# Франсуа Шобар: «Данные — это новый App Store для искусственного интеллекта»

Источник: https://www.youtube.com/watch?v=IfoPg2QefF8
Канал: Y Combinator
Опубликовано: 20.08.2026

---

На недавней встрече YC Paper Club эксперты в области искусственного интеллекта обсудили фундаментальный сдвиг в индустрии: переход от фокуса на архитектуре моделей к приоритету качества и обработки данных. Франсуа Шобар, Винсент Сунн Чен, Воло Кулешов и Шейн Лонгпре разобрали, почему данные перестали быть «биржевым товаром», как оценивать ИИ-агентов на уровне Senior-инженеров и каким образом диффузионные языковые модели меняют рынок голосовых интерфейсов.

## 🚀 Почему данные — это новый «бутылочное горлышко» индустрии
[[JUMP:00:00]]

Франсуа Шобар начал дискуссию с ретроспективы: в 2016 году, когда он запускал свой стартап Focal Systems, в Кремниевой долине преобладало мнение, что данные — это товар с нулевой предельной стоимостью [00:25]. Считалось, что достаточно скачать ImageNet, а основная работа заключается в настройке слоев нейросети. Однако за прошедшее время компании, специализирующиеся на данных (например, Scale AI), создали рыночную капитализацию более чем в 100 млрд долларов [00:52].

По мнению Шобара, современная разработка ИИ на 97% состоит из работы с данными и лишь на 3% — из проектирования архитектуры [03:02]. В академической среде (PhD) пропорция часто обратная, что мешает внедрению моделей в производство.

Ключевые тезисы Франсуа Шобара о рынке данных:

*   **Конец эпохи архитектур:** После появления трансформеров архитектуры стали достаточно выразительными, и теперь результат на 100% зависит от обучающей выборки [02:37].
*   **Принцип «Смотри в данные»:** На вопрос «Что делать, если точность модели застряла на 85%?», Шобар считает единственно верным ответом тщательный ручной аудит ошибок (false positives/negatives), а не чтение новых статей о функциях активации [01:31].
*   **Аналогия с App Store:** Шобар полагает, что рынок данных будет развиваться по модели магазинов приложений [06:58]. Как Apple не делает все приложения сама, так и разработчики базовых моделей (OpenAI, Anthropic) не смогут качественно собрать данные для всех ниш — от медицины до юриспруденции. Каждой доменной области (терапия, бухгалтерский учет, трейдинг) потребуется своя специализированная компания-поставщик экспертных данных [07:35].

## 🧠 Масштабирование экспертизы: от простых меток к сложным агентам
[[JUMP:09:51]]

Винсент Сунн Чен из Snorkel представил концепцию «Программирования данных» (Data Programming). По его словам, главной проблемой обучения моделей в экспертных областях (например, медицине) является дефицит времени специалистов [10:44].

Эволюция подходов к данным, по версии Винсента Чена:

1.  **Данные 1.0 (Ручная разметка):** Поточечная разметка людьми. Процесс дорогой, плохо масштабируемый и не имеющий «происхождения» (provenance) — мы не знаем, почему разметчик принял то или иное решение [12:56].
2.  **Данные 2.0 (Сложные среды):** Оценка агентов, работающих в Docker-контейнерах, с использованием верификаторов и многочасовых траекторий [12:05].

Вместо того чтобы просить врача вручную разметить тысячи снимков МРТ, Чен предлагает кодировать экспертизу в виде «функций разметки» (labeling functions) — программных эвристик, которые могут быть неточными, но покрывают огромные массивы данных [14:42]. Затем математические модели (слабое обучение/weak supervision) очищают этот шум, находя истину на пересечении мнений разных алгоритмов [16:24].

### Бенчмарк Senior SWE-bench

Чен представил новый бенчмарк для оценки ИИ-кодеров — **Senior SWE-bench** [18:46]. Он утверждает, что существующие тесты (например, HumanEval) уже пройдены моделями, но они оценивают навыки «джуниоров» [19:00]. 

Особенности нового подхода:

*   **Реализм инструкций:** Задания подаются не в виде строгих спецификаций, а как сообщения в Slack или дампы логов [20:15].
*   **Валидационный агент:** Чтобы сбалансировать гибкость LLM-судей и жесткость модульных тестов, команда внедрила специального агента. Он изучает патч (код), предложенный моделью, и пишет детерминированные скрипты для его проверки «на лету» [23:04].
*   **Метрика Tasteful Pass:** Оценивает не только корректность кода, но и его «вкус» — отсутствие избыточности и соответствие практикам конкретной кодовой базы [25:41].

По данным Чена, на текущий момент модели Claude 3.5 Sonnet и GPT-4o делят первое место в этом рейтинге, но даже они едва справляются с самыми сложными задачами [26:15].

## 🌊 Диффузионные языковые модели для продакшена
[[JUMP:28:44]]

Воло Кулешов (Inception Labs) рассказал о новой генерации языковых моделей, основанных на диффузии. В отличие от традиционных авторегрессионных моделей, которые генерируют токены последовательно один за другим, диффузионные модели создают всю последовательность сразу, постепенно уточняя её из «шума» [29:11].

Преимущества диффузионных моделей по Кулешову:

*   **Экстремальная скорость:** Модели серии Mercury достигают скорости более 1000 токенов в секунду [29:51].
*   **Реальное время для голоса:** Кулешов считает, что именно задержка LLM является главным препятствием для естественного общения с ИИ-ассистентами. Использование диффузии позволяет сделать голосовой интерфейс бесшовным [30:44].
*   **Экономика:** Высокая скорость на стандартных GPU позволяет конкурировать со специализированным железом (например, чипами Cerebras) за счет умного ПО, а не дорогого оборудования [31:51].

Для обучения таких моделей Inception Labs использует систему **Tau Forge**, которая синтезирует реалистичные RL-среды (Reinforcement Learning) [33:37]. Система берет логи реальных взаимодействий пользователей и превращает их в сценарии для обучения, создавая «ловушки сложности» (hardening traps), чтобы модель постоянно училась на грани своих возможностей [37:11].

## 🌍 Физика многоязычных моделей: синергия и помехи
[[JUMP:40:26]]

Шейн Лонгпре представил исследование ATLAS, посвященное законам масштабирования для многоязычных моделей. Он отметил, что 99% научных работ сфокусированы на английском языке, в то время как для большинства языков мира (например, тайского) данных в интернете менее 1% от объема английского [41:59].

Основные выводы исследования Лонгпре:

*   **Матрица переноса:** Существует измеримая синергия между языками. Например, обучение на испанском помогает модели лучше понимать португальский (высокая синергия), но обучение на японском может «портить» результаты в испанском из-за конкуренции за нейроны (помехи) [47:21].
*   **Важность письменности:** Исследование показало, что общий алфавит (скрипт) важнее для синергии языков, чем принадлежность к одной языковой семье [49:22].
*   **Эффект масштаба:** Чем больше параметров у модели, тем больше «синих» зон (помех) в матрице превращаются в «красные» (синергию). Большие модели способны находить общие паттерны даже в очень разных языках [48:02].

Лонгпре утверждает, что простая дозагрузка модели на одном языке (fine-tuning) часто уступает по качеству грамотно подобранной смеси языков при предварительном обучении (pre-training) [51:44].