Франсуа Шобар: «Данные — это новый App Store для искусственного интеллекта»

Y Combinator 15,4 тыс. 52 мин 4 мин 20.08.2026
Главное

На недавней встрече YC Paper Club эксперты в области искусственного интеллекта обсудили фундаментальный сдвиг в индустрии: переход от фокуса на архитектуре моделей к приоритету качества и обработки данных. Франсуа Шобар, Винсент Сунн Чен, Воло Кулешов и Шейн Лонгпре разобрали, почему данные перестали быть «биржевым товаром», как оценивать ИИ-агентов на уровне Senior-инженеров и каким образом диффузионные языковые модели меняют рынок голосовых интерфейсов.

🚀 Почему данные — это новый «бутылочное горлышко» индустрии 0:00

Франсуа Шобар начал дискуссию с ретроспективы: в 2016 году, когда он запускал свой стартап Focal Systems, в Кремниевой долине преобладало мнение, что данные — это товар с нулевой предельной стоимостью . Считалось, что достаточно скачать ImageNet, а основная работа заключается в настройке слоев нейросети. Однако за прошедшее время компании, специализирующиеся на данных (например, Scale AI), создали рыночную капитализацию более чем в 100 млрд долларов .

По мнению Шобара, современная разработка ИИ на 97% состоит из работы с данными и лишь на 3% — из проектирования архитектуры . В академической среде (PhD) пропорция часто обратная, что мешает внедрению моделей в производство.

Ключевые тезисы Франсуа Шобара о рынке данных:

🧠 Масштабирование экспертизы: от простых меток к сложным агентам 9:51

Винсент Сунн Чен из Snorkel представил концепцию «Программирования данных» (Data Programming). По его словам, главной проблемой обучения моделей в экспертных областях (например, медицине) является дефицит времени специалистов .

Эволюция подходов к данным, по версии Винсента Чена:

  1. Данные 1.0 (Ручная разметка): Поточечная разметка людьми. Процесс дорогой, плохо масштабируемый и не имеющий «происхождения» (provenance) — мы не знаем, почему разметчик принял то или иное решение .
  2. Данные 2.0 (Сложные среды): Оценка агентов, работающих в Docker-контейнерах, с использованием верификаторов и многочасовых траекторий .

Вместо того чтобы просить врача вручную разметить тысячи снимков МРТ, Чен предлагает кодировать экспертизу в виде «функций разметки» (labeling functions) — программных эвристик, которые могут быть неточными, но покрывают огромные массивы данных . Затем математические модели (слабое обучение/weak supervision) очищают этот шум, находя истину на пересечении мнений разных алгоритмов .

Бенчмарк Senior SWE-bench

Чен представил новый бенчмарк для оценки ИИ-кодеров — Senior SWE-bench . Он утверждает, что существующие тесты (например, HumanEval) уже пройдены моделями, но они оценивают навыки «джуниоров» .

Особенности нового подхода:

По данным Чена, на текущий момент модели Claude 3.5 Sonnet и GPT-4o делят первое место в этом рейтинге, но даже они едва справляются с самыми сложными задачами .

🌊 Диффузионные языковые модели для продакшена 28:44

Воло Кулешов (Inception Labs) рассказал о новой генерации языковых моделей, основанных на диффузии. В отличие от традиционных авторегрессионных моделей, которые генерируют токены последовательно один за другим, диффузионные модели создают всю последовательность сразу, постепенно уточняя её из «шума» .

Преимущества диффузионных моделей по Кулешову:

Для обучения таких моделей Inception Labs использует систему Tau Forge, которая синтезирует реалистичные RL-среды (Reinforcement Learning) . Система берет логи реальных взаимодействий пользователей и превращает их в сценарии для обучения, создавая «ловушки сложности» (hardening traps), чтобы модель постоянно училась на грани своих возможностей .

🌍 Физика многоязычных моделей: синергия и помехи 40:26

Шейн Лонгпре представил исследование ATLAS, посвященное законам масштабирования для многоязычных моделей. Он отметил, что 99% научных работ сфокусированы на английском языке, в то время как для большинства языков мира (например, тайского) данных в интернете менее 1% от объема английского .

Основные выводы исследования Лонгпре:

Лонгпре утверждает, что простая дозагрузка модели на одном языке (fine-tuning) часто уступает по качеству грамотно подобранной смеси языков при предварительном обучении (pre-training) .

💬 Цитаты

«Если ваш ответ на низкую точность модели — 'я пойду почитаю статьи о новых слоях', вы ошибаетесь. Правильный ответ — смотреть в данные.»

Франсуа Шобар 01:31

«Мы доверяем ИИ-агентам архитектурные решения, но все еще оцениваем их как джуниор-инженеров.»

Винсент Сунн Чен 18:59
👥 Спикеры
🔗 Упомянутые сайты и проекты
📖 Термины
Диффузионные языковые модели
Нейросети, которые генерируют текст не по одному слову, а восстанавливая всю последовательность сразу из случайного шума.
Слабое обучение (Weak Supervision)
Метод обучения моделей на зашумленных или программно сгенерированных данных без идеальной ручной разметки.
Авторегрессионные модели
Стандартные модели типа GPT, которые предсказывают каждое следующее слово на основе всех предыдущих.
📊 Цифры
🗓 Хронология
  1. 2016 Франсуа Шобар покидает PhD и основывает Focal Systems; в это время данные считались дешевым товаром.
  2. 2024 Публикация исследования ATLAS о многоязычном обучении на конференции ICLR.
⚖️ Другая сторона
Искусственный интеллект Y Combinator Snorkel Inception Labs SWE-bench Diffusion Models