На недавней встрече YC Paper Club эксперты в области искусственного интеллекта обсудили фундаментальный сдвиг в индустрии: переход от фокуса на архитектуре моделей к приоритету качества и обработки данных. Франсуа Шобар, Винсент Сунн Чен, Воло Кулешов и Шейн Лонгпре разобрали, почему данные перестали быть «биржевым товаром», как оценивать ИИ-агентов на уровне Senior-инженеров и каким образом диффузионные языковые модели меняют рынок голосовых интерфейсов.
🚀 Почему данные — это новый «бутылочное горлышко» индустрии 0:00
Франсуа Шобар начал дискуссию с ретроспективы: в 2016 году, когда он запускал свой стартап Focal Systems, в Кремниевой долине преобладало мнение, что данные — это товар с нулевой предельной стоимостью . Считалось, что достаточно скачать ImageNet, а основная работа заключается в настройке слоев нейросети. Однако за прошедшее время компании, специализирующиеся на данных (например, Scale AI), создали рыночную капитализацию более чем в 100 млрд долларов .
По мнению Шобара, современная разработка ИИ на 97% состоит из работы с данными и лишь на 3% — из проектирования архитектуры . В академической среде (PhD) пропорция часто обратная, что мешает внедрению моделей в производство.
Ключевые тезисы Франсуа Шобара о рынке данных:
- Конец эпохи архитектур: После появления трансформеров архитектуры стали достаточно выразительными, и теперь результат на 100% зависит от обучающей выборки .
- Принцип «Смотри в данные»: На вопрос «Что делать, если точность модели застряла на 85%?», Шобар считает единственно верным ответом тщательный ручной аудит ошибок (false positives/negatives), а не чтение новых статей о функциях активации .
- Аналогия с App Store: Шобар полагает, что рынок данных будет развиваться по модели магазинов приложений . Как Apple не делает все приложения сама, так и разработчики базовых моделей (OpenAI, Anthropic) не смогут качественно собрать данные для всех ниш — от медицины до юриспруденции. Каждой доменной области (терапия, бухгалтерский учет, трейдинг) потребуется своя специализированная компания-поставщик экспертных данных .
🧠 Масштабирование экспертизы: от простых меток к сложным агентам 9:51
Винсент Сунн Чен из Snorkel представил концепцию «Программирования данных» (Data Programming). По его словам, главной проблемой обучения моделей в экспертных областях (например, медицине) является дефицит времени специалистов .
Эволюция подходов к данным, по версии Винсента Чена:
- Данные 1.0 (Ручная разметка): Поточечная разметка людьми. Процесс дорогой, плохо масштабируемый и не имеющий «происхождения» (provenance) — мы не знаем, почему разметчик принял то или иное решение .
- Данные 2.0 (Сложные среды): Оценка агентов, работающих в Docker-контейнерах, с использованием верификаторов и многочасовых траекторий .
Вместо того чтобы просить врача вручную разметить тысячи снимков МРТ, Чен предлагает кодировать экспертизу в виде «функций разметки» (labeling functions) — программных эвристик, которые могут быть неточными, но покрывают огромные массивы данных . Затем математические модели (слабое обучение/weak supervision) очищают этот шум, находя истину на пересечении мнений разных алгоритмов .
Бенчмарк Senior SWE-bench
Чен представил новый бенчмарк для оценки ИИ-кодеров — Senior SWE-bench . Он утверждает, что существующие тесты (например, HumanEval) уже пройдены моделями, но они оценивают навыки «джуниоров» .
Особенности нового подхода:
- Реализм инструкций: Задания подаются не в виде строгих спецификаций, а как сообщения в Slack или дампы логов .
- Валидационный агент: Чтобы сбалансировать гибкость LLM-судей и жесткость модульных тестов, команда внедрила специального агента. Он изучает патч (код), предложенный моделью, и пишет детерминированные скрипты для его проверки «на лету» .
- Метрика Tasteful Pass: Оценивает не только корректность кода, но и его «вкус» — отсутствие избыточности и соответствие практикам конкретной кодовой базы .
По данным Чена, на текущий момент модели Claude 3.5 Sonnet и GPT-4o делят первое место в этом рейтинге, но даже они едва справляются с самыми сложными задачами .
🌊 Диффузионные языковые модели для продакшена 28:44
Воло Кулешов (Inception Labs) рассказал о новой генерации языковых моделей, основанных на диффузии. В отличие от традиционных авторегрессионных моделей, которые генерируют токены последовательно один за другим, диффузионные модели создают всю последовательность сразу, постепенно уточняя её из «шума» .
Преимущества диффузионных моделей по Кулешову:
- Экстремальная скорость: Модели серии Mercury достигают скорости более 1000 токенов в секунду .
- Реальное время для голоса: Кулешов считает, что именно задержка LLM является главным препятствием для естественного общения с ИИ-ассистентами. Использование диффузии позволяет сделать голосовой интерфейс бесшовным .
- Экономика: Высокая скорость на стандартных GPU позволяет конкурировать со специализированным железом (например, чипами Cerebras) за счет умного ПО, а не дорогого оборудования .
Для обучения таких моделей Inception Labs использует систему Tau Forge, которая синтезирует реалистичные RL-среды (Reinforcement Learning) . Система берет логи реальных взаимодействий пользователей и превращает их в сценарии для обучения, создавая «ловушки сложности» (hardening traps), чтобы модель постоянно училась на грани своих возможностей .
🌍 Физика многоязычных моделей: синергия и помехи 40:26
Шейн Лонгпре представил исследование ATLAS, посвященное законам масштабирования для многоязычных моделей. Он отметил, что 99% научных работ сфокусированы на английском языке, в то время как для большинства языков мира (например, тайского) данных в интернете менее 1% от объема английского .
Основные выводы исследования Лонгпре:
- Матрица переноса: Существует измеримая синергия между языками. Например, обучение на испанском помогает модели лучше понимать португальский (высокая синергия), но обучение на японском может «портить» результаты в испанском из-за конкуренции за нейроны (помехи) .
- Важность письменности: Исследование показало, что общий алфавит (скрипт) важнее для синергии языков, чем принадлежность к одной языковой семье .
- Эффект масштаба: Чем больше параметров у модели, тем больше «синих» зон (помех) в матрице превращаются в «красные» (синергию). Большие модели способны находить общие паттерны даже в очень разных языках .
Лонгпре утверждает, что простая дозагрузка модели на одном языке (fine-tuning) часто уступает по качеству грамотно подобранной смеси языков при предварительном обучении (pre-training) .