Рич Саттон: «LLM — это лишь четверть интеллекта, а синтетические данные — большая ошибка»

Sequoia Capital 17,5 тыс. 53 мин 5 мин 18.08.2026
Главное

Рич Саттон, легендарный исследователь, создавший современное обучение с подкреплением (Reinforcement Learning), и его бывший студент Хуррам Джавед в подкасте Sequoia Capital объясняют, почему нынешний триумф больших языковых моделей (LLM) — это лишь четверть пути к настоящему интеллекту. Они представляют свою новую компанию Oak Lab и амбициозный план по созданию саморазвивающихся «разумов», способных учиться непрерывно, не забывая старое, и работать на энергии обычной лампочки.

❄️ Наследие «Горького урока» и зима ИИ 2:10

Рич Саттон начал заниматься обучением с подкреплением еще в те времена, когда это направление считалось маргинальным. В 2003 году, в разгар «зимы ИИ», он переехал в Альберту (Канада), чтобы основать там исследовательский центр . Саттон вспоминает это время как период личной борьбы: у него диагностировали рак, и он продолжал работать, буквально находясь на грани жизни и смерти . По его словам, им двигали лишь две вещи — привычка и тщеславие .

Сегодня Саттона часто называют радикалом за его взгляды, но сам он считает свою позицию «обычной», а текущее состояние индустрии — «странным» .

Саттон считает LLM одновременно и триумфом, и провалом «Горького урока» . С одной стороны, они доказали мощь масштабирования на огромных данных. С другой — они застыли в развитии: их веса не меняются в процессе использования, а значит, они перестают учиться в тот момент, когда заканчивается их обучение на серверах разработчика .

🌍 Гипотеза «Большого мира» и ошибка синтетических данных 11:03

Современные лаборатории (OpenAI, Anthropic и другие) активно пытаются решить проблему нехватки данных с помощью их синтетической генерации. Хуррам Джавед называет этот подход «большой ошибкой» .

Их аргументация строится на гипотезе «Большого мира» (Big World Hypothesis):

По мнению Саттона, обучение должно происходить постоянно, потому что мир огромен, и агент всегда будет сталкиваться с чем-то новым, требующим обновления его внутренних «аппроксимаций» .

🧠 Почему LLM — это не разум 22:37

Основная претензия Саттона к текущим чат-ботам заключается в их статичности. Ведущие подкаста возражают, что модели могут «учиться» через контекстное окно или RAG, но Саттон непреклонен: «Их веса никогда не меняются» .

Основные тезисы критиков текущего подхода:

  1. Отсутствие пластичности: Настоящий мозг невероятно пластичен. Джавед приводит пример людей с ограниченными возможностями, которые заново учатся ходить, используя визуальные сигналы вместо потерянного чувства положения тела (проприоцепции) . Современные нейросети на такое не способны без полной перетренировки.
  2. Проблема персонализации: В текущей парадигме вы не можете по-настоящему научить модель чему-то специфическому для вас, не вступая в конфликт с интересами миллионов других пользователей, на данных которых обучалась общая модель .
  3. Опыт против школы: Саттон подчеркивает, что ни одно животное не учится по методу «обучения с учителем» (supervised learning) . Белкам не нужны наборы данных, чтобы понять, как прыгать по веткам, и им никто не говорит, как именно должны сокращаться их мышцы .

Саттон считает, что ИИ-сообщество слишком зациклилось на языке. Он оценивает языковые способности лишь в 20–25% от того, что составляет полноценный интеллект .

🚀 План Альберты и лекарство от «забывания» 36:42

В 2022 году Саттон представил «План Альберты» — 12 шагов к созданию полноценного ИИ . Ключевым этапом (шаг №2) является Continual Deep Learning (непрерывное глубокое обучение) .

Главная техническая преграда здесь — катастрофическое забывание: когда нейросеть при получении новой информации мгновенно стирает старые знания. Саттон утверждает, что эта проблема «полностью излечима» .

Технологический стек Oak Lab для решения проблемы:

⚡️ Будущее: Разум на 20 Ватт 43:43

Цель Oak Lab — создать систему с триллионом параметров, которая способна поддерживать свою когерентность самостоятельно и потреблять при этом всего 20 Ватт энергии (как мозг человека или обычная лампочка) .

Почему этого не делают техгиганты?

Джавед считает, что крупные лаборатории застряли в «локальном минимуме» . Переход к парадигме непрерывного обучения требует, чтобы результаты сначала стали хуже, прежде чем они станут лучше . Публичные компании и продуктовые команды не могут позволить себе такого проседания метрик ради смены парадигмы .

Инвестиционный тезис Саттона и Джаведа:

Oak Lab планирует оставаться небольшой, «супералайненной» (согласованной в целях) командой, нанимая только тех, кто разделяет их видение отказа от статических моделей в пользу живых, вечно меняющихся систем .

💬 Цитаты

«Я не странный. Поле странное. Нам пришлось придумать термин «непрерывное обучение», хотя любое обучение по определению должно быть непрерывным.»

Рич Саттон 00:39

«Большие языковые модели — это потрясающий прорыв, но они представляют собой лишь четверть интеллекта.»

Рич Саттон 50:52

«Синтетические данные — это просто большая ошибка.»

Рич Саттон 11:27
👥 Спикеры
📚 Упомянутые книги
🔗 Упомянутые сайты и проекты
📖 Термины
The Bitter Lesson
Тезис о том, что в ИИ методы, использующие вычисления, всегда побеждают методы, основанные на человеческих знаниях.
Катастрофическое забывание
Проблема нейросетей, при которой обучение новым задачам приводит к полной потере знаний о предыдущих задачах.
Continual Backprop
Алгоритм, позволяющий нейросетям постоянно обновлять свои веса на потоке данных без деградации старых знаний.
📊 Цифры
🗓 Хронология
  1. 2003 Рич Саттон переезжает в Альберту и продолжает работу над RL во время «зимы ИИ».
  2. 2019 Публикация влиятельного эссе Саттона «The Bitter Lesson».
  3. 2022 Анонс «Плана Альберты» (Alberta Plan) из 12 шагов.
⚖️ Другая сторона
Искусственный интеллект Rich Sutton Oak Lab The Bitter Lesson Continual Learning Reinforcement Learning