Рич Саттон, легендарный исследователь, создавший современное обучение с подкреплением (Reinforcement Learning), и его бывший студент Хуррам Джавед в подкасте Sequoia Capital объясняют, почему нынешний триумф больших языковых моделей (LLM) — это лишь четверть пути к настоящему интеллекту. Они представляют свою новую компанию Oak Lab и амбициозный план по созданию саморазвивающихся «разумов», способных учиться непрерывно, не забывая старое, и работать на энергии обычной лампочки.
❄️ Наследие «Горького урока» и зима ИИ 2:10
Рич Саттон начал заниматься обучением с подкреплением еще в те времена, когда это направление считалось маргинальным. В 2003 году, в разгар «зимы ИИ», он переехал в Альберту (Канада), чтобы основать там исследовательский центр . Саттон вспоминает это время как период личной борьбы: у него диагностировали рак, и он продолжал работать, буквально находясь на грани жизни и смерти . По его словам, им двигали лишь две вещи — привычка и тщеславие .
Сегодня Саттона часто называют радикалом за его взгляды, но сам он считает свою позицию «обычной», а текущее состояние индустрии — «странным» .
- Концепция обучения: Саттон утверждает, что термин «непрерывное обучение» (continual learning) избыточен. Любое истинное обучение по определению должно быть непрерывным: агент действует и учится на основе последствий своих действий .
- «Горький урок» (The Bitter Lesson): Эссе Саттона 2019 года стало манифестом современной эпохи ИИ. Его суть в том, что в долгосрочной перспективе попытки вложить в ИИ человеческие знания (правила, структуру) всегда проигрывают методам, которые просто масштабируются вместе с вычислительными мощностями .
Саттон считает LLM одновременно и триумфом, и провалом «Горького урока» . С одной стороны, они доказали мощь масштабирования на огромных данных. С другой — они застыли в развитии: их веса не меняются в процессе использования, а значит, они перестают учиться в тот момент, когда заканчивается их обучение на серверах разработчика .
🌍 Гипотеза «Большого мира» и ошибка синтетических данных 11:03
Современные лаборатории (OpenAI, Anthropic и другие) активно пытаются решить проблему нехватки данных с помощью их синтетической генерации. Хуррам Джавед называет этот подход «большой ошибкой» .
Их аргументация строится на гипотезе «Большого мира» (Big World Hypothesis):
- Бесконечная сложность: Мир бесконечно сложнее любого агента или симулятора . Любая симуляция, созданная человеком, — это лишь микроскопическое упрощение реальности .
- Человеческое «бутылочное горлышко»: Синтетические данные создаются программами, которые написали люди. Это ограничивает ИИ человеческим опытом и экспертными знаниями .
- Пример с эхолокацией: Джавед приводит пример: если вы хотите научить дрон летать с помощью эхолокации (как летучая мышь), вам не помогут синтетические данные, пока человек-эксперт сам не поймет физику процесса и не опишет её . Истинный ИИ должен научиться этому сам через опыт столкновений и полетов .
По мнению Саттона, обучение должно происходить постоянно, потому что мир огромен, и агент всегда будет сталкиваться с чем-то новым, требующим обновления его внутренних «аппроксимаций» .
🧠 Почему LLM — это не разум 22:37
Основная претензия Саттона к текущим чат-ботам заключается в их статичности. Ведущие подкаста возражают, что модели могут «учиться» через контекстное окно или RAG, но Саттон непреклонен: «Их веса никогда не меняются» .
Основные тезисы критиков текущего подхода:
- Отсутствие пластичности: Настоящий мозг невероятно пластичен. Джавед приводит пример людей с ограниченными возможностями, которые заново учатся ходить, используя визуальные сигналы вместо потерянного чувства положения тела (проприоцепции) . Современные нейросети на такое не способны без полной перетренировки.
- Проблема персонализации: В текущей парадигме вы не можете по-настоящему научить модель чему-то специфическому для вас, не вступая в конфликт с интересами миллионов других пользователей, на данных которых обучалась общая модель .
- Опыт против школы: Саттон подчеркивает, что ни одно животное не учится по методу «обучения с учителем» (supervised learning) . Белкам не нужны наборы данных, чтобы понять, как прыгать по веткам, и им никто не говорит, как именно должны сокращаться их мышцы .
Саттон считает, что ИИ-сообщество слишком зациклилось на языке. Он оценивает языковые способности лишь в 20–25% от того, что составляет полноценный интеллект .
🚀 План Альберты и лекарство от «забывания» 36:42
В 2022 году Саттон представил «План Альберты» — 12 шагов к созданию полноценного ИИ . Ключевым этапом (шаг №2) является Continual Deep Learning (непрерывное глубокое обучение) .
Главная техническая преграда здесь — катастрофическое забывание: когда нейросеть при получении новой информации мгновенно стирает старые знания. Саттон утверждает, что эта проблема «полностью излечима» .
Технологический стек Oak Lab для решения проблемы:
- Оптимизация шага обучения (Step-size optimization): Каждому весу в сети назначается свой темп обновления. Большинство весов меняются крайне медленно, сохраняя базу знаний, в то время как другие адаптируются под новые примеры .
- Алгоритм Continual Backprop: В отличие от стандартного обратного распространения ошибки, этот метод постоянно «подсаживает» в сеть новые случайные нейроны . Это позволяет системе не закостеневать и продолжать искать новые закономерности вечно.
- Генерация и тестирование: Вместо того чтобы полагаться только на градиенты (которые Саттон считает слишком медленными), система должна постоянно предлагать новые гипотезы (фичи) и проверять их эффективность в реальном времени .
⚡️ Будущее: Разум на 20 Ватт 43:43
Цель Oak Lab — создать систему с триллионом параметров, которая способна поддерживать свою когерентность самостоятельно и потреблять при этом всего 20 Ватт энергии (как мозг человека или обычная лампочка) .
Почему этого не делают техгиганты?
Джавед считает, что крупные лаборатории застряли в «локальном минимуме» . Переход к парадигме непрерывного обучения требует, чтобы результаты сначала стали хуже, прежде чем они станут лучше . Публичные компании и продуктовые команды не могут позволить себе такого проседания метрик ради смены парадигмы .
Инвестиционный тезис Саттона и Джаведа:
- Горизонт: 5–10 лет .
- Эффективность: Использование закона Мура позволит снизить энергопотребление с текущих тысяч ватт до десятков .
- Структура: Вместо одной «супермодели», Oak Lab видит мир как множество «разумов», каждый из которых учится на своем уникальном опыте .
Oak Lab планирует оставаться небольшой, «супералайненной» (согласованной в целях) командой, нанимая только тех, кто разделяет их видение отказа от статических моделей в пользу живых, вечно меняющихся систем .