Современные системы искусственного интеллекта потребляют колоссальные объемы данных, чтобы обучиться простейшим навыкам, в то время как человек схватывает суть после нескольких попыток. В новом выпуске подкаста Decoded от Y Combinator ведущий Анкит Хария и исследователь ИИ Франсуа Шолле обсуждают концепцию «мировых моделей» (World Models) как ключ к созданию по-настоящему эффективного и автономного интеллекта.
🧠 Проблема эффективности выборки: почему ИИ проигрывает человеку 0:00
Одной из самых больших нерешенных проблем в области ИИ остается эффективность выборки (sample efficiency) — способность модели быстро осваивать новые задачи на основе минимального количества данных . Человеческий мозг справляется с этим феноменально: мы можем научиться новой игре или навыку за считаные попытки, тогда как передовым моделям требуются десятки тысяч примеров .
Анкит Хария выделяет две критические метрики для будущего ИИ:
- Интеллект на ватт: количество баллов снижения перплексии на единицу затраченной энергии .
- Интеллект на выборку: насколько умнее становится модель с каждым новым добавленным в датасет примером .
По мнению Франсуа Шолле, интеллект следует рассматривать не как набор статических навыков, а как скорость их приобретения . Современные системы, даже «проглотив» весь интернет, часто пасуют перед новыми задачами, которые человек решает интуитивно, используя свои внутренние когнитивные механизмы .
🚀 Идеальная модель мира: от Ньютона до SpaceX 2:36
В предельном случае идеальная эффективность выборки означала бы обучение на нулевом количестве примеров из среды . Франсуа Шолле утверждает, что такие примеры уже существуют — это законы классической механики. Когда NASA планирует перехват астероида за несколько лет до события, им не нужно запускать миллион пробных ракет; у них есть «идеальная модель мира» в виде законов Ньютона .
Ключевые характеристики такой модели:
- Дифференцируемость: возможность использовать градиентные методы оптимизации .
- Детерминизм: предсказуемость результата при заданных входных данных.
- Модельно-прогностическое управление (MPC): алгоритм, позволяющий SpaceX сажать ракеты на плавучие платформы, рассчитывая оптимальную траекторию в реальном времени .
Хария и Шолле отмечают, что человеческий мозг также полагается на внутренние симуляции. Исследование 1967 года показало, что игроки в баскетбол, которые только воображали выполнение штрафных бросков (визуализация), улучшили свои результаты на 23% — почти столько же, сколько группа, тренировавшаяся физически (24%) . Это доказывает наличие в нашей голове мощнейшей модели мира, способной генерировать полезный опыт без участия физического тела .
♟️ Почему AlphaGo не масштабируется на робототехнику 17:45
Обсуждая успех AlphaGo, спикеры объясняют, почему методы, сработавшие в шахматах и го, неприменимы в реальном мире. Основная проблема заключается в «взрыве» пространства действий (action space explosion) .
Сравнение сложности задач:
- Шахматы: Малое пространство действий (в среднем 8–10 вариантов хода), детерминированная среда, понятное вознаграждение .
- Го: Пространство действий больше (361 вариант), но все еще трактуемое с помощью алгоритма поиска по дереву Монте-Карло (MCTS) .
- Робототехника: Пространство действий становится практически бесконечным. Если у манипулятора 16 степеней свободы, количество комбинаций усилий на моторах достигает $10^{16}$ .
Алгоритм MCTS, использованный в AlphaGo, требует около 800 симуляций на каждый ход, чтобы покрыть 361 вариант действий . В случае с беспилотным автомобилем, где пространство действий в сотни раз больше, а решение нужно принимать мгновенно, такой подход заставил бы машину «замереть» на 60 секунд перед каждым поворотом руля .
🚗 Автопилот и роботы: когда физика перестает быть простой 34:00
В беспилотном вождении физика Ньютона сталкивается с недифференцируемым фактором — человеческим поведением . Вы не можете «продифференцировать» мозг другого водителя, чтобы предсказать его реакцию.
Основные трудности в этой сфере:
- Стохастичность: Среда непредсказуема и изменчива.
- Отсутствие данных о действиях: Из видео с видеорегистраторов на YouTube можно понять, как меняется сцена (состояние), но мы не знаем, какие именно усилия прилагал водитель к рулю и педалям . Исключение составляет Tesla, имеющая доступ к телеметрии своего флота .
- Разрыв воплощения (Cross-embodiment gap): Данные, собранные на Tesla Model X, нельзя напрямую перенести на Model 3 из-за разницы в массе и динамике . Шолле предполагает, что Tesla вынуждена разделять данные по типам автомобилей, чтобы избежать ошибок в управлении .
🤖 Dreamer и JEPA: путь к обучению в воображении 48:20
Решением проблемы нехватки данных становится использование моделей мира для генерации синтетического опыта. Юрген Шмидхубер еще в 1990-х предложил концепцию World Models, где агент обучается внутри собственной галлюцинации .
Современные итерации этого подхода:
- Серия Dreamer (v1–v4): Дэнниар Хафнер доказал, что агент может научиться добывать алмазы в Minecraft, обучаясь почти полностью на воображаемых «роллаутах» (прокрутках событий в памяти модели) .
- Видео-диффузионные модели: Использование технологий вроде Sora или Gaia (от компании Wayve) позволяет превратить терабайты видео из интернета в тренажеры для роботов .
- JEPA (Joint Embedding Predictive Architecture): Архитектура Яна Лекуна, которая предсказывает не каждый пиксель следующего кадра (что дорого), а абстрактное представление (latent space) будущего состояния . Это делает обучение на порядки быстрее и эффективнее .
🚀 Будущее: физика, сон и тактильные ощущения 59:00
Несмотря на прогресс, остается ряд фундаментальных препятствий. Франсуа Шолле скептически относится к текущим попыткам внедрить физику в нейросети (PINNs), отмечая, что они все еще страдают от ошибок аппроксимации и не достигают машинной точности .
Ключевые нерешенные задачи:
- Отсутствие «сна»: В биологии нет интеллектуальных видов, которые бы не спали. Сон необходим для сжатия дневного опыта и консолидации памяти . Шолле считает, что ИИ-архитектурам не хватает механизма «оффлайн-обучения» во время покоя .
- Проблема адаптации: Люди мгновенно адаптируются к изменению трения (например, если пол скользкий), тогда как моделям нужно переучиваться .
- Тактильный голод: У роботов нет аналога человеческого эпидермиса, способного чувствовать силу сдвига, температуру и текстуру по всей поверхности тела. Без этого обратной связи для точного контроля недостаточно .
Подводя итог, Анкит Хария отмечает, что этот год может стать «годом робота» в Y Combinator . Появление видео-диффузионных моделей и новых методов обусловливания действий (action conditioning) дает надежду на создание «Рози из „Джетсонов“» — домашнего робота, способного навести порядок в комнате, понимая физику и логику окружающего мира.