# Мировые модели: как ИИ учится предсказывать физическую реальность

Источник: https://www.youtube.com/watch?v=qz4GQ0zUFRw
Канал: Y Combinator
Опубликовано: 17.07.2026

---

Современные системы искусственного интеллекта потребляют колоссальные объемы данных, чтобы обучиться простейшим навыкам, в то время как человек схватывает суть после нескольких попыток. В новом выпуске подкаста Decoded от Y Combinator ведущий Анкит Хария и исследователь ИИ Франсуа Шолле обсуждают концепцию «мировых моделей» (World Models) как ключ к созданию по-настоящему эффективного и автономного интеллекта.

## 🧠 Проблема эффективности выборки: почему ИИ проигрывает человеку
[[JUMP:00:00]]

Одной из самых больших нерешенных проблем в области ИИ остается эффективность выборки (sample efficiency) — способность модели быстро осваивать новые задачи на основе минимального количества данных [0:00]. Человеческий мозг справляется с этим феноменально: мы можем научиться новой игре или навыку за считаные попытки, тогда как передовым моделям требуются десятки тысяч примеров [0:13].

Анкит Хария выделяет две критические метрики для будущего ИИ:

*   **Интеллект на ватт:** количество баллов снижения перплексии на единицу затраченной энергии [0:54].
*   **Интеллект на выборку:** насколько умнее становится модель с каждым новым добавленным в датасет примером [1:07].

По мнению Франсуа Шолле, интеллект следует рассматривать не как набор статических навыков, а как скорость их приобретения [1:19]. Современные системы, даже «проглотив» весь интернет, часто пасуют перед новыми задачами, которые человек решает интуитивно, используя свои внутренние когнитивные механизмы [2:11].

## 🚀 Идеальная модель мира: от Ньютона до SpaceX
[[JUMP:02:36]]

В предельном случае идеальная эффективность выборки означала бы обучение на нулевом количестве примеров из среды [2:36]. Франсуа Шолле утверждает, что такие примеры уже существуют — это законы классической механики. Когда NASA планирует перехват астероида за несколько лет до события, им не нужно запускать миллион пробных ракет; у них есть «идеальная модель мира» в виде законов Ньютона [3:14].

Ключевые характеристики такой модели:

*   **Дифференцируемость:** возможность использовать градиентные методы оптимизации [3:56].
*   **Детерминизм:** предсказуемость результата при заданных входных данных.
*   **Модельно-прогностическое управление (MPC):** алгоритм, позволяющий SpaceX сажать ракеты на плавучие платформы, рассчитывая оптимальную траекторию в реальном времени [9:44].

Хария и Шолле отмечают, что человеческий мозг также полагается на внутренние симуляции. Исследование 1967 года показало, что игроки в баскетбол, которые только воображали выполнение штрафных бросков (визуализация), улучшили свои результаты на 23% — почти столько же, сколько группа, тренировавшаяся физически (24%) [5:00]. Это доказывает наличие в нашей голове мощнейшей модели мира, способной генерировать полезный опыт без участия физического тела [5:14].

## ♟️ Почему AlphaGo не масштабируется на робототехнику
[[JUMP:17:45]]

Обсуждая успех AlphaGo, спикеры объясняют, почему методы, сработавшие в шахматах и го, неприменимы в реальном мире. Основная проблема заключается в «взрыве» пространства действий (action space explosion) [17:45].

Сравнение сложности задач:

1.  **Шахматы:** Малое пространство действий (в среднем 8–10 вариантов хода), детерминированная среда, понятное вознаграждение [21:02].
2.  **Го:** Пространство действий больше (361 вариант), но все еще трактуемое с помощью алгоритма поиска по дереву Монте-Карло (MCTS) [24:29].
3.  **Робототехника:** Пространство действий становится практически бесконечным. Если у манипулятора 16 степеней свободы, количество комбинаций усилий на моторах достигает $10^{16}$ [46:49].

Алгоритм MCTS, использованный в AlphaGo, требует около 800 симуляций на каждый ход, чтобы покрыть 361 вариант действий [34:32]. В случае с беспилотным автомобилем, где пространство действий в сотни раз больше, а решение нужно принимать мгновенно, такой подход заставил бы машину «замереть» на 60 секунд перед каждым поворотом руля [36:04].

## 🚗 Автопилот и роботы: когда физика перестает быть простой
[[JUMP:34:00]]

В беспилотном вождении физика Ньютона сталкивается с недифференцируемым фактором — человеческим поведением [39:09]. Вы не можете «продифференцировать» мозг другого водителя, чтобы предсказать его реакцию.

Основные трудности в этой сфере:

*   **Стохастичность:** Среда непредсказуема и изменчива.
*   **Отсутствие данных о действиях:** Из видео с видеорегистраторов на YouTube можно понять, как меняется сцена (состояние), но мы не знаем, какие именно усилия прилагал водитель к рулю и педалям [41:33]. Исключение составляет Tesla, имеющая доступ к телеметрии своего флота [42:12].
*   **Разрыв воплощения (Cross-embodiment gap):** Данные, собранные на Tesla Model X, нельзя напрямую перенести на Model 3 из-за разницы в массе и динамике [47:44]. Шолле предполагает, что Tesla вынуждена разделять данные по типам автомобилей, чтобы избежать ошибок в управлении [48:22].

## 🤖 Dreamer и JEPA: путь к обучению в воображении
[[JUMP:48:20]]

Решением проблемы нехватки данных становится использование моделей мира для генерации синтетического опыта. Юрген Шмидхубер еще в 1990-х предложил концепцию World Models, где агент обучается внутри собственной галлюцинации [49:45].

Современные итерации этого подхода:

*   **Серия Dreamer (v1–v4):** Дэнниар Хафнер доказал, что агент может научиться добывать алмазы в Minecraft, обучаясь почти полностью на воображаемых «роллаутах» (прокрутках событий в памяти модели) [51:48].
*   **Видео-диффузионные модели:** Использование технологий вроде Sora или Gaia (от компании Wayve) позволяет превратить терабайты видео из интернета в тренажеры для роботов [53:32].
*   **JEPA (Joint Embedding Predictive Architecture):** Архитектура Яна Лекуна, которая предсказывает не каждый пиксель следующего кадра (что дорого), а абстрактное представление (latent space) будущего состояния [58:43]. Это делает обучение на порядки быстрее и эффективнее [59:24].

## 🚀 Будущее: физика, сон и тактильные ощущения
[[JUMP:59:00]]

Несмотря на прогресс, остается ряд фундаментальных препятствий. Франсуа Шолле скептически относится к текущим попыткам внедрить физику в нейросети (PINNs), отмечая, что они все еще страдают от ошибок аппроксимации и не достигают машинной точности [1:04:14].

Ключевые нерешенные задачи:

1.  **Отсутствие «сна»:** В биологии нет интеллектуальных видов, которые бы не спали. Сон необходим для сжатия дневного опыта и консолидации памяти [1:10:26]. Шолле считает, что ИИ-архитектурам не хватает механизма «оффлайн-обучения» во время покоя [1:10:54].
2.  **Проблема адаптации:** Люди мгновенно адаптируются к изменению трения (например, если пол скользкий), тогда как моделям нужно переучиваться [1:07:47].
3.  **Тактильный голод:** У роботов нет аналога человеческого эпидермиса, способного чувствовать силу сдвига, температуру и текстуру по всей поверхности тела. Без этого обратной связи для точного контроля недостаточно [1:13:17].

Подводя итог, Анкит Хария отмечает, что этот год может стать «годом робота» в Y Combinator [1:13:04]. Появление видео-диффузионных моделей и новых методов обусловливания действий (action conditioning) дает надежду на создание «Рози из „Джетсонов“» — домашнего робота, способного навести порядок в комнате, понимая физику и логику окружающего мира.