Фей-Фей Ли: «Предсказание ракурса — это новый „следующий токен” в ИИ»

a16z (Andreessen Horowitz) 22,8 тыс. 43 мин 5 мин 04.09.2026
Главное

Стартап World Labs, основанный легендой компьютерного зрения Фей-Фей Ли и её коллегами, представил Atlas — нейросетевую модель нового типа. В отличие от привычных текстовых (LLM) или видеомоделей, Atlas работает с «пространственным интеллектом», объединяя генерацию изображений и точную 3D-реконструкцию.

В рамках подкаста a16z сооснователи компании и генеральный партнер фонда Мартин Касадо обсудили, почему предсказание новых ракурсов (New View Prediction) может стать таким же фундаментальным прорывом для ИИ, каким стало предсказание следующего токена для языковых моделей.

🚀 Atlas: от спецэффектов «Матрицы» до съемки на три iPhone 0:51

Главной инновацией Atlas разработчики называют способность модели создавать, реконструировать и симулировать виртуальные миры, используя минимальное количество входных данных . Джастин Джонсон объясняет это на примере знаменитого эффекта Bullet Time из фильма «Матрица». В оригинале для сцены, где камера облетает Нео в слоу-мо, требовалось кольцо из сотен откалиброванных камер и огромный зеленый экран .

С помощью Atlas аналогичный эффект можно создать, имея всего три обычных iPhone на штативах . Модель способна:

По словам Джастина Джонсона, Atlas — это не просто «улучшенная видеомодель», а принципиально новая архитектура. В то время как обычные видеогенераторы часто выдают визуально красивые, но физически невозможные кадры, Atlas изначально обучается с учетом 3D-позиции камеры .

🧠 Новая парадигма: New View Prediction как «следующий токен» 8:15

Фей-Фей Ли подчеркивает, что пространственный интеллект — это способность ИИ не просто видеть пиксели, но понимать геометрию, структуру и физику мира . Основным примитивом Atlas является «предсказание нового ракурса» (New View Prediction) .

Бен Милденхолл объясняет фундаментальное отличие от классических видеомоделей:

  1. Пространственная привязка: В Atlas каждый входной кадр имеет строгое математическое описание положения камеры в пространстве .
  2. Точность против воображения: Видеомодели похожи на «слот-машины» — вы вводите текст и надеетесь на удачный результат . Atlas же воспроизводит именно то, что вы ему дали, сохраняя отношения между объектами в комнате .
  3. Гибридный подход: Модель впервые объединяет реконструкцию (точное восстановление видимого) и генерацию (достраивание того, что осталось за кадром или под столом) в рамках единой архитектуры .

Как утверждает Джастин Джонсон, такая мультимодальность — текст, изображения, видео и 3D-координаты как «родной» входной формат — ранее не применялась на этапе предварительного обучения моделей такого масштаба .

🏗️ Как создавался Atlas: вера в масштабирование 21:27

На вопрос Мартина Касадо о том, были ли основатели уверены в успехе такого подхода, Фей-Фей Ли ответила утвердительно . Команда опиралась на «гипотезу масштабирования» (scaling hypothesis): они верили, что при увеличении объёма данных и вычислительных мощностей модель начнет демонстрировать эмерджентные свойства в понимании пространства .

Бен Милденхолл, создатель технологии NeRF, отметил, что переход от «плотных» реконструкций (когда для оцифровки комнаты нужны сотни фото и часы работы) к «разреженным» (3–5 фото) стал возможен благодаря добавлению генеративных способностей .

Ключевые вехи разработки:

«Эврика-момент» наступил в начале лета, когда Джастин и Бен показали Фей-Фей результат работы еще небольшой модели: камера в симуляции пролетела под столом и показала футбольный мяч, которого не было видно на входных кадрах . В этот момент основатели поняли, что модель научилась «понимать» скрытую геометрию .

🎨 Применение: от архитектуры до «умных» симуляторов 24:42

Бен Милденхолл видит огромный потенциал Atlas в профессиональном дизайне и архитектуре. Сейчас 95% работы архитектора или креативного директора — это рутинная правка 3D-моделей в сложном ПО после получения фидбека . ИИ может сделать этот процесс интуитивным, как игра в LEGO или лепка из глины .

Основные преимущества для креаторов:

Мартин Касадо отметил, что такое «горизонтальное» решение может породить целую индустрию новых интерфейсов взаимодействия человека с 3D-контентом .

🤖 Робототехника и решение проблемы данных 29:13

Фей-Фей Ли считает, что Atlas станет критическим звеном в развитии физических роботов. Главная проблема робототехники сегодня — не чипы, а отсутствие данных для обучения в реальном мире .

Atlas позволяет реализовать цикл «из реальности в симуляцию» (Real-to-Sim):

  1. Снимается короткое видео рабочего места робота (например, процесс прокладки кабеля) .
  2. Atlas восстанавливает цифровую копию этой среды .
  3. В симуляции запускается «рандомизация»: кабель изгибается иначе, коробки меняют цвет и положение. Это дает миллионы сценариев для обучения нейросети робота без риска повредить оборудование .

Джастин Джонсон добавляет, что следующим шагом станет создание «нейросимуляторов» — обученных моделей, которые понимают, как мир реагирует на действия. Если модель понимает физику настолько, что может предсказать реакцию объекта на толчок, она сама может стать «мозгом» робота .

🔮 Будущее: 4D-видео и биологические корни ИИ 37:55

Хотя текущая версия Atlas сфокусирована на статичных сценах, в ней уже заложены основы динамики (baby dynamics) — например, колыхание волн или движение крошечных машин на заднем плане . Джастин Джонсон утверждает, что обучение модели на динамических видео даже для статической реконструкции помогает ей лучше понимать структуру объектов .

В финале дискуссии Фей-Фей Ли провела аналогию с эволюцией. Природа дала глаза животным, которые двигаются, но не дала их деревьям . Зрение нужно именно для того, чтобы предсказывать новый ракурс при движении в пространстве.

По мнению спикеров, предсказание нового ракурса является «ИИ-полной» задачей (AI-complete) . Если модель идеально предсказывает, как будет выглядеть мир с другой точки зрения, она неизбежно должна понимать и смысл происходящего — будь то разгадка детектива или доказательство математической гипотезы на доске, на которую камера еще только поворачивается .

💬 Цитаты

«Предсказание нового ракурса в пространстве — это эквивалент предсказания следующего токена в языке.»

Джастин Джонсон 43:11

«Природа дала глаза животным, потому что они двигаются. Деревьям глаза не нужны. Зрение — это инструмент для навигации в новых ракурсах.»

Фей-Фей Ли 42:59
👥 Спикеры
🎬 Упомянутые фильмы и сериалы
🔗 Упомянутые сайты и проекты
📖 Термины
New View Prediction
Способность модели предсказывать, как будет выглядеть сцена с точки зрения камеры, находящейся в новой позиции.
Gaussian Splatting
Метод визуализации и реконструкции 3D-сцен с использованием набора трехмерных эллипсоидов (гауссиан).
Sim-to-Real
Процесс обучения роботов в виртуальной симуляции с последующим переносом навыков в реальный физический мир.
AI-complete
Класс задач в ИИ, решение которых эквивалентно созданию общего искусственного интеллекта (AGI).
📊 Цифры
🗓 Хронология
  1. 2.5 года назад Основание компании World Labs.
  2. Прошлый год Выпуск модели Marble, первой коммерческой разработки компании.
  3. Лето 2026 Eureka-момент при тестировании прототипа Atlas с «пролетом под столом».
  4. Сентябрь 2026 Официальный запуск модели Atlas.
⚖️ Другая сторона
Искусственный интеллект World Labs Atlas spatial intelligence Fei-Fei Li 3D reconstruction