# Фей-Фей Ли: «Предсказание ракурса — это новый „следующий токен” в ИИ»

Источник: https://www.youtube.com/watch?v=qn1QDDBnTA0
Канал: a16z (Andreessen Horowitz)
Опубликовано: 04.09.2026

---

Стартап World Labs, основанный легендой компьютерного зрения Фей-Фей Ли и её коллегами, представил Atlas — нейросетевую модель нового типа. В отличие от привычных текстовых (LLM) или видеомоделей, Atlas работает с «пространственным интеллектом», объединяя генерацию изображений и точную 3D-реконструкцию.

В рамках подкаста a16z сооснователи компании и генеральный партнер фонда Мартин Касадо обсудили, почему предсказание новых ракурсов (New View Prediction) может стать таким же фундаментальным прорывом для ИИ, каким стало предсказание следующего токена для языковых моделей.

## 🚀 Atlas: от спецэффектов «Матрицы» до съемки на три iPhone
[[JUMP:00:51]]

Главной инновацией Atlas разработчики называют способность модели создавать, реконструировать и симулировать виртуальные миры, используя минимальное количество входных данных [01:00]. Джастин Джонсон объясняет это на примере знаменитого эффекта Bullet Time из фильма «Матрица». В оригинале для сцены, где камера облетает Нео в слоу-мо, требовалось кольцо из сотен откалиброванных камер и огромный зеленый экран [01:50].

С помощью Atlas аналогичный эффект можно создать, имея всего три обычных iPhone на штативах [02:27]. Модель способна:

*   Принимать на вход от 1 до 100 кадров реального мира [01:25].
*   Восстанавливать точную геометрию пространства (sparse 3D reconstruction).
*   Генерировать видео с любого произвольного ракурса, «пролетая» камерой там, где физически съёмка не велась [01:37].
*   Замораживать время и детализировать моменты (например, всплеск молока при падении клубники) с высокой точностью [02:39].

По словам Джастина Джонсона, Atlas — это не просто «улучшенная видеомодель», а принципиально новая архитектура. В то время как обычные видеогенераторы часто выдают визуально красивые, но физически невозможные кадры, Atlas изначально обучается с учетом 3D-позиции камеры [06:45].

## 🧠 Новая парадигма: New View Prediction как «следующий токен»
[[JUMP:08:15]]

Фей-Фей Ли подчеркивает, что пространственный интеллект — это способность ИИ не просто видеть пиксели, но понимать геометрию, структуру и физику мира [08:53]. Основным примитивом Atlas является «предсказание нового ракурса» (New View Prediction) [03:04].

Бен Милденхолл объясняет фундаментальное отличие от классических видеомоделей:

1.  **Пространственная привязка:** В Atlas каждый входной кадр имеет строгое математическое описание положения камеры в пространстве [04:17].
2.  **Точность против воображения:** Видеомодели похожи на «слот-машины» — вы вводите текст и надеетесь на удачный результат [05:06]. Atlas же воспроизводит именно то, что вы ему дали, сохраняя отношения между объектами в комнате [04:29].
3.  **Гибридный подход:** Модель впервые объединяет реконструкцию (точное восстановление видимого) и генерацию (достраивание того, что осталось за кадром или под столом) в рамках единой архитектуры [05:31].

Как утверждает Джастин Джонсон, такая мультимодальность — текст, изображения, видео и 3D-координаты как «родной» входной формат — ранее не применялась на этапе предварительного обучения моделей такого масштаба [06:20].

## 🏗️ Как создавался Atlas: вера в масштабирование
[[JUMP:21:27]]

На вопрос Мартина Касадо о том, были ли основатели уверены в успехе такого подхода, Фей-Фей Ли ответила утвердительно [21:37]. Команда опиралась на «гипотезу масштабирования» (scaling hypothesis): они верили, что при увеличении объёма данных и вычислительных мощностей модель начнет демонстрировать эмерджентные свойства в понимании пространства [21:49].

Бен Милденхолл, создатель технологии NeRF, отметил, что переход от «плотных» реконструкций (когда для оцифровки комнаты нужны сотни фото и часы работы) к «разреженным» (3–5 фото) стал возможен благодаря добавлению генеративных способностей [15:14]. 

Ключевые вехи разработки:

*   **Продукт Marble:** Первая модель World Labs, использовавшая технологию Gaussian Splatting для создания 3D-миров из текста и фото [11:20].
*   **Ограничение Marble:** Модель могла принимать максимум два изображения одновременно [19:33].
*   **Прорыв Atlas:** Благодаря расширенному «контекстному окну» Atlas может обрабатывать до 64 кадров и строить по ним связные траектории пролета через целые дома [19:45].

«Эврика-момент» наступил в начале лета, когда Джастин и Бен показали Фей-Фей результат работы еще небольшой модели: камера в симуляции пролетела под столом и показала футбольный мяч, которого не было видно на входных кадрах [24:18]. В этот момент основатели поняли, что модель научилась «понимать» скрытую геометрию [24:31].

## 🎨 Применение: от архитектуры до «умных» симуляторов
[[JUMP:24:42]]

Бен Милденхолл видит огромный потенциал Atlas в профессиональном дизайне и архитектуре. Сейчас 95% работы архитектора или креативного директора — это рутинная правка 3D-моделей в сложном ПО после получения фидбека [28:24]. ИИ может сделать этот процесс интуитивным, как игра в LEGO или лепка из глины [28:36].

Основные преимущества для креаторов:

*   **Постоянство состояния (Persistence):** В отличие от мимолетных генераций DALL-E, Atlas создает устойчивый 3D-мир, в который можно возвращаться, менять освещение или добавлять объекты, сохраняя структуру [26:46].
*   **Редактируемость:** Будущие версии модели позволят управлять отдельными объектами внутри сцены, а не просто перегенерировать весь кадр целиком [38:49].

Мартин Касадо отметил, что такое «горизонтальное» решение может породить целую индустрию новых интерфейсов взаимодействия человека с 3D-контентом [38:12].

## 🤖 Робототехника и решение проблемы данных
[[JUMP:29:13]]

Фей-Фей Ли считает, что Atlas станет критическим звеном в развитии физических роботов. Главная проблема робототехники сегодня — не чипы, а отсутствие данных для обучения в реальном мире [30:55]. 

Atlas позволяет реализовать цикл «из реальности в симуляцию» (Real-to-Sim):

1.  Снимается короткое видео рабочего места робота (например, процесс прокладки кабеля) [29:53].
2.  Atlas восстанавливает цифровую копию этой среды [30:42].
3.  В симуляции запускается «рандомизация»: кабель изгибается иначе, коробки меняют цвет и положение. Это дает миллионы сценариев для обучения нейросети робота без риска повредить оборудование [31:32].

Джастин Джонсон добавляет, что следующим шагом станет создание «нейросимуляторов» — обученных моделей, которые понимают, как мир реагирует на действия. Если модель понимает физику настолько, что может предсказать реакцию объекта на толчок, она сама может стать «мозгом» робота [35:05].

## 🔮 Будущее: 4D-видео и биологические корни ИИ
[[JUMP:37:55]]

Хотя текущая версия Atlas сфокусирована на статичных сценах, в ней уже заложены основы динамики (baby dynamics) — например, колыхание волн или движение крошечных машин на заднем плане [36:32]. Джастин Джонсон утверждает, что обучение модели на динамических видео даже для статической реконструкции помогает ей лучше понимать структуру объектов [37:22].

В финале дискуссии Фей-Фей Ли провела аналогию с эволюцией. Природа дала глаза животным, которые двигаются, но не дала их деревьям [42:59]. Зрение нужно именно для того, чтобы предсказывать новый ракурс при движении в пространстве.

По мнению спикеров, предсказание нового ракурса является «ИИ-полной» задачей (AI-complete) [42:19]. Если модель идеально предсказывает, как будет выглядеть мир с другой точки зрения, она неизбежно должна понимать и смысл происходящего — будь то разгадка детектива или доказательство математической гипотезы на доске, на которую камера еще только поворачивается [42:32].