Стартап World Labs, основанный легендой компьютерного зрения Фей-Фей Ли и её коллегами, представил Atlas — нейросетевую модель нового типа. В отличие от привычных текстовых (LLM) или видеомоделей, Atlas работает с «пространственным интеллектом», объединяя генерацию изображений и точную 3D-реконструкцию.
В рамках подкаста a16z сооснователи компании и генеральный партнер фонда Мартин Касадо обсудили, почему предсказание новых ракурсов (New View Prediction) может стать таким же фундаментальным прорывом для ИИ, каким стало предсказание следующего токена для языковых моделей.
🚀 Atlas: от спецэффектов «Матрицы» до съемки на три iPhone 0:51
Главной инновацией Atlas разработчики называют способность модели создавать, реконструировать и симулировать виртуальные миры, используя минимальное количество входных данных . Джастин Джонсон объясняет это на примере знаменитого эффекта Bullet Time из фильма «Матрица». В оригинале для сцены, где камера облетает Нео в слоу-мо, требовалось кольцо из сотен откалиброванных камер и огромный зеленый экран .
С помощью Atlas аналогичный эффект можно создать, имея всего три обычных iPhone на штативах . Модель способна:
- Принимать на вход от 1 до 100 кадров реального мира .
- Восстанавливать точную геометрию пространства (sparse 3D reconstruction).
- Генерировать видео с любого произвольного ракурса, «пролетая» камерой там, где физически съёмка не велась .
- Замораживать время и детализировать моменты (например, всплеск молока при падении клубники) с высокой точностью .
По словам Джастина Джонсона, Atlas — это не просто «улучшенная видеомодель», а принципиально новая архитектура. В то время как обычные видеогенераторы часто выдают визуально красивые, но физически невозможные кадры, Atlas изначально обучается с учетом 3D-позиции камеры .
🧠 Новая парадигма: New View Prediction как «следующий токен» 8:15
Фей-Фей Ли подчеркивает, что пространственный интеллект — это способность ИИ не просто видеть пиксели, но понимать геометрию, структуру и физику мира . Основным примитивом Atlas является «предсказание нового ракурса» (New View Prediction) .
Бен Милденхолл объясняет фундаментальное отличие от классических видеомоделей:
- Пространственная привязка: В Atlas каждый входной кадр имеет строгое математическое описание положения камеры в пространстве .
- Точность против воображения: Видеомодели похожи на «слот-машины» — вы вводите текст и надеетесь на удачный результат . Atlas же воспроизводит именно то, что вы ему дали, сохраняя отношения между объектами в комнате .
- Гибридный подход: Модель впервые объединяет реконструкцию (точное восстановление видимого) и генерацию (достраивание того, что осталось за кадром или под столом) в рамках единой архитектуры .
Как утверждает Джастин Джонсон, такая мультимодальность — текст, изображения, видео и 3D-координаты как «родной» входной формат — ранее не применялась на этапе предварительного обучения моделей такого масштаба .
🏗️ Как создавался Atlas: вера в масштабирование 21:27
На вопрос Мартина Касадо о том, были ли основатели уверены в успехе такого подхода, Фей-Фей Ли ответила утвердительно . Команда опиралась на «гипотезу масштабирования» (scaling hypothesis): они верили, что при увеличении объёма данных и вычислительных мощностей модель начнет демонстрировать эмерджентные свойства в понимании пространства .
Бен Милденхолл, создатель технологии NeRF, отметил, что переход от «плотных» реконструкций (когда для оцифровки комнаты нужны сотни фото и часы работы) к «разреженным» (3–5 фото) стал возможен благодаря добавлению генеративных способностей .
Ключевые вехи разработки:
- Продукт Marble: Первая модель World Labs, использовавшая технологию Gaussian Splatting для создания 3D-миров из текста и фото .
- Ограничение Marble: Модель могла принимать максимум два изображения одновременно .
- Прорыв Atlas: Благодаря расширенному «контекстному окну» Atlas может обрабатывать до 64 кадров и строить по ним связные траектории пролета через целые дома .
«Эврика-момент» наступил в начале лета, когда Джастин и Бен показали Фей-Фей результат работы еще небольшой модели: камера в симуляции пролетела под столом и показала футбольный мяч, которого не было видно на входных кадрах . В этот момент основатели поняли, что модель научилась «понимать» скрытую геометрию .
🎨 Применение: от архитектуры до «умных» симуляторов 24:42
Бен Милденхолл видит огромный потенциал Atlas в профессиональном дизайне и архитектуре. Сейчас 95% работы архитектора или креативного директора — это рутинная правка 3D-моделей в сложном ПО после получения фидбека . ИИ может сделать этот процесс интуитивным, как игра в LEGO или лепка из глины .
Основные преимущества для креаторов:
- Постоянство состояния (Persistence): В отличие от мимолетных генераций DALL-E, Atlas создает устойчивый 3D-мир, в который можно возвращаться, менять освещение или добавлять объекты, сохраняя структуру .
- Редактируемость: Будущие версии модели позволят управлять отдельными объектами внутри сцены, а не просто перегенерировать весь кадр целиком .
Мартин Касадо отметил, что такое «горизонтальное» решение может породить целую индустрию новых интерфейсов взаимодействия человека с 3D-контентом .
🤖 Робототехника и решение проблемы данных 29:13
Фей-Фей Ли считает, что Atlas станет критическим звеном в развитии физических роботов. Главная проблема робототехники сегодня — не чипы, а отсутствие данных для обучения в реальном мире .
Atlas позволяет реализовать цикл «из реальности в симуляцию» (Real-to-Sim):
- Снимается короткое видео рабочего места робота (например, процесс прокладки кабеля) .
- Atlas восстанавливает цифровую копию этой среды .
- В симуляции запускается «рандомизация»: кабель изгибается иначе, коробки меняют цвет и положение. Это дает миллионы сценариев для обучения нейросети робота без риска повредить оборудование .
Джастин Джонсон добавляет, что следующим шагом станет создание «нейросимуляторов» — обученных моделей, которые понимают, как мир реагирует на действия. Если модель понимает физику настолько, что может предсказать реакцию объекта на толчок, она сама может стать «мозгом» робота .
🔮 Будущее: 4D-видео и биологические корни ИИ 37:55
Хотя текущая версия Atlas сфокусирована на статичных сценах, в ней уже заложены основы динамики (baby dynamics) — например, колыхание волн или движение крошечных машин на заднем плане . Джастин Джонсон утверждает, что обучение модели на динамических видео даже для статической реконструкции помогает ей лучше понимать структуру объектов .
В финале дискуссии Фей-Фей Ли провела аналогию с эволюцией. Природа дала глаза животным, которые двигаются, но не дала их деревьям . Зрение нужно именно для того, чтобы предсказывать новый ракурс при движении в пространстве.
По мнению спикеров, предсказание нового ракурса является «ИИ-полной» задачей (AI-complete) . Если модель идеально предсказывает, как будет выглядеть мир с другой точки зрения, она неизбежно должна понимать и смысл происходящего — будь то разгадка детектива или доказательство математической гипотезы на доске, на которую камера еще только поворачивается .