Y Combinator о будущем робототехники: от телеуправления до World Action Models

Y Combinator 18 тыс. 1 ч 24 мин 4 мин 08.08.2026
Главное

В середине 2026 года индустрия робототехники находится в странной точке: технологии развиваются стремительно, но обещанная «эра домашних роботов» всё ещё кажется делом следующего года. В рамках специального выпуска YC Paper Club Франсуа Шобар и приглашённые эксперты из Stanford, Physical Intelligence и General Instinct обсудили фундаментальные барьеры, мешающие масштабированию роботов, и представили новые архитектуры, которые могут решить проблемы памяти, рассуждений и переноса навыков из симуляции в реальность.

🧱 Четыре стены робототехники: почему прогресс замедлился 0:19

Франсуа Шобар открыл дискуссию напоминанием о том, что последние десять лет каждый следующий год объявлялся «годом решения робототехники» . Несмотря на успехи алгоритмов AlphaGo и появление качественных данных телеуправления (Aloha, UMi), в июле 2026 года потребительские роботы вроде Neo 1X или Figure всё ещё находятся на стадии предзаказов или узких промышленных ячеек .

Шобар выделяет четыре критических барьера («стены»), которые индустрии ещё предстоит преодолеть:

🧠 MEM: как добавить роботам память и контекст 7:59

Марсель Торне представил систему MEM (Multi-Scale Embodied Memory), разработанную в Physical Intelligence. По его мнению, отсутствие памяти — главная причина, по которой роботы «зацикливаются», бесконечно моя одну и ту же тарелку или пережаривая сэндвич, не понимая, сколько времени уже прошло .

Основные механизмы MEM:

  1. Двухуровневая структура: Разделение на высокоуровневую политику (планирование) и низкоуровневую VLA (исполнение действий) .
  2. Краткосрочная визуальная память: Использование модифицированного ViT-энкодера с временным вниманием (temporal attention), который сжимает последовательность кадров в информативный токен .
  3. Долгосрочная текстовая память: Робот ведет «дневник» (scratchpad) на естественном языке, записывая, что он уже сделал. Это гораздо эффективнее по памяти, чем хранение видео .

По словам Торне, добавление памяти даёт свойство in-context adaptation: если робот ошибается (например, не может открыть холодильник с первого раза), он «вспоминает» неудачу и меняет стратегию во второй попытке .

📑 RNB Encore: обучение роботов рассуждению 20:21

Милан Ганаи поднял вопрос целесообразности рассуждений (Chain of Thought) в робототехнике. В условиях дефицита данных (robotics data scarcity) любые текстовые аннотации полезны, но избыточное планирование на каждом шагу увеличивает задержку (latency) .

Исследование RNB Encore показало:

🦾 SimToolReal: виртуозное владение инструментами без обучения на людях 33:42

Тайлер Га Вэй Лум продемонстрировал систему SimToolReal, которая обучает роботов использовать инструменты (молотки, кисти, лопатки) полностью в симуляции.

Ключевые особенности подхода:

📈 Стратегия бизнеса: почему телеуправление — это новый SaaS 51:21

Нико Вест (Rerun.io) утверждает, что лучшие робототехнические компании будущего начнут не с создания «общего интеллекта», а с телеуправления. Он называет это «робототехническими прикладными компаниями» (Robotics Application Companies) .

Советы Веста для фаундеров:

  1. Solve with teleop first: Если задачу можно решить руками оператора, её можно автоматизировать. Если нет — бизнес не взлетит .
  2. Реплика среды: Успешная компания всегда имеет в офисе точную копию рабочего места клиента .
  3. Данные — это не таблицы: Физические данные мультимодальны и эпизодичны. Использование стандартных баз данных вроде Postgres для хранения видео и облаков точек — тупиковый путь, создающий огромное трение при разработке .

По мнению Веста, робототехника сейчас — это «смерть от тысячи порезов» , где успех зависит не только от архитектуры трансформера, но и от логистики, поддержки и скорости итерации данных.

⚡ World Action Models: ИИ на «железе» без суперкомпьютеров 1:08:30

Билл Цзяо и Гуаньмин Ван (General Instinct) представили критику тяжеловесных моделей. Современные World Action Models (WAM), предсказывающие будущие кадры видео для планирования действий, требуют для работы по два ускорителя NVIDIA GB200 на одного робота ($140 000 только за GPU) .

Команда General Instinct предложила методы оптимизации:

Ван подчеркивает, что предсказание будущего (видео) — это не просто визуальный эффект, а способ обучения физике. Когда модель видит на пиксельном уровне, как падает бутылка, она лучше понимает кинематику, необходимую для генерации действий .

💬 Цитаты

«Если вы можете решить задачу с помощью телеуправления, вы, как правило, сможете обучить модель делать это.»

Нико Вест 55:20

«Рассуждения о перемещении и положении захвата полезны, но перечисление всех объектов в сцене часто просто отвлекает робота.»

Милан Ганаи 26:44

«Экономически это не масштабируемо: для работы одной модели мира сейчас требуется два GB200 по $70 000 каждый.»

👥 Спикеры
🔗 Упомянутые сайты и проекты
📖 Термины
Sim-to-real gap
Различие между физикой в компьютерной симуляции и реальном мире, мешающее переносу навыков робота.
VLA (Vision-Language-Action)
Мультимодальные модели, принимающие на вход изображение и текст, а на выходе выдающие команды для моторов робота.
Teleoperation
Дистанционное управление роботом человеком-оператором для сбора обучающих данных.
World Action Models (WAM)
Модели, которые предсказывают будущее состояние среды (видеокадры) и необходимые для этого действия одновременно.
Embodiment drift
Изменение физических характеристик робота (износ, коррозия) со временем, требующее адаптации алгоритмов.
📊 Цифры
🗓 Хронология
  1. 2016 Выход AlphaGo, породивший надежды на скорое решение робототехники
  2. Июль 2026 Текущая дата дискуссии; роботы-гуманоиды всё ещё на стадии предзаказов
  3. 2026 Публикация ключевых работ по MEM, SimToolReal и RNB Encore
⚖️ Другая сторона
Технологии и IT Y Combinator VLA SimToolReal General Instinct Rerun.io