В середине 2026 года индустрия робототехники находится в странной точке: технологии развиваются стремительно, но обещанная «эра домашних роботов» всё ещё кажется делом следующего года. В рамках специального выпуска YC Paper Club Франсуа Шобар и приглашённые эксперты из Stanford, Physical Intelligence и General Instinct обсудили фундаментальные барьеры, мешающие масштабированию роботов, и представили новые архитектуры, которые могут решить проблемы памяти, рассуждений и переноса навыков из симуляции в реальность.
🧱 Четыре стены робототехники: почему прогресс замедлился 0:19
Франсуа Шобар открыл дискуссию напоминанием о том, что последние десять лет каждый следующий год объявлялся «годом решения робототехники» . Несмотря на успехи алгоритмов AlphaGo и появление качественных данных телеуправления (Aloha, UMi), в июле 2026 года потребительские роботы вроде Neo 1X или Figure всё ещё находятся на стадии предзаказов или узких промышленных ячеек .
Шобар выделяет четыре критических барьера («стены»), которые индустрии ещё предстоит преодолеть:
- Sim-to-Real Gap (Разрыв между симуляцией и реальностью): Модели мировых процессов часто игнорируют физику. Например, при управлении беспилотным автомобилем в симуляции машина может «проехать сквозь» магазин, который внезапно превратится в шоссе .
- Action Representation (Репрезентация действий): Представление пространства действий остается нерешённой задачей для быстрого обучения.
- Sensorimotor Problem (Сенсомоторная проблема): У роботов нет «эпидермиса». Человек может найти зарядку в рюкзаке на ощупь, используя тысячи нервных окончаний . У большинства современных роботов в лучшем случае есть один датчик силы/момента на запястье или пальце.
- Embodiment Drift (Дрейф воплощения): Физические компоненты изнашиваются, в приводы попадает пыль, батареи теряют мощность. Это делает данные телеуправления «протухшими», требуя постоянного переобучения моделей VLA (Vision-Language-Action) .
🧠 MEM: как добавить роботам память и контекст 7:59
Марсель Торне представил систему MEM (Multi-Scale Embodied Memory), разработанную в Physical Intelligence. По его мнению, отсутствие памяти — главная причина, по которой роботы «зацикливаются», бесконечно моя одну и ту же тарелку или пережаривая сэндвич, не понимая, сколько времени уже прошло .
Основные механизмы MEM:
- Двухуровневая структура: Разделение на высокоуровневую политику (планирование) и низкоуровневую VLA (исполнение действий) .
- Краткосрочная визуальная память: Использование модифицированного ViT-энкодера с временным вниманием (temporal attention), который сжимает последовательность кадров в информативный токен .
- Долгосрочная текстовая память: Робот ведет «дневник» (scratchpad) на естественном языке, записывая, что он уже сделал. Это гораздо эффективнее по памяти, чем хранение видео .
По словам Торне, добавление памяти даёт свойство in-context adaptation: если робот ошибается (например, не может открыть холодильник с первого раза), он «вспоминает» неудачу и меняет стратегию во второй попытке .
📑 RNB Encore: обучение роботов рассуждению 20:21
Милан Ганаи поднял вопрос целесообразности рассуждений (Chain of Thought) в робототехнике. В условиях дефицита данных (robotics data scarcity) любые текстовые аннотации полезны, но избыточное планирование на каждом шагу увеличивает задержку (latency) .
Исследование RNB Encore показало:
- Не все рассуждения одинаково полезны. Рассуждения о перемещении (move) и положении захвата (gripper position) критически важны для успеха задачи .
- Perceptual reasoning (перечисление всех объектов в сцене) часто оказывается вредным, так как отвлекает модель на несущественные детали .
- Метод action forcing позволяет использовать рассуждения во время обучения, но отключать их при инференсе, чтобы избежать задержек в реальном времени .
🦾 SimToolReal: виртуозное владение инструментами без обучения на людях 33:42
Тайлер Га Вэй Лум продемонстрировал систему SimToolReal, которая обучает роботов использовать инструменты (молотки, кисти, лопатки) полностью в симуляции.
Ключевые особенности подхода:
- Zero-shot обучение: Модель никогда не видела реальные инструменты во время тренировки. Она обучается на примитивных объектах (цилиндрах и кубах) в GPU-ускоренной симуляции, работающей в 1000 раз быстрее реального времени .
- Универсальная цель: Вместо меток задач («подметать», «забивать») используется целевое положение объекта (goal-conditioned policy). Видео с человеком используется лишь как «подсказка» траектории, а не для имитации движений .
- Реактивность: Политику запускают на частоте 60 Гц, что позволяет роботу мгновенно подхватывать выпавший инструмент и продолжать работу .
📈 Стратегия бизнеса: почему телеуправление — это новый SaaS 51:21
Нико Вест (Rerun.io) утверждает, что лучшие робототехнические компании будущего начнут не с создания «общего интеллекта», а с телеуправления. Он называет это «робототехническими прикладными компаниями» (Robotics Application Companies) .
Советы Веста для фаундеров:
- Solve with teleop first: Если задачу можно решить руками оператора, её можно автоматизировать. Если нет — бизнес не взлетит .
- Реплика среды: Успешная компания всегда имеет в офисе точную копию рабочего места клиента .
- Данные — это не таблицы: Физические данные мультимодальны и эпизодичны. Использование стандартных баз данных вроде Postgres для хранения видео и облаков точек — тупиковый путь, создающий огромное трение при разработке .
По мнению Веста, робототехника сейчас — это «смерть от тысячи порезов» , где успех зависит не только от архитектуры трансформера, но и от логистики, поддержки и скорости итерации данных.
⚡ World Action Models: ИИ на «железе» без суперкомпьютеров 1:08:30
Билл Цзяо и Гуаньмин Ван (General Instinct) представили критику тяжеловесных моделей. Современные World Action Models (WAM), предсказывающие будущие кадры видео для планирования действий, требуют для работы по два ускорителя NVIDIA GB200 на одного робота ($140 000 только за GPU) .
Команда General Instinct предложила методы оптимизации:
- Дистилляция DiT (Diffusion Transformer): Сжатие модели и сокращение шагов выборки (flow matching) с 50 до 1–2 шагов, что даёт 50-кратное ускорение без потери качества .
- Latent World Models: Вместо декодирования полноценного видео робот может предсказывать только скрытые состояния (hidden states), что позволяет запускать WAM на бюджетных модулях Jetson Thor с задержкой 500 мс на блок из 16 действий .
Ван подчеркивает, что предсказание будущего (видео) — это не просто визуальный эффект, а способ обучения физике. Когда модель видит на пиксельном уровне, как падает бутылка, она лучше понимает кинематику, необходимую для генерации действий .