# Y Combinator о будущем робототехники: от телеуправления до World Action Models

Источник: https://www.youtube.com/watch?v=myDCd0hNqQU
Канал: Y Combinator
Опубликовано: 08.08.2026

---

В середине 2026 года индустрия робототехники находится в странной точке: технологии развиваются стремительно, но обещанная «эра домашних роботов» всё ещё кажется делом следующего года. В рамках специального выпуска YC Paper Club Франсуа Шобар и приглашённые эксперты из Stanford, Physical Intelligence и General Instinct обсудили фундаментальные барьеры, мешающие масштабированию роботов, и представили новые архитектуры, которые могут решить проблемы памяти, рассуждений и переноса навыков из симуляции в реальность.

## 🧱 Четыре стены робототехники: почему прогресс замедлился
[[JUMP:0:19]]

Франсуа Шобар открыл дискуссию напоминанием о том, что последние десять лет каждый следующий год объявлялся «годом решения робототехники» [0:19]. Несмотря на успехи алгоритмов AlphaGo и появление качественных данных телеуправления (Aloha, UMi), в июле 2026 года потребительские роботы вроде Neo 1X или Figure всё ещё находятся на стадии предзаказов или узких промышленных ячеек [1:40]. 

Шобар выделяет четыре критических барьера («стены»), которые индустрии ещё предстоит преодолеть:

*   **Sim-to-Real Gap (Разрыв между симуляцией и реальностью):** Модели мировых процессов часто игнорируют физику. Например, при управлении беспилотным автомобилем в симуляции машина может «проехать сквозь» магазин, который внезапно превратится в шоссе [3:26].
*   **Action Representation (Репрезентация действий):** Представление пространства действий остается нерешённой задачей для быстрого обучения.
*   **Sensorimotor Problem (Сенсомоторная проблема):** У роботов нет «эпидермиса». Человек может найти зарядку в рюкзаке на ощупь, используя тысячи нервных окончаний [5:11]. У большинства современных роботов в лучшем случае есть один датчик силы/момента на запястье или пальце.
*   **Embodiment Drift (Дрейф воплощения):** Физические компоненты изнашиваются, в приводы попадает пыль, батареи теряют мощность. Это делает данные телеуправления «протухшими», требуя постоянного переобучения моделей VLA (Vision-Language-Action) [5:51].

## 🧠 MEM: как добавить роботам память и контекст
[[JUMP:7:59]]

Марсель Торне представил систему **MEM (Multi-Scale Embodied Memory)**, разработанную в Physical Intelligence. По его мнению, отсутствие памяти — главная причина, по которой роботы «зацикливаются», бесконечно моя одну и ту же тарелку или пережаривая сэндвич, не понимая, сколько времени уже прошло [10:02].

Основные механизмы MEM:

1.  **Двухуровневая структура:** Разделение на высокоуровневую политику (планирование) и низкоуровневую VLA (исполнение действий) [11:32].
2.  **Краткосрочная визуальная память:** Использование модифицированного ViT-энкодера с временным вниманием (temporal attention), который сжимает последовательность кадров в информативный токен [12:09].
3.  **Долгосрочная текстовая память:** Робот ведет «дневник» (scratchpad) на естественном языке, записывая, что он уже сделал. Это гораздо эффективнее по памяти, чем хранение видео [13:42].

По словам Торне, добавление памяти даёт свойство **in-context adaptation**: если робот ошибается (например, не может открыть холодильник с первого раза), он «вспоминает» неудачу и меняет стратегию во второй попытке [15:37].

## 📑 RNB Encore: обучение роботов рассуждению
[[JUMP:20:21]]

Милан Ганаи поднял вопрос целесообразности рассуждений (Chain of Thought) в робототехнике. В условиях дефицита данных (robotics data scarcity) любые текстовые аннотации полезны, но избыточное планирование на каждом шагу увеличивает задержку (latency) [23:42].

Исследование RNB Encore показало:

*   Не все рассуждения одинаково полезны. Рассуждения о перемещении (move) и положении захвата (gripper position) критически важны для успеха задачи [26:44].
*   **Perceptual reasoning** (перечисление всех объектов в сцене) часто оказывается вредным, так как отвлекает модель на несущественные детали [26:57].
*   Метод **action forcing** позволяет использовать рассуждения во время обучения, но отключать их при инференсе, чтобы избежать задержек в реальном времени [31:29].

## 🦾 SimToolReal: виртуозное владение инструментами без обучения на людях
[[JUMP:33:42]]

Тайлер Га Вэй Лум продемонстрировал систему **SimToolReal**, которая обучает роботов использовать инструменты (молотки, кисти, лопатки) полностью в симуляции.

Ключевые особенности подхода:

*   **Zero-shot обучение:** Модель никогда не видела реальные инструменты во время тренировки. Она обучается на примитивных объектах (цилиндрах и кубах) в GPU-ускоренной симуляции, работающей в 1000 раз быстрее реального времени [35:17].
*   **Универсальная цель:** Вместо меток задач («подметать», «забивать») используется целевое положение объекта (goal-conditioned policy). Видео с человеком используется лишь как «подсказка» траектории, а не для имитации движений [37:52].
*   **Реактивность:** Политику запускают на частоте 60 Гц, что позволяет роботу мгновенно подхватывать выпавший инструмент и продолжать работу [40:41].

## 📈 Стратегия бизнеса: почему телеуправление — это новый SaaS
[[JUMP:51:21]]

Нико Вест (Rerun.io) утверждает, что лучшие робототехнические компании будущего начнут не с создания «общего интеллекта», а с телеуправления. Он называет это «робототехническими прикладными компаниями» (Robotics Application Companies) [52:45].

Советы Веста для фаундеров:

1.  **Solve with teleop first:** Если задачу можно решить руками оператора, её можно автоматизировать. Если нет — бизнес не взлетит [55:20].
2.  **Реплика среды:** Успешная компания всегда имеет в офисе точную копию рабочего места клиента [57:44].
3.  **Данные — это не таблицы:** Физические данные мультимодальны и эпизодичны. Использование стандартных баз данных вроде Postgres для хранения видео и облаков точек — тупиковый путь, создающий огромное трение при разработке [1:00:59].

По мнению Веста, робототехника сейчас — это «смерть от тысячи порезов» [1:02:16], где успех зависит не только от архитектуры трансформера, но и от логистики, поддержки и скорости итерации данных.

## ⚡ World Action Models: ИИ на «железе» без суперкомпьютеров
[[JUMP:1:08:30]]

Билл Цзяо и Гуаньмин Ван (General Instinct) представили критику тяжеловесных моделей. Современные **World Action Models (WAM)**, предсказывающие будущие кадры видео для планирования действий, требуют для работы по два ускорителя NVIDIA GB200 на одного робота ($140 000 только за GPU) [1:10:16].

Команда General Instinct предложила методы оптимизации:

*   **Дистилляция DiT (Diffusion Transformer):** Сжатие модели и сокращение шагов выборки (flow matching) с 50 до 1–2 шагов, что даёт 50-кратное ускорение без потери качества [1:15:15].
*   **Latent World Models:** Вместо декодирования полноценного видео робот может предсказывать только скрытые состояния (hidden states), что позволяет запускать WAM на бюджетных модулях Jetson Thor с задержкой 500 мс на блок из 16 действий [1:16:09].

Ван подчеркивает, что предсказание будущего (видео) — это не просто визуальный эффект, а способ обучения физике. Когда модель видит на пиксельном уровне, как падает бутылка, она лучше понимает кинематику, необходимую для генерации действий [1:19:17].