# Челси Финн из Physical Intelligence: «Робототехника входит в свою эру GPT»

Источник: https://www.youtube.com/watch?v=cRZNwgvcWUg
Канал: Y Combinator
Опубликовано: 12.08.2026

---

Челси Финн, сооснователь компании Physical Intelligence, утверждает, что робототехника наконец вступает в свою «эру GPT», переходя от узкоспециализированных систем к универсальным моделям, способным работать «из коробки». На выступлении в Startup School 2026 она представила данные о том, как новые подходы к обучению с подкреплением и архитектуре памяти позволяют роботам работать автономно часами, справляясь с задачами в незнакомых условиях.

## 🤖 Состояние «физического интеллекта» и путь к автономности
[[JUMP:00:06]]

Главная цель Physical Intelligence — разработать системы, позволяющие любому роботу выполнять любую задачу в реальном мире [00:19]. За прошедший год компания перешла от базовых демонстраций (складывание белья в новых помещениях) к более сложным манипуляциям: мытью грязных сковород, чистке моркови, приготовлению сэндвичей на гриле и нарезке цукини [01:11].

Однако Челси Финн подчеркивает, что эффектные видео — это не самоцель. Основной вызов заключается в том, чтобы сделать роботов полезными и надежными в реальной эксплуатации [01:36]. Она выделяет два ключевых аспекта:

1.  **Универсальность (General Purpose):** Создание моделей, которые не требуют переобучения под каждую новую задачу.
2.  **Автономность:** Возможность систем работать без постоянного присмотра человека.

Финн проводит параллель с эволюцией ИИ. Если первые системы (рекомендательные алгоритмы, ранжирование рекламы) лишь давали советы человеку, то физический ИИ должен принимать решения самостоятельно [04:47]. В случае ошибки рекомендательной системы пользователь просто игнорирует её, но ошибка робота в физическом мире может иметь серьезные последствия. По мнению Финн, роботы станут по-настоящему полезными только тогда, когда достигнут уровня надежности в 99% и выше, работая полностью автономно [05:00]. В качестве примера успешного внедрения такой технологии она приводит компанию Waymo, которая в прошлом году достигла отметки в 250 000 автономных поездок в неделю [05:13].

## ☕ Проблема надежности: как заставить робота работать 13 часов подряд
[[JUMP:05:11]]

Чтобы разобрать проблему надежности, Челси Финн использует пример приготовления эспрессо. Это сложная задача, требующая точного контроля силы при установке холдера, аккуратного обращения с жидкостями и четкого чувства времени [06:07].

Традиционный цикл машинного обучения (сбор данных — обучение — оценка) редко дает высокий результат с первой попытки [06:48]. Обычно инженеры итеративно добавляют данные о крайних случаях (edge cases), но человеческий ресурс ограничен. Решением, по словам Финн, является алгоритм обучения с подкреплением (Reinforcement Learning, RL), который позволяет роботу учиться на собственных ошибках в автоматическом режиме [07:51].

### Оптимизация обучения в физическом мире

Применение классических RL-алгоритмов (таких как PPO или GRPO) в робототехнике затруднено. Если языковые модели могут тренироваться на миллионах попыток за счет вычислительных мощностей, то робот ограничен физическим временем. По оценке Финн, выполнение 1 миллиона траекторий (каждая по 1 минуте) заняло бы 700 робо-дней [08:50]. Чтобы сделать процесс эффективнее, Physical Intelligence использует два метода:

*   **Человеческое вмешательство (Interventions):** Вместо того чтобы позволять роботу бесконечно пытаться выполнить задачу по ложному пути (например, пытаться сложить две слипшиеся коробки), человек-оператор вмешивается в процесс через телеуправление [10:17]. Он показывает роботу, как выйти из тупика, что экономит время и предотвращает накопление бесполезных данных [10:31].
*   **Универсальная функция ценности (General Purpose Value Function):** Вместо оценки каждой попытки с нуля, модель обучается на огромном массиве видео понимать, что такое «хорошо» и «плохо» [11:50]. Например, она распознает, что разворачивание уже сложенной рубашки — это отрицательный прогресс [12:03].

Результатом этого подхода стал эксперимент, в котором робот готовил латте в паре с человеком в течение 13 часов подряд [14:21]. Система показала высокую надежность, справляясь даже с самыми деликатными моментами, такими как перенос полной чашки на костер без расплескивания [14:43]. Аналогичные успехи были достигнуты на шоколадной фабрике Dandelion Chocolate, где робот взял на себя цикл сборки, маркировки и укладки коробок [15:08]. Использование RL позволило увеличить пропускную способность (throughput) роботов в два раза [16:25].

## 🧠 Зачем роботам память и контекст
[[JUMP:17:36]]

Финн отмечает удивительный факт: большинство современных базовых моделей для робототехники не имеют памяти. Они принимают решения только на основе текущего кадра с камеры [17:54]. Этого достаточно для повторяющихся моторных навыков, но недостаточно для выполнения длинных последовательных задач.

Проблема добавления памяти — в объеме токенов. Передача всего 10 секунд видео с четырех камер робота при частоте 50 Гц потребовала бы обработки около 500 000 токенов в реальном времени, что сейчас технически невозможно или слишком дорого [19:00].

Physical Intelligence разработала систему многоуровневой памяти:

1.  **Краткосрочная видеопамять:** Эффективная обработка последних 10 секунд визуальных данных [19:38].
2.  **Долгосрочная текстовая память:** Робот сжимает события последних 10–15 минут в текстовое описание («помыл тарелку», «протер стол») [20:04].

Такая архитектура позволила роботу автономно убирать кухню в течение 15 минут [20:30]. Задача включала в себя последовательность из множества действий: протирание столешницы губкой, использование бумажного полотенца, выброс мусора, уборка горчицы в холодильник и расстановка посуды [20:43].

## 🚀 Эра «универсальных моделей» в робототехнике: модель PI07
[[JUMP:21:22]]

Челси Финн описывает фундаментальный сдвиг в индустрии. Еще в 2023 году нормой было собирать специфический датасет под каждую задачу и обучать модель с нуля [24:02]. Теперь робототехника проходит путь от BERT-подобных моделей (предварительное обучение + тонкая настройка) к GPT-подобным системам, работающим «из коробки» [23:10].

### Ключевые цели новой модели PI07:

1.  **Работа без дообучения:** Создание единой модели, которая справляется с задачами без fine-tuning [25:45].
2.  **Композиционное обобщение:** Способность комбинировать концепты, которых не было в обучающей выборке в таком сочетании (аналог генерации «стула в форме авокадо» в DALL-E) [26:14].

Модель PI07 обучалась на всех доступных данных: демонстрациях роботов, результатах автономных попыток, видео с людьми и данных из интернета [27:35]. Ключевым «взломом» (unlock) стало детальное промптирование модели метаданными о качестве данных, инструкциями для подзадач и генерация визуальных подцелей (sub-goal images) — изображений того, как должен выглядеть результат через несколько секунд [28:40].

### Результаты испытаний PI07

В ходе тестов универсальная модель PI07 догнала или превзошла по эффективности специализированные модели, обученные только на конкретных задачах (например, приготовлении кофе) [30:42]. Финн выделила два поразительных примера обобщения:

*   **Новые объекты:** Робот смог взаимодействовать с аэрофритюрницей (открыть, положить батат, закрыть), хотя в огромном датасете было всего три случайных эпизода с этим устройством [31:34].
*   **Кросс-платформенность:** Модель смогла сложить одежду на огромном промышленном манипуляторе BARM, хотя все данные о складывании собирались на совершенно других, маленьких роботах [32:55]. Модель самостоятельно адаптировалась к другой длине рычагов и конфигурации суставов [33:35].

## ❓ Вопросы и ответы: Будущее индустрии
[[JUMP:39:49]]

В завершение сессии Челси Финн ответила на вопросы участников о перспективах отрасли и карьерных путях.

*   **О «моменте ChatGPT» для робототехники:** Финн полагает, что мы не увидим такого же взрывного роста пользователей (миллион за пять дней), так как распространение ограничено физическим производством и доставкой «железа» [39:58]. Однако по уровню возможностей роботы достигнут аналогичного прогресса в ближайшие несколько лет [40:39].
*   **О PhD против индустрии:** Финн считает аспирантуру отличной школой работы с неопределенностью и выбора правильных задач [43:25]. Тем не менее, сейчас в индустрии (особенно в стартапах на передовой ИИ) сосредоточено огромное количество инженерных и исследовательских ресурсов, где можно влиять на продукт без научной степени [44:32].
*   **О данных:** Робототехнике нужны данные реального опыта на физических платформах. Хотя видео с YouTube и людьми полезны (как просмотр игры Роджера Федерера для теннисиста), робот не сможет научиться эффективно, не попробовав выполнить действие самостоятельно на своем «теле» [47:49].
*   **О скорости:** По мнению Финн, нынешняя медлительность роботов — это временное ограничение, связанное с качеством данных телеуправления (люди сами медленно управляют роботами) [53:27]. Новые итерации RL уже показывают скорость выше человеческой [53:30].
*   **Вход в индустрию:** Финн рекомендует инженерам не бояться «грязной работы» с железом. Она привела пример сотрудницы, которая перешла из алгоритмического трейдинга, купила дешевого робота себе в спальню, самостоятельно дообучила открытую модель и прислала результаты в холодном письме, что обеспечило ей место в Physical Intelligence [57:24].