Челси Финн, сооснователь компании Physical Intelligence, утверждает, что робототехника наконец вступает в свою «эру GPT», переходя от узкоспециализированных систем к универсальным моделям, способным работать «из коробки». На выступлении в Startup School 2026 она представила данные о том, как новые подходы к обучению с подкреплением и архитектуре памяти позволяют роботам работать автономно часами, справляясь с задачами в незнакомых условиях.
🤖 Состояние «физического интеллекта» и путь к автономности 0:06
Главная цель Physical Intelligence — разработать системы, позволяющие любому роботу выполнять любую задачу в реальном мире . За прошедший год компания перешла от базовых демонстраций (складывание белья в новых помещениях) к более сложным манипуляциям: мытью грязных сковород, чистке моркови, приготовлению сэндвичей на гриле и нарезке цукини .
Однако Челси Финн подчеркивает, что эффектные видео — это не самоцель. Основной вызов заключается в том, чтобы сделать роботов полезными и надежными в реальной эксплуатации . Она выделяет два ключевых аспекта:
- Универсальность (General Purpose): Создание моделей, которые не требуют переобучения под каждую новую задачу.
- Автономность: Возможность систем работать без постоянного присмотра человека.
Финн проводит параллель с эволюцией ИИ. Если первые системы (рекомендательные алгоритмы, ранжирование рекламы) лишь давали советы человеку, то физический ИИ должен принимать решения самостоятельно . В случае ошибки рекомендательной системы пользователь просто игнорирует её, но ошибка робота в физическом мире может иметь серьезные последствия. По мнению Финн, роботы станут по-настоящему полезными только тогда, когда достигнут уровня надежности в 99% и выше, работая полностью автономно . В качестве примера успешного внедрения такой технологии она приводит компанию Waymo, которая в прошлом году достигла отметки в 250 000 автономных поездок в неделю .
☕ Проблема надежности: как заставить робота работать 13 часов подряд 5:11
Чтобы разобрать проблему надежности, Челси Финн использует пример приготовления эспрессо. Это сложная задача, требующая точного контроля силы при установке холдера, аккуратного обращения с жидкостями и четкого чувства времени .
Традиционный цикл машинного обучения (сбор данных — обучение — оценка) редко дает высокий результат с первой попытки . Обычно инженеры итеративно добавляют данные о крайних случаях (edge cases), но человеческий ресурс ограничен. Решением, по словам Финн, является алгоритм обучения с подкреплением (Reinforcement Learning, RL), который позволяет роботу учиться на собственных ошибках в автоматическом режиме .
Оптимизация обучения в физическом мире
Применение классических RL-алгоритмов (таких как PPO или GRPO) в робототехнике затруднено. Если языковые модели могут тренироваться на миллионах попыток за счет вычислительных мощностей, то робот ограничен физическим временем. По оценке Финн, выполнение 1 миллиона траекторий (каждая по 1 минуте) заняло бы 700 робо-дней . Чтобы сделать процесс эффективнее, Physical Intelligence использует два метода:
- Человеческое вмешательство (Interventions): Вместо того чтобы позволять роботу бесконечно пытаться выполнить задачу по ложному пути (например, пытаться сложить две слипшиеся коробки), человек-оператор вмешивается в процесс через телеуправление . Он показывает роботу, как выйти из тупика, что экономит время и предотвращает накопление бесполезных данных .
- Универсальная функция ценности (General Purpose Value Function): Вместо оценки каждой попытки с нуля, модель обучается на огромном массиве видео понимать, что такое «хорошо» и «плохо» . Например, она распознает, что разворачивание уже сложенной рубашки — это отрицательный прогресс .
Результатом этого подхода стал эксперимент, в котором робот готовил латте в паре с человеком в течение 13 часов подряд . Система показала высокую надежность, справляясь даже с самыми деликатными моментами, такими как перенос полной чашки на костер без расплескивания . Аналогичные успехи были достигнуты на шоколадной фабрике Dandelion Chocolate, где робот взял на себя цикл сборки, маркировки и укладки коробок . Использование RL позволило увеличить пропускную способность (throughput) роботов в два раза .
🧠 Зачем роботам память и контекст 17:36
Финн отмечает удивительный факт: большинство современных базовых моделей для робототехники не имеют памяти. Они принимают решения только на основе текущего кадра с камеры . Этого достаточно для повторяющихся моторных навыков, но недостаточно для выполнения длинных последовательных задач.
Проблема добавления памяти — в объеме токенов. Передача всего 10 секунд видео с четырех камер робота при частоте 50 Гц потребовала бы обработки около 500 000 токенов в реальном времени, что сейчас технически невозможно или слишком дорого .
Physical Intelligence разработала систему многоуровневой памяти:
- Краткосрочная видеопамять: Эффективная обработка последних 10 секунд визуальных данных .
- Долгосрочная текстовая память: Робот сжимает события последних 10–15 минут в текстовое описание («помыл тарелку», «протер стол») .
Такая архитектура позволила роботу автономно убирать кухню в течение 15 минут . Задача включала в себя последовательность из множества действий: протирание столешницы губкой, использование бумажного полотенца, выброс мусора, уборка горчицы в холодильник и расстановка посуды .
🚀 Эра «универсальных моделей» в робототехнике: модель PI07 21:22
Челси Финн описывает фундаментальный сдвиг в индустрии. Еще в 2023 году нормой было собирать специфический датасет под каждую задачу и обучать модель с нуля . Теперь робототехника проходит путь от BERT-подобных моделей (предварительное обучение + тонкая настройка) к GPT-подобным системам, работающим «из коробки» .
Ключевые цели новой модели PI07:
- Работа без дообучения: Создание единой модели, которая справляется с задачами без fine-tuning .
- Композиционное обобщение: Способность комбинировать концепты, которых не было в обучающей выборке в таком сочетании (аналог генерации «стула в форме авокадо» в DALL-E) .
Модель PI07 обучалась на всех доступных данных: демонстрациях роботов, результатах автономных попыток, видео с людьми и данных из интернета . Ключевым «взломом» (unlock) стало детальное промптирование модели метаданными о качестве данных, инструкциями для подзадач и генерация визуальных подцелей (sub-goal images) — изображений того, как должен выглядеть результат через несколько секунд .
Результаты испытаний PI07
В ходе тестов универсальная модель PI07 догнала или превзошла по эффективности специализированные модели, обученные только на конкретных задачах (например, приготовлении кофе) . Финн выделила два поразительных примера обобщения:
- Новые объекты: Робот смог взаимодействовать с аэрофритюрницей (открыть, положить батат, закрыть), хотя в огромном датасете было всего три случайных эпизода с этим устройством .
- Кросс-платформенность: Модель смогла сложить одежду на огромном промышленном манипуляторе BARM, хотя все данные о складывании собирались на совершенно других, маленьких роботах . Модель самостоятельно адаптировалась к другой длине рычагов и конфигурации суставов .
❓ Вопросы и ответы: Будущее индустрии 39:49
В завершение сессии Челси Финн ответила на вопросы участников о перспективах отрасли и карьерных путях.
- О «моменте ChatGPT» для робототехники: Финн полагает, что мы не увидим такого же взрывного роста пользователей (миллион за пять дней), так как распространение ограничено физическим производством и доставкой «железа» . Однако по уровню возможностей роботы достигнут аналогичного прогресса в ближайшие несколько лет .
- О PhD против индустрии: Финн считает аспирантуру отличной школой работы с неопределенностью и выбора правильных задач . Тем не менее, сейчас в индустрии (особенно в стартапах на передовой ИИ) сосредоточено огромное количество инженерных и исследовательских ресурсов, где можно влиять на продукт без научной степени .
- О данных: Робототехнике нужны данные реального опыта на физических платформах. Хотя видео с YouTube и людьми полезны (как просмотр игры Роджера Федерера для теннисиста), робот не сможет научиться эффективно, не попробовав выполнить действие самостоятельно на своем «теле» .
- О скорости: По мнению Финн, нынешняя медлительность роботов — это временное ограничение, связанное с качеством данных телеуправления (люди сами медленно управляют роботами) . Новые итерации RL уже показывают скорость выше человеческой .
- Вход в индустрию: Финн рекомендует инженерам не бояться «грязной работы» с железом. Она привела пример сотрудницы, которая перешла из алгоритмического трейдинга, купила дешевого робота себе в спальню, самостоятельно дообучила открытую модель и прислала результаты в холодном письме, что обеспечило ей место в Physical Intelligence .