Челси Финн из Physical Intelligence: «Робототехника входит в свою эру GPT»

Y Combinator 19 тыс. 58 мин 6 мин 12.08.2026
Главное

Челси Финн, сооснователь компании Physical Intelligence, утверждает, что робототехника наконец вступает в свою «эру GPT», переходя от узкоспециализированных систем к универсальным моделям, способным работать «из коробки». На выступлении в Startup School 2026 она представила данные о том, как новые подходы к обучению с подкреплением и архитектуре памяти позволяют роботам работать автономно часами, справляясь с задачами в незнакомых условиях.

🤖 Состояние «физического интеллекта» и путь к автономности 0:06

Главная цель Physical Intelligence — разработать системы, позволяющие любому роботу выполнять любую задачу в реальном мире . За прошедший год компания перешла от базовых демонстраций (складывание белья в новых помещениях) к более сложным манипуляциям: мытью грязных сковород, чистке моркови, приготовлению сэндвичей на гриле и нарезке цукини .

Однако Челси Финн подчеркивает, что эффектные видео — это не самоцель. Основной вызов заключается в том, чтобы сделать роботов полезными и надежными в реальной эксплуатации . Она выделяет два ключевых аспекта:

  1. Универсальность (General Purpose): Создание моделей, которые не требуют переобучения под каждую новую задачу.
  2. Автономность: Возможность систем работать без постоянного присмотра человека.

Финн проводит параллель с эволюцией ИИ. Если первые системы (рекомендательные алгоритмы, ранжирование рекламы) лишь давали советы человеку, то физический ИИ должен принимать решения самостоятельно . В случае ошибки рекомендательной системы пользователь просто игнорирует её, но ошибка робота в физическом мире может иметь серьезные последствия. По мнению Финн, роботы станут по-настоящему полезными только тогда, когда достигнут уровня надежности в 99% и выше, работая полностью автономно . В качестве примера успешного внедрения такой технологии она приводит компанию Waymo, которая в прошлом году достигла отметки в 250 000 автономных поездок в неделю .

☕ Проблема надежности: как заставить робота работать 13 часов подряд 5:11

Чтобы разобрать проблему надежности, Челси Финн использует пример приготовления эспрессо. Это сложная задача, требующая точного контроля силы при установке холдера, аккуратного обращения с жидкостями и четкого чувства времени .

Традиционный цикл машинного обучения (сбор данных — обучение — оценка) редко дает высокий результат с первой попытки . Обычно инженеры итеративно добавляют данные о крайних случаях (edge cases), но человеческий ресурс ограничен. Решением, по словам Финн, является алгоритм обучения с подкреплением (Reinforcement Learning, RL), который позволяет роботу учиться на собственных ошибках в автоматическом режиме .

Оптимизация обучения в физическом мире

Применение классических RL-алгоритмов (таких как PPO или GRPO) в робототехнике затруднено. Если языковые модели могут тренироваться на миллионах попыток за счет вычислительных мощностей, то робот ограничен физическим временем. По оценке Финн, выполнение 1 миллиона траекторий (каждая по 1 минуте) заняло бы 700 робо-дней . Чтобы сделать процесс эффективнее, Physical Intelligence использует два метода:

Результатом этого подхода стал эксперимент, в котором робот готовил латте в паре с человеком в течение 13 часов подряд . Система показала высокую надежность, справляясь даже с самыми деликатными моментами, такими как перенос полной чашки на костер без расплескивания . Аналогичные успехи были достигнуты на шоколадной фабрике Dandelion Chocolate, где робот взял на себя цикл сборки, маркировки и укладки коробок . Использование RL позволило увеличить пропускную способность (throughput) роботов в два раза .

🧠 Зачем роботам память и контекст 17:36

Финн отмечает удивительный факт: большинство современных базовых моделей для робототехники не имеют памяти. Они принимают решения только на основе текущего кадра с камеры . Этого достаточно для повторяющихся моторных навыков, но недостаточно для выполнения длинных последовательных задач.

Проблема добавления памяти — в объеме токенов. Передача всего 10 секунд видео с четырех камер робота при частоте 50 Гц потребовала бы обработки около 500 000 токенов в реальном времени, что сейчас технически невозможно или слишком дорого .

Physical Intelligence разработала систему многоуровневой памяти:

  1. Краткосрочная видеопамять: Эффективная обработка последних 10 секунд визуальных данных .
  2. Долгосрочная текстовая память: Робот сжимает события последних 10–15 минут в текстовое описание («помыл тарелку», «протер стол») .

Такая архитектура позволила роботу автономно убирать кухню в течение 15 минут . Задача включала в себя последовательность из множества действий: протирание столешницы губкой, использование бумажного полотенца, выброс мусора, уборка горчицы в холодильник и расстановка посуды .

🚀 Эра «универсальных моделей» в робототехнике: модель PI07 21:22

Челси Финн описывает фундаментальный сдвиг в индустрии. Еще в 2023 году нормой было собирать специфический датасет под каждую задачу и обучать модель с нуля . Теперь робототехника проходит путь от BERT-подобных моделей (предварительное обучение + тонкая настройка) к GPT-подобным системам, работающим «из коробки» .

Ключевые цели новой модели PI07:

  1. Работа без дообучения: Создание единой модели, которая справляется с задачами без fine-tuning .
  2. Композиционное обобщение: Способность комбинировать концепты, которых не было в обучающей выборке в таком сочетании (аналог генерации «стула в форме авокадо» в DALL-E) .

Модель PI07 обучалась на всех доступных данных: демонстрациях роботов, результатах автономных попыток, видео с людьми и данных из интернета . Ключевым «взломом» (unlock) стало детальное промптирование модели метаданными о качестве данных, инструкциями для подзадач и генерация визуальных подцелей (sub-goal images) — изображений того, как должен выглядеть результат через несколько секунд .

Результаты испытаний PI07

В ходе тестов универсальная модель PI07 догнала или превзошла по эффективности специализированные модели, обученные только на конкретных задачах (например, приготовлении кофе) . Финн выделила два поразительных примера обобщения:

❓ Вопросы и ответы: Будущее индустрии 39:49

В завершение сессии Челси Финн ответила на вопросы участников о перспективах отрасли и карьерных путях.

💬 Цитаты

«В отличие от рекомендательных систем, физический ИИ должен напрямую принимать решения, влияющие на реальный мир.»

Челси Финн 04:47

«Если я смотрю, как Роджер Федерер играет в теннис, это не значит, что я сам смогу играть так же хорошо. Роботам нужен собственный опыт.»

Челси Финн 47:49
👥 Спикер
🔗 Упомянутые сайты и проекты
📖 Термины
Композиционное обобщение
Способность модели объединять знакомые концепции для решения совершенно новых задач (например, применить навык чистки к новому овощу).
Телеуправление (Teleoperation)
Дистанционное управление роботом человеком, используемое для сбора данных и демонстрации правильных действий.
Zero-shot / Out-of-the-box
Способность модели выполнять задачу без предварительного обучения или настройки под конкретные условия.
📊 Цифры
🗓 Хронология
  1. 2012 Deep Learning система впервые побила специализированные алгоритмы в ImageNet.
  2. 2022 Запуск ChatGPT, ознаменовавший эру универсальных моделей в тексте.
  3. 2023 В робототехнике всё ещё доминирует подход сбора данных с нуля под каждую задачу.
  4. 2026 Выступление на Startup School, представление универсальной модели PI07.
⚖️ Другая сторона
Искусственный интеллект Челси Финн Physical Intelligence PI07 Reinforcement Learning робототехника