# Семинар в Стэнфорде: безопасное и эффективное обучение ИИ в физическом мире

Источник: https://www.youtube.com/watch?v=HfkcXxC-JUs
Канал: Stanford Online
Опубликовано: 19.04.2024

---

На семинаре в Стэнфордском университете ведущий исследователь представил передовые подходы к безопасному и эффективному машинному обучению в физическом мире. В центре внимания оказалась проблема преодоления рисков при обучении реальных агентов — от автономных роботов до линейных ускорителей элементарных частиц, где цена ошибки критически высока. Спикер подробно разобрал механизмы безопасной байесовской оптимизации, мета-обучения и управления неопределенностью, позволяющие алгоритмам эффективно осваивать новые среды без риска разрушения оборудования.

## 🌍 Вызов реального мира: почему ИИ до сих пор «живет в матрице»
[[JUMP:0:10]]

Современные модели машинного обучения и искусственного интеллекта демонстрируют впечатляющий уровень универсальности, выходя далеко за рамки простых задач классификации изображений или перевода текстов `[0:48]`. Сегодня нейросети способны сочинять стихи и рэп-композиции о субмодулярной оптимизации или создавать фотореалистичные видео по текстовому описанию. Однако перенос этих достижений в физический мир — в такие сферы, как взаимодействие человека и робота, медицинские рекомендации, научные открытия и точное земледелие — сопряжен с огромными трудностями `[1:16]`. 

Как только алгоритмы начинают сталкиваться с реальной средой, ставки резко возрастают, а любые сбои становятся проблематичными. Центральной парадигмой машинного обучения в этих контекстах выступает обучение с подкреплением (Reinforcement Learning, RL) `[1:43]`. В этой модели агент взаимодействует со средой, совершает действия, меняет марковские состояния и получает награду. Ключевая проблема здесь заключается в том, что агент изначально не знает, как устроен мир, и сталкивается с дилеммой исследования и эксплуатации (exploration vs. exploitation) `[2:08]`. Ему приходится балансировать между экспериментированием для изучения последствий своих действий и использованием уже накопленных знаний для достижения наилучшего результата.

В последние годы академическое сообщество наблюдало за выдающимися успехами RL в играх, а также в сложных робототехнических приложениях. По словам докладчика, исследователи из Цюриха научили роботов совершать пешие прогулки по пересеченной местности и управлять дронами быстрее, чем это делают люди-пилоты `[2:20]`. 

Тем не менее в классическом представлении алгоритмов обучения с подкреплением кроется серьезное допущение. Спикер иронично отмечает, что в действительности ИИ-агент «живет в матрице» `[2:48]`. Для успешного обучения ему необходим невероятно точный симулятор, детально описывающий законы окружающего мира. В реальных же задачах, включая автономные лаборатории и научные эксперименты, симуляции либо слишком грубы, либо безумно дороги. В физическом пространстве любое исследование обходится дорого и может быть опасным `[3:15]`. Это заставляет ученых искать подходы, которые сочетали бы в себе максимальную эффективность выборки (sample efficiency) и строгие гарантии безопасности.

## 🔬 Кейс SwissFEL: оптимизация лазера на свободных электронах
[[JUMP:03:44]]

В качестве главного практического примера безопасного обучения спикер привел совместный проект с Институтом Поля Шеррера (Paul Scherrer Institute) в Швейцарии `[03:44]`. Исследователи работали со SwissFEL — уникальным лазером на свободных электронах. Эта установка представляет собой линейный ускоритель частиц длиной 700 метров, который генерирует рентгеновские импульсы экстремально короткой фемтосекундной длительности (одна миллионная от миллиардной доли секунды) `[03:57]`. 

С помощью этих ультракоротких вспышек ученые могут получать изображения сверхбыстрых процессов, например, видеть, как молекулы взаимодействуют друг с другом в ходе химической реакции `[04:10]`. Подобные исследования критически важны для разработки новых лекарств и открытия передовых материалов. 

SwissFEL — это невероятно сложное и хрупкое устройство. Свойства его излучения зависят от точно выверенной конфигурации множества магнитов, часть из которых физически перемещается в пространстве. Параметры пучка постоянно колеблются под воздействием тончайших изменений внешней среды, таких как температура и влажность воздуха `[04:24]`. Установку нельзя настроить один раз и забыть: ее конфигурацию необходимо непрерывно адаптировать под требования конкретного целевого эксперимента.

При этом процесс настройки является критически опасным для самого оборудования. Ошибочные действия оператора или алгоритма могут физически повредить магниты и полностью уничтожить дорогостоящую установку `[04:37]`. К счастью, лазер оснащен огромным количеством датчиков и мониторов потерь пучка, фиксирующих, насколько близко система подходит к нарушению критических ограничений. 

Главная сложность заключается в том, что базовые законы физики процесса поддаются симуляции, но математическое моделирование с требуемым уровнем точности требует колоссальных вычислительных мощностей `[05:03]`. С учетом того, что параметры внешней среды меняются динамически, рассчитывать настройки в симуляторе в реальном времени невозможно. Настройку и эксперименты приходится проводить непосредственно на работающем оборудовании.

## 🧮 Безопасная байесовская оптимизация и калибровка неопределенности
[[JUMP:05:16]]

Абстрактно эту задачу можно представить как оптимизацию «черного ящика». На вход подаются настраиваемые параметры ($\Delta t$), а на выходе измеряется награда (интенсивность пучка) и показатели безопасности с датчиков потерь `[05:29]`. Ни целевая функция награды, ни точные границы ограничений не известны алгоритму заранее. Задача сводится к нелинейной оптимизации с неизвестными ограничениями, где критически важно сохранять безопасность (допустимость состояния) на каждом шагу `[05:45]`.

Без априорных предположений эта задача математически некорректна и не имеет решений. Чтобы сделать ее решаемой, исследователи применили байесовский подход, моделируя неопределенность неизвестных функций `[06:12]`. В рамках байесовской оптимизации неизвестные награды и ограничения наделяются априорным распределением случайного процесса, что позволяет алгоритму действовать осторожно и осознанно.

В качестве базовой модели ученые использовали гауссовские процессы (Gaussian Processes, GP), хотя подход применим и к байесовским нейросетям `[06:37]`. Математический механизм работает на основе доверительных интервалов:

* **Оценка ограничений:** алгоритм использует пессимистичную (нижнюю) границу доверительного интервала для безопасных зон, что позволяет статистически аппроксимировать гарантированно безопасную область с высокой вероятностью `[07:04]`.
* **Оценка наград:** для целевой функции используется оптимистичная (верхняя) граница, указывающая на потенциально наиболее выгодные параметры `[07:16]`.

Обычный поиск в рамках безопасной зоны быстро приводит к застреванию в локальных субоптимальных решениях. Чтобы избежать этого, в алгоритм заложили концепцию «расширителей» (expanders) `[07:45]`. У алгоритма появляется стимул исследовать границы текущей безопасной зоны, чтобы статистически сертифицировать новые области пространства параметров и открывать путь к глобально лучшим конфигурациям.

Для работы этих математических гарантий модели обязаны быть хорошо откалиброванными: истинные физические функции должны строго укладываться в доверительные интервалы байесовской модели `[08:12]`. Если модель раскалибрована, реальные параметры могут выйти за безопасные границы. Спикер подчеркнул, что обеспечение равномерной калибровки bounds во всем домене и на любом отрезке времени — это глубокий теоретический вызов, над которым его команда долго работала `[08:39]`. В итоге им удалось доказать, что при определенных допущениях регулярности алгоритм способен гарантированно находить квазиоптимальные решения, не нарушая ограничений ни на одном из шагов обучения `[09:44]`.

## 🏎️ От теории к практике: ускорение протонов и настройка роботов
[[JUMP:09:44]]

Разработанные алгоритмы безопасной оптимизации были развернуты непосредственно на швейцарской установке SwissFEL. Аспиранты Йоханнес (Johannes) и Мойнье (Moynier) вместе с коллегой Николь (Nicole) работали в операторской комнате ускорителя, запуская код в реальном времени `[09:57]`. 

В ходе экспериментов исследователи брали параметры, выставленные экспертами-физиками, намеренно сбивали настройки до ухудшения работы системы, а затем запускали алгоритм для восстановления оптимального режима. Байесовская оптимизация показала значительное превосходство над традиционными методами локального поиска, обеспечив глобальную сходимость при строгом соблюдении рамок безопасности `[10:25]`.

После этого успеха методологию Safe BO применили на еще более опасном объекте — высокоинтенсивном протонном ускорителе в том же научном центре `[10:51]`. Любая ошибка там чревата мгновенной аварийной остановкой. Алгоритм сумел найти существенно более качественные режимы работы ускорителя, не вызвав ни одного прерывания протонного пучка.

Помимо физических мега-установок, данный метод успешно зарекомендовал себя в робототехнике и промышленности. Его использовали для автоматической настройки параметров усиления высокоточных электродвигателей на производстве, а также для подбора параметров походки четырехногих роботов-квадрупедов `[11:04]`.

## 🧠 Мета-обучение: как извлечь априорные знания из прошлых задач
[[JUMP:11:17]]

Классическая байесовская оптимизация требует от инженера ручного проектирования априорной модели — например, выбора фиксированного ядра гауссовского процесса. Но опыт глубокого обучения и генеративного ИИ доказывает: если данных достаточно, извлечение представлений из самой информации работает лучше, чем ручной дизайн функций `[11:57]`. Кроме того, представления, освоенные на одних задачах, можно эффективно адаптировать (дообучать) на новых. Например, модель, обученную на миллионах обычных фотографий, можно быстро и экономно дообучить на распознавание медицинских снимков с использованием малой выборки.

Ученые задались вопросом: можно ли перенести этот принцип на последовательное принятие решений и байесовскую оптимизацию? Ответ лежит в плоскости байесовского мета-обучения (Bayesian meta-learning) `[12:25]`. Вместо того чтобы начинать поиск с нуля с абстрактным априорным распределением, алгоритм берет коллекцию схожих задач из смежных областей, выстраивает иерархию и формирует единое мета-априорное знание (hyper-prior) `[12:54]`. Накапливая опыт прошлых сессий настройки, система мгновенно адаптируется к новой задаче.

Стандартный подход в индустрии — задавать априорные параметры распределения весов нейросети (например, изотропное гауссовское распределение весов) `[13:46]`. По мнению спикера, у этого метода есть огромный минус: крайне тяжело просчитать, какие именно ограничения и допущения такой шаг накладывает на итоговое пространство функций `[13:59]`. На практике это часто приводит к непредсказуемому поведению ИИ и плохой калибровке.

В качестве альтернативы команда докладчика предложила кодировать априорные допущения напрямую в пространстве функций `[14:12]`. Гауссовские процессы удобны тем, что ведут себя понятно: вблизи известных данных они уверены, а по мере удаления от них неопределенность плавно растет. Исследователи решили напрямую обучать модель базового случайного процесса, управляющего распределением наград и ограничений.

Поскольку случайные процессы полностью определяются своими маргинальными распределениями, моделировать их нужно только в тех точках, где они непосредственно вычисляются `[15:09]`. Более того, для большинства современных техник приближенного вывода в байесовском глубоком обучении нет необходимости знать само распределение функций — достаточно знать так называемый «скор» (score), то есть градиент логарифма плотности вероятности случайного процесса в исследуемых точках `[15:22]`. 

Для предсказания этого скора ученые задействовали гибкую архитектуру трансформера (transformer-based model) `[16:40]`. Обучение этой нейросети скорингу осуществляется с помощью метода сопоставления скоров (score matching) — базового математического движка, стоящего за современными диффузионными моделями генерации изображений.

## 📊 Эксперименты с диффузионным счетом и поиск безопасного баланса
[[JUMP:16:54]]

Разработанную архитектуру на основе диффузионного скора протестировали на широком спектре бенчмарков в условиях жесткого дефицита данных, когда на одну задачу приходится всего несколько примеров. В тестах использовались реальные логи прошлых сессий настройки лазера SwissFEL, а также медицинские базы данных временных рядов пациентов из палат интенсивной терапии (где важно построить общую модель, но кастомизировать ее под конкретного человека) `[17:34]`. Нейросеть показала высокую точность предсказаний и рекордно низкую ошибку калибровки `[17:47]`. Теоретические аспекты сходимости этой системы в параметрических режимах исследовала аспирантка команды Парниан (Parnian) `[18:15]`.

Когда речь заходит о безопасности, критически важно гарантировать, что мета-обученная модель выдает консервативные, а не излишне оптимистичные оценки неопределенности. Для этого исследователи ввели управление гиперпараметрами масштаба (дисперсии) и масштаба длины (length scale) `[18:45]`. 

Взаимосвязь этих параметров определяет поведение модели:

* **Большой length scale:** единичные наблюдения вызывают резкое падение неопределенности вокруг точки. Это ускоряет обучение, но может спровоцировать опасное поведение алгоритма, если реальная функция окажется более изменчивой `[19:10]`.
* **Малый length scale и высокая дисперсия:** модель ведет себя максимально консервативно, осторожно продвигаясь по пространству, что гарантирует безопасность, но замедляет поиск.

Чтобы найти идеальный баланс (sweet spot) между скоростью обучения и соблюдением ограничений, ученые предложили алгоритм поиска на Парето-фронте (frontier search) `[20:58]`. Алгоритм максимизирует информативность модели, опираясь на исторические данные, но жестко следит за тем, чтобы уровень калибровки не падал ниже безопасного лимита. Эксперименты на реальном оборудовании доказали, что использование оптимизированного мета-приора дает колоссальное ускорение сходимости по сравнению с обучением с чистого листа `[21:38]`.

## 🎮 Управление на основе моделей: оптимистичное исследование без риска
[[JUMP:21:51]]

Следующим шагом исследователей стала трансляция идей байесовской оптимизации в теорию автоматического управления и в обучение с подкреплением на основе моделей (Model-Based RL). В отличие от оптимизации черного ящика, роботы и динамические системы выдают непрерывный поток наблюдений за своим состоянием. Неизвестная динамика описывается марковским ядром переходов, и байесовская модель призвана оценивать эпистемическую неопределенность относительно того, в каком состоянии окажется робот на шаге $t+1$ при совершении конкретного действия `[22:58]`.

Если запустить робота из начальной точки в целевую, цепочка неопределенности начнет лавинообразно нарастать с каждым шагом вперед. Однако по мере движения и сбора данных доверительные интервалы сужаются. Робот может перепланировать траекторию на лету, становясь менее консервативным `[23:36]`.

В рамках эпизодического Model-Based RL авторы выстроили следующий цикл: агент совершает раунд в реальном мире, собирает данные, уточняет модель динамики и затем использует накопленную неопределенность для планирования новой стратегии `[25:00]`. Процесс планирования происходит сугубо виртуально (интроспективно), внутри модели-симулятора. Для этого можно использовать любые мощные алгоритмы безмодельного RL (например, политические градиенты), тратя сколько угодно вычислительных ресурсов процессора перед тем, как совершить физическое действие на реальном роботе `[25:26]`.

Большинство классических алгоритмов (таких как PILCO или PETS) при планировании просто усредняют траектории по ансамблю моделей динамики, что эквивалентно тривиальному адаптивному управлению `[26:53]`. Команда спикера разработала метод оптимистичного исследования среды, преодолевающий этот недостаток `[26:08]`. 

Идея графически иллюстрируется одномерной схемой: агенту в виртуальном симуляторе позволяют буквально «контролировать свое везение» `[28:46]`. В пределах одношагового доверительного интервала неопределенности динамики агент сам выбирает ту точку следующего состояния, которая ему наиболее выгодна. Эта процедура математически перепараметризует неопределенность в управляемый параметр новой модифицированной функции динамики $\tilde{f}$ `[29:00]`. Задача оптимистичного поиска сводится к стандартному динамическому программированию, где можно эффективно применять метод политического градиента.

На классической задаче раскачивания перевернутого маятника (inverted pendulum) алгоритм продемонстрировал молниеносную скорость обучения с нуля `[29:42]`. Не зная законов физики, робот в первых раундах падал, но быстро собирал данные по пространству состояний и находил идеальную траекторию подъема `[30:09]`. Метод значительно превзошел по эффективности стратегии на основе сэмплирования Томсона и жадные подходы `[31:05]`. Оптимистичный поиск критически необходим в жестких условиях, когда задействованы штрафы за чрезмерные усилия актуаторов — в таких сценариях стандартные алгоритмы RL пугаются штрафов и просто застывают на месте, тогда как перепараметризованный алгоритм продолжает находить эффективные лазейки для достижения цели `[31:33]`.

## 🛡️ Безопасность на основе пикселей и преодоление разрыва между симуляцией и реальностью
[[JUMP:32:25]]

Аналогичный подход с перепараметризацией неопределенности исследователи адаптировали для марковских процессов принятия решений с ограничениями (Constraint MDPs). В этой схеме агент при поиске стратегии внутри симулятора обязан быть оптимистичным в отношении исследования наград, но предельно пессимистичным в отношении нарушения безопасности `[33:08]`.

Эффективность подхода была доказана на сложном робототехническом бенчмарке Safety-Gym, где виртуальные объекты (точка, тележка, квадрупед) должны ориентироваться в пространстве, нажимать кнопки и перемещать коробки, ориентируясь исключительно на изображение с фронтальной камеры (обучение напрямую из пикселей) `[33:51]`. Модель успешно справилась с частичной наблюдаемостью среды, показав высокую скорость обучения и гарантируя безопасное поведение в процессе тренировки, тогда как безмодельные алгоритмы требовали на несколько порядков больше итераций и постоянно нарушали ограничения `[35:02]`.

Финальным аккордом презентации стал эксперимент с парковкой задним ходом миниатюрного гоночного автомобиля `[35:57]`. Задача осложнена нелинейным трением, проскальзыванием шин и сложной динамикой колес. Базовый алгоритм Model-Based RL обучается этой задаче с нуля примерно за 20 эпизодов `[36:27]`. Если применить классический подход из теории управления — взять простую физическую модель велосипеда (bicycle model) и откалибровать ее параметры через идентификацию систем (sys id), — возникнет неизбежный разрыв между симуляцией и реальностью (sim-to-real gap) `[37:19]`. Машинка будет парковаться близко к цели, но не идеально, поскольку простая физика не учитывает микроэффекты скольжения шин.

Чтобы убрать этот разрыв, ученые задействовали байесовское мета-обучение. Они взяли несовершенный симулятор велосипеда и превратили его в нейросетевой априорный фильтр `[38:43]`. Нейросеть обучалась на скорах симулятора, вбирая в себя базовые законы физики. 

В результате реальный робот уже в самом первом заезде парковался в правильном направлении, а для полной идеальной адаптации к трению и скольжению на реальном треке ему потребовалось всего 10 эпизодов `[39:08]`. Данный гибридный метод показал лучшую точность предсказания состояний и превзошел как чистые нейросети, так и классические сероящичные (gray-box) модели динамики `[40:24]`.

Подводя итог, спикер подчеркнул, что ключевым фронтиром в создании безопасного ИИ является способность алгоритмов четко осознавать границы собственного незнания `[41:41]`. Это требование актуально как для робототехники, так и для современных больших фундаментальных моделей. Чтобы продолжить масштабирование этих концепций, команда планирует задействовать мощности суперкомпьютера следующего поколения в Лугано (Швейцария), оснащенного передовыми графическими процессорами `[42:07]`.

## ❓ Вопросы и ответы: имитационное обучение и каузальный анализ
[[JUMP:42:34]]

После завершения доклада слушатели задали автору несколько уточняющих вопросов.

**Вопрос об имитационном обучении (Imitation Learning):** Один из участников поинтересовался, не теряются ли строгие гарантии безопасности, если вместо интерактивного RL использовать обучение по демонстрациям эксперта `[42:47]`. 

Спикер согласился, что фундаментальное ограничение имитационного обучения заключается в том, что агент принципиально не может стать лучше, чем увиденные им демонстрации `[43:07]`. Тем не менее эти подходы можно эффективно комбинировать: например, использовать имитационное обучение для построения грамотного скрытого пространства признаков (latent space), а затем запускать на его основе алгоритмы безопасной байесовской оптимизации.

**Вопрос о гранулярности действий:** Слушатель спросил, можно ли оценивать неопределенность не для симулятора целиком, а на более детальном уровне — например, раздельно для каждого мотора многоколесного робота `[43:59]`. 

Докладчик назвал эту идею отличным вектором развития, отметив, что такое разделение ведет к области причинно-следственного анализа (causal discovery) `[44:51]`. Его команда уже ведет исследования в сфере причинно-следственной байесовской оптимизации на основе моделей (Model-Based Causal BO), которая изучает локальные эффекты конкретных узлов системы `[45:04]`.