# Градиент стратегии и алгоритм REINFORCE: от робототехники до ChatGPT

Источник: https://www.youtube.com/watch?v=L6OVEmV3NcE
Канал: Stanford Online
Опубликовано: 30.10.2024

---

В лекции из курса CS234 Стэнфордского университета подробно рассматривается переход от классических методов обучения с подкреплением, основанных на функциях ценности, к методам прямого поиска стратегий (Policy Search). Профессор объясняет ключевые математические концепции, стоящие за градиентом стратегии, включая знаменитый трюк отношения правдоподобия (likelihood ratio) и алгоритм REINFORCE. На практических примерах из робототехники и современной индустрии искусственного интеллекта — от экзоскелетов до настройки ChatGPT — демонстрируется, почему прямое параметризованное управление оказывается эффективнее традиционных подходов в условиях реального мира.

## 🔄 Сходимость ценностных методов и скрытые уязвимости DQN
[[JUMP:0:05]]

В начале лекции проводится традиционный обзор пройденного материала для проверки понимания базовых алгоритмов. В частности, напоминается, что в табулярном случае (когда пространство состояний невелико и может быть представлено в виде таблицы) алгоритм Q-learning гарантированно сходится к истинной ценности оптимальной стратегии при условии правильного подбора графика затухания скорости обучения. Также подтверждается тезис о том, что пакетные обновления TD-обучения (Batch TD-learning) эквивалентны построению модели определенной эквивалентности (certainty equivalent model), когда на основе имеющихся данных сначала оцениваются модели динамики среды и вознаграждения, а затем применяется динамическое программирование.

Однако ситуация кардинально меняется при переходе к глубоким нейронным сетям. Популярный алгоритм DQN (Deep Q-Network) не имеет теоретических гарантий сходимости к оптимальной Q-функции даже при бесконечном числе итераций. Лектор объясняет это фундаментальной проблемой «реализуемости» (realizability). Поскольку истинная функциональная форма Q-функции в сложных средах неизвестна, аппроксиматор может быть выбран неверно. Если представить одномерное пространство состояний, где реальная Q-функция выглядит как сложный многочлен, а модель пытается приблизить её простой прямой линией, то никакой объем данных не позволит достичь оптимума. Дополнительные факторы нестабильности глубокого обучения усугубляют эту проблему, хотя на практике, по наблюдениям профессора, DQN часто демонстрирует весьма впечатляющие эмпирические результаты.

## 🎯 Прямой поиск стратегий как новая парадигма
[[JUMP:3:50]]

Ограничения методов, завязанных исключительно на функциях ценности ($Q$ и $V$), заставляют исследователей искать альтернативные пути. Так рождается парадигма поиска стратегий (Policy Search). Вместо того чтобы строить явное представление о том, сколько вознаграждения принесет каждое состояние, алгоритм сразу фокусируется на самой стратегии $\pi$, которая отображает состояния в действия или задает распределение вероятностей на множестве доступных действий. При этом явное вычисление функции ценности становится необязательным.

В основе любого алгоритма обучения с подкреплением лежат четыре столпа: оптимизация, отложенные последствия, исследование среды (exploration) и генерализация. Поиск стратегий позволяет взглянуть на задачу RL через призму онлайн-оптимизации, где цель — напрямую найти параметры управления, максимизирующие общий выигрыш. Как отмечает лектор, методы градиента стратегии (Policy Gradient) совершили настоящий прорыв в последние 5–10 лет. Они лежат в основе обучения рекуррентных нейронных сетей на уровне последовательностей (алгоритм REINFORCE) и сквозного обучения глубоких визуально-моторных стратегий в робототехнике, позволяющих переходить напрямую от пикселей с камер к командам для приводов робота. 

Историческим примером такого подхода стала докторская диссертация профессора Челси Финн (Chelsea Finn), выполненная совместно с Сергеем Левиным (Sergey Levine) в Беркли десятилетие назад, где роботы обучались сложным манипуляциям непосредственно по изображениям. Сегодня эти алгоритмы масштабировались до невероятных масштабов: усовершенствованный метод PPO (Proximal Policy Optimization) стал неотъемлемой частью процесса настройки языковой модели ChatGPT.

## 🎲 Магия стохастичности: почему случайность побеждает детерминизм
[[JUMP:8:33]]

В отличие от ценностных методов, где для формирования стратегии применяется $\epsilon$-жадный (epsilon-greedy) выбор на основе параметров $w$, в Policy Search стратегия параметризуется напрямую вектором $\theta$. Архитектурно это может быть глубокая сверточная нейросеть, выдающая на выходе конкретное действие или его вероятность. Дэвид Сильвер (David Silver), один из ключевых разработчиков AlphaGo, предложил удобную классификацию методов RL, разделив их на чисто ценностные, чисто стратегические и гибридные — актор-критик (Actor-Critic). Последние сочетают в себе преимущества обоих подходов (как та же AlphaGo).



Главное концептуальное новшество Policy Search — переход к стохастическим (вероятностным) стратегиям. Профессор приводит два ярких примера, доказывающих преимущество стохастики:

1.  **Игра «Камень, ножницы, бумага» (в Китае известная как «рошамбо»)**. Если агент будет использовать детерминированную стратегию (например, всегда выбирать «бумагу»), наблюдательный оппонент мгновенно адаптируется и начнет постоянно выигрывать («ножницами»). Любое детерминированное поведение здесь уязвимо для эксплуатации, тогда как абсолютно случайный равномерный выбор является оптимальным решением и представляет собой равновесие Нэша. Полноценно описать такую систему через стандартную Q-функцию крайне сложно, поскольку среда не является марковской из-за реакций оппонента.
2.  **Проблема частичной наблюдаемости (perceptual aliasing)**. Представьте мобильного робота, который ориентируется в коридоре с помощью датчиков расстояния до стен. В этом коридоре есть две серые зоны, которые для датчиков робота выглядят абсолютно идентично из-за одинакового расположения стен. Ценностный метод, извлекающий детерминированную стратегию, заставит робота совершать одно и то же действие в обеих серых зонах (например, всегда идти на запад). В результате робот рискует зациклиться и никогда не добраться до целевой награды. Стохастическая же стратегия позволяет роботу в спорной ситуации выбирать направление случайно (с вероятностью 50% на восток или запад), благодаря чему он быстро выбирается из ловушки и находит цель. Подобные системы классифицируются как частично наблюдаемые марковские процессы принятия решений (POMDP).



## 📈 Оптимизация без градиентов: кейс человеко-машинных экзоскелетов
[[JUMP:17:12]]

Математически поиск лучшей стратегии сводится к максимизации функции ценности начального состояния $V(\theta)$. Поскольку аналитический вид этой функции изначально скрыт от исследователя, задача превращается в сложную оптимизационную проблему, решаемую сугубо через сбор данных.

Удивительно, но для её решения можно полностью игнорировать градиенты, используя методы «черного ящика»: алгоритмы случайного поиска (hill climbing), генетические алгоритмы или метод кросс-энтропии (CMA-ES). Коллега профессора, Стивен Коллинз (Steven Collins) с кафедры машиностроения Стэнфорда, применил этот подход для настройки медицинских экзоскелетов, помогающих людям с нарушениями моторных функций. Конфигурация тела каждого пациента уникальна, и ручной подбор параметров управления может занимать годы. Команда Коллинза внедрила человеко-ориентированную оптимизацию (human-in-the-loop). Пациент ходил в экзоскелете при нескольких случайно заданных параметрах, система замеряла уровень его метаболических усилий, а затем с помощью алгоритма CMA-ES сдвигала параметры в сторону наиболее эффективных настроек. 

Всего за 2–3 часа такой оптимизации удалось найти индивидуальные профили управления, которые повысили метаболическую эффективность ходьбы на 20–30%. Результаты этого исследования были опубликованы в журнале Science около 7–8 лет назад. Основное преимущество безградиентных методов — их применимость к недифференцируемым стратегиям и легкость распараллеливания, хотя они и требуют существенно больше данных, поскольку игнорируют временную структуру процессов.

## 🧮 Математический трюк отношения правдоподобия
[[JUMP:23:36]]

Основной фокус лекции смещен на дифференцируемые методы, где параметры нейросети обновляются с помощью стохастического градиентного спуска. В контексте эпизодических сред алгоритмы пытаются нащупать хотя бы локальный максимум функции ценности. В отличие от табулярных методов, глобальная оптимальность здесь не гарантируется, но исследователи соглашаются на локальный оптимум в рамках выбранного класса стратегий. Исторически, еще до эпохи автоматического дифференцирования, в 2004 году группа Питера Стоуна (Peter Stone) использовала метод конечных разностей для ускорения ходьбы четырехногих роботов в RoboCup. Роботы часами ходили взад-вперед, параметры движения их суставов слегка корректировались вручную, и за 4 часа (с несколькими заменами батарей) они обучались бегать значительно быстрее.

Для аналитического расчета градиента стратегии без численных приближений используются такие классы, как Softmax (для дискретных действий) и функции Гаусса (для непрерывных пространств, например, моментов сил в робототехнике). Математически ценность стратегии выражается как математическое ожидание вознаграждения за всю траекторию движения агента. Чтобы взять градиент от ожидания, применяется «трюк отношения правдоподобия» (likelihood ratio trick): выражение умножается и делится на вероятность траектории $P(\tau; \theta)$. Благодаря свойству производной логарифма, формула преобразуется в математическое ожидание, которое теперь можно легко оценить по конечным выборкам (методом Монте-Карло).



При разложении полной вероятности траектории на составляющие (распределение начальных состояний, стратегия агента и динамика среды) происходит удивительное: логарифм превращает произведение в сумму. Компоненты, отвечающие за динамику среды (переходы из состояния в состояние), вообще не зависят от параметров стратегии $\theta$, и при дифференцировании их производная обращается в ноль. Лектор подчеркивает элегантность этого момента: алгоритму не нужно знать физику и правила мира (модель динамики), чтобы рассчитать точный градиент. Более того, данное свойство сохраняется, даже если среда не является марковской. Полученная производная логарифма стратегии называется «функцией счета» (score function). Для Softmax-стратегии она сводится к разности между вектором признаков выбранного действия и их средним ожидаемым значением.

## 🏁 Классический алгоритм REINFORCE и укрощение дисперсии
[[JUMP:53:34]]

Для закрепления материала аудитории предлагается тест, который доказывает три важнейших вывода: для работы градиента стратегии функция вознаграждения не обязана быть дифференцируемой, среда не обязана быть строго марковской, а сам метод изначально затачивается под конечный горизонт планирования. Интуитивный смысл градиента заключается в том, чтобы направленно увеличивать логарифм вероятности тех траекторий, которые принесли высокое вознаграждение.

Прямая реализация этой идеи на основе полных траекторий Монте-Карло является несмещенной, но обладает колоссальной дисперсией (шумом). Чтобы сделать метод практичным, разработчики используют два улучшения: учет временной структуры и введение базовой линии (baseline). Учет временной структуры базируется на очевидном физическом законе: время течет только в одну сторону, и решения, принятые агентом в будущем, никак не могут повлиять на вознаграждения, полученные им в прошлом. Это позволяет заменить суммарное вознаграждение за всю траекторию на «остаточное вознаграждение» (return, $G_t$), полученное строго от текущего шага до конца эпизода.

Так оформляется знаменитый алгоритм REINFORCE (Monte Carlo policy gradient), предложенный около 30 лет назад, в 1992 году. Согласно алгоритму, параметры обновляются по формуле: изменение весов пропорционально скорости обучения, функции счета и остаточному вознаграждению $G_t$. Агент выполняет полный эпизод, а затем для каждого временного шага делает небольшую корректировку параметров.

Вторым мощным инструментом борьбы с шумом становится концепция базовой линии. Из остаточного вознаграждения вычитается функция $b(s)$, зависящая исключительно от состояния среды. Профессор отмечает математический феномен: вычитание любой функции, не зависящей от действий, оставляет градиент абсолютно несмещенным, но драматически снижает его дисперсию. Смысл базовой линии в том, чтобы оценивать не абсолютное вознаграждение, а то, насколько выбранное действие оказалось лучше или хуже среднего ожидаемого результата для данного состояния. Подробное доказательство этого феномена и разбор современного алгоритма PPO лектор обещает представить на следующем занятии.