Янник Кильхер о Go-Explore: «Новый подход к обучению ИИ»

Yannic Kilcher 3,7 тыс. 19 мин 2 мин 10.01.2020
Главное

Революционный подход к обучению с подкреплением: что такое Go-Explore 1:33

Алгоритм Go-Explore, разработанный командой исследователей из Uber AI Labs, стал прорывом в решении задач с «разреженным» вознаграждением, где агент должен выполнить сотни действий, прежде чем получить хоть какой-то положительный сигнал. Янник Кильхер в своем обзоре объясняет, что традиционные методы обучения с подкреплением (Reinforcement Learning, RL) часто терпят неудачу в таких средах, как игра Montezuma's Revenge, где нужно собирать ключи, избегать врагов и перемещаться по лабиринтам. Go-Explore впервые позволил алгоритму превзойти результаты человека без предварительных демонстраций со стороны игрока-эксперта.

Проблемы классического RL: отрыв и «схождение с рельсов» 1:59

Авторы исследования выделяют две фундаментальные причины, по которым агенты «застревают» в сложных средах:

Как работает Go-Explore: двухфазная стратегия 7:04

Алгоритм решает эти проблемы, разделяя процесс обучения на два независимых этапа.

Фаза 1: Исследование как поиск кратчайшего пути 7:47

В первой фазе алгоритм ведет себя подобно классическому алгоритму Дейкстры для поиска кратчайшего пути на графе. В основе лежит «архив состояний»:

  1. Сохранение состояния: Алгоритм сохраняет состояние эмулятора игры. Это позволяет в любой момент вернуться в конкретную точку и начать исследование оттуда.
  2. Эффективность пути: Если агент достигает уже известного состояния, он сравнивает количество затраченных шагов. Если новый путь короче, он обновляет архив.
  3. Квантование состояний: Чтобы архив не стал бесконечным, используется метод сжатия данных: изображения экрана уменьшаются в размере и переходят в градации серого. Таким образом, алгоритм группирует визуально похожие ситуации как одно «состояние».

Фаза 2: Обучение устойчивости (Robustification) 16:56

После того как успешная траектория найдена, алгоритм переходит ко второй фазе, где в среду добавляется шум. Используя методы имитационного обучения, агент пытается достичь цели, начиная с точек, расположенных все дальше и дальше от финала. Постепенно он учится достигать цели из любого «промежуточного» состояния, что делает его поведение крайне надежным даже при наличии помех в среде.

По мнению Кильхера, ключевой успех Go-Explore заключается в том, что он переносит логику поиска пути (как в графовых алгоритмах) в область обучения с подкреплением. Главное ограничение метода — необходимость детерминированной среды (хотя бы внутри эмулятора) и возможность создать качественную репрезентацию состояний.

💬 Цитаты

«Это был первый алгоритм, который фактически превзошел человеческих экспертов в этой игре.»

Янник Кильхер 01:05

«Это почти в точности алгоритм Дейкстры: вы просто исследуете, и для каждого нового состояния вы либо находите новый путь, либо обновляете старый.»

Янник Кильхер 13:09
👥 Спикер
🔗 Упомянутые сайты и проекты
📖 Термины
Обучение с подкреплением
Метод машинного обучения, где агент учится принимать решения путем взаимодействия со средой и получения наград.
Разреженное вознаграждение
Ситуация в обучении, когда агент получает обратную связь крайне редко, что затрудняет поиск правильной стратегии.
Алгоритм Дейкстры
Классический алгоритм поиска кратчайшего пути на графе от одной вершины до всех остальных.
Имитационное обучение
Метод обучения агента на основе демонстраций (или успешных траекторий), а не только на основе наград.
📊 Цифры
⚖️ Другая сторона
Искусственный интеллект Go-Explore Reinforcement Learning Uber AI Labs Montezuma's Revenge Имитационное обучение