«Распространённая», а не «успешная» В лекции схема названа самой успешной. Обзор 2024 года формулирует осторожнее — «the most common», то есть самая частая, а не доказанно лучшая. Есть и документированная критика её базового допущения о независимости стратегий агентов.
Суть
Схема разводит во времени две несовместимые потребности.
Во время обучения нужна полная информация: чтобы оценить, был ли ход агента хорош, полезно знать, что делали остальные. Поэтому обучающая часть (критик) получает на вход совместные наблюдения и совместные действия всех участников.
Во время исполнения полной информации нет и не будет: агент действует в реальном времени, видит только свой кусок мира и не может дожидаться сводки от соседей. Поэтому исполняющая часть (актор) обучена работать от локального наблюдения.
Ключ в том, что централизованный критик нужен только на этапе обучения и после него выбрасывается. Асимметрия «знали больше, чем понадобится» — это не жульничество, а способ дать градиенту осмысленный сигнал.
Чем это отвечает на вызовы MARL
Схема закрывает два из трёх пунктов MARL Challenges:
- Нестационарность. Для централизованного критика среда стационарна, потому что он видит действия всех агентов и не воспринимает их как случайный шум. Обучение стабилизируется.
- Назначение вклада. Критик, знающий совместное действие, способен различить, чей ход изменил исход.
Проклятие размерности схема не решает: вход централизованного критика растёт вместе с числом агентов.
MADDPG как канонический пример
MADDPG (Multi-Agent Deep Deterministic Policy Gradient) — расширение одноагентного DDPG на мультиагентный случай, самая известная реализация схемы.
Устройство по шагам: в буфер воспроизведения складывается кортеж из совместных состояний, совместных действий, наград и следующих состояний. Из него обучаются две сети — актор (что делать) и критик (насколько это хорошо). Ошибка критика даёт градиент, по которому корректируется актор.
Две детали реализации, на которых лектор останавливается отдельно:
- Шум для исследования. В детерминированную стратегию искусственно подмешивается шум, иначе агент не пробует ничего нового. Авторы перебрали много вариантов, и самый простой оказался достаточным.
- Мягкая замена целевой сети. Целевая сеть обновляется не скачком, а плавным смешиванием с обучаемой. Резкое обновление раскачивает обучение, плавное — стабилизирует.
Стандартной средой для проверки таких алгоритмов стал StarCraft II: группы юнитов под управлением обученных агентов вырабатывают тактики, которых никто не закладывал, — например, сосредоточенный огонь по одной цели.
Связано с
- MARL — место схемы в истории области
- MARL Challenges — какие именно проблемы она закрывает, а какие нет
- Backpropagation — механика, по которой ошибка критика доходит до актора
Открытые вопросы
- где предел масштабируемости централизованного критика по числу агентов
- насколько результаты на StarCraft II переносятся на среды с непрерывным действием