CTDE

Centralized Training, Decentralized Execution — схема, при которой агенты обучаются, видя общую картину, а действуют, опираясь только на собственные наблюдения. На сегодня самая распространённая архитектурная схема в мультиагентном обучении с подкреплением.

«Распространённая», а не «успешная» В лекции схема названа самой успешной. Обзор 2024 года формулирует осторожнее — «the most common», то есть самая частая, а не доказанно лучшая. Есть и документированная критика её базового допущения о независимости стратегий агентов.

Суть

Схема разводит во времени две несовместимые потребности.

Во время обучения нужна полная информация: чтобы оценить, был ли ход агента хорош, полезно знать, что делали остальные. Поэтому обучающая часть (критик) получает на вход совместные наблюдения и совместные действия всех участников.

Во время исполнения полной информации нет и не будет: агент действует в реальном времени, видит только свой кусок мира и не может дожидаться сводки от соседей. Поэтому исполняющая часть (актор) обучена работать от локального наблюдения.

Ключ в том, что централизованный критик нужен только на этапе обучения и после него выбрасывается. Асимметрия «знали больше, чем понадобится» — это не жульничество, а способ дать градиенту осмысленный сигнал.

Чем это отвечает на вызовы MARL

Схема закрывает два из трёх пунктов MARL Challenges:

  • Нестационарность. Для централизованного критика среда стационарна, потому что он видит действия всех агентов и не воспринимает их как случайный шум. Обучение стабилизируется.
  • Назначение вклада. Критик, знающий совместное действие, способен различить, чей ход изменил исход.

Проклятие размерности схема не решает: вход централизованного критика растёт вместе с числом агентов.

MADDPG как канонический пример

MADDPG (Multi-Agent Deep Deterministic Policy Gradient) — расширение одноагентного DDPG на мультиагентный случай, самая известная реализация схемы.

Устройство по шагам: в буфер воспроизведения складывается кортеж из совместных состояний, совместных действий, наград и следующих состояний. Из него обучаются две сети — актор (что делать) и критик (насколько это хорошо). Ошибка критика даёт градиент, по которому корректируется актор.

Две детали реализации, на которых лектор останавливается отдельно:

  • Шум для исследования. В детерминированную стратегию искусственно подмешивается шум, иначе агент не пробует ничего нового. Авторы перебрали много вариантов, и самый простой оказался достаточным.
  • Мягкая замена целевой сети. Целевая сеть обновляется не скачком, а плавным смешиванием с обучаемой. Резкое обновление раскачивает обучение, плавное — стабилизирует.

Стандартной средой для проверки таких алгоритмов стал StarCraft II: группы юнитов под управлением обученных агентов вырабатывают тактики, которых никто не закладывал, — например, сосредоточенный огонь по одной цели.

Связано с

  • MARL — место схемы в истории области
  • MARL Challenges — какие именно проблемы она закрывает, а какие нет
  • Backpropagation — механика, по которой ошибка критика доходит до актора

Открытые вопросы

  • где предел масштабируемости централизованного критика по числу агентов
  • насколько результаты на StarCraft II переносятся на среды с непрерывным действием