«Распространённая», а не «успешная» В исходном изложении схема названа самой успешной. Обзор 2024 года формулирует осторожнее — «the most common», то есть самая частая, а не доказанно лучшая. Есть и документированная критика её базового допущения о независимости стратегий агентов.
Суть
Схема разводит во времени две несовместимые потребности.
Во время обучения нужна полная информация: чтобы оценить, был ли ход агента хорош, полезно знать, что делали остальные. Поэтому обучающая часть (критик) получает на вход совместные наблюдения и совместные действия всех участников.
Во время исполнения полной информации нет и не будет: агент действует в реальном времени, видит только свой кусок мира и не может дожидаться сводки от соседей. Поэтому исполняющая часть (актор) обучена работать от локального наблюдения.
Ключ в том, что централизованный критик нужен только на этапе обучения и после него выбрасывается. Асимметрия «знали больше, чем понадобится» — это не жульничество, а способ дать градиенту осмысленный сигнал.
Чем это отвечает на вызовы MARL
Схема закрывает два из трёх пунктов MARL Challenges:
- Нестационарность. Для централизованного критика среда стационарна, потому что он видит действия всех агентов и не воспринимает их как случайный шум. Обучение стабилизируется.
- Назначение вклада. Критик, знающий совместное действие, способен различить, чей ход изменил исход.
Проклятие размерности схема не решает: вход централизованного критика растёт вместе с числом агентов.
MADDPG как канонический пример
MADDPG (Multi-Agent Deep Deterministic Policy Gradient) — расширение одноагентного DDPG на мультиагентный случай, самая известная реализация схемы.
Устройство по шагам: в буфер воспроизведения складывается кортеж из совместных состояний, совместных действий, наград и следующих состояний. Из него обучаются две сети — актор (что делать) и критик (насколько это хорошо). Ошибка критика даёт градиент, по которому корректируется актор.
Две детали реализации, которые стоит выделить отдельно:
- Шум для исследования. В детерминированную стратегию искусственно подмешивается шум, иначе агент не пробует ничего нового. Авторы перебрали много вариантов, и самый простой оказался достаточным.
- Мягкая замена целевой сети. Целевая сеть обновляется не скачком, а плавным смешиванием с обучаемой. Резкое обновление раскачивает обучение, плавное — стабилизирует.
Стандартной средой для проверки таких алгоритмов стал StarCraft II: группы юнитов под управлением обученных агентов вырабатывают тактики, которых никто не закладывал, — например, сосредоточенный огонь по одной цели.
Предел централизованного критика
Сверка 2026-08. Числа как такового нет — предел задаётся механизмом, и он жёсткий: объём совместного пространства действий и наблюдений растёт экспоненциально с числом агентов, поэтому аппроксимировать централизованного критика сетью становится нечем. В литературе как пример непреодолимого масштаба приводится сценарий с сотнями агентов (Gather, 495 агентов) — там обучение с использованием совместной информации невозможно в принципе.
Обходы существуют, но каждый чем-то платит:
- Внимание в критике (MAAC, G2Anet) снимает избыточность информации и отодвигает границу, но по-прежнему требует данных от всех агентов — то есть переносит потолок, а не убирает его.
- Усечение до локальной окрестности (подходы вида SNA) опирается на затухание взаимодействий в физических сетях: критик видит только соседей, а качество гарантируется с ограниченной ошибкой. Работает там, где взаимодействие действительно локально, и ломается, если влияние глобальное.
- Mean field абстрагирует всех прочих в одного «усреднённого» агента, делая сложность не зависящей от их числа, — это и есть путь к тысячам агентов (Swarm Intelligence, MARL Challenges). Цена — предположение об однородности и потеря индивидуального разнесения вклада.
Практический ориентир: десятки агентов — территория обычного централизованного критика, сотни требуют внимания или усечения, тысячи — только mean field и только при однородности.
Переносятся ли результаты со StarCraft II
Плохо, и по структурной причине: SMAC — среда с дискретными действиями, а непрерывный аналог (MAMuJoCo, где робот разбирается на агентов, управляющих подмножествами суставов) требует другого семейства алгоритмов. Методы разложения ценности вроде QMIX построены под дискретный выбор; в непрерывных задачах сравниваются уже MADDPG и родственные подходы, а перенос факторизации в непрерывный случай потребовал отдельной работы (FACMAC).
Отсюда прямое следствие: место алгоритма в таблице SMAC не предсказывает его место в MAMuJoCo. Известен и обратный пример по устойчивости: MAPPO наиболее стабильно хорош по широкому набору сред, тогда как QMIX выигрывает именно на SMAC и экономнее по выборке — то есть лидерство зависит от среды сильнее, чем от алгоритма.
Отдельная оговорка про сам бенчмарк: у SMAC нашлись ограничения, ради устранения которых выпущена улучшенная версия SMACv2, — так что и внутри дискретных сред старые результаты стоит читать с поправкой на версию.
Связано с
- MARL — место схемы в истории области
- MARL Challenges — какие именно проблемы она закрывает, а какие нет
- Backpropagation — механика, по которой ошибка критика доходит до актора