Проклятие размерности
В одноагентной постановке размер таблицы определяется числом состояний и действий. Как только в расчёт идут совместные действия, размер становится произведением.
Пример: семь агентов, шесть действий у каждого. Если считать их независимо, хранить нужно 42 значения. С учётом совместных действий пространство раздувается до более чем 270 000 комбинаций. Дальше рост экспоненциальный, и вычислительная сложность останавливает эксперимент раньше, чем алгоритм успевает сойтись.
Для сравнения масштабов, которые в этой области считаются нормальными: около 10⁴³ уникальных позиций в шахматах и порядка 10¹⁶⁸ в го. Оговорка обязательна: это пространства состояний, а расчёт выше — пространство совместных действий, и величины разной природы стоят рядом только как ориентир порядка. Именно поэтому переход к нейросетевым аппроксимациям был не улучшением, а условием выживания области.
Нестационарность среды
Самая коварная из трёх, потому что нарушает базовое допущение.
Классические доказательства сходимости в RL опираются на то, что среда неподвижна: агент пробует действия, и реакция среды зависит только от них. В мультиагентной постановке остальные агенты — тоже часть среды, и они учатся одновременно. Пока один подстраивается под поведение второго, второй меняет своё поведение под первого.
Следствие: гарантий сходимости нет. Формально доказать, что оптимальная стратегия будет найдена, нельзя — в лучшем случае строятся аппроксимации и эмпирически подтверждается стабильность обучения. Отсюда честная формулировка: инновации в этой области направлены не на доказательство оптимальности, а на улучшение стабильности обучения.
Проблема назначения вклада
Credit assignment problem: команда победила — но кто именно это сделал?
В одноагентном случае задача уже нетривиальна из-за отложенной и разреженной награды: агент совершает сотни действий, а сигнал получает один раз в конце, и непонятно, какое из действий было решающим. В мультиагентном случае к временнóму измерению добавляется пространственное — надо распределить общую награду ещё и между участниками.
Практическая цена этой проблемы: без её решения агенты учатся паразитировать. Если вклад не различается, выгоднее ничего не делать и получать долю от общего результата.
Часть алгоритмов строится прямо вокруг этой задачи: VDN раскладывает общую ценность на слагаемые по агентам, QMIX делает то же нелинейно с ограничением монотонности, COMA оценивает контрфактический вклад — что было бы, поступи агент иначе.
Почему это важно за пределами академии
Три вызова объясняют, почему в MARL нельзя просто «взять больше вычислений». Размерность растёт быстрее любого бюджета, нестационарность делает результат невоспроизводимым от запуска к запуску, а без решения задачи вклада система обучается не тому. Схема CTDE — прямой ответ на второй и третий пункты, а Swarm Intelligence обходит первый, отказываясь от индивидуальных стратегий.
Где проходит граница по числу агентов
Сверка 2026-08: единой границы нет, потому что она разная у разных семейств методов — и это полезнее, чем одно число.
Методы, работающие с совместным пространством (централизованный критик), упираются в экспоненциальный рост уже на десятках-сотнях агентов (CTDE). Методы среднего поля снимают зависимость от числа агентов принципиально: все прочие абстрагируются в одного «усреднённого», сложность перестаёт зависеть от их количества, и сотни и тысячи становятся решаемыми.
Но платой оказывается ровно то, ради чего мультиагентность и затевалась. Среднее поле предполагает однородность и равное бесконечно малое влияние каждого — то есть агенты неразличимы. Соседские варианты сохраняют локальность, но теряют глобальную картину и плохо моделируют координацию уровня системы; одномасштабные представления не улавливают многоуровневых взаимодействий.
Практический вывод: граница не в числе агентов, а в их разнородности. Тысяча одинаковых агентов обучаема, полсотни разных со сложной структурой взаимодействий — уже нет, и здесь начинается территория многомасштабных и attention-подходов. Проверять поэтому надо не «сколько у нас агентов», а «насколько они взаимозаменяемы».
Паразитирование или малый вклад
Различить их «на глаз» по итоговой награде нельзя — в этом и суть проблемы: при общей награде слабый агент получает высокую оценку за счёт действий остальных, и возникает ложный сигнал, закрепляющий бездействие.
Рабочий приём один и он контрфактический: сравнить исход с тем, что произошло бы, замени действие агента на действие по умолчанию. Если результат не изменился — вклад действительно мал. Если изменился — агент работал, просто его роль не видна в суммарной награде. Так устроен COMA с его контрфактическим базисом, и он прямо адресует проблему ленивого агента.
Ограничение у приёма существенное: контрфактический базис не учитывает корреляции между агентами. Двое, полезные только вместе, по отдельности покажут нулевой вклад — и оба будут признаны паразитами. Это лечится оценкой по коалициям (значение Шепли учитывает вклад любых сочетаний без априорных предположений), но её сложность растёт факториально по числу агентов, поэтому в чистом виде она применима на малых командах, а дальше требует приближений.
Практическая формулировка для инженера: паразитирование — это нулевой контрфактический вклад при ненулевой награде, и различать надо именно так, а не по активности агента, которая может быть высокой и бесполезной.
Связано с
- MARL — общая картина области и её эпохи
- CTDE — архитектурный ответ на нестационарность и назначение вклада
- Swarm Intelligence — обход проклятия размерности через однородность агентов