Слово «мультиагентный» в академической литературе и в инженерной практике означает разные вещи.
Дальше разберём устройство той области, где агенты обучаются, а не инструктируются. Почему пространство их совместных действий взрывается, откуда берётся поведение команды, которого никто не программировал, и на каком уровне приёмы оттуда переносятся в системы на языковых моделях.
Дневник курса, урок 12. Пост стоит особняком: в остальных агентов инструктируют промптом, здесь они обучаются на функции награды, и прямого переноса между двумя мирами почти нет. Соседи по слову «мультиагентный», с которыми полезно сверяться: когда команда агентов окупается (урок 8) — инженерная постановка того же вопроса про координацию; паттерны команды в проде (урок 11) — что там считают режимом отказа и почему в этой области то же самое считают результатом. Пост читается отдельно: все термины вводятся заново, знание соседних не требуется.
Содержание
- Одно слово, две дисциплины
- Эмерджентность: ради чего область вообще существует
- Пространство совместных действий взрывается на седьмом агенте
- Среда, которая учится вместе с вами
- Кто именно сделал результат
- Обучать со знанием всего, исполнять вслепую
- Обход размерности: рой, эволюция и путаница в названиях
- Как читать эксперименты в этой области
- Где кончается перенос в агентов на языковых моделях
- Итог
- FAQ
- Источники
1. Одно слово, две дисциплины
Разработчик, собравший команду агентов на промптах, рано или поздно открывает статью со словом «мультиагентный» в заголовке и обнаруживает там функции награды, кривые обучения и ни одного промпта. Общего у двух областей примерно столько же, сколько у слова «транзакция» в базе данных и в банке. Термин один, предметы разные.
Прямой пользы от мультиагентного обучения с подкреплением (MARL, multi-agent reinforcement learning — раздел обучения с подкреплением, где в одной среде учатся сразу несколько агентов и каждый подстраивает поведение под остальных) разработчику, который собирает агентов на языковых моделях, немного. Честнее сказать это в первом абзаце, чем изображать применимость. Расходятся две области уже на вопросе о том, откуда берётся осмысленное поведение.
| Академическая рамка (MARL) | Инженерная рамка (агенты на LLM) | |
|---|---|---|
| Откуда роли | Возникают из обучения | Назначены человеком в промпте |
| Что настраиваем | Функцию награды и среду | Инструкции, топологию, лимиты |
| Критерий успеха | Средняя награда растёт, обучение стабильно | Ответ получен, бюджет не превышен |
| Сюрпризы | Считаются результатом | Считаются багом |
Последняя строка самая содержательная, и разница в ней не стилистическая. Представьте, что два агента вашей команды нашли обходной путь. Вместо того чтобы отвечать пользователю, они начали перекидывать задачу друг другу и в какой-то момент сошлись на ответе, которого никто не закладывал. В мультиагентной системе на промптах это инцидент. Находите вы его по расходу токенов, чините ограничением на число ходов и в постмортеме пишете, что топология допускала цикл. Ровно тот же сюжет в MARL идёт в аннотацию статьи. Там неожиданная стратегия не дефект реализации, а то, ради чего эксперимент ставился: если бы поведение можно было выписать заранее, обучать было бы нечего.
Забираем мы отсюда словарь и интуицию; приёмы не переносятся. Отложенная награда — это когда результат виден в конце сессии, а не на каждом шаге, и непонятно, какой из шагов его обеспечил. Назначение вклада всплывает, если из пяти участников ответ испортил кто-то один, а искать виноватого приходится по общему исходу. Исследование против использования уже найденного — это выбор между незнакомым инструментом и тем, что стабильно срабатывал. Нестационарность заметна, когда соседняя команда поменяла промпт своего агента, и ваша настройка, подогнанная под прежнее поведение, устарела молча, а узнаете вы об этом, когда что-нибудь сломается. Все четыре вопроса живут и в агентных системах, просто мы решаем их эвристиками и не называем по имени.
2. Эмерджентность: ради чего область вообще существует
Если поведение агента можно записать правилами, обучение с подкреплением избыточно, потому что правила дешевле и отлаживаются. Область существует ради противоположного случая, когда работающая стратегия лежит в пространстве, которого автор не представлял, и найти её может только поиск, а не проектирование. Такое поведение целого, которое не сводится к сумме поведений частей и которого никто не программировал, называют эмерджентностью.
Первый образ биологический. Одноклеточный слизевик Dictyostelium discoideum живёт как амёба, пока есть еда, а когда еда кончается, сто тысяч амёб собираются в единый многоклеточный организм, мигрируют и дают споры. Ни в одной амёбе этой программы нет. Нет и координатора, который объявил бы сбор: правила локальные, конструкция общая.
Второй образ измерим, и он интереснее, потому что показывает, чем коллективное решение отличается от суммы индивидуальных. В сравнительном эксперименте Института Вейцмана (PNAS, декабрь 2024) муравьям и людям давали одну и ту же головоломку — протащить Т-образный груз через узкие проходы и повороты. Задача чисто геометрическая и потому масштабируется без переделки от одиночки до большой группы и от муравья до человека, а условия остаются сравнимыми.
Один человек обыгрывает одного муравья, и это объяснимо: пространственное мышление, планирование маршрута, прямые траектории. В группах порядок переворачивается. Муравьи хорошо масштабируют простую стратегию, потому что коллективное движение даёт им эмерджентную когнитивность и краткосрочную память, которых у отдельного муравья нет. Люди индивидуальное преимущество в коллективное действие не переносят. Когда общение ограничено, группа скатывается к самым очевидным манёврам ради консенсуса, и результат падает. Сильные участники в сумме дают команду слабее, чем слабые участники с правильной механикой согласования.
MARL и занимается тем, чтобы получить такой эффект на обучаемых агентах, то есть задать среду и награду так, чтобы стратегия команды выросла из обучения. Цена известна заранее. Почти все удобные свойства одноагентной постановки при этом ломаются, причём разом.
3. Пространство совместных действий взрывается на седьмом агенте
Фраза «добавим ещё одного агента» звучит как линейная правка, а обходится нелинейно. Посчитаем: семь агентов, у каждого шесть действий. Если учить их независимо, каждый ведёт собственную таблицу «состояние — действие», и на одно состояние приходится 42 значения. Если учитывать совместные действия, то есть все комбинации того, кто что делает одновременно, получается уже 6⁷, или 279 936 значений на то же одно состояние.
одно состояние среды · 7 агентов · 6 действий у каждого
независимо 7 × 6 = 42 значения
совместно 6 × 6 × … × 6 = 279 936 значений
└── 7 раз ──┘
отношение ≈ 6 665×
полный размер таблицы = |S| × 6⁷ — множитель по состояниям остаётсяОговорка обязательна. Оба числа считаны на одно состояние, полная таблица — это |S| × 6⁷, и множитель по состояниям тот же, что в одноагентном случае. Проклятие размерности бьёт здесь по мультиагентной оси, причём уже при семи агентах и шести действиях, то есть на крошечной задаче.
Зачем вообще платить за совместный учёт, если независимый дешевле на три с лишним порядка? Затем, что координация в независимую таблицу не помещается. Возьмём двух агентов у узкого прохода. Пройдут оба, если один пропустит другого, и застрянут, если шагнут одновременно. Независимая таблица знает только «состояние → моё действие» и обе ситуации видит одинаково. Различить «идти, когда сосед стоит» и «идти, когда сосед тоже идёт» она физически не может, потому что действия соседа в ней нет. Чтобы различие появилось, в таблицу приходится класть комбинацию действий целиком. Отсюда и 6⁷, плата за возможность выучить хоть какую-то согласованность.
Рядом обычно ставят другие порядки — около 10⁴³ уникальных позиций в шахматах и порядка 10¹⁶⁸ в го. Величины эти разной природы, потому что там пространства состояний, а здесь пространство совместных действий, и соседствуют они только как ориентир масштаба. Отсюда грубая практическая прикидка. Эксперименты по глубокому MARL ставят на единицах агентов, а не на десятках, а для систем принципиально большего размера завели отдельный термин Many-Agent Reinforcement Learning. Переход к нейросетевым аппроксимациям здесь был не улучшением, а условием выживания области. Таблицу на 279 936 значений ещё можно хранить, а вот заполнить её данными нельзя, потому что каждая клетка требует своих визитов.
4. Среда, которая учится вместе с вами
Кривая награды растёт, потом без видимой причины проваливается, потом растёт снова; повторный запуск даёт другую картинку. В одноагентной задаче это повод искать баг, а здесь штатное поведение, и объясняется оно тем, что среда под агентом не стоит на месте.
Классические доказательства сходимости в обучении с подкреплением опираются на неподвижность среды. Вероятности переходов и распределение награды фиксированы, реакция зависит только от действий агента, и на этом допущении держится вся конструкция. Обновление ценности при неподвижной среде оказывается сжатием: любые две оценки после очередного шага становятся ближе друг к другу, чем были, и расстояние между ними стягивается независимо от того, с чего начинали. У такого преобразования есть ровно одна неподвижная точка, набор оценок, который обновление уже не меняет. Её и объявляют правильным ответом, а итерации к ней гарантированно приходят.
В мультиагентной постановке остальные агенты тоже часть среды, и они учатся одновременно. Пока один подстраивается под поведение второго, второй меняет своё поведение под первого. Это и называют нестационарностью. Знакомо всем, кто оптимизировал клиент под API, которую в это же время переписывает соседняя команда.
Ломается при этом не обучение. Агенты эмпирически улучшаются, награда в среднем растёт, полезные стратегии находятся, эта часть на месте. Ломается доказательство. Неподвижная точка, к которой должен сойтись процесс, определена относительно среды, а среда меняется, пока к ней идут, и вместе с ней меняется то, что считать оптимальным. Утверждение «алгоритм найдёт оптимальную стратегию» теряет доказательство, а заодно и смысл. Оптимальную относительно чего, если поведение соседей завтра будет другим?
Отсюда два следствия, оба практические. Первое — осторожные формулировки результатов. Инновации направлены не на доказательство оптимальности, а на улучшение стабильности обучения, и это не скромность авторов, а всё, что можно утверждать. Второе касается воспроизводимости. Запуск с теми же гиперпараметрами и другим зерном генератора случайных чисел может уйти в другую точку, потому что расхождение в ранних эпизодах меняет то, подо что подстраиваются все остальные. Сравнивать методы приходится по распределению результатов на многих запусках, а не по лучшей кривой.
5. Кто именно сделал результат
Команда победила, но чей ход был решающим? Так формулируется задача назначения вклада (credit assignment), то есть связывания конкретного действия агента с итоговой наградой. В одноагентном случае она уже нетривиальна из-за отложенной и разреженной награды: сотни действий, один сигнал в конце, и непонятно, какой из ходов его заработал. В мультиагентном к временно́му измерению добавляется пространственное, потому что общую награду надо распределить ещё и между участниками.
Звучит как техническая деталь распределения сигнала, а оборачивается конкретным поведением. Агенты учатся паразитировать. Механика прямая. Награда общая, и в обновление стратегии каждого участника подставляется одно и то же число. Агент, который весь эпизод простоял на месте, получает тот же положительный сигнал, что и агент, вытащивший эпизод, так что его бездействие подкрепляется ровно так же, как чужая работа. Дальше оптимизация делает то, для чего её позвали, и из двух стратегий с одинаковой ожидаемой наградой выбирает ту, что дешевле и безопаснее. Ничего не делать дешевле, ведь ресурс не тратится и риск получить штраф за неудачное действие не растёт. Паразитирование здесь не сбой обучения, а его корректный результат — правильный ответ на неправильно поставленный вопрос.
Вокруг этого выросло целое семейство алгоритмов, и все они отвечают на один вопрос: как нам из общего числа получить индивидуальное. VDN раскладывает общую ценность на сумму слагаемых по агентам. Просто, а потому ограниченно, ведь суммой выражается не всякое взаимодействие. QMIX делает то же нелинейно и требует лишь монотонности: рост индивидуальной ценности не должен снижать общую, и этого хватает, чтобы разложение оставалось согласованным с жадным выбором действия. COMA заходит с другой стороны и считает контрфактический вклад, сравнивая полученную награду с той, что была бы, поступи этот агент иначе при неизменных действиях остальных. Скажем, агент выстрелил и команда выиграла. Заменяем его выстрел на действие по умолчанию, всё прочее оставляем как было, и если исход не меняется, вклад нулевой, сколько бы он ни стрелял. Разные ответы на один вопрос, и ни один не окончательный.
6. Обучать со знанием всего, исполнять вслепую
Обучение и исполнение хотят несовместимого. Чтобы оценить ход агента, надо знать, что в этот момент делали остальные. Сам по себе ход бессмысленен, он хорош или плох только в контексте чужих действий. А в момент исполнения этого контекста нет и не будет, потому что агент действует в реальном времени, видит свой кусок мира и никакого канала до чужих наблюдений не имеет. Схема CTDE (centralized training for decentralized execution — централизованное обучение с децентрализованным исполнением) разводит две потребности во времени: полную картину получает обучение, а исполнение обходится локальным наблюдением.
Участников в ней двое, и они делят между собой работу, которую в одноагентном случае делает один алгоритм. Актор выбирает действие: смотрит на наблюдение и выдаёт ход. Критик оценивает выбранное, то есть говорит, насколько этот ход хорош с точки зрения будущей награды. Актор действует, критик ставит оценку, по оценке правятся веса актора; отсюда и название семейства методов — актор-критик.
ОБУЧЕНИЕ ИСПОЛНЕНИЕ
──────────────────────────── ─────────────────────
критик ← совместные наблюдения критика больше нет
← совместные действия
│ градиент актор_i ← своё наблюдение
▼ → своё действие
актор_1 … актор_n
закрывает нестационарность; назначение вклада
не закрывает размерность: вход критика растёт с числом агентовВся схема держится на том, где именно стоит критик. В выборе действия он не участвует. Актор с самого начала устроен как функция от локального наблюдения, и привилегированные данные в его вход не входят никогда. Критик влияет на актора только через формулу градиента, то есть тратит знание о чужих действиях на форму весов, а не на решение. Как только веса зафиксированы, доступ к совместным наблюдениям нам больше не нужен, примерно как разметка, которая нужна при обучении и не нужна в рантайме. Поэтому критика после обучения выбрасывают без потерь. Асимметрия «знали больше, чем понадобится» здесь не расточительство, а условие того, что градиенту вообще есть откуда взять осмысленный сигнал.
Заодно видно, почему схема закрывает две проблемы из трёх. Для централизованного критика среда снова стационарна. Он видит совместное действие целиком, поэтому его оценка не плывёт от того, что соседи меняют стратегии: изменение чужого поведения для него не шум, а другой вход. Назначение вклада тоже становится решаемым, ведь зная, кто что сделал, можно спрашивать, что изменилось бы при другом ходе конкретного агента. А вот размерность остаётся. Вход критика растёт с числом агентов, и потолок, посчитанный выше, никуда не девается.
Со статусом схемы есть тонкость, которую в пересказах обычно теряют. Вводный обзор 2024 года называет CTDE самой распространённой из трёх парадигм — «the most common», а не самой успешной. Распространённость измерима подсчётом работ, успешность нет, и подмена одного другим превращает наблюдение в рекламу. Базовое допущение о независимости стратегий агентов в литературе тоже критиковали.
Парадигмы, между которыми идёт выбор, различаются тем, где проходит граница знания. Полностью централизованная (CTE) отдаёт общую картину и обучению, и исполнению. В теории удобно, зато требует канала между агентами прямо в момент действия. На другом конце стоит полностью децентрализованная (DTE), где общей картины нет нигде: каждый агент учится и действует по своему наблюдению, и нестационарность достаётся ему целиком. CTDE стоит между ними, и его популярность объясняется скорее этим положением, чем доказанным превосходством. Разложить можно так:
ОБУЧЕНИЕ ВИДИТ ИСПОЛНЕНИЕ ВИДИТ
CTE общую картину общую картину
└ цена: канал между агентами в момент действия
CTDE общую картину своё наблюдение
└ цена: вход критика растёт с числом агентов
DTE своё наблюдение своё наблюдение
└ цена: каждый агент несёт нестационарность самКанонический учебный пример — MADDPG. Препринт вышел в июне 2017, доклад прозвучал на NeurIPS того же года, авторы из OpenAI и Университета Макгилла. Разберём устройство по частям: актор решает, что делать; критик оценивает, насколько это хорошо, глядя на совместные наблюдения и действия; в детерминированную стратегию подмешивается шум, иначе агент никогда не попробует ничего, кроме уже выбранного; целевая сеть обновляется плавным смешиванием вместо скачка, чтобы ориентир, по которому считается ошибка, не прыгал вслед за обучаемой сетью. Рабочим умолчанием MADDPG быть перестал. Сегодняшняя точка отсчёта — MAPPO, показавший на четырёх популярных бенчмарках результаты не хуже методов off-policy (тех, что учатся на ранее собранных чужих траекториях) и без подгонки под среду. Смена при этом произошла внутри парадигмы CTDE, а не вместо неё. Поменялся способ обновлять стратегию, а разделение на всезнающее обучение и слепое исполнение осталось. Схема живёт дольше конкретного метода.
7. Обход размерности: рой, эволюция и путаница в названиях
Из взрыва совместных действий есть два выхода. Либо держать число агентов маленьким, либо отказаться от индивидуальных стратегий. Роевой интеллект идёт вторым путём и не пытается выучить стратегию для каждого агента. Агенты одинаковы, правила у них простые, координация идёт через изменение среды, а сообщениями они не обмениваются вовсе.
Каноническая механика — феромоновый след. Нашедший хороший путь помечает его, другие с большей вероятностью идут по помеченному и усиливают метку, неудачные пути выветриваются. Решение здесь хранится не в голове агента, а в среде, и поэтому размерность не взрывается, ведь совместное действие никто не представляет: каждый читает след и реагирует локально. В нейросетевом варианте это обычный цикл обучения, где в состояние добавлена карта феромонов, а в буфер воспроизведения кладут и награду, и след.
Однородность — и сила, и потолок. Рой хорош на задачах, которые раскладываются на множество одинаковых мелких вкладов, и бесполезен там, где нужны разные роли. Стратегия одна на всех, значит специализации взяться неоткуда. Оптимизировать поведение отдельного агента здесь нельзя в принципе, потому что отдельного агента как объекта настройки просто нет. Есть и практическая деталь, из-за которой рой обманывает ожидания. Размер роя оказывается гиперпараметром обучения, а не характеристикой задачи. Маленький рой не находит решения, слишком большой мешает сам себе, и подбирать это число приходится прогонами, как скорость обучения.
Рядом стоят эволюционные алгоритмы. Веса сетей подбираются мутациями и скрещиванием, без градиента, а популяция и есть множество агентов. Происходящее ближе к ламарковской эволюции, чем к дарвиновской, ведь выученное родителем передаётся потомку напрямую, а не через отбор случайных вариаций.
Нужна и терминологическая чистка, без которой в этой части легко запутаться. GARL (group-agent reinforcement learning), о котором много говорили в 2023 году, к MARL прямого отношения не имеет. У каждого агента там своя среда, а общение сводится к обмену знанием, и ни кооперации, ни конкуренции как результата обучения не возникает. Соседство по созвучию названий, не по предмету. Расхожая оценка «не взлетело» верна наполовину. За четыре года направление ведёт, по сути, одна группа при околонулевом цитировании, зато «значимых результатов нет» неверно: в продолжении 2025 года заявлены 43 игры Atari и ускорение обучения у 96% из 129 агентов. База сравнения тут своя же, тот же агент, только учится он в одиночку и в той же среде. Выигрыш даёт обмен знанием между копиями, а не кооперация в общей задаче. Замер авторский, независимо не повторён. Получается ниша, которая не разрослась, а не пустое место.
8. Как читать эксперименты в этой области
Заголовок «метод показал лучший результат на StarCraft II» стоит читать с поправкой на то, что за названием почти всегда стоит SMAC — набор сценариев микроменеджмента отрядов юнитов, а не игра целиком. Никакого макроменеджмента, экономики и разведки там нет, есть фиксированный состав отрядов и задача провести бой. Набор жив, работы на нём выходят по июль 2026 включительно.
Оригинальные сценарии при этом насыщены, и это признано в самой области. Авторы SMACv2 показали, что алгоритмы достигают на них почти идеального результата, а часть сценариев берётся стратегией, которая вообще не смотрит на состояние среды и зависит только от номера шага. Второе наблюдение убийственнее первого. Если сценарий решается расписанием действий по счётчику, значит он не требует ни реакции на противника, ни согласования между агентами, и измеряет что угодно, кроме заявленного. Ответом стала процедурная генерация сценариев в SMACv2: условия боя разыгрываются заново, и заучить расписание становится нечем.
Сам движок игры из пайплайна тем временем ушёл. Реимплементация SMAX на JAX внутри JaxMARL обходится без StarCraft II и даёт ускорение около 14 раз, а при векторизации нескольких запусков — до 12 500 раз. Мотивировку авторы называют прямо: кризис оценивания в области. Причина понятна из предыдущего абзаца, потому что бенчмарк, на котором все показывают почти сто процентов, перестаёт быть бенчмарком; параллель с рейтингами агентных систем напрашивается. Второй мотив тише, зато важнее для практики. Результат в MARL приходится усреднять по многим запускам, а не смотреть на один, и цена одного эксперимента упирается в число прогонов.
Самая известная демонстрация эмерджентности — игра в прятки от OpenAI (сентябрь 2019, ICLR 2020). Награда задана только за линию видимости, а из одного этого сигнала вырастают шесть фаз стратегии, от постройки укрытий до серфинга на коробках и защиты от него. Показательны две детали, которые в пересказах теряются. Находки вроде катания на коробках без касания земли сами авторы относят к нежелательному поведению, а не к достижению: агенты нашли дыру в физическом движке, и плоская формулировка «в академии сюрприз — это результат» на этом усложняется. Ценным сюрприз считается тогда, когда он про задачу, а не про баг симулятора. Вторая деталь касается фундамента. Построены прятки на централизованной всезнающей функции ценности (omniscient value function — критик видит полное состояние среды без масок по видимости), то есть на той же CTDE. Витрина эмерджентности стоит на вполне конкретной инженерии.
Отдельный сюжет — как расхожие эмпирические закономерности разваливаются при проверке. Правило звучит так: чем меньше у агента ресурсов и чем меньше его нейросеть, тем агрессивнее он себя ведёт. Первая половина подтверждается независимо. В работе DeepMind (AAMAS 2017) в среде Gathering агенты вели себя тем агрессивнее, чем скуднее восстанавливались ресурсы, а агрессию там операционализировали через beam-use rate, частоту, с которой агент бьёт соперника лучом. Определение здесь важнее, чем кажется. Агрессия тут не оценочное суждение наблюдателя, а счётчик, и потому результат вообще поддаётся проверке.
Вторая половина в том же эксперименте опровергается со сменой знака. Агрессивнее оказывается агент с большей сетью, а в другой игре из той же работы знак переворачивается обратно. Объяснение простое и обобщается лучше самого правила: осваивается то поведение, которое сложнее выучить. Целиться лучом по движущемуся сопернику технически труднее, чем мирно собирать яблоки, поэтому большая сеть осваивает агрессию, а маленькая до неё не дотягивается; смените игру, и сложным окажется другое поведение. Универсального правила про размер сети отсюда не выводится, выводится зависимость от того, что в конкретной среде труднее. Сведём проверку в таблицу:
| Половина правила | Где проверяли | Что вышло |
|---|---|---|
| Меньше ресурсов → агрессивнее | Gathering | подтверждается: чем скуднее ресурсы, тем выше beam-use rate |
| Меньше сеть → агрессивнее | Gathering | знак обратный: агрессивнее агент с большей сетью |
| Меньше сеть → агрессивнее | другая игра той же работы | знак снова как в правиле |
9. Где кончается перенос в агентов на языковых моделях
Можно ли взять MADDPG и обучить им команду агентов на API? Короткий ответ — нет, однако мост между областями всё-таки существует и найден недавно. Подходы CoLLM-CC и CoLLM-DC (январь 2026) применяют мультиагентный актор-критик к координации агентов на языковых моделях, причём централизованный критик выигрывает ровно там, где у инженеров болит: на длинном горизонте и разреженной обратной связи. Децентрализованный вариант на таких задачах сходится плохо, тот же эффект, что и в классической постановке, только с языковыми агентами вместо юнитов.
Существенно, на каком уровне это работает. Перенос идёт через дообучение весов, а промпты и оркестрация остаются снаружи. Разработчик, который собирает команду агентов на API и настраивает их инструкциями, в эту категорию не попадает: у него нет ни весов, которые он мог бы обновлять, ни функции награды, ни миллионов эпизодов, чтобы её оптимизировать. Вот здесь и проходит настоящая граница, и проходит она не по сложности метода, а по тому, что вообще можно настраивать.
Почему и обладателям весов перенос обходится недёшево, сформулировано отдельно. Обзор по мультиагентному дообучению называет три свойства инженерных систем, которых нет в классической постановке. Асинхронность взаимодействий: агенты не ходят по очереди на общем такте, а работают когда придётся. У каждого агента есть свой профиль и своя роль, то есть участники разные по назначению, а не взаимозаменяемые единицы. Архитектуры разнородны, под агентами стоят разные модели, и общего пространства параметров у команды нет. Взять MADDPG и обучить им команду агентов на языковых моделях не выйдет по каждому из трёх пунктов, причём каждый ломает своё — первый синхронную схему обновления, второй предположение об однородности, третий саму идею общего градиента.
Стены между областями при этом нет, есть история, и она объясняет, откуда языковые модели вообще взялись в этом сюжете. Свежий обзор прослеживает единую линию. Коммуникацию в MARL сначала задавали вручную, потом стали выучивать под награду. Выученные протоколы получались эффективными, зато узкоспециализированными и плохо интерпретируемыми: работали на той задаче, под которую выросли, и не читались человеком. Отсюда интерес к языковым моделям с их готовым априорным знанием языка. Коммуникацию не надо ни проектировать, ни выучивать с нуля, она уже есть, пусть и с потерей в эффективности. Три способа задать коммуникацию оказались фазами одного сюжета, а не конкурирующими школами.
Итог
- Две мультиагентности расходятся в первом же вопросе: агенты обучаются или инструктируются. Из академической рамки забирают словарь; приёмы от постановки не отделяются.
- 42 значения против 279 936 — цена перехода к совместным действиям на семи агентах с шестью действиями у каждого, причём на одно состояние среды. Отсюда и масштаб экспериментов: единицы агентов, а не десятки.
- Гарантий сходимости нет: среда учится вместе с агентом. Работы в области направлены не на доказательство оптимальности, а на стабильность обучения.
- CTDE — самая распространённая схема, но не доказанно лучшая. MADDPG остался учебным примером, сегодняшняя точка отсчёта — MAPPO, и смена произошла внутри парадигмы.
- Расхожие выводы полезно проверять. «Дефицит ресурсов → агрессия» воспроизводится; «меньше сеть → агрессивнее» в каноническом эксперименте имеет обратный знак.
- Перенос в системы на языковых моделях реален на уровне дообучения весов и не работает на уровне оркестрации промптами.
FAQ
Чем мультиагентное обучение с подкреплением отличается от мультиагентных систем на языковых моделях?
Способом получения поведения. В MARL агент вырабатывает стратегию сам, обучаясь на функции награды миллионы эпизодов, и роли внутри команды возникают эмерджентно. В системе на языковых моделях роли задаются промптом, обучения весов нет, а качество даёт инженерия: контракты, лимиты, топология. Совпадает только слово «мультиагентный», а термины вроде «нестационарности» в двух контекстах означают разное.
Почему в мультиагентном обучении с подкреплением нет гарантий сходимости?
Потому что среда перестаёт быть неподвижной. Классические доказательства сходимости предполагают, что реакция среды зависит только от действий агента, а в мультиагентной постановке остальные агенты входят в среду и учатся одновременно. Пока первый подстраивается под второго, второй меняется под первого. Формально доказать нахождение оптимальной стратегии нельзя, поэтому исследования нацелены на стабильность обучения.
Что такое CTDE и почему критика выбрасывают после обучения?
CTDE (централизованное обучение с децентрализованным исполнением) — схема, где обучающая часть, критик, видит совместные наблюдения и действия всех агентов, а исполняющая часть, актор, работает только от локального наблюдения. Критик существует, чтобы дать градиенту осмысленный сигнал. Зная, что делали все, он различает, чей ход изменил исход. В момент исполнения такой информации нет физически, поэтому критик после обучения не нужен.
Сколько агентов обычно бывает в экспериментах по MARL?
Обычно единицы, а не десятки. Пространство совместных действий растёт экспоненциально по числу агентов, и вычислительная сложность останавливает эксперимент раньше, чем алгоритм успевает сойтись. Для систем принципиально большего размера существует отдельный термин Many-Agent Reinforcement Learning, где отказываются от индивидуальных стратегий в пользу однородности агентов и роевых алгоритмов.
Правда ли, что агент с маленькой нейросетью ведёт себя агрессивнее?
Нет, универсального правила такого вида в литературе нет. В каноническом эксперименте DeepMind 2017 года в среде со сбором ресурсов агрессивнее оказался агент с большей сетью, а в другой игре из той же работы знак эффекта перевернулся. Определяет исход не размер сети, а то, какое поведение в конкретной среде сложнее выучить. При этом связь «дефицит ресурсов → агрессия» в той же работе подтверждается.
Можно ли применить приёмы MARL к оркестрации агентов на языковых моделях?
На уровне промптов и оркестрации — нет, на уровне дообучения весов — да. Подходы CoLLM-CC и CoLLM-DC (январь 2026) переносят мультиагентный актор-критик на координацию языковых агентов, и централизованный критик выигрывает на длинном горизонте и разреженной награде. Мешают переносу три свойства инженерных систем: асинхронность взаимодействий, профиль и роль у агента, разнородность архитектур.
Источники
- Comparing cooperative geometric puzzle solving in ants versus humans — PNAS, декабрь 2024 — головоломка с Т-образным грузом: одиночка-человек сильнее, группа муравьёв — наоборот.
- An Introduction to Centralized Training for Decentralized Execution — arXiv:2409.03052 — таксономия CTE / CTDE / DTE и точная формулировка статуса схемы: «the most common».
- Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments (MADDPG) — arXiv:1706.02275 — канонический пример CTDE: устройство актора и критика, шум для исследования, мягкое обновление целевой сети.
- The Surprising Effectiveness of PPO in Cooperative, Multi-Agent Games (MAPPO) — arXiv:2103.01955 — почему точкой отсчёта стал on-policy метод, обучающийся на собственных свежих траекториях.
- The StarCraft Multi-Agent Challenge — arXiv:1902.04043 · SMACv2 — arXiv:2212.07489 — первоисточник бенчмарка и документированное признание его насыщения.
- JaxMARL — arXiv:2311.10090 — переезд сред на GPU, реимплементация SMAX без движка игры, кризис оценивания.
- Multi-agent Reinforcement Learning in Sequential Social Dilemmas — arXiv:1702.03037 — дефицит ресурсов и агрессия, обратный знак эффекта от ёмкости сети.
- Emergent Tool Use From Multi-Agent Autocurricula — arXiv:1909.07528 — шесть фаз стратегии в игре в прятки и omniscient value function в основе.
- Group-Agent Reinforcement Learning — arXiv:2202.05135 · продолжение 2025 года — arXiv:2501.11818 — определение GARL и результаты на 43 играх Atari.
- Learning Decentralized LLM Collaboration with Multi-Agent Actor Critic — arXiv:2601.21972 — перенос CTDE на координацию языковых агентов и преимущество централизованного критика.
- MARFT: Multi-Agent Reinforcement Fine-Tuning — arXiv:2504.16129 — три причины, по которым классический MARL не переносится напрямую.
- The Five Ws of Multi-Agent Communication — arXiv:2602.11583 — линия MARL → выученные языки → языковые модели как единая история.
Числовые ориентиры в тексте получены на конкретных средах и постановках: расчёт размерности верен для дискретного набора действий и одного состояния, эффекты от дефицита ресурсов и ёмкости сети измерены в двух играх, а ускорение обучения на JAX зависит от степени векторизации запусков.