status/volatile Прогнозы (доля автономных решений к 2028 году), оценки состояния области и списки «самых успешных» схем устаревают. Ревизия раз в квартал.
Суть
Классическое обучение с подкреплением ставит одного агента в среду: он действует, получает награду, подстраивает стратегию. MARL добавляет к этому других обучающихся агентов — и ломает почти все удобные свойства постановки, потому что среда перестаёт быть неподвижной мишенью.
Взамен появляется то, ради чего этим занимаются: эмерджентность. Поведение, которого никто не программировал, возникает из взаимодействия простых единиц. Метафора, с которой начинается разбор, — одноклеточный слизевик Dictyostelium discoideum: пока есть еда, он живёт как амёба, а когда еда кончается, сотня тысяч амёб собирается в единый многоклеточный организм, мигрирует и даёт споры.
Чем это отличается от «мультиагентности» в LLM-инженерии
Различие принципиальное, и путать их вредно:
| MARL (эта заметка) | MAS на LLM (Multi Agent Systems) | |
|---|---|---|
| Как агент получает поведение | Обучается на награде, миллионы эпизодов | Задаётся промптом, обучения нет |
| Что оптимизируется | Стратегия (policy) под функцию награды | Ничего; качество достигается инженерией |
| Роль взаимодействия | Источник эмерджентности и главная сложность | Способ разделить работу |
| Метрика успеха | Средняя награда, сходимость | Качество ответа, стоимость, латентность |
Практический вывод: приёмы из MARL не переносятся в сборку LLM-агентов напрямую, а понятия вроде «нестационарности среды» в инженерном контексте звучат похоже, но означают другое.
Эпохи развития
Материал выстроен как историческая арка, и это удобный каркас для навигации по области.
- Табличное обучение. Независимое Q-обучение: каждый агент ведёт свою таблицу «состояние — действие» и считает остальных частью среды. Друг о друге агенты не знают.
- Теория игр. Матрицы наград начинают явно учитывать взаимозависимость действий. Пик эпохи — алгоритмы с равновесием Нэша, дающие теоретические гарантии для небольших задач.
- Глубокое обучение (Deep MARL). Переход от формул к архитектурам: сети обрабатывают огромные пространства состояний, где состоянием считается уже не координата, а целое изображение экрана. Отсюда VDN, QMIX, MADDPG, COMA.
- Эволюционное обучение. Генетические алгоритмы подбирают веса сетей без градиента — фитнес-функция, мутации, скрещивание.
- Роевое обучение. Биоинспирированные алгоритмы для однородных агентов, см. Swarm Intelligence.
Математическая рамка
Фундамент — марковский процесс принятия решений, кортеж из множества состояний, множества действий, функции переходов и функции наград. Для мультиагентного случая берут расширения: частично наблюдаемые процессы (POMDP) и их децентрализованный вариант, где каждый агент видит лишь фрагмент общей картины.
Ключевая оговорка: в одноагентном случае из этой рамки строго выводится существование оптимальной стратегии. В мультиагентном логический вывод не срабатывает, нужны аппроксимации — подробнее в MARL Challenges.
Зачем это изучать инженеру
Прямой пользы для сборки LLM-агентов мало, но два повода есть.
Первый — словарь и интуиция. Проблема отложенной награды, назначение вклада, исследование против эксплуатации — эти вопросы возникают и в агентных системах, просто там их решают эвристиками и не называют по имени.
Второй — эмпирические наблюдения, которых нет в инженерных источниках. Классический пример — игра в прятки от OpenAI (сентябрь 2019, ICLR 2020): шесть фаз эмерджентной стратегии, где агенты находят дыры в физике мира — катаются на коробках, не касаясь земли, и сбегают за пределы среды под их прикрытием. Показательно, что построена она на централизованной omniscient value function, то есть на CTDE.
Про «агрессию при дефиците ресурсов» — правило расщепляется надвое В источнике звучит закономерность: чем меньше у агента ресурсов и чем меньше его нейросеть, тем агрессивнее он ведёт себя в конкурентной среде. Проверка развела эти две половины.
Дефицит ресурсов → агрессия: подтверждено независимо (DeepMind, AAMAS 2017, метрика beam-use rate в среде Gathering).
Меньше сеть → агрессивнее: не подтверждено, знак обратный. В том же каноническом эксперименте агрессивнее оказывается агент с большей сетью, а в другой игре из той же работы знак и вовсе переворачивается. Определяет исход не размер сети сам по себе, а то, какое поведение сложнее выучить: более ёмкая сеть быстрее осваивает сложную стратегию, и если сложной оказывается агрессия — она и проявляется.
Где знак «ёмкость ↔ агрессия» переворачивается
Сверка 2026-08 закрывает вопрос из предупреждения выше, и ответ лежит в той же канонической работе. Обе среды разбирались в одном исследовании, и результаты в них противоположны:
- Gathering — конкуренция за общий ресурс. Рост ёмкости сети даёт больше агрессии: более сложная стратегия находит более эффективный способ вытеснить соперника.
- Wolfpack — охота, требующая тесной координации для успеха. Рост той же ёмкости даёт больше кооперации, и авторы прямо отмечают это как противоположность результату в Gathering.
Отсюда общий принцип, который переносится за пределы этих двух игр: ёмкость не склоняет к агрессии или кооперации — она усиливает то, что вознаграждает среда. Если структура выплат поощряет дефекцию, более мощная сеть найдёт лучшую дефекцию; если успех недостижим без совместных действий, она найдёт лучшую координацию.
Для инженера отсюда следует практическое: спорить о том, «сделает ли более сильная модель агента агрессивнее», бессмысленно в отрыве от того, что засчитывается за успех. Проектировать надо структуру вознаграждения, а не размер сети.
Переносится ли CoLLM за пределы дообучения
CoLLM-CC и CoLLM-DC (январь 2026, ICML 2026) различаются тем, где живёт критик: централизованный против децентрализованных. Метод по своей природе обучающий — это actor-critic, оптимизирующий политики самих моделей, — поэтому «применить его без обучения весов» нельзя: без градиента не остаётся ни актора, ни критика.
А вот его центральный результат переносится как эвристика проектирования, и он полезен: на коротких задачах с плотным вознаграждением децентрализованные критики работают наравне с централизованным, но на длинных горизонтах и разреженном сигнале децентрализованный вариант плохо сходится, а методы Монте-Карло требуют существенно больше выборок.
Прямая аналогия в оркестрации LLM-агентов без обучения: если сигнал успеха приходит в конце длинной цепочки, оценка по отдельным шагам («каждый агент оценивает свой вклад») работает плохо — нужна оценка целого результата с последующим разнесением по шагам. Это ровно то, что в инженерной практике делают внешним верификатором цепочки, а не самооценкой звеньев (Generator Evaluator, Multi Agent Patterns).
Отдельно стоит отметить и результат сравнения: обученная мультиагентная связка достигала качества не хуже одной более крупной модели на задачах письма, кода и игр — то есть аргумент в пользу команды из малых моделей появился не только экономический.
Связано с
- MARL Challenges — почему классические гарантии здесь не работают
- CTDE — самая распространённая на сегодня архитектурная схема обучения
- Swarm Intelligence — ветка для систем из тысяч однородных агентов
- Multi Agent Systems — инженерная мультиагентность на LLM: сходство только в названии