MARL

Мультиагентное обучение с подкреплением — раздел RL, где в одной среде учатся несколько агентов одновременно. Академическая дисциплина со своей математикой и нерешёнными проблемами, а не инженерная практика сборки агентов на LLM: общее у них только слово «мультиагентный».

status/volatile Прогнозы (доля автономных решений к 2028 году), оценки состояния области и списки «самых успешных» схем устаревают. Ревизия раз в квартал.

Суть

Классическое обучение с подкреплением ставит одного агента в среду: он действует, получает награду, подстраивает стратегию. MARL добавляет к этому других обучающихся агентов — и ломает почти все удобные свойства постановки, потому что среда перестаёт быть неподвижной мишенью.

Взамен появляется то, ради чего этим занимаются: эмерджентность. Поведение, которого никто не программировал, возникает из взаимодействия простых единиц. Метафора, с которой начинается разбор, — одноклеточный слизевик Dictyostelium discoideum: пока есть еда, он живёт как амёба, а когда еда кончается, сотня тысяч амёб собирается в единый многоклеточный организм, мигрирует и даёт споры.

Чем это отличается от «мультиагентности» в LLM-инженерии

Различие принципиальное, и путать их вредно:

MARL (эта заметка) MAS на LLM (Multi Agent Systems)
Как агент получает поведение Обучается на награде, миллионы эпизодов Задаётся промптом, обучения нет
Что оптимизируется Стратегия (policy) под функцию награды Ничего; качество достигается инженерией
Роль взаимодействия Источник эмерджентности и главная сложность Способ разделить работу
Метрика успеха Средняя награда, сходимость Качество ответа, стоимость, латентность

Практический вывод: приёмы из MARL не переносятся в сборку LLM-агентов напрямую, а понятия вроде «нестационарности среды» в инженерном контексте звучат похоже, но означают другое.

Эпохи развития

Материал выстроен как историческая арка, и это удобный каркас для навигации по области.

  • Табличное обучение. Независимое Q-обучение: каждый агент ведёт свою таблицу «состояние — действие» и считает остальных частью среды. Друг о друге агенты не знают.
  • Теория игр. Матрицы наград начинают явно учитывать взаимозависимость действий. Пик эпохи — алгоритмы с равновесием Нэша, дающие теоретические гарантии для небольших задач.
  • Глубокое обучение (Deep MARL). Переход от формул к архитектурам: сети обрабатывают огромные пространства состояний, где состоянием считается уже не координата, а целое изображение экрана. Отсюда VDN, QMIX, MADDPG, COMA.
  • Эволюционное обучение. Генетические алгоритмы подбирают веса сетей без градиента — фитнес-функция, мутации, скрещивание.
  • Роевое обучение. Биоинспирированные алгоритмы для однородных агентов, см. Swarm Intelligence.

Математическая рамка

Фундамент — марковский процесс принятия решений, кортеж из множества состояний, множества действий, функции переходов и функции наград. Для мультиагентного случая берут расширения: частично наблюдаемые процессы (POMDP) и их децентрализованный вариант, где каждый агент видит лишь фрагмент общей картины.

Ключевая оговорка: в одноагентном случае из этой рамки строго выводится существование оптимальной стратегии. В мультиагентном логический вывод не срабатывает, нужны аппроксимации — подробнее в MARL Challenges.

Зачем это изучать инженеру

Прямой пользы для сборки LLM-агентов мало, но два повода есть.

Первый — словарь и интуиция. Проблема отложенной награды, назначение вклада, исследование против эксплуатации — эти вопросы возникают и в агентных системах, просто там их решают эвристиками и не называют по имени.

Второй — эмпирические наблюдения, которых нет в инженерных источниках. Классический пример — игра в прятки от OpenAI (сентябрь 2019, ICLR 2020): шесть фаз эмерджентной стратегии, где агенты находят дыры в физике мира — катаются на коробках, не касаясь земли, и сбегают за пределы среды под их прикрытием. Показательно, что построена она на централизованной omniscient value function, то есть на CTDE.

Про «агрессию при дефиците ресурсов» — правило расщепляется надвое В источнике звучит закономерность: чем меньше у агента ресурсов и чем меньше его нейросеть, тем агрессивнее он ведёт себя в конкурентной среде. Проверка развела эти две половины.

Дефицит ресурсов → агрессия: подтверждено независимо (DeepMind, AAMAS 2017, метрика beam-use rate в среде Gathering).

Меньше сеть → агрессивнее: не подтверждено, знак обратный. В том же каноническом эксперименте агрессивнее оказывается агент с большей сетью, а в другой игре из той же работы знак и вовсе переворачивается. Определяет исход не размер сети сам по себе, а то, какое поведение сложнее выучить: более ёмкая сеть быстрее осваивает сложную стратегию, и если сложной оказывается агрессия — она и проявляется.

Где знак «ёмкость ↔ агрессия» переворачивается

Сверка 2026-08 закрывает вопрос из предупреждения выше, и ответ лежит в той же канонической работе. Обе среды разбирались в одном исследовании, и результаты в них противоположны:

  • Gathering — конкуренция за общий ресурс. Рост ёмкости сети даёт больше агрессии: более сложная стратегия находит более эффективный способ вытеснить соперника.
  • Wolfpack — охота, требующая тесной координации для успеха. Рост той же ёмкости даёт больше кооперации, и авторы прямо отмечают это как противоположность результату в Gathering.

Отсюда общий принцип, который переносится за пределы этих двух игр: ёмкость не склоняет к агрессии или кооперации — она усиливает то, что вознаграждает среда. Если структура выплат поощряет дефекцию, более мощная сеть найдёт лучшую дефекцию; если успех недостижим без совместных действий, она найдёт лучшую координацию.

Для инженера отсюда следует практическое: спорить о том, «сделает ли более сильная модель агента агрессивнее», бессмысленно в отрыве от того, что засчитывается за успех. Проектировать надо структуру вознаграждения, а не размер сети.

Переносится ли CoLLM за пределы дообучения

CoLLM-CC и CoLLM-DC (январь 2026, ICML 2026) различаются тем, где живёт критик: централизованный против децентрализованных. Метод по своей природе обучающий — это actor-critic, оптимизирующий политики самих моделей, — поэтому «применить его без обучения весов» нельзя: без градиента не остаётся ни актора, ни критика.

А вот его центральный результат переносится как эвристика проектирования, и он полезен: на коротких задачах с плотным вознаграждением децентрализованные критики работают наравне с централизованным, но на длинных горизонтах и разреженном сигнале децентрализованный вариант плохо сходится, а методы Монте-Карло требуют существенно больше выборок.

Прямая аналогия в оркестрации LLM-агентов без обучения: если сигнал успеха приходит в конце длинной цепочки, оценка по отдельным шагам («каждый агент оценивает свой вклад») работает плохо — нужна оценка целого результата с последующим разнесением по шагам. Это ровно то, что в инженерной практике делают внешним верификатором цепочки, а не самооценкой звеньев (Generator Evaluator, Multi Agent Patterns).

Отдельно стоит отметить и результат сравнения: обученная мультиагентная связка достигала качества не хуже одной более крупной модели на задачах письма, кода и игр — то есть аргумент в пользу команды из малых моделей появился не только экономический.

Связано с

  • MARL Challenges — почему классические гарантии здесь не работают
  • CTDE — самая распространённая на сегодня архитектурная схема обучения
  • Swarm Intelligence — ветка для систем из тысяч однородных агентов
  • Multi Agent Systems — инженерная мультиагентность на LLM: сходство только в названии