MARL

Мультиагентное обучение с подкреплением — раздел RL, где в одной среде учатся несколько агентов одновременно. Академическая дисциплина со своей математикой и нерешёнными проблемами, а не инженерная практика сборки агентов на LLM: общее у них только слово «мультиагентный».

status/volatile Прогнозы (доля автономных решений к 2028 году), оценки состояния области и списки «самых успешных» схем устаревают. Ревизия раз в квартал.

Суть

Классическое обучение с подкреплением ставит одного агента в среду: он действует, получает награду, подстраивает стратегию. MARL добавляет к этому других обучающихся агентов — и ломает почти все удобные свойства постановки, потому что среда перестаёт быть неподвижной мишенью.

Взамен появляется то, ради чего этим занимаются: эмерджентность. Поведение, которого никто не программировал, возникает из взаимодействия простых единиц. Метафора, с которой начинается лекция, — одноклеточный слизевик Dictyostelium discoideum: пока есть еда, он живёт как амёба, а когда еда кончается, сотня тысяч амёб собирается в единый многоклеточный организм, мигрирует и даёт споры.

Чем это отличается от «мультиагентности» в LLM-инженерии

Различие принципиальное, и путать их вредно:

MARL (эта заметка) MAS на LLM (Multi Agent Systems)
Как агент получает поведение Обучается на награде, миллионы эпизодов Задаётся промптом, обучения нет
Что оптимизируется Стратегия (policy) под функцию награды Ничего; качество достигается инженерией
Роль взаимодействия Источник эмерджентности и главная сложность Способ разделить работу
Метрика успеха Средняя награда, сходимость Качество ответа, стоимость, латентность

Практический вывод: приёмы из MARL не переносятся в сборку LLM-агентов напрямую, а понятия вроде «нестационарности среды» в инженерном контексте звучат похоже, но означают другое.

Эпохи развития

Лекция выстроена как историческая арка, и это удобный каркас для навигации по области.

  • Табличное обучение. Независимое Q-обучение: каждый агент ведёт свою таблицу «состояние — действие» и считает остальных частью среды. Друг о друге агенты не знают.
  • Теория игр. Матрицы наград начинают явно учитывать взаимозависимость действий. Пик эпохи — алгоритмы с равновесием Нэша, дающие теоретические гарантии для небольших задач.
  • Глубокое обучение (Deep MARL). Переход от формул к архитектурам: сети обрабатывают огромные пространства состояний, где состоянием считается уже не координата, а целое изображение экрана. Отсюда VDN, QMIX, MADDPG, COMA.
  • Эволюционное обучение. Генетические алгоритмы подбирают веса сетей без градиента — фитнес-функция, мутации, скрещивание.
  • Роевое обучение. Биоинспирированные алгоритмы для однородных агентов, см. Swarm Intelligence.

Математическая рамка

Фундамент — марковский процесс принятия решений, кортеж из множества состояний, множества действий, функции переходов и функции наград. Для мультиагентного случая берут расширения: частично наблюдаемые процессы (POMDP) и их децентрализованный вариант, где каждый агент видит лишь фрагмент общей картины.

Ключевая оговорка: в одноагентном случае из этой рамки строго выводится существование оптимальной стратегии. В мультиагентном логический вывод не срабатывает, нужны аппроксимации — подробнее в MARL Challenges.

Зачем это изучать инженеру

Прямой пользы для сборки LLM-агентов мало, но два повода есть.

Первый — словарь и интуиция. Проблема отложенной награды, назначение вклада, исследование против эксплуатации — эти вопросы возникают и в агентных системах, просто там их решают эвристиками и не называют по имени.

Второй — эмпирические наблюдения, которых нет в инженерных источниках. Классический пример — игра в прятки от OpenAI (сентябрь 2019, ICLR 2020): шесть фаз эмерджентной стратегии, где агенты находят дыры в физике мира — катаются на коробках, не касаясь земли, и сбегают за пределы среды под их прикрытием. Показательно, что построена она на централизованной omniscient value function, то есть на CTDE.

Про «агрессию при дефиците ресурсов» — правило расщепляется надвое В лекции звучит закономерность: чем меньше у агента ресурсов и чем меньше его нейросеть, тем агрессивнее он ведёт себя в конкурентной среде. Проверка развела эти две половины.

Дефицит ресурсов → агрессия: подтверждено независимо (DeepMind, AAMAS 2017, метрика beam-use rate в среде Gathering).

Меньше сеть → агрессивнее: не подтверждено, знак обратный. В том же каноническом эксперименте агрессивнее оказывается агент с большей сетью, а в другой игре из той же работы знак и вовсе переворачивается. Определяет исход не размер сети сам по себе, а то, какое поведение сложнее выучить: более ёмкая сеть быстрее осваивает сложную стратегию, и если сложной оказывается агрессия — она и проявляется.

Связано с

  • MARL Challenges — почему классические гарантии здесь не работают
  • CTDE — самая распространённая на сегодня архитектурная схема обучения
  • Swarm Intelligence — ветка для систем из тысяч однородных агентов
  • Multi Agent Systems — инженерная мультиагентность на LLM: сходство только в названии

Открытые вопросы

  • переносится ли CoLLM-CC/DC за пределы дообучения — работает ли что-то похожее на уровне оркестрации без обучения весов
  • в каких средах знак зависимости «ёмкость сети ↔ агрессия» устойчив, а в каких переворачивается