status/volatile Прогнозы (доля автономных решений к 2028 году), оценки состояния области и списки «самых успешных» схем устаревают. Ревизия раз в квартал.
Суть
Классическое обучение с подкреплением ставит одного агента в среду: он действует, получает награду, подстраивает стратегию. MARL добавляет к этому других обучающихся агентов — и ломает почти все удобные свойства постановки, потому что среда перестаёт быть неподвижной мишенью.
Взамен появляется то, ради чего этим занимаются: эмерджентность. Поведение, которого никто не программировал, возникает из взаимодействия простых единиц. Метафора, с которой начинается лекция, — одноклеточный слизевик Dictyostelium discoideum: пока есть еда, он живёт как амёба, а когда еда кончается, сотня тысяч амёб собирается в единый многоклеточный организм, мигрирует и даёт споры.
Чем это отличается от «мультиагентности» в LLM-инженерии
Различие принципиальное, и путать их вредно:
| MARL (эта заметка) | MAS на LLM (Multi Agent Systems) | |
|---|---|---|
| Как агент получает поведение | Обучается на награде, миллионы эпизодов | Задаётся промптом, обучения нет |
| Что оптимизируется | Стратегия (policy) под функцию награды | Ничего; качество достигается инженерией |
| Роль взаимодействия | Источник эмерджентности и главная сложность | Способ разделить работу |
| Метрика успеха | Средняя награда, сходимость | Качество ответа, стоимость, латентность |
Практический вывод: приёмы из MARL не переносятся в сборку LLM-агентов напрямую, а понятия вроде «нестационарности среды» в инженерном контексте звучат похоже, но означают другое.
Эпохи развития
Лекция выстроена как историческая арка, и это удобный каркас для навигации по области.
- Табличное обучение. Независимое Q-обучение: каждый агент ведёт свою таблицу «состояние — действие» и считает остальных частью среды. Друг о друге агенты не знают.
- Теория игр. Матрицы наград начинают явно учитывать взаимозависимость действий. Пик эпохи — алгоритмы с равновесием Нэша, дающие теоретические гарантии для небольших задач.
- Глубокое обучение (Deep MARL). Переход от формул к архитектурам: сети обрабатывают огромные пространства состояний, где состоянием считается уже не координата, а целое изображение экрана. Отсюда VDN, QMIX, MADDPG, COMA.
- Эволюционное обучение. Генетические алгоритмы подбирают веса сетей без градиента — фитнес-функция, мутации, скрещивание.
- Роевое обучение. Биоинспирированные алгоритмы для однородных агентов, см. Swarm Intelligence.
Математическая рамка
Фундамент — марковский процесс принятия решений, кортеж из множества состояний, множества действий, функции переходов и функции наград. Для мультиагентного случая берут расширения: частично наблюдаемые процессы (POMDP) и их децентрализованный вариант, где каждый агент видит лишь фрагмент общей картины.
Ключевая оговорка: в одноагентном случае из этой рамки строго выводится существование оптимальной стратегии. В мультиагентном логический вывод не срабатывает, нужны аппроксимации — подробнее в MARL Challenges.
Зачем это изучать инженеру
Прямой пользы для сборки LLM-агентов мало, но два повода есть.
Первый — словарь и интуиция. Проблема отложенной награды, назначение вклада, исследование против эксплуатации — эти вопросы возникают и в агентных системах, просто там их решают эвристиками и не называют по имени.
Второй — эмпирические наблюдения, которых нет в инженерных источниках. Классический пример — игра в прятки от OpenAI (сентябрь 2019, ICLR 2020): шесть фаз эмерджентной стратегии, где агенты находят дыры в физике мира — катаются на коробках, не касаясь земли, и сбегают за пределы среды под их прикрытием. Показательно, что построена она на централизованной omniscient value function, то есть на CTDE.
Про «агрессию при дефиците ресурсов» — правило расщепляется надвое В лекции звучит закономерность: чем меньше у агента ресурсов и чем меньше его нейросеть, тем агрессивнее он ведёт себя в конкурентной среде. Проверка развела эти две половины.
Дефицит ресурсов → агрессия: подтверждено независимо (DeepMind, AAMAS 2017, метрика beam-use rate в среде Gathering).
Меньше сеть → агрессивнее: не подтверждено, знак обратный. В том же каноническом эксперименте агрессивнее оказывается агент с большей сетью, а в другой игре из той же работы знак и вовсе переворачивается. Определяет исход не размер сети сам по себе, а то, какое поведение сложнее выучить: более ёмкая сеть быстрее осваивает сложную стратегию, и если сложной оказывается агрессия — она и проявляется.
Связано с
- MARL Challenges — почему классические гарантии здесь не работают
- CTDE — самая распространённая на сегодня архитектурная схема обучения
- Swarm Intelligence — ветка для систем из тысяч однородных агентов
- Multi Agent Systems — инженерная мультиагентность на LLM: сходство только в названии
Открытые вопросы
- переносится ли CoLLM-CC/DC за пределы дообучения — работает ли что-то похожее на уровне оркестрации без обучения весов
- в каких средах знак зависимости «ёмкость сети ↔ агрессия» устойчив, а в каких переворачивается