Слово «мультиагентный» в академической литературе и в инженерной практике означает разные вещи. Ниже — устройство области, где агенты обучаются, а не инструктируются: почему пространство их совместных действий взрывается, откуда берётся эмерджентность и на каком уровне приёмы оттуда переносятся в системы на языковых моделях.
1. Одно слово, две дисциплины
Прямой пользы от мультиагентного обучения с подкреплением (MARL, multi-agent reinforcement learning — раздел обучения с подкреплением, где в одной среде учатся сразу несколько агентов) разработчику, который собирает агентов на языковых моделях, немного. Честнее сказать это в первом абзаце, чем изображать применимость. Общего у двух областей — название; расходятся они в первом же вопросе: откуда система берёт осмысленное поведение.
| Академическая рамка (MARL) | Инженерная рамка (агенты на LLM) | |
|---|---|---|
| Откуда роли | Возникают из обучения | Назначены человеком в промпте |
| Что настраиваем | Функцию награды и среду | Инструкции, топологию, лимиты |
| Критерий успеха | Средняя награда растёт, обучение стабильно | Ответ получен, бюджет не превышен |
| Сюрпризы | Считаются результатом | Считаются багом |
Последняя строка — самая содержательная. В мультиагентной системе на промптах неожиданное поведение агента — это дефект, который надо чинить; в MARL оно то, ради чего эксперимент ставился.
Отсюда забирают словарь и интуицию; приёмы не переносятся. Отложенная награда, назначение вклада, исследование против использования уже найденного, нестационарность — эти вопросы возникают и в агентных системах, просто там их решают эвристиками и не называют по имени.
2. Эмерджентность: ради чего область вообще существует
Эмерджентность — поведение целого, которое не сводится к сумме поведений частей и которого никто не программировал. Первый образ — биологический: одноклеточный слизевик Dictyostelium discoideum живёт как амёба, пока есть еда, а когда еда кончается, сто тысяч амёб собираются в единый многоклеточный организм, мигрируют и дают споры. Ни в одной амёбе этой программы нет.
Второй образ — измеримый. В сравнительном эксперименте Института Вейцмана (PNAS, декабрь 2024) муравьям и людям давали одну и ту же головоломку: протащить Т-образный груз через узкие проходы и повороты. Задача чисто геометрическая и потому масштабируется без переделки — от одиночки до большой группы. Один человек обыгрывает одного муравья: пространственное мышление, прямые траектории. В группах порядок переворачивается. Муравьи хорошо масштабируют простую стратегию, коллективное движение даёт им эмерджентную когнитивность и краткосрочную память. Люди индивидуальное преимущество в коллективное действие не переносят: с ограниченным общением группа скатывается к самым очевидным манёврам ради консенсуса — и результат падает.
MARL и занимается тем, чтобы получить такой эффект на обучаемых агентах. Цена — почти все удобные свойства одноагентной постановки ломаются разом.
3. Пространство совместных действий взрывается на седьмом агенте
Семь агентов, у каждого шесть действий. Если учить их независимо, каждый ведёт собственную таблицу «состояние — действие», и на одно состояние приходится 42 значения. Если учитывать совместные действия, то есть все комбинации того, кто что делает одновременно, — уже 6⁷, или 279 936 значений на то же одно состояние.
одно состояние среды · 7 агентов · 6 действий у каждого
независимо 7 × 6 = 42 значения
совместно 6 × 6 × … × 6 = 279 936 значений
└── 7 раз ──┘
отношение ≈ 6 665×
полный размер таблицы = |S| × 6⁷ — множитель по состояниям остаётсяОговорка обязательна: оба числа считаны на одно состояние, полная таблица — это |S| × 6⁷, и множитель по состояниям тот же, что в одноагентном случае. Проклятие размерности бьёт здесь по мультиагентной оси, причём при семи агентах и шести действиях — то есть на крошечной задаче.
Рядом обычно ставят другие порядки: около 10⁴³ уникальных позиций в шахматах и порядка 10¹⁶⁸ в го. Величины разной природы — там пространства состояний, здесь пространство совместных действий, и соседствуют они только как ориентир масштаба. Отсюда грубый практический ориентир: эксперименты по глубокому MARL ставят на единицах агентов, а не на десятках, а для систем принципиально большего размера завели отдельный термин Many-Agent Reinforcement Learning. Переход к нейросетевым аппроксимациям здесь был не улучшением, а условием выживания области.
4. Среда, которая учится вместе с вами
Классические доказательства сходимости в обучении с подкреплением опираются на неподвижность среды: агент пробует действия, реакция среды зависит только от них. В мультиагентной постановке остальные агенты — тоже часть среды, и они учатся одновременно. Пока один подстраивается под поведение второго, второй меняет своё поведение под первого. Это и называют нестационарностью.
Следствие жёсткое: гарантий сходимости нет. Формально доказать, что оптимальная стратегия будет найдена, нельзя — строят аппроксимации и эмпирически подтверждают стабильность обучения. Отсюда и осторожные формулировки результатов: инновации в области направлены не на доказательство оптимальности, а на улучшение стабильности обучения. Заодно понятно, почему результат от запуска к запуску воспроизводится хуже, чем хотелось бы.
5. Кто именно сделал результат
Команда победила — но чей ход был решающим? Это задача назначения вклада (credit assignment): связать конкретное действие агента с итоговой наградой. В одноагентном случае она уже нетривиальна из-за отложенной и разреженной награды — сотни действий, один сигнал в конце. В мультиагентном к временно́му измерению добавляется пространственное: общую награду надо распределить ещё и между участниками.
Цена нерешённой задачи конкретная: агенты учатся паразитировать. Если вклад неразличим, выгоднее ничего не делать и получать долю от общего результата.
Вокруг этого выросло целое семейство алгоритмов. VDN раскладывает общую ценность на слагаемые по агентам; QMIX делает то же нелинейно, с ограничением монотонности; COMA считает контрфактический вклад — что было бы, поступи агент иначе. Разные ответы на один вопрос, и ни один не окончательный.
6. Обучать со знанием всего, исполнять вслепую
Схема CTDE (centralized training for decentralized execution — централизованное обучение с децентрализованным исполнением) разводит во времени две несовместимые потребности. При обучении полезно видеть всю картину: чтобы оценить ход агента, надо знать, что делали остальные. При исполнении полной картины нет и не будет: агент действует в реальном времени и видит только свой кусок мира.
ОБУЧЕНИЕ ИСПОЛНЕНИЕ
──────────────────────────── ─────────────────────
критик ← совместные наблюдения критика больше нет
← совместные действия
│ градиент актор_i ← своё наблюдение
▼ → своё действие
актор_1 … актор_n
закрывает нестационарность; назначение вклада
не закрывает размерность: вход критика растёт с числом агентовКритик нужен только на этапе обучения и после него выбрасывается. Асимметрия «знали больше, чем понадобится» здесь оправдана: без неё градиенту неоткуда взять осмысленный сигнал.
Со статусом схемы есть тонкость. Вводный обзор 2024 года называет CTDE самой распространённой из трёх парадигм — «the most common», а не самой успешной. Распространённость измерима, успешность нет. Базовое допущение о независимости стратегий агентов в литературе тоже критиковали.
Канонический учебный пример — MADDPG (NeurIPS 2017, OpenAI и Университет Макгилла): актор решает, что делать; критик оценивает, насколько это хорошо; в детерминированную стратегию подмешивается шум для исследования; целевая сеть обновляется плавным смешиванием вместо скачка. Рабочим умолчанием MADDPG быть перестал — сегодняшняя точка отсчёта MAPPO, показавший на четырёх популярных бенчмарках результаты не хуже методов off-policy (тех, что учатся на ранее собранных чужих траекториях) и без подгонки под среду. Смена произошла внутри парадигмы CTDE: схема живёт дольше конкретного метода.
7. Обход размерности: рой, эволюция и путаница в названиях
Роевой интеллект не пытается выучить стратегию для каждого агента. Агенты одинаковы, правила у них простые, координация идёт через изменение среды: сообщениями они не обмениваются. Каноническая механика — феромоновый след: нашедший хороший путь помечает его, другие с большей вероятностью идут по помеченному и усиливают метку, неудачные пути выветриваются. В нейросетевом варианте это обычный цикл обучения, где в состояние добавлена карта феромонов, а в буфер воспроизведения кладут и награду, и след.
Однородность — и сила, и потолок. Рой хорош на задачах из множества одинаковых мелких вкладов и бесполезен там, где нужны разные роли; оптимизировать поведение отдельного агента здесь нельзя в принципе. Практическая деталь: размер роя оказывается гиперпараметром обучения, а не характеристикой задачи. Маленький рой не находит решения, слишком большой мешает сам себе.
Рядом стоят эволюционные алгоритмы: веса сетей подбираются мутациями и скрещиванием, без градиента, а популяция и есть множество агентов. Происходящее ближе к ламарковской эволюции, чем к дарвиновской, — выученное родителем передаётся потомку напрямую.
И терминологическая чистка. GARL (group-agent reinforcement learning), о котором много говорили в 2023 году, к MARL прямого отношения не имеет: у каждого агента своя среда, а общение сводится к обмену знанием, без кооперации и конкуренции как результата обучения. Соседство по созвучию названий. Расхожая оценка «не взлетело» верна наполовину: за четыре года направление ведёт, по сути, одна группа при околонулевом цитировании, но «значимых результатов нет» неверно — в продолжении 2025 года заявлены 43 игры Atari и ускорение обучения у 96% из 129 агентов. Ниша, которая не разрослась.
8. Как читать эксперименты в этой области
Стандартной средой здесь считается StarCraft II, но за названием почти всегда стоит SMAC — набор сценариев микроменеджмента отрядов юнитов, а не игра целиком. Набор жив, работы на нём выходят по июль 2026 включительно. Оригинальные сценарии при этом насыщены: авторы SMACv2 показали, что алгоритмы достигают на них почти идеального результата, а часть сценариев берётся стратегией, которая вообще не смотрит на состояние среды и зависит только от номера шага; ответ — процедурная генерация сценариев в SMACv2.
Сам движок игры из пайплайна тем временем ушёл: реимплементация SMAX на JAX внутри JaxMARL обходится без StarCraft II и даёт ускорение около 14 раз, а при векторизации нескольких запусков — до 12 500 раз. Мотивировку авторы называют прямо: кризис оценивания в области. Бенчмарк, на котором все показывают почти сто процентов, перестаёт быть бенчмарком; параллель с рейтингами агентных систем напрашивается.
Самая известная демонстрация эмерджентности — игра в прятки от OpenAI (сентябрь 2019, ICLR 2020): награда задана только за линию видимости, а из одного этого сигнала вырастают шесть фаз стратегии, от постройки укрытий до серфинга на коробках и защиты от него. Показательны две детали. Находки вроде катания на коробках без касания земли сами авторы относят к нежелательному поведению, а не к достижению; плоская формулировка «в академии сюрприз — это результат» на этом усложняется. И построены прятки на централизованной всезнающей функции ценности (omniscient value function — критик видит полное состояние среды без масок по видимости), то есть на той же CTDE.
Отдельный сюжет — как эмпирические расхожие закономерности разваливаются при проверке. Правило звучит так: чем меньше у агента ресурсов и чем меньше его нейросеть, тем агрессивнее он себя ведёт. Первая половина подтверждается независимо: в работе DeepMind (AAMAS 2017) в среде Gathering агенты вели себя тем агрессивнее, чем скуднее восстанавливались ресурсы, а агрессию там операционализировали через beam-use rate — частоту, с которой агент бьёт соперника лучом. Вторая половина в том же эксперименте опровергается со сменой знака: агрессивнее оказывается агент с большей сетью, а в другой игре из той же работы знак переворачивается обратно. Объяснение простое: побеждает поведение, которое сложнее выучить, — целиться лучом по сопернику технически труднее, чем мирно собирать яблоки. Универсального правила про размер сети отсюда не выводится.
9. Где кончается перенос в агентов на языковых моделях
Мост между областями существует и найден недавно. Подходы CoLLM-CC и CoLLM-DC (январь 2026) применяют мультиагентный актор-критик к координации агентов на языковых моделях, причём централизованный критик выигрывает ровно там, где у инженеров болит: длинный горизонт и разреженная обратная связь. Децентрализованный вариант на таких задачах сходится плохо.
Существенно, на каком уровне это работает: перенос идёт через дообучение весов; промпты и оркестрация остаются снаружи. Разработчик, который собирает команду агентов на API, в эту категорию не попадает. Вот здесь и проходит настоящая граница.
Почему перенос не бесплатный, сформулировано отдельно: обзор по мультиагентному дообучению называет три свойства инженерных систем, которых нет в классической постановке, — асинхронность взаимодействий, профиль и роль у агента, разнородность архитектур. Взять MADDPG и обучить им команду агентов на языковых моделях не выйдет по каждому из трёх пунктов.
Стены между областями при этом нет — есть история. Свежий обзор прослеживает единую линию: коммуникацию в MARL сначала задавали вручную, потом стали выучивать под награду — протоколы получались эффективными, но узкоспециализированными и плохо интерпретируемыми, — отсюда интерес к языковым моделям с их готовым априорным знанием языка. Три способа задать коммуникацию оказались фазами одного сюжета.
Итог
- Две мультиагентности расходятся в первом же вопросе: агенты обучаются или инструктируются. Из академической рамки забирают словарь; приёмы от постановки не отделяются.
- 42 значения против 279 936 — цена перехода к совместным действиям на семи агентах с шестью действиями у каждого, причём на одно состояние среды. Отсюда и масштаб экспериментов: единицы агентов, а не десятки.
- Гарантий сходимости нет: среда учится вместе с агентом. Работы в области направлены не на доказательство оптимальности, а на стабильность обучения.
- CTDE — самая распространённая схема, но не доказанно лучшая. MADDPG остался учебным примером, сегодняшняя точка отсчёта — MAPPO, и смена произошла внутри парадигмы.
- Расхожие выводы полезно проверять. «Дефицит ресурсов → агрессия» воспроизводится; «меньше сеть → агрессивнее» в каноническом эксперименте имеет обратный знак.
- Перенос в системы на языковых моделях реален на уровне дообучения весов и не работает на уровне оркестрации промптами.
FAQ
Чем мультиагентное обучение с подкреплением отличается от мультиагентных систем на языковых моделях?
Способом получения поведения. В MARL агент вырабатывает стратегию сам, обучаясь на функции награды миллионы эпизодов, и роли внутри команды возникают эмерджентно. В системе на языковых моделях роли задаются промптом, обучения весов нет, а качество даёт инженерия: контракты, лимиты, топология. Совпадает только слово «мультиагентный» — термины вроде «нестационарности» в двух контекстах означают разное.
Почему в мультиагентном обучении с подкреплением нет гарантий сходимости?
Потому что среда перестаёт быть неподвижной. Классические доказательства сходимости предполагают, что реакция среды зависит только от действий агента, а в мультиагентной постановке остальные агенты входят в среду и учатся одновременно: пока первый подстраивается под второго, второй меняется под первого. Формально доказать нахождение оптимальной стратегии нельзя, поэтому исследования нацелены на стабильность обучения.
Что такое CTDE и почему критика выбрасывают после обучения?
CTDE (централизованное обучение с децентрализованным исполнением) — схема, где обучающая часть, критик, видит совместные наблюдения и действия всех агентов, а исполняющая часть, актор, работает только от локального наблюдения. Критик существует, чтобы дать градиенту осмысленный сигнал: зная, что делали все, он различает, чей ход изменил исход. В момент исполнения такой информации нет физически, поэтому критик после обучения не нужен.
Сколько агентов обычно бывает в экспериментах по MARL?
Обычно единицы, а не десятки. Пространство совместных действий растёт экспоненциально по числу агентов, и вычислительная сложность останавливает эксперимент раньше, чем алгоритм успевает сойтись. Для систем принципиально большего размера существует отдельный термин Many-Agent Reinforcement Learning: там отказываются от индивидуальных стратегий в пользу однородности агентов и роевых алгоритмов.
Правда ли, что агент с маленькой нейросетью ведёт себя агрессивнее?
Нет, универсального правила такого вида в литературе нет. В каноническом эксперименте DeepMind 2017 года в среде со сбором ресурсов агрессивнее оказался агент с большей сетью, а в другой игре из той же работы знак эффекта перевернулся. Определяет исход не размер сети, а то, какое поведение в конкретной среде сложнее выучить. При этом связь «дефицит ресурсов → агрессия» в той же работе подтверждается.
Можно ли применить приёмы MARL к оркестрации агентов на языковых моделях?
На уровне промптов и оркестрации — нет, на уровне дообучения весов — да. Подходы CoLLM-CC и CoLLM-DC (январь 2026) переносят мультиагентный актор-критик на координацию языковых агентов, и централизованный критик выигрывает на длинном горизонте и разреженной награде. Мешают переносу три свойства инженерных систем: асинхронность взаимодействий, профиль и роль у агента, разнородность архитектур.
Источники
- Comparing cooperative geometric puzzle solving in ants versus humans — PNAS, декабрь 2024 — головоломка с Т-образным грузом: одиночка-человек сильнее, группа муравьёв — наоборот.
- An Introduction to Centralized Training for Decentralized Execution — arXiv:2409.03052 — таксономия CTE / CTDE / DTE и точная формулировка статуса схемы: «the most common».
- Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments (MADDPG) — arXiv:1706.02275 — канонический пример CTDE: устройство актора и критика, шум для исследования, мягкое обновление целевой сети.
- The Surprising Effectiveness of PPO in Cooperative, Multi-Agent Games (MAPPO) — arXiv:2103.01955 — почему точкой отсчёта стал on-policy метод, обучающийся на собственных свежих траекториях.
- The StarCraft Multi-Agent Challenge — arXiv:1902.04043 · SMACv2 — arXiv:2212.07489 — первоисточник бенчмарка и документированное признание его насыщения.
- JaxMARL — arXiv:2311.10090 — переезд сред на GPU, реимплементация SMAX без движка игры, кризис оценивания.
- Multi-agent Reinforcement Learning in Sequential Social Dilemmas — arXiv:1702.03037 — дефицит ресурсов и агрессия, обратный знак эффекта от ёмкости сети.
- Emergent Tool Use From Multi-Agent Autocurricula — arXiv:1909.07528 — шесть фаз стратегии в игре в прятки и omniscient value function в основе.
- Group-Agent Reinforcement Learning — arXiv:2202.05135 · продолжение 2025 года — arXiv:2501.11818 — определение GARL и результаты на 43 играх Atari.
- Learning Decentralized LLM Collaboration with Multi-Agent Actor Critic — arXiv:2601.21972 — перенос CTDE на координацию языковых агентов и преимущество централизованного критика.
- MARFT: Multi-Agent Reinforcement Fine-Tuning — arXiv:2504.16129 — три причины, по которым классический MARL не переносится напрямую.
- The Five Ws of Multi-Agent Communication — arXiv:2602.11583 — линия MARL → выученные языки → языковые модели как единая история.
Числовые ориентиры в тексте получены на конкретных средах и постановках: расчёт размерности верен для дискретного набора действий и одного состояния, эффекты от дефицита ресурсов и ёмкости сети измерены в двух играх, а ускорение обучения на JAX зависит от степени векторизации запусков.