Суть
Подход CTDE упирается в число агентов: чем их больше, тем тяжелее централизованный критик. Роевые алгоритмы заходят с другой стороны — они не пытаются выучить стратегию для каждого. Агенты одинаковы, правила у них простые, а координация идёт не через обмен сообщениями, а через изменение среды.
Каноническая механика — феромоновый след. Агент, нашедший хороший путь, помечает его; другие с большей вероятностью идут по помеченному и усиливают метку; неудачные пути выветриваются сами. Никакого центра, никакой передачи планов — только локальное правило и общая память в виде среды.
В нейросетевом варианте это выглядит как обычный цикл обучения, где в состояние добавлена карта феромонов: агент получает координаты и текущую карту, действует, обновляет карту, а в буфер воспроизведения сохраняется и награда, и след.
Чем расплачиваются
Однородность агентов — это и сила, и ограничение. Рой хорошо работает там, где задача делится на множество одинаковых мелких вкладов, и плохо там, где нужны разные роли. Оптимизировать поведение отдельного агента здесь тоже нельзя: он в принципе не отличается от соседа.
Ещё одна практическая деталь из лекции: размер роя оказывается отдельным гиперпараметром обучения, а не просто характеристикой задачи. Слишком маленький рой не находит решения, слишком большой начинает мешать сам себе.
Где проходит граница «много агентов»
Терминология в области размытая, и лектор приводит вилку: часть исследователей называет мультиагентной любую систему из более чем двух агентов, часть резервирует термин Many-Agent Reinforcement Learning для систем от миллиона участников. Отсюда и разные ожидания от одних и тех же слов в статьях.
Отдельная ветка, о которой много говорили в 2023 году, — GARL (Group-Agent Reinforcement Learning), где каждый агент учится в своей области, а знания пытаются переносить между ними. По оценке из лекции, идея не взлетела.
Оценка верна наполовину «Не взлетело» — справедливо: за четыре года направление ведёт фактически одна группа, цитирование околонулевое.
«Значимых результатов нет» — неверно. В продолжении 2025 года заявлены 43 игры Atari и ускорение обучения у 96% из 129 агентов.
И терминологическая поправка: GARL — не разновидность MARL. Там у каждого агента своя среда, тогда как в MARL агенты делят одну. Соседство в лекции скорее по созвучию названий, чем по существу.
Соседняя ветка: эволюционные алгоритмы
Рядом с роевыми стоят генетические и эволюционные методы: веса сетей подбираются мутациями и скрещиванием, без градиента. Они по своей природе мультиагентны — популяция и есть множество агентов.
Любопытная деталь из обсуждения: происходящее ближе к ламарковской эволюции, чем к дарвиновской, поскольку выученное родителем передаётся потомку напрямую. Цена подхода — вычислительная сложность и отсутствие теоретических гарантий, зато он работает там, где градиент недоступен.
Связано с
- MARL — место роевых методов среди эпох области
- MARL Challenges — проклятие размерности, которое рой обходит однородностью
- CTDE — противоположный подход: индивидуальные стратегии и централизованный критик
Открытые вопросы
- как выбирать размер роя, если он гиперпараметр — есть ли эвристика или только перебор
- применимы ли феромоновые схемы к разнородным агентам, или однородность принципиальна