Swarm Intelligence

Ветка коллективного обучения, где отказываются от индивидуальных стратегий: агенты однородны, взаимодействуют через след в среде, а осмысленное поведение возникает на уровне роя. Способ обойти проклятие размерности, не решая его.

Суть

Подход CTDE упирается в число агентов: чем их больше, тем тяжелее централизованный критик. Роевые алгоритмы заходят с другой стороны — они не пытаются выучить стратегию для каждого. Агенты одинаковы, правила у них простые, а координация идёт не через обмен сообщениями, а через изменение среды.

Каноническая механика — феромоновый след. Агент, нашедший хороший путь, помечает его; другие с большей вероятностью идут по помеченному и усиливают метку; неудачные пути выветриваются сами. Никакого центра, никакой передачи планов — только локальное правило и общая память в виде среды.

В нейросетевом варианте это выглядит как обычный цикл обучения, где в состояние добавлена карта феромонов: агент получает координаты и текущую карту, действует, обновляет карту, а в буфер воспроизведения сохраняется и награда, и след.

Чем расплачиваются

Однородность агентов — это и сила, и ограничение. Рой хорошо работает там, где задача делится на множество одинаковых мелких вкладов, и плохо там, где нужны разные роли. Оптимизировать поведение отдельного агента здесь тоже нельзя: он в принципе не отличается от соседа.

Ещё одна практическая деталь: размер роя оказывается отдельным гиперпараметром обучения, а не просто характеристикой задачи. Слишком маленький рой не находит решения, слишком большой начинает мешать сам себе.

Где проходит граница «много агентов»

Терминология в области размытая, и вилка широкая: часть исследователей называет мультиагентной любую систему из более чем двух агентов, часть резервирует термин Many-Agent Reinforcement Learning для систем от миллиона участников. Отсюда и разные ожидания от одних и тех же слов в статьях.

Отдельная ветка, о которой много говорили в 2023 году, — GARL (Group-Agent Reinforcement Learning), где каждый агент учится в своей области, а знания пытаются переносить между ними. По оценке источника, идея не взлетела.

Оценка верна наполовину «Не взлетело» — справедливо: за четыре года направление ведёт фактически одна группа, цитирование околонулевое.

«Значимых результатов нет» — неверно. В продолжении 2025 года заявлены 43 игры Atari и ускорение обучения у 96% из 129 агентов.

И терминологическая поправка: GARL — не разновидность MARL. Там у каждого агента своя среда, тогда как в MARL агенты делят одну. Соседство в исходном изложении скорее по созвучию названий, чем по существу.

Соседняя ветка: эволюционные алгоритмы

Рядом с роевыми стоят генетические и эволюционные методы: веса сетей подбираются мутациями и скрещиванием, без градиента. Они по своей природе мультиагентны — популяция и есть множество агентов.

Любопытная деталь из обсуждения: происходящее ближе к ламарковской эволюции, чем к дарвиновской, поскольку выученное родителем передаётся потомку напрямую. Цена подхода — вычислительная сложность и отсутствие теоретических гарантий, зато он работает там, где градиент недоступен.

Размер роя: эвристика есть, и общепринятая цифра занижена

Сверка 2026-08. Классический ориентир, идущий с 1995 года, — 20-50 частиц, и им пользуются по инерции. Исследования размера популяции показывают, что для большинства вариантов алгоритма лучший результат достигается на 70-500 частицах, то есть привычный выбор чаще всего слишком мал, а на трудных задачах и практических применениях больший рой прямо повышает эффективность.

Эвристика, привязывающая размер к задаче, а не к традиции: n < N < 2n, где n — размерность пространства поиска. Для унимодальных задач допустимы меньшие размеры, но и там часть вариантов алгоритма работает лучше на сотнях частиц.

Практический вывод: перебор не нужен как метод, нужен как проверка — стартовать от размерности задачи, а не от числа из учебника, и убедиться, что увеличение вдвое перестало давать прирост.

Феромоны и разнородные агенты

Прямых работ по применимости феромонных схем к разнородным агентам найти не удалось (проверено 2026-08). Зато нашлось более важное ограничение, ставящее под сомнение и однородный случай.

Стигмергия не масштабируется монотонно. В экспериментах с плотными роями роботов простой алгоритм избегания на отталкивающем феромоне при росте размера роя и плотности сначала перестаёт давать преимущество, а затем проигрывает по покрытию площади обычным случайным блужданиям без взаимодействия вовсе. Авторы прямо пишут, что предположение о робастности и масштабируемости таких схем стоит пересмотреть при высокой плотности.

Что до разнородности — механизм подсказывает ответ, даже если замеров нет. Феромон переносит скалярный след в среде: он кодирует «где», а не «кто». Агент, читающий метку, не знает, какой тип агента её оставил и с каким намерением, — а именно это и нужно, когда участники различаются возможностями. Значит для разнородного роя однородного феромона мало: нужны либо раздельные каналы меток по типам, либо метка с содержимым, а это уже не стигмергия в исходном смысле, а обмен сообщениями через среду.

Связано с

  • MARL — место роевых методов среди эпох области
  • MARL Challenges — проклятие размерности, которое рой обходит однородностью
  • CTDE — противоположный подход: индивидуальные стратегии и централизованный критик