Swarm Intelligence

Ветка коллективного обучения, где отказываются от индивидуальных стратегий: агенты однородны, взаимодействуют через след в среде, а осмысленное поведение возникает на уровне роя. Способ обойти проклятие размерности, не решая его.

Суть

Подход CTDE упирается в число агентов: чем их больше, тем тяжелее централизованный критик. Роевые алгоритмы заходят с другой стороны — они не пытаются выучить стратегию для каждого. Агенты одинаковы, правила у них простые, а координация идёт не через обмен сообщениями, а через изменение среды.

Каноническая механика — феромоновый след. Агент, нашедший хороший путь, помечает его; другие с большей вероятностью идут по помеченному и усиливают метку; неудачные пути выветриваются сами. Никакого центра, никакой передачи планов — только локальное правило и общая память в виде среды.

В нейросетевом варианте это выглядит как обычный цикл обучения, где в состояние добавлена карта феромонов: агент получает координаты и текущую карту, действует, обновляет карту, а в буфер воспроизведения сохраняется и награда, и след.

Чем расплачиваются

Однородность агентов — это и сила, и ограничение. Рой хорошо работает там, где задача делится на множество одинаковых мелких вкладов, и плохо там, где нужны разные роли. Оптимизировать поведение отдельного агента здесь тоже нельзя: он в принципе не отличается от соседа.

Ещё одна практическая деталь из лекции: размер роя оказывается отдельным гиперпараметром обучения, а не просто характеристикой задачи. Слишком маленький рой не находит решения, слишком большой начинает мешать сам себе.

Где проходит граница «много агентов»

Терминология в области размытая, и лектор приводит вилку: часть исследователей называет мультиагентной любую систему из более чем двух агентов, часть резервирует термин Many-Agent Reinforcement Learning для систем от миллиона участников. Отсюда и разные ожидания от одних и тех же слов в статьях.

Отдельная ветка, о которой много говорили в 2023 году, — GARL (Group-Agent Reinforcement Learning), где каждый агент учится в своей области, а знания пытаются переносить между ними. По оценке из лекции, идея не взлетела.

Оценка верна наполовину «Не взлетело» — справедливо: за четыре года направление ведёт фактически одна группа, цитирование околонулевое.

«Значимых результатов нет» — неверно. В продолжении 2025 года заявлены 43 игры Atari и ускорение обучения у 96% из 129 агентов.

И терминологическая поправка: GARL — не разновидность MARL. Там у каждого агента своя среда, тогда как в MARL агенты делят одну. Соседство в лекции скорее по созвучию названий, чем по существу.

Соседняя ветка: эволюционные алгоритмы

Рядом с роевыми стоят генетические и эволюционные методы: веса сетей подбираются мутациями и скрещиванием, без градиента. Они по своей природе мультиагентны — популяция и есть множество агентов.

Любопытная деталь из обсуждения: происходящее ближе к ламарковской эволюции, чем к дарвиновской, поскольку выученное родителем передаётся потомку напрямую. Цена подхода — вычислительная сложность и отсутствие теоретических гарантий, зато он работает там, где градиент недоступен.

Связано с

  • MARL — место роевых методов среди эпох области
  • MARL Challenges — проклятие размерности, которое рой обходит однородностью
  • CTDE — противоположный подход: индивидуальные стратегии и централизованный критик

Открытые вопросы

  • как выбирать размер роя, если он гиперпараметр — есть ли эвристика или только перебор
  • применимы ли феромоновые схемы к разнородным агентам, или однородность принципиальна