Карта раздела: заметки сгруппированы по темам с короткими аннотациями — читайте по порядку как путеводитель или переходите сразу к нужной теме.
1. Мультиагентное обучение с подкреплением
Раздел RL, где в одной среде учатся несколько агентов одновременно. Добавление второго обучающегося ломает почти все удобные свойства одноагентной постановки: среда перестаёт быть неподвижной мишенью, гарантии сходимости исчезают, а награду становится нечем делить между участниками. Взамен появляется эмерджентность — поведение, которого никто не программировал.
- MARL — хаб направления: эпохи развития, марковская рамка, отличие от мультиагентности на LLM.
- MARL Challenges — три причины, по которым область остаётся трудной: проклятие размерности, нестационарность среды, назначение вклада.
2. Архитектурные схемы обучения
Как обходят проблемы из предыдущего раздела. Основной приём — развести во времени то, что несовместимо в один момент: во время обучения агенту дают больше информации, чем будет доступно при исполнении.
- CTDE — централизованное обучение при децентрализованном исполнении; самая распространённая схема на сегодня, MADDPG как канонический пример.
- Swarm Intelligence — противоположный подход: отказ от индивидуальных стратегий, однородные агенты и координация через след в среде.
3. Механика обучения
- Backpropagation — как ошибка распространяется обратно по сети; фундамент под обучением любой из схем выше (используется и в разделе LLM).
4. Практический маршрут
Понять MARL с нуля MARL → MARL Challenges → CTDE → Swarm Intelligence
Связано с
- MARL — корневая заметка направления
- Multi Agent Systems — инженерная мультиагентность на LLM: сходство с этим разделом только в названии
- Backpropagation — мост к разделу LLM