ML

Машинное обучение под агентами: обучение с подкреплением для нескольких агентов сразу и математика, из которой оно выросло.

Карта раздела: заметки сгруппированы по темам с короткими аннотациями — читайте по порядку как путеводитель или переходите сразу к нужной теме.

1. Мультиагентное обучение с подкреплением

Раздел RL, где в одной среде учатся несколько агентов одновременно. Добавление второго обучающегося ломает почти все удобные свойства одноагентной постановки: среда перестаёт быть неподвижной мишенью, гарантии сходимости исчезают, а награду становится нечем делить между участниками. Взамен появляется эмерджентность — поведение, которого никто не программировал.

  • MARL — хаб направления: эпохи развития, марковская рамка, отличие от мультиагентности на LLM.
  • MARL Challenges — три причины, по которым область остаётся трудной: проклятие размерности, нестационарность среды, назначение вклада.

2. Архитектурные схемы обучения

Как обходят проблемы из предыдущего раздела. Основной приём — развести во времени то, что несовместимо в один момент: во время обучения агенту дают больше информации, чем будет доступно при исполнении.

  • CTDE — централизованное обучение при децентрализованном исполнении; самая распространённая схема на сегодня, MADDPG как канонический пример.
  • Swarm Intelligence — противоположный подход: отказ от индивидуальных стратегий, однородные агенты и координация через след в среде.

3. Механика обучения

  • Backpropagation — как ошибка распространяется обратно по сети; фундамент под обучением любой из схем выше (используется и в разделе LLM).

4. Практический маршрут

Понять MARL с нуля MARLMARL ChallengesCTDESwarm Intelligence

Связано с

  • MARL — корневая заметка направления
  • Multi Agent Systems — инженерная мультиагентность на LLM: сходство с этим разделом только в названии
  • Backpropagation — мост к разделу LLM