Change Classification Agent

В агентной системе изменением считается не только код. Классическая ошибка — считать правку инструкции «не настоящим релизом»: она меняет поведение сильнее, чем половина коммитов, и при этом проходит мимо всех гейтов.

Тринадцать поверхностей, меняющих поведение

Список стоит держать под рукой целиком, потому что каждый пункт хоть раз выкатывали «просто настройкой»:

  • выбор модели или маршрутизация;
  • системная инструкция, рабочие процедуры и правила;
  • наборы политик;
  • контракты возможностей;
  • правила подтверждения;
  • правила делегированной авторизации и обращение с токенами;
  • корпус извлечения;
  • семантика записи в память;
  • выбор схемы оркестрации и границы делегирования;
  • семантика прерывания и истечения для сессий возможностей;
  • наборы данных для оценки и логика оценивания;
  • рубрика проверяющего и правила атрибуции отказов;
  • параметры поэтапного выпуска.

Два пункта особенно неочевидны. Изменение набора для оценки — это изменение системы: новый набор может «починить» регрессию, ничего не улучшив. Изменение рубрики проверяющего — то же самое уровнем выше: меняется определение того, что считается хорошим (LLM as Judge).

Не все изменения одинаково рискованны

Смысл классификации в том, чтобы дешёвые изменения шли быстро, а дорогие — через шлюзы. Ось риска строится по двум признакам: радиус воздействия (сколько запусков и каких затронуто) и обратимость (можно ли вернуть без восстановления состояния).

Правка формулировки в подсказке ассистента и правка правила подтверждения для операции записи формально обе «правка текста», а по обоим признакам различаются на порядки.

Откат сложнее, чем кажется

Версия агента — связка провайдера, модели, инструкции, политик и корпуса, а не строка в коде (Feature Flags LLM). Частичный откат — вернули модель, оставили новую инструкцию — даёт сочетание, которое никогда не тестировалось.

Отдельная сложность в том, что часть поверхностей откатывается не мгновенно: корпус извлечения возвращается переиндексацией, а записи в памяти уже повлияли на последующие запуски (Memory Poisoning).

Происхождение нужно не только для цепочки поставки

Побочная польза дисциплины происхождения: она отвечает на вопрос «что изменилось между этими двумя запусками», без которого разбор регрессии превращается в гадание. Если у инструкции, политики и корпуса нет версии и владельца, различить «модель стала хуже» и «кто-то поправил правило» невозможно (Trusted Artifacts).

Связано с

  • ADLC — цикл, внутри которого работает эта дисциплина
  • Feature Flags LLM — почему версия это связка целиком
  • Canary Release LLM — как выкатываются высокорисковые изменения
  • Trusted Artifacts — происхождение и владелец каждой поверхности
  • IaC CICD AI — атомарный откат по всем частям артефакта
  • Agent Evals — почему изменение набора оценок само является изменением
  • Memory Poisoning — поверхность, которая откатывается хуже всех