Тринадцать поверхностей, меняющих поведение
Список стоит держать под рукой целиком, потому что каждый пункт хоть раз выкатывали «просто настройкой»:
- выбор модели или маршрутизация;
- системная инструкция, рабочие процедуры и правила;
- наборы политик;
- контракты возможностей;
- правила подтверждения;
- правила делегированной авторизации и обращение с токенами;
- корпус извлечения;
- семантика записи в память;
- выбор схемы оркестрации и границы делегирования;
- семантика прерывания и истечения для сессий возможностей;
- наборы данных для оценки и логика оценивания;
- рубрика проверяющего и правила атрибуции отказов;
- параметры поэтапного выпуска.
Два пункта особенно неочевидны. Изменение набора для оценки — это изменение системы: новый набор может «починить» регрессию, ничего не улучшив. Изменение рубрики проверяющего — то же самое уровнем выше: меняется определение того, что считается хорошим (LLM as Judge).
Не все изменения одинаково рискованны
Смысл классификации в том, чтобы дешёвые изменения шли быстро, а дорогие — через шлюзы. Ось риска строится по двум признакам: радиус воздействия (сколько запусков и каких затронуто) и обратимость (можно ли вернуть без восстановления состояния).
Правка формулировки в подсказке ассистента и правка правила подтверждения для операции записи формально обе «правка текста», а по обоим признакам различаются на порядки.
Откат сложнее, чем кажется
Версия агента — связка провайдера, модели, инструкции, политик и корпуса, а не строка в коде (Feature Flags LLM). Частичный откат — вернули модель, оставили новую инструкцию — даёт сочетание, которое никогда не тестировалось.
Отдельная сложность в том, что часть поверхностей откатывается не мгновенно: корпус извлечения возвращается переиндексацией, а записи в памяти уже повлияли на последующие запуски (Memory Poisoning).
Происхождение нужно не только для цепочки поставки
Побочная польза дисциплины происхождения: она отвечает на вопрос «что изменилось между этими двумя запусками», без которого разбор регрессии превращается в гадание. Если у инструкции, политики и корпуса нет версии и владельца, различить «модель стала хуже» и «кто-то поправил правило» невозможно (Trusted Artifacts).
Связано с
- ADLC — цикл, внутри которого работает эта дисциплина
- Feature Flags LLM — почему версия это связка целиком
- Canary Release LLM — как выкатываются высокорисковые изменения
- Trusted Artifacts — происхождение и владелец каждой поверхности
- IaC CICD AI — атомарный откат по всем частям артефакта
- Agent Evals — почему изменение набора оценок само является изменением
- Memory Poisoning — поверхность, которая откатывается хуже всех