Суть
Когда агент ошибается в продакшене, вопрос не «кто виноват», а «на каком уровне это чинится дешевле всего». Человек — самый дорогой ресурс в цепочке, поэтому задача архитектуры в том, чтобы до него доходило как можно меньше.
| Уровень | Кто разбирает | Что делает |
|---|---|---|
| 1 | Продукт сам | Повторная генерация, встроенная в интерфейс |
| 2 | Продукт сам | Самообучение: knowledge-centered, prompt evolution, self-learning |
| 3 | Человек L1 | Первая линия поддержки |
| 4 | Человек L2 | Вторая линия |
| 5 | Человек L3 | Разработка и ML-инженеры |
Первые две ступени — надстройка над привычной схемой поддержки, появившаяся именно из-за недетерминизма модели: часть ошибок исчезает при повторе, и тратить на них человека бессмысленно.
Уровень 1: повторная генерация
Самый дешёвый уровень. Пользователю (или автоматике по вердикту LLM as Judge) даётся возможность перегенерировать ответ.
Повтор лучше делать с повышенной температурой — иначе модель воспроизведёт тот же ход рассуждений и ту же ошибку. Чуть больше разброса даёт заметно более отличающийся результат. Работает не везде: на задачах со строгим форматом рост температуры вредит, поэтому приём надо проверять на своих сценариях.
Уровень 2: самообучение
Система накапливает разобранные случаи и подтягивает их в работу: обновление базы знаний по разобранным обращениям (knowledge-centered support), эволюция промптов, дообучение на собранном фидбэке. Ошибка одного пользователя перестаёт быть ошибкой для следующих.
Самообучающийся уровень нельзя оценивать им же самим. Если на уровне 2 система пополняет базу своими удачными ответами, а критерий удачности определяет она сама, ошибка, признанная удачей, закрепляется и начинает воспроизводиться — с каждым циклом увереннее. Это тот же механизм, из-за которого агенты хвалят собственную работу (Generator Evaluator).
Две меры, обе обязательные. Первая — внешний фиксированный набор, который не пополняется автоматически: golden set проверяет систему после каждого пополнения базы, и падение на нём означает, что в базу попало плохое (Agent Evals). Второе — источник истины для пополнения не сама система: в базу уходит то, что подтвердил человек на уровне 3 или детерминированная проверка, а не то, что понравилось модели.
Отдельный сигнал в мониторинг: доля обращений, закрытых на уровне 2 после того, как ранее по той же теме была эскалация. Рост означает, что уровень начал перехватывать то, что раньше уходило людям, — и это либо успех обучения, либо начало закрепления ошибки, различить можно только по golden set.
Правила эскалации
Наверх запрос уходит, когда:
- модель показывает низкую уверенность в ответе;
- запрос попадает в irreversible-зону — действие нельзя откатить (перевод денег, отправка письма клиенту, удаление данных);
- по одному типу запроса ошибка повторяется — значит, дело не в случайности;
- запрос явно выходит за границы задачи агента.
Первый и второй пункты связаны с Human in the Loop: там же, где технически ставится interrupt(), организационно начинается человеческая линия.
Зоны ответственности в команде
Переход из демо в продакшен рождает набор ролей, которых у прототипа не было. Границы стоит зафиксировать заранее, иначе инцидент начинается со спора, чей он:
| За что отвечает | Кто |
|---|---|
| Качество ответов, промпты | ML-инженеры, промпт-инженеры |
| Доступность, инфраструктура | DevOps |
| Бизнес-результат, клиент | Product Owner и поддержка |
| Безопасность | Отдельная роль (Agent Security) |
Отраслевые цифры: сколько реально закрывается без человека
Сверка 2026-08 — цифры есть, но пользоваться ими надо осторожно, потому что в отрасли систематически путают две разные метрики.
Deflection — не resolution. Deflection считает обращения, которых не коснулся человек; resolution считает решённые проблемы. Разница принципиальная: обращение, где пользователь плюнул и ушёл, попадает в deflection и не попадает в resolution. В маркетинговых материалах их регулярно смешивают, поэтому одну и ту же цифру подают как обе метрики сразу.
Ориентиры 2026 года: медиана deflection первого уровня — 41.2% по корпоративным программам, верхний квартиль 58.7%. По resolution диапазоны зависят от зрелости: 30-50% у ранних внедрений, 50-70% у зрелых процессов, 70-85% у глубоко интегрированных агентов, которые совершают действия, а не только отвечают.
Разброс по типам обращений больше, чем между компаниями. Структурированные интенты с понятной системой-источником истины — возврат средств, сброс пароля, статус заказа — закрываются на 65-80% и выше. Неоднозначные жалобы редко переваливают 25%. Поэтому средняя доля по продукту почти ничего не говорит: она отражает состав обращений, а не качество системы, и сравнивать себя с чужой средней бессмысленно.
Для экономики полезнее третья цифра: стоимость решения — около $0.62 автоматического против $7.40 с участием человека. Именно она, а не доля, определяет окупаемость (Unit Economics AI).
Чего эта лестница не ловит
Семантические ошибки: ответ синтаксически корректен, проходит все валидаторы формата и при этом неверен по сути. Такое возникает не от поломки, а от нехватки контекста, и ни один тест на схему его не поймает. Средства против них другие — обогащение контекста до генерации, второй проход через независимый верификатор, выборочный человеческий аудит именно смысла (см. Agent Failure Modes).
Связано с
- AgentOps — эксплуатация AI-сервиса, частью которой является эта лестница
- Human in the Loop — техническая механика того же перехода к человеку
- Agent Failure Modes — типология сбоев, которые распределяются по уровням
- Unit Economics AI — стоимость поддержки как слагаемое цены запроса
- LLM as Judge — автоматический вердикт на первом уровне