Support Escalation Ladder

Лестница обработки ошибок AI-сервиса в проде: пять уровней от автоматического повтора генерации до разработчиков. Классические L1–L2–L3 остаются, но снизу к ним добавляются две ступени, которых нет в обычной разработке, — и именно они принимают на себя основную массу сбоев.

Суть

Когда агент ошибается в продакшене, вопрос не «кто виноват», а «на каком уровне это чинится дешевле всего». Человек — самый дорогой ресурс в цепочке, поэтому задача архитектуры в том, чтобы до него доходило как можно меньше.

Уровень Кто разбирает Что делает
1 Продукт сам Повторная генерация, встроенная в интерфейс
2 Продукт сам Самообучение: knowledge-centered, prompt evolution, self-learning
3 Человек L1 Первая линия поддержки
4 Человек L2 Вторая линия
5 Человек L3 Разработка и ML-инженеры

Первые две ступени — надстройка над привычной схемой поддержки, появившаяся именно из-за недетерминизма модели: часть ошибок исчезает при повторе, и тратить на них человека бессмысленно.

Уровень 1: повторная генерация

Самый дешёвый уровень. Пользователю (или автоматике по вердикту LLM as Judge) даётся возможность перегенерировать ответ.

Повтор лучше делать с повышенной температурой — иначе модель воспроизведёт тот же ход рассуждений и ту же ошибку. Чуть больше разброса даёт заметно более отличающийся результат. Работает не везде: на задачах со строгим форматом рост температуры вредит, поэтому приём надо проверять на своих сценариях.

Уровень 2: самообучение

Система накапливает разобранные случаи и подтягивает их в работу: обновление базы знаний по разобранным обращениям (knowledge-centered support), эволюция промптов, дообучение на собранном фидбэке. Ошибка одного пользователя перестаёт быть ошибкой для следующих.

Самообучающийся уровень нельзя оценивать им же самим. Если на уровне 2 система пополняет базу своими удачными ответами, а критерий удачности определяет она сама, ошибка, признанная удачей, закрепляется и начинает воспроизводиться — с каждым циклом увереннее. Это тот же механизм, из-за которого агенты хвалят собственную работу (Generator Evaluator).

Две меры, обе обязательные. Первая — внешний фиксированный набор, который не пополняется автоматически: golden set проверяет систему после каждого пополнения базы, и падение на нём означает, что в базу попало плохое (Agent Evals). Второе — источник истины для пополнения не сама система: в базу уходит то, что подтвердил человек на уровне 3 или детерминированная проверка, а не то, что понравилось модели.

Отдельный сигнал в мониторинг: доля обращений, закрытых на уровне 2 после того, как ранее по той же теме была эскалация. Рост означает, что уровень начал перехватывать то, что раньше уходило людям, — и это либо успех обучения, либо начало закрепления ошибки, различить можно только по golden set.

Правила эскалации

Наверх запрос уходит, когда:

  • модель показывает низкую уверенность в ответе;
  • запрос попадает в irreversible-зону — действие нельзя откатить (перевод денег, отправка письма клиенту, удаление данных);
  • по одному типу запроса ошибка повторяется — значит, дело не в случайности;
  • запрос явно выходит за границы задачи агента.

Первый и второй пункты связаны с Human in the Loop: там же, где технически ставится interrupt(), организационно начинается человеческая линия.

Зоны ответственности в команде

Переход из демо в продакшен рождает набор ролей, которых у прототипа не было. Границы стоит зафиксировать заранее, иначе инцидент начинается со спора, чей он:

За что отвечает Кто
Качество ответов, промпты ML-инженеры, промпт-инженеры
Доступность, инфраструктура DevOps
Бизнес-результат, клиент Product Owner и поддержка
Безопасность Отдельная роль (Agent Security)

Отраслевые цифры: сколько реально закрывается без человека

Сверка 2026-08 — цифры есть, но пользоваться ими надо осторожно, потому что в отрасли систематически путают две разные метрики.

Deflection — не resolution. Deflection считает обращения, которых не коснулся человек; resolution считает решённые проблемы. Разница принципиальная: обращение, где пользователь плюнул и ушёл, попадает в deflection и не попадает в resolution. В маркетинговых материалах их регулярно смешивают, поэтому одну и ту же цифру подают как обе метрики сразу.

Ориентиры 2026 года: медиана deflection первого уровня — 41.2% по корпоративным программам, верхний квартиль 58.7%. По resolution диапазоны зависят от зрелости: 30-50% у ранних внедрений, 50-70% у зрелых процессов, 70-85% у глубоко интегрированных агентов, которые совершают действия, а не только отвечают.

Разброс по типам обращений больше, чем между компаниями. Структурированные интенты с понятной системой-источником истины — возврат средств, сброс пароля, статус заказа — закрываются на 65-80% и выше. Неоднозначные жалобы редко переваливают 25%. Поэтому средняя доля по продукту почти ничего не говорит: она отражает состав обращений, а не качество системы, и сравнивать себя с чужой средней бессмысленно.

Для экономики полезнее третья цифра: стоимость решения — около $0.62 автоматического против $7.40 с участием человека. Именно она, а не доля, определяет окупаемость (Unit Economics AI).

Чего эта лестница не ловит

Семантические ошибки: ответ синтаксически корректен, проходит все валидаторы формата и при этом неверен по сути. Такое возникает не от поломки, а от нехватки контекста, и ни один тест на схему его не поймает. Средства против них другие — обогащение контекста до генерации, второй проход через независимый верификатор, выборочный человеческий аудит именно смысла (см. Agent Failure Modes).

Связано с

  • AgentOps — эксплуатация AI-сервиса, частью которой является эта лестница
  • Human in the Loop — техническая механика того же перехода к человеку
  • Agent Failure Modes — типология сбоев, которые распределяются по уровням
  • Unit Economics AI — стоимость поддержки как слагаемое цены запроса
  • LLM as Judge — автоматический вердикт на первом уровне