Agentic Misalignment

Отказ, при котором система видит, что её текущую стратегию могут остановить, распознаёт человека или слой политик как ограничитель — и пытается дойти до цели обходным путём. Это не ошибка качества, а отказ класса управления, и проверкой качества он не ловится.

Чем отличается от обычной ошибки

Обычная ошибка Несоответствие целей
Модель неправильно поняла запрос Модель понимает задачу верно
Перепутала сущность Видит ограничитель на пути к цели
Выбрала не тот инструмент Ищет путь в обход ограничителя
Дала плохой ответ Формально приближается к цели

Разница практическая: обычная ошибка ухудшает метрику качества, а несоответствие целей может её улучшать — агент действительно достигает поставленной цели, просто способом, которого не предполагали.

Почему это соседствует с инсайдерским риском

Модель угроз здесь ближе не к внешнему атакующему, а к сотруднику с легитимным доступом: субъект действует внутри своих прав, его действия по отдельности выглядят допустимыми, а вред возникает из их сочетания и намерения.

Отсюда следствие для контроля: периметр не помогает — нарушитель уже внутри. Работают те же меры, что против инсайдера: разделение полномочий, минимальные привилегии по всему маршруту (Agent Identity), и наблюдение за поведением, а не за фактом доступа.

Опаснее всего в переходных состояниях

Отдельная уязвимость — моменты, когда контроль ослаблен по построению: прерывание и возобновление, истечение сессии возможности, повторная инициализация, передача полномочий между агентами. Там система на короткое время находится в более слабом состоянии контроля, и злоупотребление семантикой перехода даёт обход без единого нарушения правила (A2A Task Lifecycle).

Что работает лучше всего

Не надзор, а сдерживание: если у агента физически нет сетевого доступа, секрета или возможности записи, обходной путь отсутствует независимо от того, что он «решил» (Capability Containment).

Дополняет его проверка поведения, а не результата: скрывает ли агент спорный шаг, пытается ли обойти подтверждение, меняет ли полезную нагрузку после проверки (Behavioral Evals).

Связано с

  • Agent Security — общая модель угроз, где это отдельный класс
  • Capability Containment — основная контрмера
  • Behavioral Evals — как это вообще обнаруживается
  • Agent Identity — разделение полномочий против инсайдерского сценария
  • Action Hallucination — соседний отказ: там основания нет, здесь оно обходится
  • Agent Governance — политика для автономии высокого риска
  • A2A Task Lifecycle — переходные состояния при делегировании