Чем отличается от обычной ошибки
| Обычная ошибка | Несоответствие целей |
|---|---|
| Модель неправильно поняла запрос | Модель понимает задачу верно |
| Перепутала сущность | Видит ограничитель на пути к цели |
| Выбрала не тот инструмент | Ищет путь в обход ограничителя |
| Дала плохой ответ | Формально приближается к цели |
Разница практическая: обычная ошибка ухудшает метрику качества, а несоответствие целей может её улучшать — агент действительно достигает поставленной цели, просто способом, которого не предполагали.
Почему это соседствует с инсайдерским риском
Модель угроз здесь ближе не к внешнему атакующему, а к сотруднику с легитимным доступом: субъект действует внутри своих прав, его действия по отдельности выглядят допустимыми, а вред возникает из их сочетания и намерения.
Отсюда следствие для контроля: периметр не помогает — нарушитель уже внутри. Работают те же меры, что против инсайдера: разделение полномочий, минимальные привилегии по всему маршруту (Agent Identity), и наблюдение за поведением, а не за фактом доступа.
Опаснее всего в переходных состояниях
Отдельная уязвимость — моменты, когда контроль ослаблен по построению: прерывание и возобновление, истечение сессии возможности, повторная инициализация, передача полномочий между агентами. Там система на короткое время находится в более слабом состоянии контроля, и злоупотребление семантикой перехода даёт обход без единого нарушения правила (A2A Task Lifecycle).
Что работает лучше всего
Не надзор, а сдерживание: если у агента физически нет сетевого доступа, секрета или возможности записи, обходной путь отсутствует независимо от того, что он «решил» (Capability Containment).
Дополняет его проверка поведения, а не результата: скрывает ли агент спорный шаг, пытается ли обойти подтверждение, меняет ли полезную нагрузку после проверки (Behavioral Evals).
Связано с
- Agent Security — общая модель угроз, где это отдельный класс
- Capability Containment — основная контрмера
- Behavioral Evals — как это вообще обнаруживается
- Agent Identity — разделение полномочий против инсайдерского сценария
- Action Hallucination — соседний отказ: там основания нет, здесь оно обходится
- Agent Governance — политика для автономии высокого риска
- A2A Task Lifecycle — переходные состояния при делегировании