Суть
С ростом возможностей агента растёт не только вероятность ошибки, но и радиус поражения. Подтверждениями это не удерживается: пользователь, видящий десятки запросов на одобрение, начинает подтверждать почти автоматически, и надзор превращается из контроля в ритуал (Human in the Loop).
Отсюда вопрос, через который стоит перечитывать любую модель угроз: что агент физически способен сделать, даже если модель ошиблась, а подтверждающий устал?
Это не отменяет подтверждение, а ставит его на место. Подтверждение решает, можно ли выполнить действие. Сдерживание ограничивает ущерб, если это решение оказалось ошибочным, неполным или атакованным.
Пять архитектурных пределов
Для каждой рискованной возможности задаются не только правила одобрения, но и границы среды:
- Контроль исходящих соединений — куда среда исполнения вообще может подключаться.
- Область файловой системы — какие каталоги, монтирования и снимки доступны.
- Область учётных данных — какие токены существуют внутри этого запуска и как быстро истекают (JIT Secret Inversion).
- Граница отката — что можно откатить без восстановления всей системы.
- Граница аудита — какие события остаются видимыми без доступа к пользовательским данным.
Первые три отвечают на вопрос «что доступно», четвёртый — «что поправимо», пятый — «что можно доказать, не нарушая приватность».
Почему это сильнее надзора
Надзор — вероятностная мера: он работает, пока человек внимателен, а внимание расходуется. Сдерживание — детерминированная: недоступный сетевой адрес недоступен независимо от того, что решила модель, что написал пользователь и сколько подтверждений он уже нажал сегодня.
Практическое следствие для проектирования: детерминированная среда обязана ограничить возможность до того, как модель, пользователь или внешний контент начнут спорить о допустимости конкретного шага. Спор о допустимости имеет смысл только внутри уже ограниченного множества.
Граница отката как проектное решение
Из пяти пределов этот чаще всего не задают вовсе, а он определяет цену ошибки. Вопрос формулируется до запуска: какое множество действий система умеет отменить самостоятельно, и где начинается зона, требующая восстановления из резервной копии или ручного разбора.
Действие вне границы отката — кандидат на обязательное подтверждение независимо от его класса риска, потому что цена ошибки там не ограничена сверху (Approval Path).
Связано с
- Agent Sandboxing — техническая реализация изоляции исполнения
- Human in the Loop — почему одних подтверждений недостаточно
- Trust Boundary Agent — рубежи, внутри которых работает сдерживание
- JIT Secret Inversion — область и срок жизни учётных данных
- Approval Path — что решает подтверждение, а что нет
- Tool Hijacking — угроза, чей радиус ограничивается этими пределами
- Agent Governance — пропорциональность контролей уровню автономии