Overreliance

Беглый, уверенный и хорошо структурированный ответ читается как авторитетный — и человеком, и следующим компонентом. В агентных системах это зашито в устройство: вывод одного узла попадает в следующий как факт, потому что так спроектирована передача, а не потому что кто-то решил ему поверить.

Суть

Обычная постановка — «люди слишком доверяют ИИ» — описывает половину проблемы и уводит к обучению пользователей. Вторая половина архитектурная: модель порождает вызовы инструментов, пишет код, выводит состояние системы, авторизует действия и координирует других агентов. Ошибка на любом из этих мест уходит ниже по потоку не как мнение, а как вход, и там уже никто не помнит, что источник был вероятностным.

Формулировка первоисточника прямая: в агентных архитектурах избыточное доверие часто встроено в дизайн системы.

Три формы, и вторая специфична для агентов

Необоснованная поддержка решения. Неверные или ничем не подкреплённые сведения влияют на деловое, юридическое, медицинское, финансовое или операционное решение. Классический случай, где страдает человек на выходе.

Неверный вывод о состоянии. Модель заключает, что условие выполнено, когда оно не выполнено, — и это запускает действие. Отличается от Action Hallucination тем, где именно ложь: там агент сообщает, что действие совершено, а его не было; здесь он сообщает, что предпосылка верна, и действие после этого совершается по-настоящему. Второе тише и опаснее: сбоя нет, всё отработало штатно, просто не на тех основаниях.

Выдуманный код и зависимости. Модель рекомендует несуществующий пакет; регистрация таких имён заранее — уже вектор цепочки поставки (Supply Chain AI).

Где доверие уже зашито в наши же схемы

Полезнее не рассуждать о доверии вообще, а найти места, где оно проставлено по умолчанию:

  • Вывод агента в системном сообщении. Результат исполнителя приходит соседу как системный текст, хотя по происхождению это данные (Instruction Hierarchy).
  • Само-репортируемая уверенность. Число, которое модель назвала сама, без калибровки не значит ничего, но выглядит измерением и используется как порог (Agent Routing, LLM as Judge).
  • Причина, названная маршрутизатором. Правдоподобное объяснение, а не запись хода вычисления; показанное пользователю, оно создаёт ложную подотчётность (LangGraph Intent Router).
  • Оценка судьи. Судья систематически предпочитает машинный текст человеческому, и его согласие с людьми падает раньше, чем внутренние метрики (LLM as Judge).

Общее у всех четырёх: не человек решил поверить, а передача устроена так, что вопрос о доверии не задаётся.

Атрибуция: ссылка, написанная моделью, — не доказательство

Самое механическое правило из всего разбора. Ответ RAG обязан нести ссылки на документы, из которых он собран, но ссылки берутся из метаданных поиска, а не из текста, порождённого моделью — иначе провенанс подделывается: модель напишет правдоподобный источник так же, как правдоподобный ответ.

Разница практическая: сгенерированная ссылка — это утверждение о доказательстве, а не доказательство. Следующий уровень — прослеживаемость: каждое утверждение ответа должно возводиться к конкретному найденному фрагменту, а не к документу целиком (RAG Metrics).

Калибровка вместо уговоров

Меры, которые работают, стоят вне модели и срабатывают автоматически:

  • оценка надёжности ответа отдельным механизмом, а не самоотчётом;
  • порог и запасной ответ: ниже порога система не отдаёт ответ, а переключается на заготовленное сообщение или на человека;
  • дополнительная проверка для ответов, отнесённых политикой к рискованным.

Порог здесь — это решение владельца сервиса, а не универсальная константа: он задаёт, что дороже — молчание или ошибка. Для справочного запроса дешевле ошибиться, для необратимого действия — промолчать и позвать человека (Human in the Loop).

Чего показывать пользователю не надо — объяснение, придуманное моделью. Оно неоспоримо по существу, потому что не является настоящей причиной, и потому усиливает доверие вместо того, чтобы его калибровать. Честнее показать выбранный сценарий и дать возможность его сменить.

Связано с

  • Action Hallucination — соседняя ложь: «сделал», когда не сделал
  • Instruction Hierarchy — почему вывод агента поднимается до системного уровня
  • LLM as Judge — самооценка судьи и её смещения
  • Agent Routing — само-репортируемая уверенность как гейт
  • LangGraph Intent Router — ложная подотчётность объяснения
  • RAG Metrics — прослеживаемость утверждения до фрагмента
  • Human in the Loop — куда уходит ответ ниже порога
  • Supply Chain AI — выдуманная зависимость как вектор атаки