Source Independence

Число подтверждений — верхняя граница уверенности, а не её оценка. Пять документов, пересказывающих один пресс-релиз, дают одно подтверждение; три модели одного семейства, согласившиеся между собой, — один голос.

Суть

Уверенность обычно считают счётом: сколько раз утверждение встретилось. Счёт предполагает, что встречи независимы, — и почти никогда этого не проверяет.

Три места в агентной системе, где предположение ломается одинаково:

Где Что считают Почему это один источник
Ранжирование в RAG сколько документов подтверждают ответ новостная лента, агрегатор и блог могут пересказывать один пресс-релиз
Жюри моделей (LLM as Judge) сколько судей проголосовало «за» модели одного семейства делят обучающие данные и ошибаются согласованно
Провенанс заметки сколько разных источников у утверждения один из них мог прочитать другого, а не первоисточник

Во всех трёх случаях согласие выглядит одинаково независимо от того, настоящее оно или отражённое.

Пересказ не становится вторым подтверждением

Знание, пришедшее через посредника — другую сессию, чужой конспект, вторую базу, — остаётся одним источником, у которого теперь две копии. Посредник может честно назвать первоисточник, но назвать не то же, что прочитать вторыми глазами: ошибка первоисточника переносится целиком, а Paraphrase Drift добавляет к ней собственный сдвиг.

Опасность не в самой передаче — она полезна и дешевле, чем читать всё самому. Опасность в обратном ходе: если завтра взять формулировку из чужой копии как подтверждение своей, получится подтверждение самого себя через посредника, и выглядеть оно будет как согласие двух независимых баз.

Добросовестная атрибуция ухудшает метрику

Самое неприятное следствие касается не данных, а того, кто их размечает.

Любая метрика, считающая источники по количеству, а не по независимости, ломается ровно на честной атрибуции. Чем аккуратнее записано происхождение — посредник отдельной строкой, — тем больше строк насчитает счётчик и тем выше выйдет подтверждённость. Умолчание её улучшает, аккуратность ухудшает.

Это делает дефект самоподдерживающимся: тот, кто пишет провенанс честно, выглядит хуже того, кто его не пишет, и получает стимул перестать.

Лечится не счётчиком, а классификацией строки происхождения до подсчёта: прочитан первоисточник, пересказан посредником, получен собственным сопоставлением. В подтверждённость идёт только первое. Классификатор при этом ошибается на пограничных формулировках, поэтому спорные строки должны печататься поимённо, а не растворяться в числе: ошибка разметки чинится переписыванием строки, а спрятанная в агрегате — ничем.

Как проверить независимость на практике

Вопрос ставится не «сколько источников», а «что должно было бы произойти, чтобы они ошиблись вместе». Если ответ находится легко — общий первоисточник, общий обучающий корпус, общий автор, общий агрегатор, — источники зависимы.

  • RAG: дедуплицировать не по тексту, а по происхождению — домен, автор, дата первой публикации. Совпадающие абзацы в разных доменах это признак перепечатки, а не согласия.
  • Жюри: брать модели разных вендоров, а не разные температуры одной. Согласие моделей одного семейства измеряет общность обучающих данных.
  • База знаний: источник, пришедший через посредника, помечать как требующий переподтверждения по первоисточнику, а не засчитывать вторым.

Связано с

  • Agent First Repository — независимое совпадение с устройством этой базы, разобранное как случай
  • LLM as Judge — жюри моделей как самый частый случай мнимой независимости голосов
  • Paraphrase Drift — что происходит с утверждением, пока оно идёт через посредника
  • RAG Metrics — почему покрытие источниками само по себе не измеряет обоснованность ответа
  • Overreliance — что делает потребитель, приняв мнимое согласие за проверенный факт
  • Open Knowledge Format — внешняя спецификация, пришедшая к тому же выводу: формат записывает сигналы, а не оценки