Как узнать, действительно ли ИИ-агент использовал правильные доказательства

ИИ-агент может цитировать источники, извлекать документы и всё равно использовать неподходящие доказательства. Источник может быть авторитетным, но не иметь отношения к конкретному утверждению. Найденный фрагмент может подтверждать ответ лишь частично. Корректный источник может оказаться устаревшим, замененным или применимым к другой юрисдикции, версии продукта, пользователю или состоянию системы. Это создает более сложную проблему оценки, чем простая проверка цитирования: действительно ли агент использовал правильные доказательства для сделанного им утверждения?
Почему одних цитат недостаточно
Цитата отвечает лишь на узкий вопрос: связала ли система утверждение или ответ с источником. Она не гарантирует автоматически, что источник подтверждает конкретное утверждение, что источник достаточно авторитетен для данной задачи, что цитируемый фрагмент содержит необходимое условие или исключение, или что модель опиралась именно на это доказательство, а не сгенерировала ответ на основе ранее заложенных знаний.
Руководство Anthropic по оценке исследовательских агентов явно разграничивает обоснованность, полноту охвата и качество источников. Руководство OpenAI по оценке агентов аналогично делает акцент на трассировках выполнения, поскольку итоговый результат не показывает, выбрал ли агент правильные инструменты и следовал ли он намеченному процессу. Эти идеи подводят к более широкому выводу: качество доказательств — это свойство пути выполнения, а не просто финального текста.
Четыре вопроса, которым должно соответствовать каждое существенное утверждение
| Критерий | Вопрос | Типичная ошибка |
|---|---|---|
| Подтверждение утверждения | Подтверждает ли доказательство именно это конкретное утверждение напрямую? | Источник связан по теме, но не доказывает само утверждение |
| Авторитетность доказательства | Подходит ли этот источник для утверждений такого рода? | Используется вторичный пересказ там, где требуется первоисточник или данные из действующей системы |
| Применимость | Применимо ли доказательство к данному времени, версии, юрисдикции, пользователю, состоянию или выборке? | Истинное утверждение применяется за пределами условий его действия |
| Использование доказательства | Было ли это доказательство действительно доступно и использовано в процессе работы агента? | Итоговый ответ верен, но найденное доказательство не относилось к делу или не было использовано |
1. Подтверждение утверждения: доказывает ли источник то, о чем говорит агент?
Доказательства следует оценивать на уровне отдельных утверждений. Документ может соответствовать теме и при этом не подтверждать конкретную мысль. Если в источнике сказано, что функция доступна в отдельных регионах, ответ «функция доступна по всему миру» не подтвержден, даже если ссылка выглядит правдоподобно.
Именно здесь общие оценки «обосновано / не обосновано» часто оказываются слишком поверхностными. Разбейте ответ на существенные утверждения, сопоставьте каждое с наименьшим фрагментом доказательства, подтверждающим его, и классифицируйте связь: прямое подтверждение, частичное подтверждение, противоречие или отсутствие подтверждения.
2. Авторитетность доказательства: подходит ли такой тип источника?
Правильный выбор доказательств определяется не только смысловой релевантностью. Источник должен подходить для принятия решения. Текущий статус аккаунта должен браться из системы учетных записей, а не из старого письма. Утверждение о поведении API желательно сверять с актуальной документацией вендора или воспроизводимым поведением. Для юридического требования может потребоваться действующий закон, регламент или официальные разъяснения регулятора, а не статья в блоге общего характера.
Авторитетность источника зависит от задачи. Сообщение от сообщества пользователей может служить лучшим доказательством реальной ошибки, которую вендор не признает в документации. Заявление вендора может быть авторитетным в отношении его собственных планов, но слабым аргументом при независимой оценке производительности. Поэтому оценщику необходима четкая иерархия источников для конкретной задачи, а не единый универсальный балл авторитетности.
3. Применимость: правильные доказательства, неверные условия
Самые опасные ошибки доказательной базы — это зачастую не выдуманные источники, а подлинные материалы, использованные вне рамок их применимости. Рекомендация может измениться в зависимости от версии ПО, даты, юрисдикции, ревизии оборудования, прав пользователя, доступности продукта, текущего состояния игры, конфигурации тенанта или других параметров среды.
Для каждого значимого источника сохраняйте условия, определяющие его актуальность. Это особенно важно после обобщения (саммаризации): сжатая память или цитата могут сохранить вывод, потеряв при этом исключение, дату или обязательное предварительное условие, которые делали этот вывод верным.
4. Использование доказательств: опирался ли агент на них в действительности?
Ответ может быть правильным, даже если этап поиска (retrieval) завершился сбоем. Модель может уже знать ответ, вывести его из несвязанного контекста или просто угадать. Если оценка проверяет только итоговую правильность, может показаться, что система надежно обосновывает свои выводы, хотя цепочка доказательств нарушена.
Чтобы оценить использование доказательств, проанализируйте трейс выполнения. Проверьте, какие источники были получены, какие фрагменты попали в контекст модели, когда именно они стали доступны и можно ли объяснить итоговое утверждение этими входными данными. Современные инструменты OpenAI для оценки агентов делают упор на анализ трейсов именно потому, что поведение на уровне рабочего процесса невозможно надежно восстановить только по итоговому ответу.
Тест на использование доказательств
Практическую оценку можно построить как контролируемый контрфактический эксперимент. Вместо того чтобы просто проверять правильность ответа, измените доказательства и проследите, изменится ли утверждение в ожидаемом направлении.
Тест на использование доказательств
Матрица «утверждение — доказательство» полезнее простого списка источников
| Утверждение | Доказательство | Подтверждение | Авторитетность | Применимость | Использовано в трейсе |
|---|---|---|---|---|---|
| Функция X доступна | Документация вендора | Прямое | Высокая для заявления о доступности | Текущая версия и регион должны совпадать | Да / Нет |
| Конфигурация Y быстрее | Бенчмарк вендора | Частичное | Высокая для тестов вендора, но не для независимой производительности | Оборудование и нагрузка должны совпадать | Да / Нет |
| Политика применяется к этому пользователю | Текущая политика + статус аккаунта | Прямое только в совокупности | Высокая | Юрисдикция, дата, роль и статус аккаунта должны совпадать | Да / Нет |
| Товар есть в наличии | API складских остатков в реальном времени | Прямое | Авторитетно для текущего остатка | Быстро устаревает | Да / Нет |
Эта матрица поднимает ряд вопросов, которые скрывает стандартная проверка цитирования. Одному утверждению может требоваться несколько источников. Один источник может подтверждать лишь часть утверждения. Авторитетный источник может иметь короткое окно актуальности. А превосходный источник окажется бесполезным, если он так и не попал в цепочку выполнения.
Разделяйте качество поиска и качество доказательств
Метрики поиска определяют, были ли найдены и отранжированы релевантные материалы. Оценка доказательств определяет, обосновывают ли эти материалы полученные утверждения. Эти аспекты взаимосвязаны, но не идентичны.
Успешный поиск не равен качественному доказательству
| Ситуация | Поиск (Retrieval) | Качество доказательств | |
|---|---|---|---|
| Правильный документ, неверное утверждение | |||
| Правильный факт, устаревший источник | |||
| Слабый источник, правильный ответ | |||
| Требуется несколько источников |
Оценивайте качество источников по критериям, а не по белому списку доменов
Жестко заданные списки «доверенных доменов» заманчивы, но часто неэффективны. Качество источника должно зависеть от типа утверждения. Среди полезных критериев: первичный или вторичный статус, актуальность, прямота данных, воспроизводимость, независимость, экспертиза в предметной области, происхождение данных, частота обновлений, а также наличие у источника мотива преувеличивать факты.
Руководство Anthropic по оценке исследовательских агентов явно выделяет проверку качества источников наряду с обоснованностью (groundedness) и полнотой охвата. Соответственно, на практике следует оценивать как то, что именно сообщает источник, так и то, подходит ли этот источник для подобных заявлений.
Полнота доказательств: подтверждения требует каждое важное утверждение, а не каждое предложение
Не каждое предложение требует ссылки на источник. Переходные фразы, арифметические вычисления, явно выведенные из приведенных значений, или четко обозначенная интерпретация могут не требовать отдельного источника. Но каждое существенное утверждение, поддающееся внешней проверке, должно иметь достаточное подтверждение, чтобы оценщик мог восстановить, на каком основании агенту было разрешено его сделать.
Поэтому покрытие доказательствами должно взвешиваться с учетом важности утверждения. Отсутствие подтверждения для декоративной детали не эквивалентно отсутствию подтверждения для цены, решения о соответствии критериям, инструкции по безопасности, юридического требования, заявления о технической совместимости или факта, лежащего в основе рекомендации.
Происхождение доказательств должно сохраняться при суммаризации и записи в память
Долго работающие агенты часто суммаризируют предыдущую работу или записывают долговременные воспоминания. Если в ходе этой трансформации происхождение доказательств утрачивается, будущие агенты могут извлечь четкий вывод, не зная, был ли он получен из слов пользователя, работающего в реальном времени API, старого документа, логического вывода модели или непроверенного результата из интернета.
Для важных фактов сохраняйте как минимум идентификатор источника, время извлечения или наблюдения, тип доказательства, соответствующую версию или состояние, а также пометку о том, является ли сохраненный текст цитатой, суммаризацией, логическим выводом или производным значением. Именно происхождение позволяет последующему агенту решить, следует ли доверять доказательству, обновить его, ограничить или отбросить.
Практическая запись доказательства
| Поле | Назначение |
|---|---|
| claim_id | Идентифицирует подтверждаемое существенное утверждение |
| source_id / source_url / system | Идентифицирует источник происхождения доказательства |
| evidence_span | Сохраняет наименьший фрагмент текста, запись или результат вызова инструмента, подтверждающий утверждение |
| retrieved_at / observed_at | Позволяет проверять актуальность и временную последовательность |
| source_version / object_version | Позволяет проверять замещение версий и воспроизводимость |
| authority_role | Объясняет, почему этот источник подходит для данного утверждения |
| applicability | Хранит применимую дату, юрисдикцию, версию продукта, пользователя, тенанта, состояние или другие условия |
| transformation | Указывает, являются ли доказательства необработанными, процитированными, суммаризированными, нормализованными или производными |
| trace_step | Показывает, в какой момент доказательство стало доступно агенту |
| support_status | Прямое, частичное, противоречивое, неподтвержденное или неопределенное |
Режимы сбоев, выглядящие обоснованными, но не являющиеся таковыми
| Режим сбоя | Почему это вводит оценщиков в заблуждение | Что проверять |
|---|---|---|
| Декоративные ссылки | Ответ содержит источники, поэтому выглядит глубоко исследованным | Сопоставляйте каждое существенное утверждение с точным подтверждающим фрагментом |
| Несоответствие авторитетности | Источник надежен, но не авторитетен в отношении конкретного факта | Определите иерархию источников для каждого конкретного типа утверждений |
| Временное несоответствие | Источник был верен на момент публикации | Проверяйте время извлечения, дату источника и наличие замещающих данных |
| Утрата условий | Суммаризация сохраняет вывод, но опускает исключения | Сравнивайте сгенерированное утверждение с полным локальным контекстом источника |
| Постфактум-ссылки | Правдоподобный источник прикрепляется уже после формирования ответа | Проверяйте последовательность в трейсе и предшествовало ли появление доказательства утверждению |
| Параметрическое переопределение | Модель игнорирует извлеченные доказательства и отвечает на основе априорных знаний | Проводите контрфактические тесты использования доказательств |
| Отмывание доказательств | Логический вывод модели суммаризируется и позже сохраняется как факт из первоисточника | Сохраняйте тип трансформации и происхождение при любых записях в память |
| Ложная опора на большинство источников | Несколько вторичных страниц повторяют одно и то же неподтвержденное утверждение | Прослеживайте утверждения вплоть до независимых или первичных доказательств |
Как оценивать агента в производственной среде
Пайплайн оценки доказательств
Актуальные рекомендации OpenAI по оценке предлагают использовать специализированные тесты под конкретные задачи, непрерывное оценивание, датасеты на основе производственных данных и трейсы для отладки поведения агентов. Anthropic аналогично рекомендует комбинировать различные типы оценщиков для исследовательских агентов, поскольку корректность, качество источников, полнота покрытия и обоснованность — это отдельные независимые аспекты. Оценка доказательств должна следовать тому же принципу: несколько узконаправленных оценщиков дают больше диагностической пользы, чем единая непрозрачная оценка «качества».
Не делайте LLM-судью единственным оценщиком доказательств
Оценщики на базе LLM полезны для масштабируемой классификации утверждений, проверок на релевантность и попарных сравнений, но они могут иметь те же слепые зоны, что и оцениваемая ими система. Такой оценщик может принять правдоподобное, но неподтвержденное утверждение, пропустить тонкую границу между версиями или переоценить красиво оформленный источник.
Рекомендации OpenAI по оценке советуют калибровать автоматических оценщиков по оценкам человека и применять четкие, узко очерченные критерии. Для систем с высокой плотностью доказательств следует везде, где это возможно, использовать детерминированные проверки: временные метки, версии объектов, область прав доступа, точные идентификаторы источников, порядок извлечения, хеши документов и наличие доказательства до того, как модель сгенерировала утверждение.
Что может изменить этот ответ?
Оценка может быть проще, когда агент работает с небольшим, неизменяемым, авторитетным корпусом данных, а каждый ответ носит строго экстрактивный характер. В таких условиях авторитетность и применимость источников практически фиксированы, и сопоставления утверждения с подтверждающим фрагментом может быть достаточно.
Оценка обязана становиться строже, когда агент объединяет веб-поиск, долговременную память, динамические инструменты, несколько юрисдикций, быстро меняющуюся информацию, специфичное для пользователя состояние или автономные действия. В подобных системах валидность доказательств зависит не только от текста источника, но и от того, когда и как именно доказательство было получено.
Будущие модели могут научиться лучше отслеживать происхождение данных и неопределенность на внутреннем уровне, но это не устранит необходимость во внешних записях подтверждений в системах, требующих аудируемости. Система не должна полагаться на самоотчет модели о том, что именно на нее повлияло, когда трассировки и метаданные источников могут предоставить более убедительные доказательства.
Ограничения
Доказать причинно-следственное использование свидетельств только на основе трассировок возможно не всегда. Источник может присутствовать в контексте, не влияя на ответ, а модель может независимо знать тот же самый факт. Контрфактические тесты усиливают логический вывод, но сами по себе могут изменять распределение задач.
Авторитетность источника также может быть спорной или зависеть от предметной области. У некоторых вопросов нет единого авторитетного источника, и эксперты могут расходиться во мнениях относительно того, какие свидетельства заслуживают большего веса. В таких случаях оценщику следует фиксировать разногласия и оценивать прозрачность, полноту охвата и логику рассуждений по явным критериям, а не делать вид, будто существует один неоспоримый источник истины.
Заключение
Вопрос «Сослался ли агент на источник?» слишком слаб для продакшн-систем ИИ. Гораздо важнее другой вопрос: исходит ли каждое существенное утверждение из подтверждения, которое действительно его подкрепляет, обладает надлежащей авторитетностью, все еще применимо к текущим условиям и присутствовало в пути выполнения до того, как утверждение было сформулировано?
Это превращает свидетельства из простого декоративного элемента в оцениваемое системное свойство. Фиксируйте трассировку. Сопоставляйте утверждения со свидетельствами. Проверяйте авторитетность и применимость. Проводите контрфактические тесты свидетельств. Сохраняйте происхождение данных через суммаризации и память. Тогда правильный ответ станет не просто правдоподобным — за ним появится путь обоснования, который можно проверить.
Часто задаваемые вопросы
Оценка использования свидетельств в ИИ-агентах
Доказывает ли цитата, что ответ ИИ обоснован?
Как проверить, действительно ли ИИ-агент использовал извлеченные свидетельства?
В чем разница между обоснованностью (groundedness) и качеством источника?
Почему реальный источник все равно может привести к неверному ответу ИИ?
Что необходимо логировать для оценки использования свидетельств?
Глоссарий
Ключевые термины оценки свидетельств
- Подтверждение утверждения (Claim support)
- Степень, в которой конкретный фрагмент свидетельства напрямую доказывает сгенерированное утверждение.
- Применимость (Applicability)
- Условия, при которых свидетельство сохраняет валидность для утверждения, включая временные рамки, версию, юрисдикцию, пользователя, группу населения, состояние системы или другие границы.
- Утилизация свидетельств (Evidence utilization)
- Показатель того, действительно ли выходные данные агента реагируют на свидетельства, предоставленные на пути выполнения, и зависят ли от них.
- Контрфактический тест свидетельств (Counterfactual evidence test)
- Метод оценки, при котором решающее свидетельство удаляется, заменяется или модифицируется, чтобы проверить, изменится ли утверждение агента соответствующим образом.
- Происхождение данных (Provenance)
- Метаданные, фиксирующие, откуда поступило свидетельство, когда оно было получено, как трансформировалось и какую версию или состояние представляло.
Первоисточники и материалы для дальнейшего чтения
OpenAI — Оценка рабочих процессов агентов (Evaluate Agent Workflows)Руководство по оценке трассировок, тестированию на уровне рабочих процессов, датасетам и воспроизводимым запускам проверок для агентов.
OpenAI — Лучшие практики оценки (Evaluation Best Practices)Рекомендации по оценкам под конкретные задачи, датасетам на основе продакшна, специализированным метрикам, непрерывной оценке и калибровке грейдеров.
Anthropic — Демистификация оценок для ИИ-агентов (Demystifying Evals for AI Agents)Руководство по оценке агентов, включая проверки обоснованности, полноты охвата и качества источников для исследовательских агентов.
OpenAI — Единый сборник методик для надежных независимых оценок (A Shared Playbook for Trustworthy Third-Party Evaluations)Руководство по оценке, подчеркивающее, что эффективность современных агентов зависит от рабочего процесса и среды, а не только от финального ответа модели.
Related Articles

Quectel RM500U-EA в ZBT Z8102AX: диапазоны 5G, o2 Germany и поведение сигнала в реальных условиях
ZBT Z8102AX использует модем Quectel RM500U-EA для подключения 4G и 5G. В первом практическом тесте роутер успешно подключился к o2 Germany с LTE Band 3 и NR n28. Модем работает, но более глубокая диагностика, такая как RSRP, RSRQ, SINR, блокировка диапазонов и поведение сот, все еще требует надлежащего тестирования.

Что ИИ-агент должен помнить, забывать, перевычислять или извлекать повторно?
Долгоживущие агенты не должны помнить всё. В этой статье представлена практическая модель жизненного цикла для определения того, что относится к долговременной памяти, что следует извлекать повторно, что безопаснее пересчитать, а что должно истечь по сроку действия или быть заменено.

Граница достоверности ответа: недостающий слой между релевантностью и надёжными ответами ИИ
Источник может быть релевантным, авторитетным и при этом неверным для задаваемого вопроса. Недостающий слой — применимость: условия, при которых ответ остаётся в силе, и изменения, вынуждающие пересмотреть его. В этой статье вводится понятие «Граница действительности ответа» как паттерн проектирования источников для людей, ИИ-поиска и RAG-систем.

Обзор аппаратной части и упаковки ZBT Z8102AX: мощный роутер, слабая коробка
ZBT Z8102AX производит солидное первое впечатление как тонкий черный металлический 5G-роутер на OpenWrt с несколькими разъемами для антенн, двумя слотами для SIM-карт, портами USB, LAN/WAN и практичным набором аксессуаров. Аппаратная часть кажется полезной и серьезной, но упаковка, очевидно, является слабым местом.

Почему больше контекста может ухудшить ответы ИИ
Большее контекстное окно не гарантирует более качественного ответа. В этой статье объясняется, как размывание сигнала, противоречивые данные, устаревшее состояние, чувствительность к позиции и сжатие с потерями могут снизить надежность ИИ — и предлагается практический стресс-тест контекста.

Стоит ли покупать 5G OpenWrt-роутер со старой прошивкой? ZBT Z8102AX как практический пример
Покупка 5G-роутера с OpenWrt на старой прошивке может иметь смысл, но только при определённых условиях. ZBT Z8102AX наглядно демонстрирует обе стороны: железо полезное, модем работает, а роутер оставался стабильным в ходе тестов, однако OpenWrt 21.02, слабая упаковка и неясные пути обновления требуют взвешенного решения о покупке.

Каноническая архитектура, Дизайн URL, Логика резолвера, Спецификация API и масштабируемости
Геоориентированная архитектура обнаружения для мультитенантных порталов. Определяет канонические URL-адреса, логику разрешения, стратегию кэширования и гео-модель чтения без привязки к CMS или рефакторинга базы данных. Разработано для стабильности SEO, масштабируемости и будущих расширений, таких как бронирование и карты.

Агенты для управления компьютером: почему успешная демонстрация всё ещё может быть ненадёжной системой
Агенты для управления компьютером теперь могут выполнять впечатляющие рабочие процессы в браузере и на рабочем столе, но один успешный запуск доказывает способность—а не надежность. В этой статье показано, как проверять повторяемость, устойчивость к условиям среды, управление на длинном горизонте, осведомленность о состоянии, верификацию результатов и безопасную обработку целей.

MCP vs A2A vs UCP vs AP2 vs A2UI: разбор стека протоколов агентов
MCP, A2A, UCP, AP2 и A2UI часто представляют как конкурирующие агентские стандарты. В основном они решают разные проблемы интероперабельности. Это руководство сопоставляет каждый протокол с границей, которую он фактически стандартизирует,—и показывает, как они могут работать вместе в одной промышленной системе.