[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:ru":3,"public-menus:all":38,"post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:ru":205,"related:post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:ru:1":1721},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","ru","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1720},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":854,"featuredImage":855,"featuredImageAlt":856,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":857,"publishedAt":858,"createdAt":859,"updatedAt":860,"seoLocalePaths":861,"categories":870,"author":883,"translations":888},"471","Как узнать, действительно ли ИИ-агент использовал правильные доказательства","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Содержание\">\u003Cstrong class=\"editorjs-toc__title\">Содержание\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-5\" class=\"editorjs-toc__link\">Почему одних цитат недостаточно\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-8\" class=\"editorjs-toc__link\">Четыре вопроса, которым должно соответствовать каждое существенное утверждение\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">1. Подтверждение утверждения: доказывает ли источник то, о чем говорит агент?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-13\" class=\"editorjs-toc__link\">2. Авторитетность доказательства: подходит ли такой тип источника?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-16\" class=\"editorjs-toc__link\">3. Применимость: правильные доказательства, неверные условия\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-20\" class=\"editorjs-toc__link\">4. Использование доказательств: опирался ли агент на них в действительности?\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-23\" class=\"editorjs-toc__link\">Тест на использование доказательств\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-27\" class=\"editorjs-toc__link\">Матрица «утверждение — доказательство» полезнее простого списка источников\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-30\" class=\"editorjs-toc__link\">Разделяйте качество поиска и качество доказательств\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">Оценивайте качество источников по критериям, а не по белому списку доменов\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-36\" class=\"editorjs-toc__link\">Полнота доказательств: подтверждения требует каждое важное утверждение, а не каждое предложение\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-39\" class=\"editorjs-toc__link\">Происхождение доказательств должно сохраняться при суммаризации и записи в память\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-42\" class=\"editorjs-toc__link\">Практическая запись доказательства\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-44\" class=\"editorjs-toc__link\">Режимы сбоев, выглядящие обоснованными, но не являющиеся таковыми\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-46\" class=\"editorjs-toc__link\">Как оценивать агента в производственной среде\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-49\" class=\"editorjs-toc__link\">Не делайте LLM-судью единственным оценщиком доказательств\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-52\" class=\"editorjs-toc__link\">Что может изменить этот ответ?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-56\" class=\"editorjs-toc__link\">Ограничения\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-59\" class=\"editorjs-toc__link\">Заключение\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-64\" class=\"editorjs-toc__link\">Часто задаваемые вопросы\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-66\" class=\"editorjs-toc__link\">Глоссарий\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-68\" class=\"editorjs-toc__link\">Первоисточники и материалы для дальнейшего чтения\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>ИИ-агент может цитировать источники, извлекать документы и всё равно использовать неподходящие доказательства. Источник может быть авторитетным, но не иметь отношения к конкретному утверждению. Найденный фрагмент может подтверждать ответ лишь частично. Корректный источник может оказаться устаревшим, замененным или применимым к другой юрисдикции, версии продукта, пользователю или состоянию системы. Это создает более сложную проблему оценки, чем простая проверка цитирования: действительно ли агент использовал правильные доказательства для сделанного им утверждения?\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Прямой ответ\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Чтобы понять, использовал ли ИИ-агент правильные доказательства, оцените цепочку &lt;strong&gt;Утверждение → Доказательство → Применимость → Использование&lt;\u002Fstrong&gt;. Для каждого существенного утверждения проверьте, что доказательство напрямую подтверждает его, исходит из надежного источника, применимо к текущим условиям и действительно было доступно агенту до формулирования утверждения. Само по себе наличие цитаты ничего из этого не доказывает.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">О методологии\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Модель «Утверждение — Доказательство — Применимость — Использование» и тест на использование доказательств в этой статье являются практическими методами оценки, а не формальными отраслевыми стандартами. Они опираются на такие устоявшиеся концепции, как обоснованность (groundedness), качество источников, полнота цитирования, оценка трассировки и специализированные тесты для конкретных задач.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-5\">Почему одних цитат недостаточно\u003C\u002Fh2>\n\u003Cp>Цитата отвечает лишь на узкий вопрос: связала ли система утверждение или ответ с источником. Она не гарантирует автоматически, что источник подтверждает конкретное утверждение, что источник достаточно авторитетен для данной задачи, что цитируемый фрагмент содержит необходимое условие или исключение, или что модель опиралась именно на это доказательство, а не сгенерировала ответ на основе ранее заложенных знаний.\u003C\u002Fp>\n\u003Cp>Руководство Anthropic по оценке исследовательских агентов явно разграничивает обоснованность, полноту охвата и качество источников. Руководство OpenAI по оценке агентов аналогично делает акцент на трассировках выполнения, поскольку итоговый результат не показывает, выбрал ли агент правильные инструменты и следовал ли он намеченному процессу. Эти идеи подводят к более широкому выводу: качество доказательств — это свойство пути выполнения, а не просто финального текста.\u003C\u002Fp>\n\u003Ch2 id=\"section-8\">Четыре вопроса, которым должно соответствовать каждое существенное утверждение\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Критерий\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Вопрос\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Типичная ошибка\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Подтверждение утверждения\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Подтверждает ли доказательство именно это конкретное утверждение напрямую?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Источник связан по теме, но не доказывает само утверждение\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Авторитетность доказательства\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Подходит ли этот источник для утверждений такого рода?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Используется вторичный пересказ там, где требуется первоисточник или данные из действующей системы\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Применимость\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Применимо ли доказательство к данному времени, версии, юрисдикции, пользователю, состоянию или выборке?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Истинное утверждение применяется за пределами условий его действия\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Использование доказательства\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Было ли это доказательство действительно доступно и использовано в процессе работы агента?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Итоговый ответ верен, но найденное доказательство не относилось к делу или не было использовано\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch3 id=\"section-10\">1. Подтверждение утверждения: доказывает ли источник то, о чем говорит агент?\u003C\u002Fh3>\n\u003Cp>Доказательства следует оценивать на уровне отдельных утверждений. Документ может соответствовать теме и при этом не подтверждать конкретную мысль. Если в источнике сказано, что функция доступна в отдельных регионах, ответ «функция доступна по всему миру» не подтвержден, даже если ссылка выглядит правдоподобно.\u003C\u002Fp>\n\u003Cp>Именно здесь общие оценки «обосновано \u002F не обосновано» часто оказываются слишком поверхностными. Разбейте ответ на существенные утверждения, сопоставьте каждое с наименьшим фрагментом доказательства, подтверждающим его, и классифицируйте связь: прямое подтверждение, частичное подтверждение, противоречие или отсутствие подтверждения.\u003C\u002Fp>\n\u003Ch3 id=\"section-13\">2. Авторитетность доказательства: подходит ли такой тип источника?\u003C\u002Fh3>\n\u003Cp>Правильный выбор доказательств определяется не только смысловой релевантностью. Источник должен подходить для принятия решения. Текущий статус аккаунта должен браться из системы учетных записей, а не из старого письма. Утверждение о поведении API желательно сверять с актуальной документацией вендора или воспроизводимым поведением. Для юридического требования может потребоваться действующий закон, регламент или официальные разъяснения регулятора, а не статья в блоге общего характера.\u003C\u002Fp>\n\u003Cp>Авторитетность источника зависит от задачи. Сообщение от сообщества пользователей может служить лучшим доказательством реальной ошибки, которую вендор не признает в документации. Заявление вендора может быть авторитетным в отношении его собственных планов, но слабым аргументом при независимой оценке производительности. Поэтому оценщику необходима четкая иерархия источников для конкретной задачи, а не единый универсальный балл авторитетности.\u003C\u002Fp>\n\u003Ch3 id=\"section-16\">3. Применимость: правильные доказательства, неверные условия\u003C\u002Fh3>\n\u003Cp>Самые опасные ошибки доказательной базы — это зачастую не выдуманные источники, а подлинные материалы, использованные вне рамок их применимости. Рекомендация может измениться в зависимости от версии ПО, даты, юрисдикции, ревизии оборудования, прав пользователя, доступности продукта, текущего состояния игры, конфигурации тенанта или других параметров среды.\u003C\u002Fp>\n\u003Cp>Для каждого значимого источника сохраняйте условия, определяющие его актуальность. Это особенно важно после обобщения (саммаризации): сжатая память или цитата могут сохранить вывод, потеряв при этом исключение, дату или обязательное предварительное условие, которые делали этот вывод верным.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Доказательство может быть подлинным, но при этом неподходящим для ответа\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Реальный источник при точном цитировании все равно может привести к неверному ответу, если его временной период, версия, выборка, юрисдикция или статус не соответствуют текущему вопросу.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-20\">4. Использование доказательств: опирался ли агент на них в действительности?\u003C\u002Fh3>\n\u003Cp>Ответ может быть правильным, даже если этап поиска (retrieval) завершился сбоем. Модель может уже знать ответ, вывести его из несвязанного контекста или просто угадать. Если оценка проверяет только итоговую правильность, может показаться, что система надежно обосновывает свои выводы, хотя цепочка доказательств нарушена.\u003C\u002Fp>\n\u003Cp>Чтобы оценить использование доказательств, проанализируйте трейс выполнения. Проверьте, какие источники были получены, какие фрагменты попали в контекст модели, когда именно они стали доступны и можно ли объяснить итоговое утверждение этими входными данными. Современные инструменты OpenAI для оценки агентов делают упор на анализ трейсов именно потому, что поведение на уровне рабочего процесса невозможно надежно восстановить только по итоговому ответу.\u003C\u002Fp>\n\u003Ch2 id=\"section-23\">Тест на использование доказательств\u003C\u002Fh2>\n\u003Cp>Практическую оценку можно построить как контролируемый контрфактический эксперимент. Вместо того чтобы просто проверять правильность ответа, измените доказательства и проследите, изменится ли утверждение в ожидаемом направлении.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Тест на использование доказательств\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Выберите одно существенное утверждение\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Выберите утверждение, правильность которого имеет значение, и точно определите ожидаемый ответ.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Определите эталонные доказательства\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Сформируйте минимальный авторитетный набор доказательств, достаточный для подтверждения утверждения.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Запустите с эталонными доказательствами\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Убедитесь, что агент выдает подтвержденный ответ при наличии правильных доказательств.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Удалите решающее доказательство\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Запустите ту же задачу без ключевого подтверждающего фрагмента, оставив остальные входные данные без изменений.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Замените его противоречащими или замещающими доказательствами\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Там, где это допустимо, предоставьте контролируемые доказательства, меняющие правильный вывод.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Сравните утверждения\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Проверьте, меняется ли ответ вслед за доказательствами или он остается привязан к априорным знаниям модели.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Проанализируйте трейс\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Проверьте, что именно было извлечено, что попало в контекст и какой источник или результат инструмента предшествовал утверждению.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Ключевой сигнал\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Если решающее доказательство изменилось, а утверждение агента — нет, это говорит о том, что система, возможно, использует поиск не так, как предполагалось, даже если исходный ответ случайно оказался правильным.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-27\">Матрица «утверждение — доказательство» полезнее простого списка источников\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Утверждение\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Доказательство\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Подтверждение\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Авторитетность\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Применимость\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Использовано в трейсе\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Функция X доступна\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Документация вендора\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Прямое\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Высокая для заявления о доступности\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Текущая версия и регион должны совпадать\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Да \u002F Нет\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Конфигурация Y быстрее\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Бенчмарк вендора\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Частичное\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Высокая для тестов вендора, но не для независимой производительности\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Оборудование и нагрузка должны совпадать\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Да \u002F Нет\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Политика применяется к этому пользователю\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Текущая политика + статус аккаунта\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Прямое только в совокупности\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Высокая\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Юрисдикция, дата, роль и статус аккаунта должны совпадать\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Да \u002F Нет\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Товар есть в наличии\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">API складских остатков в реальном времени\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Прямое\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Авторитетно для текущего остатка\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Быстро устаревает\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Да \u002F Нет\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Эта матрица поднимает ряд вопросов, которые скрывает стандартная проверка цитирования. Одному утверждению может требоваться несколько источников. Один источник может подтверждать лишь часть утверждения. Авторитетный источник может иметь короткое окно актуальности. А превосходный источник окажется бесполезным, если он так и не попал в цепочку выполнения.\u003C\u002Fp>\n\u003Ch2 id=\"section-30\">Разделяйте качество поиска и качество доказательств\u003C\u002Fh2>\n\u003Cp>Метрики поиска определяют, были ли найдены и отранжированы релевантные материалы. Оценка доказательств определяет, обосновывают ли эти материалы полученные утверждения. Эти аспекты взаимосвязаны, но не идентичны.\u003C\u002Fp>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Успешный поиск не равен качественному доказательству\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Ситуация\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Поиск (Retrieval)\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Качество доказательств\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Правильный документ, неверное утверждение\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Правильный факт, устаревший источник\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Слабый источник, правильный ответ\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Требуется несколько источников\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-33\">Оценивайте качество источников по критериям, а не по белому списку доменов\u003C\u002Fh2>\n\u003Cp>Жестко заданные списки «доверенных доменов» заманчивы, но часто неэффективны. Качество источника должно зависеть от типа утверждения. Среди полезных критериев: первичный или вторичный статус, актуальность, прямота данных, воспроизводимость, независимость, экспертиза в предметной области, происхождение данных, частота обновлений, а также наличие у источника мотива преувеличивать факты.\u003C\u002Fp>\n\u003Cp>Руководство Anthropic по оценке исследовательских агентов явно выделяет проверку качества источников наряду с обоснованностью (groundedness) и полнотой охвата. Соответственно, на практике следует оценивать как то, что именно сообщает источник, так и то, подходит ли этот источник для подобных заявлений.\u003C\u002Fp>\n\u003Ch2 id=\"section-36\">Полнота доказательств: подтверждения требует каждое важное утверждение, а не каждое предложение\u003C\u002Fh2>\n\u003Cp>Не каждое предложение требует ссылки на источник. Переходные фразы, арифметические вычисления, явно выведенные из приведенных значений, или четко обозначенная интерпретация могут не требовать отдельного источника. Но каждое существенное утверждение, поддающееся внешней проверке, должно иметь достаточное подтверждение, чтобы оценщик мог восстановить, на каком основании агенту было разрешено его сделать.\u003C\u002Fp>\n\u003Cp>Поэтому покрытие доказательствами должно взвешиваться с учетом важности утверждения. Отсутствие подтверждения для декоративной детали не эквивалентно отсутствию подтверждения для цены, решения о соответствии критериям, инструкции по безопасности, юридического требования, заявления о технической совместимости или факта, лежащего в основе рекомендации.\u003C\u002Fp>\n\u003Ch2 id=\"section-39\">Происхождение доказательств должно сохраняться при суммаризации и записи в память\u003C\u002Fh2>\n\u003Cp>Долго работающие агенты часто суммаризируют предыдущую работу или записывают долговременные воспоминания. Если в ходе этой трансформации происхождение доказательств утрачивается, будущие агенты могут извлечь четкий вывод, не зная, был ли он получен из слов пользователя, работающего в реальном времени API, старого документа, логического вывода модели или непроверенного результата из интернета.\u003C\u002Fp>\n\u003Cp>Для важных фактов сохраняйте как минимум идентификатор источника, время извлечения или наблюдения, тип доказательства, соответствующую версию или состояние, а также пометку о том, является ли сохраненный текст цитатой, суммаризацией, логическим выводом или производным значением. Именно происхождение позволяет последующему агенту решить, следует ли доверять доказательству, обновить его, ограничить или отбросить.\u003C\u002Fp>\n\u003Ch2 id=\"section-42\">Практическая запись доказательства\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Поле\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Назначение\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">claim_id\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Идентифицирует подтверждаемое существенное утверждение\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_id \u002F source_url \u002F system\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Идентифицирует источник происхождения доказательства\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">evidence_span\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Сохраняет наименьший фрагмент текста, запись или результат вызова инструмента, подтверждающий утверждение\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">retrieved_at \u002F observed_at\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Позволяет проверять актуальность и временную последовательность\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_version \u002F object_version\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Позволяет проверять замещение версий и воспроизводимость\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">authority_role\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Объясняет, почему этот источник подходит для данного утверждения\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">applicability\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Хранит применимую дату, юрисдикцию, версию продукта, пользователя, тенанта, состояние или другие условия\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">transformation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Указывает, являются ли доказательства необработанными, процитированными, суммаризированными, нормализованными или производными\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">trace_step\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Показывает, в какой момент доказательство стало доступно агенту\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">support_status\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Прямое, частичное, противоречивое, неподтвержденное или неопределенное\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-44\">Режимы сбоев, выглядящие обоснованными, но не являющиеся таковыми\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Режим сбоя\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Почему это вводит оценщиков в заблуждение\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Что проверять\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Декоративные ссылки\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ответ содержит источники, поэтому выглядит глубоко исследованным\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Сопоставляйте каждое существенное утверждение с точным подтверждающим фрагментом\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Несоответствие авторитетности\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Источник надежен, но не авторитетен в отношении конкретного факта\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Определите иерархию источников для каждого конкретного типа утверждений\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Временное несоответствие\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Источник был верен на момент публикации\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Проверяйте время извлечения, дату источника и наличие замещающих данных\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Утрата условий\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Суммаризация сохраняет вывод, но опускает исключения\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Сравнивайте сгенерированное утверждение с полным локальным контекстом источника\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Постфактум-ссылки\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Правдоподобный источник прикрепляется уже после формирования ответа\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Проверяйте последовательность в трейсе и предшествовало ли появление доказательства утверждению\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Параметрическое переопределение\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Модель игнорирует извлеченные доказательства и отвечает на основе априорных знаний\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Проводите контрфактические тесты использования доказательств\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Отмывание доказательств\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Логический вывод модели суммаризируется и позже сохраняется как факт из первоисточника\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Сохраняйте тип трансформации и происхождение при любых записях в память\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ложная опора на большинство источников\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Несколько вторичных страниц повторяют одно и то же неподтвержденное утверждение\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Прослеживайте утверждения вплоть до независимых или первичных доказательств\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-46\">Как оценивать агента в производственной среде\u003C\u002Fh2>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Пайплайн оценки доказательств\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Определение существенных утверждений\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Выявите факты, рекомендации или решения, правильность которых имеет решающее значение для задачи.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Создание эталонных доказательств\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Сформируйте эталонные доказательства и требования к качеству источников для репрезентативных кейсов.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Сбор трейсов\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Логируйте поисковые запросы, вызовы инструментов, возвращенные доказательства, сборку контекста, вывод модели и ссылки.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Оценка подтвержденности\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Проверяйте, подтверждено ли каждое существенное утверждение прямо, частично, противоречиво или не подтверждено вовсе.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Оценка авторитетности и применимости\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Оценивайте соответствие источника задаче и совпадение его условий с текущими требованиями.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Запуск контрфактических тестов\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Удаляйте, заменяйте или делайте неактуальными ключевые доказательства и проверяйте, меняется ли ответ вслед за ними.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Анализ критических сбоев\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Привлекайте людей или экспертов предметной области в случаях, когда автоматическая оценка недостаточно надежна.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Преобразование сбоев в тестовые сценарии\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Добавляйте выявленные на проде сбои и граничные случаи в воспроизводимый датасет для регрессионного тестирования.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>Актуальные рекомендации OpenAI по оценке предлагают использовать специализированные тесты под конкретные задачи, непрерывное оценивание, датасеты на основе производственных данных и трейсы для отладки поведения агентов. Anthropic аналогично рекомендует комбинировать различные типы оценщиков для исследовательских агентов, поскольку корректность, качество источников, полнота покрытия и обоснованность — это отдельные независимые аспекты. Оценка доказательств должна следовать тому же принципу: несколько узконаправленных оценщиков дают больше диагностической пользы, чем единая непрозрачная оценка «качества».\u003C\u002Fp>\n\u003Ch2 id=\"section-49\">Не делайте LLM-судью единственным оценщиком доказательств\u003C\u002Fh2>\n\u003Cp>Оценщики на базе LLM полезны для масштабируемой классификации утверждений, проверок на релевантность и попарных сравнений, но они могут иметь те же слепые зоны, что и оцениваемая ими система. Такой оценщик может принять правдоподобное, но неподтвержденное утверждение, пропустить тонкую границу между версиями или переоценить красиво оформленный источник.\u003C\u002Fp>\n\u003Cp>Рекомендации OpenAI по оценке советуют калибровать автоматических оценщиков по оценкам человека и применять четкие, узко очерченные критерии. Для систем с высокой плотностью доказательств следует везде, где это возможно, использовать детерминированные проверки: временные метки, версии объектов, область прав доступа, точные идентификаторы источников, порядок извлечения, хеши документов и наличие доказательства до того, как модель сгенерировала утверждение.\u003C\u002Fp>\n\u003Ch2 id=\"section-52\">Что может изменить этот ответ?\u003C\u002Fh2>\n\u003Cp>Оценка может быть проще, когда агент работает с небольшим, неизменяемым, авторитетным корпусом данных, а каждый ответ носит строго экстрактивный характер. В таких условиях авторитетность и применимость источников практически фиксированы, и сопоставления утверждения с подтверждающим фрагментом может быть достаточно.\u003C\u002Fp>\n\u003Cp>Оценка обязана становиться строже, когда агент объединяет веб-поиск, долговременную память, динамические инструменты, несколько юрисдикций, быстро меняющуюся информацию, специфичное для пользователя состояние или автономные действия. В подобных системах валидность доказательств зависит не только от текста источника, но и от того, когда и как именно доказательство было получено.\u003C\u002Fp>\n\u003Cp>Будущие модели могут научиться лучше отслеживать происхождение данных и неопределенность на внутреннем уровне, но это не устранит необходимость во внешних записях подтверждений в системах, требующих аудируемости. Система не должна полагаться на самоотчет модели о том, что именно на нее повлияло, когда трассировки и метаданные источников могут предоставить более убедительные доказательства.\u003C\u002Fp>\n\u003Ch2 id=\"section-56\">Ограничения\u003C\u002Fh2>\n\u003Cp>Доказать причинно-следственное использование свидетельств только на основе трассировок возможно не всегда. Источник может присутствовать в контексте, не влияя на ответ, а модель может независимо знать тот же самый факт. Контрфактические тесты усиливают логический вывод, но сами по себе могут изменять распределение задач.\u003C\u002Fp>\n\u003Cp>Авторитетность источника также может быть спорной или зависеть от предметной области. У некоторых вопросов нет единого авторитетного источника, и эксперты могут расходиться во мнениях относительно того, какие свидетельства заслуживают большего веса. В таких случаях оценщику следует фиксировать разногласия и оценивать прозрачность, полноту охвата и логику рассуждений по явным критериям, а не делать вид, будто существует один неоспоримый источник истины.\u003C\u002Fp>\n\u003Ch2 id=\"section-59\">Заключение\u003C\u002Fh2>\n\u003Cp>Вопрос «Сослался ли агент на источник?» слишком слаб для продакшн-систем ИИ. Гораздо важнее другой вопрос: исходит ли каждое существенное утверждение из подтверждения, которое действительно его подкрепляет, обладает надлежащей авторитетностью, все еще применимо к текущим условиям и присутствовало в пути выполнения до того, как утверждение было сформулировано?\u003C\u002Fp>\n\u003Cp>Это превращает свидетельства из простого декоративного элемента в оцениваемое системное свойство. Фиксируйте трассировку. Сопоставляйте утверждения со свидетельствами. Проверяйте авторитетность и применимость. Проводите контрфактические тесты свидетельств. Сохраняйте происхождение данных через суммаризации и память. Тогда правильный ответ станет не просто правдоподобным — за ним появится путь обоснования, который можно проверить.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fru\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Надежность ИИ-агентов: почему одного лишь финального ответа недостаточно\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Корректность итогового результата сама по себе не доказывает, что путь выполнения агента был безопасным или надежным. В этой связанной статье объясняется, почему траектории, инструменты и промежуточные решения имеют значение.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Читать статью по теме →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fru\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">От исследовательского протокола к общей структуре рассуждений ИИ\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Практический метод рассуждений для разделения свидетельств, допущений, конкурирующих гипотез и валидации с учетом предметной области.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Читать о структуре рассуждений →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-64\">Часто задаваемые вопросы\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Оценка использования свидетельств в ИИ-агентах\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Доказывает ли цитата, что ответ ИИ обоснован?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Нет. Цитата может быть релевантной теме, но не подтверждать конкретное утверждение, может исходить от ненадлежащего источника, потерять актуальность или быть прикрепленной постфактум, никак не повлияв на сгенерированный ответ.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Как проверить, действительно ли ИИ-агент использовал извлеченные свидетельства?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Используйте контрфактический тест утилизации свидетельств: выполните задачу с заведомо корректными данными, затем удалите или замените решающее свидетельство, оставив остальные входные данные неизменными. Если ответ не реагирует на изменение свидетельства, проверьте, не опирается ли модель на предварительные знания или другой источник.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">В чем разница между обоснованностью (groundedness) и качеством источника?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Обоснованность определяет, подкреплены ли утверждения предоставленными свидетельствами. Качество источника показывает, насколько само свидетельство уместно и авторитетно для утверждения подобного типа.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Почему реальный источник все равно может привести к неверному ответу ИИ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Источник может быть устаревшим, замененным более новым, актуальным для другой версии, юрисдикции, пользователя, группы населения или состояния системы, либо может содержать ограничивающие условия, которые были утеряны при поиске или суммаризации.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Что необходимо логировать для оценки использования свидетельств?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Логируйте поисковый запрос, полученные источники, точные фрагменты свидетельств, временные метки и версии, фильтры, итоговый контекст, вывод модели, цитаты и последовательность шагов трассировки, чтобы оценщики могли восстановить, какие подтверждения были доступны до формулирования каждого значимого утверждения.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-66\">Глоссарий\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Ключевые термины оценки свидетельств\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"claim-support\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Подтверждение утверждения (Claim support)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Степень, в которой конкретный фрагмент свидетельства напрямую доказывает сгенерированное утверждение.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-authority\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Авторитетность свидетельства (Evidence authority)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Степень пригодности источника для обоснования утверждения определенного типа с учетом его роли, происхождения и связи с лежащим в основе фактом.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"applicability\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Применимость (Applicability)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Условия, при которых свидетельство сохраняет валидность для утверждения, включая временные рамки, версию, юрисдикцию, пользователя, группу населения, состояние системы или другие границы.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-utilization\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Утилизация свидетельств (Evidence utilization)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Показатель того, действительно ли выходные данные агента реагируют на свидетельства, предоставленные на пути выполнения, и зависят ли от них.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"counterfactual-evidence-test\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Контрфактический тест свидетельств (Counterfactual evidence test)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Метод оценки, при котором решающее свидетельство удаляется, заменяется или модифицируется, чтобы проверить, изменится ли утверждение агента соответствующим образом.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"provenance\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Происхождение данных (Provenance)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Метаданные, фиксирующие, откуда поступило свидетельство, когда оно было получено, как трансформировалось и какую версию или состояние представляло.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-68\">Первоисточники и материалы для дальнейшего чтения\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Оценка рабочих процессов агентов (Evaluate Agent Workflows)\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Руководство по оценке трассировок, тестированию на уровне рабочих процессов, датасетам и воспроизводимым запускам проверок для агентов.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Лучшие практики оценки (Evaluation Best Practices)\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Рекомендации по оценкам под конкретные задачи, датасетам на основе продакшна, специализированным метрикам, непрерывной оценке и калибровке грейдеров.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Anthropic — Демистификация оценок для ИИ-агентов (Demystifying Evals for AI Agents)\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Руководство по оценке агентов, включая проверки обоснованности, полноты охвата и качества источников для исследовательских агентов.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Единый сборник методик для надежных независимых оценок (A Shared Playbook for Trustworthy Third-Party Evaluations)\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Руководство по оценке, подчеркивающее, что эффективность современных агентов зависит от рабочего процесса и среды, а не только от финального ответа модели.\u003C\u002Fp>\u003C\u002Fa>",{"time":212,"blocks":213,"version":853},1790368381662,[214,222,228,236,243,248,253,258,263,289,294,299,304,309,314,319,324,329,334,341,346,351,356,361,366,394,401,406,441,446,451,456,490,495,500,505,510,515,520,525,530,535,540,578,583,624,629,659,664,669,674,679,684,689,694,699,704,709,714,719,724,729,738,746,751,777,782,811,816,826,835,844],{"id":215,"data":216,"type":220,"tunes":221},"0hk9UtwqZf",{"title":217,"maxLevel":218,"minLevel":219},"Содержание",3,2,"tableOfContents",{},{"id":223,"data":224,"type":226,"tunes":227},"intro",{"text":225},"ИИ-агент может цитировать источники, извлекать документы и всё равно использовать неподходящие доказательства. Источник может быть авторитетным, но не иметь отношения к конкретному утверждению. Найденный фрагмент может подтверждать ответ лишь частично. Корректный источник может оказаться устаревшим, замененным или применимым к другой юрисдикции, версии продукта, пользователю или состоянию системы. Это создает более сложную проблему оценки, чем простая проверка цитирования: действительно ли агент использовал правильные доказательства для сделанного им утверждения?","paragraph",{},{"id":229,"data":230,"type":234,"tunes":235},"direct",{"body":231,"title":232,"variant":233},"Чтобы понять, использовал ли ИИ-агент правильные доказательства, оцените цепочку \u003Cstrong>Утверждение → Доказательство → Применимость → Использование\u003C\u002Fstrong>. Для каждого существенного утверждения проверьте, что доказательство напрямую подтверждает его, исходит из надежного источника, применимо к текущим условиям и действительно было доступно агенту до формулирования утверждения. Само по себе наличие цитаты ничего из этого не доказывает.","Прямой ответ","info","callout",{},{"id":237,"data":238,"type":234,"tunes":242},"method-note",{"body":239,"title":240,"variant":241},"Модель «Утверждение — Доказательство — Применимость — Использование» и тест на использование доказательств в этой статье являются практическими методами оценки, а не формальными отраслевыми стандартами. Они опираются на такие устоявшиеся концепции, как обоснованность (groundedness), качество источников, полнота цитирования, оценка трассировки и специализированные тесты для конкретных задач.","О методологии","note",{},{"id":244,"data":245,"type":42,"tunes":247},"h-citations",{"text":246,"level":219},"Почему одних цитат недостаточно",{},{"id":249,"data":250,"type":226,"tunes":252},"p-citations-1",{"text":251},"Цитата отвечает лишь на узкий вопрос: связала ли система утверждение или ответ с источником. Она не гарантирует автоматически, что источник подтверждает конкретное утверждение, что источник достаточно авторитетен для данной задачи, что цитируемый фрагмент содержит необходимое условие или исключение, или что модель опиралась именно на это доказательство, а не сгенерировала ответ на основе ранее заложенных знаний.",{},{"id":254,"data":255,"type":226,"tunes":257},"p-citations-2",{"text":256},"Руководство Anthropic по оценке исследовательских агентов явно разграничивает обоснованность, полноту охвата и качество источников. Руководство OpenAI по оценке агентов аналогично делает акцент на трассировках выполнения, поскольку итоговый результат не показывает, выбрал ли агент правильные инструменты и следовал ли он намеченному процессу. Эти идеи подводят к более широкому выводу: качество доказательств — это свойство пути выполнения, а не просто финального текста.",{},{"id":259,"data":260,"type":42,"tunes":262},"h-four",{"text":261,"level":219},"Четыре вопроса, которым должно соответствовать каждое существенное утверждение",{},{"id":264,"data":265,"type":287,"tunes":288},"table-four",{"content":266,"stretched":43,"withHeadings":14},[267,271,275,279,283],[268,269,270],"Критерий","Вопрос","Типичная ошибка",[272,273,274],"Подтверждение утверждения","Подтверждает ли доказательство именно это конкретное утверждение напрямую?","Источник связан по теме, но не доказывает само утверждение",[276,277,278],"Авторитетность доказательства","Подходит ли этот источник для утверждений такого рода?","Используется вторичный пересказ там, где требуется первоисточник или данные из действующей системы",[280,281,282],"Применимость","Применимо ли доказательство к данному времени, версии, юрисдикции, пользователю, состоянию или выборке?","Истинное утверждение применяется за пределами условий его действия",[284,285,286],"Использование доказательства","Было ли это доказательство действительно доступно и использовано в процессе работы агента?","Итоговый ответ верен, но найденное доказательство не относилось к делу или не было использовано","table",{},{"id":290,"data":291,"type":42,"tunes":293},"h-support",{"text":292,"level":218},"1. Подтверждение утверждения: доказывает ли источник то, о чем говорит агент?",{},{"id":295,"data":296,"type":226,"tunes":298},"p-support-1",{"text":297},"Доказательства следует оценивать на уровне отдельных утверждений. Документ может соответствовать теме и при этом не подтверждать конкретную мысль. Если в источнике сказано, что функция доступна в отдельных регионах, ответ «функция доступна по всему миру» не подтвержден, даже если ссылка выглядит правдоподобно.",{},{"id":300,"data":301,"type":226,"tunes":303},"p-support-2",{"text":302},"Именно здесь общие оценки «обосновано \u002F не обосновано» часто оказываются слишком поверхностными. Разбейте ответ на существенные утверждения, сопоставьте каждое с наименьшим фрагментом доказательства, подтверждающим его, и классифицируйте связь: прямое подтверждение, частичное подтверждение, противоречие или отсутствие подтверждения.",{},{"id":305,"data":306,"type":42,"tunes":308},"h-authority",{"text":307,"level":218},"2. Авторитетность доказательства: подходит ли такой тип источника?",{},{"id":310,"data":311,"type":226,"tunes":313},"p-authority-1",{"text":312},"Правильный выбор доказательств определяется не только смысловой релевантностью. Источник должен подходить для принятия решения. Текущий статус аккаунта должен браться из системы учетных записей, а не из старого письма. Утверждение о поведении API желательно сверять с актуальной документацией вендора или воспроизводимым поведением. Для юридического требования может потребоваться действующий закон, регламент или официальные разъяснения регулятора, а не статья в блоге общего характера.",{},{"id":315,"data":316,"type":226,"tunes":318},"p-authority-2",{"text":317},"Авторитетность источника зависит от задачи. Сообщение от сообщества пользователей может служить лучшим доказательством реальной ошибки, которую вендор не признает в документации. Заявление вендора может быть авторитетным в отношении его собственных планов, но слабым аргументом при независимой оценке производительности. Поэтому оценщику необходима четкая иерархия источников для конкретной задачи, а не единый универсальный балл авторитетности.",{},{"id":320,"data":321,"type":42,"tunes":323},"h-applicability",{"text":322,"level":218},"3. Применимость: правильные доказательства, неверные условия",{},{"id":325,"data":326,"type":226,"tunes":328},"p-apply-1",{"text":327},"Самые опасные ошибки доказательной базы — это зачастую не выдуманные источники, а подлинные материалы, использованные вне рамок их применимости. Рекомендация может измениться в зависимости от версии ПО, даты, юрисдикции, ревизии оборудования, прав пользователя, доступности продукта, текущего состояния игры, конфигурации тенанта или других параметров среды.",{},{"id":330,"data":331,"type":226,"tunes":333},"p-apply-2",{"text":332},"Для каждого значимого источника сохраняйте условия, определяющие его актуальность. Это особенно важно после обобщения (саммаризации): сжатая память или цитата могут сохранить вывод, потеряв при этом исключение, дату или обязательное предварительное условие, которые делали этот вывод верным.",{},{"id":335,"data":336,"type":234,"tunes":340},"apply-warning",{"body":337,"title":338,"variant":339},"Реальный источник при точном цитировании все равно может привести к неверному ответу, если его временной период, версия, выборка, юрисдикция или статус не соответствуют текущему вопросу.","Доказательство может быть подлинным, но при этом неподходящим для ответа","warning",{},{"id":342,"data":343,"type":42,"tunes":345},"h-use",{"text":344,"level":218},"4. Использование доказательств: опирался ли агент на них в действительности?",{},{"id":347,"data":348,"type":226,"tunes":350},"p-use-1",{"text":349},"Ответ может быть правильным, даже если этап поиска (retrieval) завершился сбоем. Модель может уже знать ответ, вывести его из несвязанного контекста или просто угадать. Если оценка проверяет только итоговую правильность, может показаться, что система надежно обосновывает свои выводы, хотя цепочка доказательств нарушена.",{},{"id":352,"data":353,"type":226,"tunes":355},"p-use-2",{"text":354},"Чтобы оценить использование доказательств, проанализируйте трейс выполнения. Проверьте, какие источники были получены, какие фрагменты попали в контекст модели, когда именно они стали доступны и можно ли объяснить итоговое утверждение этими входными данными. Современные инструменты OpenAI для оценки агентов делают упор на анализ трейсов именно потому, что поведение на уровне рабочего процесса невозможно надежно восстановить только по итоговому ответу.",{},{"id":357,"data":358,"type":42,"tunes":360},"h-eut",{"text":359,"level":219},"Тест на использование доказательств",{},{"id":362,"data":363,"type":226,"tunes":365},"p-eut-intro",{"text":364},"Практическую оценку можно построить как контролируемый контрфактический эксперимент. Вместо того чтобы просто проверять правильность ответа, измените доказательства и проследите, изменится ли утверждение в ожидаемом направлении.",{},{"id":367,"data":368,"type":392,"tunes":393},"eut-flow",{"steps":369,"title":359,"orientation":391},[370,373,376,379,382,385,388],{"label":371,"description":372},"1. Выберите одно существенное утверждение","Выберите утверждение, правильность которого имеет значение, и точно определите ожидаемый ответ.",{"label":374,"description":375},"2. Определите эталонные доказательства","Сформируйте минимальный авторитетный набор доказательств, достаточный для подтверждения утверждения.",{"label":377,"description":378},"3. Запустите с эталонными доказательствами","Убедитесь, что агент выдает подтвержденный ответ при наличии правильных доказательств.",{"label":380,"description":381},"4. Удалите решающее доказательство","Запустите ту же задачу без ключевого подтверждающего фрагмента, оставив остальные входные данные без изменений.",{"label":383,"description":384},"5. Замените его противоречащими или замещающими доказательствами","Там, где это допустимо, предоставьте контролируемые доказательства, меняющие правильный вывод.",{"label":386,"description":387},"6. Сравните утверждения","Проверьте, меняется ли ответ вслед за доказательствами или он остается привязан к априорным знаниям модели.",{"label":389,"description":390},"7. Проанализируйте трейс","Проверьте, что именно было извлечено, что попало в контекст и какой источник или результат инструмента предшествовал утверждению.","auto","processFlow",{},{"id":395,"data":396,"type":234,"tunes":400},"eut-tip",{"body":397,"title":398,"variant":399},"Если решающее доказательство изменилось, а утверждение агента — нет, это говорит о том, что система, возможно, использует поиск не так, как предполагалось, даже если исходный ответ случайно оказался правильным.","Ключевой сигнал","tip",{},{"id":402,"data":403,"type":42,"tunes":405},"h-matrix",{"text":404,"level":219},"Матрица «утверждение — доказательство» полезнее простого списка источников",{},{"id":407,"data":408,"type":287,"tunes":440},"claim-matrix",{"content":409,"stretched":43,"withHeadings":14},[410,416,423,429,435],[411,412,413,414,280,415],"Утверждение","Доказательство","Подтверждение","Авторитетность","Использовано в трейсе",[417,418,419,420,421,422],"Функция X доступна","Документация вендора","Прямое","Высокая для заявления о доступности","Текущая версия и регион должны совпадать","Да \u002F Нет",[424,425,426,427,428,422],"Конфигурация Y быстрее","Бенчмарк вендора","Частичное","Высокая для тестов вендора, но не для независимой производительности","Оборудование и нагрузка должны совпадать",[430,431,432,433,434,422],"Политика применяется к этому пользователю","Текущая политика + статус аккаунта","Прямое только в совокупности","Высокая","Юрисдикция, дата, роль и статус аккаунта должны совпадать",[436,437,419,438,439,422],"Товар есть в наличии","API складских остатков в реальном времени","Авторитетно для текущего остатка","Быстро устаревает",{},{"id":442,"data":443,"type":226,"tunes":445},"p-matrix-1",{"text":444},"Эта матрица поднимает ряд вопросов, которые скрывает стандартная проверка цитирования. Одному утверждению может требоваться несколько источников. Один источник может подтверждать лишь часть утверждения. Авторитетный источник может иметь короткое окно актуальности. А превосходный источник окажется бесполезным, если он так и не попал в цепочку выполнения.",{},{"id":447,"data":448,"type":42,"tunes":450},"h-retrieval-evidence",{"text":449,"level":219},"Разделяйте качество поиска и качество доказательств",{},{"id":452,"data":453,"type":226,"tunes":455},"p-re-1",{"text":454},"Метрики поиска определяют, были ли найдены и отранжированы релевантные материалы. Оценка доказательств определяет, обосновывают ли эти материалы полученные утверждения. Эти аспекты взаимосвязаны, но не идентичны.",{},{"id":457,"data":458,"type":488,"tunes":489},"retrieval-comparison",{"rows":459,"title":477,"layout":287,"columns":478},[460,465,469,473],{"id":461,"label":462,"values":463},"a","Правильный документ, неверное утверждение",[464,464,464],"",{"id":466,"label":467,"values":468},"b","Правильный факт, устаревший источник",[464,464,464],{"id":470,"label":471,"values":472},"c","Слабый источник, правильный ответ",[464,464,464],{"id":474,"label":475,"values":476},"d","Требуется несколько источников",[464,464,464],"Успешный поиск не равен качественному доказательству",[479,482,485],{"id":480,"label":481},"situation","Ситуация",{"id":483,"label":484},"retrieval","Поиск (Retrieval)",{"id":486,"label":487},"evidence","Качество доказательств","comparison",{},{"id":491,"data":492,"type":42,"tunes":494},"h-source-quality",{"text":493,"level":219},"Оценивайте качество источников по критериям, а не по белому списку доменов",{},{"id":496,"data":497,"type":226,"tunes":499},"p-source-quality-1",{"text":498},"Жестко заданные списки «доверенных доменов» заманчивы, но часто неэффективны. Качество источника должно зависеть от типа утверждения. Среди полезных критериев: первичный или вторичный статус, актуальность, прямота данных, воспроизводимость, независимость, экспертиза в предметной области, происхождение данных, частота обновлений, а также наличие у источника мотива преувеличивать факты.",{},{"id":501,"data":502,"type":226,"tunes":504},"p-source-quality-2",{"text":503},"Руководство Anthropic по оценке исследовательских агентов явно выделяет проверку качества источников наряду с обоснованностью (groundedness) и полнотой охвата. Соответственно, на практике следует оценивать как то, что именно сообщает источник, так и то, подходит ли этот источник для подобных заявлений.",{},{"id":506,"data":507,"type":42,"tunes":509},"h-coverage",{"text":508,"level":219},"Полнота доказательств: подтверждения требует каждое важное утверждение, а не каждое предложение",{},{"id":511,"data":512,"type":226,"tunes":514},"p-coverage-1",{"text":513},"Не каждое предложение требует ссылки на источник. Переходные фразы, арифметические вычисления, явно выведенные из приведенных значений, или четко обозначенная интерпретация могут не требовать отдельного источника. Но каждое существенное утверждение, поддающееся внешней проверке, должно иметь достаточное подтверждение, чтобы оценщик мог восстановить, на каком основании агенту было разрешено его сделать.",{},{"id":516,"data":517,"type":226,"tunes":519},"p-coverage-2",{"text":518},"Поэтому покрытие доказательствами должно взвешиваться с учетом важности утверждения. Отсутствие подтверждения для декоративной детали не эквивалентно отсутствию подтверждения для цены, решения о соответствии критериям, инструкции по безопасности, юридического требования, заявления о технической совместимости или факта, лежащего в основе рекомендации.",{},{"id":521,"data":522,"type":42,"tunes":524},"h-provenance",{"text":523,"level":219},"Происхождение доказательств должно сохраняться при суммаризации и записи в память",{},{"id":526,"data":527,"type":226,"tunes":529},"p-prov-1",{"text":528},"Долго работающие агенты часто суммаризируют предыдущую работу или записывают долговременные воспоминания. Если в ходе этой трансформации происхождение доказательств утрачивается, будущие агенты могут извлечь четкий вывод, не зная, был ли он получен из слов пользователя, работающего в реальном времени API, старого документа, логического вывода модели или непроверенного результата из интернета.",{},{"id":531,"data":532,"type":226,"tunes":534},"p-prov-2",{"text":533},"Для важных фактов сохраняйте как минимум идентификатор источника, время извлечения или наблюдения, тип доказательства, соответствующую версию или состояние, а также пометку о том, является ли сохраненный текст цитатой, суммаризацией, логическим выводом или производным значением. Именно происхождение позволяет последующему агенту решить, следует ли доверять доказательству, обновить его, ограничить или отбросить.",{},{"id":536,"data":537,"type":42,"tunes":539},"h-record",{"text":538,"level":219},"Практическая запись доказательства",{},{"id":541,"data":542,"type":287,"tunes":577},"evidence-record",{"content":543,"stretched":43,"withHeadings":14},[544,547,550,553,556,559,562,565,568,571,574],[545,546],"Поле","Назначение",[548,549],"claim_id","Идентифицирует подтверждаемое существенное утверждение",[551,552],"source_id \u002F source_url \u002F system","Идентифицирует источник происхождения доказательства",[554,555],"evidence_span","Сохраняет наименьший фрагмент текста, запись или результат вызова инструмента, подтверждающий утверждение",[557,558],"retrieved_at \u002F observed_at","Позволяет проверять актуальность и временную последовательность",[560,561],"source_version \u002F object_version","Позволяет проверять замещение версий и воспроизводимость",[563,564],"authority_role","Объясняет, почему этот источник подходит для данного утверждения",[566,567],"applicability","Хранит применимую дату, юрисдикцию, версию продукта, пользователя, тенанта, состояние или другие условия",[569,570],"transformation","Указывает, являются ли доказательства необработанными, процитированными, суммаризированными, нормализованными или производными",[572,573],"trace_step","Показывает, в какой момент доказательство стало доступно агенту",[575,576],"support_status","Прямое, частичное, противоречивое, неподтвержденное или неопределенное",{},{"id":579,"data":580,"type":42,"tunes":582},"h-failures",{"text":581,"level":219},"Режимы сбоев, выглядящие обоснованными, но не являющиеся таковыми",{},{"id":584,"data":585,"type":287,"tunes":623},"failure-table",{"content":586,"stretched":43,"withHeadings":14},[587,591,595,599,603,607,611,615,619],[588,589,590],"Режим сбоя","Почему это вводит оценщиков в заблуждение","Что проверять",[592,593,594],"Декоративные ссылки","Ответ содержит источники, поэтому выглядит глубоко исследованным","Сопоставляйте каждое существенное утверждение с точным подтверждающим фрагментом",[596,597,598],"Несоответствие авторитетности","Источник надежен, но не авторитетен в отношении конкретного факта","Определите иерархию источников для каждого конкретного типа утверждений",[600,601,602],"Временное несоответствие","Источник был верен на момент публикации","Проверяйте время извлечения, дату источника и наличие замещающих данных",[604,605,606],"Утрата условий","Суммаризация сохраняет вывод, но опускает исключения","Сравнивайте сгенерированное утверждение с полным локальным контекстом источника",[608,609,610],"Постфактум-ссылки","Правдоподобный источник прикрепляется уже после формирования ответа","Проверяйте последовательность в трейсе и предшествовало ли появление доказательства утверждению",[612,613,614],"Параметрическое переопределение","Модель игнорирует извлеченные доказательства и отвечает на основе априорных знаний","Проводите контрфактические тесты использования доказательств",[616,617,618],"Отмывание доказательств","Логический вывод модели суммаризируется и позже сохраняется как факт из первоисточника","Сохраняйте тип трансформации и происхождение при любых записях в память",[620,621,622],"Ложная опора на большинство источников","Несколько вторичных страниц повторяют одно и то же неподтвержденное утверждение","Прослеживайте утверждения вплоть до независимых или первичных доказательств",{},{"id":625,"data":626,"type":42,"tunes":628},"h-production",{"text":627,"level":219},"Как оценивать агента в производственной среде",{},{"id":630,"data":631,"type":392,"tunes":658},"production-flow",{"steps":632,"title":657,"orientation":391},[633,636,639,642,645,648,651,654],{"label":634,"description":635},"1. Определение существенных утверждений","Выявите факты, рекомендации или решения, правильность которых имеет решающее значение для задачи.",{"label":637,"description":638},"2. Создание эталонных доказательств","Сформируйте эталонные доказательства и требования к качеству источников для репрезентативных кейсов.",{"label":640,"description":641},"3. Сбор трейсов","Логируйте поисковые запросы, вызовы инструментов, возвращенные доказательства, сборку контекста, вывод модели и ссылки.",{"label":643,"description":644},"4. Оценка подтвержденности","Проверяйте, подтверждено ли каждое существенное утверждение прямо, частично, противоречиво или не подтверждено вовсе.",{"label":646,"description":647},"5. Оценка авторитетности и применимости","Оценивайте соответствие источника задаче и совпадение его условий с текущими требованиями.",{"label":649,"description":650},"6. Запуск контрфактических тестов","Удаляйте, заменяйте или делайте неактуальными ключевые доказательства и проверяйте, меняется ли ответ вслед за ними.",{"label":652,"description":653},"7. Анализ критических сбоев","Привлекайте людей или экспертов предметной области в случаях, когда автоматическая оценка недостаточно надежна.",{"label":655,"description":656},"8. Преобразование сбоев в тестовые сценарии","Добавляйте выявленные на проде сбои и граничные случаи в воспроизводимый датасет для регрессионного тестирования.","Пайплайн оценки доказательств",{},{"id":660,"data":661,"type":226,"tunes":663},"p-production-1",{"text":662},"Актуальные рекомендации OpenAI по оценке предлагают использовать специализированные тесты под конкретные задачи, непрерывное оценивание, датасеты на основе производственных данных и трейсы для отладки поведения агентов. Anthropic аналогично рекомендует комбинировать различные типы оценщиков для исследовательских агентов, поскольку корректность, качество источников, полнота покрытия и обоснованность — это отдельные независимые аспекты. Оценка доказательств должна следовать тому же принципу: несколько узконаправленных оценщиков дают больше диагностической пользы, чем единая непрозрачная оценка «качества».",{},{"id":665,"data":666,"type":42,"tunes":668},"h-judge",{"text":667,"level":219},"Не делайте LLM-судью единственным оценщиком доказательств",{},{"id":670,"data":671,"type":226,"tunes":673},"p-judge-1",{"text":672},"Оценщики на базе LLM полезны для масштабируемой классификации утверждений, проверок на релевантность и попарных сравнений, но они могут иметь те же слепые зоны, что и оцениваемая ими система. Такой оценщик может принять правдоподобное, но неподтвержденное утверждение, пропустить тонкую границу между версиями или переоценить красиво оформленный источник.",{},{"id":675,"data":676,"type":226,"tunes":678},"p-judge-2",{"text":677},"Рекомендации OpenAI по оценке советуют калибровать автоматических оценщиков по оценкам человека и применять четкие, узко очерченные критерии. Для систем с высокой плотностью доказательств следует везде, где это возможно, использовать детерминированные проверки: временные метки, версии объектов, область прав доступа, точные идентификаторы источников, порядок извлечения, хеши документов и наличие доказательства до того, как модель сгенерировала утверждение.",{},{"id":680,"data":681,"type":42,"tunes":683},"h-change",{"text":682,"level":219},"Что может изменить этот ответ?",{},{"id":685,"data":686,"type":226,"tunes":688},"p-change-1",{"text":687},"Оценка может быть проще, когда агент работает с небольшим, неизменяемым, авторитетным корпусом данных, а каждый ответ носит строго экстрактивный характер. В таких условиях авторитетность и применимость источников практически фиксированы, и сопоставления утверждения с подтверждающим фрагментом может быть достаточно.",{},{"id":690,"data":691,"type":226,"tunes":693},"p-change-2",{"text":692},"Оценка обязана становиться строже, когда агент объединяет веб-поиск, долговременную память, динамические инструменты, несколько юрисдикций, быстро меняющуюся информацию, специфичное для пользователя состояние или автономные действия. В подобных системах валидность доказательств зависит не только от текста источника, но и от того, когда и как именно доказательство было получено.",{},{"id":695,"data":696,"type":226,"tunes":698},"p-change-3",{"text":697},"Будущие модели могут научиться лучше отслеживать происхождение данных и неопределенность на внутреннем уровне, но это не устранит необходимость во внешних записях подтверждений в системах, требующих аудируемости. Система не должна полагаться на самоотчет модели о том, что именно на нее повлияло, когда трассировки и метаданные источников могут предоставить более убедительные доказательства.",{},{"id":700,"data":701,"type":42,"tunes":703},"h-limitations",{"text":702,"level":219},"Ограничения",{},{"id":705,"data":706,"type":226,"tunes":708},"p-limit-1",{"text":707},"Доказать причинно-следственное использование свидетельств только на основе трассировок возможно не всегда. Источник может присутствовать в контексте, не влияя на ответ, а модель может независимо знать тот же самый факт. Контрфактические тесты усиливают логический вывод, но сами по себе могут изменять распределение задач.",{},{"id":710,"data":711,"type":226,"tunes":713},"p-limit-2",{"text":712},"Авторитетность источника также может быть спорной или зависеть от предметной области. У некоторых вопросов нет единого авторитетного источника, и эксперты могут расходиться во мнениях относительно того, какие свидетельства заслуживают большего веса. В таких случаях оценщику следует фиксировать разногласия и оценивать прозрачность, полноту охвата и логику рассуждений по явным критериям, а не делать вид, будто существует один неоспоримый источник истины.",{},{"id":715,"data":716,"type":42,"tunes":718},"h-conclusion",{"text":717,"level":219},"Заключение",{},{"id":720,"data":721,"type":226,"tunes":723},"p-conclusion-1",{"text":722},"Вопрос «Сослался ли агент на источник?» слишком слаб для продакшн-систем ИИ. Гораздо важнее другой вопрос: исходит ли каждое существенное утверждение из подтверждения, которое действительно его подкрепляет, обладает надлежащей авторитетностью, все еще применимо к текущим условиям и присутствовало в пути выполнения до того, как утверждение было сформулировано?",{},{"id":725,"data":726,"type":226,"tunes":728},"p-conclusion-2",{"text":727},"Это превращает свидетельства из простого декоративного элемента в оцениваемое системное свойство. Фиксируйте трассировку. Сопоставляйте утверждения со свидетельствами. Проверяйте авторитетность и применимость. Проводите контрфактические тесты свидетельств. Сохраняйте происхождение данных через суммаризации и память. Тогда правильный ответ станет не просто правдоподобным — за ним появится путь обоснования, который можно проверить.",{},{"id":730,"data":731,"type":736,"tunes":737},"internal-reliability",{"url":732,"title":733,"excerpt":734,"ctaLabel":735},"https:\u002F\u002Fstajic.de\u002Fru\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Надежность ИИ-агентов: почему одного лишь финального ответа недостаточно","Корректность итогового результата сама по себе не доказывает, что путь выполнения агента был безопасным или надежным. В этой связанной статье объясняется, почему траектории, инструменты и промежуточные решения имеют значение.","Читать статью по теме","referralArticle",{},{"id":739,"data":740,"type":736,"tunes":745},"internal-reasoning",{"url":741,"title":742,"excerpt":743,"ctaLabel":744},"https:\u002F\u002Fstajic.de\u002Fru\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","От исследовательского протокола к общей структуре рассуждений ИИ","Практический метод рассуждений для разделения свидетельств, допущений, конкурирующих гипотез и валидации с учетом предметной области.","Читать о структуре рассуждений",{},{"id":747,"data":748,"type":42,"tunes":750},"h-faq",{"text":749,"level":219},"Часто задаваемые вопросы",{},{"id":752,"data":753,"type":752,"tunes":776},"faq",{"items":754,"title":775},[755,759,763,767,771],{"id":756,"answer":757,"question":758},"faq1","Нет. Цитата может быть релевантной теме, но не подтверждать конкретное утверждение, может исходить от ненадлежащего источника, потерять актуальность или быть прикрепленной постфактум, никак не повлияв на сгенерированный ответ.","Доказывает ли цитата, что ответ ИИ обоснован?",{"id":760,"answer":761,"question":762},"faq2","Используйте контрфактический тест утилизации свидетельств: выполните задачу с заведомо корректными данными, затем удалите или замените решающее свидетельство, оставив остальные входные данные неизменными. Если ответ не реагирует на изменение свидетельства, проверьте, не опирается ли модель на предварительные знания или другой источник.","Как проверить, действительно ли ИИ-агент использовал извлеченные свидетельства?",{"id":764,"answer":765,"question":766},"faq3","Обоснованность определяет, подкреплены ли утверждения предоставленными свидетельствами. Качество источника показывает, насколько само свидетельство уместно и авторитетно для утверждения подобного типа.","В чем разница между обоснованностью (groundedness) и качеством источника?",{"id":768,"answer":769,"question":770},"faq4","Источник может быть устаревшим, замененным более новым, актуальным для другой версии, юрисдикции, пользователя, группы населения или состояния системы, либо может содержать ограничивающие условия, которые были утеряны при поиске или суммаризации.","Почему реальный источник все равно может привести к неверному ответу ИИ?",{"id":772,"answer":773,"question":774},"faq5","Логируйте поисковый запрос, полученные источники, точные фрагменты свидетельств, временные метки и версии, фильтры, итоговый контекст, вывод модели, цитаты и последовательность шагов трассировки, чтобы оценщики могли восстановить, какие подтверждения были доступны до формулирования каждого значимого утверждения.","Что необходимо логировать для оценки использования свидетельств?","Оценка использования свидетельств в ИИ-агентах",{},{"id":778,"data":779,"type":42,"tunes":781},"h-glossary",{"text":780,"level":219},"Глоссарий",{},{"id":783,"data":784,"type":783,"tunes":810},"glossary",{"title":785,"entries":786},"Ключевые термины оценки свидетельств",[787,791,795,798,802,806],{"term":788,"anchor":789,"definition":790},"Подтверждение утверждения (Claim support)","claim-support","Степень, в которой конкретный фрагмент свидетельства напрямую доказывает сгенерированное утверждение.",{"term":792,"anchor":793,"definition":794},"Авторитетность свидетельства (Evidence authority)","evidence-authority","Степень пригодности источника для обоснования утверждения определенного типа с учетом его роли, происхождения и связи с лежащим в основе фактом.",{"term":796,"anchor":566,"definition":797},"Применимость (Applicability)","Условия, при которых свидетельство сохраняет валидность для утверждения, включая временные рамки, версию, юрисдикцию, пользователя, группу населения, состояние системы или другие границы.",{"term":799,"anchor":800,"definition":801},"Утилизация свидетельств (Evidence utilization)","evidence-utilization","Показатель того, действительно ли выходные данные агента реагируют на свидетельства, предоставленные на пути выполнения, и зависят ли от них.",{"term":803,"anchor":804,"definition":805},"Контрфактический тест свидетельств (Counterfactual evidence test)","counterfactual-evidence-test","Метод оценки, при котором решающее свидетельство удаляется, заменяется или модифицируется, чтобы проверить, изменится ли утверждение агента соответствующим образом.",{"term":807,"anchor":808,"definition":809},"Происхождение данных (Provenance)","provenance","Метаданные, фиксирующие, откуда поступило свидетельство, когда оно было получено, как трансформировалось и какую версию или состояние представляло.",{},{"id":812,"data":813,"type":42,"tunes":815},"h-sources",{"text":814,"level":219},"Первоисточники и материалы для дальнейшего чтения",{},{"id":817,"data":818,"type":824,"tunes":825},"src-openai-agent-evals",{"link":819,"meta":820},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals",{"image":821,"title":822,"description":823},{"url":464},"OpenAI — Оценка рабочих процессов агентов (Evaluate Agent Workflows)","Руководство по оценке трассировок, тестированию на уровне рабочих процессов, датасетам и воспроизводимым запускам проверок для агентов.","linkTool",{},{"id":827,"data":828,"type":824,"tunes":834},"src-openai-eval-best",{"link":829,"meta":830},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices",{"image":831,"title":832,"description":833},{"url":464},"OpenAI — Лучшие практики оценки (Evaluation Best Practices)","Рекомендации по оценкам под конкретные задачи, датасетам на основе продакшна, специализированным метрикам, непрерывной оценке и калибровке грейдеров.",{},{"id":836,"data":837,"type":824,"tunes":843},"src-anthropic-evals",{"link":838,"meta":839},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"image":840,"title":841,"description":842},{"url":464},"Anthropic — Демистификация оценок для ИИ-агентов (Demystifying Evals for AI Agents)","Руководство по оценке агентов, включая проверки обоснованности, полноты охвата и качества источников для исследовательских агентов.",{},{"id":845,"data":846,"type":824,"tunes":852},"src-openai-thirdparty",{"link":847,"meta":848},"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F",{"image":849,"title":850,"description":851},{"url":464},"OpenAI — Единый сборник методик для надежных независимых оценок (A Shared Playbook for Trustworthy Third-Party Evaluations)","Руководство по оценке, подчеркивающее, что эффективность современных агентов зависит от рабочего процесса и среды, а не только от финального ответа модели.",{},"2.31","ИИ-агент может ссылаться на источники и при этом использовать неверные доказательства. В этой статье представлен практический метод проверки обоснованности утверждений, авторитетности источников, применимости, происхождения и того, действительно ли доказательства повлияли на ответ.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve","PUBLISHED","2026-09-25T11:47:00.000Z","2026-09-25T15:47:02.186Z","2026-09-25T20:33:01.720Z",{"en":862,"de":863,"sr":864,"es":865,"fr":866,"it":867,"ru":868,"zh":869},"\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fde\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fsr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fes\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Ffr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fit\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fru\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fzh\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence",[871,875,879],{"id":872,"name":873,"slug":874},84,"Политики и границы данных","policy-and-data",{"id":876,"name":877,"slug":878},97,"Проверка на тест-наборе","verification",{"id":880,"name":881,"slug":882},66,"Операции контента","content-ops",{"id":884,"login":885,"email":886,"displayName":887},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[889,1416],{"lang":890,"title":891,"content":892,"contentJson":893,"excerpt":1415},"en","How to Know Whether an AI Agent Actually Used the Right Evidence","{\"time\":1790351390243,\"blocks\":[{\"id\":\"0hk9UtwqZf\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.\"},\"tunes\":{}},{\"id\":\"method-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"About the method\",\"body\":\"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.\"},\"tunes\":{}},{\"id\":\"h-citations\",\"type\":\"header\",\"data\":{\"text\":\"Why citations are not enough\",\"level\":2},\"tunes\":{}},{\"id\":\"p-citations-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.\"},\"tunes\":{}},{\"id\":\"p-citations-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.\"},\"tunes\":{}},{\"id\":\"h-four\",\"type\":\"header\",\"data\":{\"text\":\"The four questions every material claim should pass\",\"level\":2},\"tunes\":{}},{\"id\":\"table-four\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Dimension\",\"Question\",\"Typical failure\"],[\"Claim support\",\"Does the evidence directly support this exact claim?\",\"The source is topically related but does not establish the statement\"],[\"Evidence authority\",\"Is this an appropriate source for this kind of claim?\",\"A secondary summary is used where a primary source or live system is required\"],[\"Applicability\",\"Does the evidence apply to this time, version, jurisdiction, user, state, or population?\",\"A true statement is applied outside its valid conditions\"],[\"Evidence use\",\"Was this evidence actually available and used in the agent's execution path?\",\"The final answer is correct, but the retrieved evidence was irrelevant or unused\"]]},\"tunes\":{}},{\"id\":\"h-support\",\"type\":\"header\",\"data\":{\"text\":\"1. Claim support: does the source establish what the agent says?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-support-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.\"},\"tunes\":{}},{\"id\":\"p-support-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.\"},\"tunes\":{}},{\"id\":\"h-authority\",\"type\":\"header\",\"data\":{\"text\":\"2. Evidence authority: is this the right kind of source?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-authority-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.\"},\"tunes\":{}},{\"id\":\"p-authority-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.\"},\"tunes\":{}},{\"id\":\"h-applicability\",\"type\":\"header\",\"data\":{\"text\":\"3. Applicability: right evidence, wrong conditions\",\"level\":3},\"tunes\":{}},{\"id\":\"p-apply-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.\"},\"tunes\":{}},{\"id\":\"p-apply-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.\"},\"tunes\":{}},{\"id\":\"apply-warning\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Evidence can be authentic and still be wrong for the answer\",\"body\":\"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.\"},\"tunes\":{}},{\"id\":\"h-use\",\"type\":\"header\",\"data\":{\"text\":\"4. Evidence use: did the agent actually rely on the evidence?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-use-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.\"},\"tunes\":{}},{\"id\":\"p-use-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.\"},\"tunes\":{}},{\"id\":\"h-eut\",\"type\":\"header\",\"data\":{\"text\":\"The Evidence Utilization Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-eut-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.\"},\"tunes\":{}},{\"id\":\"eut-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence Utilization Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Select one material claim\",\"description\":\"Choose a claim whose correctness matters and define the expected answer precisely.\"},{\"label\":\"2. Identify gold evidence\",\"description\":\"Provide the smallest authoritative evidence set sufficient to support the claim.\"},{\"label\":\"3. Run with gold evidence\",\"description\":\"Verify that the agent produces the supported answer when the correct evidence is available.\"},{\"label\":\"4. Remove the decisive evidence\",\"description\":\"Run the same task without the key supporting passage while keeping other inputs stable.\"},{\"label\":\"5. Replace it with contradictory or superseding evidence\",\"description\":\"Where safe, provide controlled evidence that changes the correct conclusion.\"},{\"label\":\"6. Compare the claims\",\"description\":\"Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.\"},{\"label\":\"7. Inspect the trace\",\"description\":\"Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.\"}]},\"tunes\":{}},{\"id\":\"eut-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"The key signal\",\"body\":\"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A claim–evidence matrix is more useful than a source list\",\"level\":2},\"tunes\":{}},{\"id\":\"claim-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Claim\",\"Evidence\",\"Support\",\"Authority\",\"Applicability\",\"Used in trace\"],[\"Feature X is available\",\"Vendor documentation\",\"Direct\",\"High for availability claim\",\"Current version and region must match\",\"Yes \u002F No\"],[\"Configuration Y is faster\",\"Vendor benchmark\",\"Partial\",\"High for vendor's test, not independent performance\",\"Hardware and workload must match\",\"Yes \u002F No\"],[\"Policy applies to this user\",\"Current policy + account state\",\"Direct only when combined\",\"High\",\"Jurisdiction, date, role and account state must match\",\"Yes \u002F No\"],[\"A product is in stock\",\"Live inventory API\",\"Direct\",\"Authoritative for current stock\",\"Expires quickly\",\"Yes \u002F No\"]]},\"tunes\":{}},{\"id\":\"p-matrix-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.\"},\"tunes\":{}},{\"id\":\"h-retrieval-evidence\",\"type\":\"header\",\"data\":{\"text\":\"Separate retrieval quality from evidence quality\",\"level\":2},\"tunes\":{}},{\"id\":\"p-re-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.\"},\"tunes\":{}},{\"id\":\"retrieval-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Retrieval success is not evidence success\",\"layout\":\"table\",\"columns\":[{\"id\":\"situation\",\"label\":\"Situation\"},{\"id\":\"retrieval\",\"label\":\"Retrieval\"},{\"id\":\"evidence\",\"label\":\"Evidence quality\"}],\"rows\":[{\"id\":\"a\",\"label\":\"Right document, wrong claim\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"b\",\"label\":\"Right fact, stale source\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"c\",\"label\":\"Weak source, correct answer\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"d\",\"label\":\"Multiple sources required\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-source-quality\",\"type\":\"header\",\"data\":{\"text\":\"Evaluate source quality as a rubric, not a domain whitelist\",\"level\":2},\"tunes\":{}},{\"id\":\"p-source-quality-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.\"},\"tunes\":{}},{\"id\":\"p-source-quality-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.\"},\"tunes\":{}},{\"id\":\"h-coverage\",\"type\":\"header\",\"data\":{\"text\":\"Evidence coverage: every important claim needs support, not every sentence\",\"level\":2},\"tunes\":{}},{\"id\":\"p-coverage-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.\"},\"tunes\":{}},{\"id\":\"p-coverage-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.\"},\"tunes\":{}},{\"id\":\"h-provenance\",\"type\":\"header\",\"data\":{\"text\":\"Evidence provenance must survive summarization and memory\",\"level\":2},\"tunes\":{}},{\"id\":\"p-prov-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.\"},\"tunes\":{}},{\"id\":\"p-prov-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.\"},\"tunes\":{}},{\"id\":\"h-record\",\"type\":\"header\",\"data\":{\"text\":\"A practical evidence record\",\"level\":2},\"tunes\":{}},{\"id\":\"evidence-record\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Field\",\"Purpose\"],[\"claim_id\",\"Identifies the material claim being supported\"],[\"source_id \u002F source_url \u002F system\",\"Identifies where the evidence came from\"],[\"evidence_span\",\"Preserves the smallest passage, record, or tool result that supports the claim\"],[\"retrieved_at \u002F observed_at\",\"Allows freshness and timeline checks\"],[\"source_version \u002F object_version\",\"Allows supersession and reproducibility checks\"],[\"authority_role\",\"Explains why this source is suitable for this claim\"],[\"applicability\",\"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions\"],[\"transformation\",\"Marks whether evidence is raw, quoted, summarized, normalized, or derived\"],[\"trace_step\",\"Shows when the evidence became available to the agent\"],[\"support_status\",\"Direct, partial, contradictory, unsupported, or uncertain\"]]},\"tunes\":{}},{\"id\":\"h-failures\",\"type\":\"header\",\"data\":{\"text\":\"Failure modes that look grounded but are not\",\"level\":2},\"tunes\":{}},{\"id\":\"failure-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Failure mode\",\"Why it fools evaluators\",\"What to test\"],[\"Citation decoration\",\"The answer contains sources, so it looks researched\",\"Map each material claim to an exact supporting span\"],[\"Authority mismatch\",\"The source is reputable but not authoritative for the specific fact\",\"Define claim-specific source hierarchy\"],[\"Temporal mismatch\",\"The source was correct when published\",\"Check retrieval time, source date, and superseding evidence\"],[\"Condition stripping\",\"A summary keeps the conclusion but drops exceptions\",\"Compare generated claim with full local source context\"],[\"Post-hoc citation\",\"A plausible source is attached after the answer is generated\",\"Inspect trace ordering and whether evidence preceded the claim\"],[\"Parametric override\",\"The model ignores retrieved evidence and answers from prior knowledge\",\"Run counterfactual evidence-utilization tests\"],[\"Evidence laundering\",\"Model inference is summarized and later stored as if it were a source fact\",\"Preserve transformation type and provenance across memory writes\"],[\"Source majority fallacy\",\"Several secondary pages repeat the same unsupported statement\",\"Trace claims back to independent or primary evidence\"]]},\"tunes\":{}},{\"id\":\"h-production\",\"type\":\"header\",\"data\":{\"text\":\"How to evaluate the agent in production\",\"level\":2},\"tunes\":{}},{\"id\":\"production-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence evaluation pipeline\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Define material claims\",\"description\":\"Identify the facts, recommendations, or decisions whose correctness matters to the task.\"},{\"label\":\"2. Build gold evidence\",\"description\":\"Create reference evidence and source-quality expectations for representative cases.\"},{\"label\":\"3. Capture traces\",\"description\":\"Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.\"},{\"label\":\"4. Grade support\",\"description\":\"Check whether each material claim is directly, partially, contradictorily, or not supported.\"},{\"label\":\"5. Grade authority and applicability\",\"description\":\"Evaluate whether the source is appropriate and whether its conditions match the current task.\"},{\"label\":\"6. Run counterfactuals\",\"description\":\"Remove, replace, or supersede decisive evidence and test whether the answer follows the change.\"},{\"label\":\"7. Review high-impact failures\",\"description\":\"Use human or domain-expert review where automated grading is not reliable enough.\"},{\"label\":\"8. Convert failures into eval cases\",\"description\":\"Add production failures and edge cases to a repeatable regression dataset.\"}]},\"tunes\":{}},{\"id\":\"p-production-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.\"},\"tunes\":{}},{\"id\":\"h-judge\",\"type\":\"header\",\"data\":{\"text\":\"Do not let an LLM judge become the only evidence judge\",\"level\":2},\"tunes\":{}},{\"id\":\"p-judge-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.\"},\"tunes\":{}},{\"id\":\"p-judge-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.\"},\"tunes\":{}},{\"id\":\"p-change-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.\"},\"tunes\":{}},{\"id\":\"internal-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.\",\"ctaLabel\":\"Read the related article\"},\"tunes\":{}},{\"id\":\"internal-reasoning\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\",\"title\":\"From Research Protocol to a General AI Reasoning Framework\",\"excerpt\":\"A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.\",\"ctaLabel\":\"Read the reasoning framework\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Evaluating evidence use in AI agents\",\"items\":[{\"id\":\"faq1\",\"question\":\"Does a citation prove that an AI answer is grounded?\",\"answer\":\"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.\"},{\"id\":\"faq2\",\"question\":\"How can I test whether an AI agent actually used retrieved evidence?\",\"answer\":\"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.\"},{\"id\":\"faq3\",\"question\":\"What is the difference between groundedness and source quality?\",\"answer\":\"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.\"},{\"id\":\"faq4\",\"question\":\"Why can a real source still produce a wrong AI answer?\",\"answer\":\"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.\"},{\"id\":\"faq5\",\"question\":\"What should I log for evidence evaluation?\",\"answer\":\"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key evidence-evaluation terms\",\"entries\":[{\"term\":\"Claim support\",\"definition\":\"The degree to which a specific evidence span directly establishes a generated claim.\",\"anchor\":\"claim-support\"},{\"term\":\"Evidence authority\",\"definition\":\"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.\",\"anchor\":\"evidence-authority\"},{\"term\":\"Applicability\",\"definition\":\"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.\",\"anchor\":\"applicability\"},{\"term\":\"Evidence utilization\",\"definition\":\"Whether the agent's output actually responds to and depends on the evidence made available in its execution path.\",\"anchor\":\"evidence-utilization\"},{\"term\":\"Counterfactual evidence test\",\"definition\":\"An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.\",\"anchor\":\"counterfactual-evidence-test\"},{\"term\":\"Provenance\",\"definition\":\"Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.\",\"anchor\":\"provenance\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-agent-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluate Agent Workflows\",\"description\":\"Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-eval-best\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluation Best Practices\",\"description\":\"Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.\"}},\"tunes\":{}},{\"id\":\"src-anthropic-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Demystifying Evals for AI Agents\",\"description\":\"Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-thirdparty\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations\",\"description\":\"Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":894,"blocks":895,"version":1414},1790351390243,[896,900,904,909,914,918,922,926,930,954,958,962,966,970,974,978,982,986,990,995,999,1003,1007,1011,1015,1041,1046,1050,1084,1088,1092,1096,1120,1124,1128,1132,1136,1140,1144,1148,1152,1156,1160,1187,1191,1231,1235,1264,1268,1272,1276,1280,1284,1288,1292,1296,1300,1304,1308,1312,1316,1320,1327,1334,1338,1358,1362,1382,1386,1393,1400,1407],{"id":215,"data":897,"type":220,"tunes":899},{"title":898,"maxLevel":218,"minLevel":219},"Contents",{},{"id":223,"data":901,"type":226,"tunes":903},{"text":902},"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?",{},{"id":229,"data":905,"type":234,"tunes":908},{"body":906,"title":907,"variant":233},"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.","Direct answer",{},{"id":237,"data":910,"type":234,"tunes":913},{"body":911,"title":912,"variant":241},"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.","About the method",{},{"id":244,"data":915,"type":42,"tunes":917},{"text":916,"level":219},"Why citations are not enough",{},{"id":249,"data":919,"type":226,"tunes":921},{"text":920},"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.",{},{"id":254,"data":923,"type":226,"tunes":925},{"text":924},"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.",{},{"id":259,"data":927,"type":42,"tunes":929},{"text":928,"level":219},"The four questions every material claim should pass",{},{"id":264,"data":931,"type":287,"tunes":953},{"content":932,"stretched":43,"withHeadings":14},[933,937,941,945,949],[934,935,936],"Dimension","Question","Typical failure",[938,939,940],"Claim support","Does the evidence directly support this exact claim?","The source is topically related but does not establish the statement",[942,943,944],"Evidence authority","Is this an appropriate source for this kind of claim?","A secondary summary is used where a primary source or live system is required",[946,947,948],"Applicability","Does the evidence apply to this time, version, jurisdiction, user, state, or population?","A true statement is applied outside its valid conditions",[950,951,952],"Evidence use","Was this evidence actually available and used in the agent's execution path?","The final answer is correct, but the retrieved evidence was irrelevant or unused",{},{"id":290,"data":955,"type":42,"tunes":957},{"text":956,"level":218},"1. Claim support: does the source establish what the agent says?",{},{"id":295,"data":959,"type":226,"tunes":961},{"text":960},"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.",{},{"id":300,"data":963,"type":226,"tunes":965},{"text":964},"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.",{},{"id":305,"data":967,"type":42,"tunes":969},{"text":968,"level":218},"2. Evidence authority: is this the right kind of source?",{},{"id":310,"data":971,"type":226,"tunes":973},{"text":972},"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.",{},{"id":315,"data":975,"type":226,"tunes":977},{"text":976},"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.",{},{"id":320,"data":979,"type":42,"tunes":981},{"text":980,"level":218},"3. Applicability: right evidence, wrong conditions",{},{"id":325,"data":983,"type":226,"tunes":985},{"text":984},"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.",{},{"id":330,"data":987,"type":226,"tunes":989},{"text":988},"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.",{},{"id":335,"data":991,"type":234,"tunes":994},{"body":992,"title":993,"variant":339},"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.","Evidence can be authentic and still be wrong for the answer",{},{"id":342,"data":996,"type":42,"tunes":998},{"text":997,"level":218},"4. Evidence use: did the agent actually rely on the evidence?",{},{"id":347,"data":1000,"type":226,"tunes":1002},{"text":1001},"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.",{},{"id":352,"data":1004,"type":226,"tunes":1006},{"text":1005},"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.",{},{"id":357,"data":1008,"type":42,"tunes":1010},{"text":1009,"level":219},"The Evidence Utilization Test",{},{"id":362,"data":1012,"type":226,"tunes":1014},{"text":1013},"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.",{},{"id":367,"data":1016,"type":392,"tunes":1040},{"steps":1017,"title":1039,"orientation":391},[1018,1021,1024,1027,1030,1033,1036],{"label":1019,"description":1020},"1. Select one material claim","Choose a claim whose correctness matters and define the expected answer precisely.",{"label":1022,"description":1023},"2. Identify gold evidence","Provide the smallest authoritative evidence set sufficient to support the claim.",{"label":1025,"description":1026},"3. Run with gold evidence","Verify that the agent produces the supported answer when the correct evidence is available.",{"label":1028,"description":1029},"4. Remove the decisive evidence","Run the same task without the key supporting passage while keeping other inputs stable.",{"label":1031,"description":1032},"5. Replace it with contradictory or superseding evidence","Where safe, provide controlled evidence that changes the correct conclusion.",{"label":1034,"description":1035},"6. Compare the claims","Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.",{"label":1037,"description":1038},"7. Inspect the trace","Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.","Evidence Utilization Test",{},{"id":395,"data":1042,"type":234,"tunes":1045},{"body":1043,"title":1044,"variant":399},"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.","The key signal",{},{"id":402,"data":1047,"type":42,"tunes":1049},{"text":1048,"level":219},"A claim–evidence matrix is more useful than a source list",{},{"id":407,"data":1051,"type":287,"tunes":1083},{"content":1052,"stretched":43,"withHeadings":14},[1053,1059,1066,1072,1078],[1054,1055,1056,1057,946,1058],"Claim","Evidence","Support","Authority","Used in trace",[1060,1061,1062,1063,1064,1065],"Feature X is available","Vendor documentation","Direct","High for availability claim","Current version and region must match","Yes \u002F No",[1067,1068,1069,1070,1071,1065],"Configuration Y is faster","Vendor benchmark","Partial","High for vendor's test, not independent performance","Hardware and workload must match",[1073,1074,1075,1076,1077,1065],"Policy applies to this user","Current policy + account state","Direct only when combined","High","Jurisdiction, date, role and account state must match",[1079,1080,1062,1081,1082,1065],"A product is in stock","Live inventory API","Authoritative for current stock","Expires quickly",{},{"id":442,"data":1085,"type":226,"tunes":1087},{"text":1086},"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.",{},{"id":447,"data":1089,"type":42,"tunes":1091},{"text":1090,"level":219},"Separate retrieval quality from evidence quality",{},{"id":452,"data":1093,"type":226,"tunes":1095},{"text":1094},"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.",{},{"id":457,"data":1097,"type":488,"tunes":1119},{"rows":1098,"title":1111,"layout":287,"columns":1112},[1099,1102,1105,1108],{"id":461,"label":1100,"values":1101},"Right document, wrong claim",[464,464,464],{"id":466,"label":1103,"values":1104},"Right fact, stale source",[464,464,464],{"id":470,"label":1106,"values":1107},"Weak source, correct answer",[464,464,464],{"id":474,"label":1109,"values":1110},"Multiple sources required",[464,464,464],"Retrieval success is not evidence success",[1113,1115,1117],{"id":480,"label":1114},"Situation",{"id":483,"label":1116},"Retrieval",{"id":486,"label":1118},"Evidence quality",{},{"id":491,"data":1121,"type":42,"tunes":1123},{"text":1122,"level":219},"Evaluate source quality as a rubric, not a domain whitelist",{},{"id":496,"data":1125,"type":226,"tunes":1127},{"text":1126},"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.",{},{"id":501,"data":1129,"type":226,"tunes":1131},{"text":1130},"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.",{},{"id":506,"data":1133,"type":42,"tunes":1135},{"text":1134,"level":219},"Evidence coverage: every important claim needs support, not every sentence",{},{"id":511,"data":1137,"type":226,"tunes":1139},{"text":1138},"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.",{},{"id":516,"data":1141,"type":226,"tunes":1143},{"text":1142},"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.",{},{"id":521,"data":1145,"type":42,"tunes":1147},{"text":1146,"level":219},"Evidence provenance must survive summarization and memory",{},{"id":526,"data":1149,"type":226,"tunes":1151},{"text":1150},"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.",{},{"id":531,"data":1153,"type":226,"tunes":1155},{"text":1154},"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.",{},{"id":536,"data":1157,"type":42,"tunes":1159},{"text":1158,"level":219},"A practical evidence record",{},{"id":541,"data":1161,"type":287,"tunes":1186},{"content":1162,"stretched":43,"withHeadings":14},[1163,1166,1168,1170,1172,1174,1176,1178,1180,1182,1184],[1164,1165],"Field","Purpose",[548,1167],"Identifies the material claim being supported",[551,1169],"Identifies where the evidence came from",[554,1171],"Preserves the smallest passage, record, or tool result that supports the claim",[557,1173],"Allows freshness and timeline checks",[560,1175],"Allows supersession and reproducibility checks",[563,1177],"Explains why this source is suitable for this claim",[566,1179],"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions",[569,1181],"Marks whether evidence is raw, quoted, summarized, normalized, or derived",[572,1183],"Shows when the evidence became available to the agent",[575,1185],"Direct, partial, contradictory, unsupported, or uncertain",{},{"id":579,"data":1188,"type":42,"tunes":1190},{"text":1189,"level":219},"Failure modes that look grounded but are not",{},{"id":584,"data":1192,"type":287,"tunes":1230},{"content":1193,"stretched":43,"withHeadings":14},[1194,1198,1202,1206,1210,1214,1218,1222,1226],[1195,1196,1197],"Failure mode","Why it fools evaluators","What to test",[1199,1200,1201],"Citation decoration","The answer contains sources, so it looks researched","Map each material claim to an exact supporting span",[1203,1204,1205],"Authority mismatch","The source is reputable but not authoritative for the specific fact","Define claim-specific source hierarchy",[1207,1208,1209],"Temporal mismatch","The source was correct when published","Check retrieval time, source date, and superseding evidence",[1211,1212,1213],"Condition stripping","A summary keeps the conclusion but drops exceptions","Compare generated claim with full local source context",[1215,1216,1217],"Post-hoc citation","A plausible source is attached after the answer is generated","Inspect trace ordering and whether evidence preceded the claim",[1219,1220,1221],"Parametric override","The model ignores retrieved evidence and answers from prior knowledge","Run counterfactual evidence-utilization tests",[1223,1224,1225],"Evidence laundering","Model inference is summarized and later stored as if it were a source fact","Preserve transformation type and provenance across memory writes",[1227,1228,1229],"Source majority fallacy","Several secondary pages repeat the same unsupported statement","Trace claims back to independent or primary evidence",{},{"id":625,"data":1232,"type":42,"tunes":1234},{"text":1233,"level":219},"How to evaluate the agent in production",{},{"id":630,"data":1236,"type":392,"tunes":1263},{"steps":1237,"title":1262,"orientation":391},[1238,1241,1244,1247,1250,1253,1256,1259],{"label":1239,"description":1240},"1. Define material claims","Identify the facts, recommendations, or decisions whose correctness matters to the task.",{"label":1242,"description":1243},"2. Build gold evidence","Create reference evidence and source-quality expectations for representative cases.",{"label":1245,"description":1246},"3. Capture traces","Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.",{"label":1248,"description":1249},"4. Grade support","Check whether each material claim is directly, partially, contradictorily, or not supported.",{"label":1251,"description":1252},"5. Grade authority and applicability","Evaluate whether the source is appropriate and whether its conditions match the current task.",{"label":1254,"description":1255},"6. Run counterfactuals","Remove, replace, or supersede decisive evidence and test whether the answer follows the change.",{"label":1257,"description":1258},"7. Review high-impact failures","Use human or domain-expert review where automated grading is not reliable enough.",{"label":1260,"description":1261},"8. Convert failures into eval cases","Add production failures and edge cases to a repeatable regression dataset.","Evidence evaluation pipeline",{},{"id":660,"data":1265,"type":226,"tunes":1267},{"text":1266},"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.",{},{"id":665,"data":1269,"type":42,"tunes":1271},{"text":1270,"level":219},"Do not let an LLM judge become the only evidence judge",{},{"id":670,"data":1273,"type":226,"tunes":1275},{"text":1274},"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.",{},{"id":675,"data":1277,"type":226,"tunes":1279},{"text":1278},"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.",{},{"id":680,"data":1281,"type":42,"tunes":1283},{"text":1282,"level":219},"What would change this answer?",{},{"id":685,"data":1285,"type":226,"tunes":1287},{"text":1286},"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.",{},{"id":690,"data":1289,"type":226,"tunes":1291},{"text":1290},"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.",{},{"id":695,"data":1293,"type":226,"tunes":1295},{"text":1294},"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.",{},{"id":700,"data":1297,"type":42,"tunes":1299},{"text":1298,"level":219},"Limitations",{},{"id":705,"data":1301,"type":226,"tunes":1303},{"text":1302},"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.",{},{"id":710,"data":1305,"type":226,"tunes":1307},{"text":1306},"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.",{},{"id":715,"data":1309,"type":42,"tunes":1311},{"text":1310,"level":219},"Conclusion",{},{"id":720,"data":1313,"type":226,"tunes":1315},{"text":1314},"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?",{},{"id":725,"data":1317,"type":226,"tunes":1319},{"text":1318},"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.",{},{"id":730,"data":1321,"type":736,"tunes":1326},{"url":1322,"title":1323,"excerpt":1324,"ctaLabel":1325},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.","Read the related article",{},{"id":739,"data":1328,"type":736,"tunes":1333},{"url":1329,"title":1330,"excerpt":1331,"ctaLabel":1332},"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","From Research Protocol to a General AI Reasoning Framework","A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.","Read the reasoning framework",{},{"id":747,"data":1335,"type":42,"tunes":1337},{"text":1336,"level":219},"FAQ",{},{"id":752,"data":1339,"type":752,"tunes":1357},{"items":1340,"title":1356},[1341,1344,1347,1350,1353],{"id":756,"answer":1342,"question":1343},"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.","Does a citation prove that an AI answer is grounded?",{"id":760,"answer":1345,"question":1346},"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.","How can I test whether an AI agent actually used retrieved evidence?",{"id":764,"answer":1348,"question":1349},"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.","What is the difference between groundedness and source quality?",{"id":768,"answer":1351,"question":1352},"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.","Why can a real source still produce a wrong AI answer?",{"id":772,"answer":1354,"question":1355},"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.","What should I log for evidence evaluation?","Evaluating evidence use in AI agents",{},{"id":778,"data":1359,"type":42,"tunes":1361},{"text":1360,"level":219},"Glossary",{},{"id":783,"data":1363,"type":783,"tunes":1381},{"title":1364,"entries":1365},"Key evidence-evaluation terms",[1366,1368,1370,1372,1375,1378],{"term":938,"anchor":789,"definition":1367},"The degree to which a specific evidence span directly establishes a generated claim.",{"term":942,"anchor":793,"definition":1369},"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.",{"term":946,"anchor":566,"definition":1371},"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.",{"term":1373,"anchor":800,"definition":1374},"Evidence utilization","Whether the agent's output actually responds to and depends on the evidence made available in its execution path.",{"term":1376,"anchor":804,"definition":1377},"Counterfactual evidence test","An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.",{"term":1379,"anchor":808,"definition":1380},"Provenance","Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.",{},{"id":812,"data":1383,"type":42,"tunes":1385},{"text":1384,"level":219},"Primary sources and further reading",{},{"id":817,"data":1387,"type":824,"tunes":1392},{"link":819,"meta":1388},{"image":1389,"title":1390,"description":1391},{"url":464},"OpenAI — Evaluate Agent Workflows","Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.",{},{"id":827,"data":1394,"type":824,"tunes":1399},{"link":829,"meta":1395},{"image":1396,"title":1397,"description":1398},{"url":464},"OpenAI — Evaluation Best Practices","Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.",{},{"id":836,"data":1401,"type":824,"tunes":1406},{"link":838,"meta":1402},{"image":1403,"title":1404,"description":1405},{"url":464},"Anthropic — Demystifying Evals for AI Agents","Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.",{},{"id":845,"data":1408,"type":824,"tunes":1413},{"link":847,"meta":1409},{"image":1410,"title":1411,"description":1412},{"url":464},"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations","Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.",{},"2.31.6","An AI agent can cite sources and still use the wrong evidence. This article introduces a practical method for checking claim support, source authority, applicability, provenance, and whether the evidence actually influenced the answer.",{"lang":7,"title":208,"content":210,"contentJson":1417,"excerpt":854},{"time":212,"blocks":1418,"version":853},[1419,1422,1425,1428,1431,1434,1437,1440,1443,1452,1455,1458,1461,1464,1467,1470,1473,1476,1479,1482,1485,1488,1491,1494,1497,1508,1511,1514,1523,1526,1529,1532,1548,1551,1554,1557,1560,1563,1566,1569,1572,1575,1578,1593,1596,1609,1612,1624,1627,1630,1633,1636,1639,1642,1645,1648,1651,1654,1657,1660,1663,1666,1669,1672,1675,1684,1687,1697,1700,1705,1710,1715],{"id":215,"data":1420,"type":220,"tunes":1421},{"title":217,"maxLevel":218,"minLevel":219},{},{"id":223,"data":1423,"type":226,"tunes":1424},{"text":225},{},{"id":229,"data":1426,"type":234,"tunes":1427},{"body":231,"title":232,"variant":233},{},{"id":237,"data":1429,"type":234,"tunes":1430},{"body":239,"title":240,"variant":241},{},{"id":244,"data":1432,"type":42,"tunes":1433},{"text":246,"level":219},{},{"id":249,"data":1435,"type":226,"tunes":1436},{"text":251},{},{"id":254,"data":1438,"type":226,"tunes":1439},{"text":256},{},{"id":259,"data":1441,"type":42,"tunes":1442},{"text":261,"level":219},{},{"id":264,"data":1444,"type":287,"tunes":1451},{"content":1445,"stretched":43,"withHeadings":14},[1446,1447,1448,1449,1450],[268,269,270],[272,273,274],[276,277,278],[280,281,282],[284,285,286],{},{"id":290,"data":1453,"type":42,"tunes":1454},{"text":292,"level":218},{},{"id":295,"data":1456,"type":226,"tunes":1457},{"text":297},{},{"id":300,"data":1459,"type":226,"tunes":1460},{"text":302},{},{"id":305,"data":1462,"type":42,"tunes":1463},{"text":307,"level":218},{},{"id":310,"data":1465,"type":226,"tunes":1466},{"text":312},{},{"id":315,"data":1468,"type":226,"tunes":1469},{"text":317},{},{"id":320,"data":1471,"type":42,"tunes":1472},{"text":322,"level":218},{},{"id":325,"data":1474,"type":226,"tunes":1475},{"text":327},{},{"id":330,"data":1477,"type":226,"tunes":1478},{"text":332},{},{"id":335,"data":1480,"type":234,"tunes":1481},{"body":337,"title":338,"variant":339},{},{"id":342,"data":1483,"type":42,"tunes":1484},{"text":344,"level":218},{},{"id":347,"data":1486,"type":226,"tunes":1487},{"text":349},{},{"id":352,"data":1489,"type":226,"tunes":1490},{"text":354},{},{"id":357,"data":1492,"type":42,"tunes":1493},{"text":359,"level":219},{},{"id":362,"data":1495,"type":226,"tunes":1496},{"text":364},{},{"id":367,"data":1498,"type":392,"tunes":1507},{"steps":1499,"title":359,"orientation":391},[1500,1501,1502,1503,1504,1505,1506],{"label":371,"description":372},{"label":374,"description":375},{"label":377,"description":378},{"label":380,"description":381},{"label":383,"description":384},{"label":386,"description":387},{"label":389,"description":390},{},{"id":395,"data":1509,"type":234,"tunes":1510},{"body":397,"title":398,"variant":399},{},{"id":402,"data":1512,"type":42,"tunes":1513},{"text":404,"level":219},{},{"id":407,"data":1515,"type":287,"tunes":1522},{"content":1516,"stretched":43,"withHeadings":14},[1517,1518,1519,1520,1521],[411,412,413,414,280,415],[417,418,419,420,421,422],[424,425,426,427,428,422],[430,431,432,433,434,422],[436,437,419,438,439,422],{},{"id":442,"data":1524,"type":226,"tunes":1525},{"text":444},{},{"id":447,"data":1527,"type":42,"tunes":1528},{"text":449,"level":219},{},{"id":452,"data":1530,"type":226,"tunes":1531},{"text":454},{},{"id":457,"data":1533,"type":488,"tunes":1547},{"rows":1534,"title":477,"layout":287,"columns":1543},[1535,1537,1539,1541],{"id":461,"label":462,"values":1536},[464,464,464],{"id":466,"label":467,"values":1538},[464,464,464],{"id":470,"label":471,"values":1540},[464,464,464],{"id":474,"label":475,"values":1542},[464,464,464],[1544,1545,1546],{"id":480,"label":481},{"id":483,"label":484},{"id":486,"label":487},{},{"id":491,"data":1549,"type":42,"tunes":1550},{"text":493,"level":219},{},{"id":496,"data":1552,"type":226,"tunes":1553},{"text":498},{},{"id":501,"data":1555,"type":226,"tunes":1556},{"text":503},{},{"id":506,"data":1558,"type":42,"tunes":1559},{"text":508,"level":219},{},{"id":511,"data":1561,"type":226,"tunes":1562},{"text":513},{},{"id":516,"data":1564,"type":226,"tunes":1565},{"text":518},{},{"id":521,"data":1567,"type":42,"tunes":1568},{"text":523,"level":219},{},{"id":526,"data":1570,"type":226,"tunes":1571},{"text":528},{},{"id":531,"data":1573,"type":226,"tunes":1574},{"text":533},{},{"id":536,"data":1576,"type":42,"tunes":1577},{"text":538,"level":219},{},{"id":541,"data":1579,"type":287,"tunes":1592},{"content":1580,"stretched":43,"withHeadings":14},[1581,1582,1583,1584,1585,1586,1587,1588,1589,1590,1591],[545,546],[548,549],[551,552],[554,555],[557,558],[560,561],[563,564],[566,567],[569,570],[572,573],[575,576],{},{"id":579,"data":1594,"type":42,"tunes":1595},{"text":581,"level":219},{},{"id":584,"data":1597,"type":287,"tunes":1608},{"content":1598,"stretched":43,"withHeadings":14},[1599,1600,1601,1602,1603,1604,1605,1606,1607],[588,589,590],[592,593,594],[596,597,598],[600,601,602],[604,605,606],[608,609,610],[612,613,614],[616,617,618],[620,621,622],{},{"id":625,"data":1610,"type":42,"tunes":1611},{"text":627,"level":219},{},{"id":630,"data":1613,"type":392,"tunes":1623},{"steps":1614,"title":657,"orientation":391},[1615,1616,1617,1618,1619,1620,1621,1622],{"label":634,"description":635},{"label":637,"description":638},{"label":640,"description":641},{"label":643,"description":644},{"label":646,"description":647},{"label":649,"description":650},{"label":652,"description":653},{"label":655,"description":656},{},{"id":660,"data":1625,"type":226,"tunes":1626},{"text":662},{},{"id":665,"data":1628,"type":42,"tunes":1629},{"text":667,"level":219},{},{"id":670,"data":1631,"type":226,"tunes":1632},{"text":672},{},{"id":675,"data":1634,"type":226,"tunes":1635},{"text":677},{},{"id":680,"data":1637,"type":42,"tunes":1638},{"text":682,"level":219},{},{"id":685,"data":1640,"type":226,"tunes":1641},{"text":687},{},{"id":690,"data":1643,"type":226,"tunes":1644},{"text":692},{},{"id":695,"data":1646,"type":226,"tunes":1647},{"text":697},{},{"id":700,"data":1649,"type":42,"tunes":1650},{"text":702,"level":219},{},{"id":705,"data":1652,"type":226,"tunes":1653},{"text":707},{},{"id":710,"data":1655,"type":226,"tunes":1656},{"text":712},{},{"id":715,"data":1658,"type":42,"tunes":1659},{"text":717,"level":219},{},{"id":720,"data":1661,"type":226,"tunes":1662},{"text":722},{},{"id":725,"data":1664,"type":226,"tunes":1665},{"text":727},{},{"id":730,"data":1667,"type":736,"tunes":1668},{"url":732,"title":733,"excerpt":734,"ctaLabel":735},{},{"id":739,"data":1670,"type":736,"tunes":1671},{"url":741,"title":742,"excerpt":743,"ctaLabel":744},{},{"id":747,"data":1673,"type":42,"tunes":1674},{"text":749,"level":219},{},{"id":752,"data":1676,"type":752,"tunes":1683},{"items":1677,"title":775},[1678,1679,1680,1681,1682],{"id":756,"answer":757,"question":758},{"id":760,"answer":761,"question":762},{"id":764,"answer":765,"question":766},{"id":768,"answer":769,"question":770},{"id":772,"answer":773,"question":774},{},{"id":778,"data":1685,"type":42,"tunes":1686},{"text":780,"level":219},{},{"id":783,"data":1688,"type":783,"tunes":1696},{"title":785,"entries":1689},[1690,1691,1692,1693,1694,1695],{"term":788,"anchor":789,"definition":790},{"term":792,"anchor":793,"definition":794},{"term":796,"anchor":566,"definition":797},{"term":799,"anchor":800,"definition":801},{"term":803,"anchor":804,"definition":805},{"term":807,"anchor":808,"definition":809},{},{"id":812,"data":1698,"type":42,"tunes":1699},{"text":814,"level":219},{},{"id":817,"data":1701,"type":824,"tunes":1704},{"link":819,"meta":1702},{"image":1703,"title":822,"description":823},{"url":464},{},{"id":827,"data":1706,"type":824,"tunes":1709},{"link":829,"meta":1707},{"image":1708,"title":832,"description":833},{"url":464},{},{"id":836,"data":1711,"type":824,"tunes":1714},{"link":838,"meta":1712},{"image":1713,"title":841,"description":842},{"url":464},{},{"id":845,"data":1716,"type":824,"tunes":1719},{"link":847,"meta":1717},{"image":1718,"title":850,"description":851},{"url":464},{},"Post erfolgreich abgerufen",{"items":1722,"source":1786,"manualIds":1787,"manualMatchedIds":1788},[1723,1730,1737,1744,1751,1758,1765,1772,1779],{"id":1724,"slug":1725,"title":1726,"excerpt":1727,"featuredImage":1728,"publishedAt":1729},"467","the-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","Граница достоверности ответа: недостающий слой между релевантностью и надёжными ответами ИИ","Источник может быть релевантным, авторитетным и при этом неверным для задаваемого вопроса. Недостающий слой — применимость: условия, при которых ответ остаётся в силе, и изменения, вынуждающие пересмотреть его. В этой статье вводится понятие «Граница действительности ответа» как паттерн проектирования источников для людей, ИИ-поиска и RAG-систем.","\u002Fuploads\u002F2026\u002F09\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers-1790272901306-1g5jly.webp","2026-09-24T11:59:00.000Z",{"id":1731,"slug":1732,"title":1733,"excerpt":1734,"featuredImage":1735,"publishedAt":1736},"476","mcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained","MCP vs A2A vs UCP vs AP2 vs A2UI: разбор стека протоколов агентов","MCP, A2A, UCP, AP2 и A2UI часто представляют как конкурирующие агентские стандарты. В основном они решают разные проблемы интероперабельности. Это руководство сопоставляет каждый протокол с границей, которую он фактически стандартизирует,—и показывает, как они могут работать вместе в одной промышленной системе.","\u002Fuploads\u002F2026\u002F09\u002Fmcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained-1790352625869-2ezle0.webp","2026-09-25T12:09:00.000Z",{"id":1738,"slug":1739,"title":1740,"excerpt":1741,"featuredImage":1742,"publishedAt":1743},"470","what-should-an-ai-agent-remember-forget-recompute-or-retrieve-again","Что ИИ-агент должен помнить, забывать, перевычислять или извлекать повторно?","Долгоживущие агенты не должны помнить всё. В этой статье представлена практическая модель жизненного цикла для определения того, что относится к долговременной памяти, что следует извлекать повторно, что безопаснее пересчитать, а что должно истечь по сроку действия или быть заменено.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-should-an-ai-agent-remember-forget-recompute-or-retrieve-again-1790351131087-iehz28.webp","2026-09-25T09:43:00.000Z",{"id":1745,"slug":1746,"title":1747,"excerpt":1748,"featuredImage":1749,"publishedAt":1750},"477","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","Агенты для управления компьютером: почему успешная демонстрация всё ещё может быть ненадёжной системой","Агенты для управления компьютером теперь могут выполнять впечатляющие рабочие процессы в браузере и на рабочем столе, но один успешный запуск доказывает способность—а не надежность. В этой статье показано, как проверять повторяемость, устойчивость к условиям среды, управление на длинном горизонте, осведомленность о состоянии, верификацию результатов и безопасную обработку целей.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","2026-09-25T12:13:00.000Z",{"id":1752,"slug":1753,"title":1754,"excerpt":1755,"featuredImage":1756,"publishedAt":1757},"457","should-you-buy-5g-openwrt-router-old-firmware","Стоит ли покупать 5G OpenWrt-роутер со старой прошивкой? ZBT Z8102AX как практический пример","Покупка 5G-роутера с OpenWrt на старой прошивке может иметь смысл, но только при определённых условиях. ZBT Z8102AX наглядно демонстрирует обе стороны: железо полезное, модем работает, а роутер оставался стабильным в ходе тестов, однако OpenWrt 21.02, слабая упаковка и неясные пути обновления требуют взвешенного решения о покупке.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1759,"slug":1760,"title":1761,"excerpt":1762,"featuredImage":1763,"publishedAt":1764},"472","why-more-context-can-make-ai-answers-worse","Почему больше контекста может ухудшить ответы ИИ","Большее контекстное окно не гарантирует более качественного ответа. В этой статье объясняется, как размывание сигнала, противоречивые данные, устаревшее состояние, чувствительность к позиции и сжатие с потерями могут снизить надежность ИИ — и предлагается практический стресс-тест контекста.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z",{"id":1766,"slug":1767,"title":1768,"excerpt":1769,"featuredImage":1770,"publishedAt":1771},"456","zbt-z8102ax-hardware-packaging-review","Обзор аппаратной части и упаковки ZBT Z8102AX: мощный роутер, слабая коробка","ZBT Z8102AX производит солидное первое впечатление как тонкий черный металлический 5G-роутер на OpenWrt с несколькими разъемами для антенн, двумя слотами для SIM-карт, портами USB, LAN\u002FWAN и практичным набором аксессуаров. Аппаратная часть кажется полезной и серьезной, но упаковка, очевидно, является слабым местом.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-02-1781620590938-y33j4b.webp","2026-06-16T04:40:00.000Z",{"id":1773,"slug":1774,"title":1775,"excerpt":1776,"featuredImage":1777,"publishedAt":1778},"454","zbt-z8102ax-rm500u-ea-5g-modem-test","Quectel RM500U-EA в ZBT Z8102AX: диапазоны 5G, o2 Germany и поведение сигнала в реальных условиях","ZBT Z8102AX использует модем Quectel RM500U-EA для подключения 4G и 5G. В первом практическом тесте роутер успешно подключился к o2 Germany с LTE Band 3 и NR n28. Модем работает, но более глубокая диагностика, такая как RSRP, RSRQ, SINR, блокировка диапазонов и поведение сот, все еще требует надлежащего тестирования.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-06-1781620597879-qay2sx.webp","2026-06-16T08:39:00.000Z",{"id":1780,"slug":1781,"title":1782,"excerpt":1783,"featuredImage":1784,"publishedAt":1785},"383","canonical-architecture-url-design-resolver-logic-api-scalability-specification","Каноническая архитектура, Дизайн URL, Логика резолвера, Спецификация API и масштабируемости","Геоориентированная архитектура обнаружения для мультитенантных порталов. Определяет канонические URL-адреса, логику разрешения, стратегию кэширования и гео-модель чтения без привязки к CMS или рефакторинга базы данных. Разработано для стабильности SEO, масштабируемости и будущих расширений, таких как бронирование и карты.","\u002Fuploads\u002F2026\u002F01\u002Fcanonical-architecture-url-design-resolver-logic-api-scalability-specification-1769890763607-7rghbp.webp","2026-01-31T06:12:00.000Z","fallback",[],[]]