[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:fr":3,"public-menus:all":38,"post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:fr":205,"related:post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:fr:1":1709},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","fr","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1708},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":853,"featuredImage":854,"featuredImageAlt":855,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":856,"publishedAt":857,"createdAt":858,"updatedAt":859,"seoLocalePaths":860,"categories":869,"author":882,"translations":887},"471","Comment savoir si un agent IA a réellement utilisé les bonnes preuves","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Sommaire\">\u003Cstrong class=\"editorjs-toc__title\">Sommaire\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-5\" class=\"editorjs-toc__link\">Pourquoi les citations ne suffisent pas\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-8\" class=\"editorjs-toc__link\">Les quatre questions auxquelles chaque affirmation essentielle doit répondre\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">1. Soutien de l&#39;affirmation : la source établit-elle ce que dit l&#39;agent ?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-13\" class=\"editorjs-toc__link\">2. Autorité de la preuve : s&#39;agit-il du bon type de source ?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-16\" class=\"editorjs-toc__link\">3. Applicabilité : bonne preuve, mauvaises conditions\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-20\" class=\"editorjs-toc__link\">4. Utilisation des preuves : l&#39;agent s&#39;est-il réellement appuyé sur les preuves ?\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-23\" class=\"editorjs-toc__link\">Le test d&#39;utilisation des preuves (Evidence Utilization Test)\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-27\" class=\"editorjs-toc__link\">Une matrice affirmations–preuves est plus utile qu&#39;une liste de sources\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-30\" class=\"editorjs-toc__link\">Distinguer la qualité de la recherche documentaire de la qualité des preuves\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">Évaluer la qualité des sources via une grille critériée, non par une liste blanche de domaines\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-36\" class=\"editorjs-toc__link\">Couverture des preuves : chaque affirmation importante doit être étayée, pas chaque phrase\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-39\" class=\"editorjs-toc__link\">La provenance des preuves doit survivre à la résumation et à la mémoire\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-42\" class=\"editorjs-toc__link\">Un registre de preuves pratique\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-44\" class=\"editorjs-toc__link\">Modes de défaillance semblant fondés mais qui ne le sont pas\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-46\" class=\"editorjs-toc__link\">Comment évaluer l&#39;agent en production\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-49\" class=\"editorjs-toc__link\">Ne laissez pas un juge LLM être le seul juge des preuves\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-52\" class=\"editorjs-toc__link\">Qu&#39;est-ce qui modifierait cette réponse ?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-56\" class=\"editorjs-toc__link\">Limites\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-59\" class=\"editorjs-toc__link\">Conclusion\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-64\" class=\"editorjs-toc__link\">FAQ\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-66\" class=\"editorjs-toc__link\">Glossaire\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-68\" class=\"editorjs-toc__link\">Sources principales et lectures complémentaires\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>Un agent d'IA peut citer des sources, extraire des documents et pourtant utiliser les mauvaises preuves. Une source peut être faisant autorité mais sans rapport avec l'affirmation exacte. Un extrait récupéré peut ne soutenir qu'une partie d'une réponse. Une source correcte peut être obsolète, remplacée ou valide pour une juridiction, une version de produit, un utilisateur ou un état de système inadéquat. Cela crée un problème d'évaluation plus difficile que la simple vérification des citations : l'agent a-t-il réellement utilisé les bonnes preuves pour l'affirmation qu'il a formulée ?\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Réponse directe\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Pour savoir si un agent d&#39;IA a utilisé les bonnes preuves, évaluez la chaîne &lt;strong&gt;Affirmation → Preuve → Applicabilité → Utilisation&lt;\u002Fstrong&gt;. Pour chaque affirmation essentielle, vérifiez que la preuve l&#39;étaye directement, provient d&#39;une autorité appropriée, s&#39;applique aux conditions actuelles et était réellement accessible à l&#39;agent avant que l&#39;affirmation ne soit produite. Une citation seule ne prouve aucun de ces éléments.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">À propos de la méthode\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Le modèle Affirmation–Preuve–Applicabilité–Utilisation et le test d&#39;utilisation des preuves présentés dans cet article sont des méthodes pratiques d&#39;évaluation, et non des normes formelles du secteur. Ils s&#39;appuient sur des concepts établis tels que l&#39;ancrage factuel, la qualité des sources, la couverture des citations, l&#39;évaluation des traces d&#39;exécution et les évaluations spécifiques aux tâches.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-5\">Pourquoi les citations ne suffisent pas\u003C\u002Fh2>\n\u003Cp>Une citation ne répond qu'à une question restreinte : le système a associé une affirmation ou une réponse à une source. Elle n'établit pas automatiquement que la source étaye l'affirmation spécifique, que la source fasse suffisamment autorité pour la tâche, que le passage cité contienne la condition ou l'exception nécessaire, ou que le modèle se soit appuyé sur cette preuve plutôt que de produire la réponse à partir de ses connaissances préalables.\u003C\u002Fp>\n\u003Cp>Les recommandations d'Anthropic pour l'évaluation des agents de recherche distinguent explicitement l'ancrage, la couverture et la qualité des sources. Les conseils d'OpenAI sur l'évaluation des agents mettent de même l'accent sur les traces d'exécution, car le résultat final ne révèle pas si l'agent a sélectionné les bons outils ou suivi le flux de travail prévu. Ces idées mènent à une conclusion plus large : la qualité des preuves est une propriété du chemin d'exécution, et pas seulement du texte final.\u003C\u002Fp>\n\u003Ch2 id=\"section-8\">Les quatre questions auxquelles chaque affirmation essentielle doit répondre\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Dimension\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Question\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Échec typique\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Soutien de l'affirmation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La preuve étaye-t-elle directement cette affirmation exacte ?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La source est thématiquement liée mais n'établit pas l'affirmation\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autorité de la preuve\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">S'agit-il d'une source appropriée pour ce type d'affirmation ?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Un résumé secondaire est utilisé là où une source primaire ou un système en direct est requis\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Applicabilité\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La preuve s'applique-t-elle à cette période, version, juridiction, utilisateur, état ou population ?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Une affirmation vraie est appliquée en dehors de ses conditions de validité\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Utilisation de la preuve\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Cette preuve était-elle réellement disponible et utilisée dans le chemin d'exécution de l'agent ?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La réponse finale est correcte, mais la preuve extraite était hors de propos ou inutilisée\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch3 id=\"section-10\">1. Soutien de l'affirmation : la source établit-elle ce que dit l'agent ?\u003C\u002Fh3>\n\u003Cp>Les preuves doivent être évaluées au niveau de chaque affirmation. Un document peut être pertinent par rapport au sujet et pourtant ne pas étayer une déclaration précise. Si une source indique qu'une fonctionnalité est disponible dans certaines régions, la réponse « la fonctionnalité est disponible dans le monde entier » n'est pas étayée, même si la citation semble plausible.\u003C\u002Fp>\n\u003Cp>C'est ici que les jugements larges de type « ancré \u002F non ancré » sont souvent trop imprécis. Décomposez la réponse en affirmations essentielles, associez chaque affirmation au segment de preuve le plus court qui l'étaye, et classez la relation : soutien direct, soutien partiel, contradiction ou absence de soutien.\u003C\u002Fp>\n\u003Ch3 id=\"section-13\">2. Autorité de la preuve : s'agit-il du bon type de source ?\u003C\u002Fh3>\n\u003Cp>La sélection de la bonne preuve ne se résume pas à la pertinence sémantique. La source doit convenir à la décision prise. Le statut actuel d'un compte doit provenir du système de gestion des comptes, et non d'un ancien e-mail. Une affirmation sur le comportement d'une API doit de préférence être vérifiée par rapport à la documentation actuelle du fournisseur ou à un comportement reproductible. Une exigence légale peut nécessiter la loi applicable, les textes du régulateur ou des directives officielles plutôt qu'un article de blog généraliste.\u003C\u002Fp>\n\u003Cp>L'autorité d'une source dépend de la tâche. Un rapport de la communauté peut constituer la meilleure preuve pour un bogue réel non reconnu par la documentation du fournisseur. Une annonce d'un fournisseur peut faire autorité quant à ce qu'il revendique, mais représenter une preuve faible pour des performances mesurées de manière indépendante. L'évaluateur a donc besoin d'une hiérarchie explicite des sources pour la tâche en cours, plutôt que d'un score universel d'autorité.\u003C\u002Fp>\n\u003Ch3 id=\"section-16\">3. Applicabilité : bonne preuve, mauvaises conditions\u003C\u002Fh3>\n\u003Cp>Les erreurs de preuves les plus dangereuses ne proviennent souvent pas de sources inventées, mais de sources valides utilisées en dehors de leur champ d'application. Une recommandation peut varier selon la version logicielle, la date, la juridiction, la révision matérielle, les permissions utilisateur, la disponibilité du produit, l'état actuel de la partie, la configuration du locataire ou d'autres variables d'environnement.\u003C\u002Fp>\n\u003Cp>Pour chaque source essentielle, conservez les conditions qui déterminent si elle s'applique toujours. Cela s'avère particulièrement crucial après une synthèse : une mémoire compressée ou une citation peut conserver la conclusion tout en omettant l'exception, la date ou le prérequis qui rendait cette conclusion valide.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Une preuve peut être authentique tout en étant inappropriée pour la réponse\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Une source réelle, citée avec exactitude, peut tout de même mener à une réponse erronée lorsque sa date, sa version, sa population cible, sa juridiction ou son état ne correspondent pas à la question posée.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-20\">4. Utilisation des preuves : l'agent s'est-il réellement appuyé sur les preuves ?\u003C\u002Fh3>\n\u003Cp>Une réponse peut être correcte même lorsque la recherche documentaire a échoué. Le modèle connaît peut-être déjà la réponse, la déduit d'un contexte sans rapport, ou devine tout simplement juste. Si l'évaluation ne vérifie que l'exactitude finale, le système peut sembler bien étayé alors que le cheminement des preuves est rompu.\u003C\u002Fp>\n\u003Cp>Pour évaluer l'utilisation des preuves, examinez la trace d'exécution. Vérifiez quelles sources ont été récupérées, quels passages ont intégré le contexte du modèle, à quel moment ils sont devenus disponibles, et si l'affirmation finale peut s'expliquer par ces éléments fournis. Les outils actuels d'évaluation d'agents d'OpenAI mettent précisément l'accent sur l'évaluation des traces, car le comportement au niveau du workflow ne peut pas être reconstitué de manière fiable à partir de la seule réponse finale.\u003C\u002Fp>\n\u003Ch2 id=\"section-23\">Le test d'utilisation des preuves (Evidence Utilization Test)\u003C\u002Fh2>\n\u003Cp>Une évaluation pratique peut être conçue sous la forme d'un contrefactuel contrôlé. Au lieu de se demander uniquement si la réponse est correcte, modifiez la preuve et observez si l'affirmation évolue dans le sens attendu.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Test d'utilisation des preuves\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Sélectionner une affirmation déterminante\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Choisissez une affirmation dont l'exactitude importe et définissez précisément la réponse attendue.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Identifier la preuve de référence\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Fournissez le plus petit ensemble de preuves faisant autorité suffisant pour étayer l'affirmation.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Exécuter avec la preuve de référence\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Vérifiez que l'agent produit la réponse étayée lorsque la preuve correcte est disponible.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Retirer la preuve décisive\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Exécutez la même tâche sans le passage clé de soutien tout en maintenant les autres entrées stables.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. La remplacer par une preuve contradictoire ou plus récente\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Lorsque c'est sans risque, fournissez une preuve contrôlée qui modifie la conclusion correcte.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Comparer les affirmations\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Vérifiez si la réponse s'adapte au changement de preuve ou reste ancrée dans les connaissances préalables du modèle.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Examiner la trace\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Confirmez ce qui a été extrait, ce qui a atteint le contexte et quelle source ou résultat d'outil a précédé l'affirmation.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Le signal clé\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Si la preuve décisive change mais que l&#39;affirmation de l&#39;agent ne change pas, vous avez la preuve que le système n&#39;utilise peut-être pas la recherche documentaire comme prévu — même si la réponse initiale s&#39;est avérée exacte.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-27\">Une matrice affirmations–preuves est plus utile qu'une liste de sources\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Affirmation\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Preuve\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Niveau de soutien\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Autorité\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Applicabilité\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Utilisé dans la trace\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La fonctionnalité X est disponible\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Documentation du fournisseur\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direct\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Élevée pour une affirmation de disponibilité\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La version actuelle et la région doivent concorder\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Oui \u002F Non\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La configuration Y est plus rapide\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Benchmark du fournisseur\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Partiel\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Élevée pour le test du fournisseur, pas pour des performances indépendantes\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le matériel et la charge de travail doivent concorder\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Oui \u002F Non\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La politique s'applique à cet utilisateur\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Politique actuelle + état du compte\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direct uniquement lorsque combinés\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Élevée\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La juridiction, la date, le rôle et l'état du compte doivent concorder\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Oui \u002F Non\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Un produit est en stock\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">API d'inventaire en direct\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direct\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Fait autorité pour le stock actuel\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Expire rapidement\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Oui \u002F Non\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Cette matrice soulève plusieurs questions que la simple vérification des citations occulte. Une affirmation peut nécessiter plusieurs sources. Une source peut n'étayer qu'une partie d'une affirmation. Une source faisant autorité peut avoir une fenêtre de validité très courte. Et une source parfaitement valable peut être inutile si elle n'a jamais intégré le flux d'exécution.\u003C\u002Fp>\n\u003Ch2 id=\"section-30\">Distinguer la qualité de la recherche documentaire de la qualité des preuves\u003C\u002Fh2>\n\u003Cp>Les métriques de recherche documentaire visent à savoir si des documents pertinents ont été trouvés et classés. L'évaluation des preuves vise à savoir si ces documents justifient les affirmations obtenues. Les deux aspects sont liés, mais distincts.\u003C\u002Fp>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">La réussite de la recherche documentaire ne garantit pas la validité des preuves\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Situation\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Recherche documentaire\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Qualité des preuves\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Bon document, mauvaise affirmation\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Fait exact, source obsolète\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Source faible, réponse correcte\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Plusieurs sources requises\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-33\">Évaluer la qualité des sources via une grille critériée, non par une liste blanche de domaines\u003C\u002Fh2>\n\u003Cp>Les listes prédéfinies de « domaines de confiance » sont tentantes, mais souvent fragiles. La qualité d'une source doit plutôt refléter le type d'affirmation. Parmi les critères pertinents figurent le caractère primaire ou secondaire de la source, sa récence, son caractère direct, sa reproductibilité, son indépendance, l'expertise du domaine, la provenance des données, la fréquence de mise à jour, et l'éventuelle incitation de la source à exagérer l'affirmation.\u003C\u002Fp>\n\u003Cp>Les recommandations d'Anthropic pour l'évaluation des agents de recherche mentionnent explicitement le contrôle de la qualité des sources aux côtés de l'ancrage factuel et de la couverture. La mise en œuvre pratique doit donc évaluer à la fois ce que dit la source et si cette source est appropriée pour ce type d'affirmation.\u003C\u002Fp>\n\u003Ch2 id=\"section-36\">Couverture des preuves : chaque affirmation importante doit être étayée, pas chaque phrase\u003C\u002Fh2>\n\u003Cp>Toutes les phrases ne nécessitent pas de citation. Le langage de transition, les calculs arithmétiques dérivés de manière transparente à partir de valeurs citées ou les interprétations clairement indiquées peuvent ne pas requérir de source distincte. Mais chaque affirmation matérielle et vérifiable de manière externe doit bénéficier d'un appui suffisant pour qu'un évaluateur puisse reconstituer pourquoi l'agent a été autorisé à l'énoncer.\u003C\u002Fp>\n\u003Cp>La couverture doit donc être pondérée en fonction de l'importance de l'affirmation. L'absence de justification pour un détail décoratif n'équivaut pas à l'absence de justification pour un prix, une décision d'éligibilité, une consigne de sécurité, une exigence légale, une déclaration de compatibilité technique ou un fait déterminant pour une recommandation.\u003C\u002Fp>\n\u003Ch2 id=\"section-39\">La provenance des preuves doit survivre à la résumation et à la mémoire\u003C\u002Fh2>\n\u003Cp>Les agents à exécution longue résument souvent les travaux précédents ou enregistrent des mémoires durables. Si la provenance des preuves est supprimée lors de cette transformation, les futurs agents risquent de récupérer une conclusion nette sans savoir si elle provient d'une déclaration de l'utilisateur, d'une API en direct, d'un ancien document, d'une inférence du modèle ou d'un résultat Web non vérifié.\u003C\u002Fp>\n\u003Cp>Pour les faits importants, conservez au minimum l'identité de la source, l'horodatage de récupération ou d'observation, le type de preuve, la version ou l'état pertinent, et indiquez si le texte stocké est cité, résumé, inféré ou dérivé. La provenance est ce qui permet à un agent ultérieur de décider si la preuve doit être acceptée, actualisée, restreinte ou rejetée.\u003C\u002Fp>\n\u003Ch2 id=\"section-42\">Un registre de preuves pratique\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Champ\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Finalité\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">claim_id\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Identifie l'affirmation matérielle étayée\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_id \u002F source_url \u002F system\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Identifie l'origine de la preuve\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">evidence_span\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Conserve le plus petit extrait, enregistrement ou résultat d'outil qui étaye l'affirmation\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">retrieved_at \u002F observed_at\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Permet les vérifications de fraîcheur et de chronologie\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_version \u002F object_version\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Permet les vérifications de remplacement et de reproductibilité\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">authority_role\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Explique pourquoi cette source est appropriée pour cette affirmation\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">applicability\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Stocke la date, la juridiction, la version du produit, l'utilisateur, le locataire, l'état ou d'autres conditions pertinentes\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">transformation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Indique si la preuve est brute, citée, résumée, normalisée ou dérivée\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">trace_step\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Montre à quel moment la preuve est devenue accessible à l'agent\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">support_status\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direct, partiel, contradictoire, non étayé ou incertain\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-44\">Modes de défaillance semblant fondés mais qui ne le sont pas\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Mode de défaillance\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Pourquoi il trompe les évaluateurs\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Ce qu'il faut tester\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Décoration par citation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La réponse contient des sources, elle a donc l'air documentée\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Associer chaque affirmation matérielle à un extrait justificatif exact\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Inadéquation d'autorité\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La source est réputée mais ne fait pas autorité pour ce fait précis\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Définir une hiérarchie des sources propre à chaque affirmation\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Inadéquation temporelle\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La source était exacte au moment de sa publication\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Vérifier la date de récupération, la date de la source et les preuves postérieures\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Suppression des conditions\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Un résumé conserve la conclusion mais omet les exceptions\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Comparer l'affirmation générée avec le contexte textuel complet de la source\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Citation a posteriori\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Une source plausible est rattachée après la génération de la réponse\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Inspecter l'ordre des traces et vérifier si la preuve précédait l'affirmation\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Priorité paramétrique\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le modèle ignore les preuves récupérées et répond à partir de ses connaissances préalables\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Exécuter des tests contrefactuels d'utilisation des preuves\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Blanchiment de preuves\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Une inférence du modèle est résumée puis stockée comme s'il s'agissait d'un fait source\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Préserver le type de transformation et la provenance lors des écritures en mémoire\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sophisme de la majorité des sources\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Plusieurs pages secondaires répètent la même affirmation non vérifiée\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Remonter les affirmations jusqu'aux preuves indépendantes ou primaires\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-46\">Comment évaluer l'agent en production\u003C\u002Fh2>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Pipeline d'évaluation des preuves\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Définir les affirmations matérielles\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identifier les faits, recommandations ou décisions dont l'exactitude importe pour la tâche.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Établir des preuves de référence\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Créer des preuves de référence et des exigences de qualité des sources pour les cas représentatifs.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Capturer les traces\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Consigner les requêtes de récupération, les appels d'outils, les preuves renvoyées, la construction du contexte, la sortie du modèle et les citations.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Évaluer l'appui documentaire\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Vérifier si chaque affirmation matérielle est étayée de manière directe, partielle, contradictoire ou non étayée.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Évaluer l'autorité et l'applicabilité\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Évaluer si la source est appropriée et si ses conditions correspondent à la tâche en cours.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Exécuter des tests contrefactuels\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Supprimer, remplacer ou invalider des preuves déterminantes et vérifier si la réponse s'adapte au changement.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Examiner les défaillances à fort impact\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Faire appel à une révision humaine ou d'experts du domaine lorsque l'évaluation automatisée n'est pas assez fiable.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Convertir les défaillances en cas d'évaluation\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Ajouter les défaillances de production et les cas limites à un ensemble de données de non-régression reproductible.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>Les recommandations actuelles d'OpenAI en matière d'évaluation préconisent des évaluations adaptées à la tâche, une évaluation continue, des jeux de données issus de la production et des traces pour déboguer le comportement de l'agent. De même, Anthropic recommande de combiner plusieurs types d'évaluateurs pour les agents de recherche, car l'exactitude, la qualité des sources, la couverture et le fondement factuel constituent des dimensions distinctes. L'évaluation des preuves doit suivre le même modèle : plusieurs évaluateurs ciblés fournissent un meilleur diagnostic qu'un score de « qualité » opaque unique.\u003C\u002Fp>\n\u003Ch2 id=\"section-49\">Ne laissez pas un juge LLM être le seul juge des preuves\u003C\u002Fh2>\n\u003Cp>Les évaluateurs LLM sont utiles pour classifier à grande échelle des affirmations, vérifier la pertinence et réaliser des comparaisons par paires, mais ils peuvent partager les mêmes angles morts que le système qu'ils évaluent. Un évaluateur peut accepter une affirmation plausible mais non étayée, manquer une limite subtile de version ou surévaluer une source bien formulée.\u003C\u002Fp>\n\u003Cp>Les directives d'évaluation d'OpenAI recommandent de calibrer les évaluateurs automatisés par rapport au jugement humain et d'utiliser des critères clairs et bien définis. Pour les systèmes riches en preuves, des vérifications déterministes doivent être utilisées dans la mesure du possible : horodatages, versions d'objets, périmètre des autorisations, identifiants exacts de sources, ordre de récupération, hachages de documents et présence effective de la preuve avant que le modèle ne génère l'affirmation.\u003C\u002Fp>\n\u003Ch2 id=\"section-52\">Qu'est-ce qui modifierait cette réponse ?\u003C\u002Fh2>\n\u003Cp>L'évaluation peut être plus simple lorsque l'agent opère sur un corpus restreint, immuable et faisant autorité, et que chaque réponse est strictement extractive. Dans un tel environnement, l'autorité de la source et son applicabilité sont en grande partie fixes, et la vérification de l'appui d'un extrait à une affirmation peut suffire.\u003C\u002Fp>\n\u003Cp>L'évaluation doit devenir plus stricte lorsque l'agent combine recherche Web, mémoire à long terme, outils en direct, juridictions multiples, informations évoluant rapidement, état propre à l'utilisateur ou actions autonomes. Dans ces systèmes, la validité des preuves dépend non seulement du texte source, mais aussi du moment et de la manière dont les preuves ont été obtenues.\u003C\u002Fp>\n\u003Cp>Les futurs modèles deviendront peut-être plus performants pour suivre en interne la provenance et l'incertitude, mais cela ne supprimera pas la nécessité de conserver des enregistrements de preuves externes dans les systèmes nécessitant une auditabilité. Un système ne devrait pas dépendre de l'auto-évaluation du modèle sur ce qui l'a influencé lorsque les traces et les métadonnées de source peuvent fournir des preuves plus solides.\u003C\u002Fp>\n\u003Ch2 id=\"section-56\">Limites\u003C\u002Fh2>\n\u003Cp>Il n'est pas toujours possible de prouver l'utilisation causale des preuves uniquement à partir des traces. Une source peut être présente dans le contexte sans influencer la réponse, et un modèle peut connaître indépendamment le même fait. Les tests contrefactuels renforcent l'inférence, mais peuvent eux-mêmes modifier la distribution de la tâche.\u003C\u002Fp>\n\u003Cp>L'autorité de la source peut également être contestée ou dépendre du domaine. Certaines questions ne comportent aucune source faisant autorité unique, et les experts peuvent être en désaccord sur la preuve qui mérite le plus de poids. Dans ces cas, l'évaluateur doit préserver le désaccord et noter la transparence, la couverture et le raisonnement selon une grille explicite plutôt que de prétendre qu'il existe une source de vérité incontestée.\u003C\u002Fp>\n\u003Ch2 id=\"section-59\">Conclusion\u003C\u002Fh2>\n\u003Cp>La question « L'agent a-t-il cité une source ? » est trop faible pour l'IA en production. La question la plus pertinente est la suivante : chaque affirmation importante provient-elle d'une preuve qui l'étaye réellement, dispose-t-elle de l'autorité requise, s'applique-t-elle toujours aux conditions actuelles et était-elle disponible dans le chemin d'exécution avant que l'affirmation ne soit formulée ?\u003C\u002Fp>\n\u003Cp>Cela transforme la preuve, passant du simple élément décoratif à une propriété évaluable du système. Capturez la trace. Associez les affirmations aux preuves. Vérifiez l'autorité et l'applicabilité. Exécutez des tests de preuves contrefactuels. Préservez la provenance à travers les résumés et la mémoire. Dès lors, une réponse correcte n'est plus seulement plausible : elle dispose d'un chemin de preuves vérifiable.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Fiabilité des agents d'IA : pourquoi la réponse finale ne suffit pas\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">L'exactitude du résultat final ne peut à elle seule prouver que le chemin d'exécution d'un agent était sûr ou fiable. Cet article connexe explique pourquoi les trajectoires, les outils et les décisions intermédiaires sont essentiels.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Lire l'article connexe →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Du protocole de recherche à un cadre général de raisonnement pour l'IA\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Une méthode pratique de raisonnement pour dissocier preuves, hypothèses, hypothèses concurrentes et validation spécifique au domaine.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Découvrir le cadre de raisonnement →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-64\">FAQ\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Évaluer l&#39;utilisation des preuves chez les agents d&#39;IA\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Une citation prouve-t-elle qu&#39;une réponse d&#39;IA est ancrée dans les faits ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Non. Une citation peut être pertinente par rapport au sujet sans étayer l&#39;affirmation exacte, peut provenir d&#39;une mauvaise autorité, peut ne plus s&#39;appliquer ou avoir été ajoutée sans influencer concrètement la réponse générée.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Comment puis-je vérifier si un agent d&#39;IA a réellement utilisé les preuves récupérées ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Utilisez un test contrefactuel d&#39;utilisation des preuves : exécutez la tâche avec des preuves reconnues exactes, puis retirez ou remplacez la preuve déterminante tout en conservant les autres entrées stables. Si la réponse ne s&#39;ajuste pas au changement de preuve, vérifiez si le modèle s&#39;appuie sur des connaissances préalables ou sur une autre source.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Quelle est la différence entre l&#39;ancrage factuel (groundedness) et la qualité des sources ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">L&#39;ancrage factuel examine si les affirmations sont étayées par les preuves fournies. La qualité des sources évalue si la preuve elle-même est appropriée et suffisamment autoritaire pour le type d&#39;affirmation formulée.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Pourquoi une source authentique peut-elle tout de même produire une réponse d&#39;IA erronée ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">La source peut être obsolète, remplacée, valable pour une autre version, juridiction, utilisateur, population ou état du système, ou comporter des conditions préalables qui ont été perdues lors de la récupération ou du résumé.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Que dois-je consigner pour l&#39;évaluation des preuves ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Consignez la requête de recherche, les sources retournées, les extraits exacts de preuves, les horodatages et versions, les filtres, le contexte final, la sortie du modèle, les citations et la chronologie de la trace afin que les évaluateurs puissent reconstituer quelles preuves étaient disponibles avant chaque affirmation déterminante.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-66\">Glossaire\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Termes clés pour l'évaluation des preuves\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"claim-support\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Justification de l'affirmation\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Le degré auquel un extrait précis de preuve établit directement une affirmation générée.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-authority\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Autorité de la preuve\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">La pertinence d'une source pour établir un type particulier d'affirmation, compte tenu de son rôle, de sa provenance et de sa relation avec le fait sous-jacent.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"applicability\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Applicabilité\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Les conditions selon lesquelles une preuve reste valable pour une affirmation, incluant le temps, la version, la juridiction, l'utilisateur, la population, l'état du système ou d'autres limites contextuelles.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-utilization\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Utilisation des preuves\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Le fait que la réponse de l'agent réagisse réellement et dépende des preuves mises à sa disposition dans son chemin d'exécution.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"counterfactual-evidence-test\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Test de preuve contrefactuel\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Une évaluation qui retire, remplace ou modifie une preuve décisive afin de tester si l'affirmation de l'agent se modifie en conséquence.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"provenance\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Provenance\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Métadonnées consignant l'origine de la preuve, le moment de son obtention, ses transformations subies et la version ou l'état qu'elle représentait.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-68\">Sources principales et lectures complémentaires\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Evaluate Agent Workflows\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Conseils sur la notation des traces, l&#39;évaluation au niveau des flux de travail, les jeux de données et les exécutions reproductibles d&#39;évaluations pour les agents.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Evaluation Best Practices\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Recommandations sur les évaluations spécifiques aux tâches, les jeux de données issus de la production, les métriques ciblées, l&#39;évaluation continue et l&#39;étalonnage des évaluateurs.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Anthropic — Demystifying Evals for AI Agents\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Conseils pour l&#39;évaluation des agents, notamment l&#39;ancrage factuel, la couverture et les contrôles de qualité des sources pour les agents de recherche.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Directives d&#39;évaluation soulignant que les performances des agents modernes dépendent du flux de travail et de l&#39;environnement, et pas seulement de la sortie finale du modèle.\u003C\u002Fp>\u003C\u002Fa>",{"time":212,"blocks":213,"version":852},1790368255854,[214,222,228,236,243,248,253,258,263,289,294,299,304,309,314,319,324,329,334,341,346,351,356,361,366,395,402,407,442,447,452,457,491,496,501,506,511,516,521,526,531,536,541,579,584,625,630,660,665,670,675,680,685,690,695,700,705,710,715,720,725,730,739,747,752,778,783,810,815,825,834,843],{"id":215,"data":216,"type":220,"tunes":221},"0hk9UtwqZf",{"title":217,"maxLevel":218,"minLevel":219},"Sommaire",3,2,"tableOfContents",{},{"id":223,"data":224,"type":226,"tunes":227},"intro",{"text":225},"Un agent d'IA peut citer des sources, extraire des documents et pourtant utiliser les mauvaises preuves. Une source peut être faisant autorité mais sans rapport avec l'affirmation exacte. Un extrait récupéré peut ne soutenir qu'une partie d'une réponse. Une source correcte peut être obsolète, remplacée ou valide pour une juridiction, une version de produit, un utilisateur ou un état de système inadéquat. Cela crée un problème d'évaluation plus difficile que la simple vérification des citations : l'agent a-t-il réellement utilisé les bonnes preuves pour l'affirmation qu'il a formulée ?","paragraph",{},{"id":229,"data":230,"type":234,"tunes":235},"direct",{"body":231,"title":232,"variant":233},"Pour savoir si un agent d'IA a utilisé les bonnes preuves, évaluez la chaîne \u003Cstrong>Affirmation → Preuve → Applicabilité → Utilisation\u003C\u002Fstrong>. Pour chaque affirmation essentielle, vérifiez que la preuve l'étaye directement, provient d'une autorité appropriée, s'applique aux conditions actuelles et était réellement accessible à l'agent avant que l'affirmation ne soit produite. Une citation seule ne prouve aucun de ces éléments.","Réponse directe","info","callout",{},{"id":237,"data":238,"type":234,"tunes":242},"method-note",{"body":239,"title":240,"variant":241},"Le modèle Affirmation–Preuve–Applicabilité–Utilisation et le test d'utilisation des preuves présentés dans cet article sont des méthodes pratiques d'évaluation, et non des normes formelles du secteur. Ils s'appuient sur des concepts établis tels que l'ancrage factuel, la qualité des sources, la couverture des citations, l'évaluation des traces d'exécution et les évaluations spécifiques aux tâches.","À propos de la méthode","note",{},{"id":244,"data":245,"type":42,"tunes":247},"h-citations",{"text":246,"level":219},"Pourquoi les citations ne suffisent pas",{},{"id":249,"data":250,"type":226,"tunes":252},"p-citations-1",{"text":251},"Une citation ne répond qu'à une question restreinte : le système a associé une affirmation ou une réponse à une source. Elle n'établit pas automatiquement que la source étaye l'affirmation spécifique, que la source fasse suffisamment autorité pour la tâche, que le passage cité contienne la condition ou l'exception nécessaire, ou que le modèle se soit appuyé sur cette preuve plutôt que de produire la réponse à partir de ses connaissances préalables.",{},{"id":254,"data":255,"type":226,"tunes":257},"p-citations-2",{"text":256},"Les recommandations d'Anthropic pour l'évaluation des agents de recherche distinguent explicitement l'ancrage, la couverture et la qualité des sources. Les conseils d'OpenAI sur l'évaluation des agents mettent de même l'accent sur les traces d'exécution, car le résultat final ne révèle pas si l'agent a sélectionné les bons outils ou suivi le flux de travail prévu. Ces idées mènent à une conclusion plus large : la qualité des preuves est une propriété du chemin d'exécution, et pas seulement du texte final.",{},{"id":259,"data":260,"type":42,"tunes":262},"h-four",{"text":261,"level":219},"Les quatre questions auxquelles chaque affirmation essentielle doit répondre",{},{"id":264,"data":265,"type":287,"tunes":288},"table-four",{"content":266,"stretched":43,"withHeadings":14},[267,271,275,279,283],[268,269,270],"Dimension","Question","Échec typique",[272,273,274],"Soutien de l'affirmation","La preuve étaye-t-elle directement cette affirmation exacte ?","La source est thématiquement liée mais n'établit pas l'affirmation",[276,277,278],"Autorité de la preuve","S'agit-il d'une source appropriée pour ce type d'affirmation ?","Un résumé secondaire est utilisé là où une source primaire ou un système en direct est requis",[280,281,282],"Applicabilité","La preuve s'applique-t-elle à cette période, version, juridiction, utilisateur, état ou population ?","Une affirmation vraie est appliquée en dehors de ses conditions de validité",[284,285,286],"Utilisation de la preuve","Cette preuve était-elle réellement disponible et utilisée dans le chemin d'exécution de l'agent ?","La réponse finale est correcte, mais la preuve extraite était hors de propos ou inutilisée","table",{},{"id":290,"data":291,"type":42,"tunes":293},"h-support",{"text":292,"level":218},"1. Soutien de l'affirmation : la source établit-elle ce que dit l'agent ?",{},{"id":295,"data":296,"type":226,"tunes":298},"p-support-1",{"text":297},"Les preuves doivent être évaluées au niveau de chaque affirmation. Un document peut être pertinent par rapport au sujet et pourtant ne pas étayer une déclaration précise. Si une source indique qu'une fonctionnalité est disponible dans certaines régions, la réponse « la fonctionnalité est disponible dans le monde entier » n'est pas étayée, même si la citation semble plausible.",{},{"id":300,"data":301,"type":226,"tunes":303},"p-support-2",{"text":302},"C'est ici que les jugements larges de type « ancré \u002F non ancré » sont souvent trop imprécis. Décomposez la réponse en affirmations essentielles, associez chaque affirmation au segment de preuve le plus court qui l'étaye, et classez la relation : soutien direct, soutien partiel, contradiction ou absence de soutien.",{},{"id":305,"data":306,"type":42,"tunes":308},"h-authority",{"text":307,"level":218},"2. Autorité de la preuve : s'agit-il du bon type de source ?",{},{"id":310,"data":311,"type":226,"tunes":313},"p-authority-1",{"text":312},"La sélection de la bonne preuve ne se résume pas à la pertinence sémantique. La source doit convenir à la décision prise. Le statut actuel d'un compte doit provenir du système de gestion des comptes, et non d'un ancien e-mail. Une affirmation sur le comportement d'une API doit de préférence être vérifiée par rapport à la documentation actuelle du fournisseur ou à un comportement reproductible. Une exigence légale peut nécessiter la loi applicable, les textes du régulateur ou des directives officielles plutôt qu'un article de blog généraliste.",{},{"id":315,"data":316,"type":226,"tunes":318},"p-authority-2",{"text":317},"L'autorité d'une source dépend de la tâche. Un rapport de la communauté peut constituer la meilleure preuve pour un bogue réel non reconnu par la documentation du fournisseur. Une annonce d'un fournisseur peut faire autorité quant à ce qu'il revendique, mais représenter une preuve faible pour des performances mesurées de manière indépendante. L'évaluateur a donc besoin d'une hiérarchie explicite des sources pour la tâche en cours, plutôt que d'un score universel d'autorité.",{},{"id":320,"data":321,"type":42,"tunes":323},"h-applicability",{"text":322,"level":218},"3. Applicabilité : bonne preuve, mauvaises conditions",{},{"id":325,"data":326,"type":226,"tunes":328},"p-apply-1",{"text":327},"Les erreurs de preuves les plus dangereuses ne proviennent souvent pas de sources inventées, mais de sources valides utilisées en dehors de leur champ d'application. Une recommandation peut varier selon la version logicielle, la date, la juridiction, la révision matérielle, les permissions utilisateur, la disponibilité du produit, l'état actuel de la partie, la configuration du locataire ou d'autres variables d'environnement.",{},{"id":330,"data":331,"type":226,"tunes":333},"p-apply-2",{"text":332},"Pour chaque source essentielle, conservez les conditions qui déterminent si elle s'applique toujours. Cela s'avère particulièrement crucial après une synthèse : une mémoire compressée ou une citation peut conserver la conclusion tout en omettant l'exception, la date ou le prérequis qui rendait cette conclusion valide.",{},{"id":335,"data":336,"type":234,"tunes":340},"apply-warning",{"body":337,"title":338,"variant":339},"Une source réelle, citée avec exactitude, peut tout de même mener à une réponse erronée lorsque sa date, sa version, sa population cible, sa juridiction ou son état ne correspondent pas à la question posée.","Une preuve peut être authentique tout en étant inappropriée pour la réponse","warning",{},{"id":342,"data":343,"type":42,"tunes":345},"h-use",{"text":344,"level":218},"4. Utilisation des preuves : l'agent s'est-il réellement appuyé sur les preuves ?",{},{"id":347,"data":348,"type":226,"tunes":350},"p-use-1",{"text":349},"Une réponse peut être correcte même lorsque la recherche documentaire a échoué. Le modèle connaît peut-être déjà la réponse, la déduit d'un contexte sans rapport, ou devine tout simplement juste. Si l'évaluation ne vérifie que l'exactitude finale, le système peut sembler bien étayé alors que le cheminement des preuves est rompu.",{},{"id":352,"data":353,"type":226,"tunes":355},"p-use-2",{"text":354},"Pour évaluer l'utilisation des preuves, examinez la trace d'exécution. Vérifiez quelles sources ont été récupérées, quels passages ont intégré le contexte du modèle, à quel moment ils sont devenus disponibles, et si l'affirmation finale peut s'expliquer par ces éléments fournis. Les outils actuels d'évaluation d'agents d'OpenAI mettent précisément l'accent sur l'évaluation des traces, car le comportement au niveau du workflow ne peut pas être reconstitué de manière fiable à partir de la seule réponse finale.",{},{"id":357,"data":358,"type":42,"tunes":360},"h-eut",{"text":359,"level":219},"Le test d'utilisation des preuves (Evidence Utilization Test)",{},{"id":362,"data":363,"type":226,"tunes":365},"p-eut-intro",{"text":364},"Une évaluation pratique peut être conçue sous la forme d'un contrefactuel contrôlé. Au lieu de se demander uniquement si la réponse est correcte, modifiez la preuve et observez si l'affirmation évolue dans le sens attendu.",{},{"id":367,"data":368,"type":393,"tunes":394},"eut-flow",{"steps":369,"title":391,"orientation":392},[370,373,376,379,382,385,388],{"label":371,"description":372},"1. Sélectionner une affirmation déterminante","Choisissez une affirmation dont l'exactitude importe et définissez précisément la réponse attendue.",{"label":374,"description":375},"2. Identifier la preuve de référence","Fournissez le plus petit ensemble de preuves faisant autorité suffisant pour étayer l'affirmation.",{"label":377,"description":378},"3. Exécuter avec la preuve de référence","Vérifiez que l'agent produit la réponse étayée lorsque la preuve correcte est disponible.",{"label":380,"description":381},"4. Retirer la preuve décisive","Exécutez la même tâche sans le passage clé de soutien tout en maintenant les autres entrées stables.",{"label":383,"description":384},"5. La remplacer par une preuve contradictoire ou plus récente","Lorsque c'est sans risque, fournissez une preuve contrôlée qui modifie la conclusion correcte.",{"label":386,"description":387},"6. Comparer les affirmations","Vérifiez si la réponse s'adapte au changement de preuve ou reste ancrée dans les connaissances préalables du modèle.",{"label":389,"description":390},"7. Examiner la trace","Confirmez ce qui a été extrait, ce qui a atteint le contexte et quelle source ou résultat d'outil a précédé l'affirmation.","Test d'utilisation des preuves","auto","processFlow",{},{"id":396,"data":397,"type":234,"tunes":401},"eut-tip",{"body":398,"title":399,"variant":400},"Si la preuve décisive change mais que l'affirmation de l'agent ne change pas, vous avez la preuve que le système n'utilise peut-être pas la recherche documentaire comme prévu — même si la réponse initiale s'est avérée exacte.","Le signal clé","tip",{},{"id":403,"data":404,"type":42,"tunes":406},"h-matrix",{"text":405,"level":219},"Une matrice affirmations–preuves est plus utile qu'une liste de sources",{},{"id":408,"data":409,"type":287,"tunes":441},"claim-matrix",{"content":410,"stretched":43,"withHeadings":14},[411,417,424,430,436],[412,413,414,415,280,416],"Affirmation","Preuve","Niveau de soutien","Autorité","Utilisé dans la trace",[418,419,420,421,422,423],"La fonctionnalité X est disponible","Documentation du fournisseur","Direct","Élevée pour une affirmation de disponibilité","La version actuelle et la région doivent concorder","Oui \u002F Non",[425,426,427,428,429,423],"La configuration Y est plus rapide","Benchmark du fournisseur","Partiel","Élevée pour le test du fournisseur, pas pour des performances indépendantes","Le matériel et la charge de travail doivent concorder",[431,432,433,434,435,423],"La politique s'applique à cet utilisateur","Politique actuelle + état du compte","Direct uniquement lorsque combinés","Élevée","La juridiction, la date, le rôle et l'état du compte doivent concorder",[437,438,420,439,440,423],"Un produit est en stock","API d'inventaire en direct","Fait autorité pour le stock actuel","Expire rapidement",{},{"id":443,"data":444,"type":226,"tunes":446},"p-matrix-1",{"text":445},"Cette matrice soulève plusieurs questions que la simple vérification des citations occulte. Une affirmation peut nécessiter plusieurs sources. Une source peut n'étayer qu'une partie d'une affirmation. Une source faisant autorité peut avoir une fenêtre de validité très courte. Et une source parfaitement valable peut être inutile si elle n'a jamais intégré le flux d'exécution.",{},{"id":448,"data":449,"type":42,"tunes":451},"h-retrieval-evidence",{"text":450,"level":219},"Distinguer la qualité de la recherche documentaire de la qualité des preuves",{},{"id":453,"data":454,"type":226,"tunes":456},"p-re-1",{"text":455},"Les métriques de recherche documentaire visent à savoir si des documents pertinents ont été trouvés et classés. L'évaluation des preuves vise à savoir si ces documents justifient les affirmations obtenues. Les deux aspects sont liés, mais distincts.",{},{"id":458,"data":459,"type":489,"tunes":490},"retrieval-comparison",{"rows":460,"title":478,"layout":287,"columns":479},[461,466,470,474],{"id":462,"label":463,"values":464},"a","Bon document, mauvaise affirmation",[465,465,465],"",{"id":467,"label":468,"values":469},"b","Fait exact, source obsolète",[465,465,465],{"id":471,"label":472,"values":473},"c","Source faible, réponse correcte",[465,465,465],{"id":475,"label":476,"values":477},"d","Plusieurs sources requises",[465,465,465],"La réussite de la recherche documentaire ne garantit pas la validité des preuves",[480,483,486],{"id":481,"label":482},"situation","Situation",{"id":484,"label":485},"retrieval","Recherche documentaire",{"id":487,"label":488},"evidence","Qualité des preuves","comparison",{},{"id":492,"data":493,"type":42,"tunes":495},"h-source-quality",{"text":494,"level":219},"Évaluer la qualité des sources via une grille critériée, non par une liste blanche de domaines",{},{"id":497,"data":498,"type":226,"tunes":500},"p-source-quality-1",{"text":499},"Les listes prédéfinies de « domaines de confiance » sont tentantes, mais souvent fragiles. La qualité d'une source doit plutôt refléter le type d'affirmation. Parmi les critères pertinents figurent le caractère primaire ou secondaire de la source, sa récence, son caractère direct, sa reproductibilité, son indépendance, l'expertise du domaine, la provenance des données, la fréquence de mise à jour, et l'éventuelle incitation de la source à exagérer l'affirmation.",{},{"id":502,"data":503,"type":226,"tunes":505},"p-source-quality-2",{"text":504},"Les recommandations d'Anthropic pour l'évaluation des agents de recherche mentionnent explicitement le contrôle de la qualité des sources aux côtés de l'ancrage factuel et de la couverture. La mise en œuvre pratique doit donc évaluer à la fois ce que dit la source et si cette source est appropriée pour ce type d'affirmation.",{},{"id":507,"data":508,"type":42,"tunes":510},"h-coverage",{"text":509,"level":219},"Couverture des preuves : chaque affirmation importante doit être étayée, pas chaque phrase",{},{"id":512,"data":513,"type":226,"tunes":515},"p-coverage-1",{"text":514},"Toutes les phrases ne nécessitent pas de citation. Le langage de transition, les calculs arithmétiques dérivés de manière transparente à partir de valeurs citées ou les interprétations clairement indiquées peuvent ne pas requérir de source distincte. Mais chaque affirmation matérielle et vérifiable de manière externe doit bénéficier d'un appui suffisant pour qu'un évaluateur puisse reconstituer pourquoi l'agent a été autorisé à l'énoncer.",{},{"id":517,"data":518,"type":226,"tunes":520},"p-coverage-2",{"text":519},"La couverture doit donc être pondérée en fonction de l'importance de l'affirmation. L'absence de justification pour un détail décoratif n'équivaut pas à l'absence de justification pour un prix, une décision d'éligibilité, une consigne de sécurité, une exigence légale, une déclaration de compatibilité technique ou un fait déterminant pour une recommandation.",{},{"id":522,"data":523,"type":42,"tunes":525},"h-provenance",{"text":524,"level":219},"La provenance des preuves doit survivre à la résumation et à la mémoire",{},{"id":527,"data":528,"type":226,"tunes":530},"p-prov-1",{"text":529},"Les agents à exécution longue résument souvent les travaux précédents ou enregistrent des mémoires durables. Si la provenance des preuves est supprimée lors de cette transformation, les futurs agents risquent de récupérer une conclusion nette sans savoir si elle provient d'une déclaration de l'utilisateur, d'une API en direct, d'un ancien document, d'une inférence du modèle ou d'un résultat Web non vérifié.",{},{"id":532,"data":533,"type":226,"tunes":535},"p-prov-2",{"text":534},"Pour les faits importants, conservez au minimum l'identité de la source, l'horodatage de récupération ou d'observation, le type de preuve, la version ou l'état pertinent, et indiquez si le texte stocké est cité, résumé, inféré ou dérivé. La provenance est ce qui permet à un agent ultérieur de décider si la preuve doit être acceptée, actualisée, restreinte ou rejetée.",{},{"id":537,"data":538,"type":42,"tunes":540},"h-record",{"text":539,"level":219},"Un registre de preuves pratique",{},{"id":542,"data":543,"type":287,"tunes":578},"evidence-record",{"content":544,"stretched":43,"withHeadings":14},[545,548,551,554,557,560,563,566,569,572,575],[546,547],"Champ","Finalité",[549,550],"claim_id","Identifie l'affirmation matérielle étayée",[552,553],"source_id \u002F source_url \u002F system","Identifie l'origine de la preuve",[555,556],"evidence_span","Conserve le plus petit extrait, enregistrement ou résultat d'outil qui étaye l'affirmation",[558,559],"retrieved_at \u002F observed_at","Permet les vérifications de fraîcheur et de chronologie",[561,562],"source_version \u002F object_version","Permet les vérifications de remplacement et de reproductibilité",[564,565],"authority_role","Explique pourquoi cette source est appropriée pour cette affirmation",[567,568],"applicability","Stocke la date, la juridiction, la version du produit, l'utilisateur, le locataire, l'état ou d'autres conditions pertinentes",[570,571],"transformation","Indique si la preuve est brute, citée, résumée, normalisée ou dérivée",[573,574],"trace_step","Montre à quel moment la preuve est devenue accessible à l'agent",[576,577],"support_status","Direct, partiel, contradictoire, non étayé ou incertain",{},{"id":580,"data":581,"type":42,"tunes":583},"h-failures",{"text":582,"level":219},"Modes de défaillance semblant fondés mais qui ne le sont pas",{},{"id":585,"data":586,"type":287,"tunes":624},"failure-table",{"content":587,"stretched":43,"withHeadings":14},[588,592,596,600,604,608,612,616,620],[589,590,591],"Mode de défaillance","Pourquoi il trompe les évaluateurs","Ce qu'il faut tester",[593,594,595],"Décoration par citation","La réponse contient des sources, elle a donc l'air documentée","Associer chaque affirmation matérielle à un extrait justificatif exact",[597,598,599],"Inadéquation d'autorité","La source est réputée mais ne fait pas autorité pour ce fait précis","Définir une hiérarchie des sources propre à chaque affirmation",[601,602,603],"Inadéquation temporelle","La source était exacte au moment de sa publication","Vérifier la date de récupération, la date de la source et les preuves postérieures",[605,606,607],"Suppression des conditions","Un résumé conserve la conclusion mais omet les exceptions","Comparer l'affirmation générée avec le contexte textuel complet de la source",[609,610,611],"Citation a posteriori","Une source plausible est rattachée après la génération de la réponse","Inspecter l'ordre des traces et vérifier si la preuve précédait l'affirmation",[613,614,615],"Priorité paramétrique","Le modèle ignore les preuves récupérées et répond à partir de ses connaissances préalables","Exécuter des tests contrefactuels d'utilisation des preuves",[617,618,619],"Blanchiment de preuves","Une inférence du modèle est résumée puis stockée comme s'il s'agissait d'un fait source","Préserver le type de transformation et la provenance lors des écritures en mémoire",[621,622,623],"Sophisme de la majorité des sources","Plusieurs pages secondaires répètent la même affirmation non vérifiée","Remonter les affirmations jusqu'aux preuves indépendantes ou primaires",{},{"id":626,"data":627,"type":42,"tunes":629},"h-production",{"text":628,"level":219},"Comment évaluer l'agent en production",{},{"id":631,"data":632,"type":393,"tunes":659},"production-flow",{"steps":633,"title":658,"orientation":392},[634,637,640,643,646,649,652,655],{"label":635,"description":636},"1. Définir les affirmations matérielles","Identifier les faits, recommandations ou décisions dont l'exactitude importe pour la tâche.",{"label":638,"description":639},"2. Établir des preuves de référence","Créer des preuves de référence et des exigences de qualité des sources pour les cas représentatifs.",{"label":641,"description":642},"3. Capturer les traces","Consigner les requêtes de récupération, les appels d'outils, les preuves renvoyées, la construction du contexte, la sortie du modèle et les citations.",{"label":644,"description":645},"4. Évaluer l'appui documentaire","Vérifier si chaque affirmation matérielle est étayée de manière directe, partielle, contradictoire ou non étayée.",{"label":647,"description":648},"5. Évaluer l'autorité et l'applicabilité","Évaluer si la source est appropriée et si ses conditions correspondent à la tâche en cours.",{"label":650,"description":651},"6. Exécuter des tests contrefactuels","Supprimer, remplacer ou invalider des preuves déterminantes et vérifier si la réponse s'adapte au changement.",{"label":653,"description":654},"7. Examiner les défaillances à fort impact","Faire appel à une révision humaine ou d'experts du domaine lorsque l'évaluation automatisée n'est pas assez fiable.",{"label":656,"description":657},"8. Convertir les défaillances en cas d'évaluation","Ajouter les défaillances de production et les cas limites à un ensemble de données de non-régression reproductible.","Pipeline d'évaluation des preuves",{},{"id":661,"data":662,"type":226,"tunes":664},"p-production-1",{"text":663},"Les recommandations actuelles d'OpenAI en matière d'évaluation préconisent des évaluations adaptées à la tâche, une évaluation continue, des jeux de données issus de la production et des traces pour déboguer le comportement de l'agent. De même, Anthropic recommande de combiner plusieurs types d'évaluateurs pour les agents de recherche, car l'exactitude, la qualité des sources, la couverture et le fondement factuel constituent des dimensions distinctes. L'évaluation des preuves doit suivre le même modèle : plusieurs évaluateurs ciblés fournissent un meilleur diagnostic qu'un score de « qualité » opaque unique.",{},{"id":666,"data":667,"type":42,"tunes":669},"h-judge",{"text":668,"level":219},"Ne laissez pas un juge LLM être le seul juge des preuves",{},{"id":671,"data":672,"type":226,"tunes":674},"p-judge-1",{"text":673},"Les évaluateurs LLM sont utiles pour classifier à grande échelle des affirmations, vérifier la pertinence et réaliser des comparaisons par paires, mais ils peuvent partager les mêmes angles morts que le système qu'ils évaluent. Un évaluateur peut accepter une affirmation plausible mais non étayée, manquer une limite subtile de version ou surévaluer une source bien formulée.",{},{"id":676,"data":677,"type":226,"tunes":679},"p-judge-2",{"text":678},"Les directives d'évaluation d'OpenAI recommandent de calibrer les évaluateurs automatisés par rapport au jugement humain et d'utiliser des critères clairs et bien définis. Pour les systèmes riches en preuves, des vérifications déterministes doivent être utilisées dans la mesure du possible : horodatages, versions d'objets, périmètre des autorisations, identifiants exacts de sources, ordre de récupération, hachages de documents et présence effective de la preuve avant que le modèle ne génère l'affirmation.",{},{"id":681,"data":682,"type":42,"tunes":684},"h-change",{"text":683,"level":219},"Qu'est-ce qui modifierait cette réponse ?",{},{"id":686,"data":687,"type":226,"tunes":689},"p-change-1",{"text":688},"L'évaluation peut être plus simple lorsque l'agent opère sur un corpus restreint, immuable et faisant autorité, et que chaque réponse est strictement extractive. Dans un tel environnement, l'autorité de la source et son applicabilité sont en grande partie fixes, et la vérification de l'appui d'un extrait à une affirmation peut suffire.",{},{"id":691,"data":692,"type":226,"tunes":694},"p-change-2",{"text":693},"L'évaluation doit devenir plus stricte lorsque l'agent combine recherche Web, mémoire à long terme, outils en direct, juridictions multiples, informations évoluant rapidement, état propre à l'utilisateur ou actions autonomes. Dans ces systèmes, la validité des preuves dépend non seulement du texte source, mais aussi du moment et de la manière dont les preuves ont été obtenues.",{},{"id":696,"data":697,"type":226,"tunes":699},"p-change-3",{"text":698},"Les futurs modèles deviendront peut-être plus performants pour suivre en interne la provenance et l'incertitude, mais cela ne supprimera pas la nécessité de conserver des enregistrements de preuves externes dans les systèmes nécessitant une auditabilité. Un système ne devrait pas dépendre de l'auto-évaluation du modèle sur ce qui l'a influencé lorsque les traces et les métadonnées de source peuvent fournir des preuves plus solides.",{},{"id":701,"data":702,"type":42,"tunes":704},"h-limitations",{"text":703,"level":219},"Limites",{},{"id":706,"data":707,"type":226,"tunes":709},"p-limit-1",{"text":708},"Il n'est pas toujours possible de prouver l'utilisation causale des preuves uniquement à partir des traces. Une source peut être présente dans le contexte sans influencer la réponse, et un modèle peut connaître indépendamment le même fait. Les tests contrefactuels renforcent l'inférence, mais peuvent eux-mêmes modifier la distribution de la tâche.",{},{"id":711,"data":712,"type":226,"tunes":714},"p-limit-2",{"text":713},"L'autorité de la source peut également être contestée ou dépendre du domaine. Certaines questions ne comportent aucune source faisant autorité unique, et les experts peuvent être en désaccord sur la preuve qui mérite le plus de poids. Dans ces cas, l'évaluateur doit préserver le désaccord et noter la transparence, la couverture et le raisonnement selon une grille explicite plutôt que de prétendre qu'il existe une source de vérité incontestée.",{},{"id":716,"data":717,"type":42,"tunes":719},"h-conclusion",{"text":718,"level":219},"Conclusion",{},{"id":721,"data":722,"type":226,"tunes":724},"p-conclusion-1",{"text":723},"La question « L'agent a-t-il cité une source ? » est trop faible pour l'IA en production. La question la plus pertinente est la suivante : chaque affirmation importante provient-elle d'une preuve qui l'étaye réellement, dispose-t-elle de l'autorité requise, s'applique-t-elle toujours aux conditions actuelles et était-elle disponible dans le chemin d'exécution avant que l'affirmation ne soit formulée ?",{},{"id":726,"data":727,"type":226,"tunes":729},"p-conclusion-2",{"text":728},"Cela transforme la preuve, passant du simple élément décoratif à une propriété évaluable du système. Capturez la trace. Associez les affirmations aux preuves. Vérifiez l'autorité et l'applicabilité. Exécutez des tests de preuves contrefactuels. Préservez la provenance à travers les résumés et la mémoire. Dès lors, une réponse correcte n'est plus seulement plausible : elle dispose d'un chemin de preuves vérifiable.",{},{"id":731,"data":732,"type":737,"tunes":738},"internal-reliability",{"url":733,"title":734,"excerpt":735,"ctaLabel":736},"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Fiabilité des agents d'IA : pourquoi la réponse finale ne suffit pas","L'exactitude du résultat final ne peut à elle seule prouver que le chemin d'exécution d'un agent était sûr ou fiable. Cet article connexe explique pourquoi les trajectoires, les outils et les décisions intermédiaires sont essentiels.","Lire l'article connexe","referralArticle",{},{"id":740,"data":741,"type":737,"tunes":746},"internal-reasoning",{"url":742,"title":743,"excerpt":744,"ctaLabel":745},"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","Du protocole de recherche à un cadre général de raisonnement pour l'IA","Une méthode pratique de raisonnement pour dissocier preuves, hypothèses, hypothèses concurrentes et validation spécifique au domaine.","Découvrir le cadre de raisonnement",{},{"id":748,"data":749,"type":42,"tunes":751},"h-faq",{"text":750,"level":219},"FAQ",{},{"id":753,"data":754,"type":753,"tunes":777},"faq",{"items":755,"title":776},[756,760,764,768,772],{"id":757,"answer":758,"question":759},"faq1","Non. Une citation peut être pertinente par rapport au sujet sans étayer l'affirmation exacte, peut provenir d'une mauvaise autorité, peut ne plus s'appliquer ou avoir été ajoutée sans influencer concrètement la réponse générée.","Une citation prouve-t-elle qu'une réponse d'IA est ancrée dans les faits ?",{"id":761,"answer":762,"question":763},"faq2","Utilisez un test contrefactuel d'utilisation des preuves : exécutez la tâche avec des preuves reconnues exactes, puis retirez ou remplacez la preuve déterminante tout en conservant les autres entrées stables. Si la réponse ne s'ajuste pas au changement de preuve, vérifiez si le modèle s'appuie sur des connaissances préalables ou sur une autre source.","Comment puis-je vérifier si un agent d'IA a réellement utilisé les preuves récupérées ?",{"id":765,"answer":766,"question":767},"faq3","L'ancrage factuel examine si les affirmations sont étayées par les preuves fournies. La qualité des sources évalue si la preuve elle-même est appropriée et suffisamment autoritaire pour le type d'affirmation formulée.","Quelle est la différence entre l'ancrage factuel (groundedness) et la qualité des sources ?",{"id":769,"answer":770,"question":771},"faq4","La source peut être obsolète, remplacée, valable pour une autre version, juridiction, utilisateur, population ou état du système, ou comporter des conditions préalables qui ont été perdues lors de la récupération ou du résumé.","Pourquoi une source authentique peut-elle tout de même produire une réponse d'IA erronée ?",{"id":773,"answer":774,"question":775},"faq5","Consignez la requête de recherche, les sources retournées, les extraits exacts de preuves, les horodatages et versions, les filtres, le contexte final, la sortie du modèle, les citations et la chronologie de la trace afin que les évaluateurs puissent reconstituer quelles preuves étaient disponibles avant chaque affirmation déterminante.","Que dois-je consigner pour l'évaluation des preuves ?","Évaluer l'utilisation des preuves chez les agents d'IA",{},{"id":779,"data":780,"type":42,"tunes":782},"h-glossary",{"text":781,"level":219},"Glossaire",{},{"id":784,"data":785,"type":784,"tunes":809},"glossary",{"title":786,"entries":787},"Termes clés pour l'évaluation des preuves",[788,792,795,797,801,805],{"term":789,"anchor":790,"definition":791},"Justification de l'affirmation","claim-support","Le degré auquel un extrait précis de preuve établit directement une affirmation générée.",{"term":276,"anchor":793,"definition":794},"evidence-authority","La pertinence d'une source pour établir un type particulier d'affirmation, compte tenu de son rôle, de sa provenance et de sa relation avec le fait sous-jacent.",{"term":280,"anchor":567,"definition":796},"Les conditions selon lesquelles une preuve reste valable pour une affirmation, incluant le temps, la version, la juridiction, l'utilisateur, la population, l'état du système ou d'autres limites contextuelles.",{"term":798,"anchor":799,"definition":800},"Utilisation des preuves","evidence-utilization","Le fait que la réponse de l'agent réagisse réellement et dépende des preuves mises à sa disposition dans son chemin d'exécution.",{"term":802,"anchor":803,"definition":804},"Test de preuve contrefactuel","counterfactual-evidence-test","Une évaluation qui retire, remplace ou modifie une preuve décisive afin de tester si l'affirmation de l'agent se modifie en conséquence.",{"term":806,"anchor":807,"definition":808},"Provenance","provenance","Métadonnées consignant l'origine de la preuve, le moment de son obtention, ses transformations subies et la version ou l'état qu'elle représentait.",{},{"id":811,"data":812,"type":42,"tunes":814},"h-sources",{"text":813,"level":219},"Sources principales et lectures complémentaires",{},{"id":816,"data":817,"type":823,"tunes":824},"src-openai-agent-evals",{"link":818,"meta":819},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals",{"image":820,"title":821,"description":822},{"url":465},"OpenAI — Evaluate Agent Workflows","Conseils sur la notation des traces, l'évaluation au niveau des flux de travail, les jeux de données et les exécutions reproductibles d'évaluations pour les agents.","linkTool",{},{"id":826,"data":827,"type":823,"tunes":833},"src-openai-eval-best",{"link":828,"meta":829},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices",{"image":830,"title":831,"description":832},{"url":465},"OpenAI — Evaluation Best Practices","Recommandations sur les évaluations spécifiques aux tâches, les jeux de données issus de la production, les métriques ciblées, l'évaluation continue et l'étalonnage des évaluateurs.",{},{"id":835,"data":836,"type":823,"tunes":842},"src-anthropic-evals",{"link":837,"meta":838},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"image":839,"title":840,"description":841},{"url":465},"Anthropic — Demystifying Evals for AI Agents","Conseils pour l'évaluation des agents, notamment l'ancrage factuel, la couverture et les contrôles de qualité des sources pour les agents de recherche.",{},{"id":844,"data":845,"type":823,"tunes":851},"src-openai-thirdparty",{"link":846,"meta":847},"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F",{"image":848,"title":849,"description":850},{"url":465},"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations","Directives d'évaluation soulignant que les performances des agents modernes dépendent du flux de travail et de l'environnement, et pas seulement de la sortie finale du modèle.",{},"2.31","Un agent IA peut citer des sources et tout de même utiliser les mauvais éléments de preuve. Cet article présente une méthode pratique pour vérifier le soutien des affirmations, l'autorité de la source, l'applicabilité, la provenance et si les éléments de preuve ont réellement influencé la réponse.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve","PUBLISHED","2026-09-25T11:47:00.000Z","2026-09-25T15:47:02.186Z","2026-09-25T20:33:01.720Z",{"en":861,"de":862,"sr":863,"es":864,"fr":865,"it":866,"ru":867,"zh":868},"\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fde\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fsr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fes\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Ffr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fit\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fru\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fzh\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence",[870,874,878],{"id":871,"name":872,"slug":873},84,"Politique et limites des données","policy-and-data",{"id":875,"name":876,"slug":877},97,"Vérification sur jeu de test","verification",{"id":879,"name":880,"slug":881},66,"Opérations de contenu","content-ops",{"id":883,"login":884,"email":885,"displayName":886},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[888,1404],{"lang":889,"title":890,"content":891,"contentJson":892,"excerpt":1403},"en","How to Know Whether an AI Agent Actually Used the Right Evidence","{\"time\":1790351390243,\"blocks\":[{\"id\":\"0hk9UtwqZf\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.\"},\"tunes\":{}},{\"id\":\"method-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"About the method\",\"body\":\"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.\"},\"tunes\":{}},{\"id\":\"h-citations\",\"type\":\"header\",\"data\":{\"text\":\"Why citations are not enough\",\"level\":2},\"tunes\":{}},{\"id\":\"p-citations-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.\"},\"tunes\":{}},{\"id\":\"p-citations-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.\"},\"tunes\":{}},{\"id\":\"h-four\",\"type\":\"header\",\"data\":{\"text\":\"The four questions every material claim should pass\",\"level\":2},\"tunes\":{}},{\"id\":\"table-four\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Dimension\",\"Question\",\"Typical failure\"],[\"Claim support\",\"Does the evidence directly support this exact claim?\",\"The source is topically related but does not establish the statement\"],[\"Evidence authority\",\"Is this an appropriate source for this kind of claim?\",\"A secondary summary is used where a primary source or live system is required\"],[\"Applicability\",\"Does the evidence apply to this time, version, jurisdiction, user, state, or population?\",\"A true statement is applied outside its valid conditions\"],[\"Evidence use\",\"Was this evidence actually available and used in the agent's execution path?\",\"The final answer is correct, but the retrieved evidence was irrelevant or unused\"]]},\"tunes\":{}},{\"id\":\"h-support\",\"type\":\"header\",\"data\":{\"text\":\"1. Claim support: does the source establish what the agent says?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-support-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.\"},\"tunes\":{}},{\"id\":\"p-support-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.\"},\"tunes\":{}},{\"id\":\"h-authority\",\"type\":\"header\",\"data\":{\"text\":\"2. Evidence authority: is this the right kind of source?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-authority-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.\"},\"tunes\":{}},{\"id\":\"p-authority-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.\"},\"tunes\":{}},{\"id\":\"h-applicability\",\"type\":\"header\",\"data\":{\"text\":\"3. Applicability: right evidence, wrong conditions\",\"level\":3},\"tunes\":{}},{\"id\":\"p-apply-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.\"},\"tunes\":{}},{\"id\":\"p-apply-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.\"},\"tunes\":{}},{\"id\":\"apply-warning\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Evidence can be authentic and still be wrong for the answer\",\"body\":\"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.\"},\"tunes\":{}},{\"id\":\"h-use\",\"type\":\"header\",\"data\":{\"text\":\"4. Evidence use: did the agent actually rely on the evidence?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-use-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.\"},\"tunes\":{}},{\"id\":\"p-use-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.\"},\"tunes\":{}},{\"id\":\"h-eut\",\"type\":\"header\",\"data\":{\"text\":\"The Evidence Utilization Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-eut-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.\"},\"tunes\":{}},{\"id\":\"eut-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence Utilization Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Select one material claim\",\"description\":\"Choose a claim whose correctness matters and define the expected answer precisely.\"},{\"label\":\"2. Identify gold evidence\",\"description\":\"Provide the smallest authoritative evidence set sufficient to support the claim.\"},{\"label\":\"3. Run with gold evidence\",\"description\":\"Verify that the agent produces the supported answer when the correct evidence is available.\"},{\"label\":\"4. Remove the decisive evidence\",\"description\":\"Run the same task without the key supporting passage while keeping other inputs stable.\"},{\"label\":\"5. Replace it with contradictory or superseding evidence\",\"description\":\"Where safe, provide controlled evidence that changes the correct conclusion.\"},{\"label\":\"6. Compare the claims\",\"description\":\"Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.\"},{\"label\":\"7. Inspect the trace\",\"description\":\"Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.\"}]},\"tunes\":{}},{\"id\":\"eut-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"The key signal\",\"body\":\"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A claim–evidence matrix is more useful than a source list\",\"level\":2},\"tunes\":{}},{\"id\":\"claim-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Claim\",\"Evidence\",\"Support\",\"Authority\",\"Applicability\",\"Used in trace\"],[\"Feature X is available\",\"Vendor documentation\",\"Direct\",\"High for availability claim\",\"Current version and region must match\",\"Yes \u002F No\"],[\"Configuration Y is faster\",\"Vendor benchmark\",\"Partial\",\"High for vendor's test, not independent performance\",\"Hardware and workload must match\",\"Yes \u002F No\"],[\"Policy applies to this user\",\"Current policy + account state\",\"Direct only when combined\",\"High\",\"Jurisdiction, date, role and account state must match\",\"Yes \u002F No\"],[\"A product is in stock\",\"Live inventory API\",\"Direct\",\"Authoritative for current stock\",\"Expires quickly\",\"Yes \u002F No\"]]},\"tunes\":{}},{\"id\":\"p-matrix-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.\"},\"tunes\":{}},{\"id\":\"h-retrieval-evidence\",\"type\":\"header\",\"data\":{\"text\":\"Separate retrieval quality from evidence quality\",\"level\":2},\"tunes\":{}},{\"id\":\"p-re-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.\"},\"tunes\":{}},{\"id\":\"retrieval-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Retrieval success is not evidence success\",\"layout\":\"table\",\"columns\":[{\"id\":\"situation\",\"label\":\"Situation\"},{\"id\":\"retrieval\",\"label\":\"Retrieval\"},{\"id\":\"evidence\",\"label\":\"Evidence quality\"}],\"rows\":[{\"id\":\"a\",\"label\":\"Right document, wrong claim\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"b\",\"label\":\"Right fact, stale source\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"c\",\"label\":\"Weak source, correct answer\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"d\",\"label\":\"Multiple sources required\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-source-quality\",\"type\":\"header\",\"data\":{\"text\":\"Evaluate source quality as a rubric, not a domain whitelist\",\"level\":2},\"tunes\":{}},{\"id\":\"p-source-quality-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.\"},\"tunes\":{}},{\"id\":\"p-source-quality-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.\"},\"tunes\":{}},{\"id\":\"h-coverage\",\"type\":\"header\",\"data\":{\"text\":\"Evidence coverage: every important claim needs support, not every sentence\",\"level\":2},\"tunes\":{}},{\"id\":\"p-coverage-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.\"},\"tunes\":{}},{\"id\":\"p-coverage-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.\"},\"tunes\":{}},{\"id\":\"h-provenance\",\"type\":\"header\",\"data\":{\"text\":\"Evidence provenance must survive summarization and memory\",\"level\":2},\"tunes\":{}},{\"id\":\"p-prov-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.\"},\"tunes\":{}},{\"id\":\"p-prov-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.\"},\"tunes\":{}},{\"id\":\"h-record\",\"type\":\"header\",\"data\":{\"text\":\"A practical evidence record\",\"level\":2},\"tunes\":{}},{\"id\":\"evidence-record\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Field\",\"Purpose\"],[\"claim_id\",\"Identifies the material claim being supported\"],[\"source_id \u002F source_url \u002F system\",\"Identifies where the evidence came from\"],[\"evidence_span\",\"Preserves the smallest passage, record, or tool result that supports the claim\"],[\"retrieved_at \u002F observed_at\",\"Allows freshness and timeline checks\"],[\"source_version \u002F object_version\",\"Allows supersession and reproducibility checks\"],[\"authority_role\",\"Explains why this source is suitable for this claim\"],[\"applicability\",\"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions\"],[\"transformation\",\"Marks whether evidence is raw, quoted, summarized, normalized, or derived\"],[\"trace_step\",\"Shows when the evidence became available to the agent\"],[\"support_status\",\"Direct, partial, contradictory, unsupported, or uncertain\"]]},\"tunes\":{}},{\"id\":\"h-failures\",\"type\":\"header\",\"data\":{\"text\":\"Failure modes that look grounded but are not\",\"level\":2},\"tunes\":{}},{\"id\":\"failure-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Failure mode\",\"Why it fools evaluators\",\"What to test\"],[\"Citation decoration\",\"The answer contains sources, so it looks researched\",\"Map each material claim to an exact supporting span\"],[\"Authority mismatch\",\"The source is reputable but not authoritative for the specific fact\",\"Define claim-specific source hierarchy\"],[\"Temporal mismatch\",\"The source was correct when published\",\"Check retrieval time, source date, and superseding evidence\"],[\"Condition stripping\",\"A summary keeps the conclusion but drops exceptions\",\"Compare generated claim with full local source context\"],[\"Post-hoc citation\",\"A plausible source is attached after the answer is generated\",\"Inspect trace ordering and whether evidence preceded the claim\"],[\"Parametric override\",\"The model ignores retrieved evidence and answers from prior knowledge\",\"Run counterfactual evidence-utilization tests\"],[\"Evidence laundering\",\"Model inference is summarized and later stored as if it were a source fact\",\"Preserve transformation type and provenance across memory writes\"],[\"Source majority fallacy\",\"Several secondary pages repeat the same unsupported statement\",\"Trace claims back to independent or primary evidence\"]]},\"tunes\":{}},{\"id\":\"h-production\",\"type\":\"header\",\"data\":{\"text\":\"How to evaluate the agent in production\",\"level\":2},\"tunes\":{}},{\"id\":\"production-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence evaluation pipeline\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Define material claims\",\"description\":\"Identify the facts, recommendations, or decisions whose correctness matters to the task.\"},{\"label\":\"2. Build gold evidence\",\"description\":\"Create reference evidence and source-quality expectations for representative cases.\"},{\"label\":\"3. Capture traces\",\"description\":\"Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.\"},{\"label\":\"4. Grade support\",\"description\":\"Check whether each material claim is directly, partially, contradictorily, or not supported.\"},{\"label\":\"5. Grade authority and applicability\",\"description\":\"Evaluate whether the source is appropriate and whether its conditions match the current task.\"},{\"label\":\"6. Run counterfactuals\",\"description\":\"Remove, replace, or supersede decisive evidence and test whether the answer follows the change.\"},{\"label\":\"7. Review high-impact failures\",\"description\":\"Use human or domain-expert review where automated grading is not reliable enough.\"},{\"label\":\"8. Convert failures into eval cases\",\"description\":\"Add production failures and edge cases to a repeatable regression dataset.\"}]},\"tunes\":{}},{\"id\":\"p-production-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.\"},\"tunes\":{}},{\"id\":\"h-judge\",\"type\":\"header\",\"data\":{\"text\":\"Do not let an LLM judge become the only evidence judge\",\"level\":2},\"tunes\":{}},{\"id\":\"p-judge-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.\"},\"tunes\":{}},{\"id\":\"p-judge-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.\"},\"tunes\":{}},{\"id\":\"p-change-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.\"},\"tunes\":{}},{\"id\":\"internal-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.\",\"ctaLabel\":\"Read the related article\"},\"tunes\":{}},{\"id\":\"internal-reasoning\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\",\"title\":\"From Research Protocol to a General AI Reasoning Framework\",\"excerpt\":\"A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.\",\"ctaLabel\":\"Read the reasoning framework\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Evaluating evidence use in AI agents\",\"items\":[{\"id\":\"faq1\",\"question\":\"Does a citation prove that an AI answer is grounded?\",\"answer\":\"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.\"},{\"id\":\"faq2\",\"question\":\"How can I test whether an AI agent actually used retrieved evidence?\",\"answer\":\"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.\"},{\"id\":\"faq3\",\"question\":\"What is the difference between groundedness and source quality?\",\"answer\":\"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.\"},{\"id\":\"faq4\",\"question\":\"Why can a real source still produce a wrong AI answer?\",\"answer\":\"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.\"},{\"id\":\"faq5\",\"question\":\"What should I log for evidence evaluation?\",\"answer\":\"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key evidence-evaluation terms\",\"entries\":[{\"term\":\"Claim support\",\"definition\":\"The degree to which a specific evidence span directly establishes a generated claim.\",\"anchor\":\"claim-support\"},{\"term\":\"Evidence authority\",\"definition\":\"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.\",\"anchor\":\"evidence-authority\"},{\"term\":\"Applicability\",\"definition\":\"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.\",\"anchor\":\"applicability\"},{\"term\":\"Evidence utilization\",\"definition\":\"Whether the agent's output actually responds to and depends on the evidence made available in its execution path.\",\"anchor\":\"evidence-utilization\"},{\"term\":\"Counterfactual evidence test\",\"definition\":\"An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.\",\"anchor\":\"counterfactual-evidence-test\"},{\"term\":\"Provenance\",\"definition\":\"Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.\",\"anchor\":\"provenance\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-agent-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluate Agent Workflows\",\"description\":\"Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-eval-best\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluation Best Practices\",\"description\":\"Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.\"}},\"tunes\":{}},{\"id\":\"src-anthropic-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Demystifying Evals for AI Agents\",\"description\":\"Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-thirdparty\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations\",\"description\":\"Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":893,"blocks":894,"version":1402},1790351390243,[895,899,903,908,913,917,921,925,929,951,955,959,963,967,971,975,979,983,987,992,996,1000,1004,1008,1012,1038,1043,1047,1080,1084,1088,1092,1115,1119,1123,1127,1131,1135,1139,1143,1147,1151,1155,1182,1186,1226,1230,1259,1263,1267,1271,1275,1279,1283,1287,1291,1295,1299,1303,1306,1310,1314,1321,1328,1331,1351,1355,1374,1378,1384,1390,1396],{"id":215,"data":896,"type":220,"tunes":898},{"title":897,"maxLevel":218,"minLevel":219},"Contents",{},{"id":223,"data":900,"type":226,"tunes":902},{"text":901},"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?",{},{"id":229,"data":904,"type":234,"tunes":907},{"body":905,"title":906,"variant":233},"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.","Direct answer",{},{"id":237,"data":909,"type":234,"tunes":912},{"body":910,"title":911,"variant":241},"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.","About the method",{},{"id":244,"data":914,"type":42,"tunes":916},{"text":915,"level":219},"Why citations are not enough",{},{"id":249,"data":918,"type":226,"tunes":920},{"text":919},"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.",{},{"id":254,"data":922,"type":226,"tunes":924},{"text":923},"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.",{},{"id":259,"data":926,"type":42,"tunes":928},{"text":927,"level":219},"The four questions every material claim should pass",{},{"id":264,"data":930,"type":287,"tunes":950},{"content":931,"stretched":43,"withHeadings":14},[932,934,938,942,946],[268,269,933],"Typical failure",[935,936,937],"Claim support","Does the evidence directly support this exact claim?","The source is topically related but does not establish the statement",[939,940,941],"Evidence authority","Is this an appropriate source for this kind of claim?","A secondary summary is used where a primary source or live system is required",[943,944,945],"Applicability","Does the evidence apply to this time, version, jurisdiction, user, state, or population?","A true statement is applied outside its valid conditions",[947,948,949],"Evidence use","Was this evidence actually available and used in the agent's execution path?","The final answer is correct, but the retrieved evidence was irrelevant or unused",{},{"id":290,"data":952,"type":42,"tunes":954},{"text":953,"level":218},"1. Claim support: does the source establish what the agent says?",{},{"id":295,"data":956,"type":226,"tunes":958},{"text":957},"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.",{},{"id":300,"data":960,"type":226,"tunes":962},{"text":961},"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.",{},{"id":305,"data":964,"type":42,"tunes":966},{"text":965,"level":218},"2. Evidence authority: is this the right kind of source?",{},{"id":310,"data":968,"type":226,"tunes":970},{"text":969},"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.",{},{"id":315,"data":972,"type":226,"tunes":974},{"text":973},"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.",{},{"id":320,"data":976,"type":42,"tunes":978},{"text":977,"level":218},"3. Applicability: right evidence, wrong conditions",{},{"id":325,"data":980,"type":226,"tunes":982},{"text":981},"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.",{},{"id":330,"data":984,"type":226,"tunes":986},{"text":985},"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.",{},{"id":335,"data":988,"type":234,"tunes":991},{"body":989,"title":990,"variant":339},"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.","Evidence can be authentic and still be wrong for the answer",{},{"id":342,"data":993,"type":42,"tunes":995},{"text":994,"level":218},"4. Evidence use: did the agent actually rely on the evidence?",{},{"id":347,"data":997,"type":226,"tunes":999},{"text":998},"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.",{},{"id":352,"data":1001,"type":226,"tunes":1003},{"text":1002},"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.",{},{"id":357,"data":1005,"type":42,"tunes":1007},{"text":1006,"level":219},"The Evidence Utilization Test",{},{"id":362,"data":1009,"type":226,"tunes":1011},{"text":1010},"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.",{},{"id":367,"data":1013,"type":393,"tunes":1037},{"steps":1014,"title":1036,"orientation":392},[1015,1018,1021,1024,1027,1030,1033],{"label":1016,"description":1017},"1. Select one material claim","Choose a claim whose correctness matters and define the expected answer precisely.",{"label":1019,"description":1020},"2. Identify gold evidence","Provide the smallest authoritative evidence set sufficient to support the claim.",{"label":1022,"description":1023},"3. Run with gold evidence","Verify that the agent produces the supported answer when the correct evidence is available.",{"label":1025,"description":1026},"4. Remove the decisive evidence","Run the same task without the key supporting passage while keeping other inputs stable.",{"label":1028,"description":1029},"5. Replace it with contradictory or superseding evidence","Where safe, provide controlled evidence that changes the correct conclusion.",{"label":1031,"description":1032},"6. Compare the claims","Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.",{"label":1034,"description":1035},"7. Inspect the trace","Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.","Evidence Utilization Test",{},{"id":396,"data":1039,"type":234,"tunes":1042},{"body":1040,"title":1041,"variant":400},"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.","The key signal",{},{"id":403,"data":1044,"type":42,"tunes":1046},{"text":1045,"level":219},"A claim–evidence matrix is more useful than a source list",{},{"id":408,"data":1048,"type":287,"tunes":1079},{"content":1049,"stretched":43,"withHeadings":14},[1050,1056,1062,1068,1074],[1051,1052,1053,1054,943,1055],"Claim","Evidence","Support","Authority","Used in trace",[1057,1058,420,1059,1060,1061],"Feature X is available","Vendor documentation","High for availability claim","Current version and region must match","Yes \u002F No",[1063,1064,1065,1066,1067,1061],"Configuration Y is faster","Vendor benchmark","Partial","High for vendor's test, not independent performance","Hardware and workload must match",[1069,1070,1071,1072,1073,1061],"Policy applies to this user","Current policy + account state","Direct only when combined","High","Jurisdiction, date, role and account state must match",[1075,1076,420,1077,1078,1061],"A product is in stock","Live inventory API","Authoritative for current stock","Expires quickly",{},{"id":443,"data":1081,"type":226,"tunes":1083},{"text":1082},"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.",{},{"id":448,"data":1085,"type":42,"tunes":1087},{"text":1086,"level":219},"Separate retrieval quality from evidence quality",{},{"id":453,"data":1089,"type":226,"tunes":1091},{"text":1090},"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.",{},{"id":458,"data":1093,"type":489,"tunes":1114},{"rows":1094,"title":1107,"layout":287,"columns":1108},[1095,1098,1101,1104],{"id":462,"label":1096,"values":1097},"Right document, wrong claim",[465,465,465],{"id":467,"label":1099,"values":1100},"Right fact, stale source",[465,465,465],{"id":471,"label":1102,"values":1103},"Weak source, correct answer",[465,465,465],{"id":475,"label":1105,"values":1106},"Multiple sources required",[465,465,465],"Retrieval success is not evidence success",[1109,1110,1112],{"id":481,"label":482},{"id":484,"label":1111},"Retrieval",{"id":487,"label":1113},"Evidence quality",{},{"id":492,"data":1116,"type":42,"tunes":1118},{"text":1117,"level":219},"Evaluate source quality as a rubric, not a domain whitelist",{},{"id":497,"data":1120,"type":226,"tunes":1122},{"text":1121},"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.",{},{"id":502,"data":1124,"type":226,"tunes":1126},{"text":1125},"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.",{},{"id":507,"data":1128,"type":42,"tunes":1130},{"text":1129,"level":219},"Evidence coverage: every important claim needs support, not every sentence",{},{"id":512,"data":1132,"type":226,"tunes":1134},{"text":1133},"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.",{},{"id":517,"data":1136,"type":226,"tunes":1138},{"text":1137},"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.",{},{"id":522,"data":1140,"type":42,"tunes":1142},{"text":1141,"level":219},"Evidence provenance must survive summarization and memory",{},{"id":527,"data":1144,"type":226,"tunes":1146},{"text":1145},"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.",{},{"id":532,"data":1148,"type":226,"tunes":1150},{"text":1149},"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.",{},{"id":537,"data":1152,"type":42,"tunes":1154},{"text":1153,"level":219},"A practical evidence record",{},{"id":542,"data":1156,"type":287,"tunes":1181},{"content":1157,"stretched":43,"withHeadings":14},[1158,1161,1163,1165,1167,1169,1171,1173,1175,1177,1179],[1159,1160],"Field","Purpose",[549,1162],"Identifies the material claim being supported",[552,1164],"Identifies where the evidence came from",[555,1166],"Preserves the smallest passage, record, or tool result that supports the claim",[558,1168],"Allows freshness and timeline checks",[561,1170],"Allows supersession and reproducibility checks",[564,1172],"Explains why this source is suitable for this claim",[567,1174],"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions",[570,1176],"Marks whether evidence is raw, quoted, summarized, normalized, or derived",[573,1178],"Shows when the evidence became available to the agent",[576,1180],"Direct, partial, contradictory, unsupported, or uncertain",{},{"id":580,"data":1183,"type":42,"tunes":1185},{"text":1184,"level":219},"Failure modes that look grounded but are not",{},{"id":585,"data":1187,"type":287,"tunes":1225},{"content":1188,"stretched":43,"withHeadings":14},[1189,1193,1197,1201,1205,1209,1213,1217,1221],[1190,1191,1192],"Failure mode","Why it fools evaluators","What to test",[1194,1195,1196],"Citation decoration","The answer contains sources, so it looks researched","Map each material claim to an exact supporting span",[1198,1199,1200],"Authority mismatch","The source is reputable but not authoritative for the specific fact","Define claim-specific source hierarchy",[1202,1203,1204],"Temporal mismatch","The source was correct when published","Check retrieval time, source date, and superseding evidence",[1206,1207,1208],"Condition stripping","A summary keeps the conclusion but drops exceptions","Compare generated claim with full local source context",[1210,1211,1212],"Post-hoc citation","A plausible source is attached after the answer is generated","Inspect trace ordering and whether evidence preceded the claim",[1214,1215,1216],"Parametric override","The model ignores retrieved evidence and answers from prior knowledge","Run counterfactual evidence-utilization tests",[1218,1219,1220],"Evidence laundering","Model inference is summarized and later stored as if it were a source fact","Preserve transformation type and provenance across memory writes",[1222,1223,1224],"Source majority fallacy","Several secondary pages repeat the same unsupported statement","Trace claims back to independent or primary evidence",{},{"id":626,"data":1227,"type":42,"tunes":1229},{"text":1228,"level":219},"How to evaluate the agent in production",{},{"id":631,"data":1231,"type":393,"tunes":1258},{"steps":1232,"title":1257,"orientation":392},[1233,1236,1239,1242,1245,1248,1251,1254],{"label":1234,"description":1235},"1. Define material claims","Identify the facts, recommendations, or decisions whose correctness matters to the task.",{"label":1237,"description":1238},"2. Build gold evidence","Create reference evidence and source-quality expectations for representative cases.",{"label":1240,"description":1241},"3. Capture traces","Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.",{"label":1243,"description":1244},"4. Grade support","Check whether each material claim is directly, partially, contradictorily, or not supported.",{"label":1246,"description":1247},"5. Grade authority and applicability","Evaluate whether the source is appropriate and whether its conditions match the current task.",{"label":1249,"description":1250},"6. Run counterfactuals","Remove, replace, or supersede decisive evidence and test whether the answer follows the change.",{"label":1252,"description":1253},"7. Review high-impact failures","Use human or domain-expert review where automated grading is not reliable enough.",{"label":1255,"description":1256},"8. Convert failures into eval cases","Add production failures and edge cases to a repeatable regression dataset.","Evidence evaluation pipeline",{},{"id":661,"data":1260,"type":226,"tunes":1262},{"text":1261},"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.",{},{"id":666,"data":1264,"type":42,"tunes":1266},{"text":1265,"level":219},"Do not let an LLM judge become the only evidence judge",{},{"id":671,"data":1268,"type":226,"tunes":1270},{"text":1269},"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.",{},{"id":676,"data":1272,"type":226,"tunes":1274},{"text":1273},"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.",{},{"id":681,"data":1276,"type":42,"tunes":1278},{"text":1277,"level":219},"What would change this answer?",{},{"id":686,"data":1280,"type":226,"tunes":1282},{"text":1281},"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.",{},{"id":691,"data":1284,"type":226,"tunes":1286},{"text":1285},"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.",{},{"id":696,"data":1288,"type":226,"tunes":1290},{"text":1289},"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.",{},{"id":701,"data":1292,"type":42,"tunes":1294},{"text":1293,"level":219},"Limitations",{},{"id":706,"data":1296,"type":226,"tunes":1298},{"text":1297},"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.",{},{"id":711,"data":1300,"type":226,"tunes":1302},{"text":1301},"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.",{},{"id":716,"data":1304,"type":42,"tunes":1305},{"text":718,"level":219},{},{"id":721,"data":1307,"type":226,"tunes":1309},{"text":1308},"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?",{},{"id":726,"data":1311,"type":226,"tunes":1313},{"text":1312},"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.",{},{"id":731,"data":1315,"type":737,"tunes":1320},{"url":1316,"title":1317,"excerpt":1318,"ctaLabel":1319},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.","Read the related article",{},{"id":740,"data":1322,"type":737,"tunes":1327},{"url":1323,"title":1324,"excerpt":1325,"ctaLabel":1326},"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","From Research Protocol to a General AI Reasoning Framework","A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.","Read the reasoning framework",{},{"id":748,"data":1329,"type":42,"tunes":1330},{"text":750,"level":219},{},{"id":753,"data":1332,"type":753,"tunes":1350},{"items":1333,"title":1349},[1334,1337,1340,1343,1346],{"id":757,"answer":1335,"question":1336},"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.","Does a citation prove that an AI answer is grounded?",{"id":761,"answer":1338,"question":1339},"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.","How can I test whether an AI agent actually used retrieved evidence?",{"id":765,"answer":1341,"question":1342},"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.","What is the difference between groundedness and source quality?",{"id":769,"answer":1344,"question":1345},"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.","Why can a real source still produce a wrong AI answer?",{"id":773,"answer":1347,"question":1348},"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.","What should I log for evidence evaluation?","Evaluating evidence use in AI agents",{},{"id":779,"data":1352,"type":42,"tunes":1354},{"text":1353,"level":219},"Glossary",{},{"id":784,"data":1356,"type":784,"tunes":1373},{"title":1357,"entries":1358},"Key evidence-evaluation terms",[1359,1361,1363,1365,1368,1371],{"term":935,"anchor":790,"definition":1360},"The degree to which a specific evidence span directly establishes a generated claim.",{"term":939,"anchor":793,"definition":1362},"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.",{"term":943,"anchor":567,"definition":1364},"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.",{"term":1366,"anchor":799,"definition":1367},"Evidence utilization","Whether the agent's output actually responds to and depends on the evidence made available in its execution path.",{"term":1369,"anchor":803,"definition":1370},"Counterfactual evidence test","An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.",{"term":806,"anchor":807,"definition":1372},"Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.",{},{"id":811,"data":1375,"type":42,"tunes":1377},{"text":1376,"level":219},"Primary sources and further reading",{},{"id":816,"data":1379,"type":823,"tunes":1383},{"link":818,"meta":1380},{"image":1381,"title":821,"description":1382},{"url":465},"Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.",{},{"id":826,"data":1385,"type":823,"tunes":1389},{"link":828,"meta":1386},{"image":1387,"title":831,"description":1388},{"url":465},"Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.",{},{"id":835,"data":1391,"type":823,"tunes":1395},{"link":837,"meta":1392},{"image":1393,"title":840,"description":1394},{"url":465},"Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.",{},{"id":844,"data":1397,"type":823,"tunes":1401},{"link":846,"meta":1398},{"image":1399,"title":849,"description":1400},{"url":465},"Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.",{},"2.31.6","An AI agent can cite sources and still use the wrong evidence. This article introduces a practical method for checking claim support, source authority, applicability, provenance, and whether the evidence actually influenced the answer.",{"lang":7,"title":208,"content":210,"contentJson":1405,"excerpt":853},{"time":212,"blocks":1406,"version":852},[1407,1410,1413,1416,1419,1422,1425,1428,1431,1440,1443,1446,1449,1452,1455,1458,1461,1464,1467,1470,1473,1476,1479,1482,1485,1496,1499,1502,1511,1514,1517,1520,1536,1539,1542,1545,1548,1551,1554,1557,1560,1563,1566,1581,1584,1597,1600,1612,1615,1618,1621,1624,1627,1630,1633,1636,1639,1642,1645,1648,1651,1654,1657,1660,1663,1672,1675,1685,1688,1693,1698,1703],{"id":215,"data":1408,"type":220,"tunes":1409},{"title":217,"maxLevel":218,"minLevel":219},{},{"id":223,"data":1411,"type":226,"tunes":1412},{"text":225},{},{"id":229,"data":1414,"type":234,"tunes":1415},{"body":231,"title":232,"variant":233},{},{"id":237,"data":1417,"type":234,"tunes":1418},{"body":239,"title":240,"variant":241},{},{"id":244,"data":1420,"type":42,"tunes":1421},{"text":246,"level":219},{},{"id":249,"data":1423,"type":226,"tunes":1424},{"text":251},{},{"id":254,"data":1426,"type":226,"tunes":1427},{"text":256},{},{"id":259,"data":1429,"type":42,"tunes":1430},{"text":261,"level":219},{},{"id":264,"data":1432,"type":287,"tunes":1439},{"content":1433,"stretched":43,"withHeadings":14},[1434,1435,1436,1437,1438],[268,269,270],[272,273,274],[276,277,278],[280,281,282],[284,285,286],{},{"id":290,"data":1441,"type":42,"tunes":1442},{"text":292,"level":218},{},{"id":295,"data":1444,"type":226,"tunes":1445},{"text":297},{},{"id":300,"data":1447,"type":226,"tunes":1448},{"text":302},{},{"id":305,"data":1450,"type":42,"tunes":1451},{"text":307,"level":218},{},{"id":310,"data":1453,"type":226,"tunes":1454},{"text":312},{},{"id":315,"data":1456,"type":226,"tunes":1457},{"text":317},{},{"id":320,"data":1459,"type":42,"tunes":1460},{"text":322,"level":218},{},{"id":325,"data":1462,"type":226,"tunes":1463},{"text":327},{},{"id":330,"data":1465,"type":226,"tunes":1466},{"text":332},{},{"id":335,"data":1468,"type":234,"tunes":1469},{"body":337,"title":338,"variant":339},{},{"id":342,"data":1471,"type":42,"tunes":1472},{"text":344,"level":218},{},{"id":347,"data":1474,"type":226,"tunes":1475},{"text":349},{},{"id":352,"data":1477,"type":226,"tunes":1478},{"text":354},{},{"id":357,"data":1480,"type":42,"tunes":1481},{"text":359,"level":219},{},{"id":362,"data":1483,"type":226,"tunes":1484},{"text":364},{},{"id":367,"data":1486,"type":393,"tunes":1495},{"steps":1487,"title":391,"orientation":392},[1488,1489,1490,1491,1492,1493,1494],{"label":371,"description":372},{"label":374,"description":375},{"label":377,"description":378},{"label":380,"description":381},{"label":383,"description":384},{"label":386,"description":387},{"label":389,"description":390},{},{"id":396,"data":1497,"type":234,"tunes":1498},{"body":398,"title":399,"variant":400},{},{"id":403,"data":1500,"type":42,"tunes":1501},{"text":405,"level":219},{},{"id":408,"data":1503,"type":287,"tunes":1510},{"content":1504,"stretched":43,"withHeadings":14},[1505,1506,1507,1508,1509],[412,413,414,415,280,416],[418,419,420,421,422,423],[425,426,427,428,429,423],[431,432,433,434,435,423],[437,438,420,439,440,423],{},{"id":443,"data":1512,"type":226,"tunes":1513},{"text":445},{},{"id":448,"data":1515,"type":42,"tunes":1516},{"text":450,"level":219},{},{"id":453,"data":1518,"type":226,"tunes":1519},{"text":455},{},{"id":458,"data":1521,"type":489,"tunes":1535},{"rows":1522,"title":478,"layout":287,"columns":1531},[1523,1525,1527,1529],{"id":462,"label":463,"values":1524},[465,465,465],{"id":467,"label":468,"values":1526},[465,465,465],{"id":471,"label":472,"values":1528},[465,465,465],{"id":475,"label":476,"values":1530},[465,465,465],[1532,1533,1534],{"id":481,"label":482},{"id":484,"label":485},{"id":487,"label":488},{},{"id":492,"data":1537,"type":42,"tunes":1538},{"text":494,"level":219},{},{"id":497,"data":1540,"type":226,"tunes":1541},{"text":499},{},{"id":502,"data":1543,"type":226,"tunes":1544},{"text":504},{},{"id":507,"data":1546,"type":42,"tunes":1547},{"text":509,"level":219},{},{"id":512,"data":1549,"type":226,"tunes":1550},{"text":514},{},{"id":517,"data":1552,"type":226,"tunes":1553},{"text":519},{},{"id":522,"data":1555,"type":42,"tunes":1556},{"text":524,"level":219},{},{"id":527,"data":1558,"type":226,"tunes":1559},{"text":529},{},{"id":532,"data":1561,"type":226,"tunes":1562},{"text":534},{},{"id":537,"data":1564,"type":42,"tunes":1565},{"text":539,"level":219},{},{"id":542,"data":1567,"type":287,"tunes":1580},{"content":1568,"stretched":43,"withHeadings":14},[1569,1570,1571,1572,1573,1574,1575,1576,1577,1578,1579],[546,547],[549,550],[552,553],[555,556],[558,559],[561,562],[564,565],[567,568],[570,571],[573,574],[576,577],{},{"id":580,"data":1582,"type":42,"tunes":1583},{"text":582,"level":219},{},{"id":585,"data":1585,"type":287,"tunes":1596},{"content":1586,"stretched":43,"withHeadings":14},[1587,1588,1589,1590,1591,1592,1593,1594,1595],[589,590,591],[593,594,595],[597,598,599],[601,602,603],[605,606,607],[609,610,611],[613,614,615],[617,618,619],[621,622,623],{},{"id":626,"data":1598,"type":42,"tunes":1599},{"text":628,"level":219},{},{"id":631,"data":1601,"type":393,"tunes":1611},{"steps":1602,"title":658,"orientation":392},[1603,1604,1605,1606,1607,1608,1609,1610],{"label":635,"description":636},{"label":638,"description":639},{"label":641,"description":642},{"label":644,"description":645},{"label":647,"description":648},{"label":650,"description":651},{"label":653,"description":654},{"label":656,"description":657},{},{"id":661,"data":1613,"type":226,"tunes":1614},{"text":663},{},{"id":666,"data":1616,"type":42,"tunes":1617},{"text":668,"level":219},{},{"id":671,"data":1619,"type":226,"tunes":1620},{"text":673},{},{"id":676,"data":1622,"type":226,"tunes":1623},{"text":678},{},{"id":681,"data":1625,"type":42,"tunes":1626},{"text":683,"level":219},{},{"id":686,"data":1628,"type":226,"tunes":1629},{"text":688},{},{"id":691,"data":1631,"type":226,"tunes":1632},{"text":693},{},{"id":696,"data":1634,"type":226,"tunes":1635},{"text":698},{},{"id":701,"data":1637,"type":42,"tunes":1638},{"text":703,"level":219},{},{"id":706,"data":1640,"type":226,"tunes":1641},{"text":708},{},{"id":711,"data":1643,"type":226,"tunes":1644},{"text":713},{},{"id":716,"data":1646,"type":42,"tunes":1647},{"text":718,"level":219},{},{"id":721,"data":1649,"type":226,"tunes":1650},{"text":723},{},{"id":726,"data":1652,"type":226,"tunes":1653},{"text":728},{},{"id":731,"data":1655,"type":737,"tunes":1656},{"url":733,"title":734,"excerpt":735,"ctaLabel":736},{},{"id":740,"data":1658,"type":737,"tunes":1659},{"url":742,"title":743,"excerpt":744,"ctaLabel":745},{},{"id":748,"data":1661,"type":42,"tunes":1662},{"text":750,"level":219},{},{"id":753,"data":1664,"type":753,"tunes":1671},{"items":1665,"title":776},[1666,1667,1668,1669,1670],{"id":757,"answer":758,"question":759},{"id":761,"answer":762,"question":763},{"id":765,"answer":766,"question":767},{"id":769,"answer":770,"question":771},{"id":773,"answer":774,"question":775},{},{"id":779,"data":1673,"type":42,"tunes":1674},{"text":781,"level":219},{},{"id":784,"data":1676,"type":784,"tunes":1684},{"title":786,"entries":1677},[1678,1679,1680,1681,1682,1683],{"term":789,"anchor":790,"definition":791},{"term":276,"anchor":793,"definition":794},{"term":280,"anchor":567,"definition":796},{"term":798,"anchor":799,"definition":800},{"term":802,"anchor":803,"definition":804},{"term":806,"anchor":807,"definition":808},{},{"id":811,"data":1686,"type":42,"tunes":1687},{"text":813,"level":219},{},{"id":816,"data":1689,"type":823,"tunes":1692},{"link":818,"meta":1690},{"image":1691,"title":821,"description":822},{"url":465},{},{"id":826,"data":1694,"type":823,"tunes":1697},{"link":828,"meta":1695},{"image":1696,"title":831,"description":832},{"url":465},{},{"id":835,"data":1699,"type":823,"tunes":1702},{"link":837,"meta":1700},{"image":1701,"title":840,"description":841},{"url":465},{},{"id":844,"data":1704,"type":823,"tunes":1707},{"link":846,"meta":1705},{"image":1706,"title":849,"description":850},{"url":465},{},"Post erfolgreich abgerufen",{"items":1710,"source":1774,"manualIds":1775,"manualMatchedIds":1776},[1711,1718,1725,1732,1739,1746,1753,1760,1767],{"id":1712,"slug":1713,"title":1714,"excerpt":1715,"featuredImage":1716,"publishedAt":1717},"470","what-should-an-ai-agent-remember-forget-recompute-or-retrieve-again","Que devrait mémoriser, oublier, recalculer ou récupérer à nouveau un agent IA ?","Les agents à exécution longue ne devraient pas tout retenir. Cet article propose un modèle de cycle de vie pratique pour décider de ce qui a sa place dans la mémoire durable, de ce qui devrait être récupéré à nouveau, de ce qu'il est plus sûr de recalculer et de ce qui devrait expirer ou être remplacé.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-should-an-ai-agent-remember-forget-recompute-or-retrieve-again-1790351131087-iehz28.webp","2026-09-25T09:43:00.000Z",{"id":1719,"slug":1720,"title":1721,"excerpt":1722,"featuredImage":1723,"publishedAt":1724},"456","zbt-z8102ax-hardware-packaging-review","Test du matériel et de l'emballage du ZBT Z8102AX : routeur solide, boîte fragile","Le ZBT Z8102AX fait une solide première impression en tant que routeur OpenWrt 5G fin en métal noir avec plusieurs connecteurs d'antenne, des emplacements double SIM, des ports USB, LAN\u002FWAN et un ensemble d'accessoires pratique. Le matériel semble utile et sérieux, mais l'emballage est clairement le point faible.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-02-1781620590938-y33j4b.webp","2026-06-16T04:40:00.000Z",{"id":1726,"slug":1727,"title":1728,"excerpt":1729,"featuredImage":1730,"publishedAt":1731},"454","zbt-z8102ax-rm500u-ea-5g-modem-test","Quectel RM500U-EA dans le ZBT Z8102AX : bandes 5G, o2 Allemagne et comportement du signal en conditions réelles","Le ZBT Z8102AX utilise un modem Quectel RM500U-EA pour la connectivité 4G et 5G. Lors du premier test pratique, le routeur s'est connecté avec succès à o2 Germany avec la bande LTE 3 et la NR n28. Le modem fonctionne, mais des diagnostics plus approfondis tels que le RSRP, le RSRQ, le SINR, le verrouillage de bande et le comportement des cellules nécessitent encore des tests appropriés.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-06-1781620597879-qay2sx.webp","2026-06-16T08:39:00.000Z",{"id":1733,"slug":1734,"title":1735,"excerpt":1736,"featuredImage":1737,"publishedAt":1738},"477","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","Agents d'utilisation de l'ordinateur : pourquoi une démonstration réussie peut tout de même être un système peu fiable","Les agents d'utilisation de l'ordinateur peuvent désormais accomplir d'impressionnants flux de travail sur navigateur et sur bureau, mais une seule exécution réussie prouve la capacité—non la fiabilité. Cet article montre comment tester la répétabilité, la robustesse environnementale, le contrôle à long horizon, la conscience de l'état, la vérification des résultats et la gestion sécurisée des objectifs.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","2026-09-25T12:13:00.000Z",{"id":1740,"slug":1741,"title":1742,"excerpt":1743,"featuredImage":1744,"publishedAt":1745},"383","canonical-architecture-url-design-resolver-logic-api-scalability-specification","Architecture Canonique, Conception d'URL, Logique de Résolution, Spécification d'API et d'Évolutivité","Architecture de découverte géolocalisée pour les portails multi-locataires. Définit les URL canoniques, la logique de résolution, la stratégie de mise en cache et un modèle de lecture géo sans couplage CMS ni refactorisation de base de données. Conçue pour la stabilité SEO, l'évolutivité et les futures extensions comme la réservation et les cartes.","\u002Fuploads\u002F2026\u002F01\u002Fcanonical-architecture-url-design-resolver-logic-api-scalability-specification-1769890763607-7rghbp.webp","2026-01-31T06:12:00.000Z",{"id":1747,"slug":1748,"title":1749,"excerpt":1750,"featuredImage":1751,"publishedAt":1752},"467","the-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","La frontière de validité des réponses : la couche manquante entre la pertinence et les réponses fiables de l'IA","Une source peut être pertinente, faisant autorité et pourtant être erronée pour la question posée. La couche manquante est l'applicabilité : les conditions dans lesquelles une réponse est valable, et les changements qui obligent à la reconsidérer. Cet article présente la Frontière de Validité de la Réponse comme un modèle de conception de source pour les humains, la recherche par IA et les systèmes RAG.","\u002Fuploads\u002F2026\u002F09\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers-1790272901306-1g5jly.webp","2026-09-24T11:59:00.000Z",{"id":1754,"slug":1755,"title":1756,"excerpt":1757,"featuredImage":1758,"publishedAt":1759},"472","why-more-context-can-make-ai-answers-worse","Pourquoi plus de contexte peut rendre les réponses de l'IA pires","Une fenêtre de contexte plus grande ne garantit pas une meilleure réponse. Cet article explique comment la dilution du signal, les preuves contradictoires, l'état obsolète, la sensibilité à la position et la compression avec perte peuvent réduire la fiabilité de l'IA — et présente un test pratique de pression de contexte.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z",{"id":1761,"slug":1762,"title":1763,"excerpt":1764,"featuredImage":1765,"publishedAt":1766},"457","should-you-buy-5g-openwrt-router-old-firmware","Faut-il acheter un routeur 5G OpenWrt avec un ancien firmware ? Le ZBT Z8102AX comme exemple concret","Acheter un routeur 5G OpenWrt avec un ancien firmware peut avoir du sens, mais uniquement dans les bonnes conditions. Le ZBT Z8102AX illustre clairement les deux aspects : le matériel est utile, le modem fonctionne et le routeur est resté stable lors des tests, mais OpenWrt 21.02, un emballage faible et des chemins de mise à niveau peu clairs nécessitent une décision d'achat réfléchie.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1768,"slug":1769,"title":1770,"excerpt":1771,"featuredImage":1772,"publishedAt":1773},"476","mcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained","MCP vs A2A vs UCP vs AP2 vs A2UI : La pile de protocoles d'agent expliquée","MCP, A2A, UCP, AP2 et A2UI sont souvent présentés comme des standards d'agents concurrents. Ils résolvent principalement des problèmes d'interopérabilité différents. Ce guide associe chaque protocole à la frontière qu'il standardise réellement—et montre comment ils peuvent fonctionner ensemble dans un seul système de production.","\u002Fuploads\u002F2026\u002F09\u002Fmcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained-1790352625869-2ezle0.webp","2026-09-25T12:09:00.000Z","fallback",[],[]]