[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:de":3,"public-menus:all":37,"post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:de":204,"related:post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:de:1":1713},{"statusCode":4,"data":5,"message":36},200,{"tenantId":6,"lang":7,"defaultLang":7,"siteUrl":8,"contactEmail":9,"brandName":10,"logoUrl":11,"siteName":10,"siteDescription":12,"ogImage":9,"robotsIndex":13,"socialLinks":9,"reservedSlugs":9,"seoPolicy":14},"stajic","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":15,"relatedContent":16,"crossDomainLinks":17},{"logoUrl":11},{"enabled":13},[18,21,24,27,30,33],{"url":19,"label":20,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":22,"label":23,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":25,"label":26,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.com","bazify.com",{"url":28,"label":29,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.de","bazify.de",{"url":31,"label":32,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.at","bazify.at",{"url":34,"label":35,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[38,44],{"id":39,"name":40,"location":41,"isActive":13,"isDefault":42,"items":43},1,"main-navigation","header",false,[],{"id":45,"name":46,"location":47,"isActive":13,"isDefault":13,"items":48},4,"main-menu","sidebar",[49,65,78,92,102,117,132],{"id":50,"title":51,"url":59,"target":60,"icon":61,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":63,"portfolioId":9,"children":64},"item-18",{"de":52,"en":53,"es":54,"fr":55,"it":53,"ru":56,"sr":57,"zh":58},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":66,"title":67,"url":74,"target":60,"icon":75,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":76,"portfolioId":9,"children":77},"item-22",{"de":68,"en":68,"es":69,"fr":68,"it":70,"ru":71,"sr":72,"zh":73},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":79,"title":80,"url":88,"target":60,"icon":89,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":90,"portfolioId":9,"children":91},"item-19",{"de":81,"en":82,"es":83,"fr":82,"it":84,"ru":85,"sr":86,"zh":87},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":93,"title":94,"url":98,"target":60,"icon":99,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":100,"portfolioId":9,"children":101},"item-23",{"de":95,"en":95,"es":95,"fr":95,"it":95,"ru":96,"sr":96,"zh":97},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":103,"title":104,"url":113,"target":60,"icon":114,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":115,"portfolioId":9,"children":116},"item-32",{"de":105,"en":106,"es":107,"fr":108,"it":109,"ru":110,"sr":111,"zh":112},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":118,"title":119,"url":128,"target":60,"icon":129,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":130,"portfolioId":9,"children":131},"item-20",{"de":120,"en":121,"es":122,"fr":123,"it":124,"ru":125,"sr":126,"zh":127},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":133,"title":134,"url":143,"target":60,"icon":144,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":146},"item-21",{"de":135,"en":136,"es":137,"fr":138,"it":139,"ru":140,"sr":141,"zh":142},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[147,160,174,180,192],{"id":148,"title":149,"url":143,"target":60,"icon":158,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":159},"item-24",{"de":150,"en":151,"es":152,"fr":153,"it":154,"ru":155,"sr":156,"zh":157},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":161,"title":162,"url":170,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":173},"item-29",{"de":163,"en":164,"es":165,"fr":166,"it":167,"ru":168,"sr":169,"zh":142},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":175,"title":176,"url":178,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":179},"item-28",{"de":177,"en":177,"es":177,"fr":177,"it":177,"ru":177,"sr":177,"zh":177},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":181,"title":182,"url":190,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":191},"item-27",{"de":183,"en":184,"es":185,"fr":186,"it":187,"ru":188,"sr":189,"zh":184},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":193,"title":194,"url":202,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":203},"item-31",{"de":195,"en":196,"es":197,"fr":198,"it":199,"ru":200,"sr":201,"zh":196},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":205,"message":1712},{"id":206,"title":207,"slug":208,"content":209,"contentJson":210,"excerpt":854,"featuredImage":855,"featuredImageAlt":856,"featuredImageCaption":9,"featuredImageTitle":9,"featuredImageCopyright":9,"featuredImageAuthor":9,"featuredImageSourceUrl":9,"featuredImageLicense":9,"featuredImageIsAiGenerated":42,"status":857,"publishedAt":858,"createdAt":859,"updatedAt":860,"seoLocalePaths":861,"categories":870,"author":883,"translations":888},"471","Wie man erkennt, ob ein KI-Agent tatsächlich die richtigen Belege verwendet hat","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Inhalt\">\u003Cstrong class=\"editorjs-toc__title\">Inhalt\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-5\" class=\"editorjs-toc__link\">Warum Zitate nicht ausreichen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-8\" class=\"editorjs-toc__link\">Die vier Fragen, die jede wesentliche Behauptung bestehen sollte\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">1. Stützung der Behauptung: Begründet die Quelle das, was der Agent aussagt?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-13\" class=\"editorjs-toc__link\">2. Autorität des Belegs: Ist dies die richtige Art von Quelle?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-16\" class=\"editorjs-toc__link\">3. Anwendbarkeit: Richtiger Beleg, falsche Bedingungen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-20\" class=\"editorjs-toc__link\">4. Evidenznutzung: Hat sich der Agent tatsächlich auf die Evidenz gestützt?\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-23\" class=\"editorjs-toc__link\">Der Evidence Utilization Test\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-27\" class=\"editorjs-toc__link\">Eine Behauptungs-Evidenz-Matrix ist nützlicher als eine Quellenliste\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-30\" class=\"editorjs-toc__link\">Abrufqualität von Evidenzqualität trennen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">Quellenqualität als Rubrik bewerten, nicht als Domain-Whitelist\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-36\" class=\"editorjs-toc__link\">Evidenzabdeckung: Jede wichtige Behauptung benötigt Belege, nicht jeder Satz\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-39\" class=\"editorjs-toc__link\">Die Provenienz von Belegen muss Zusammenfassungen und das Gedächtnis überdauern\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-42\" class=\"editorjs-toc__link\">Ein praxisorientierter Belegdatensatz\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-44\" class=\"editorjs-toc__link\">Fehlermuster, die fundiert wirken, es aber nicht sind\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-46\" class=\"editorjs-toc__link\">Wie der Agent im Produktivbetrieb evaluiert wird\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-49\" class=\"editorjs-toc__link\">Ein LLM-Judge darf nicht die einzige Bewertungsinstanz sein\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-52\" class=\"editorjs-toc__link\">Was würde diese Antwort verändern?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-56\" class=\"editorjs-toc__link\">Einschränkungen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-59\" class=\"editorjs-toc__link\">Fazit\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-64\" class=\"editorjs-toc__link\">FAQ\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-66\" class=\"editorjs-toc__link\">Glossar\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-68\" class=\"editorjs-toc__link\">Primärquellen und weiterführende Literatur\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>Ein KI-Agent kann Quellen zitieren, Dokumente abrufen und dennoch die falschen Belege verwenden. Eine Quelle kann maßgeblich sein, aber für die konkrete Behauptung irrelevant. Ein abgerufener Textabschnitt stützt möglicherweise nur einen Teil einer Antwort. Eine korrekte Quelle kann veraltet oder abgelöst sein oder für die falsche Rechtsordnung, Produktversion, Nutzergruppe oder den falschen Systemzustand gelten. Daraus ergibt sich ein schwierigeres Evaluierungsproblem als eine einfache Quellenprüfung: Hat der Agent tatsächlich die richtigen Belege für die von ihm aufgestellte Behauptung verwendet?\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Direkte Antwort\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Um zu wissen, ob ein KI-Agent die richtigen Belege verwendet hat, evaluieren Sie die Kette &lt;strong&gt;Behauptung → Beleg → Anwendbarkeit → Nutzung&lt;\u002Fstrong&gt;. Überprüfen Sie für jede wesentliche Behauptung, ob der Beleg sie direkt stützt, aus einer geeigneten Autorität stammt, für die aktuellen Bedingungen gilt und dem Agenten tatsächlich zur Verfügung stand, bevor die Behauptung generiert wurde. Eine Quellenangabe allein beweist nichts davon.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Über die Methode\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Das Modell „Behauptung–Beleg–Anwendbarkeit–Nutzung“ und der Evidence Utilization Test in diesem Artikel sind praktische Evaluierungsmethoden, keine formalen Branchenstandards. Sie bauen auf etablierten Konzepten wie Groundedness, Quellenqualität, Zitationsabdeckung, Trace-Evaluierung und aufgabenspezifischen Evals auf.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-5\">Warum Zitate nicht ausreichen\u003C\u002Fh2>\n\u003Cp>Ein Zitat beantwortet nur eine eng begrenzte Frage: Das System hat eine Behauptung oder Antwort mit einer Quelle verknüpft. Es belegt nicht automatisch, dass die Quelle die spezifische Behauptung stützt, dass die Quelle für die Aufgabe maßgeblich genug ist, dass der zitierte Abschnitt die notwendige Bedingung oder Ausnahme enthält oder dass das Modell sich auf diesen Beleg gestützt hat, anstatt die Antwort aus vorherigem Modellwissen zu generieren.\u003C\u002Fp>\n\u003Cp>Anthropics Leitfaden zur Evaluierung von Recherche-Agenten trennt explizit zwischen Groundedness, Abdeckung und Quellenqualität. Auch OpenAIs Leitfaden zur Agenten-Evaluierung betont Ausführungsspuren (Traces), da ein Endergebnis nicht offenbart, ob der Agent die richtigen Tools ausgewählt oder den beabsichtigten Workflow befolgt hat. Diese Überlegungen weisen auf eine allgemeinere Schlussfolgerung hin: Belegqualität ist eine Eigenschaft des Ausführungspfads, nicht nur des finalen Textes.\u003C\u002Fp>\n\u003Ch2 id=\"section-8\">Die vier Fragen, die jede wesentliche Behauptung bestehen sollte\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Dimension\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Frage\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Typischer Fehler\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Stützung der Behauptung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Stützt der Beleg diese exakte Behauptung direkt?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die Quelle ist thematisch verwandt, begründet die Aussage jedoch nicht\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autorität des Belegs\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ist dies eine geeignete Quelle für diese Art von Behauptung?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eine sekundäre Zusammenfassung wird verwendet, wo eine Primärquelle oder ein Live-System erforderlich ist\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Anwendbarkeit\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Gilt der Beleg für diesen Zeitpunkt, diese Version, diese Rechtsordnung, diesen Nutzer, diesen Zustand oder diese Population?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eine wahre Aussage wird außerhalb ihrer gültigen Bedingungen angewendet\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Nutzung des Belegs\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">War dieser Beleg tatsächlich verfügbar und wurde er im Ausführungspfad des Agenten genutzt?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die finale Antwort ist korrekt, aber der abgerufene Beleg war irrelevant oder ungenutzt\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch3 id=\"section-10\">1. Stützung der Behauptung: Begründet die Quelle das, was der Agent aussagt?\u003C\u002Fh3>\n\u003Cp>Belege sollten auf Behauptungsebene evaluiert werden. Ein Dokument kann für das Thema relevant sein und dennoch eine spezifische Aussage nicht stützen. Wenn eine Quelle besagt, dass eine Funktion in ausgewählten Regionen verfügbar ist, ist die Antwort „die Funktion ist weltweit verfügbar“ nicht belegt, auch wenn das Zitat plausibel wirkt.\u003C\u002Fp>\n\u003Cp>Hier sind pauschale Urteile wie „fundiert \u002F nicht fundiert“ oft zu grob. Teilen Sie die Antwort in wesentliche Behauptungen auf, ordnen Sie jede Behauptung dem kleinsten Belegabschnitt zu, der sie stützt, und klassifizieren Sie die Beziehung: direkte Stützung, teilweise Stützung, Widerspruch oder keine Stützung.\u003C\u002Fp>\n\u003Ch3 id=\"section-13\">2. Autorität des Belegs: Ist dies die richtige Art von Quelle?\u003C\u002Fh3>\n\u003Cp>Die korrekte Auswahl von Belegen beschränkt sich nicht nur auf semantische Relevanz. Die Quelle muss für die Entscheidung geeignet sein. Ein aktueller Kontostatus sollte aus dem Kontosystem stammen, nicht aus einer alten E-Mail. Eine Behauptung zum API-Verhalten sollte vorzugsweise anhand der aktuellen Dokumentation des Anbieters oder reproduzierbarem Verhalten überprüft werden. Eine rechtliche Anforderung erfordert möglicherweise das anwendbare Gesetz, die Regulierungsbehörde oder maßgebliche Richtlinien anstelle eines allgemeinen Blogbeitrags.\u003C\u002Fp>\n\u003Cp>Die Quellenautorität ist aufgabenspezifisch. Ein Community-Bericht kann der beste Beleg für einen realen Fehler sein, den die Dokumentation des Anbieters nicht erwähnt. Eine Ankündigung des Anbieters kann maßgeblich dafür sein, was der Anbieter behauptet, aber ein schwacher Beleg für die unabhängige Leistung. Die evaluierende Person benötigt daher eine explizite Quellenhierarchie für die jeweilige Aufgabe anstelle eines universellen Autoritätswerts.\u003C\u002Fp>\n\u003Ch3 id=\"section-16\">3. Anwendbarkeit: Richtiger Beleg, falsche Bedingungen\u003C\u002Fh3>\n\u003Cp>Die gefährlichsten Belegfehler sind oft keine erfundenen Quellen, sondern gültige Quellen, die außerhalb ihres Gültigkeitsbereichs verwendet werden. Eine Empfehlung kann sich je nach Softwareversion, Datum, Rechtsordnung, Hardware-Revision, Nutzerberechtigungen, Produktverfügbarkeit, aktuellem Spielzustand, Mandantenkonfiguration oder anderen Umgebungsvariablen ändern.\u003C\u002Fp>\n\u003Cp>Bewahren Sie für jede wesentliche Quelle die Bedingungen auf, die bestimmen, ob sie noch anwendbar ist. Dies ist besonders nach einer Zusammenfassung wichtig: Ein komprimiertes Gedächtnis oder Zitat behält möglicherweise die Schlussfolgerung bei, lässt jedoch die Ausnahme, das Datum oder die Voraussetzung weg, die die Schlussfolgerung überhaupt erst gültig gemacht haben.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Evidenz kann authentisch sein und dennoch falsch für die Antwort\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Eine echte Quelle, die korrekt zitiert wird, kann dennoch zu einer falschen Antwort führen, wenn deren Zeitpunkt, Version, Zielgruppe, Zuständigkeitsbereich oder Zustand nicht zur aktuellen Frage passen.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-20\">4. Evidenznutzung: Hat sich der Agent tatsächlich auf die Evidenz gestützt?\u003C\u002Fh3>\n\u003Cp>Eine Antwort kann korrekt sein, selbst wenn der Abruf fehlgeschlagen ist. Das Modell kennt die Antwort möglicherweise bereits, leitet sie aus unzusammenhängendem Kontext ab oder rät einfach richtig. Wenn die Evaluierung nur die finale Korrektheit prüft, wirkt das System möglicherweise fundiert, obwohl der Evidenzpfad unterbrochen ist.\u003C\u002Fp>\n\u003Cp>Um die Evidenznutzung zu bewerten, prüfen Sie den Trace. Stellen Sie fest, welche Quellen abgerufen wurden, welche Passagen den Kontext des Modells erreichten, wann sie verfügbar wurden und ob die endgültige Behauptung durch diese Eingaben erklärt werden kann. OpenAIs aktuelle Werkzeuge zur Agenten-Evaluierung betonen das Trace-Grading genau deshalb, weil sich das Verhalten auf Workflow-Ebene nicht verlässlich allein aus der finalen Antwort rekonstruieren lässt.\u003C\u002Fp>\n\u003Ch2 id=\"section-23\">Der Evidence Utilization Test\u003C\u002Fh2>\n\u003Cp>Eine praktische Evaluierung lässt sich als kontrolliertes Kontrafaktum aufbauen. Anstatt nur zu fragen, ob die Antwort korrekt ist, ändern Sie die Evidenz und beobachten Sie, ob sich die Behauptung in die erwartete Richtung verändert.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Evidence Utilization Test\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Eine wesentliche Behauptung auswählen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Wählen Sie eine Behauptung aus, deren Korrektheit von Bedeutung ist, und definieren Sie die erwartete Antwort präzise.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Gold-Standard-Evidenz identifizieren\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Stellen Sie den kleinsten maßgeblichen Evidenzsatz bereit, der ausreicht, um die Behauptung zu stützen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Mit Gold-Standard-Evidenz ausführen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Verifizieren Sie, dass der Agent die belegte Antwort liefert, wenn die korrekte Evidenz verfügbar ist.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Die entscheidende Evidenz entfernen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Führen Sie dieselbe Aufgabe ohne die zentrale stützende Passage aus, während die übrigen Eingaben unverändert bleiben.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Durch widersprüchliche oder ersetzende Evidenz austauschen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Sofern unbedenklich, stellen Sie kontrollierte Evidenz bereit, die die korrekte Schlussfolgerung verändert.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Die Behauptungen vergleichen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Prüfen Sie, ob die Antwort der Evidenzänderung folgt oder am Vorwissen des Modells verhaftet bleibt.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Den Trace untersuchen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Prüfen Sie, was abgerufen wurde, was in den Kontext gelangte und welche Quelle oder welches Tool-Ergebnis der Behauptung vorausging.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Das Schlüsselsignal\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Wenn sich die entscheidende Evidenz ändert, die Behauptung des Agenten jedoch nicht, haben Sie den Beleg dafür, dass das System den Abruf möglicherweise nicht wie vorgesehen nutzt – selbst wenn die ursprüngliche Antwort zufällig korrekt war.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-27\">Eine Behauptungs-Evidenz-Matrix ist nützlicher als eine Quellenliste\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Behauptung\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Evidenz\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Stützung\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Autorität\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Anwendbarkeit\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Im Trace verwendet\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Funktion X ist verfügbar\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Herstellerdokumentation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direkt\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Hoch für Verfügbarkeitsbehauptung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Aktuelle Version und Region müssen übereinstimmen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ja \u002F Nein\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Konfiguration Y ist schneller\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Hersteller-Benchmark\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Teilweise\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Hoch für Herstellertest, keine unabhängige Leistung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Hardware und Workload müssen übereinstimmen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ja \u002F Nein\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Richtlinie gilt für diesen Benutzer\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Aktuelle Richtlinie + Kontostatus\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Nur in Kombination direkt\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Hoch\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Zuständigkeitsbereich, Datum, Rolle und Kontostatus müssen übereinstimmen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ja \u002F Nein\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ein Produkt ist auf Lager\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Live-Bestands-API\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direkt\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Maßgeblich für aktuellen Bestand\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Verfällt schnell\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ja \u002F Nein\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Diese Matrix erzwingt mehrere Fragen, die eine herkömmliche Überprüfung von Zitaten verbirgt. Eine Behauptung kann mehrere Quellen erfordern. Eine Quelle kann nur einen Teil einer Behauptung stützen. Eine maßgebliche Quelle kann ein kurzes Gültigkeitsfenster haben. Und eine vollkommen gute Quelle kann irrelevant sein, wenn sie nie in den Ausführungspfad gelangt ist.\u003C\u002Fp>\n\u003Ch2 id=\"section-30\">Abrufqualität von Evidenzqualität trennen\u003C\u002Fh2>\n\u003Cp>Abrufmetriken fragen, ob relevantes Material gefunden und eingestuft wurde. Die Evidenzevaluierung fragt, ob dieses Material die resultierenden Behauptungen rechtfertigt. Beides hängt zusammen, ist aber nicht identisch.\u003C\u002Fp>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Abruferfolg ist kein Evidenzerfolg\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Situation\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Abruf\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Evidenzqualität\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Richtiges Dokument, falsche Behauptung\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Richtige Tatsache, veraltete Quelle\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Schwache Quelle, richtige Antwort\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Mehrere Quellen erforderlich\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-33\">Quellenqualität als Rubrik bewerten, nicht als Domain-Whitelist\u003C\u002Fh2>\n\u003Cp>Fest codierte Listen „vertrauenswürdiger Domains“ sind verlockend, aber oft fragil. Die Qualität von Quellen sollte stattdessen den Typ der Behauptung widerspiegeln. Nützliche Dimensionen umfassen Primär- versus Sekundärstatus, Aktualität, Direktheit, Reproduzierbarkeit, Unabhängigkeit, Fachkompetenz, Datenherkunft, Aktualisierungszyklus und die Frage, ob die Quelle einen Anreiz hat, die Behauptung zu übertreiben.\u003C\u002Fp>\n\u003Cp>Anthropics Leitfaden zur Evaluierung von Forschungsagenten hebt Prüfungen der Quellenqualität neben Fundierung und Abdeckung explizit hervor. Die praktische Umsetzung sollte daher sowohl bewerten, was die Quelle aussagt, als auch, ob diese Quelle für diese Art von Aussage angemessen ist.\u003C\u002Fp>\n\u003Ch2 id=\"section-36\">Evidenzabdeckung: Jede wichtige Behauptung benötigt Belege, nicht jeder Satz\u003C\u002Fh2>\n\u003Cp>Nicht jeder Satz erfordert einen Beleg. Übergangsformulierungen, Arithmetik, die transparent aus zitierten Werten abgeleitet ist, oder eindeutig gekennzeichnete Interpretationen benötigen möglicherweise keine separate Quelle. Aber jede wesentliche, extern überprüfbare Behauptung sollte ausreichend belegt sein, damit ein Prüfer nachvollziehen kann, warum der Agent diese Aussage treffen durfte.\u003C\u002Fp>\n\u003Cp>Die Belegabdeckung sollte daher nach der Relevanz der Behauptung gewichtet werden. Fehlende Belege für ein dekoratives Detail sind nicht gleichzusetzen mit fehlenden Belegen für einen Preis, eine Berechtigungsentscheidung, eine Sicherheitsanweisung, eine rechtliche Anforderung, eine Aussage zur technischen Kompatibilität oder eine Tatsache, die eine Empfehlung begründet.\u003C\u002Fp>\n\u003Ch2 id=\"section-39\">Die Provenienz von Belegen muss Zusammenfassungen und das Gedächtnis überdauern\u003C\u002Fh2>\n\u003Cp>Langlaufende Agenten fassen häufig frühere Arbeiten zusammen oder speichern dauerhafte Erinnerungen. Wenn bei dieser Transformation die Provenienz der Belege verloren geht, können zukünftige Agenten zwar eine saubere Schlussfolgerung abrufen, ohne jedoch zu wissen, ob diese aus einer Benutzeraussage, einer Live-API, einem alten Dokument, einer Modellinferenz oder einem unbestätigten Webergebnis stammt.\u003C\u002Fp>\n\u003Cp>Bei wichtigen Fakten sollten mindestens die Identität der Quelle, der Abruf- oder Beobachtungszeitpunkt, der Belegtyp, die relevante Version oder der Status sowie die Angabe erhalten bleiben, ob der gespeicherte Text zitiert, zusammengefasst, geschlussfolgert oder abgeleitet ist. Erst die Provenienz ermöglicht es einem späteren Agenten zu entscheiden, ob der Beleg vertrauenswürdig ist, aktualisiert, eingeschränkt oder verworfen werden sollte.\u003C\u002Fp>\n\u003Ch2 id=\"section-42\">Ein praxisorientierter Belegdatensatz\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Feld\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Zweck\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">claim_id\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Identifiziert die wesentliche Behauptung, die gestützt wird\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_id \u002F source_url \u002F system\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Identifiziert den Ursprung des Belegs\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">evidence_span\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Bewahrt die kleinste Textpassage, den Datensatz oder das Tool-Ergebnis auf, das die Behauptung stützt\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">retrieved_at \u002F observed_at\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ermöglicht Prüfungen auf Aktualität und zeitliche Einordnung\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_version \u002F object_version\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ermöglicht Prüfungen auf Überholtheit und Reproduzierbarkeit\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">authority_role\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Erklärt, warum diese Quelle für die Behauptung geeignet ist\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">applicability\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Speichert relevante Bedingungen wie Datum, Rechtsprechung, Produktversion, Benutzer, Mandant oder Status\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">transformation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kennzeichnet, ob der Beleg roh, zitiert, zusammengefasst, normalisiert oder abgeleitet ist\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">trace_step\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Zeigt an, wann der Beleg für den Agenten verfügbar wurde\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">support_status\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direkt, partiell, widersprüchlich, unbelegt oder unsicher\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-44\">Fehlermuster, die fundiert wirken, es aber nicht sind\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Fehlermuster\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Warum es Prüfer täuscht\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Was zu testen ist\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Dekorative Zitate\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die Antwort enthält Quellen und wirkt daher gut recherchiert\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Jede wesentliche Behauptung einer exakt stützenden Textpassage zuordnen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autoritätsdiskrepanz\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die Quelle ist seriös, aber für das spezifische Faktum nicht maßgeblich\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Anspruchsspezifische Quellenhierarchie definieren\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Zeitliche Diskrepanz\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die Quelle war zum Zeitpunkt der Veröffentlichung korrekt\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Abrufzeitpunkt, Quelldatum und neuere Belege prüfen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Verlust von Bedingungen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eine Zusammenfassung behält das Fazit bei, unterschlägt aber Ausnahmen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Generierte Behauptung mit dem vollständigen lokalen Kontext der Quelle vergleichen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Post-hoc-Zitierung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eine plausible Quelle wird erst nach der Generierung der Antwort angefügt\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Trace-Reihenfolge prüfen und verifizieren, ob der Beleg vor der Behauptung vorlag\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Parametrische Übersteuerung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Das Modell ignoriert abgerufene Belege und antwortet aus seinem Vorwissen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kontrafaktische Tests zur Evidenznutzung durchführen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Beleg-Geldwäsche\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modellinferenzen werden zusammengefasst und später als Primärquelle gespeichert\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Transformationstyp und Provenienz über Speicheroperationen hinweg beibehalten\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Quellen-Mehrheitsfehlschluss\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Mehrere Sekundärseiten wiederholen dieselbe unbelegte Aussage\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Behauptungen auf unabhängige oder primäre Belege zurückführen\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-46\">Wie der Agent im Produktivbetrieb evaluiert wird\u003C\u002Fh2>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Pipeline zur Belegevaluierung\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Wesentliche Behauptungen definieren\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Fakten, Empfehlungen oder Entscheidungen identifizieren, deren Richtigkeit für die Aufgabe entscheidend ist.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Gold-Standard-Belege erstellen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Referenzbelege und Qualitätsanforderungen an Quellen für repräsentative Anwendungsfälle definieren.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Traces erfassen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Suchabfragen, Tool-Aufrufe, zurückgegebene Belege, Kontextaufbau, Modellausgabe und Zitate protokollieren.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Belegstatus bewerten\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Prüfen, ob jede wesentliche Behauptung direkt, teilweise, widersprüchlich oder gar nicht gestützt wird.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Autorität und Anwendbarkeit prüfen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Beurteilen, ob die Quelle geeignet ist und ihre Bedingungen mit der aktuellen Aufgabe übereinstimmen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Kontrafaktische Tests durchführen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Entscheidende Belege entfernen, ersetzen oder überschreiben und testen, ob die Antwort der Änderung folgt.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Kritische Fehler manuell prüfen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Menschliche Prüfer oder Fachexperten hinzuziehen, wenn die automatische Bewertung nicht verlässlich genug ist.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Fehler in Eval-Fälle umwandeln\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Produktionsfehler und Randfälle in einen wiederholbaren Regressionsdatensatz überführen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>Die aktuellen Evaluierungsleitlinien von OpenAI empfehlen aufgabenspezifische Evals, kontinuierliche Evaluierung, aus dem Produktivbetrieb abgeleitete Datensätze sowie Traces zum Debuggen des Agentenverhaltens. Auch Anthropic empfiehlt für Research-Agenten die Kombination mehrerer Bewertungsansätze, da Korrektheit, Quellenqualität, Abdeckung und Faktentreue getrennte Dimensionen darstellen. Die Belegevaluierung sollte demselben Muster folgen: Mehrere eng gefasste Evaluatoren liefern mehr Erkenntnisse als ein einzelner, undurchsichtiger Qualitätswert.\u003C\u002Fp>\n\u003Ch2 id=\"section-49\">Ein LLM-Judge darf nicht die einzige Bewertungsinstanz sein\u003C\u002Fh2>\n\u003Cp>LLM-Evaluatoren sind nützlich für die skalierbare Klassifizierung von Behauptungen, Relevanzprüfungen und paarweise Vergleiche. Sie können jedoch dieselben toten Winkel aufweisen wie das System, das sie bewerten. Ein Evaluator akzeptiert möglicherweise eine plausible, aber unbelegte Behauptung, übersieht feine Versionsunterschiede oder bewertet eine gut formulierte Quelle zu positiv.\u003C\u002Fp>\n\u003Cp>Die Evaluierungsrichtlinien von OpenAI empfehlen, automatisierte Evaluatoren anhand menschlicher Urteile zu kalibrieren und klare, abgegrenzte Kriterien zu verwenden. Bei belegintensiven Systemen sollten nach Möglichkeit deterministische Prüfungen eingesetzt werden: Zeitstempel, Objektversionen, Berechtigungsbereiche, exakte Quellen-IDs, Abrufreihenfolge, Dokumenten-Hashes und die Prüfung, ob der Beleg bereits vorlag, bevor das Modell die Behauptung generiert hat.\u003C\u002Fp>\n\u003Ch2 id=\"section-52\">Was würde diese Antwort verändern?\u003C\u002Fh2>\n\u003Cp>Die Evaluierung kann einfacher gestaltet werden, wenn der Agent auf einem kleinen, unveränderlichen und maßgeblichen Korpus arbeitet und jede Antwort rein extraktiv ist. In einer solchen Umgebung sind die Autorität und Anwendbarkeit der Quellen weitgehend festgelegt, sodass der Belegabgleich auf Satzebene ausreichen kann.\u003C\u002Fp>\n\u003Cp>Die Evaluierung muss strenger werden, sobald der Agent Websuchen, Langzeitgedächtnis, Live-Tools, mehrere Rechtsordnungen, sich schnell ändernde Informationen, nutzerspezifische Zustände oder autonome Aktionen miteinander kombiniert. In solchen Systemen hängt die Gültigkeit von Belegen nicht nur vom Quelltext ab, sondern auch davon, wann und wie der Beleg beschafft wurde.\u003C\u002Fp>\n\u003Cp>Zukünftige Modelle werden Herkunft und Unsicherheit intern möglicherweise besser nachverfolgen können, doch das beseitigt in Systemen, die Prüfbarkeit erfordern, nicht den Bedarf an externen Evidenzaufzeichnungen. Ein System sollte sich nicht auf die Selbsteinschätzung des Modells darüber verlassen, was es beeinflusst hat, wenn Traces und Quellmetadaten stichhaltigere Belege liefern können.\u003C\u002Fp>\n\u003Ch2 id=\"section-56\">Einschränkungen\u003C\u002Fh2>\n\u003Cp>Es ist nicht immer möglich, die kausale Nutzung von Belegen allein aus Traces nachzuweisen. Eine Quelle kann im Kontext vorhanden sein, ohne die Antwort zu beeinflussen, und ein Modell kennt dieselbe Tatsache möglicherweise unabhängig davon. Kontrafaktische Tests stärken die Schlussfolgerung, können jedoch selbst die Aufgabenverteilung verändern.\u003C\u002Fp>\n\u003Cp>Auch die Autorität von Quellen kann umstritten oder domänenabhängig sein. Manche Fragen haben keine einzelne maßgebliche Quelle, und Fachleute sind sich möglicherweise uneins darüber, welche Evidenz mehr Gewicht verdient. In diesen Fällen sollte die Evaluation die Uneinigkeit abbilden und Transparenz, Abdeckung sowie Argumentation anhand eines expliziten Schemas bewerten, anstatt vorzutäuschen, dass es eine einzige unumstößliche Wahrheitsquelle gäbe.\u003C\u002Fp>\n\u003Ch2 id=\"section-59\">Fazit\u003C\u002Fh2>\n\u003Cp>Die Frage „Hat der Agent eine Quelle zitiert?“ ist für den Produktiveinsatz von KI zu schwach. Die weitaus entscheidendere Frage lautet: Stammt jede wesentliche Behauptung aus einer Evidenz, die sie tatsächlich stützt, die erforderliche Autorität besitzt, für die aktuellen Rahmenbedingungen noch gültig ist und im Ausführungspfad verfügbar war, bevor die Behauptung aufgestellt wurde?\u003C\u002Fp>\n\u003Cp>Damit wird Evidenz vom bloßen Beiwerk zu einer überprüfbaren Systemeigenschaft. Erfassen Sie den Trace. Ordnen Sie Behauptungen Belegen zu. Überprüfen Sie Autorität und Anwendbarkeit. Führen Sie kontrafaktische Evidenztests durch. Bewahren Sie die Herkunft über Zusammenfassungen und das Gedächtnis hinweg. Dann ist eine korrekte Antwort nicht nur plausibel — sie besitzt einen nachvollziehbaren Evidenzpfad.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Zuverlässigkeit von KI-Agenten: Warum die finale Antwort nicht ausreicht\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Die Korrektheit des Ergebnisses allein kann nicht beweisen, dass der Ausführungspfad eines Agenten sicher oder zuverlässig war. Dieser weiterführende Artikel erläutert, warum Trajektorien, Tools und Zwischenentscheidungen wichtig sind.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Den verwandten Artikel lesen →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Vom Forschungsprotokoll zum allgemeinen KI-Reasoning-Framework\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Eine praktische Reasoning-Methode zur Trennung von Belegen, Annahmen, konkurrierenden Hypothesen und domänenspezifischer Validierung.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Das Reasoning-Framework lesen →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-64\">FAQ\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Evaluierung der Evidenznutzung bei KI-Agenten\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Beweist ein Zitat, dass eine KI-Antwort fundiert ist?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nein. Ein Zitat kann zwar für das Thema relevant sein, ohne jedoch die konkrete Behauptung zu stützen, es kann von der falschen Autorität stammen, nicht mehr gültig sein oder angehängt worden sein, ohne die generierte Antwort maßgeblich beeinflusst zu haben.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Wie kann ich testen, ob ein KI-Agent abgerufene Belege tatsächlich genutzt hat?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Verwenden Sie einen kontrafaktischen Evidenznutzungstest: Führen Sie die Aufgabe mit bekanntermaßen korrekter Evidenz aus, und entfernen oder ersetzen Sie anschließend die entscheidende Evidenz, während alle anderen Eingaben unverändert bleiben. Reagiert die Antwort nicht auf die Änderung der Evidenz, prüfen Sie, ob sich das Modell auf Vorwissen oder eine andere Quelle stützt.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Was ist der Unterschied zwischen Fundierung (Groundedness) und Quellenqualität?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Die Fundierung prüft, ob Behauptungen durch die bereitgestellten Belege gestützt werden. Die Quellenqualität hinterfragt, ob die Evidenz selbst für die Art der aufgestellten Behauptung angemessen und autoritativ genug ist.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Warum kann eine echte Quelle dennoch zu einer falschen KI-Antwort führen?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Die Quelle kann veraltet oder überholt sein, für eine andere Version, Rechtsprechung, Benutzergruppe, Population oder einen anderen Systemstatus gelten oder Bedingungen enthalten, die beim Abruf oder Zusammenfassen verloren gegangen sind.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Was sollte ich für die Evidenzevaluierung protokollieren?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Protokollieren Sie die Suchanfrage, zurückgegebene Quellen, genaue Evidenzauszüge, Zeitstempel und Versionen, Filter, den finalen Kontext, Modellausgaben, Zitate und die Reihenfolge im Trace, damit Evaluatoren rekonstruieren können, welche Belege vor jeder wesentlichen Behauptung verfügbar waren.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-66\">Glossar\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Wichtige Begriffe zur Evidenzevaluierung\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"claim-support\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Behauptungsstützung (Claim support)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Der Grad, in dem ein bestimmter Evidenzauszug eine generierte Behauptung direkt belegt.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-authority\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Evidenzautorität (Evidence authority)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Wie angemessen eine Quelle ist, um eine bestimmte Art von Behauptung zu stützen, basierend auf ihrer Rolle, Herkunft und Beziehung zur zugrunde liegenden Tatsache.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"applicability\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Anwendbarkeit (Applicability)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Die Bedingungen, unter denen Belege für eine Behauptung gültig bleiben, einschließlich Zeit, Version, Rechtsraum, Benutzer, Population, Systemzustand oder anderer Grenzen.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-utilization\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Evidenznutzung (Evidence utilization)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Ob die Ausgabe des Agenten tatsächlich auf die in seinem Ausführungspfad bereitgestellte Evidenz reagiert und von ihr abhängt.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"counterfactual-evidence-test\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Kontrafaktischer Evidenztest (Counterfactual evidence test)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Eine Evaluierung, bei der entscheidende Belege entfernt, ersetzt oder geändert werden, um zu prüfen, ob sich die Behauptung des Agenten entsprechend anpasst.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"provenance\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Herkunft (Provenance)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Metadaten, die festhalten, woher Belege stammen, wann sie erfasst wurden, wie sie transformiert wurden und welche Version oder welchen Zustand sie repräsentieren.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-68\">Primärquellen und weiterführende Literatur\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Evaluate Agent Workflows\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Leitfaden zu Trace-Bewertungen, Workflows auf Systemebene, Datensätzen und wiederholbaren Evaluierungsläufen für Agenten.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Evaluation Best Practices\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Leitfaden zu aufgabenspezifischen Evals, produktionsnahen Datensätzen, abgegrenzten Metriken, kontinuierlicher Evaluierung und Kalibrierung von Prüfinstanzen.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Anthropic — Demystifying Evals for AI Agents\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Leitfaden zur Agenten-Evaluierung einschließlich Prüfungen von Fundierung, Abdeckung und Quellenqualität für Recherche-Agenten.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Evaluierungsleitfaden, der hervorhebt, dass die Leistung moderner Agenten von Workflow und Umgebung abhängt, nicht nur von der finalen Modellausgabe.\u003C\u002Fp>\u003C\u002Fa>",{"time":211,"blocks":212,"version":853},1790368069610,[213,221,227,235,242,247,252,257,262,288,293,298,303,308,313,318,323,328,333,340,345,350,355,360,365,394,401,406,441,446,451,456,490,495,500,505,510,515,520,525,530,535,540,578,583,624,629,659,664,669,674,679,684,689,694,699,704,709,714,719,724,729,738,746,751,777,782,811,816,826,835,844],{"id":214,"data":215,"type":219,"tunes":220},"0hk9UtwqZf",{"title":216,"maxLevel":217,"minLevel":218},"Inhalt",3,2,"tableOfContents",{},{"id":222,"data":223,"type":225,"tunes":226},"intro",{"text":224},"Ein KI-Agent kann Quellen zitieren, Dokumente abrufen und dennoch die falschen Belege verwenden. Eine Quelle kann maßgeblich sein, aber für die konkrete Behauptung irrelevant. Ein abgerufener Textabschnitt stützt möglicherweise nur einen Teil einer Antwort. Eine korrekte Quelle kann veraltet oder abgelöst sein oder für die falsche Rechtsordnung, Produktversion, Nutzergruppe oder den falschen Systemzustand gelten. Daraus ergibt sich ein schwierigeres Evaluierungsproblem als eine einfache Quellenprüfung: Hat der Agent tatsächlich die richtigen Belege für die von ihm aufgestellte Behauptung verwendet?","paragraph",{},{"id":228,"data":229,"type":233,"tunes":234},"direct",{"body":230,"title":231,"variant":232},"Um zu wissen, ob ein KI-Agent die richtigen Belege verwendet hat, evaluieren Sie die Kette \u003Cstrong>Behauptung → Beleg → Anwendbarkeit → Nutzung\u003C\u002Fstrong>. Überprüfen Sie für jede wesentliche Behauptung, ob der Beleg sie direkt stützt, aus einer geeigneten Autorität stammt, für die aktuellen Bedingungen gilt und dem Agenten tatsächlich zur Verfügung stand, bevor die Behauptung generiert wurde. Eine Quellenangabe allein beweist nichts davon.","Direkte Antwort","info","callout",{},{"id":236,"data":237,"type":233,"tunes":241},"method-note",{"body":238,"title":239,"variant":240},"Das Modell „Behauptung–Beleg–Anwendbarkeit–Nutzung“ und der Evidence Utilization Test in diesem Artikel sind praktische Evaluierungsmethoden, keine formalen Branchenstandards. Sie bauen auf etablierten Konzepten wie Groundedness, Quellenqualität, Zitationsabdeckung, Trace-Evaluierung und aufgabenspezifischen Evals auf.","Über die Methode","note",{},{"id":243,"data":244,"type":41,"tunes":246},"h-citations",{"text":245,"level":218},"Warum Zitate nicht ausreichen",{},{"id":248,"data":249,"type":225,"tunes":251},"p-citations-1",{"text":250},"Ein Zitat beantwortet nur eine eng begrenzte Frage: Das System hat eine Behauptung oder Antwort mit einer Quelle verknüpft. Es belegt nicht automatisch, dass die Quelle die spezifische Behauptung stützt, dass die Quelle für die Aufgabe maßgeblich genug ist, dass der zitierte Abschnitt die notwendige Bedingung oder Ausnahme enthält oder dass das Modell sich auf diesen Beleg gestützt hat, anstatt die Antwort aus vorherigem Modellwissen zu generieren.",{},{"id":253,"data":254,"type":225,"tunes":256},"p-citations-2",{"text":255},"Anthropics Leitfaden zur Evaluierung von Recherche-Agenten trennt explizit zwischen Groundedness, Abdeckung und Quellenqualität. Auch OpenAIs Leitfaden zur Agenten-Evaluierung betont Ausführungsspuren (Traces), da ein Endergebnis nicht offenbart, ob der Agent die richtigen Tools ausgewählt oder den beabsichtigten Workflow befolgt hat. Diese Überlegungen weisen auf eine allgemeinere Schlussfolgerung hin: Belegqualität ist eine Eigenschaft des Ausführungspfads, nicht nur des finalen Textes.",{},{"id":258,"data":259,"type":41,"tunes":261},"h-four",{"text":260,"level":218},"Die vier Fragen, die jede wesentliche Behauptung bestehen sollte",{},{"id":263,"data":264,"type":286,"tunes":287},"table-four",{"content":265,"stretched":42,"withHeadings":13},[266,270,274,278,282],[267,268,269],"Dimension","Frage","Typischer Fehler",[271,272,273],"Stützung der Behauptung","Stützt der Beleg diese exakte Behauptung direkt?","Die Quelle ist thematisch verwandt, begründet die Aussage jedoch nicht",[275,276,277],"Autorität des Belegs","Ist dies eine geeignete Quelle für diese Art von Behauptung?","Eine sekundäre Zusammenfassung wird verwendet, wo eine Primärquelle oder ein Live-System erforderlich ist",[279,280,281],"Anwendbarkeit","Gilt der Beleg für diesen Zeitpunkt, diese Version, diese Rechtsordnung, diesen Nutzer, diesen Zustand oder diese Population?","Eine wahre Aussage wird außerhalb ihrer gültigen Bedingungen angewendet",[283,284,285],"Nutzung des Belegs","War dieser Beleg tatsächlich verfügbar und wurde er im Ausführungspfad des Agenten genutzt?","Die finale Antwort ist korrekt, aber der abgerufene Beleg war irrelevant oder ungenutzt","table",{},{"id":289,"data":290,"type":41,"tunes":292},"h-support",{"text":291,"level":217},"1. Stützung der Behauptung: Begründet die Quelle das, was der Agent aussagt?",{},{"id":294,"data":295,"type":225,"tunes":297},"p-support-1",{"text":296},"Belege sollten auf Behauptungsebene evaluiert werden. Ein Dokument kann für das Thema relevant sein und dennoch eine spezifische Aussage nicht stützen. Wenn eine Quelle besagt, dass eine Funktion in ausgewählten Regionen verfügbar ist, ist die Antwort „die Funktion ist weltweit verfügbar“ nicht belegt, auch wenn das Zitat plausibel wirkt.",{},{"id":299,"data":300,"type":225,"tunes":302},"p-support-2",{"text":301},"Hier sind pauschale Urteile wie „fundiert \u002F nicht fundiert“ oft zu grob. Teilen Sie die Antwort in wesentliche Behauptungen auf, ordnen Sie jede Behauptung dem kleinsten Belegabschnitt zu, der sie stützt, und klassifizieren Sie die Beziehung: direkte Stützung, teilweise Stützung, Widerspruch oder keine Stützung.",{},{"id":304,"data":305,"type":41,"tunes":307},"h-authority",{"text":306,"level":217},"2. Autorität des Belegs: Ist dies die richtige Art von Quelle?",{},{"id":309,"data":310,"type":225,"tunes":312},"p-authority-1",{"text":311},"Die korrekte Auswahl von Belegen beschränkt sich nicht nur auf semantische Relevanz. Die Quelle muss für die Entscheidung geeignet sein. Ein aktueller Kontostatus sollte aus dem Kontosystem stammen, nicht aus einer alten E-Mail. Eine Behauptung zum API-Verhalten sollte vorzugsweise anhand der aktuellen Dokumentation des Anbieters oder reproduzierbarem Verhalten überprüft werden. Eine rechtliche Anforderung erfordert möglicherweise das anwendbare Gesetz, die Regulierungsbehörde oder maßgebliche Richtlinien anstelle eines allgemeinen Blogbeitrags.",{},{"id":314,"data":315,"type":225,"tunes":317},"p-authority-2",{"text":316},"Die Quellenautorität ist aufgabenspezifisch. Ein Community-Bericht kann der beste Beleg für einen realen Fehler sein, den die Dokumentation des Anbieters nicht erwähnt. Eine Ankündigung des Anbieters kann maßgeblich dafür sein, was der Anbieter behauptet, aber ein schwacher Beleg für die unabhängige Leistung. Die evaluierende Person benötigt daher eine explizite Quellenhierarchie für die jeweilige Aufgabe anstelle eines universellen Autoritätswerts.",{},{"id":319,"data":320,"type":41,"tunes":322},"h-applicability",{"text":321,"level":217},"3. Anwendbarkeit: Richtiger Beleg, falsche Bedingungen",{},{"id":324,"data":325,"type":225,"tunes":327},"p-apply-1",{"text":326},"Die gefährlichsten Belegfehler sind oft keine erfundenen Quellen, sondern gültige Quellen, die außerhalb ihres Gültigkeitsbereichs verwendet werden. Eine Empfehlung kann sich je nach Softwareversion, Datum, Rechtsordnung, Hardware-Revision, Nutzerberechtigungen, Produktverfügbarkeit, aktuellem Spielzustand, Mandantenkonfiguration oder anderen Umgebungsvariablen ändern.",{},{"id":329,"data":330,"type":225,"tunes":332},"p-apply-2",{"text":331},"Bewahren Sie für jede wesentliche Quelle die Bedingungen auf, die bestimmen, ob sie noch anwendbar ist. Dies ist besonders nach einer Zusammenfassung wichtig: Ein komprimiertes Gedächtnis oder Zitat behält möglicherweise die Schlussfolgerung bei, lässt jedoch die Ausnahme, das Datum oder die Voraussetzung weg, die die Schlussfolgerung überhaupt erst gültig gemacht haben.",{},{"id":334,"data":335,"type":233,"tunes":339},"apply-warning",{"body":336,"title":337,"variant":338},"Eine echte Quelle, die korrekt zitiert wird, kann dennoch zu einer falschen Antwort führen, wenn deren Zeitpunkt, Version, Zielgruppe, Zuständigkeitsbereich oder Zustand nicht zur aktuellen Frage passen.","Evidenz kann authentisch sein und dennoch falsch für die Antwort","warning",{},{"id":341,"data":342,"type":41,"tunes":344},"h-use",{"text":343,"level":217},"4. Evidenznutzung: Hat sich der Agent tatsächlich auf die Evidenz gestützt?",{},{"id":346,"data":347,"type":225,"tunes":349},"p-use-1",{"text":348},"Eine Antwort kann korrekt sein, selbst wenn der Abruf fehlgeschlagen ist. Das Modell kennt die Antwort möglicherweise bereits, leitet sie aus unzusammenhängendem Kontext ab oder rät einfach richtig. Wenn die Evaluierung nur die finale Korrektheit prüft, wirkt das System möglicherweise fundiert, obwohl der Evidenzpfad unterbrochen ist.",{},{"id":351,"data":352,"type":225,"tunes":354},"p-use-2",{"text":353},"Um die Evidenznutzung zu bewerten, prüfen Sie den Trace. Stellen Sie fest, welche Quellen abgerufen wurden, welche Passagen den Kontext des Modells erreichten, wann sie verfügbar wurden und ob die endgültige Behauptung durch diese Eingaben erklärt werden kann. OpenAIs aktuelle Werkzeuge zur Agenten-Evaluierung betonen das Trace-Grading genau deshalb, weil sich das Verhalten auf Workflow-Ebene nicht verlässlich allein aus der finalen Antwort rekonstruieren lässt.",{},{"id":356,"data":357,"type":41,"tunes":359},"h-eut",{"text":358,"level":218},"Der Evidence Utilization Test",{},{"id":361,"data":362,"type":225,"tunes":364},"p-eut-intro",{"text":363},"Eine praktische Evaluierung lässt sich als kontrolliertes Kontrafaktum aufbauen. Anstatt nur zu fragen, ob die Antwort korrekt ist, ändern Sie die Evidenz und beobachten Sie, ob sich die Behauptung in die erwartete Richtung verändert.",{},{"id":366,"data":367,"type":392,"tunes":393},"eut-flow",{"steps":368,"title":390,"orientation":391},[369,372,375,378,381,384,387],{"label":370,"description":371},"1. Eine wesentliche Behauptung auswählen","Wählen Sie eine Behauptung aus, deren Korrektheit von Bedeutung ist, und definieren Sie die erwartete Antwort präzise.",{"label":373,"description":374},"2. Gold-Standard-Evidenz identifizieren","Stellen Sie den kleinsten maßgeblichen Evidenzsatz bereit, der ausreicht, um die Behauptung zu stützen.",{"label":376,"description":377},"3. Mit Gold-Standard-Evidenz ausführen","Verifizieren Sie, dass der Agent die belegte Antwort liefert, wenn die korrekte Evidenz verfügbar ist.",{"label":379,"description":380},"4. Die entscheidende Evidenz entfernen","Führen Sie dieselbe Aufgabe ohne die zentrale stützende Passage aus, während die übrigen Eingaben unverändert bleiben.",{"label":382,"description":383},"5. Durch widersprüchliche oder ersetzende Evidenz austauschen","Sofern unbedenklich, stellen Sie kontrollierte Evidenz bereit, die die korrekte Schlussfolgerung verändert.",{"label":385,"description":386},"6. Die Behauptungen vergleichen","Prüfen Sie, ob die Antwort der Evidenzänderung folgt oder am Vorwissen des Modells verhaftet bleibt.",{"label":388,"description":389},"7. Den Trace untersuchen","Prüfen Sie, was abgerufen wurde, was in den Kontext gelangte und welche Quelle oder welches Tool-Ergebnis der Behauptung vorausging.","Evidence Utilization Test","auto","processFlow",{},{"id":395,"data":396,"type":233,"tunes":400},"eut-tip",{"body":397,"title":398,"variant":399},"Wenn sich die entscheidende Evidenz ändert, die Behauptung des Agenten jedoch nicht, haben Sie den Beleg dafür, dass das System den Abruf möglicherweise nicht wie vorgesehen nutzt – selbst wenn die ursprüngliche Antwort zufällig korrekt war.","Das Schlüsselsignal","tip",{},{"id":402,"data":403,"type":41,"tunes":405},"h-matrix",{"text":404,"level":218},"Eine Behauptungs-Evidenz-Matrix ist nützlicher als eine Quellenliste",{},{"id":407,"data":408,"type":286,"tunes":440},"claim-matrix",{"content":409,"stretched":42,"withHeadings":13},[410,416,423,429,435],[411,412,413,414,279,415],"Behauptung","Evidenz","Stützung","Autorität","Im Trace verwendet",[417,418,419,420,421,422],"Funktion X ist verfügbar","Herstellerdokumentation","Direkt","Hoch für Verfügbarkeitsbehauptung","Aktuelle Version und Region müssen übereinstimmen","Ja \u002F Nein",[424,425,426,427,428,422],"Konfiguration Y ist schneller","Hersteller-Benchmark","Teilweise","Hoch für Herstellertest, keine unabhängige Leistung","Hardware und Workload müssen übereinstimmen",[430,431,432,433,434,422],"Richtlinie gilt für diesen Benutzer","Aktuelle Richtlinie + Kontostatus","Nur in Kombination direkt","Hoch","Zuständigkeitsbereich, Datum, Rolle und Kontostatus müssen übereinstimmen",[436,437,419,438,439,422],"Ein Produkt ist auf Lager","Live-Bestands-API","Maßgeblich für aktuellen Bestand","Verfällt schnell",{},{"id":442,"data":443,"type":225,"tunes":445},"p-matrix-1",{"text":444},"Diese Matrix erzwingt mehrere Fragen, die eine herkömmliche Überprüfung von Zitaten verbirgt. Eine Behauptung kann mehrere Quellen erfordern. Eine Quelle kann nur einen Teil einer Behauptung stützen. Eine maßgebliche Quelle kann ein kurzes Gültigkeitsfenster haben. Und eine vollkommen gute Quelle kann irrelevant sein, wenn sie nie in den Ausführungspfad gelangt ist.",{},{"id":447,"data":448,"type":41,"tunes":450},"h-retrieval-evidence",{"text":449,"level":218},"Abrufqualität von Evidenzqualität trennen",{},{"id":452,"data":453,"type":225,"tunes":455},"p-re-1",{"text":454},"Abrufmetriken fragen, ob relevantes Material gefunden und eingestuft wurde. Die Evidenzevaluierung fragt, ob dieses Material die resultierenden Behauptungen rechtfertigt. Beides hängt zusammen, ist aber nicht identisch.",{},{"id":457,"data":458,"type":488,"tunes":489},"retrieval-comparison",{"rows":459,"title":477,"layout":286,"columns":478},[460,465,469,473],{"id":461,"label":462,"values":463},"a","Richtiges Dokument, falsche Behauptung",[464,464,464],"",{"id":466,"label":467,"values":468},"b","Richtige Tatsache, veraltete Quelle",[464,464,464],{"id":470,"label":471,"values":472},"c","Schwache Quelle, richtige Antwort",[464,464,464],{"id":474,"label":475,"values":476},"d","Mehrere Quellen erforderlich",[464,464,464],"Abruferfolg ist kein Evidenzerfolg",[479,482,485],{"id":480,"label":481},"situation","Situation",{"id":483,"label":484},"retrieval","Abruf",{"id":486,"label":487},"evidence","Evidenzqualität","comparison",{},{"id":491,"data":492,"type":41,"tunes":494},"h-source-quality",{"text":493,"level":218},"Quellenqualität als Rubrik bewerten, nicht als Domain-Whitelist",{},{"id":496,"data":497,"type":225,"tunes":499},"p-source-quality-1",{"text":498},"Fest codierte Listen „vertrauenswürdiger Domains“ sind verlockend, aber oft fragil. Die Qualität von Quellen sollte stattdessen den Typ der Behauptung widerspiegeln. Nützliche Dimensionen umfassen Primär- versus Sekundärstatus, Aktualität, Direktheit, Reproduzierbarkeit, Unabhängigkeit, Fachkompetenz, Datenherkunft, Aktualisierungszyklus und die Frage, ob die Quelle einen Anreiz hat, die Behauptung zu übertreiben.",{},{"id":501,"data":502,"type":225,"tunes":504},"p-source-quality-2",{"text":503},"Anthropics Leitfaden zur Evaluierung von Forschungsagenten hebt Prüfungen der Quellenqualität neben Fundierung und Abdeckung explizit hervor. Die praktische Umsetzung sollte daher sowohl bewerten, was die Quelle aussagt, als auch, ob diese Quelle für diese Art von Aussage angemessen ist.",{},{"id":506,"data":507,"type":41,"tunes":509},"h-coverage",{"text":508,"level":218},"Evidenzabdeckung: Jede wichtige Behauptung benötigt Belege, nicht jeder Satz",{},{"id":511,"data":512,"type":225,"tunes":514},"p-coverage-1",{"text":513},"Nicht jeder Satz erfordert einen Beleg. Übergangsformulierungen, Arithmetik, die transparent aus zitierten Werten abgeleitet ist, oder eindeutig gekennzeichnete Interpretationen benötigen möglicherweise keine separate Quelle. Aber jede wesentliche, extern überprüfbare Behauptung sollte ausreichend belegt sein, damit ein Prüfer nachvollziehen kann, warum der Agent diese Aussage treffen durfte.",{},{"id":516,"data":517,"type":225,"tunes":519},"p-coverage-2",{"text":518},"Die Belegabdeckung sollte daher nach der Relevanz der Behauptung gewichtet werden. Fehlende Belege für ein dekoratives Detail sind nicht gleichzusetzen mit fehlenden Belegen für einen Preis, eine Berechtigungsentscheidung, eine Sicherheitsanweisung, eine rechtliche Anforderung, eine Aussage zur technischen Kompatibilität oder eine Tatsache, die eine Empfehlung begründet.",{},{"id":521,"data":522,"type":41,"tunes":524},"h-provenance",{"text":523,"level":218},"Die Provenienz von Belegen muss Zusammenfassungen und das Gedächtnis überdauern",{},{"id":526,"data":527,"type":225,"tunes":529},"p-prov-1",{"text":528},"Langlaufende Agenten fassen häufig frühere Arbeiten zusammen oder speichern dauerhafte Erinnerungen. Wenn bei dieser Transformation die Provenienz der Belege verloren geht, können zukünftige Agenten zwar eine saubere Schlussfolgerung abrufen, ohne jedoch zu wissen, ob diese aus einer Benutzeraussage, einer Live-API, einem alten Dokument, einer Modellinferenz oder einem unbestätigten Webergebnis stammt.",{},{"id":531,"data":532,"type":225,"tunes":534},"p-prov-2",{"text":533},"Bei wichtigen Fakten sollten mindestens die Identität der Quelle, der Abruf- oder Beobachtungszeitpunkt, der Belegtyp, die relevante Version oder der Status sowie die Angabe erhalten bleiben, ob der gespeicherte Text zitiert, zusammengefasst, geschlussfolgert oder abgeleitet ist. Erst die Provenienz ermöglicht es einem späteren Agenten zu entscheiden, ob der Beleg vertrauenswürdig ist, aktualisiert, eingeschränkt oder verworfen werden sollte.",{},{"id":536,"data":537,"type":41,"tunes":539},"h-record",{"text":538,"level":218},"Ein praxisorientierter Belegdatensatz",{},{"id":541,"data":542,"type":286,"tunes":577},"evidence-record",{"content":543,"stretched":42,"withHeadings":13},[544,547,550,553,556,559,562,565,568,571,574],[545,546],"Feld","Zweck",[548,549],"claim_id","Identifiziert die wesentliche Behauptung, die gestützt wird",[551,552],"source_id \u002F source_url \u002F system","Identifiziert den Ursprung des Belegs",[554,555],"evidence_span","Bewahrt die kleinste Textpassage, den Datensatz oder das Tool-Ergebnis auf, das die Behauptung stützt",[557,558],"retrieved_at \u002F observed_at","Ermöglicht Prüfungen auf Aktualität und zeitliche Einordnung",[560,561],"source_version \u002F object_version","Ermöglicht Prüfungen auf Überholtheit und Reproduzierbarkeit",[563,564],"authority_role","Erklärt, warum diese Quelle für die Behauptung geeignet ist",[566,567],"applicability","Speichert relevante Bedingungen wie Datum, Rechtsprechung, Produktversion, Benutzer, Mandant oder Status",[569,570],"transformation","Kennzeichnet, ob der Beleg roh, zitiert, zusammengefasst, normalisiert oder abgeleitet ist",[572,573],"trace_step","Zeigt an, wann der Beleg für den Agenten verfügbar wurde",[575,576],"support_status","Direkt, partiell, widersprüchlich, unbelegt oder unsicher",{},{"id":579,"data":580,"type":41,"tunes":582},"h-failures",{"text":581,"level":218},"Fehlermuster, die fundiert wirken, es aber nicht sind",{},{"id":584,"data":585,"type":286,"tunes":623},"failure-table",{"content":586,"stretched":42,"withHeadings":13},[587,591,595,599,603,607,611,615,619],[588,589,590],"Fehlermuster","Warum es Prüfer täuscht","Was zu testen ist",[592,593,594],"Dekorative Zitate","Die Antwort enthält Quellen und wirkt daher gut recherchiert","Jede wesentliche Behauptung einer exakt stützenden Textpassage zuordnen",[596,597,598],"Autoritätsdiskrepanz","Die Quelle ist seriös, aber für das spezifische Faktum nicht maßgeblich","Anspruchsspezifische Quellenhierarchie definieren",[600,601,602],"Zeitliche Diskrepanz","Die Quelle war zum Zeitpunkt der Veröffentlichung korrekt","Abrufzeitpunkt, Quelldatum und neuere Belege prüfen",[604,605,606],"Verlust von Bedingungen","Eine Zusammenfassung behält das Fazit bei, unterschlägt aber Ausnahmen","Generierte Behauptung mit dem vollständigen lokalen Kontext der Quelle vergleichen",[608,609,610],"Post-hoc-Zitierung","Eine plausible Quelle wird erst nach der Generierung der Antwort angefügt","Trace-Reihenfolge prüfen und verifizieren, ob der Beleg vor der Behauptung vorlag",[612,613,614],"Parametrische Übersteuerung","Das Modell ignoriert abgerufene Belege und antwortet aus seinem Vorwissen","Kontrafaktische Tests zur Evidenznutzung durchführen",[616,617,618],"Beleg-Geldwäsche","Modellinferenzen werden zusammengefasst und später als Primärquelle gespeichert","Transformationstyp und Provenienz über Speicheroperationen hinweg beibehalten",[620,621,622],"Quellen-Mehrheitsfehlschluss","Mehrere Sekundärseiten wiederholen dieselbe unbelegte Aussage","Behauptungen auf unabhängige oder primäre Belege zurückführen",{},{"id":625,"data":626,"type":41,"tunes":628},"h-production",{"text":627,"level":218},"Wie der Agent im Produktivbetrieb evaluiert wird",{},{"id":630,"data":631,"type":392,"tunes":658},"production-flow",{"steps":632,"title":657,"orientation":391},[633,636,639,642,645,648,651,654],{"label":634,"description":635},"1. Wesentliche Behauptungen definieren","Fakten, Empfehlungen oder Entscheidungen identifizieren, deren Richtigkeit für die Aufgabe entscheidend ist.",{"label":637,"description":638},"2. Gold-Standard-Belege erstellen","Referenzbelege und Qualitätsanforderungen an Quellen für repräsentative Anwendungsfälle definieren.",{"label":640,"description":641},"3. Traces erfassen","Suchabfragen, Tool-Aufrufe, zurückgegebene Belege, Kontextaufbau, Modellausgabe und Zitate protokollieren.",{"label":643,"description":644},"4. Belegstatus bewerten","Prüfen, ob jede wesentliche Behauptung direkt, teilweise, widersprüchlich oder gar nicht gestützt wird.",{"label":646,"description":647},"5. Autorität und Anwendbarkeit prüfen","Beurteilen, ob die Quelle geeignet ist und ihre Bedingungen mit der aktuellen Aufgabe übereinstimmen.",{"label":649,"description":650},"6. Kontrafaktische Tests durchführen","Entscheidende Belege entfernen, ersetzen oder überschreiben und testen, ob die Antwort der Änderung folgt.",{"label":652,"description":653},"7. Kritische Fehler manuell prüfen","Menschliche Prüfer oder Fachexperten hinzuziehen, wenn die automatische Bewertung nicht verlässlich genug ist.",{"label":655,"description":656},"8. Fehler in Eval-Fälle umwandeln","Produktionsfehler und Randfälle in einen wiederholbaren Regressionsdatensatz überführen.","Pipeline zur Belegevaluierung",{},{"id":660,"data":661,"type":225,"tunes":663},"p-production-1",{"text":662},"Die aktuellen Evaluierungsleitlinien von OpenAI empfehlen aufgabenspezifische Evals, kontinuierliche Evaluierung, aus dem Produktivbetrieb abgeleitete Datensätze sowie Traces zum Debuggen des Agentenverhaltens. Auch Anthropic empfiehlt für Research-Agenten die Kombination mehrerer Bewertungsansätze, da Korrektheit, Quellenqualität, Abdeckung und Faktentreue getrennte Dimensionen darstellen. Die Belegevaluierung sollte demselben Muster folgen: Mehrere eng gefasste Evaluatoren liefern mehr Erkenntnisse als ein einzelner, undurchsichtiger Qualitätswert.",{},{"id":665,"data":666,"type":41,"tunes":668},"h-judge",{"text":667,"level":218},"Ein LLM-Judge darf nicht die einzige Bewertungsinstanz sein",{},{"id":670,"data":671,"type":225,"tunes":673},"p-judge-1",{"text":672},"LLM-Evaluatoren sind nützlich für die skalierbare Klassifizierung von Behauptungen, Relevanzprüfungen und paarweise Vergleiche. Sie können jedoch dieselben toten Winkel aufweisen wie das System, das sie bewerten. Ein Evaluator akzeptiert möglicherweise eine plausible, aber unbelegte Behauptung, übersieht feine Versionsunterschiede oder bewertet eine gut formulierte Quelle zu positiv.",{},{"id":675,"data":676,"type":225,"tunes":678},"p-judge-2",{"text":677},"Die Evaluierungsrichtlinien von OpenAI empfehlen, automatisierte Evaluatoren anhand menschlicher Urteile zu kalibrieren und klare, abgegrenzte Kriterien zu verwenden. Bei belegintensiven Systemen sollten nach Möglichkeit deterministische Prüfungen eingesetzt werden: Zeitstempel, Objektversionen, Berechtigungsbereiche, exakte Quellen-IDs, Abrufreihenfolge, Dokumenten-Hashes und die Prüfung, ob der Beleg bereits vorlag, bevor das Modell die Behauptung generiert hat.",{},{"id":680,"data":681,"type":41,"tunes":683},"h-change",{"text":682,"level":218},"Was würde diese Antwort verändern?",{},{"id":685,"data":686,"type":225,"tunes":688},"p-change-1",{"text":687},"Die Evaluierung kann einfacher gestaltet werden, wenn der Agent auf einem kleinen, unveränderlichen und maßgeblichen Korpus arbeitet und jede Antwort rein extraktiv ist. In einer solchen Umgebung sind die Autorität und Anwendbarkeit der Quellen weitgehend festgelegt, sodass der Belegabgleich auf Satzebene ausreichen kann.",{},{"id":690,"data":691,"type":225,"tunes":693},"p-change-2",{"text":692},"Die Evaluierung muss strenger werden, sobald der Agent Websuchen, Langzeitgedächtnis, Live-Tools, mehrere Rechtsordnungen, sich schnell ändernde Informationen, nutzerspezifische Zustände oder autonome Aktionen miteinander kombiniert. In solchen Systemen hängt die Gültigkeit von Belegen nicht nur vom Quelltext ab, sondern auch davon, wann und wie der Beleg beschafft wurde.",{},{"id":695,"data":696,"type":225,"tunes":698},"p-change-3",{"text":697},"Zukünftige Modelle werden Herkunft und Unsicherheit intern möglicherweise besser nachverfolgen können, doch das beseitigt in Systemen, die Prüfbarkeit erfordern, nicht den Bedarf an externen Evidenzaufzeichnungen. Ein System sollte sich nicht auf die Selbsteinschätzung des Modells darüber verlassen, was es beeinflusst hat, wenn Traces und Quellmetadaten stichhaltigere Belege liefern können.",{},{"id":700,"data":701,"type":41,"tunes":703},"h-limitations",{"text":702,"level":218},"Einschränkungen",{},{"id":705,"data":706,"type":225,"tunes":708},"p-limit-1",{"text":707},"Es ist nicht immer möglich, die kausale Nutzung von Belegen allein aus Traces nachzuweisen. Eine Quelle kann im Kontext vorhanden sein, ohne die Antwort zu beeinflussen, und ein Modell kennt dieselbe Tatsache möglicherweise unabhängig davon. Kontrafaktische Tests stärken die Schlussfolgerung, können jedoch selbst die Aufgabenverteilung verändern.",{},{"id":710,"data":711,"type":225,"tunes":713},"p-limit-2",{"text":712},"Auch die Autorität von Quellen kann umstritten oder domänenabhängig sein. Manche Fragen haben keine einzelne maßgebliche Quelle, und Fachleute sind sich möglicherweise uneins darüber, welche Evidenz mehr Gewicht verdient. In diesen Fällen sollte die Evaluation die Uneinigkeit abbilden und Transparenz, Abdeckung sowie Argumentation anhand eines expliziten Schemas bewerten, anstatt vorzutäuschen, dass es eine einzige unumstößliche Wahrheitsquelle gäbe.",{},{"id":715,"data":716,"type":41,"tunes":718},"h-conclusion",{"text":717,"level":218},"Fazit",{},{"id":720,"data":721,"type":225,"tunes":723},"p-conclusion-1",{"text":722},"Die Frage „Hat der Agent eine Quelle zitiert?“ ist für den Produktiveinsatz von KI zu schwach. Die weitaus entscheidendere Frage lautet: Stammt jede wesentliche Behauptung aus einer Evidenz, die sie tatsächlich stützt, die erforderliche Autorität besitzt, für die aktuellen Rahmenbedingungen noch gültig ist und im Ausführungspfad verfügbar war, bevor die Behauptung aufgestellt wurde?",{},{"id":725,"data":726,"type":225,"tunes":728},"p-conclusion-2",{"text":727},"Damit wird Evidenz vom bloßen Beiwerk zu einer überprüfbaren Systemeigenschaft. Erfassen Sie den Trace. Ordnen Sie Behauptungen Belegen zu. Überprüfen Sie Autorität und Anwendbarkeit. Führen Sie kontrafaktische Evidenztests durch. Bewahren Sie die Herkunft über Zusammenfassungen und das Gedächtnis hinweg. Dann ist eine korrekte Antwort nicht nur plausibel — sie besitzt einen nachvollziehbaren Evidenzpfad.",{},{"id":730,"data":731,"type":736,"tunes":737},"internal-reliability",{"url":732,"title":733,"excerpt":734,"ctaLabel":735},"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Zuverlässigkeit von KI-Agenten: Warum die finale Antwort nicht ausreicht","Die Korrektheit des Ergebnisses allein kann nicht beweisen, dass der Ausführungspfad eines Agenten sicher oder zuverlässig war. Dieser weiterführende Artikel erläutert, warum Trajektorien, Tools und Zwischenentscheidungen wichtig sind.","Den verwandten Artikel lesen","referralArticle",{},{"id":739,"data":740,"type":736,"tunes":745},"internal-reasoning",{"url":741,"title":742,"excerpt":743,"ctaLabel":744},"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","Vom Forschungsprotokoll zum allgemeinen KI-Reasoning-Framework","Eine praktische Reasoning-Methode zur Trennung von Belegen, Annahmen, konkurrierenden Hypothesen und domänenspezifischer Validierung.","Das Reasoning-Framework lesen",{},{"id":747,"data":748,"type":41,"tunes":750},"h-faq",{"text":749,"level":218},"FAQ",{},{"id":752,"data":753,"type":752,"tunes":776},"faq",{"items":754,"title":775},[755,759,763,767,771],{"id":756,"answer":757,"question":758},"faq1","Nein. Ein Zitat kann zwar für das Thema relevant sein, ohne jedoch die konkrete Behauptung zu stützen, es kann von der falschen Autorität stammen, nicht mehr gültig sein oder angehängt worden sein, ohne die generierte Antwort maßgeblich beeinflusst zu haben.","Beweist ein Zitat, dass eine KI-Antwort fundiert ist?",{"id":760,"answer":761,"question":762},"faq2","Verwenden Sie einen kontrafaktischen Evidenznutzungstest: Führen Sie die Aufgabe mit bekanntermaßen korrekter Evidenz aus, und entfernen oder ersetzen Sie anschließend die entscheidende Evidenz, während alle anderen Eingaben unverändert bleiben. Reagiert die Antwort nicht auf die Änderung der Evidenz, prüfen Sie, ob sich das Modell auf Vorwissen oder eine andere Quelle stützt.","Wie kann ich testen, ob ein KI-Agent abgerufene Belege tatsächlich genutzt hat?",{"id":764,"answer":765,"question":766},"faq3","Die Fundierung prüft, ob Behauptungen durch die bereitgestellten Belege gestützt werden. Die Quellenqualität hinterfragt, ob die Evidenz selbst für die Art der aufgestellten Behauptung angemessen und autoritativ genug ist.","Was ist der Unterschied zwischen Fundierung (Groundedness) und Quellenqualität?",{"id":768,"answer":769,"question":770},"faq4","Die Quelle kann veraltet oder überholt sein, für eine andere Version, Rechtsprechung, Benutzergruppe, Population oder einen anderen Systemstatus gelten oder Bedingungen enthalten, die beim Abruf oder Zusammenfassen verloren gegangen sind.","Warum kann eine echte Quelle dennoch zu einer falschen KI-Antwort führen?",{"id":772,"answer":773,"question":774},"faq5","Protokollieren Sie die Suchanfrage, zurückgegebene Quellen, genaue Evidenzauszüge, Zeitstempel und Versionen, Filter, den finalen Kontext, Modellausgaben, Zitate und die Reihenfolge im Trace, damit Evaluatoren rekonstruieren können, welche Belege vor jeder wesentlichen Behauptung verfügbar waren.","Was sollte ich für die Evidenzevaluierung protokollieren?","Evaluierung der Evidenznutzung bei KI-Agenten",{},{"id":778,"data":779,"type":41,"tunes":781},"h-glossary",{"text":780,"level":218},"Glossar",{},{"id":783,"data":784,"type":783,"tunes":810},"glossary",{"title":785,"entries":786},"Wichtige Begriffe zur Evidenzevaluierung",[787,791,795,798,802,806],{"term":788,"anchor":789,"definition":790},"Behauptungsstützung (Claim support)","claim-support","Der Grad, in dem ein bestimmter Evidenzauszug eine generierte Behauptung direkt belegt.",{"term":792,"anchor":793,"definition":794},"Evidenzautorität (Evidence authority)","evidence-authority","Wie angemessen eine Quelle ist, um eine bestimmte Art von Behauptung zu stützen, basierend auf ihrer Rolle, Herkunft und Beziehung zur zugrunde liegenden Tatsache.",{"term":796,"anchor":566,"definition":797},"Anwendbarkeit (Applicability)","Die Bedingungen, unter denen Belege für eine Behauptung gültig bleiben, einschließlich Zeit, Version, Rechtsraum, Benutzer, Population, Systemzustand oder anderer Grenzen.",{"term":799,"anchor":800,"definition":801},"Evidenznutzung (Evidence utilization)","evidence-utilization","Ob die Ausgabe des Agenten tatsächlich auf die in seinem Ausführungspfad bereitgestellte Evidenz reagiert und von ihr abhängt.",{"term":803,"anchor":804,"definition":805},"Kontrafaktischer Evidenztest (Counterfactual evidence test)","counterfactual-evidence-test","Eine Evaluierung, bei der entscheidende Belege entfernt, ersetzt oder geändert werden, um zu prüfen, ob sich die Behauptung des Agenten entsprechend anpasst.",{"term":807,"anchor":808,"definition":809},"Herkunft (Provenance)","provenance","Metadaten, die festhalten, woher Belege stammen, wann sie erfasst wurden, wie sie transformiert wurden und welche Version oder welchen Zustand sie repräsentieren.",{},{"id":812,"data":813,"type":41,"tunes":815},"h-sources",{"text":814,"level":218},"Primärquellen und weiterführende Literatur",{},{"id":817,"data":818,"type":824,"tunes":825},"src-openai-agent-evals",{"link":819,"meta":820},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals",{"image":821,"title":822,"description":823},{"url":464},"OpenAI — Evaluate Agent Workflows","Leitfaden zu Trace-Bewertungen, Workflows auf Systemebene, Datensätzen und wiederholbaren Evaluierungsläufen für Agenten.","linkTool",{},{"id":827,"data":828,"type":824,"tunes":834},"src-openai-eval-best",{"link":829,"meta":830},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices",{"image":831,"title":832,"description":833},{"url":464},"OpenAI — Evaluation Best Practices","Leitfaden zu aufgabenspezifischen Evals, produktionsnahen Datensätzen, abgegrenzten Metriken, kontinuierlicher Evaluierung und Kalibrierung von Prüfinstanzen.",{},{"id":836,"data":837,"type":824,"tunes":843},"src-anthropic-evals",{"link":838,"meta":839},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"image":840,"title":841,"description":842},{"url":464},"Anthropic — Demystifying Evals for AI Agents","Leitfaden zur Agenten-Evaluierung einschließlich Prüfungen von Fundierung, Abdeckung und Quellenqualität für Recherche-Agenten.",{},{"id":845,"data":846,"type":824,"tunes":852},"src-openai-thirdparty",{"link":847,"meta":848},"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F",{"image":849,"title":850,"description":851},{"url":464},"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations","Evaluierungsleitfaden, der hervorhebt, dass die Leistung moderner Agenten von Workflow und Umgebung abhängt, nicht nur von der finalen Modellausgabe.",{},"2.31","Ein KI-Agent kann Quellen zitieren und trotzdem die falschen Belege verwenden. Dieser Artikel stellt eine praktische Methode zur Überprüfung der Belegung von Behauptungen, der Quellenautorität, der Anwendbarkeit, der Herkunft sowie der Frage vor, ob die Belege die Antwort tatsächlich beeinflusst haben.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve","PUBLISHED","2026-09-25T11:47:00.000Z","2026-09-25T15:47:02.186Z","2026-09-25T20:33:01.720Z",{"en":862,"de":863,"sr":864,"es":865,"fr":866,"it":867,"ru":868,"zh":869},"\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fde\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fsr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fes\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Ffr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fit\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fru\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fzh\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence",[871,875,879],{"id":872,"name":873,"slug":874},84,"Policy & Datengrenzen","policy-and-data",{"id":876,"name":877,"slug":878},97,"Verifikation am Test-Set","verification",{"id":880,"name":881,"slug":882},66,"Content-Operations","content-ops",{"id":884,"login":885,"email":886,"displayName":887},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[889,1193],{"lang":7,"title":207,"content":209,"contentJson":890,"excerpt":854},{"time":211,"blocks":891,"version":853},[892,895,898,901,904,907,910,913,916,925,928,931,934,937,940,943,946,949,952,955,958,961,964,967,970,981,984,987,996,999,1002,1005,1021,1024,1027,1030,1033,1036,1039,1042,1045,1048,1051,1066,1069,1082,1085,1097,1100,1103,1106,1109,1112,1115,1118,1121,1124,1127,1130,1133,1136,1139,1142,1145,1148,1157,1160,1170,1173,1178,1183,1188],{"id":214,"data":893,"type":219,"tunes":894},{"title":216,"maxLevel":217,"minLevel":218},{},{"id":222,"data":896,"type":225,"tunes":897},{"text":224},{},{"id":228,"data":899,"type":233,"tunes":900},{"body":230,"title":231,"variant":232},{},{"id":236,"data":902,"type":233,"tunes":903},{"body":238,"title":239,"variant":240},{},{"id":243,"data":905,"type":41,"tunes":906},{"text":245,"level":218},{},{"id":248,"data":908,"type":225,"tunes":909},{"text":250},{},{"id":253,"data":911,"type":225,"tunes":912},{"text":255},{},{"id":258,"data":914,"type":41,"tunes":915},{"text":260,"level":218},{},{"id":263,"data":917,"type":286,"tunes":924},{"content":918,"stretched":42,"withHeadings":13},[919,920,921,922,923],[267,268,269],[271,272,273],[275,276,277],[279,280,281],[283,284,285],{},{"id":289,"data":926,"type":41,"tunes":927},{"text":291,"level":217},{},{"id":294,"data":929,"type":225,"tunes":930},{"text":296},{},{"id":299,"data":932,"type":225,"tunes":933},{"text":301},{},{"id":304,"data":935,"type":41,"tunes":936},{"text":306,"level":217},{},{"id":309,"data":938,"type":225,"tunes":939},{"text":311},{},{"id":314,"data":941,"type":225,"tunes":942},{"text":316},{},{"id":319,"data":944,"type":41,"tunes":945},{"text":321,"level":217},{},{"id":324,"data":947,"type":225,"tunes":948},{"text":326},{},{"id":329,"data":950,"type":225,"tunes":951},{"text":331},{},{"id":334,"data":953,"type":233,"tunes":954},{"body":336,"title":337,"variant":338},{},{"id":341,"data":956,"type":41,"tunes":957},{"text":343,"level":217},{},{"id":346,"data":959,"type":225,"tunes":960},{"text":348},{},{"id":351,"data":962,"type":225,"tunes":963},{"text":353},{},{"id":356,"data":965,"type":41,"tunes":966},{"text":358,"level":218},{},{"id":361,"data":968,"type":225,"tunes":969},{"text":363},{},{"id":366,"data":971,"type":392,"tunes":980},{"steps":972,"title":390,"orientation":391},[973,974,975,976,977,978,979],{"label":370,"description":371},{"label":373,"description":374},{"label":376,"description":377},{"label":379,"description":380},{"label":382,"description":383},{"label":385,"description":386},{"label":388,"description":389},{},{"id":395,"data":982,"type":233,"tunes":983},{"body":397,"title":398,"variant":399},{},{"id":402,"data":985,"type":41,"tunes":986},{"text":404,"level":218},{},{"id":407,"data":988,"type":286,"tunes":995},{"content":989,"stretched":42,"withHeadings":13},[990,991,992,993,994],[411,412,413,414,279,415],[417,418,419,420,421,422],[424,425,426,427,428,422],[430,431,432,433,434,422],[436,437,419,438,439,422],{},{"id":442,"data":997,"type":225,"tunes":998},{"text":444},{},{"id":447,"data":1000,"type":41,"tunes":1001},{"text":449,"level":218},{},{"id":452,"data":1003,"type":225,"tunes":1004},{"text":454},{},{"id":457,"data":1006,"type":488,"tunes":1020},{"rows":1007,"title":477,"layout":286,"columns":1016},[1008,1010,1012,1014],{"id":461,"label":462,"values":1009},[464,464,464],{"id":466,"label":467,"values":1011},[464,464,464],{"id":470,"label":471,"values":1013},[464,464,464],{"id":474,"label":475,"values":1015},[464,464,464],[1017,1018,1019],{"id":480,"label":481},{"id":483,"label":484},{"id":486,"label":487},{},{"id":491,"data":1022,"type":41,"tunes":1023},{"text":493,"level":218},{},{"id":496,"data":1025,"type":225,"tunes":1026},{"text":498},{},{"id":501,"data":1028,"type":225,"tunes":1029},{"text":503},{},{"id":506,"data":1031,"type":41,"tunes":1032},{"text":508,"level":218},{},{"id":511,"data":1034,"type":225,"tunes":1035},{"text":513},{},{"id":516,"data":1037,"type":225,"tunes":1038},{"text":518},{},{"id":521,"data":1040,"type":41,"tunes":1041},{"text":523,"level":218},{},{"id":526,"data":1043,"type":225,"tunes":1044},{"text":528},{},{"id":531,"data":1046,"type":225,"tunes":1047},{"text":533},{},{"id":536,"data":1049,"type":41,"tunes":1050},{"text":538,"level":218},{},{"id":541,"data":1052,"type":286,"tunes":1065},{"content":1053,"stretched":42,"withHeadings":13},[1054,1055,1056,1057,1058,1059,1060,1061,1062,1063,1064],[545,546],[548,549],[551,552],[554,555],[557,558],[560,561],[563,564],[566,567],[569,570],[572,573],[575,576],{},{"id":579,"data":1067,"type":41,"tunes":1068},{"text":581,"level":218},{},{"id":584,"data":1070,"type":286,"tunes":1081},{"content":1071,"stretched":42,"withHeadings":13},[1072,1073,1074,1075,1076,1077,1078,1079,1080],[588,589,590],[592,593,594],[596,597,598],[600,601,602],[604,605,606],[608,609,610],[612,613,614],[616,617,618],[620,621,622],{},{"id":625,"data":1083,"type":41,"tunes":1084},{"text":627,"level":218},{},{"id":630,"data":1086,"type":392,"tunes":1096},{"steps":1087,"title":657,"orientation":391},[1088,1089,1090,1091,1092,1093,1094,1095],{"label":634,"description":635},{"label":637,"description":638},{"label":640,"description":641},{"label":643,"description":644},{"label":646,"description":647},{"label":649,"description":650},{"label":652,"description":653},{"label":655,"description":656},{},{"id":660,"data":1098,"type":225,"tunes":1099},{"text":662},{},{"id":665,"data":1101,"type":41,"tunes":1102},{"text":667,"level":218},{},{"id":670,"data":1104,"type":225,"tunes":1105},{"text":672},{},{"id":675,"data":1107,"type":225,"tunes":1108},{"text":677},{},{"id":680,"data":1110,"type":41,"tunes":1111},{"text":682,"level":218},{},{"id":685,"data":1113,"type":225,"tunes":1114},{"text":687},{},{"id":690,"data":1116,"type":225,"tunes":1117},{"text":692},{},{"id":695,"data":1119,"type":225,"tunes":1120},{"text":697},{},{"id":700,"data":1122,"type":41,"tunes":1123},{"text":702,"level":218},{},{"id":705,"data":1125,"type":225,"tunes":1126},{"text":707},{},{"id":710,"data":1128,"type":225,"tunes":1129},{"text":712},{},{"id":715,"data":1131,"type":41,"tunes":1132},{"text":717,"level":218},{},{"id":720,"data":1134,"type":225,"tunes":1135},{"text":722},{},{"id":725,"data":1137,"type":225,"tunes":1138},{"text":727},{},{"id":730,"data":1140,"type":736,"tunes":1141},{"url":732,"title":733,"excerpt":734,"ctaLabel":735},{},{"id":739,"data":1143,"type":736,"tunes":1144},{"url":741,"title":742,"excerpt":743,"ctaLabel":744},{},{"id":747,"data":1146,"type":41,"tunes":1147},{"text":749,"level":218},{},{"id":752,"data":1149,"type":752,"tunes":1156},{"items":1150,"title":775},[1151,1152,1153,1154,1155],{"id":756,"answer":757,"question":758},{"id":760,"answer":761,"question":762},{"id":764,"answer":765,"question":766},{"id":768,"answer":769,"question":770},{"id":772,"answer":773,"question":774},{},{"id":778,"data":1158,"type":41,"tunes":1159},{"text":780,"level":218},{},{"id":783,"data":1161,"type":783,"tunes":1169},{"title":785,"entries":1162},[1163,1164,1165,1166,1167,1168],{"term":788,"anchor":789,"definition":790},{"term":792,"anchor":793,"definition":794},{"term":796,"anchor":566,"definition":797},{"term":799,"anchor":800,"definition":801},{"term":803,"anchor":804,"definition":805},{"term":807,"anchor":808,"definition":809},{},{"id":812,"data":1171,"type":41,"tunes":1172},{"text":814,"level":218},{},{"id":817,"data":1174,"type":824,"tunes":1177},{"link":819,"meta":1175},{"image":1176,"title":822,"description":823},{"url":464},{},{"id":827,"data":1179,"type":824,"tunes":1182},{"link":829,"meta":1180},{"image":1181,"title":832,"description":833},{"url":464},{},{"id":836,"data":1184,"type":824,"tunes":1187},{"link":838,"meta":1185},{"image":1186,"title":841,"description":842},{"url":464},{},{"id":845,"data":1189,"type":824,"tunes":1192},{"link":847,"meta":1190},{"image":1191,"title":850,"description":851},{"url":464},{},{"lang":1194,"title":1195,"content":1196,"contentJson":1197,"excerpt":1711},"en","How to Know Whether an AI Agent Actually Used the Right Evidence","{\"time\":1790351390243,\"blocks\":[{\"id\":\"0hk9UtwqZf\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.\"},\"tunes\":{}},{\"id\":\"method-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"About the method\",\"body\":\"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.\"},\"tunes\":{}},{\"id\":\"h-citations\",\"type\":\"header\",\"data\":{\"text\":\"Why citations are not enough\",\"level\":2},\"tunes\":{}},{\"id\":\"p-citations-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.\"},\"tunes\":{}},{\"id\":\"p-citations-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.\"},\"tunes\":{}},{\"id\":\"h-four\",\"type\":\"header\",\"data\":{\"text\":\"The four questions every material claim should pass\",\"level\":2},\"tunes\":{}},{\"id\":\"table-four\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Dimension\",\"Question\",\"Typical failure\"],[\"Claim support\",\"Does the evidence directly support this exact claim?\",\"The source is topically related but does not establish the statement\"],[\"Evidence authority\",\"Is this an appropriate source for this kind of claim?\",\"A secondary summary is used where a primary source or live system is required\"],[\"Applicability\",\"Does the evidence apply to this time, version, jurisdiction, user, state, or population?\",\"A true statement is applied outside its valid conditions\"],[\"Evidence use\",\"Was this evidence actually available and used in the agent's execution path?\",\"The final answer is correct, but the retrieved evidence was irrelevant or unused\"]]},\"tunes\":{}},{\"id\":\"h-support\",\"type\":\"header\",\"data\":{\"text\":\"1. Claim support: does the source establish what the agent says?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-support-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.\"},\"tunes\":{}},{\"id\":\"p-support-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.\"},\"tunes\":{}},{\"id\":\"h-authority\",\"type\":\"header\",\"data\":{\"text\":\"2. Evidence authority: is this the right kind of source?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-authority-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.\"},\"tunes\":{}},{\"id\":\"p-authority-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.\"},\"tunes\":{}},{\"id\":\"h-applicability\",\"type\":\"header\",\"data\":{\"text\":\"3. Applicability: right evidence, wrong conditions\",\"level\":3},\"tunes\":{}},{\"id\":\"p-apply-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.\"},\"tunes\":{}},{\"id\":\"p-apply-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.\"},\"tunes\":{}},{\"id\":\"apply-warning\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Evidence can be authentic and still be wrong for the answer\",\"body\":\"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.\"},\"tunes\":{}},{\"id\":\"h-use\",\"type\":\"header\",\"data\":{\"text\":\"4. Evidence use: did the agent actually rely on the evidence?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-use-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.\"},\"tunes\":{}},{\"id\":\"p-use-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.\"},\"tunes\":{}},{\"id\":\"h-eut\",\"type\":\"header\",\"data\":{\"text\":\"The Evidence Utilization Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-eut-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.\"},\"tunes\":{}},{\"id\":\"eut-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence Utilization Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Select one material claim\",\"description\":\"Choose a claim whose correctness matters and define the expected answer precisely.\"},{\"label\":\"2. Identify gold evidence\",\"description\":\"Provide the smallest authoritative evidence set sufficient to support the claim.\"},{\"label\":\"3. Run with gold evidence\",\"description\":\"Verify that the agent produces the supported answer when the correct evidence is available.\"},{\"label\":\"4. Remove the decisive evidence\",\"description\":\"Run the same task without the key supporting passage while keeping other inputs stable.\"},{\"label\":\"5. Replace it with contradictory or superseding evidence\",\"description\":\"Where safe, provide controlled evidence that changes the correct conclusion.\"},{\"label\":\"6. Compare the claims\",\"description\":\"Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.\"},{\"label\":\"7. Inspect the trace\",\"description\":\"Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.\"}]},\"tunes\":{}},{\"id\":\"eut-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"The key signal\",\"body\":\"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A claim–evidence matrix is more useful than a source list\",\"level\":2},\"tunes\":{}},{\"id\":\"claim-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Claim\",\"Evidence\",\"Support\",\"Authority\",\"Applicability\",\"Used in trace\"],[\"Feature X is available\",\"Vendor documentation\",\"Direct\",\"High for availability claim\",\"Current version and region must match\",\"Yes \u002F No\"],[\"Configuration Y is faster\",\"Vendor benchmark\",\"Partial\",\"High for vendor's test, not independent performance\",\"Hardware and workload must match\",\"Yes \u002F No\"],[\"Policy applies to this user\",\"Current policy + account state\",\"Direct only when combined\",\"High\",\"Jurisdiction, date, role and account state must match\",\"Yes \u002F No\"],[\"A product is in stock\",\"Live inventory API\",\"Direct\",\"Authoritative for current stock\",\"Expires quickly\",\"Yes \u002F No\"]]},\"tunes\":{}},{\"id\":\"p-matrix-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.\"},\"tunes\":{}},{\"id\":\"h-retrieval-evidence\",\"type\":\"header\",\"data\":{\"text\":\"Separate retrieval quality from evidence quality\",\"level\":2},\"tunes\":{}},{\"id\":\"p-re-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.\"},\"tunes\":{}},{\"id\":\"retrieval-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Retrieval success is not evidence success\",\"layout\":\"table\",\"columns\":[{\"id\":\"situation\",\"label\":\"Situation\"},{\"id\":\"retrieval\",\"label\":\"Retrieval\"},{\"id\":\"evidence\",\"label\":\"Evidence quality\"}],\"rows\":[{\"id\":\"a\",\"label\":\"Right document, wrong claim\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"b\",\"label\":\"Right fact, stale source\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"c\",\"label\":\"Weak source, correct answer\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"d\",\"label\":\"Multiple sources required\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-source-quality\",\"type\":\"header\",\"data\":{\"text\":\"Evaluate source quality as a rubric, not a domain whitelist\",\"level\":2},\"tunes\":{}},{\"id\":\"p-source-quality-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.\"},\"tunes\":{}},{\"id\":\"p-source-quality-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.\"},\"tunes\":{}},{\"id\":\"h-coverage\",\"type\":\"header\",\"data\":{\"text\":\"Evidence coverage: every important claim needs support, not every sentence\",\"level\":2},\"tunes\":{}},{\"id\":\"p-coverage-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.\"},\"tunes\":{}},{\"id\":\"p-coverage-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.\"},\"tunes\":{}},{\"id\":\"h-provenance\",\"type\":\"header\",\"data\":{\"text\":\"Evidence provenance must survive summarization and memory\",\"level\":2},\"tunes\":{}},{\"id\":\"p-prov-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.\"},\"tunes\":{}},{\"id\":\"p-prov-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.\"},\"tunes\":{}},{\"id\":\"h-record\",\"type\":\"header\",\"data\":{\"text\":\"A practical evidence record\",\"level\":2},\"tunes\":{}},{\"id\":\"evidence-record\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Field\",\"Purpose\"],[\"claim_id\",\"Identifies the material claim being supported\"],[\"source_id \u002F source_url \u002F system\",\"Identifies where the evidence came from\"],[\"evidence_span\",\"Preserves the smallest passage, record, or tool result that supports the claim\"],[\"retrieved_at \u002F observed_at\",\"Allows freshness and timeline checks\"],[\"source_version \u002F object_version\",\"Allows supersession and reproducibility checks\"],[\"authority_role\",\"Explains why this source is suitable for this claim\"],[\"applicability\",\"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions\"],[\"transformation\",\"Marks whether evidence is raw, quoted, summarized, normalized, or derived\"],[\"trace_step\",\"Shows when the evidence became available to the agent\"],[\"support_status\",\"Direct, partial, contradictory, unsupported, or uncertain\"]]},\"tunes\":{}},{\"id\":\"h-failures\",\"type\":\"header\",\"data\":{\"text\":\"Failure modes that look grounded but are not\",\"level\":2},\"tunes\":{}},{\"id\":\"failure-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Failure mode\",\"Why it fools evaluators\",\"What to test\"],[\"Citation decoration\",\"The answer contains sources, so it looks researched\",\"Map each material claim to an exact supporting span\"],[\"Authority mismatch\",\"The source is reputable but not authoritative for the specific fact\",\"Define claim-specific source hierarchy\"],[\"Temporal mismatch\",\"The source was correct when published\",\"Check retrieval time, source date, and superseding evidence\"],[\"Condition stripping\",\"A summary keeps the conclusion but drops exceptions\",\"Compare generated claim with full local source context\"],[\"Post-hoc citation\",\"A plausible source is attached after the answer is generated\",\"Inspect trace ordering and whether evidence preceded the claim\"],[\"Parametric override\",\"The model ignores retrieved evidence and answers from prior knowledge\",\"Run counterfactual evidence-utilization tests\"],[\"Evidence laundering\",\"Model inference is summarized and later stored as if it were a source fact\",\"Preserve transformation type and provenance across memory writes\"],[\"Source majority fallacy\",\"Several secondary pages repeat the same unsupported statement\",\"Trace claims back to independent or primary evidence\"]]},\"tunes\":{}},{\"id\":\"h-production\",\"type\":\"header\",\"data\":{\"text\":\"How to evaluate the agent in production\",\"level\":2},\"tunes\":{}},{\"id\":\"production-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence evaluation pipeline\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Define material claims\",\"description\":\"Identify the facts, recommendations, or decisions whose correctness matters to the task.\"},{\"label\":\"2. Build gold evidence\",\"description\":\"Create reference evidence and source-quality expectations for representative cases.\"},{\"label\":\"3. Capture traces\",\"description\":\"Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.\"},{\"label\":\"4. Grade support\",\"description\":\"Check whether each material claim is directly, partially, contradictorily, or not supported.\"},{\"label\":\"5. Grade authority and applicability\",\"description\":\"Evaluate whether the source is appropriate and whether its conditions match the current task.\"},{\"label\":\"6. Run counterfactuals\",\"description\":\"Remove, replace, or supersede decisive evidence and test whether the answer follows the change.\"},{\"label\":\"7. Review high-impact failures\",\"description\":\"Use human or domain-expert review where automated grading is not reliable enough.\"},{\"label\":\"8. Convert failures into eval cases\",\"description\":\"Add production failures and edge cases to a repeatable regression dataset.\"}]},\"tunes\":{}},{\"id\":\"p-production-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.\"},\"tunes\":{}},{\"id\":\"h-judge\",\"type\":\"header\",\"data\":{\"text\":\"Do not let an LLM judge become the only evidence judge\",\"level\":2},\"tunes\":{}},{\"id\":\"p-judge-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.\"},\"tunes\":{}},{\"id\":\"p-judge-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.\"},\"tunes\":{}},{\"id\":\"p-change-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.\"},\"tunes\":{}},{\"id\":\"internal-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.\",\"ctaLabel\":\"Read the related article\"},\"tunes\":{}},{\"id\":\"internal-reasoning\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\",\"title\":\"From Research Protocol to a General AI Reasoning Framework\",\"excerpt\":\"A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.\",\"ctaLabel\":\"Read the reasoning framework\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Evaluating evidence use in AI agents\",\"items\":[{\"id\":\"faq1\",\"question\":\"Does a citation prove that an AI answer is grounded?\",\"answer\":\"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.\"},{\"id\":\"faq2\",\"question\":\"How can I test whether an AI agent actually used retrieved evidence?\",\"answer\":\"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.\"},{\"id\":\"faq3\",\"question\":\"What is the difference between groundedness and source quality?\",\"answer\":\"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.\"},{\"id\":\"faq4\",\"question\":\"Why can a real source still produce a wrong AI answer?\",\"answer\":\"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.\"},{\"id\":\"faq5\",\"question\":\"What should I log for evidence evaluation?\",\"answer\":\"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key evidence-evaluation terms\",\"entries\":[{\"term\":\"Claim support\",\"definition\":\"The degree to which a specific evidence span directly establishes a generated claim.\",\"anchor\":\"claim-support\"},{\"term\":\"Evidence authority\",\"definition\":\"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.\",\"anchor\":\"evidence-authority\"},{\"term\":\"Applicability\",\"definition\":\"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.\",\"anchor\":\"applicability\"},{\"term\":\"Evidence utilization\",\"definition\":\"Whether the agent's output actually responds to and depends on the evidence made available in its execution path.\",\"anchor\":\"evidence-utilization\"},{\"term\":\"Counterfactual evidence test\",\"definition\":\"An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.\",\"anchor\":\"counterfactual-evidence-test\"},{\"term\":\"Provenance\",\"definition\":\"Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.\",\"anchor\":\"provenance\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-agent-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluate Agent Workflows\",\"description\":\"Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-eval-best\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluation Best Practices\",\"description\":\"Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.\"}},\"tunes\":{}},{\"id\":\"src-anthropic-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Demystifying Evals for AI Agents\",\"description\":\"Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-thirdparty\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations\",\"description\":\"Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":1198,"blocks":1199,"version":1710},1790351390243,[1200,1204,1208,1213,1218,1222,1226,1230,1234,1257,1261,1265,1269,1273,1277,1281,1285,1289,1293,1298,1302,1306,1310,1314,1318,1343,1348,1352,1386,1390,1394,1398,1421,1425,1429,1433,1437,1441,1445,1449,1453,1457,1461,1488,1492,1532,1536,1565,1569,1573,1577,1581,1585,1589,1593,1597,1601,1605,1609,1613,1617,1621,1628,1635,1638,1658,1662,1682,1686,1692,1698,1704],{"id":214,"data":1201,"type":219,"tunes":1203},{"title":1202,"maxLevel":217,"minLevel":218},"Contents",{},{"id":222,"data":1205,"type":225,"tunes":1207},{"text":1206},"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?",{},{"id":228,"data":1209,"type":233,"tunes":1212},{"body":1210,"title":1211,"variant":232},"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.","Direct answer",{},{"id":236,"data":1214,"type":233,"tunes":1217},{"body":1215,"title":1216,"variant":240},"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.","About the method",{},{"id":243,"data":1219,"type":41,"tunes":1221},{"text":1220,"level":218},"Why citations are not enough",{},{"id":248,"data":1223,"type":225,"tunes":1225},{"text":1224},"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.",{},{"id":253,"data":1227,"type":225,"tunes":1229},{"text":1228},"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.",{},{"id":258,"data":1231,"type":41,"tunes":1233},{"text":1232,"level":218},"The four questions every material claim should pass",{},{"id":263,"data":1235,"type":286,"tunes":1256},{"content":1236,"stretched":42,"withHeadings":13},[1237,1240,1244,1248,1252],[267,1238,1239],"Question","Typical failure",[1241,1242,1243],"Claim support","Does the evidence directly support this exact claim?","The source is topically related but does not establish the statement",[1245,1246,1247],"Evidence authority","Is this an appropriate source for this kind of claim?","A secondary summary is used where a primary source or live system is required",[1249,1250,1251],"Applicability","Does the evidence apply to this time, version, jurisdiction, user, state, or population?","A true statement is applied outside its valid conditions",[1253,1254,1255],"Evidence use","Was this evidence actually available and used in the agent's execution path?","The final answer is correct, but the retrieved evidence was irrelevant or unused",{},{"id":289,"data":1258,"type":41,"tunes":1260},{"text":1259,"level":217},"1. Claim support: does the source establish what the agent says?",{},{"id":294,"data":1262,"type":225,"tunes":1264},{"text":1263},"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.",{},{"id":299,"data":1266,"type":225,"tunes":1268},{"text":1267},"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.",{},{"id":304,"data":1270,"type":41,"tunes":1272},{"text":1271,"level":217},"2. Evidence authority: is this the right kind of source?",{},{"id":309,"data":1274,"type":225,"tunes":1276},{"text":1275},"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.",{},{"id":314,"data":1278,"type":225,"tunes":1280},{"text":1279},"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.",{},{"id":319,"data":1282,"type":41,"tunes":1284},{"text":1283,"level":217},"3. Applicability: right evidence, wrong conditions",{},{"id":324,"data":1286,"type":225,"tunes":1288},{"text":1287},"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.",{},{"id":329,"data":1290,"type":225,"tunes":1292},{"text":1291},"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.",{},{"id":334,"data":1294,"type":233,"tunes":1297},{"body":1295,"title":1296,"variant":338},"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.","Evidence can be authentic and still be wrong for the answer",{},{"id":341,"data":1299,"type":41,"tunes":1301},{"text":1300,"level":217},"4. Evidence use: did the agent actually rely on the evidence?",{},{"id":346,"data":1303,"type":225,"tunes":1305},{"text":1304},"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.",{},{"id":351,"data":1307,"type":225,"tunes":1309},{"text":1308},"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.",{},{"id":356,"data":1311,"type":41,"tunes":1313},{"text":1312,"level":218},"The Evidence Utilization Test",{},{"id":361,"data":1315,"type":225,"tunes":1317},{"text":1316},"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.",{},{"id":366,"data":1319,"type":392,"tunes":1342},{"steps":1320,"title":390,"orientation":391},[1321,1324,1327,1330,1333,1336,1339],{"label":1322,"description":1323},"1. Select one material claim","Choose a claim whose correctness matters and define the expected answer precisely.",{"label":1325,"description":1326},"2. Identify gold evidence","Provide the smallest authoritative evidence set sufficient to support the claim.",{"label":1328,"description":1329},"3. Run with gold evidence","Verify that the agent produces the supported answer when the correct evidence is available.",{"label":1331,"description":1332},"4. Remove the decisive evidence","Run the same task without the key supporting passage while keeping other inputs stable.",{"label":1334,"description":1335},"5. Replace it with contradictory or superseding evidence","Where safe, provide controlled evidence that changes the correct conclusion.",{"label":1337,"description":1338},"6. Compare the claims","Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.",{"label":1340,"description":1341},"7. Inspect the trace","Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.",{},{"id":395,"data":1344,"type":233,"tunes":1347},{"body":1345,"title":1346,"variant":399},"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.","The key signal",{},{"id":402,"data":1349,"type":41,"tunes":1351},{"text":1350,"level":218},"A claim–evidence matrix is more useful than a source list",{},{"id":407,"data":1353,"type":286,"tunes":1385},{"content":1354,"stretched":42,"withHeadings":13},[1355,1361,1368,1374,1380],[1356,1357,1358,1359,1249,1360],"Claim","Evidence","Support","Authority","Used in trace",[1362,1363,1364,1365,1366,1367],"Feature X is available","Vendor documentation","Direct","High for availability claim","Current version and region must match","Yes \u002F No",[1369,1370,1371,1372,1373,1367],"Configuration Y is faster","Vendor benchmark","Partial","High for vendor's test, not independent performance","Hardware and workload must match",[1375,1376,1377,1378,1379,1367],"Policy applies to this user","Current policy + account state","Direct only when combined","High","Jurisdiction, date, role and account state must match",[1381,1382,1364,1383,1384,1367],"A product is in stock","Live inventory API","Authoritative for current stock","Expires quickly",{},{"id":442,"data":1387,"type":225,"tunes":1389},{"text":1388},"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.",{},{"id":447,"data":1391,"type":41,"tunes":1393},{"text":1392,"level":218},"Separate retrieval quality from evidence quality",{},{"id":452,"data":1395,"type":225,"tunes":1397},{"text":1396},"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.",{},{"id":457,"data":1399,"type":488,"tunes":1420},{"rows":1400,"title":1413,"layout":286,"columns":1414},[1401,1404,1407,1410],{"id":461,"label":1402,"values":1403},"Right document, wrong claim",[464,464,464],{"id":466,"label":1405,"values":1406},"Right fact, stale source",[464,464,464],{"id":470,"label":1408,"values":1409},"Weak source, correct answer",[464,464,464],{"id":474,"label":1411,"values":1412},"Multiple sources required",[464,464,464],"Retrieval success is not evidence success",[1415,1416,1418],{"id":480,"label":481},{"id":483,"label":1417},"Retrieval",{"id":486,"label":1419},"Evidence quality",{},{"id":491,"data":1422,"type":41,"tunes":1424},{"text":1423,"level":218},"Evaluate source quality as a rubric, not a domain whitelist",{},{"id":496,"data":1426,"type":225,"tunes":1428},{"text":1427},"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.",{},{"id":501,"data":1430,"type":225,"tunes":1432},{"text":1431},"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.",{},{"id":506,"data":1434,"type":41,"tunes":1436},{"text":1435,"level":218},"Evidence coverage: every important claim needs support, not every sentence",{},{"id":511,"data":1438,"type":225,"tunes":1440},{"text":1439},"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.",{},{"id":516,"data":1442,"type":225,"tunes":1444},{"text":1443},"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.",{},{"id":521,"data":1446,"type":41,"tunes":1448},{"text":1447,"level":218},"Evidence provenance must survive summarization and memory",{},{"id":526,"data":1450,"type":225,"tunes":1452},{"text":1451},"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.",{},{"id":531,"data":1454,"type":225,"tunes":1456},{"text":1455},"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.",{},{"id":536,"data":1458,"type":41,"tunes":1460},{"text":1459,"level":218},"A practical evidence record",{},{"id":541,"data":1462,"type":286,"tunes":1487},{"content":1463,"stretched":42,"withHeadings":13},[1464,1467,1469,1471,1473,1475,1477,1479,1481,1483,1485],[1465,1466],"Field","Purpose",[548,1468],"Identifies the material claim being supported",[551,1470],"Identifies where the evidence came from",[554,1472],"Preserves the smallest passage, record, or tool result that supports the claim",[557,1474],"Allows freshness and timeline checks",[560,1476],"Allows supersession and reproducibility checks",[563,1478],"Explains why this source is suitable for this claim",[566,1480],"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions",[569,1482],"Marks whether evidence is raw, quoted, summarized, normalized, or derived",[572,1484],"Shows when the evidence became available to the agent",[575,1486],"Direct, partial, contradictory, unsupported, or uncertain",{},{"id":579,"data":1489,"type":41,"tunes":1491},{"text":1490,"level":218},"Failure modes that look grounded but are not",{},{"id":584,"data":1493,"type":286,"tunes":1531},{"content":1494,"stretched":42,"withHeadings":13},[1495,1499,1503,1507,1511,1515,1519,1523,1527],[1496,1497,1498],"Failure mode","Why it fools evaluators","What to test",[1500,1501,1502],"Citation decoration","The answer contains sources, so it looks researched","Map each material claim to an exact supporting span",[1504,1505,1506],"Authority mismatch","The source is reputable but not authoritative for the specific fact","Define claim-specific source hierarchy",[1508,1509,1510],"Temporal mismatch","The source was correct when published","Check retrieval time, source date, and superseding evidence",[1512,1513,1514],"Condition stripping","A summary keeps the conclusion but drops exceptions","Compare generated claim with full local source context",[1516,1517,1518],"Post-hoc citation","A plausible source is attached after the answer is generated","Inspect trace ordering and whether evidence preceded the claim",[1520,1521,1522],"Parametric override","The model ignores retrieved evidence and answers from prior knowledge","Run counterfactual evidence-utilization tests",[1524,1525,1526],"Evidence laundering","Model inference is summarized and later stored as if it were a source fact","Preserve transformation type and provenance across memory writes",[1528,1529,1530],"Source majority fallacy","Several secondary pages repeat the same unsupported statement","Trace claims back to independent or primary evidence",{},{"id":625,"data":1533,"type":41,"tunes":1535},{"text":1534,"level":218},"How to evaluate the agent in production",{},{"id":630,"data":1537,"type":392,"tunes":1564},{"steps":1538,"title":1563,"orientation":391},[1539,1542,1545,1548,1551,1554,1557,1560],{"label":1540,"description":1541},"1. Define material claims","Identify the facts, recommendations, or decisions whose correctness matters to the task.",{"label":1543,"description":1544},"2. Build gold evidence","Create reference evidence and source-quality expectations for representative cases.",{"label":1546,"description":1547},"3. Capture traces","Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.",{"label":1549,"description":1550},"4. Grade support","Check whether each material claim is directly, partially, contradictorily, or not supported.",{"label":1552,"description":1553},"5. Grade authority and applicability","Evaluate whether the source is appropriate and whether its conditions match the current task.",{"label":1555,"description":1556},"6. Run counterfactuals","Remove, replace, or supersede decisive evidence and test whether the answer follows the change.",{"label":1558,"description":1559},"7. Review high-impact failures","Use human or domain-expert review where automated grading is not reliable enough.",{"label":1561,"description":1562},"8. Convert failures into eval cases","Add production failures and edge cases to a repeatable regression dataset.","Evidence evaluation pipeline",{},{"id":660,"data":1566,"type":225,"tunes":1568},{"text":1567},"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.",{},{"id":665,"data":1570,"type":41,"tunes":1572},{"text":1571,"level":218},"Do not let an LLM judge become the only evidence judge",{},{"id":670,"data":1574,"type":225,"tunes":1576},{"text":1575},"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.",{},{"id":675,"data":1578,"type":225,"tunes":1580},{"text":1579},"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.",{},{"id":680,"data":1582,"type":41,"tunes":1584},{"text":1583,"level":218},"What would change this answer?",{},{"id":685,"data":1586,"type":225,"tunes":1588},{"text":1587},"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.",{},{"id":690,"data":1590,"type":225,"tunes":1592},{"text":1591},"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.",{},{"id":695,"data":1594,"type":225,"tunes":1596},{"text":1595},"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.",{},{"id":700,"data":1598,"type":41,"tunes":1600},{"text":1599,"level":218},"Limitations",{},{"id":705,"data":1602,"type":225,"tunes":1604},{"text":1603},"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.",{},{"id":710,"data":1606,"type":225,"tunes":1608},{"text":1607},"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.",{},{"id":715,"data":1610,"type":41,"tunes":1612},{"text":1611,"level":218},"Conclusion",{},{"id":720,"data":1614,"type":225,"tunes":1616},{"text":1615},"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?",{},{"id":725,"data":1618,"type":225,"tunes":1620},{"text":1619},"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.",{},{"id":730,"data":1622,"type":736,"tunes":1627},{"url":1623,"title":1624,"excerpt":1625,"ctaLabel":1626},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.","Read the related article",{},{"id":739,"data":1629,"type":736,"tunes":1634},{"url":1630,"title":1631,"excerpt":1632,"ctaLabel":1633},"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","From Research Protocol to a General AI Reasoning Framework","A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.","Read the reasoning framework",{},{"id":747,"data":1636,"type":41,"tunes":1637},{"text":749,"level":218},{},{"id":752,"data":1639,"type":752,"tunes":1657},{"items":1640,"title":1656},[1641,1644,1647,1650,1653],{"id":756,"answer":1642,"question":1643},"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.","Does a citation prove that an AI answer is grounded?",{"id":760,"answer":1645,"question":1646},"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.","How can I test whether an AI agent actually used retrieved evidence?",{"id":764,"answer":1648,"question":1649},"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.","What is the difference between groundedness and source quality?",{"id":768,"answer":1651,"question":1652},"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.","Why can a real source still produce a wrong AI answer?",{"id":772,"answer":1654,"question":1655},"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.","What should I log for evidence evaluation?","Evaluating evidence use in AI agents",{},{"id":778,"data":1659,"type":41,"tunes":1661},{"text":1660,"level":218},"Glossary",{},{"id":783,"data":1663,"type":783,"tunes":1681},{"title":1664,"entries":1665},"Key evidence-evaluation terms",[1666,1668,1670,1672,1675,1678],{"term":1241,"anchor":789,"definition":1667},"The degree to which a specific evidence span directly establishes a generated claim.",{"term":1245,"anchor":793,"definition":1669},"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.",{"term":1249,"anchor":566,"definition":1671},"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.",{"term":1673,"anchor":800,"definition":1674},"Evidence utilization","Whether the agent's output actually responds to and depends on the evidence made available in its execution path.",{"term":1676,"anchor":804,"definition":1677},"Counterfactual evidence test","An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.",{"term":1679,"anchor":808,"definition":1680},"Provenance","Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.",{},{"id":812,"data":1683,"type":41,"tunes":1685},{"text":1684,"level":218},"Primary sources and further reading",{},{"id":817,"data":1687,"type":824,"tunes":1691},{"link":819,"meta":1688},{"image":1689,"title":822,"description":1690},{"url":464},"Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.",{},{"id":827,"data":1693,"type":824,"tunes":1697},{"link":829,"meta":1694},{"image":1695,"title":832,"description":1696},{"url":464},"Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.",{},{"id":836,"data":1699,"type":824,"tunes":1703},{"link":838,"meta":1700},{"image":1701,"title":841,"description":1702},{"url":464},"Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.",{},{"id":845,"data":1705,"type":824,"tunes":1709},{"link":847,"meta":1706},{"image":1707,"title":850,"description":1708},{"url":464},"Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.",{},"2.31.6","An AI agent can cite sources and still use the wrong evidence. This article introduces a practical method for checking claim support, source authority, applicability, provenance, and whether the evidence actually influenced the answer.","Post erfolgreich abgerufen",{"items":1714,"source":1778,"manualIds":1779,"manualMatchedIds":1780},[1715,1722,1729,1736,1743,1750,1757,1764,1771],{"id":1716,"slug":1717,"title":1718,"excerpt":1719,"featuredImage":1720,"publishedAt":1721},"454","zbt-z8102ax-rm500u-ea-5g-modem-test","Quectel RM500U-EA im ZBT Z8102AX: 5G-Bänder, o2 Germany und Signalverhalten in der Praxis","Der ZBT Z8102AX verwendet ein Quectel RM500U-EA-Modem für die 4G- und 5G-Konnektivität. Im ersten Praxistest verband sich der Router erfolgreich mit o2 Germany mit LTE-Band 3 und NR n28. Das Modem funktioniert, aber tiefergehende Diagnosen wie RSRP, RSRQ, SINR, Band-Locking und Zellverhalten müssen noch richtig getestet werden.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-06-1781620597879-qay2sx.webp","2026-06-16T08:39:00.000Z",{"id":1723,"slug":1724,"title":1725,"excerpt":1726,"featuredImage":1727,"publishedAt":1728},"477","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","Computer-Use-Agenten: Warum eine erfolgreiche Demo dennoch ein unzuverlässiges System sein kann","Computer-Use-Agenten können mittlerweile beeindruckende Browser- und Desktop-Workflows abschließen, aber ein erfolgreicher Durchlauf beweist Fähigkeit—nicht Zuverlässigkeit. Dieser Artikel zeigt, wie man Wiederholbarkeit, Umgebungsrobustheit, Steuerung über lange Zeithorizonte, Zustandsbewusstsein, Ergebnisüberprüfung und sichere Zielhandhabung testet.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","2026-09-25T12:13:00.000Z",{"id":1730,"slug":1731,"title":1732,"excerpt":1733,"featuredImage":1734,"publishedAt":1735},"476","mcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained","MCP vs A2A vs UCP vs AP2 vs A2UI: Der Agenten-Protokoll-Stack erklärt","MCP, A2A, UCP, AP2 und A2UI werden oft als konkurrierende Agentenstandards dargestellt. Sie lösen größtenteils unterschiedliche Interoperabilitätsprobleme. Dieser Leitfaden ordnet jedes Protokoll der Grenze zu, die es tatsächlich standardisiert—und zeigt, wie sie in einem Produktionssystem zusammenarbeiten können.","\u002Fuploads\u002F2026\u002F09\u002Fmcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained-1790352625869-2ezle0.webp","2026-09-25T12:09:00.000Z",{"id":1737,"slug":1738,"title":1739,"excerpt":1740,"featuredImage":1741,"publishedAt":1742},"383","canonical-architecture-url-design-resolver-logic-api-scalability-specification","Kanonische Architektur, URL-Design, Resolver-Logik, API- & Skalierbarkeitsspezifikation","Geobasierte Erkennungsarchitektur für Mehrmandantenportale. Definiert kanonische URLs, Resolver-Logik, Caching-Strategie und ein Geo-Read-Modell ohne CMS-Kopplung oder Datenbank-Refactoring. Konzipiert für SEO-Stabilität, Skalierbarkeit und zukünftige Erweiterungen wie Buchung und Karten.","\u002Fuploads\u002F2026\u002F01\u002Fcanonical-architecture-url-design-resolver-logic-api-scalability-specification-1769890763607-7rghbp.webp","2026-01-31T06:12:00.000Z",{"id":1744,"slug":1745,"title":1746,"excerpt":1747,"featuredImage":1748,"publishedAt":1749},"457","should-you-buy-5g-openwrt-router-old-firmware","Sollten Sie einen 5G-OpenWrt-Router mit alter Firmware kaufen? ZBT Z8102AX als praktisches Beispiel","Kauf eines 5G-OpenWrt-Routers mit älterer Firmware kann sinnvoll sein, aber nur unter den richtigen Bedingungen. Der ZBT Z8102AX zeigt beide Seiten deutlich: Die Hardware ist nützlich, das Modem funktioniert, und der Router blieb im Test stabil, aber OpenWrt 21.02, schwache Verpackung und unklare Upgrade-Pfade erfordern eine sorgfältige Kaufentscheidung.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1751,"slug":1752,"title":1753,"excerpt":1754,"featuredImage":1755,"publishedAt":1756},"456","zbt-z8102ax-hardware-packaging-review","ZBT Z8102AX Hardware- und Verpackungs-Review: Starker Router, schwache Box","Der ZBT Z8102AX macht einen soliden ersten Eindruck als schlanker, schwarzer 5G-OpenWrt-Router aus Metall mit mehreren Antennenanschlüssen, Dual-SIM-Slots, USB- und LAN\u002FWAN-Ports und einem praktischen Zubehörset. Die Hardware fühlt sich nützlich und seriös an, aber die Verpackung ist eindeutig die Schwachstelle.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-02-1781620590938-y33j4b.webp","2026-06-16T04:40:00.000Z",{"id":1758,"slug":1759,"title":1760,"excerpt":1761,"featuredImage":1762,"publishedAt":1763},"470","what-should-an-ai-agent-remember-forget-recompute-or-retrieve-again","Was sollte ein KI-Agent behalten, vergessen, neu berechnen oder erneut abrufen?","Langlaufende Agenten sollten sich nicht alles merken. Dieser Artikel bietet ein praktisches Lebenszyklusmodell für die Entscheidung, was in den dauerhaften Speicher gehört, was erneut abgerufen werden sollte, was sicherer neu zu berechnen ist und was ablaufen oder ersetzt werden sollte.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-should-an-ai-agent-remember-forget-recompute-or-retrieve-again-1790351131087-iehz28.webp","2026-09-25T09:43:00.000Z",{"id":1765,"slug":1766,"title":1767,"excerpt":1768,"featuredImage":1769,"publishedAt":1770},"467","the-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","Die Antwortgültigkeitsgrenze: Die fehlende Schicht zwischen Relevanz und zuverlässigen KI-Antworten","Eine Quelle kann relevant und maßgeblich sein und dennoch falsch für die gestellte Frage. Die fehlende Ebene ist die Anwendbarkeit: die Bedingungen, unter denen eine Antwort gilt, und die Veränderungen, die erzwingen, dass sie überdacht werden muss. Dieser Artikel führt die Answer Validity Boundary als ein Quellendesign-Muster für Menschen, KI-Suche und RAG-Systeme ein.","\u002Fuploads\u002F2026\u002F09\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers-1790272901306-1g5jly.webp","2026-09-24T11:59:00.000Z",{"id":1772,"slug":1773,"title":1774,"excerpt":1775,"featuredImage":1776,"publishedAt":1777},"472","why-more-context-can-make-ai-answers-worse","Warum mehr Kontext KI-Antworten verschlechtern kann","Ein größeres Kontextfenster garantiert keine bessere Antwort. Dieser Artikel erklärt, wie Signalverwässerung, widersprüchliche Belege, veralteter Zustand, Positionssensitivität und verlustbehaftete Kompression die KI-Zuverlässigkeit verringern können—und stellt einen praktischen Context Pressure Test vor.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z","fallback",[],[]]