[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:it":3,"public-menus:all":38,"post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:it":205,"related:post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:it:1":1715},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","it","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1714},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":853,"featuredImage":854,"featuredImageAlt":855,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":856,"publishedAt":857,"createdAt":858,"updatedAt":859,"seoLocalePaths":860,"categories":869,"author":882,"translations":887},"471","Come sapere se un agente IA ha effettivamente usato le prove giuste","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Indice\">\u003Cstrong class=\"editorjs-toc__title\">Indice\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-5\" class=\"editorjs-toc__link\">Perché le citazioni non sono sufficienti\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-8\" class=\"editorjs-toc__link\">Le quattro domande che ogni affermazione rilevante dovrebbe superare\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">1. Supporto dell&#39;affermazione: la fonte dimostra ciò che l&#39;agente sostiene?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-13\" class=\"editorjs-toc__link\">2. Autorevolezza della prova: è il tipo di fonte corretto?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-16\" class=\"editorjs-toc__link\">3. Applicabilità: prove corrette, condizioni errate\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-20\" class=\"editorjs-toc__link\">4. Uso delle prove: l&#39;agente ha fatto effettivamente affidamento sulle prove?\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-23\" class=\"editorjs-toc__link\">Il Test di Utilizzo delle Prove\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-27\" class=\"editorjs-toc__link\">Una matrice affermazioni-prove è più utile di un elenco di fonti\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-30\" class=\"editorjs-toc__link\">Distinguere la qualità del recupero dalla qualità delle prove\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">Valutare la qualità delle fonti tramite una rubrica, non con una whitelist di domini\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-36\" class=\"editorjs-toc__link\">Copertura delle prove: ogni affermazione importante ha bisogno di supporto, non ogni frase\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-39\" class=\"editorjs-toc__link\">La provenienza delle prove deve sopravvivere alla sintesi e alla memoria\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-42\" class=\"editorjs-toc__link\">Un registro pratico delle prove\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-44\" class=\"editorjs-toc__link\">Modalità di fallimento che sembrano fondate ma non lo sono\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-46\" class=\"editorjs-toc__link\">Come valutare l&#39;agente in produzione\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-49\" class=\"editorjs-toc__link\">Non lasciare che un LLM as a judge sia l&#39;unico a valutare le prove\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-52\" class=\"editorjs-toc__link\">Cosa cambierebbe questa risposta?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-56\" class=\"editorjs-toc__link\">Limitazioni\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-59\" class=\"editorjs-toc__link\">Conclusione\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-64\" class=\"editorjs-toc__link\">Domande frequenti\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-66\" class=\"editorjs-toc__link\">Glossario\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-68\" class=\"editorjs-toc__link\">Fonti primarie e ulteriori letture\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>Un agente di IA può citare fonti, recuperare documenti e continuare a utilizzare le prove sbagliate. Una fonte può essere autorevole ma irrilevante rispetto all'affermazione esatta. Un passaggio recuperato può supportare solo una parte di una risposta. Una fonte corretta può essere obsoleta, superata o valida per la giurisdizione, la versione del prodotto, l'utente o lo stato del sistema errati. Ciò crea un problema di valutazione più complesso rispetto alla semplice verifica delle citazioni: l'agente ha effettivamente utilizzato le prove giuste per l'affermazione formulata?\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Risposta diretta\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Per sapere se un agente di IA ha utilizzato le prove corrette, valuta la catena &lt;strong&gt;Affermazione → Prova → Applicabilità → Utilizzo&lt;\u002Fstrong&gt;. Per ogni affermazione rilevante, verifica che la prova la supporti direttamente, provenga da un&#39;autorità appropriata, sia applicabile alle condizioni attuali e fosse effettivamente disponibile per l&#39;agente prima che l&#39;affermazione venisse generata. Una citazione da sola non dimostra nulla di tutto ciò.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Informazioni sul metodo\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Il modello Claim–Evidence–Applicability–Use e l&#39;Evidence Utilization Test descritti in questo articolo sono metodi di valutazione pratici, non standard formali di settore. Si basano su principi consolidati come groundedness, qualità delle fonti, copertura delle citazioni, valutazione delle tracce e benchmark specifici per il task.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-5\">Perché le citazioni non sono sufficienti\u003C\u002Fh2>\n\u003Cp>Una citazione risponde solo a una domanda circoscritta: il sistema ha associato un'affermazione o una risposta a una fonte. Non stabilisce automaticamente che la fonte supporti l'affermazione specifica, che la fonte sia sufficientemente autorevole per il compito, che il passaggio citato contenga la condizione o l'eccezione necessaria o che il modello si sia basato su tale prova anziché generare la risposta a partire dalle proprie conoscenze pregresse.\u003C\u002Fp>\n\u003Cp>Le linee guida di Anthropic per la valutazione degli agenti di ricerca separano esplicitamente groundedness, copertura e qualità delle fonti. Analogamente, le linee guida di OpenAI per la valutazione degli agenti pongono l'accento sulle tracce di esecuzione, poiché l'output finale non rivela se l'agente abbia selezionato gli strumenti corretti o seguito il flusso di lavoro previsto. Tali considerazioni portano a una conclusione più ampia: la qualità delle prove è una proprietà del percorso di esecuzione, non solo della prosa finale.\u003C\u002Fp>\n\u003Ch2 id=\"section-8\">Le quattro domande che ogni affermazione rilevante dovrebbe superare\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Dimensione\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Domanda\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Errore tipico\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Supporto dell'affermazione\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La prova supporta direttamente questa specifica affermazione?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La fonte è correlata all'argomento ma non dimostra l'affermazione\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autorevolezza della prova\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Si tratta di una fonte appropriata per questo tipo di affermazione?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Viene utilizzata una sintesi secondaria laddove è richiesta una fonte primaria o un sistema in tempo reale\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Applicabilità\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La prova si applica a questo periodo, versione, giurisdizione, utente, stato o popolazione?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Un'affermazione vera viene applicata al di fuori delle sue condizioni di validità\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Utilizzo della prova\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Questa prova era effettivamente disponibile e utilizzata nel percorso di esecuzione dell'agente?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La risposta finale è corretta, ma la prova recuperata era irrilevante o non utilizzata\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch3 id=\"section-10\">1. Supporto dell'affermazione: la fonte dimostra ciò che l'agente sostiene?\u003C\u002Fh3>\n\u003Cp>Le prove dovrebbero essere valutate a livello di singola affermazione. Un documento può essere pertinente all'argomento e tuttavia non supportare una dichiarazione specifica. Se una fonte afferma che una funzionalità è disponibile solo in determinate regioni, la risposta “la funzionalità è disponibile a livello globale” non è supportata, anche se la citazione appare plausibile.\u003C\u002Fp>\n\u003Cp>È qui che le valutazioni generiche del tipo “fondato \u002F non fondato” risultano spesso troppo approssimative. Suddividi la risposta in affermazioni rilevanti, associa ciascuna affermazione alla porzione minima di prova che la supporta e classifica la relazione: supporto diretto, supporto parziale, contraddizione o nessun supporto.\u003C\u002Fp>\n\u003Ch3 id=\"section-13\">2. Autorevolezza della prova: è il tipo di fonte corretto?\u003C\u002Fh3>\n\u003Cp>La selezione corretta delle prove non riguarda solo la pertinenza semantica. La fonte deve essere adeguata alla decisione da prendere. Lo stato attuale dell'account deve provenire dal sistema di gestione degli account, non da una vecchia e-mail. Un'affermazione sul comportamento di un'API dovrebbe preferibilmente essere verificata rispetto alla documentazione aggiornata del fornitore o a un comportamento riproducibile. Un requisito legale può richiedere la legge applicabile, l'autorità di regolamentazione o linee guida ufficiali, piuttosto che un generico articolo di blog.\u003C\u002Fp>\n\u003Cp>L'autorevolezza della fonte dipende dal compito specifico. La segnalazione di una community può rappresentare la prova migliore per un bug reale non riconosciuto dalla documentazione del fornitore. L'annuncio di un fornitore può essere autorevole per ciò che il fornitore dichiara, ma costituire una prova debole per una valutazione indipendente delle prestazioni. Chi valuta necessita pertanto di una gerarchia esplicita delle fonti per il compito specifico, piuttosto che di un unico punteggio di autorevolezza universale.\u003C\u002Fp>\n\u003Ch3 id=\"section-16\">3. Applicabilità: prove corrette, condizioni errate\u003C\u002Fh3>\n\u003Cp>Gli errori più insidiosi nell'uso delle prove spesso non derivano da fonti inventate, ma da fonti valide impiegate al di fuori dei loro limiti di applicabilità. Una raccomandazione può variare in base alla versione del software, alla data, alla giurisdizione, alla revisione hardware, ai permessi utente, alla disponibilità del prodotto, allo stato corrente del gioco, alla configurazione del tenant o ad altre variabili ambientali.\u003C\u002Fp>\n\u003Cp>Per ogni fonte rilevante, preserva le condizioni che determinano se sia ancora applicabile. Questo aspetto è particolarmente critico dopo una sintesi: una memoria compressa o una citazione può conservare la conclusione tralasciando l'eccezione, la data o il prerequisito che ne determinavano la validità.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Le prove possono essere autentiche e risultare comunque errate per la risposta\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Una fonte reale, citata accuratamente, può comunque produrre una risposta errata quando il suo periodo temporale, la versione, la popolazione, la giurisdizione o lo stato non corrispondono alla domanda corrente.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-20\">4. Uso delle prove: l'agente ha fatto effettivamente affidamento sulle prove?\u003C\u002Fh3>\n\u003Cp>Una risposta può essere corretta anche quando il recupero delle informazioni è fallito. Il modello potrebbe già conoscere la risposta, dedurla da un contesto non correlato o semplicemente indovinare correttamente. Se la valutazione verifica solo la correttezza finale, il sistema può sembrare ben fondato anche quando il percorso probatorio è interrotto.\u003C\u002Fp>\n\u003Cp>Per valutare l'uso delle prove, esamina la traccia. Verifica quali fonti sono state recuperate, quali passaggi hanno raggiunto il contesto del modello, quando sono diventati disponibili e se l'affermazione finale può essere spiegata da tali input. Gli attuali strumenti di valutazione degli agenti di OpenAI pongono l'accento sulla valutazione delle tracce proprio perché il comportamento a livello di flusso di lavoro non può essere ricostruito in modo affidabile solo a partire dalla risposta finale.\u003C\u002Fp>\n\u003Ch2 id=\"section-23\">Il Test di Utilizzo delle Prove\u003C\u002Fh2>\n\u003Cp>Una valutazione pratica può essere strutturata come un controfattuale controllato. Invece di chiedersi solo se la risposta sia corretta, modifica le prove e osserva se l'affermazione cambia nella direzione prevista.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Test di Utilizzo delle Prove\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Seleziona un'affermazione rilevante\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Scegli un'affermazione la cui correttezza sia essenziale e definisci con precisione la risposta attesa.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Identifica la prova di riferimento (gold evidence)\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Fornisci l'insieme minimo e autorevole di prove sufficiente a supportare l'affermazione.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Esegui il test con la prova di riferimento\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Verifica che l'agente produca la risposta supportata quando la prova corretta è disponibile.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Rimuovi la prova decisiva\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Esegui la stessa attività senza il passaggio chiave a supporto, mantenendo stabili gli altri input.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Sostituiscila con una prova contraddittoria o prevalente\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Laddove sia sicuro, fornisci prove controllate che modifichino la conclusione corretta.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Confronta le affermazioni\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Verifica se la risposta segue la modifica delle prove o se rimane ancorata alle conoscenze pregresse del modello.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Esamina la traccia\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Conferma cosa è stato recuperato, cosa ha raggiunto il contesto e quale fonte o risultato dello strumento ha preceduto l'affermazione.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Il segnale chiave\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Se la prova decisiva cambia ma l&#39;affermazione dell&#39;agente non cambia, hai la dimostrazione che il sistema potrebbe non utilizzare il recupero come previsto — anche quando la risposta originale era casualmente corretta.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-27\">Una matrice affermazioni-prove è più utile di un elenco di fonti\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Affermazione\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Prova\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Supporto\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Autorevolezza\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Applicabilità\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Utilizzata nella traccia\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La funzionalità X è disponibile\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Documentazione del fornitore\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Diretto\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Alta per l'affermazione sulla disponibilità\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La versione attuale e la regione devono corrispondere\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sì \u002F No\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La configurazione Y è più veloce\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Benchmark del fornitore\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Parziale\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Alta per il test del fornitore, non per le prestazioni indipendenti\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'hardware e il carico di lavoro devono corrispondere\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sì \u002F No\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La policy si applica a questo utente\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Policy attuale + stato dell'account\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Diretto solo se combinati\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Alta\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Giurisdizione, data, ruolo e stato dell'account devono corrispondere\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sì \u002F No\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Un prodotto è disponibile\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">API dell'inventario in tempo reale\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Diretto\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autorevole per le scorte attuali\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Scade rapidamente\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sì \u002F No\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Questa matrice impone diverse domande che la verifica convenzionale delle citazioni nasconde. Una singola affermazione può richiedere più fonti. Una fonte può supportare solo una parte di un'affermazione. Una fonte autorevole può avere una finestra di validità limitata. E una fonte del tutto valida può risultare irrilevante se non è mai entrata nel percorso di esecuzione.\u003C\u002Fp>\n\u003Ch2 id=\"section-30\">Distinguere la qualità del recupero dalla qualità delle prove\u003C\u002Fh2>\n\u003Cp>Le metriche di recupero valutano se il materiale rilevante è stato individuato e classificato. La valutazione delle prove verifica se quel materiale giustifica le affermazioni risultanti. I due aspetti sono correlati ma non identici.\u003C\u002Fp>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Il successo nel recupero non equivale alla validità delle prove\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Situazione\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Recupero\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Qualità delle prove\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Documento corretto, affermazione errata\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Fatto corretto, fonte obsoleta\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Fonte debole, risposta corretta\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Necessarie fonti multiple\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-33\">Valutare la qualità delle fonti tramite una rubrica, non con una whitelist di domini\u003C\u002Fh2>\n\u003Cp>Le liste statiche di “domini attendibili” sono allettanti ma spesso fragili. La qualità della fonte dovrebbe invece riflettere il tipo di affermazione. Dimensioni utili includono lo stato primario o secondario, la tempestività, la pertinenza diretta, la riproducibilità, l'indipendenza, la competenza specifica nel dominio, la provenienza dei dati, la frequenza di aggiornamento e l'eventuale interesse della fonte a enfatizzare l'affermazione.\u003C\u002Fp>\n\u003Cp>Le linee guida per la valutazione degli agenti di ricerca di Anthropic richiedono esplicitamente verifiche sulla qualità delle fonti, insieme alla fondatezza e alla copertura. L'implementazione pratica dovrebbe quindi valutare sia ciò che la fonte afferma, sia l'adeguatezza della fonte per quel tipo di dichiarazione.\u003C\u002Fp>\n\u003Ch2 id=\"section-36\">Copertura delle prove: ogni affermazione importante ha bisogno di supporto, non ogni frase\u003C\u002Fh2>\n\u003Cp>Non tutte le frasi necessitano di una citazione. Il linguaggio di transizione, i calcoli aritmetici derivati in modo trasparente da valori citati o un'interpretazione chiaramente contrassegnata potrebbero non richiedere una fonte separata. Tuttavia, ogni affermazione rilevante e verificabile esternamente dovrebbe disporre di un supporto sufficiente a consentire a un valutatore di ricostruire il motivo per cui l'agente era autorizzato a formularla.\u003C\u002Fp>\n\u003Cp>La copertura dovrebbe pertanto essere ponderata in base all'importanza dell'affermazione. La mancanza di supporto per un dettaglio decorativo non equivale alla mancanza di supporto per un prezzo, una decisione di idoneità, un'istruzione di sicurezza, un requisito legale, una dichiarazione di compatibilità tecnica o un fatto determinante per una raccomandazione.\u003C\u002Fp>\n\u003Ch2 id=\"section-39\">La provenienza delle prove deve sopravvivere alla sintesi e alla memoria\u003C\u002Fh2>\n\u003Cp>Gli agenti a lunga esecuzione spesso riassumono il lavoro precedente o scrivono memorie persistenti. Se la provenienza delle prove viene rimossa durante tale trasformazione, gli agenti futuri potrebbero recuperare una conclusione chiara senza sapere se proviene da una dichiarazione dell'utente, da un'API attiva, da un vecchio documento, da un'inferenza del modello o da un risultato web non verificato.\u003C\u002Fp>\n\u003Cp>Per i fatti importanti, conserva almeno l'identità della fonte, l'orario di recupero o di osservazione, il tipo di prova, la versione o lo stato pertinente e se il testo memorizzato è citato testualmente, riassunto, inferito o derivato. La provenienza è ciò che consente a un agente successivo di decidere se la prova debba essere considerata attendibile, aggiornata, limitata o scartata.\u003C\u002Fp>\n\u003Ch2 id=\"section-42\">Un registro pratico delle prove\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Field\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Scopo\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">claim_id\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Identifica l'affermazione rilevante supportata\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_id \u002F source_url \u002F system\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Identifica la provenienza della prova\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">evidence_span\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Conserva il passaggio, il record o il risultato del tool più piccolo che supporta l'affermazione\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">retrieved_at \u002F observed_at\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Consente verifiche di freschezza e temporali\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_version \u002F object_version\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Consente verifiche di obsolescenza e riproducibilità\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">authority_role\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Spiega perché questa fonte è appropriata per questa affermazione\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">applicability\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Memorizza data pertinente, giurisdizione, versione del prodotto, utente, tenant, stato o altre condizioni\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">transformation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Indica se la prova è grezza, citata, riassunta, normalizzata o derivata\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">trace_step\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Mostra quando la prova è diventata disponibile per l'agente\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">support_status\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Diretto, parziale, contraddittorio, non supportato o incerto\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-44\">Modalità di fallimento che sembrano fondate ma non lo sono\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Modalità di fallimento\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Perché inganna i valutatori\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Cosa testare\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Citazione decorativa\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La risposta contiene fonti, quindi sembra documentata\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Mappa ogni affermazione rilevante a un passaggio di supporto esatto\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Mancata corrispondenza di autorevolezza\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La fonte è affidabile ma non autorevole per il fatto specifico\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Definisci una gerarchia delle fonti specifica per l'affermazione\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Discrepanza temporale\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La fonte era corretta al momento della pubblicazione\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Verifica l'orario di recupero, la data della fonte e le prove successive che la sostituiscono\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Rimozione delle condizioni\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Una sintesi mantiene la conclusione ma omette le eccezioni\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Confronta l'affermazione generata con il contesto completo della fonte locale\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Citazione post-hoc\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Una fonte plausibile viene allegata dopo la generazione della risposta\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ispeziona l'ordine della traccia e verifica se la prova ha preceduto l'affermazione\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sovrascrittura parametrica\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Il modello ignora le prove recuperate e risponde in base alle conoscenze pregresse\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Esegui test controfattuali sull'utilizzo delle prove\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Riciclaggio delle prove\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'inferenza del modello viene riassunta e successivamente memorizzata come se fosse un fatto della fonte\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Preserva il tipo di trasformazione e la provenienza attraverso le scritture in memoria\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Fallacia della maggioranza delle fonti\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Diverse pagine secondarie ripetono la stessa affermazione non supportata\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ripercorri le affermazioni fino a prove indipendenti o primarie\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-46\">Come valutare l'agente in produzione\u003C\u002Fh2>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Pipeline di valutazione delle prove\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Definire le affermazioni rilevanti\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identificare i fatti, le raccomandazioni o le decisioni la cui correttezza è fondamentale per l'attività.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Creare prove di riferimento (gold standard)\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Creare prove di riferimento e aspettative sulla qualità delle fonti per casi rappresentativi.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Acquisire le tracce\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Registrare query di recupero, chiamate a tool, prove restituite, costruzione del contesto, output del modello e citazioni.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Valutare il supporto\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Verificare se ciascuna affermazione rilevante è supportata in modo diretto, parziale, contraddittorio o non supportata.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Valutare autorevolezza e applicabilità\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Valutare se la fonte è appropriata e se le sue condizioni corrispondono all'attività corrente.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Eseguire test controfattuali\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Rimuovere, sostituire o invalidare prove decisive e verificare se la risposta si adegua alla modifica.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Esaminare i fallimenti ad alto impatto\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Ricorrere alla revisione umana o di esperti di dominio laddove la valutazione automatizzata non sia sufficientemente affidabile.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Convertire i fallimenti in casi di valutazione\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Aggiungere i fallimenti in produzione e i casi limite a un set di dati di regressione ripetibile.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>Le attuali linee guida di valutazione di OpenAI raccomandano valutazioni specifiche per l'attività, valutazione continua, set di dati derivati dalla produzione e tracce per il debug del comportamento dell'agente. Allo stesso modo, Anthropic raccomanda di combinare diversi tipi di valutatori per gli agenti di ricerca, poiché correttezza, qualità della fonte, copertura e fondatezza sono dimensioni distinte. La valutazione delle prove dovrebbe seguire lo stesso schema: diversi valutatori mirati offrono una diagnosi migliore rispetto a un unico punteggio opaco di “qualità”.\u003C\u002Fp>\n\u003Ch2 id=\"section-49\">Non lasciare che un LLM as a judge sia l'unico a valutare le prove\u003C\u002Fh2>\n\u003Cp>I valutatori LLM sono utili per la classificazione scalabile delle affermazioni, i controlli di pertinenza e i confronti a coppie, ma possono condividere gli stessi punti ciechi del sistema che valutano. Un valutatore potrebbe accettare un'affermazione plausibile ma priva di supporto, ignorare un sottile confine di versione o sovrastimare una fonte ben scritta.\u003C\u002Fp>\n\u003Cp>Le linee guida di valutazione di OpenAI raccomandano di calibrare i valutatori automatizzati rispetto al giudizio umano e di utilizzare criteri chiari e ben delimitati. Per i sistemi fortemente basati su prove, dovrebbero essere utilizzati controlli deterministici ovunque possibile: timestamp, versioni degli oggetti, ambito dei permessi, ID esatti delle fonti, ordine di recupero, hash dei documenti e presenza della prova prima che il modello generasse l'affermazione.\u003C\u002Fp>\n\u003Ch2 id=\"section-52\">Cosa cambierebbe questa risposta?\u003C\u002Fh2>\n\u003Cp>La valutazione può essere più semplice quando l'agente opera su un corpus ristretto, immutabile e autorevole, e ogni risposta è strettamente estrattiva. In un contesto simile, l'autorevolezza e l'applicabilità della fonte sono per lo più fisse e la corrispondenza del supporto tra affermazione e porzione di testo può essere sufficiente.\u003C\u002Fp>\n\u003Cp>La valutazione deve farsi più rigorosa quando l'agente combina ricerche web, memoria a lungo termine, tool in tempo reale, molteplici giurisdizioni, informazioni in rapido mutamento, stato specifico dell'utente o azioni autonome. In tali sistemi, la validità delle prove non dipende solo dal testo di partenza, ma anche da quando e come la prova è stata ottenuta.\u003C\u002Fp>\n\u003Cp>I modelli futuri potrebbero diventare più abili nel tracciare internamente provenienza e incertezza, ma ciò non eliminerebbe la necessità di registri di evidenze esterne nei sistemi che richiedono verificabilità. Un sistema non dovrebbe dipendere dall'auto-segnalazione del modello su cosa lo abbia influenzato, quando le tracce e i metadati delle fonti possono fornire prove più solide.\u003C\u002Fp>\n\u003Ch2 id=\"section-56\">Limitazioni\u003C\u002Fh2>\n\u003Cp>Non è sempre possibile dimostrare l'uso causale delle evidenze basandosi unicamente sulle tracce. Una fonte può essere presente nel contesto senza influenzare la risposta, e un modello potrebbe conoscere lo stesso fatto in modo indipendente. I test controfattuali rafforzano l'inferenza, ma possono essi stessi alterare la distribuzione del task.\u003C\u002Fp>\n\u003Cp>L'autorevolezza delle fonti può anche essere contestata o dipendere dal dominio. Alcune domande non hanno un'unica fonte autorevole e gli esperti possono dissentire su quale evidenza meriti maggior peso. In questi casi, il valutatore dovrebbe preservare il disaccordo e valutare trasparenza, copertura e ragionamento rispetto a una rubrica esplicita, anziché fingere che esista un'unica fonte di verità indiscutibile.\u003C\u002Fp>\n\u003Ch2 id=\"section-59\">Conclusione\u003C\u002Fh2>\n\u003Cp>La domanda \"L'agente ha citato una fonte?\" è troppo debole per l'IA in produzione. La domanda più incisiva è: ogni affermazione importante proviene da un'evidenza che la supporta effettivamente, possiede la corretta autorevolezza, si applica ancora alle condizioni attuali ed era disponibile nel percorso di esecuzione prima che l'affermazione fosse formulata?\u003C\u002Fp>\n\u003Cp>Questo trasforma le evidenze da elemento decorativo a proprietà valutabile del sistema. Cattura la traccia. Mappa le affermazioni sulle evidenze. Verifica autorevolezza e applicabilità. Esegui test controfattuali sulle evidenze. Preserva la provenienza attraverso sintesi e memoria. In questo modo, una risposta corretta non è solo plausibile: ha un percorso di evidenze che puoi ispezionare.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fit\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Affidabilità degli agenti IA: perché la risposta finale non basta\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">La correttezza del risultato da sola non può dimostrare che il percorso di esecuzione di un agente sia stato sicuro o affidabile. Questo articolo correlato spiega l'importanza di traiettorie, strumenti e decisioni intermedie.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Leggi l'articolo correlato →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fit\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Dal protocollo di ricerca a un framework generale di ragionamento per l'IA\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Un metodo pratico di ragionamento per separare evidenze, presupposti, ipotesi concorrenti e validazione specifica di dominio.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Leggi il framework di ragionamento →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-64\">Domande frequenti\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Valutare l&#39;uso delle evidenze negli agenti IA\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Una citazione dimostra che una risposta dell&#39;IA è fondata?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">No. Una citazione può essere pertinente all&#39;argomento senza supportare l&#39;affermazione esatta, può provenire da un&#39;autorità inadeguata, può non essere più applicabile o può essere stata aggiunta senza influenzare materialmente la risposta generata.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Come posso verificare se un agente IA ha effettivamente utilizzato l&#39;evidenza recuperata?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Utilizza un test controfattuale sull&#39;utilizzo delle evidenze: esegui il task con prove certe e corrette, poi rimuovi o sostituisci l&#39;evidenza decisiva mantenendo stabili gli altri input. Se la risposta non reagisce alla modifica dell&#39;evidenza, verifica se il modello fa affidamento su conoscenze pregresse o su un&#39;altra fonte.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Qual è la differenza tra fondatezza e qualità della fonte?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">La fondatezza verifica se le affermazioni sono supportate dalle evidenze fornite. La qualità della fonte verifica se l&#39;evidenza stessa sia appropriata e sufficientemente autorevole per il tipo di affermazione avanzata.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Perché una fonte reale può comunque generare una risposta IA errata?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">La fonte potrebbe essere obsoleta, superata, valida per un&#39;altra versione, giurisdizione, utente, popolazione o stato del sistema, oppure potrebbe contenere condizioni andate perdute durante il recupero o la sintesi.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Cosa occorre registrare nei log per la valutazione delle evidenze?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Registra la query di recupero, le fonti restituite, i passaggi esatti delle evidenze, timestamp e versioni, i filtri, il contesto finale, l&#39;output del modello, le citazioni e l&#39;ordine delle tracce, in modo che i valutatori possano ricostruire quali evidenze erano disponibili prima di ciascuna affermazione rilevante.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-66\">Glossario\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Termini chiave per la valutazione delle evidenze\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"claim-support\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Supporto dell'affermazione\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Il grado in cui uno specifico estratto di evidenza dimostra direttamente un'affermazione generata.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-authority\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Autorevolezza dell'evidenza\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Il grado di adeguatezza di una fonte nel comprovare una particolare affermazione, in base al suo ruolo, alla provenienza e al legame con il fatto sottostante.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"applicability\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Applicabilità\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Le condizioni entro cui un'evidenza rimane valida per un'affermazione, inclusi tempo, versione, giurisdizione, utente, popolazione, stato del sistema o altri limiti.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-utilization\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Utilizzo delle evidenze\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">La misura in cui l'output dell'agente risponde effettivamente e dipende dalle evidenze rese disponibili nel suo percorso di esecuzione.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"counterfactual-evidence-test\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Test controfattuale sulle evidenze\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Una valutazione che rimuove, sostituisce o modifica un'evidenza decisiva per verificare se l'affermazione dell'agente cambia di conseguenza.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"provenance\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Provenienza\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Metadati che registrano l'origine dell'evidenza, il momento in cui è stata ottenuta, il modo in cui è stata trasformata e quale versione o stato rappresentava.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-68\">Fonti primarie e ulteriori letture\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Evaluate Agent Workflows\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Linee guida sulla valutazione delle tracce, valutazione a livello di workflow, dataset ed esecuzioni di valutazione ripetibili per agenti.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Evaluation Best Practices\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Linee guida su valutazioni specifiche per task, dataset derivati dalla produzione, metriche circoscritte, valutazione continua e calibrazione del grader.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Anthropic — Demystifying Evals for AI Agents\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Guida alla valutazione degli agenti, inclusi controlli di fondatezza, copertura e qualità delle fonti per agenti di ricerca.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Linee guida di valutazione che evidenziano come le prestazioni degli agenti moderni dipendano dal workflow e dall&#39;ambiente, non solo dall&#39;output finale del modello.\u003C\u002Fp>\u003C\u002Fa>",{"time":212,"blocks":213,"version":852},1790368321896,[214,222,228,236,243,248,253,258,263,289,294,299,304,309,314,319,324,329,334,341,346,351,356,361,366,395,402,407,442,447,452,457,491,496,501,506,511,516,521,526,531,536,541,579,584,625,630,660,665,670,675,680,685,690,695,700,705,710,715,720,725,730,739,747,752,778,783,810,815,825,834,843],{"id":215,"data":216,"type":220,"tunes":221},"0hk9UtwqZf",{"title":217,"maxLevel":218,"minLevel":219},"Indice",3,2,"tableOfContents",{},{"id":223,"data":224,"type":226,"tunes":227},"intro",{"text":225},"Un agente di IA può citare fonti, recuperare documenti e continuare a utilizzare le prove sbagliate. Una fonte può essere autorevole ma irrilevante rispetto all'affermazione esatta. Un passaggio recuperato può supportare solo una parte di una risposta. Una fonte corretta può essere obsoleta, superata o valida per la giurisdizione, la versione del prodotto, l'utente o lo stato del sistema errati. Ciò crea un problema di valutazione più complesso rispetto alla semplice verifica delle citazioni: l'agente ha effettivamente utilizzato le prove giuste per l'affermazione formulata?","paragraph",{},{"id":229,"data":230,"type":234,"tunes":235},"direct",{"body":231,"title":232,"variant":233},"Per sapere se un agente di IA ha utilizzato le prove corrette, valuta la catena \u003Cstrong>Affermazione → Prova → Applicabilità → Utilizzo\u003C\u002Fstrong>. Per ogni affermazione rilevante, verifica che la prova la supporti direttamente, provenga da un'autorità appropriata, sia applicabile alle condizioni attuali e fosse effettivamente disponibile per l'agente prima che l'affermazione venisse generata. Una citazione da sola non dimostra nulla di tutto ciò.","Risposta diretta","info","callout",{},{"id":237,"data":238,"type":234,"tunes":242},"method-note",{"body":239,"title":240,"variant":241},"Il modello Claim–Evidence–Applicability–Use e l'Evidence Utilization Test descritti in questo articolo sono metodi di valutazione pratici, non standard formali di settore. Si basano su principi consolidati come groundedness, qualità delle fonti, copertura delle citazioni, valutazione delle tracce e benchmark specifici per il task.","Informazioni sul metodo","note",{},{"id":244,"data":245,"type":42,"tunes":247},"h-citations",{"text":246,"level":219},"Perché le citazioni non sono sufficienti",{},{"id":249,"data":250,"type":226,"tunes":252},"p-citations-1",{"text":251},"Una citazione risponde solo a una domanda circoscritta: il sistema ha associato un'affermazione o una risposta a una fonte. Non stabilisce automaticamente che la fonte supporti l'affermazione specifica, che la fonte sia sufficientemente autorevole per il compito, che il passaggio citato contenga la condizione o l'eccezione necessaria o che il modello si sia basato su tale prova anziché generare la risposta a partire dalle proprie conoscenze pregresse.",{},{"id":254,"data":255,"type":226,"tunes":257},"p-citations-2",{"text":256},"Le linee guida di Anthropic per la valutazione degli agenti di ricerca separano esplicitamente groundedness, copertura e qualità delle fonti. Analogamente, le linee guida di OpenAI per la valutazione degli agenti pongono l'accento sulle tracce di esecuzione, poiché l'output finale non rivela se l'agente abbia selezionato gli strumenti corretti o seguito il flusso di lavoro previsto. Tali considerazioni portano a una conclusione più ampia: la qualità delle prove è una proprietà del percorso di esecuzione, non solo della prosa finale.",{},{"id":259,"data":260,"type":42,"tunes":262},"h-four",{"text":261,"level":219},"Le quattro domande che ogni affermazione rilevante dovrebbe superare",{},{"id":264,"data":265,"type":287,"tunes":288},"table-four",{"content":266,"stretched":43,"withHeadings":14},[267,271,275,279,283],[268,269,270],"Dimensione","Domanda","Errore tipico",[272,273,274],"Supporto dell'affermazione","La prova supporta direttamente questa specifica affermazione?","La fonte è correlata all'argomento ma non dimostra l'affermazione",[276,277,278],"Autorevolezza della prova","Si tratta di una fonte appropriata per questo tipo di affermazione?","Viene utilizzata una sintesi secondaria laddove è richiesta una fonte primaria o un sistema in tempo reale",[280,281,282],"Applicabilità","La prova si applica a questo periodo, versione, giurisdizione, utente, stato o popolazione?","Un'affermazione vera viene applicata al di fuori delle sue condizioni di validità",[284,285,286],"Utilizzo della prova","Questa prova era effettivamente disponibile e utilizzata nel percorso di esecuzione dell'agente?","La risposta finale è corretta, ma la prova recuperata era irrilevante o non utilizzata","table",{},{"id":290,"data":291,"type":42,"tunes":293},"h-support",{"text":292,"level":218},"1. Supporto dell'affermazione: la fonte dimostra ciò che l'agente sostiene?",{},{"id":295,"data":296,"type":226,"tunes":298},"p-support-1",{"text":297},"Le prove dovrebbero essere valutate a livello di singola affermazione. Un documento può essere pertinente all'argomento e tuttavia non supportare una dichiarazione specifica. Se una fonte afferma che una funzionalità è disponibile solo in determinate regioni, la risposta “la funzionalità è disponibile a livello globale” non è supportata, anche se la citazione appare plausibile.",{},{"id":300,"data":301,"type":226,"tunes":303},"p-support-2",{"text":302},"È qui che le valutazioni generiche del tipo “fondato \u002F non fondato” risultano spesso troppo approssimative. Suddividi la risposta in affermazioni rilevanti, associa ciascuna affermazione alla porzione minima di prova che la supporta e classifica la relazione: supporto diretto, supporto parziale, contraddizione o nessun supporto.",{},{"id":305,"data":306,"type":42,"tunes":308},"h-authority",{"text":307,"level":218},"2. Autorevolezza della prova: è il tipo di fonte corretto?",{},{"id":310,"data":311,"type":226,"tunes":313},"p-authority-1",{"text":312},"La selezione corretta delle prove non riguarda solo la pertinenza semantica. La fonte deve essere adeguata alla decisione da prendere. Lo stato attuale dell'account deve provenire dal sistema di gestione degli account, non da una vecchia e-mail. Un'affermazione sul comportamento di un'API dovrebbe preferibilmente essere verificata rispetto alla documentazione aggiornata del fornitore o a un comportamento riproducibile. Un requisito legale può richiedere la legge applicabile, l'autorità di regolamentazione o linee guida ufficiali, piuttosto che un generico articolo di blog.",{},{"id":315,"data":316,"type":226,"tunes":318},"p-authority-2",{"text":317},"L'autorevolezza della fonte dipende dal compito specifico. La segnalazione di una community può rappresentare la prova migliore per un bug reale non riconosciuto dalla documentazione del fornitore. L'annuncio di un fornitore può essere autorevole per ciò che il fornitore dichiara, ma costituire una prova debole per una valutazione indipendente delle prestazioni. Chi valuta necessita pertanto di una gerarchia esplicita delle fonti per il compito specifico, piuttosto che di un unico punteggio di autorevolezza universale.",{},{"id":320,"data":321,"type":42,"tunes":323},"h-applicability",{"text":322,"level":218},"3. Applicabilità: prove corrette, condizioni errate",{},{"id":325,"data":326,"type":226,"tunes":328},"p-apply-1",{"text":327},"Gli errori più insidiosi nell'uso delle prove spesso non derivano da fonti inventate, ma da fonti valide impiegate al di fuori dei loro limiti di applicabilità. Una raccomandazione può variare in base alla versione del software, alla data, alla giurisdizione, alla revisione hardware, ai permessi utente, alla disponibilità del prodotto, allo stato corrente del gioco, alla configurazione del tenant o ad altre variabili ambientali.",{},{"id":330,"data":331,"type":226,"tunes":333},"p-apply-2",{"text":332},"Per ogni fonte rilevante, preserva le condizioni che determinano se sia ancora applicabile. Questo aspetto è particolarmente critico dopo una sintesi: una memoria compressa o una citazione può conservare la conclusione tralasciando l'eccezione, la data o il prerequisito che ne determinavano la validità.",{},{"id":335,"data":336,"type":234,"tunes":340},"apply-warning",{"body":337,"title":338,"variant":339},"Una fonte reale, citata accuratamente, può comunque produrre una risposta errata quando il suo periodo temporale, la versione, la popolazione, la giurisdizione o lo stato non corrispondono alla domanda corrente.","Le prove possono essere autentiche e risultare comunque errate per la risposta","warning",{},{"id":342,"data":343,"type":42,"tunes":345},"h-use",{"text":344,"level":218},"4. Uso delle prove: l'agente ha fatto effettivamente affidamento sulle prove?",{},{"id":347,"data":348,"type":226,"tunes":350},"p-use-1",{"text":349},"Una risposta può essere corretta anche quando il recupero delle informazioni è fallito. Il modello potrebbe già conoscere la risposta, dedurla da un contesto non correlato o semplicemente indovinare correttamente. Se la valutazione verifica solo la correttezza finale, il sistema può sembrare ben fondato anche quando il percorso probatorio è interrotto.",{},{"id":352,"data":353,"type":226,"tunes":355},"p-use-2",{"text":354},"Per valutare l'uso delle prove, esamina la traccia. Verifica quali fonti sono state recuperate, quali passaggi hanno raggiunto il contesto del modello, quando sono diventati disponibili e se l'affermazione finale può essere spiegata da tali input. Gli attuali strumenti di valutazione degli agenti di OpenAI pongono l'accento sulla valutazione delle tracce proprio perché il comportamento a livello di flusso di lavoro non può essere ricostruito in modo affidabile solo a partire dalla risposta finale.",{},{"id":357,"data":358,"type":42,"tunes":360},"h-eut",{"text":359,"level":219},"Il Test di Utilizzo delle Prove",{},{"id":362,"data":363,"type":226,"tunes":365},"p-eut-intro",{"text":364},"Una valutazione pratica può essere strutturata come un controfattuale controllato. Invece di chiedersi solo se la risposta sia corretta, modifica le prove e osserva se l'affermazione cambia nella direzione prevista.",{},{"id":367,"data":368,"type":393,"tunes":394},"eut-flow",{"steps":369,"title":391,"orientation":392},[370,373,376,379,382,385,388],{"label":371,"description":372},"1. Seleziona un'affermazione rilevante","Scegli un'affermazione la cui correttezza sia essenziale e definisci con precisione la risposta attesa.",{"label":374,"description":375},"2. Identifica la prova di riferimento (gold evidence)","Fornisci l'insieme minimo e autorevole di prove sufficiente a supportare l'affermazione.",{"label":377,"description":378},"3. Esegui il test con la prova di riferimento","Verifica che l'agente produca la risposta supportata quando la prova corretta è disponibile.",{"label":380,"description":381},"4. Rimuovi la prova decisiva","Esegui la stessa attività senza il passaggio chiave a supporto, mantenendo stabili gli altri input.",{"label":383,"description":384},"5. Sostituiscila con una prova contraddittoria o prevalente","Laddove sia sicuro, fornisci prove controllate che modifichino la conclusione corretta.",{"label":386,"description":387},"6. Confronta le affermazioni","Verifica se la risposta segue la modifica delle prove o se rimane ancorata alle conoscenze pregresse del modello.",{"label":389,"description":390},"7. Esamina la traccia","Conferma cosa è stato recuperato, cosa ha raggiunto il contesto e quale fonte o risultato dello strumento ha preceduto l'affermazione.","Test di Utilizzo delle Prove","auto","processFlow",{},{"id":396,"data":397,"type":234,"tunes":401},"eut-tip",{"body":398,"title":399,"variant":400},"Se la prova decisiva cambia ma l'affermazione dell'agente non cambia, hai la dimostrazione che il sistema potrebbe non utilizzare il recupero come previsto — anche quando la risposta originale era casualmente corretta.","Il segnale chiave","tip",{},{"id":403,"data":404,"type":42,"tunes":406},"h-matrix",{"text":405,"level":219},"Una matrice affermazioni-prove è più utile di un elenco di fonti",{},{"id":408,"data":409,"type":287,"tunes":441},"claim-matrix",{"content":410,"stretched":43,"withHeadings":14},[411,417,424,430,436],[412,413,414,415,280,416],"Affermazione","Prova","Supporto","Autorevolezza","Utilizzata nella traccia",[418,419,420,421,422,423],"La funzionalità X è disponibile","Documentazione del fornitore","Diretto","Alta per l'affermazione sulla disponibilità","La versione attuale e la regione devono corrispondere","Sì \u002F No",[425,426,427,428,429,423],"La configurazione Y è più veloce","Benchmark del fornitore","Parziale","Alta per il test del fornitore, non per le prestazioni indipendenti","L'hardware e il carico di lavoro devono corrispondere",[431,432,433,434,435,423],"La policy si applica a questo utente","Policy attuale + stato dell'account","Diretto solo se combinati","Alta","Giurisdizione, data, ruolo e stato dell'account devono corrispondere",[437,438,420,439,440,423],"Un prodotto è disponibile","API dell'inventario in tempo reale","Autorevole per le scorte attuali","Scade rapidamente",{},{"id":443,"data":444,"type":226,"tunes":446},"p-matrix-1",{"text":445},"Questa matrice impone diverse domande che la verifica convenzionale delle citazioni nasconde. Una singola affermazione può richiedere più fonti. Una fonte può supportare solo una parte di un'affermazione. Una fonte autorevole può avere una finestra di validità limitata. E una fonte del tutto valida può risultare irrilevante se non è mai entrata nel percorso di esecuzione.",{},{"id":448,"data":449,"type":42,"tunes":451},"h-retrieval-evidence",{"text":450,"level":219},"Distinguere la qualità del recupero dalla qualità delle prove",{},{"id":453,"data":454,"type":226,"tunes":456},"p-re-1",{"text":455},"Le metriche di recupero valutano se il materiale rilevante è stato individuato e classificato. La valutazione delle prove verifica se quel materiale giustifica le affermazioni risultanti. I due aspetti sono correlati ma non identici.",{},{"id":458,"data":459,"type":489,"tunes":490},"retrieval-comparison",{"rows":460,"title":478,"layout":287,"columns":479},[461,466,470,474],{"id":462,"label":463,"values":464},"a","Documento corretto, affermazione errata",[465,465,465],"",{"id":467,"label":468,"values":469},"b","Fatto corretto, fonte obsoleta",[465,465,465],{"id":471,"label":472,"values":473},"c","Fonte debole, risposta corretta",[465,465,465],{"id":475,"label":476,"values":477},"d","Necessarie fonti multiple",[465,465,465],"Il successo nel recupero non equivale alla validità delle prove",[480,483,486],{"id":481,"label":482},"situation","Situazione",{"id":484,"label":485},"retrieval","Recupero",{"id":487,"label":488},"evidence","Qualità delle prove","comparison",{},{"id":492,"data":493,"type":42,"tunes":495},"h-source-quality",{"text":494,"level":219},"Valutare la qualità delle fonti tramite una rubrica, non con una whitelist di domini",{},{"id":497,"data":498,"type":226,"tunes":500},"p-source-quality-1",{"text":499},"Le liste statiche di “domini attendibili” sono allettanti ma spesso fragili. La qualità della fonte dovrebbe invece riflettere il tipo di affermazione. Dimensioni utili includono lo stato primario o secondario, la tempestività, la pertinenza diretta, la riproducibilità, l'indipendenza, la competenza specifica nel dominio, la provenienza dei dati, la frequenza di aggiornamento e l'eventuale interesse della fonte a enfatizzare l'affermazione.",{},{"id":502,"data":503,"type":226,"tunes":505},"p-source-quality-2",{"text":504},"Le linee guida per la valutazione degli agenti di ricerca di Anthropic richiedono esplicitamente verifiche sulla qualità delle fonti, insieme alla fondatezza e alla copertura. L'implementazione pratica dovrebbe quindi valutare sia ciò che la fonte afferma, sia l'adeguatezza della fonte per quel tipo di dichiarazione.",{},{"id":507,"data":508,"type":42,"tunes":510},"h-coverage",{"text":509,"level":219},"Copertura delle prove: ogni affermazione importante ha bisogno di supporto, non ogni frase",{},{"id":512,"data":513,"type":226,"tunes":515},"p-coverage-1",{"text":514},"Non tutte le frasi necessitano di una citazione. Il linguaggio di transizione, i calcoli aritmetici derivati in modo trasparente da valori citati o un'interpretazione chiaramente contrassegnata potrebbero non richiedere una fonte separata. Tuttavia, ogni affermazione rilevante e verificabile esternamente dovrebbe disporre di un supporto sufficiente a consentire a un valutatore di ricostruire il motivo per cui l'agente era autorizzato a formularla.",{},{"id":517,"data":518,"type":226,"tunes":520},"p-coverage-2",{"text":519},"La copertura dovrebbe pertanto essere ponderata in base all'importanza dell'affermazione. La mancanza di supporto per un dettaglio decorativo non equivale alla mancanza di supporto per un prezzo, una decisione di idoneità, un'istruzione di sicurezza, un requisito legale, una dichiarazione di compatibilità tecnica o un fatto determinante per una raccomandazione.",{},{"id":522,"data":523,"type":42,"tunes":525},"h-provenance",{"text":524,"level":219},"La provenienza delle prove deve sopravvivere alla sintesi e alla memoria",{},{"id":527,"data":528,"type":226,"tunes":530},"p-prov-1",{"text":529},"Gli agenti a lunga esecuzione spesso riassumono il lavoro precedente o scrivono memorie persistenti. Se la provenienza delle prove viene rimossa durante tale trasformazione, gli agenti futuri potrebbero recuperare una conclusione chiara senza sapere se proviene da una dichiarazione dell'utente, da un'API attiva, da un vecchio documento, da un'inferenza del modello o da un risultato web non verificato.",{},{"id":532,"data":533,"type":226,"tunes":535},"p-prov-2",{"text":534},"Per i fatti importanti, conserva almeno l'identità della fonte, l'orario di recupero o di osservazione, il tipo di prova, la versione o lo stato pertinente e se il testo memorizzato è citato testualmente, riassunto, inferito o derivato. La provenienza è ciò che consente a un agente successivo di decidere se la prova debba essere considerata attendibile, aggiornata, limitata o scartata.",{},{"id":537,"data":538,"type":42,"tunes":540},"h-record",{"text":539,"level":219},"Un registro pratico delle prove",{},{"id":542,"data":543,"type":287,"tunes":578},"evidence-record",{"content":544,"stretched":43,"withHeadings":14},[545,548,551,554,557,560,563,566,569,572,575],[546,547],"Field","Scopo",[549,550],"claim_id","Identifica l'affermazione rilevante supportata",[552,553],"source_id \u002F source_url \u002F system","Identifica la provenienza della prova",[555,556],"evidence_span","Conserva il passaggio, il record o il risultato del tool più piccolo che supporta l'affermazione",[558,559],"retrieved_at \u002F observed_at","Consente verifiche di freschezza e temporali",[561,562],"source_version \u002F object_version","Consente verifiche di obsolescenza e riproducibilità",[564,565],"authority_role","Spiega perché questa fonte è appropriata per questa affermazione",[567,568],"applicability","Memorizza data pertinente, giurisdizione, versione del prodotto, utente, tenant, stato o altre condizioni",[570,571],"transformation","Indica se la prova è grezza, citata, riassunta, normalizzata o derivata",[573,574],"trace_step","Mostra quando la prova è diventata disponibile per l'agente",[576,577],"support_status","Diretto, parziale, contraddittorio, non supportato o incerto",{},{"id":580,"data":581,"type":42,"tunes":583},"h-failures",{"text":582,"level":219},"Modalità di fallimento che sembrano fondate ma non lo sono",{},{"id":585,"data":586,"type":287,"tunes":624},"failure-table",{"content":587,"stretched":43,"withHeadings":14},[588,592,596,600,604,608,612,616,620],[589,590,591],"Modalità di fallimento","Perché inganna i valutatori","Cosa testare",[593,594,595],"Citazione decorativa","La risposta contiene fonti, quindi sembra documentata","Mappa ogni affermazione rilevante a un passaggio di supporto esatto",[597,598,599],"Mancata corrispondenza di autorevolezza","La fonte è affidabile ma non autorevole per il fatto specifico","Definisci una gerarchia delle fonti specifica per l'affermazione",[601,602,603],"Discrepanza temporale","La fonte era corretta al momento della pubblicazione","Verifica l'orario di recupero, la data della fonte e le prove successive che la sostituiscono",[605,606,607],"Rimozione delle condizioni","Una sintesi mantiene la conclusione ma omette le eccezioni","Confronta l'affermazione generata con il contesto completo della fonte locale",[609,610,611],"Citazione post-hoc","Una fonte plausibile viene allegata dopo la generazione della risposta","Ispeziona l'ordine della traccia e verifica se la prova ha preceduto l'affermazione",[613,614,615],"Sovrascrittura parametrica","Il modello ignora le prove recuperate e risponde in base alle conoscenze pregresse","Esegui test controfattuali sull'utilizzo delle prove",[617,618,619],"Riciclaggio delle prove","L'inferenza del modello viene riassunta e successivamente memorizzata come se fosse un fatto della fonte","Preserva il tipo di trasformazione e la provenienza attraverso le scritture in memoria",[621,622,623],"Fallacia della maggioranza delle fonti","Diverse pagine secondarie ripetono la stessa affermazione non supportata","Ripercorri le affermazioni fino a prove indipendenti o primarie",{},{"id":626,"data":627,"type":42,"tunes":629},"h-production",{"text":628,"level":219},"Come valutare l'agente in produzione",{},{"id":631,"data":632,"type":393,"tunes":659},"production-flow",{"steps":633,"title":658,"orientation":392},[634,637,640,643,646,649,652,655],{"label":635,"description":636},"1. Definire le affermazioni rilevanti","Identificare i fatti, le raccomandazioni o le decisioni la cui correttezza è fondamentale per l'attività.",{"label":638,"description":639},"2. Creare prove di riferimento (gold standard)","Creare prove di riferimento e aspettative sulla qualità delle fonti per casi rappresentativi.",{"label":641,"description":642},"3. Acquisire le tracce","Registrare query di recupero, chiamate a tool, prove restituite, costruzione del contesto, output del modello e citazioni.",{"label":644,"description":645},"4. Valutare il supporto","Verificare se ciascuna affermazione rilevante è supportata in modo diretto, parziale, contraddittorio o non supportata.",{"label":647,"description":648},"5. Valutare autorevolezza e applicabilità","Valutare se la fonte è appropriata e se le sue condizioni corrispondono all'attività corrente.",{"label":650,"description":651},"6. Eseguire test controfattuali","Rimuovere, sostituire o invalidare prove decisive e verificare se la risposta si adegua alla modifica.",{"label":653,"description":654},"7. Esaminare i fallimenti ad alto impatto","Ricorrere alla revisione umana o di esperti di dominio laddove la valutazione automatizzata non sia sufficientemente affidabile.",{"label":656,"description":657},"8. Convertire i fallimenti in casi di valutazione","Aggiungere i fallimenti in produzione e i casi limite a un set di dati di regressione ripetibile.","Pipeline di valutazione delle prove",{},{"id":661,"data":662,"type":226,"tunes":664},"p-production-1",{"text":663},"Le attuali linee guida di valutazione di OpenAI raccomandano valutazioni specifiche per l'attività, valutazione continua, set di dati derivati dalla produzione e tracce per il debug del comportamento dell'agente. Allo stesso modo, Anthropic raccomanda di combinare diversi tipi di valutatori per gli agenti di ricerca, poiché correttezza, qualità della fonte, copertura e fondatezza sono dimensioni distinte. La valutazione delle prove dovrebbe seguire lo stesso schema: diversi valutatori mirati offrono una diagnosi migliore rispetto a un unico punteggio opaco di “qualità”.",{},{"id":666,"data":667,"type":42,"tunes":669},"h-judge",{"text":668,"level":219},"Non lasciare che un LLM as a judge sia l'unico a valutare le prove",{},{"id":671,"data":672,"type":226,"tunes":674},"p-judge-1",{"text":673},"I valutatori LLM sono utili per la classificazione scalabile delle affermazioni, i controlli di pertinenza e i confronti a coppie, ma possono condividere gli stessi punti ciechi del sistema che valutano. Un valutatore potrebbe accettare un'affermazione plausibile ma priva di supporto, ignorare un sottile confine di versione o sovrastimare una fonte ben scritta.",{},{"id":676,"data":677,"type":226,"tunes":679},"p-judge-2",{"text":678},"Le linee guida di valutazione di OpenAI raccomandano di calibrare i valutatori automatizzati rispetto al giudizio umano e di utilizzare criteri chiari e ben delimitati. Per i sistemi fortemente basati su prove, dovrebbero essere utilizzati controlli deterministici ovunque possibile: timestamp, versioni degli oggetti, ambito dei permessi, ID esatti delle fonti, ordine di recupero, hash dei documenti e presenza della prova prima che il modello generasse l'affermazione.",{},{"id":681,"data":682,"type":42,"tunes":684},"h-change",{"text":683,"level":219},"Cosa cambierebbe questa risposta?",{},{"id":686,"data":687,"type":226,"tunes":689},"p-change-1",{"text":688},"La valutazione può essere più semplice quando l'agente opera su un corpus ristretto, immutabile e autorevole, e ogni risposta è strettamente estrattiva. In un contesto simile, l'autorevolezza e l'applicabilità della fonte sono per lo più fisse e la corrispondenza del supporto tra affermazione e porzione di testo può essere sufficiente.",{},{"id":691,"data":692,"type":226,"tunes":694},"p-change-2",{"text":693},"La valutazione deve farsi più rigorosa quando l'agente combina ricerche web, memoria a lungo termine, tool in tempo reale, molteplici giurisdizioni, informazioni in rapido mutamento, stato specifico dell'utente o azioni autonome. In tali sistemi, la validità delle prove non dipende solo dal testo di partenza, ma anche da quando e come la prova è stata ottenuta.",{},{"id":696,"data":697,"type":226,"tunes":699},"p-change-3",{"text":698},"I modelli futuri potrebbero diventare più abili nel tracciare internamente provenienza e incertezza, ma ciò non eliminerebbe la necessità di registri di evidenze esterne nei sistemi che richiedono verificabilità. Un sistema non dovrebbe dipendere dall'auto-segnalazione del modello su cosa lo abbia influenzato, quando le tracce e i metadati delle fonti possono fornire prove più solide.",{},{"id":701,"data":702,"type":42,"tunes":704},"h-limitations",{"text":703,"level":219},"Limitazioni",{},{"id":706,"data":707,"type":226,"tunes":709},"p-limit-1",{"text":708},"Non è sempre possibile dimostrare l'uso causale delle evidenze basandosi unicamente sulle tracce. Una fonte può essere presente nel contesto senza influenzare la risposta, e un modello potrebbe conoscere lo stesso fatto in modo indipendente. I test controfattuali rafforzano l'inferenza, ma possono essi stessi alterare la distribuzione del task.",{},{"id":711,"data":712,"type":226,"tunes":714},"p-limit-2",{"text":713},"L'autorevolezza delle fonti può anche essere contestata o dipendere dal dominio. Alcune domande non hanno un'unica fonte autorevole e gli esperti possono dissentire su quale evidenza meriti maggior peso. In questi casi, il valutatore dovrebbe preservare il disaccordo e valutare trasparenza, copertura e ragionamento rispetto a una rubrica esplicita, anziché fingere che esista un'unica fonte di verità indiscutibile.",{},{"id":716,"data":717,"type":42,"tunes":719},"h-conclusion",{"text":718,"level":219},"Conclusione",{},{"id":721,"data":722,"type":226,"tunes":724},"p-conclusion-1",{"text":723},"La domanda \"L'agente ha citato una fonte?\" è troppo debole per l'IA in produzione. La domanda più incisiva è: ogni affermazione importante proviene da un'evidenza che la supporta effettivamente, possiede la corretta autorevolezza, si applica ancora alle condizioni attuali ed era disponibile nel percorso di esecuzione prima che l'affermazione fosse formulata?",{},{"id":726,"data":727,"type":226,"tunes":729},"p-conclusion-2",{"text":728},"Questo trasforma le evidenze da elemento decorativo a proprietà valutabile del sistema. Cattura la traccia. Mappa le affermazioni sulle evidenze. Verifica autorevolezza e applicabilità. Esegui test controfattuali sulle evidenze. Preserva la provenienza attraverso sintesi e memoria. In questo modo, una risposta corretta non è solo plausibile: ha un percorso di evidenze che puoi ispezionare.",{},{"id":731,"data":732,"type":737,"tunes":738},"internal-reliability",{"url":733,"title":734,"excerpt":735,"ctaLabel":736},"https:\u002F\u002Fstajic.de\u002Fit\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Affidabilità degli agenti IA: perché la risposta finale non basta","La correttezza del risultato da sola non può dimostrare che il percorso di esecuzione di un agente sia stato sicuro o affidabile. Questo articolo correlato spiega l'importanza di traiettorie, strumenti e decisioni intermedie.","Leggi l'articolo correlato","referralArticle",{},{"id":740,"data":741,"type":737,"tunes":746},"internal-reasoning",{"url":742,"title":743,"excerpt":744,"ctaLabel":745},"https:\u002F\u002Fstajic.de\u002Fit\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","Dal protocollo di ricerca a un framework generale di ragionamento per l'IA","Un metodo pratico di ragionamento per separare evidenze, presupposti, ipotesi concorrenti e validazione specifica di dominio.","Leggi il framework di ragionamento",{},{"id":748,"data":749,"type":42,"tunes":751},"h-faq",{"text":750,"level":219},"Domande frequenti",{},{"id":753,"data":754,"type":753,"tunes":777},"faq",{"items":755,"title":776},[756,760,764,768,772],{"id":757,"answer":758,"question":759},"faq1","No. Una citazione può essere pertinente all'argomento senza supportare l'affermazione esatta, può provenire da un'autorità inadeguata, può non essere più applicabile o può essere stata aggiunta senza influenzare materialmente la risposta generata.","Una citazione dimostra che una risposta dell'IA è fondata?",{"id":761,"answer":762,"question":763},"faq2","Utilizza un test controfattuale sull'utilizzo delle evidenze: esegui il task con prove certe e corrette, poi rimuovi o sostituisci l'evidenza decisiva mantenendo stabili gli altri input. Se la risposta non reagisce alla modifica dell'evidenza, verifica se il modello fa affidamento su conoscenze pregresse o su un'altra fonte.","Come posso verificare se un agente IA ha effettivamente utilizzato l'evidenza recuperata?",{"id":765,"answer":766,"question":767},"faq3","La fondatezza verifica se le affermazioni sono supportate dalle evidenze fornite. La qualità della fonte verifica se l'evidenza stessa sia appropriata e sufficientemente autorevole per il tipo di affermazione avanzata.","Qual è la differenza tra fondatezza e qualità della fonte?",{"id":769,"answer":770,"question":771},"faq4","La fonte potrebbe essere obsoleta, superata, valida per un'altra versione, giurisdizione, utente, popolazione o stato del sistema, oppure potrebbe contenere condizioni andate perdute durante il recupero o la sintesi.","Perché una fonte reale può comunque generare una risposta IA errata?",{"id":773,"answer":774,"question":775},"faq5","Registra la query di recupero, le fonti restituite, i passaggi esatti delle evidenze, timestamp e versioni, i filtri, il contesto finale, l'output del modello, le citazioni e l'ordine delle tracce, in modo che i valutatori possano ricostruire quali evidenze erano disponibili prima di ciascuna affermazione rilevante.","Cosa occorre registrare nei log per la valutazione delle evidenze?","Valutare l'uso delle evidenze negli agenti IA",{},{"id":779,"data":780,"type":42,"tunes":782},"h-glossary",{"text":781,"level":219},"Glossario",{},{"id":784,"data":785,"type":784,"tunes":809},"glossary",{"title":786,"entries":787},"Termini chiave per la valutazione delle evidenze",[788,791,795,797,801,805],{"term":272,"anchor":789,"definition":790},"claim-support","Il grado in cui uno specifico estratto di evidenza dimostra direttamente un'affermazione generata.",{"term":792,"anchor":793,"definition":794},"Autorevolezza dell'evidenza","evidence-authority","Il grado di adeguatezza di una fonte nel comprovare una particolare affermazione, in base al suo ruolo, alla provenienza e al legame con il fatto sottostante.",{"term":280,"anchor":567,"definition":796},"Le condizioni entro cui un'evidenza rimane valida per un'affermazione, inclusi tempo, versione, giurisdizione, utente, popolazione, stato del sistema o altri limiti.",{"term":798,"anchor":799,"definition":800},"Utilizzo delle evidenze","evidence-utilization","La misura in cui l'output dell'agente risponde effettivamente e dipende dalle evidenze rese disponibili nel suo percorso di esecuzione.",{"term":802,"anchor":803,"definition":804},"Test controfattuale sulle evidenze","counterfactual-evidence-test","Una valutazione che rimuove, sostituisce o modifica un'evidenza decisiva per verificare se l'affermazione dell'agente cambia di conseguenza.",{"term":806,"anchor":807,"definition":808},"Provenienza","provenance","Metadati che registrano l'origine dell'evidenza, il momento in cui è stata ottenuta, il modo in cui è stata trasformata e quale versione o stato rappresentava.",{},{"id":811,"data":812,"type":42,"tunes":814},"h-sources",{"text":813,"level":219},"Fonti primarie e ulteriori letture",{},{"id":816,"data":817,"type":823,"tunes":824},"src-openai-agent-evals",{"link":818,"meta":819},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals",{"image":820,"title":821,"description":822},{"url":465},"OpenAI — Evaluate Agent Workflows","Linee guida sulla valutazione delle tracce, valutazione a livello di workflow, dataset ed esecuzioni di valutazione ripetibili per agenti.","linkTool",{},{"id":826,"data":827,"type":823,"tunes":833},"src-openai-eval-best",{"link":828,"meta":829},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices",{"image":830,"title":831,"description":832},{"url":465},"OpenAI — Evaluation Best Practices","Linee guida su valutazioni specifiche per task, dataset derivati dalla produzione, metriche circoscritte, valutazione continua e calibrazione del grader.",{},{"id":835,"data":836,"type":823,"tunes":842},"src-anthropic-evals",{"link":837,"meta":838},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"image":839,"title":840,"description":841},{"url":465},"Anthropic — Demystifying Evals for AI Agents","Guida alla valutazione degli agenti, inclusi controlli di fondatezza, copertura e qualità delle fonti per agenti di ricerca.",{},{"id":844,"data":845,"type":823,"tunes":851},"src-openai-thirdparty",{"link":846,"meta":847},"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F",{"image":848,"title":849,"description":850},{"url":465},"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations","Linee guida di valutazione che evidenziano come le prestazioni degli agenti moderni dipendano dal workflow e dall'ambiente, non solo dall'output finale del modello.",{},"2.31","Un agente IA può citare fonti e comunque utilizzare le prove sbagliate. Questo articolo introduce un metodo pratico per verificare il supporto delle affermazioni, l'autorevolezza della fonte, l'applicabilità, la provenienza e se le prove abbiano effettivamente influenzato la risposta.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve","PUBLISHED","2026-09-25T11:47:00.000Z","2026-09-25T15:47:02.186Z","2026-09-25T20:33:01.720Z",{"en":861,"de":862,"sr":863,"es":864,"fr":865,"it":866,"ru":867,"zh":868},"\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fde\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fsr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fes\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Ffr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fit\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fru\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fzh\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence",[870,874,878],{"id":871,"name":872,"slug":873},84,"Policy e limiti dati","policy-and-data",{"id":875,"name":876,"slug":877},97,"Verifica su test set","verification",{"id":879,"name":880,"slug":881},66,"Operazioni contenuti","content-ops",{"id":883,"login":884,"email":885,"displayName":886},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[888,1410],{"lang":889,"title":890,"content":891,"contentJson":892,"excerpt":1409},"en","How to Know Whether an AI Agent Actually Used the Right Evidence","{\"time\":1790351390243,\"blocks\":[{\"id\":\"0hk9UtwqZf\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.\"},\"tunes\":{}},{\"id\":\"method-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"About the method\",\"body\":\"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.\"},\"tunes\":{}},{\"id\":\"h-citations\",\"type\":\"header\",\"data\":{\"text\":\"Why citations are not enough\",\"level\":2},\"tunes\":{}},{\"id\":\"p-citations-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.\"},\"tunes\":{}},{\"id\":\"p-citations-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.\"},\"tunes\":{}},{\"id\":\"h-four\",\"type\":\"header\",\"data\":{\"text\":\"The four questions every material claim should pass\",\"level\":2},\"tunes\":{}},{\"id\":\"table-four\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Dimension\",\"Question\",\"Typical failure\"],[\"Claim support\",\"Does the evidence directly support this exact claim?\",\"The source is topically related but does not establish the statement\"],[\"Evidence authority\",\"Is this an appropriate source for this kind of claim?\",\"A secondary summary is used where a primary source or live system is required\"],[\"Applicability\",\"Does the evidence apply to this time, version, jurisdiction, user, state, or population?\",\"A true statement is applied outside its valid conditions\"],[\"Evidence use\",\"Was this evidence actually available and used in the agent's execution path?\",\"The final answer is correct, but the retrieved evidence was irrelevant or unused\"]]},\"tunes\":{}},{\"id\":\"h-support\",\"type\":\"header\",\"data\":{\"text\":\"1. Claim support: does the source establish what the agent says?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-support-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.\"},\"tunes\":{}},{\"id\":\"p-support-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.\"},\"tunes\":{}},{\"id\":\"h-authority\",\"type\":\"header\",\"data\":{\"text\":\"2. Evidence authority: is this the right kind of source?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-authority-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.\"},\"tunes\":{}},{\"id\":\"p-authority-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.\"},\"tunes\":{}},{\"id\":\"h-applicability\",\"type\":\"header\",\"data\":{\"text\":\"3. Applicability: right evidence, wrong conditions\",\"level\":3},\"tunes\":{}},{\"id\":\"p-apply-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.\"},\"tunes\":{}},{\"id\":\"p-apply-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.\"},\"tunes\":{}},{\"id\":\"apply-warning\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Evidence can be authentic and still be wrong for the answer\",\"body\":\"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.\"},\"tunes\":{}},{\"id\":\"h-use\",\"type\":\"header\",\"data\":{\"text\":\"4. Evidence use: did the agent actually rely on the evidence?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-use-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.\"},\"tunes\":{}},{\"id\":\"p-use-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.\"},\"tunes\":{}},{\"id\":\"h-eut\",\"type\":\"header\",\"data\":{\"text\":\"The Evidence Utilization Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-eut-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.\"},\"tunes\":{}},{\"id\":\"eut-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence Utilization Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Select one material claim\",\"description\":\"Choose a claim whose correctness matters and define the expected answer precisely.\"},{\"label\":\"2. Identify gold evidence\",\"description\":\"Provide the smallest authoritative evidence set sufficient to support the claim.\"},{\"label\":\"3. Run with gold evidence\",\"description\":\"Verify that the agent produces the supported answer when the correct evidence is available.\"},{\"label\":\"4. Remove the decisive evidence\",\"description\":\"Run the same task without the key supporting passage while keeping other inputs stable.\"},{\"label\":\"5. Replace it with contradictory or superseding evidence\",\"description\":\"Where safe, provide controlled evidence that changes the correct conclusion.\"},{\"label\":\"6. Compare the claims\",\"description\":\"Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.\"},{\"label\":\"7. Inspect the trace\",\"description\":\"Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.\"}]},\"tunes\":{}},{\"id\":\"eut-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"The key signal\",\"body\":\"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A claim–evidence matrix is more useful than a source list\",\"level\":2},\"tunes\":{}},{\"id\":\"claim-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Claim\",\"Evidence\",\"Support\",\"Authority\",\"Applicability\",\"Used in trace\"],[\"Feature X is available\",\"Vendor documentation\",\"Direct\",\"High for availability claim\",\"Current version and region must match\",\"Yes \u002F No\"],[\"Configuration Y is faster\",\"Vendor benchmark\",\"Partial\",\"High for vendor's test, not independent performance\",\"Hardware and workload must match\",\"Yes \u002F No\"],[\"Policy applies to this user\",\"Current policy + account state\",\"Direct only when combined\",\"High\",\"Jurisdiction, date, role and account state must match\",\"Yes \u002F No\"],[\"A product is in stock\",\"Live inventory API\",\"Direct\",\"Authoritative for current stock\",\"Expires quickly\",\"Yes \u002F No\"]]},\"tunes\":{}},{\"id\":\"p-matrix-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.\"},\"tunes\":{}},{\"id\":\"h-retrieval-evidence\",\"type\":\"header\",\"data\":{\"text\":\"Separate retrieval quality from evidence quality\",\"level\":2},\"tunes\":{}},{\"id\":\"p-re-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.\"},\"tunes\":{}},{\"id\":\"retrieval-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Retrieval success is not evidence success\",\"layout\":\"table\",\"columns\":[{\"id\":\"situation\",\"label\":\"Situation\"},{\"id\":\"retrieval\",\"label\":\"Retrieval\"},{\"id\":\"evidence\",\"label\":\"Evidence quality\"}],\"rows\":[{\"id\":\"a\",\"label\":\"Right document, wrong claim\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"b\",\"label\":\"Right fact, stale source\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"c\",\"label\":\"Weak source, correct answer\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"d\",\"label\":\"Multiple sources required\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-source-quality\",\"type\":\"header\",\"data\":{\"text\":\"Evaluate source quality as a rubric, not a domain whitelist\",\"level\":2},\"tunes\":{}},{\"id\":\"p-source-quality-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.\"},\"tunes\":{}},{\"id\":\"p-source-quality-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.\"},\"tunes\":{}},{\"id\":\"h-coverage\",\"type\":\"header\",\"data\":{\"text\":\"Evidence coverage: every important claim needs support, not every sentence\",\"level\":2},\"tunes\":{}},{\"id\":\"p-coverage-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.\"},\"tunes\":{}},{\"id\":\"p-coverage-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.\"},\"tunes\":{}},{\"id\":\"h-provenance\",\"type\":\"header\",\"data\":{\"text\":\"Evidence provenance must survive summarization and memory\",\"level\":2},\"tunes\":{}},{\"id\":\"p-prov-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.\"},\"tunes\":{}},{\"id\":\"p-prov-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.\"},\"tunes\":{}},{\"id\":\"h-record\",\"type\":\"header\",\"data\":{\"text\":\"A practical evidence record\",\"level\":2},\"tunes\":{}},{\"id\":\"evidence-record\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Field\",\"Purpose\"],[\"claim_id\",\"Identifies the material claim being supported\"],[\"source_id \u002F source_url \u002F system\",\"Identifies where the evidence came from\"],[\"evidence_span\",\"Preserves the smallest passage, record, or tool result that supports the claim\"],[\"retrieved_at \u002F observed_at\",\"Allows freshness and timeline checks\"],[\"source_version \u002F object_version\",\"Allows supersession and reproducibility checks\"],[\"authority_role\",\"Explains why this source is suitable for this claim\"],[\"applicability\",\"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions\"],[\"transformation\",\"Marks whether evidence is raw, quoted, summarized, normalized, or derived\"],[\"trace_step\",\"Shows when the evidence became available to the agent\"],[\"support_status\",\"Direct, partial, contradictory, unsupported, or uncertain\"]]},\"tunes\":{}},{\"id\":\"h-failures\",\"type\":\"header\",\"data\":{\"text\":\"Failure modes that look grounded but are not\",\"level\":2},\"tunes\":{}},{\"id\":\"failure-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Failure mode\",\"Why it fools evaluators\",\"What to test\"],[\"Citation decoration\",\"The answer contains sources, so it looks researched\",\"Map each material claim to an exact supporting span\"],[\"Authority mismatch\",\"The source is reputable but not authoritative for the specific fact\",\"Define claim-specific source hierarchy\"],[\"Temporal mismatch\",\"The source was correct when published\",\"Check retrieval time, source date, and superseding evidence\"],[\"Condition stripping\",\"A summary keeps the conclusion but drops exceptions\",\"Compare generated claim with full local source context\"],[\"Post-hoc citation\",\"A plausible source is attached after the answer is generated\",\"Inspect trace ordering and whether evidence preceded the claim\"],[\"Parametric override\",\"The model ignores retrieved evidence and answers from prior knowledge\",\"Run counterfactual evidence-utilization tests\"],[\"Evidence laundering\",\"Model inference is summarized and later stored as if it were a source fact\",\"Preserve transformation type and provenance across memory writes\"],[\"Source majority fallacy\",\"Several secondary pages repeat the same unsupported statement\",\"Trace claims back to independent or primary evidence\"]]},\"tunes\":{}},{\"id\":\"h-production\",\"type\":\"header\",\"data\":{\"text\":\"How to evaluate the agent in production\",\"level\":2},\"tunes\":{}},{\"id\":\"production-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence evaluation pipeline\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Define material claims\",\"description\":\"Identify the facts, recommendations, or decisions whose correctness matters to the task.\"},{\"label\":\"2. Build gold evidence\",\"description\":\"Create reference evidence and source-quality expectations for representative cases.\"},{\"label\":\"3. Capture traces\",\"description\":\"Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.\"},{\"label\":\"4. Grade support\",\"description\":\"Check whether each material claim is directly, partially, contradictorily, or not supported.\"},{\"label\":\"5. Grade authority and applicability\",\"description\":\"Evaluate whether the source is appropriate and whether its conditions match the current task.\"},{\"label\":\"6. Run counterfactuals\",\"description\":\"Remove, replace, or supersede decisive evidence and test whether the answer follows the change.\"},{\"label\":\"7. Review high-impact failures\",\"description\":\"Use human or domain-expert review where automated grading is not reliable enough.\"},{\"label\":\"8. Convert failures into eval cases\",\"description\":\"Add production failures and edge cases to a repeatable regression dataset.\"}]},\"tunes\":{}},{\"id\":\"p-production-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.\"},\"tunes\":{}},{\"id\":\"h-judge\",\"type\":\"header\",\"data\":{\"text\":\"Do not let an LLM judge become the only evidence judge\",\"level\":2},\"tunes\":{}},{\"id\":\"p-judge-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.\"},\"tunes\":{}},{\"id\":\"p-judge-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.\"},\"tunes\":{}},{\"id\":\"p-change-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.\"},\"tunes\":{}},{\"id\":\"internal-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.\",\"ctaLabel\":\"Read the related article\"},\"tunes\":{}},{\"id\":\"internal-reasoning\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\",\"title\":\"From Research Protocol to a General AI Reasoning Framework\",\"excerpt\":\"A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.\",\"ctaLabel\":\"Read the reasoning framework\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Evaluating evidence use in AI agents\",\"items\":[{\"id\":\"faq1\",\"question\":\"Does a citation prove that an AI answer is grounded?\",\"answer\":\"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.\"},{\"id\":\"faq2\",\"question\":\"How can I test whether an AI agent actually used retrieved evidence?\",\"answer\":\"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.\"},{\"id\":\"faq3\",\"question\":\"What is the difference between groundedness and source quality?\",\"answer\":\"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.\"},{\"id\":\"faq4\",\"question\":\"Why can a real source still produce a wrong AI answer?\",\"answer\":\"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.\"},{\"id\":\"faq5\",\"question\":\"What should I log for evidence evaluation?\",\"answer\":\"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key evidence-evaluation terms\",\"entries\":[{\"term\":\"Claim support\",\"definition\":\"The degree to which a specific evidence span directly establishes a generated claim.\",\"anchor\":\"claim-support\"},{\"term\":\"Evidence authority\",\"definition\":\"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.\",\"anchor\":\"evidence-authority\"},{\"term\":\"Applicability\",\"definition\":\"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.\",\"anchor\":\"applicability\"},{\"term\":\"Evidence utilization\",\"definition\":\"Whether the agent's output actually responds to and depends on the evidence made available in its execution path.\",\"anchor\":\"evidence-utilization\"},{\"term\":\"Counterfactual evidence test\",\"definition\":\"An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.\",\"anchor\":\"counterfactual-evidence-test\"},{\"term\":\"Provenance\",\"definition\":\"Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.\",\"anchor\":\"provenance\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-agent-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluate Agent Workflows\",\"description\":\"Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-eval-best\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluation Best Practices\",\"description\":\"Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.\"}},\"tunes\":{}},{\"id\":\"src-anthropic-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Demystifying Evals for AI Agents\",\"description\":\"Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-thirdparty\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations\",\"description\":\"Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":893,"blocks":894,"version":1408},1790351390243,[895,899,903,908,913,917,921,925,929,953,957,961,965,969,973,977,981,985,989,994,998,1002,1006,1010,1014,1040,1045,1049,1083,1087,1091,1095,1119,1123,1127,1131,1135,1139,1143,1147,1151,1155,1159,1185,1189,1229,1233,1262,1266,1270,1274,1278,1282,1286,1290,1294,1298,1302,1306,1310,1314,1318,1325,1332,1336,1356,1360,1380,1384,1390,1396,1402],{"id":215,"data":896,"type":220,"tunes":898},{"title":897,"maxLevel":218,"minLevel":219},"Contents",{},{"id":223,"data":900,"type":226,"tunes":902},{"text":901},"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?",{},{"id":229,"data":904,"type":234,"tunes":907},{"body":905,"title":906,"variant":233},"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.","Direct answer",{},{"id":237,"data":909,"type":234,"tunes":912},{"body":910,"title":911,"variant":241},"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.","About the method",{},{"id":244,"data":914,"type":42,"tunes":916},{"text":915,"level":219},"Why citations are not enough",{},{"id":249,"data":918,"type":226,"tunes":920},{"text":919},"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.",{},{"id":254,"data":922,"type":226,"tunes":924},{"text":923},"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.",{},{"id":259,"data":926,"type":42,"tunes":928},{"text":927,"level":219},"The four questions every material claim should pass",{},{"id":264,"data":930,"type":287,"tunes":952},{"content":931,"stretched":43,"withHeadings":14},[932,936,940,944,948],[933,934,935],"Dimension","Question","Typical failure",[937,938,939],"Claim support","Does the evidence directly support this exact claim?","The source is topically related but does not establish the statement",[941,942,943],"Evidence authority","Is this an appropriate source for this kind of claim?","A secondary summary is used where a primary source or live system is required",[945,946,947],"Applicability","Does the evidence apply to this time, version, jurisdiction, user, state, or population?","A true statement is applied outside its valid conditions",[949,950,951],"Evidence use","Was this evidence actually available and used in the agent's execution path?","The final answer is correct, but the retrieved evidence was irrelevant or unused",{},{"id":290,"data":954,"type":42,"tunes":956},{"text":955,"level":218},"1. Claim support: does the source establish what the agent says?",{},{"id":295,"data":958,"type":226,"tunes":960},{"text":959},"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.",{},{"id":300,"data":962,"type":226,"tunes":964},{"text":963},"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.",{},{"id":305,"data":966,"type":42,"tunes":968},{"text":967,"level":218},"2. Evidence authority: is this the right kind of source?",{},{"id":310,"data":970,"type":226,"tunes":972},{"text":971},"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.",{},{"id":315,"data":974,"type":226,"tunes":976},{"text":975},"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.",{},{"id":320,"data":978,"type":42,"tunes":980},{"text":979,"level":218},"3. Applicability: right evidence, wrong conditions",{},{"id":325,"data":982,"type":226,"tunes":984},{"text":983},"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.",{},{"id":330,"data":986,"type":226,"tunes":988},{"text":987},"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.",{},{"id":335,"data":990,"type":234,"tunes":993},{"body":991,"title":992,"variant":339},"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.","Evidence can be authentic and still be wrong for the answer",{},{"id":342,"data":995,"type":42,"tunes":997},{"text":996,"level":218},"4. Evidence use: did the agent actually rely on the evidence?",{},{"id":347,"data":999,"type":226,"tunes":1001},{"text":1000},"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.",{},{"id":352,"data":1003,"type":226,"tunes":1005},{"text":1004},"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.",{},{"id":357,"data":1007,"type":42,"tunes":1009},{"text":1008,"level":219},"The Evidence Utilization Test",{},{"id":362,"data":1011,"type":226,"tunes":1013},{"text":1012},"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.",{},{"id":367,"data":1015,"type":393,"tunes":1039},{"steps":1016,"title":1038,"orientation":392},[1017,1020,1023,1026,1029,1032,1035],{"label":1018,"description":1019},"1. Select one material claim","Choose a claim whose correctness matters and define the expected answer precisely.",{"label":1021,"description":1022},"2. Identify gold evidence","Provide the smallest authoritative evidence set sufficient to support the claim.",{"label":1024,"description":1025},"3. Run with gold evidence","Verify that the agent produces the supported answer when the correct evidence is available.",{"label":1027,"description":1028},"4. Remove the decisive evidence","Run the same task without the key supporting passage while keeping other inputs stable.",{"label":1030,"description":1031},"5. Replace it with contradictory or superseding evidence","Where safe, provide controlled evidence that changes the correct conclusion.",{"label":1033,"description":1034},"6. Compare the claims","Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.",{"label":1036,"description":1037},"7. Inspect the trace","Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.","Evidence Utilization Test",{},{"id":396,"data":1041,"type":234,"tunes":1044},{"body":1042,"title":1043,"variant":400},"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.","The key signal",{},{"id":403,"data":1046,"type":42,"tunes":1048},{"text":1047,"level":219},"A claim–evidence matrix is more useful than a source list",{},{"id":408,"data":1050,"type":287,"tunes":1082},{"content":1051,"stretched":43,"withHeadings":14},[1052,1058,1065,1071,1077],[1053,1054,1055,1056,945,1057],"Claim","Evidence","Support","Authority","Used in trace",[1059,1060,1061,1062,1063,1064],"Feature X is available","Vendor documentation","Direct","High for availability claim","Current version and region must match","Yes \u002F No",[1066,1067,1068,1069,1070,1064],"Configuration Y is faster","Vendor benchmark","Partial","High for vendor's test, not independent performance","Hardware and workload must match",[1072,1073,1074,1075,1076,1064],"Policy applies to this user","Current policy + account state","Direct only when combined","High","Jurisdiction, date, role and account state must match",[1078,1079,1061,1080,1081,1064],"A product is in stock","Live inventory API","Authoritative for current stock","Expires quickly",{},{"id":443,"data":1084,"type":226,"tunes":1086},{"text":1085},"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.",{},{"id":448,"data":1088,"type":42,"tunes":1090},{"text":1089,"level":219},"Separate retrieval quality from evidence quality",{},{"id":453,"data":1092,"type":226,"tunes":1094},{"text":1093},"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.",{},{"id":458,"data":1096,"type":489,"tunes":1118},{"rows":1097,"title":1110,"layout":287,"columns":1111},[1098,1101,1104,1107],{"id":462,"label":1099,"values":1100},"Right document, wrong claim",[465,465,465],{"id":467,"label":1102,"values":1103},"Right fact, stale source",[465,465,465],{"id":471,"label":1105,"values":1106},"Weak source, correct answer",[465,465,465],{"id":475,"label":1108,"values":1109},"Multiple sources required",[465,465,465],"Retrieval success is not evidence success",[1112,1114,1116],{"id":481,"label":1113},"Situation",{"id":484,"label":1115},"Retrieval",{"id":487,"label":1117},"Evidence quality",{},{"id":492,"data":1120,"type":42,"tunes":1122},{"text":1121,"level":219},"Evaluate source quality as a rubric, not a domain whitelist",{},{"id":497,"data":1124,"type":226,"tunes":1126},{"text":1125},"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.",{},{"id":502,"data":1128,"type":226,"tunes":1130},{"text":1129},"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.",{},{"id":507,"data":1132,"type":42,"tunes":1134},{"text":1133,"level":219},"Evidence coverage: every important claim needs support, not every sentence",{},{"id":512,"data":1136,"type":226,"tunes":1138},{"text":1137},"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.",{},{"id":517,"data":1140,"type":226,"tunes":1142},{"text":1141},"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.",{},{"id":522,"data":1144,"type":42,"tunes":1146},{"text":1145,"level":219},"Evidence provenance must survive summarization and memory",{},{"id":527,"data":1148,"type":226,"tunes":1150},{"text":1149},"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.",{},{"id":532,"data":1152,"type":226,"tunes":1154},{"text":1153},"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.",{},{"id":537,"data":1156,"type":42,"tunes":1158},{"text":1157,"level":219},"A practical evidence record",{},{"id":542,"data":1160,"type":287,"tunes":1184},{"content":1161,"stretched":43,"withHeadings":14},[1162,1164,1166,1168,1170,1172,1174,1176,1178,1180,1182],[546,1163],"Purpose",[549,1165],"Identifies the material claim being supported",[552,1167],"Identifies where the evidence came from",[555,1169],"Preserves the smallest passage, record, or tool result that supports the claim",[558,1171],"Allows freshness and timeline checks",[561,1173],"Allows supersession and reproducibility checks",[564,1175],"Explains why this source is suitable for this claim",[567,1177],"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions",[570,1179],"Marks whether evidence is raw, quoted, summarized, normalized, or derived",[573,1181],"Shows when the evidence became available to the agent",[576,1183],"Direct, partial, contradictory, unsupported, or uncertain",{},{"id":580,"data":1186,"type":42,"tunes":1188},{"text":1187,"level":219},"Failure modes that look grounded but are not",{},{"id":585,"data":1190,"type":287,"tunes":1228},{"content":1191,"stretched":43,"withHeadings":14},[1192,1196,1200,1204,1208,1212,1216,1220,1224],[1193,1194,1195],"Failure mode","Why it fools evaluators","What to test",[1197,1198,1199],"Citation decoration","The answer contains sources, so it looks researched","Map each material claim to an exact supporting span",[1201,1202,1203],"Authority mismatch","The source is reputable but not authoritative for the specific fact","Define claim-specific source hierarchy",[1205,1206,1207],"Temporal mismatch","The source was correct when published","Check retrieval time, source date, and superseding evidence",[1209,1210,1211],"Condition stripping","A summary keeps the conclusion but drops exceptions","Compare generated claim with full local source context",[1213,1214,1215],"Post-hoc citation","A plausible source is attached after the answer is generated","Inspect trace ordering and whether evidence preceded the claim",[1217,1218,1219],"Parametric override","The model ignores retrieved evidence and answers from prior knowledge","Run counterfactual evidence-utilization tests",[1221,1222,1223],"Evidence laundering","Model inference is summarized and later stored as if it were a source fact","Preserve transformation type and provenance across memory writes",[1225,1226,1227],"Source majority fallacy","Several secondary pages repeat the same unsupported statement","Trace claims back to independent or primary evidence",{},{"id":626,"data":1230,"type":42,"tunes":1232},{"text":1231,"level":219},"How to evaluate the agent in production",{},{"id":631,"data":1234,"type":393,"tunes":1261},{"steps":1235,"title":1260,"orientation":392},[1236,1239,1242,1245,1248,1251,1254,1257],{"label":1237,"description":1238},"1. Define material claims","Identify the facts, recommendations, or decisions whose correctness matters to the task.",{"label":1240,"description":1241},"2. Build gold evidence","Create reference evidence and source-quality expectations for representative cases.",{"label":1243,"description":1244},"3. Capture traces","Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.",{"label":1246,"description":1247},"4. Grade support","Check whether each material claim is directly, partially, contradictorily, or not supported.",{"label":1249,"description":1250},"5. Grade authority and applicability","Evaluate whether the source is appropriate and whether its conditions match the current task.",{"label":1252,"description":1253},"6. Run counterfactuals","Remove, replace, or supersede decisive evidence and test whether the answer follows the change.",{"label":1255,"description":1256},"7. Review high-impact failures","Use human or domain-expert review where automated grading is not reliable enough.",{"label":1258,"description":1259},"8. Convert failures into eval cases","Add production failures and edge cases to a repeatable regression dataset.","Evidence evaluation pipeline",{},{"id":661,"data":1263,"type":226,"tunes":1265},{"text":1264},"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.",{},{"id":666,"data":1267,"type":42,"tunes":1269},{"text":1268,"level":219},"Do not let an LLM judge become the only evidence judge",{},{"id":671,"data":1271,"type":226,"tunes":1273},{"text":1272},"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.",{},{"id":676,"data":1275,"type":226,"tunes":1277},{"text":1276},"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.",{},{"id":681,"data":1279,"type":42,"tunes":1281},{"text":1280,"level":219},"What would change this answer?",{},{"id":686,"data":1283,"type":226,"tunes":1285},{"text":1284},"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.",{},{"id":691,"data":1287,"type":226,"tunes":1289},{"text":1288},"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.",{},{"id":696,"data":1291,"type":226,"tunes":1293},{"text":1292},"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.",{},{"id":701,"data":1295,"type":42,"tunes":1297},{"text":1296,"level":219},"Limitations",{},{"id":706,"data":1299,"type":226,"tunes":1301},{"text":1300},"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.",{},{"id":711,"data":1303,"type":226,"tunes":1305},{"text":1304},"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.",{},{"id":716,"data":1307,"type":42,"tunes":1309},{"text":1308,"level":219},"Conclusion",{},{"id":721,"data":1311,"type":226,"tunes":1313},{"text":1312},"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?",{},{"id":726,"data":1315,"type":226,"tunes":1317},{"text":1316},"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.",{},{"id":731,"data":1319,"type":737,"tunes":1324},{"url":1320,"title":1321,"excerpt":1322,"ctaLabel":1323},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.","Read the related article",{},{"id":740,"data":1326,"type":737,"tunes":1331},{"url":1327,"title":1328,"excerpt":1329,"ctaLabel":1330},"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","From Research Protocol to a General AI Reasoning Framework","A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.","Read the reasoning framework",{},{"id":748,"data":1333,"type":42,"tunes":1335},{"text":1334,"level":219},"FAQ",{},{"id":753,"data":1337,"type":753,"tunes":1355},{"items":1338,"title":1354},[1339,1342,1345,1348,1351],{"id":757,"answer":1340,"question":1341},"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.","Does a citation prove that an AI answer is grounded?",{"id":761,"answer":1343,"question":1344},"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.","How can I test whether an AI agent actually used retrieved evidence?",{"id":765,"answer":1346,"question":1347},"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.","What is the difference between groundedness and source quality?",{"id":769,"answer":1349,"question":1350},"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.","Why can a real source still produce a wrong AI answer?",{"id":773,"answer":1352,"question":1353},"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.","What should I log for evidence evaluation?","Evaluating evidence use in AI agents",{},{"id":779,"data":1357,"type":42,"tunes":1359},{"text":1358,"level":219},"Glossary",{},{"id":784,"data":1361,"type":784,"tunes":1379},{"title":1362,"entries":1363},"Key evidence-evaluation terms",[1364,1366,1368,1370,1373,1376],{"term":937,"anchor":789,"definition":1365},"The degree to which a specific evidence span directly establishes a generated claim.",{"term":941,"anchor":793,"definition":1367},"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.",{"term":945,"anchor":567,"definition":1369},"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.",{"term":1371,"anchor":799,"definition":1372},"Evidence utilization","Whether the agent's output actually responds to and depends on the evidence made available in its execution path.",{"term":1374,"anchor":803,"definition":1375},"Counterfactual evidence test","An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.",{"term":1377,"anchor":807,"definition":1378},"Provenance","Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.",{},{"id":811,"data":1381,"type":42,"tunes":1383},{"text":1382,"level":219},"Primary sources and further reading",{},{"id":816,"data":1385,"type":823,"tunes":1389},{"link":818,"meta":1386},{"image":1387,"title":821,"description":1388},{"url":465},"Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.",{},{"id":826,"data":1391,"type":823,"tunes":1395},{"link":828,"meta":1392},{"image":1393,"title":831,"description":1394},{"url":465},"Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.",{},{"id":835,"data":1397,"type":823,"tunes":1401},{"link":837,"meta":1398},{"image":1399,"title":840,"description":1400},{"url":465},"Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.",{},{"id":844,"data":1403,"type":823,"tunes":1407},{"link":846,"meta":1404},{"image":1405,"title":849,"description":1406},{"url":465},"Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.",{},"2.31.6","An AI agent can cite sources and still use the wrong evidence. This article introduces a practical method for checking claim support, source authority, applicability, provenance, and whether the evidence actually influenced the answer.",{"lang":7,"title":208,"content":210,"contentJson":1411,"excerpt":853},{"time":212,"blocks":1412,"version":852},[1413,1416,1419,1422,1425,1428,1431,1434,1437,1446,1449,1452,1455,1458,1461,1464,1467,1470,1473,1476,1479,1482,1485,1488,1491,1502,1505,1508,1517,1520,1523,1526,1542,1545,1548,1551,1554,1557,1560,1563,1566,1569,1572,1587,1590,1603,1606,1618,1621,1624,1627,1630,1633,1636,1639,1642,1645,1648,1651,1654,1657,1660,1663,1666,1669,1678,1681,1691,1694,1699,1704,1709],{"id":215,"data":1414,"type":220,"tunes":1415},{"title":217,"maxLevel":218,"minLevel":219},{},{"id":223,"data":1417,"type":226,"tunes":1418},{"text":225},{},{"id":229,"data":1420,"type":234,"tunes":1421},{"body":231,"title":232,"variant":233},{},{"id":237,"data":1423,"type":234,"tunes":1424},{"body":239,"title":240,"variant":241},{},{"id":244,"data":1426,"type":42,"tunes":1427},{"text":246,"level":219},{},{"id":249,"data":1429,"type":226,"tunes":1430},{"text":251},{},{"id":254,"data":1432,"type":226,"tunes":1433},{"text":256},{},{"id":259,"data":1435,"type":42,"tunes":1436},{"text":261,"level":219},{},{"id":264,"data":1438,"type":287,"tunes":1445},{"content":1439,"stretched":43,"withHeadings":14},[1440,1441,1442,1443,1444],[268,269,270],[272,273,274],[276,277,278],[280,281,282],[284,285,286],{},{"id":290,"data":1447,"type":42,"tunes":1448},{"text":292,"level":218},{},{"id":295,"data":1450,"type":226,"tunes":1451},{"text":297},{},{"id":300,"data":1453,"type":226,"tunes":1454},{"text":302},{},{"id":305,"data":1456,"type":42,"tunes":1457},{"text":307,"level":218},{},{"id":310,"data":1459,"type":226,"tunes":1460},{"text":312},{},{"id":315,"data":1462,"type":226,"tunes":1463},{"text":317},{},{"id":320,"data":1465,"type":42,"tunes":1466},{"text":322,"level":218},{},{"id":325,"data":1468,"type":226,"tunes":1469},{"text":327},{},{"id":330,"data":1471,"type":226,"tunes":1472},{"text":332},{},{"id":335,"data":1474,"type":234,"tunes":1475},{"body":337,"title":338,"variant":339},{},{"id":342,"data":1477,"type":42,"tunes":1478},{"text":344,"level":218},{},{"id":347,"data":1480,"type":226,"tunes":1481},{"text":349},{},{"id":352,"data":1483,"type":226,"tunes":1484},{"text":354},{},{"id":357,"data":1486,"type":42,"tunes":1487},{"text":359,"level":219},{},{"id":362,"data":1489,"type":226,"tunes":1490},{"text":364},{},{"id":367,"data":1492,"type":393,"tunes":1501},{"steps":1493,"title":391,"orientation":392},[1494,1495,1496,1497,1498,1499,1500],{"label":371,"description":372},{"label":374,"description":375},{"label":377,"description":378},{"label":380,"description":381},{"label":383,"description":384},{"label":386,"description":387},{"label":389,"description":390},{},{"id":396,"data":1503,"type":234,"tunes":1504},{"body":398,"title":399,"variant":400},{},{"id":403,"data":1506,"type":42,"tunes":1507},{"text":405,"level":219},{},{"id":408,"data":1509,"type":287,"tunes":1516},{"content":1510,"stretched":43,"withHeadings":14},[1511,1512,1513,1514,1515],[412,413,414,415,280,416],[418,419,420,421,422,423],[425,426,427,428,429,423],[431,432,433,434,435,423],[437,438,420,439,440,423],{},{"id":443,"data":1518,"type":226,"tunes":1519},{"text":445},{},{"id":448,"data":1521,"type":42,"tunes":1522},{"text":450,"level":219},{},{"id":453,"data":1524,"type":226,"tunes":1525},{"text":455},{},{"id":458,"data":1527,"type":489,"tunes":1541},{"rows":1528,"title":478,"layout":287,"columns":1537},[1529,1531,1533,1535],{"id":462,"label":463,"values":1530},[465,465,465],{"id":467,"label":468,"values":1532},[465,465,465],{"id":471,"label":472,"values":1534},[465,465,465],{"id":475,"label":476,"values":1536},[465,465,465],[1538,1539,1540],{"id":481,"label":482},{"id":484,"label":485},{"id":487,"label":488},{},{"id":492,"data":1543,"type":42,"tunes":1544},{"text":494,"level":219},{},{"id":497,"data":1546,"type":226,"tunes":1547},{"text":499},{},{"id":502,"data":1549,"type":226,"tunes":1550},{"text":504},{},{"id":507,"data":1552,"type":42,"tunes":1553},{"text":509,"level":219},{},{"id":512,"data":1555,"type":226,"tunes":1556},{"text":514},{},{"id":517,"data":1558,"type":226,"tunes":1559},{"text":519},{},{"id":522,"data":1561,"type":42,"tunes":1562},{"text":524,"level":219},{},{"id":527,"data":1564,"type":226,"tunes":1565},{"text":529},{},{"id":532,"data":1567,"type":226,"tunes":1568},{"text":534},{},{"id":537,"data":1570,"type":42,"tunes":1571},{"text":539,"level":219},{},{"id":542,"data":1573,"type":287,"tunes":1586},{"content":1574,"stretched":43,"withHeadings":14},[1575,1576,1577,1578,1579,1580,1581,1582,1583,1584,1585],[546,547],[549,550],[552,553],[555,556],[558,559],[561,562],[564,565],[567,568],[570,571],[573,574],[576,577],{},{"id":580,"data":1588,"type":42,"tunes":1589},{"text":582,"level":219},{},{"id":585,"data":1591,"type":287,"tunes":1602},{"content":1592,"stretched":43,"withHeadings":14},[1593,1594,1595,1596,1597,1598,1599,1600,1601],[589,590,591],[593,594,595],[597,598,599],[601,602,603],[605,606,607],[609,610,611],[613,614,615],[617,618,619],[621,622,623],{},{"id":626,"data":1604,"type":42,"tunes":1605},{"text":628,"level":219},{},{"id":631,"data":1607,"type":393,"tunes":1617},{"steps":1608,"title":658,"orientation":392},[1609,1610,1611,1612,1613,1614,1615,1616],{"label":635,"description":636},{"label":638,"description":639},{"label":641,"description":642},{"label":644,"description":645},{"label":647,"description":648},{"label":650,"description":651},{"label":653,"description":654},{"label":656,"description":657},{},{"id":661,"data":1619,"type":226,"tunes":1620},{"text":663},{},{"id":666,"data":1622,"type":42,"tunes":1623},{"text":668,"level":219},{},{"id":671,"data":1625,"type":226,"tunes":1626},{"text":673},{},{"id":676,"data":1628,"type":226,"tunes":1629},{"text":678},{},{"id":681,"data":1631,"type":42,"tunes":1632},{"text":683,"level":219},{},{"id":686,"data":1634,"type":226,"tunes":1635},{"text":688},{},{"id":691,"data":1637,"type":226,"tunes":1638},{"text":693},{},{"id":696,"data":1640,"type":226,"tunes":1641},{"text":698},{},{"id":701,"data":1643,"type":42,"tunes":1644},{"text":703,"level":219},{},{"id":706,"data":1646,"type":226,"tunes":1647},{"text":708},{},{"id":711,"data":1649,"type":226,"tunes":1650},{"text":713},{},{"id":716,"data":1652,"type":42,"tunes":1653},{"text":718,"level":219},{},{"id":721,"data":1655,"type":226,"tunes":1656},{"text":723},{},{"id":726,"data":1658,"type":226,"tunes":1659},{"text":728},{},{"id":731,"data":1661,"type":737,"tunes":1662},{"url":733,"title":734,"excerpt":735,"ctaLabel":736},{},{"id":740,"data":1664,"type":737,"tunes":1665},{"url":742,"title":743,"excerpt":744,"ctaLabel":745},{},{"id":748,"data":1667,"type":42,"tunes":1668},{"text":750,"level":219},{},{"id":753,"data":1670,"type":753,"tunes":1677},{"items":1671,"title":776},[1672,1673,1674,1675,1676],{"id":757,"answer":758,"question":759},{"id":761,"answer":762,"question":763},{"id":765,"answer":766,"question":767},{"id":769,"answer":770,"question":771},{"id":773,"answer":774,"question":775},{},{"id":779,"data":1679,"type":42,"tunes":1680},{"text":781,"level":219},{},{"id":784,"data":1682,"type":784,"tunes":1690},{"title":786,"entries":1683},[1684,1685,1686,1687,1688,1689],{"term":272,"anchor":789,"definition":790},{"term":792,"anchor":793,"definition":794},{"term":280,"anchor":567,"definition":796},{"term":798,"anchor":799,"definition":800},{"term":802,"anchor":803,"definition":804},{"term":806,"anchor":807,"definition":808},{},{"id":811,"data":1692,"type":42,"tunes":1693},{"text":813,"level":219},{},{"id":816,"data":1695,"type":823,"tunes":1698},{"link":818,"meta":1696},{"image":1697,"title":821,"description":822},{"url":465},{},{"id":826,"data":1700,"type":823,"tunes":1703},{"link":828,"meta":1701},{"image":1702,"title":831,"description":832},{"url":465},{},{"id":835,"data":1705,"type":823,"tunes":1708},{"link":837,"meta":1706},{"image":1707,"title":840,"description":841},{"url":465},{},{"id":844,"data":1710,"type":823,"tunes":1713},{"link":846,"meta":1711},{"image":1712,"title":849,"description":850},{"url":465},{},"Post erfolgreich abgerufen",{"items":1716,"source":1780,"manualIds":1781,"manualMatchedIds":1782},[1717,1724,1731,1738,1745,1752,1759,1766,1773],{"id":1718,"slug":1719,"title":1720,"excerpt":1721,"featuredImage":1722,"publishedAt":1723},"457","should-you-buy-5g-openwrt-router-old-firmware","Dovresti Acquistare un Router OpenWrt 5G con Firmware Vecchio? ZBT Z8102AX come Esempio Pratico","Acquistare un router 5G OpenWrt con firmware più vecchio può avere senso, ma solo nelle giuste condizioni. Lo ZBT Z8102AX mostra chiaramente entrambi i lati: l'hardware è utile, il modem funziona e il router è rimasto stabile durante i test, ma OpenWrt 21.02, il packaging debole e i percorsi di aggiornamento poco chiari richiedono una decisione d'acquisto attenta.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1725,"slug":1726,"title":1727,"excerpt":1728,"featuredImage":1729,"publishedAt":1730},"476","mcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained","MCP vs A2A vs UCP vs AP2 vs A2UI: Lo stack di protocolli degli agenti spiegato","MCP, A2A, UCP, AP2 e A2UI sono spesso presentati come standard per agenti concorrenti. Per lo più risolvono problemi di interoperabilità diversi. Questa guida mappa ciascun protocollo sul confine che effettivamente standardizza—e mostra come possano lavorare insieme in un unico sistema di produzione.","\u002Fuploads\u002F2026\u002F09\u002Fmcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained-1790352625869-2ezle0.webp","2026-09-25T12:09:00.000Z",{"id":1732,"slug":1733,"title":1734,"excerpt":1735,"featuredImage":1736,"publishedAt":1737},"472","why-more-context-can-make-ai-answers-worse","Perché più contesto può peggiorare le risposte dell'IA","Una finestra di contesto più ampia non garantisce una risposta migliore. Questo articolo spiega come la diluizione del segnale, le prove contrastanti, lo stato obsoleto, la sensibilità alla posizione e la compressione con perdita possano ridurre l'affidabilità dell'IA—e introduce un pratico Context Pressure Test.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z",{"id":1739,"slug":1740,"title":1741,"excerpt":1742,"featuredImage":1743,"publishedAt":1744},"467","the-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","Il confine della validità della risposta: il livello mancante tra rilevanza e risposte AI affidabili","Una fonte può essere pertinente, autorevole e comunque errata per la domanda posta. Il livello mancante è l'applicabilità: le condizioni alle quali una risposta è valida e i cambiamenti che ne impongono una riconsiderazione. Questo articolo introduce l'Answer Validity Boundary come modello di progettazione delle fonti per esseri umani, ricerca AI e sistemi RAG.","\u002Fuploads\u002F2026\u002F09\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers-1790272901306-1g5jly.webp","2026-09-24T11:59:00.000Z",{"id":1746,"slug":1747,"title":1748,"excerpt":1749,"featuredImage":1750,"publishedAt":1751},"383","canonical-architecture-url-design-resolver-logic-api-scalability-specification","Architettura Canonica, Progettazione URL, Logica del Resolver, Specifiche API e Scalabilità","Architettura di scoperta geobasata per portali multi-tenant. Definisce URL canonici, logica di risoluzione, strategia di caching e un modello di lettura geografico senza accoppiamento con CMS o rifattorizzazione del database. Progettata per stabilità SEO, scalabilità ed estensioni future come prenotazioni e mappe.","\u002Fuploads\u002F2026\u002F01\u002Fcanonical-architecture-url-design-resolver-logic-api-scalability-specification-1769890763607-7rghbp.webp","2026-01-31T06:12:00.000Z",{"id":1753,"slug":1754,"title":1755,"excerpt":1756,"featuredImage":1757,"publishedAt":1758},"477","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","Agenti per l'uso del computer: perché una demo di successo può comunque essere un sistema inaffidabile","Gli agenti computer-use possono ora completare impressionanti flussi di lavoro su browser e desktop, ma una singola esecuzione riuscita dimostra la capacità—non l'affidabilità. Questo articolo mostra come testare la ripetibilità, la robustezza ambientale, il controllo a lungo orizzonte, la consapevolezza dello stato, la verifica dei risultati e la gestione sicura degli obiettivi.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","2026-09-25T12:13:00.000Z",{"id":1760,"slug":1761,"title":1762,"excerpt":1763,"featuredImage":1764,"publishedAt":1765},"456","zbt-z8102ax-hardware-packaging-review","Recensione hardware e confezione di ZBT Z8102AX: router forte, scatola debole","Lo ZBT Z8102AX fa una solida prima impressione come router OpenWrt 5G sottile in metallo nero con molteplici connettori per antenna, slot dual-SIM, porte USB, LAN\u002FWAN e un pratico set di accessori. L'hardware sembra utile e serio, ma la confezione è chiaramente il punto debole.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-02-1781620590938-y33j4b.webp","2026-06-16T04:40:00.000Z",{"id":1767,"slug":1768,"title":1769,"excerpt":1770,"featuredImage":1771,"publishedAt":1772},"470","what-should-an-ai-agent-remember-forget-recompute-or-retrieve-again","Cosa dovrebbe ricordare, dimenticare, ricalcolare o recuperare di nuovo un agente IA?","Gli agenti a lunga esecuzione non dovrebbero ricordare tutto. Questo articolo fornisce un modello pratico di ciclo di vita per decidere cosa appartiene alla memoria durevole, cosa dovrebbe essere recuperato di nuovo, cosa è più sicuro ricalcolare e cosa dovrebbe scadere o essere sostituito.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-should-an-ai-agent-remember-forget-recompute-or-retrieve-again-1790351131087-iehz28.webp","2026-09-25T09:43:00.000Z",{"id":1774,"slug":1775,"title":1776,"excerpt":1777,"featuredImage":1778,"publishedAt":1779},"454","zbt-z8102ax-rm500u-ea-5g-modem-test","Quectel RM500U-EA nel ZBT Z8102AX: bande 5G, o2 Germania e comportamento del segnale nel mondo reale","Lo ZBT Z8102AX utilizza un modem Quectel RM500U-EA per la connettività 4G e 5G. Nel primo test pratico, il router si è connesso con successo a o2 Germany con la banda LTE 3 e NR n28. Il modem funziona, ma diagnostiche più approfondite come RSRP, RSRQ, SINR, il blocco delle bande e il comportamento delle celle richiedono ancora test adeguati.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-06-1781620597879-qay2sx.webp","2026-06-16T08:39:00.000Z","fallback",[],[]]