[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:sr":3,"public-menus:all":38,"post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:sr":205,"related:post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:sr:1":1720},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","sr","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1719},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":853,"featuredImage":854,"featuredImageAlt":855,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":856,"publishedAt":857,"createdAt":858,"updatedAt":859,"seoLocalePaths":860,"categories":869,"author":882,"translations":887},"471","Kako znati da li je AI agent zaista koristio prave dokaze","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Sadržaj\">\u003Cstrong class=\"editorjs-toc__title\">Sadržaj\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-5\" class=\"editorjs-toc__link\">Zašto citati nisu dovoljni\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-8\" class=\"editorjs-toc__link\">Četiri pitanja koja svaka materijalna tvrdnja mora da prođe\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">1. Podrška tvrdnji: da li izvor potvrđuje ono što agent tvrdi?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-13\" class=\"editorjs-toc__link\">2. Merodavnost dokaza: da li je ovo prava vrsta izvora?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-16\" class=\"editorjs-toc__link\">3. Primenljivost: pravi dokaz, pogrešni uslovi\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-20\" class=\"editorjs-toc__link\">4. Korišćenje dokaza: da li se agent zaista oslonio na dokaz?\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-23\" class=\"editorjs-toc__link\">Test iskorišćenosti dokaza\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-27\" class=\"editorjs-toc__link\">Matrica tvrdnji i dokaza je korisnija od liste izvora\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-30\" class=\"editorjs-toc__link\">Razlikujte kvalitet pronalaženja od kvaliteta dokaza\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">Procenjujte kvalitet izvora pomoću rubrike, a ne bele liste domena\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-36\" class=\"editorjs-toc__link\">Pokrivenost dokazima: svakoj važnoj tvrdnji je potrebna podrška, a ne svakoj rečenici\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-39\" class=\"editorjs-toc__link\">Poreklo dokaza mora preživeti sažimanje i memoriju\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-42\" class=\"editorjs-toc__link\">Praktičan zapis o dokazu\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-44\" class=\"editorjs-toc__link\">Obrasci neuspeha koji deluju utemeljeno, a to nisu\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-46\" class=\"editorjs-toc__link\">Kako evaluirati agenta u produkciji\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-49\" class=\"editorjs-toc__link\">Ne dozvolite da LLM sudija postane jedini sudija za dokaze\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-52\" class=\"editorjs-toc__link\">Šta bi promenilo ovaj odgovor?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-56\" class=\"editorjs-toc__link\">Ograničenja\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-59\" class=\"editorjs-toc__link\">Zaključak\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-64\" class=\"editorjs-toc__link\">Često postavljana pitanja\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-66\" class=\"editorjs-toc__link\">Rečnik pojmova\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-68\" class=\"editorjs-toc__link\">Primarni izvori i dodatna literatura\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>AI agent može navoditi izvore, preuzimati dokumente, a ipak koristiti pogrešne dokaze. Izvor može biti merodavan, ali nerelevantan za samu tvrdnju. Preuzeti odlomak može podržavati samo deo odgovora. Tačan izvor može biti zastareo, zamenjen novijim ili važeći za pogrešnu nadležnost, verziju proizvoda, korisnika ili stanje sistema. To stvara teži problem evaluacije od jednostavne provere citata: da li je agent zaista koristio prave dokaze za tvrdnju koju je izneo?\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Direktan odgovor\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Da biste znali da li je AI agent koristio prave dokaze, procenite lanac &lt;strong&gt;Tvrdnja → Dokaz → Primenljivost → Upotreba&lt;\u002Fstrong&gt;. Za svaku materijalnu tvrdnju proverite da li je dokaz direktno podržava, da li potiče od odgovarajućeg autoriteta, da li se primenjuje na trenutne uslove i da li je zaista bio dostupan agentu pre nego što je tvrdnja generisana. Sam citat ne dokazuje ništa od toga.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">O metodu\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Model Tvrdnja–Dokaz–Primenljivost–Upotreba i Test iskorišćenosti dokaza u ovom članku su praktične metode evaluacije, a ne formalni industrijski standardi. Oni se nadovezuju na utvrđene koncepte kao što su utemeljenost (groundedness), kvalitet izvora, pokrivenost citatima, evaluacija tragova izvršavanja i procene specifične za zadatak.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-5\">Zašto citati nisu dovoljni\u003C\u002Fh2>\n\u003Cp>Citat odgovara samo na usko pitanje: sistem je povezao tvrdnju ili odgovor sa izvorom. On ne utvrđuje automatski da izvor podržava konkretnu tvrdnju, da je izvor dovoljno merodavan za dati zadatak, da citirani odlomak sadrži neophodan uslov ili izuzetak, niti da se model oslonio na taj dokaz umesto da generiše odgovor na osnovu prethodnog znanja modela.\u003C\u002Fp>\n\u003Cp>Anthropic-ove smernice za evaluaciju istraživačkih agenata izričito razdvajaju utemeljenost, pokrivenost i kvalitet izvora. OpenAI-jeve smernice za evaluaciju agenata na sličan način naglašavaju tragove izvršavanja (traces), jer konačni izlaz ne otkriva da li je agent odabrao prave alate ili sledio predviđeni tok rada. Te ideje ukazuju na širi zaključak: kvalitet dokaza je svojstvo putanje izvršavanja, a ne samo konačnog teksta.\u003C\u002Fp>\n\u003Ch2 id=\"section-8\">Četiri pitanja koja svaka materijalna tvrdnja mora da prođe\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Dimenzija\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Pitanje\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Tipičan propust\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Podrška tvrdnji\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Da li dokaz direktno podržava upravo ovu tvrdnju?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Izvor je tematski povezan, ali ne dokazuje tvrdnju\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Merodavnost dokaza\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Da li je ovo odgovarajući izvor za ovu vrstu tvrdnje?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Korišćen je sekundarni sažetak tamo gde je potreban primarni izvor ili sistem uživo\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Primenljivost\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Da li se dokaz odnosi na ovo vreme, verziju, nadležnost, korisnika, stanje ili populaciju?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Istinita tvrdnja se primenjuje van uslova njenog važenja\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Upotreba dokaza\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Da li je ovaj dokaz zaista bio dostupan i korišćen u agentovoj putanji izvršavanja?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Konačan odgovor je tačan, ali su preuzeti dokazi bili nerelevantni ili nekorišćeni\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch3 id=\"section-10\">1. Podrška tvrdnji: da li izvor potvrđuje ono što agent tvrdi?\u003C\u002Fh3>\n\u003Cp>Dokaze treba procenjivati na nivou tvrdnje. Dokument može biti relevantan za temu, a da ipak ne podržava konkretnu izjavu. Ako izvor navodi da je funkcionalnost dostupna u odabranim regionima, odgovor „funkcionalnost je dostupna globalno” nije podržan iako citat deluje uverljivo.\u003C\u002Fp>\n\u003Cp>Tu su opšte procene tipa „utemeljeno \u002F neutemeljeno” često previše grube. Podelite odgovor na materijalne tvrdnje, mapirajte svaku tvrdnju na najmanji raspon dokaza koji je podržava i klasifikujte odnos: direktna podrška, delimična podrška, protivrečnost ili nedostatak podrške.\u003C\u002Fp>\n\u003Ch3 id=\"section-13\">2. Merodavnost dokaza: da li je ovo prava vrsta izvora?\u003C\u002Fh3>\n\u003Cp>Ispravan izbor dokaza nije samo semantička relevantnost. Izvor mora biti prikladan za donošenje odluke. Trenutni status naloga treba da potiče iz sistema naloga, a ne iz stare e-pošte. Tvrdnju o ponašanju API-ja po pravilu treba proveriti u odnosu na aktuelnu dokumentaciju proizvođača ili ponovljivo ponašanje. Pravni zahtev može zahtevati važeći zakon, regulatorno telo ili merodavne smernice umesto generičkog blog posta.\u003C\u002Fp>\n\u003Cp>Merodavnost izvora zavisi od specifičnog zadatka. Prijava zajednice može biti najbolji dokaz za grešku u praksi koju dokumentacija proizvođača ne priznaje. Saopštenje proizvođača može biti merodavno za ono što proizvođač tvrdi, ali slab dokaz za nezavisne performanse. Zato je evaluatoru potrebna izričita hijerarhija izvora za dati zadatak, a ne jedinstvena univerzalna ocena autoriteta.\u003C\u002Fp>\n\u003Ch3 id=\"section-16\">3. Primenljivost: pravi dokaz, pogrešni uslovi\u003C\u002Fh3>\n\u003Cp>Najopasnije greške u dokazima često nisu izmišljeni izvori, već validni izvori upotrebljeni van svojih granica. Preporuka se može promeniti sa verzijom softvera, datumom, nadležnošću, revizijom hardvera, korisničkim dozvolama, dostupnošću proizvoda, trenutnim stanjem igre, konfiguracijom zakupca ili drugim promenljivama okruženja.\u003C\u002Fp>\n\u003Cp>Za svaki materijalni izvor sačuvajte uslove koji određuju da li se on i dalje primenjuje. Ovo je posebno važno nakon sažimanja: komprimovana memorija ili citat mogu zadržati zaključak, a izostaviti izuzetak, datum ili preduslov koji je taj zaključak činio važećim.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Dokaz može biti verodostojan, a ipak pogrešan za dati odgovor\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Pravi izvor, precizno citiran, i dalje može dovesti do pogrešnog odgovora ako se njegovo vreme, verzija, populacija, nadležnost ili stanje ne poklapaju sa trenutnim pitanjem.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-20\">4. Korišćenje dokaza: da li se agent zaista oslonio na dokaz?\u003C\u002Fh3>\n\u003Cp>Odgovor može biti tačan čak i kada pronalaženje informacija (retrieval) nije uspelo. Model možda već zna odgovor, može ga izvesti iz nepovezanog konteksta ili jednostavno tačno pogoditi. Ako evaluacija proverava samo konačnu tačnost, sistem može delovati dobro utemeljeno iako je putanja dokaza narušena.\u003C\u002Fp>\n\u003Cp>Da biste procenili korišćenje dokaza, pregledajte trag izvršavanja (trace). Potvrdite koji su izvori pronađeni, koji su odlomci stigli do konteksta modela, kada su postali dostupni i da li se konačna tvrdnja može objasniti tim ulaznim podacima. Trenutni alati kompanije OpenAI za evaluaciju agenata naglašavaju ocenjivanje traga izvršavanja upravo zato što se ponašanje na nivou toka rada ne može pouzdano rekonstruisati samo iz konačnog odgovora.\u003C\u002Fp>\n\u003Ch2 id=\"section-23\">Test iskorišćenosti dokaza\u003C\u002Fh2>\n\u003Cp>Praktična evaluacija se može koncipirati kao kontrolisani kontrafaktički test. Umesto da samo pitate da li je odgovor tačan, promenite dokaze i posmatrajte da li se tvrdnja menja u očekivanom pravcu.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Test iskorišćenosti dokaza\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Izaberite jednu ključnu tvrdnju\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Izaberite tvrdnju čija je tačnost važna i precizno definišite očekivani odgovor.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Definišite zlatni standard dokaza\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Obezbedite najmanji autoritativni skup dokaza koji je dovoljan da potkrepi tvrdnju.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Pokrenite sa zlatnim standardom dokaza\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Proverite da li agent daje podržani odgovor kada su tačni dokazi dostupni.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Uklonite presudni dokaz\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Pokrenite isti zadatak bez ključnog potkrepljujućeg odlomka, dok ostali ulazi ostaju nepromenjeni.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Zamenite ga kontradiktornim ili novijim dokazom\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Gde je bezbedno, pružite kontrolisane dokaze koji menjaju tačan zaključak.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Uporedite tvrdnje\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Proverite da li odgovor prati promenu dokaza ili ostaje vezan za prethodno znanje modela.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Pregledajte trag izvršavanja\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Potvrdite šta je pronađeno, šta je dospelo u kontekst i koji izvor ili rezultat alata je prethodio tvrdnji.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Ključni signal\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Ako se presudni dokaz promeni, a agentova tvrdnja ostane ista, imate dokaz da sistem možda ne koristi pronalaženje informacija onako kako je predviđeno — čak i kada se desilo da je prvobitni odgovor bio tačan.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-27\">Matrica tvrdnji i dokaza je korisnija od liste izvora\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Tvrdnja\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Dokaz\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Podrška\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Autoritet\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Primenjivost\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Korišćeno u tragu\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Funkcionalnost X je dostupna\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Dokumentacija proizvođača\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direktna\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Visok za tvrdnju o dostupnosti\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Trenutna verzija i region se moraju poklapati\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Da \u002F Ne\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Konfiguracija Y je brža\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Benchmark test proizvođača\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Delimična\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Visok za test proizvođača, ne za nezavisne performanse\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Hardver i radno opterećenje se moraju poklapati\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Da \u002F Ne\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Politika se primenjuje na ovog korisnika\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Važeća politika + stanje naloga\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direktna samo kada su kombinovani\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Visok\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Nadležnost, datum, uloga i stanje naloga se moraju poklapati\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Da \u002F Ne\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Proizvod je na stanju\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">API za stanje zaliha uživo\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direktna\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autoritativan za trenutno stanje zaliha\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Brzo ističe\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Da \u002F Ne\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Ova matrica nameće nekoliko pitanja koja konvencionalna provera citata skriva. Jedna tvrdnja može zahtevati više izvora. Jedan izvor može podržavati samo deo tvrdnje. Autoritativni izvor može imati kratak period važenja. I savršeno dobar izvor može biti irelevantan ako nikada nije ušao u putanju izvršavanja.\u003C\u002Fp>\n\u003Ch2 id=\"section-30\">Razlikujte kvalitet pronalaženja od kvaliteta dokaza\u003C\u002Fh2>\n\u003Cp>Metrike pronalaženja postavljaju pitanje da li je relevantan materijal pronađen i rangiran. Evaluacija dokaza postavlja pitanje da li taj materijal opravdava izvedene tvrdnje. Ova dva koncepta su povezana, ali nisu identična.\u003C\u002Fp>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Uspešno pronalaženje ne znači i uspeh dokaza\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Situacija\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Pronalaženje (Retrieval)\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Kvalitet dokaza\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Pravi dokument, pogrešna tvrdnja\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Prava činjenica, zastareo izvor\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Slab izvor, tačan odgovor\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Potrebno je više izvora\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-33\">Procenjujte kvalitet izvora pomoću rubrike, a ne bele liste domena\u003C\u002Fh2>\n\u003Cp>Fiksne liste „pouzdanih domena“ deluju primamljivo, ali su često nepouzdane. Umesto toga, kvalitet izvora treba da odražava tip tvrdnje. Korisne dimenzije uključuju primarni naspram sekundarnog statusa, ažurnost, direktnost, ponovljivost, nezavisnost, stručnost u domenu, poreklo podataka, učestalost ažuriranja i to da li izvor ima motiv da preuveliča tvrdnju.\u003C\u002Fp>\n\u003Cp>Smernice kompanije Anthropic za evaluaciju istraživačkih agenata izričito navode provere kvaliteta izvora uporedo sa utemeljenošću i pokrivenošću. Praktična primena bi stoga trebalo da ocenjuje i ono što izvor kaže i da li je taj izvor odgovarajući za takvu vrstu izjave.\u003C\u002Fp>\n\u003Ch2 id=\"section-36\">Pokrivenost dokazima: svakoj važnoj tvrdnji je potrebna podrška, a ne svakoj rečenici\u003C\u002Fh2>\n\u003Cp>Nije svakoj rečenici potreban citat. Prelazne fraze, aritmetika transparentno izvedena iz citiranih vrednosti ili jasno označeno tumačenje možda ne zahtevaju poseban izvor. Ali svaka materijalna, eksterno proverljiva tvrdnja treba da ima dovoljno potpore kako bi procenjivač mogao da rekonstruiše zašto je agentu bilo dozvoljeno da je iznese.\u003C\u002Fp>\n\u003Cp>Pokrivenost bi stoga trebalo ponderisati prema važnosti tvrdnje. Nedostatak potpore za dekorativni detalj nije isto što i nedostatak potpore za cenu, odluku o ispunjavanju uslova, bezbednosno uputstvo, zakonski zahtev, izjavu o tehničkoj kompatibilnosti ili činjenicu koja usmerava preporuku.\u003C\u002Fp>\n\u003Ch2 id=\"section-39\">Poreklo dokaza mora preživeti sažimanje i memoriju\u003C\u002Fh2>\n\u003Cp>Agenti sa dugim radom često sažimaju prethodni rad ili zapisuju trajne memorije. Ako se poreklo dokaza ukloni tokom te transformacije, budući agenti mogu preuzeti čist zaključak bez znanja o tome da li potiče iz izjave korisnika, API-ja uživo, starog dokumenta, zaključivanja modela ili neproverenog veb rezultata.\u003C\u002Fp>\n\u003Cp>Za važne činjenice sačuvajte bar identitet izvora, vreme preuzimanja ili opažanja, tip dokaza, relevantnu verziju ili stanje, kao i to da li je sačuvani tekst citiran, sažet, izveden zaključivanjem ili izračunat. Poreklo je ono što omogućava kasnijem agentu da odluči da li dokazu treba verovati, da li ga treba osvežiti, ograničiti ili odbaciti.\u003C\u002Fp>\n\u003Ch2 id=\"section-42\">Praktičan zapis o dokazu\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Polje\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Svrha\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">claim_id\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Identifikuje materijalnu tvrdnju koja se potkrepljuje\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_id \u002F source_url \u002F system\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Identifikuje odakle dokaz potiče\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">evidence_span\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Čuva najmanji odlomak, zapis ili rezultat alata koji potkrepljuje tvrdnju\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">retrieved_at \u002F observed_at\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Omogućava provere svežine i vremenskog toka\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_version \u002F object_version\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Omogućava provere zamenjenosti i ponovljivosti\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">authority_role\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Objašnjava zašto je ovaj izvor prikladan za ovu tvrdnju\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">applicability\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Čuva relevantan datum, jurisdikciju, verziju proizvoda, korisnika, zakupca, stanje ili druge uslove\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">transformation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Označava da li je dokaz sirov, citiran, sažet, normalizovan ili izveden\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">trace_step\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prikazuje kada je dokaz postao dostupan agentu\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">support_status\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direktan, delimičan, kontradiktoran, nepodržan ili neizvestan\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-44\">Obrasci neuspeha koji deluju utemeljeno, a to nisu\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Obrazac neuspeha\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Zašto zavarava procenjivače\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Šta testirati\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Dekorativno citiranje\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Odgovor sadrži izvore, pa deluje istraženo\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Mapirati svaku materijalnu tvrdnju na tačan potkrepljujući odlomak\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Neusklađenost autoriteta\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Izvor je ugledan, ali nije merodavan za konkretnu činjenicu\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Definisati hijerarhiju izvora specifičnu za tvrdnju\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Vremenska neusklađenost\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Izvor je bio tačan u trenutku objavljivanja\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Proveriti vreme preuzimanja, datum izvora i dokaze koji ga zamenjuju\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Uklanjanje uslova\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sažetak zadržava zaključak, ali izostavlja izuzetke\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Uporediti generisanu tvrdnju sa punim lokalnim kontekstom izvora\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Naknadno citiranje (post-hoc)\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Uverljiv izvor se dodaje tek nakon što je odgovor generisan\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ispitati redosled u tragu i da li je dokaz prethodio tvrdnji\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Parametarsko preinačenje\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Model ignoriše preuzeti dokaz i odgovara na osnovu prethodnog znanja\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Pokrenuti kontračinjenične testove korišćenja dokaza\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Pranje dokaza\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Zaključak modela se sažima i kasnije čuva kao da je izvorna činjenica\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sačuvati tip transformacije i poreklo prilikom svakog upisivanja u memoriju\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Zabluda većine izvora\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Nekoliko sekundarnih stranica ponavlja istu nepotkrepljenu tvrdnju\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Pratiti tvrdnje unazad do nezavisnih ili primarnih dokaza\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-46\">Kako evaluirati agenta u produkciji\u003C\u002Fh2>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Tok evaluacije dokaza\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Definišite materijalne tvrdnje\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identifikujte činjenice, preporuke ili odluke čija je tačnost važna za zadatak.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Izgradite referentne dokaze\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Kreirajte referentne dokaze i očekivanja o kvalitetu izvora za reprezentativne slučajeve.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Beležite tragove\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Zapisujte upite za preuzimanje, pozive alata, vraćene dokaze, konstrukciju konteksta, izlaz modela i citate.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Ocenite nivo potpore\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Proverite da li je svaka materijalna tvrdnja direktno, delimično, kontradiktorno ili uopšte nije podržana.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Ocenite autoritet i primenjivost\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Procenite da li je izvor prikladan i da li njegovi uslovi odgovaraju trenutnom zadatku.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Pokrenite kontračinjenične testove\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Uklonite, zamenite ili oborite presudan dokaz i testirajte da li odgovor prati tu promenu.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Pregledajte neuspehe visokog uticaja\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Koristite ljudski pregled ili stručnjake za datu oblast gde automatizovano ocenjivanje nije dovoljno pouzdano.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Pretvorite neuspehe u test primere\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Dodajte produkcijske neuspehe i granične slučajeve u ponovljivi skup podataka za regresiju.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>OpenAI-jeve aktuelne smernice za evaluaciju preporučuju evaluacije specifične za zadatak, kontinuiranu evaluaciju, skupove podataka izvedene iz produkcije i tragove za otklanjanje grešaka u ponašanju agenta. Anthropic slično tome preporučuje kombinovanje različitih tipova ocenjivača za istraživačke agente, jer su tačnost, kvalitet izvora, pokrivenost i utemeljenost zasebne dimenzije. Evaluacija dokaza treba da prati isti obrazac: nekoliko usko usmerenih ocenjivača pruža bolju dijagnostiku od jedne neprozirne ocene „kvaliteta“.\u003C\u002Fp>\n\u003Ch2 id=\"section-49\">Ne dozvolite da LLM sudija postane jedini sudija za dokaze\u003C\u002Fh2>\n\u003Cp>LLM ocenjivači su korisni za skalabilnu klasifikaciju tvrdnji, provere relevantnosti i poređenja u parovima, ali mogu deliti iste slepe mrlje kao i sistem koji procenjuju. Ocenjivač može prihvatiti uverljivu, ali nepodržanu tvrdnju, propustiti suptilnu granicu verzije ili preceniti doteran izvor.\u003C\u002Fp>\n\u003Cp>OpenAI-jeve smernice za evaluaciju preporučuju kalibraciju automatizovanih ocenjivača u odnosu na ljudsko rasuđivanje i korišćenje jasnih, precizno definisanih kriterijuma. Za sisteme koji se u velikoj meri oslanjaju na dokaze, determinističke provere treba koristiti gde god je to moguće: vremenske oznake, verzije objekata, opseg dozvola, tačne ID-jeve izvora, redosled preuzimanja, heševe dokumenata i to da li je dokaz postojao pre nego što je model generisao tvrdnju.\u003C\u002Fp>\n\u003Ch2 id=\"section-52\">Šta bi promenilo ovaj odgovor?\u003C\u002Fh2>\n\u003Cp>Evaluacija može biti jednostavnija kada agent radi nad malim, nepromenljivim, autoritativnim korpusom i kada je svaki odgovor striktno ekstraktivan. U tom okruženju autoritet izvora i primenjivost su uglavnom fiksni, pa potpora na relaciji tvrdnja-odlomak može biti dovoljna.\u003C\u002Fp>\n\u003Cp>Evaluacija mora postati stroža kada agent kombinuje veb pretragu, dugoročnu memoriju, alate uživo, više jurisdikcija, informacije koje se brzo menjaju, stanje specifično za korisnika ili autonomne akcije. U takvim sistemima validnost dokaza zavisi ne samo od teksta izvora, već i od toga kada su i kako dokazi pribavljeni.\u003C\u002Fp>\n\u003Cp>Budući modeli mogu postati bolji u internom praćenju porekla i nesigurnosti, ali to ne bi uklonilo potrebu za eksternim zapisima dokaza u sistemima koji zahtevaju proverljivost. Sistem ne bi trebalo da zavisi od modelovog sopstvenog izveštavanja o tome šta je uticalo na njega kada tragovi i metapodaci izvora mogu pružiti jače dokaze.\u003C\u002Fp>\n\u003Ch2 id=\"section-56\">Ograničenja\u003C\u002Fh2>\n\u003Cp>Nije uvek moguće dokazati uzročnu upotrebu dokaza samo na osnovu tragova izvršavanja. Izvor može biti prisutan u kontekstu bez uticaja na odgovor, a model može nezavisno znati istu činjenicu. Kontračinjenični testovi pojačavaju zaključivanje, ali mogu i sami promeniti raspodelu zadatka.\u003C\u002Fp>\n\u003Cp>Autoritet izvora takođe može biti osporavan ili zavisan od domena. Neka pitanja nemaju jedan autoritativan izvor, a stručnjaci se mogu razilaziti u mišljenjima o tome koji dokaz zaslužuje veću težinu. U tim slučajevima, procenjivač treba da sačuva neslaganje i oceni transparentnost, pokrivenost i rezonovanje u odnosu na eksplicitnu rubriku, umesto da se pretvara da postoji jedan neprikosnoveni izvor istine.\u003C\u002Fp>\n\u003Ch2 id=\"section-59\">Zaključak\u003C\u002Fh2>\n\u003Cp>Pitanje „Da li je agent naveo izvor?“ suviše je slabo za produkcioni AI. Jače pitanje je: Da li je svaka važna tvrdnja proizašla iz dokaza koji je zaista podržavaju, poseduju odgovarajući autoritet, i dalje važe u trenutnim uslovima i bili su dostupni na putanji izvršavanja pre nego što je tvrdnja izrečena?\u003C\u002Fp>\n\u003Cp>To pretvara dokaze iz pukog ukrasa u procenjivo svojstvo sistema. Zabeležite trag izvršavanja. Mapirajte tvrdnje na dokaze. Proverite autoritet i primenljivost. Pokrenite kontračinjenične testove dokaza. Sačuvajte poreklo kroz sažetke i memoriju. Tada tačan odgovor nije samo verovatan — on ima dokazni put koji možete pregledati.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fsr\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Pouzdanost AI agenata: Zašto konačni odgovor nije dovoljan\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Tačnost samog ishoda ne može dokazati da je agentova putanja izvršavanja bila bezbedna ili pouzdana. Ovaj povezani članak objašnjava zašto su putanje, alati i posredne odluke važni.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Pročitajte povezani članak →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fsr\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Od protokola istraživanja do opšteg okvira za AI rezonovanje\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Praktičan metod rezonovanja za razdvajanje dokaza, pretpostavki, suprotstavljenih hipoteza i validacije specifične za domen.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Pročitajte okvir za rezonovanje →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-64\">Često postavljana pitanja\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Evaluacija upotrebe dokaza kod AI agenata\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Da li citiranje dokazuje da je odgovor AI-ja utemeljen?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Ne. Citat može biti relevantan za temu bez podržavanja tačne tvrdnje, može poticati od pogrešnog autoriteta, više ne mora da važi ili je mogao biti pridodat bez suštinskog uticaja na generisani odgovor.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Kako mogu da testiram da li je AI agent zaista koristio preuzete dokaze?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Upotrebite kontračinjenični test korišćenja dokaza: pokrenite zadatak sa dokazano tačnim dokazima, a zatim uklonite ili zamenite presudni dokaz dok druge ulaze držite stabilnim. Ako odgovor ne reaguje na promenu dokaza, proverite da li se model oslanja na prethodno znanje ili drugi izvor.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Koja je razlika između utemeljenosti i kvaliteta izvora?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Utemeljenost postavlja pitanje da li su tvrdnje podržane priloženim dokazima. Kvalitet izvora postavlja pitanje da li je sam dokaz prikladan i dovoljno autoritativan za tip tvrdnje koja se iznosi.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Zašto stvarni izvor i dalje može proizvesti pogrešan odgovor AI-ja?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Izvor može biti zastareo, prevaziđen, važeći za drugu verziju, jurisdikciju, korisnika, populaciju ili stanje sistema, ili može sadržati uslove koji su izgubljeni tokom preuzimanja ili sažimanja.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Šta treba beležiti u dnevnik radi evaluacije dokaza?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Zabeležite upit za pretragu, vraćene izvore, tačne odlomke dokaza, vremenske oznake i verzije, filtere, konačni kontekst, izlaz modela, citate i redosled tragova, kako bi procenjivači mogli da rekonstruišu koji su dokazi bili dostupni pre svake materijalne tvrdnje.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-66\">Rečnik pojmova\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Ključni pojmovi evaluacije dokaza\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"claim-support\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Podrška tvrdnji\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Stepen u kojem određeni fragment dokaza direktno potvrđuje generisanu tvrdnju.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-authority\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Autoritet dokaza\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Koliko je izvor prikladan za utvrđivanje određenog tipa tvrdnje, s obzirom na njegovu ulogu, poreklo i odnos prema osnovnoj činjenici.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"applicability\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Primenljivost\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Uslovi pod kojima dokaz ostaje važeći za tvrdnju, uključujući vreme, verziju, jurisdikciju, korisnika, populaciju, stanje sistema ili druge granice.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-utilization\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Korišćenje dokaza\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Da li izlaz agenta zaista reaguje na dokaze koji su mu stavljeni na raspolaganje na putanji izvršavanja i zavisi od njih.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"counterfactual-evidence-test\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Kontračinjenični test dokaza\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Evaluacija koja uklanja, zamenjuje ili menja presudne dokaze kako bi se proverilo da li se tvrdnja agenta adekvatno menja.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"provenance\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Poreklo podataka\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Metapodaci koji beleže odakle dokaz potiče, kada je dobijen, kako je transformisan i koju verziju ili stanje je predstavljao.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-68\">Primarni izvori i dodatna literatura\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Evaluacija radnih tokova agenata\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Smernice za ocenjivanje tragova izvršavanja, evaluaciju na nivou radnog toka, skupove podataka i ponovljiva pokretanja evaluacije za agente.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Najbolje prakse za evaluaciju\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Smernice za evaluacije specifične za zadatke, skupove podataka izvedene iz produkcije, metrike uskog opsega, kontinuiranu evaluaciju i kalibraciju ocenjivača.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Anthropic — Demistifikacija evaluacija za AI agente\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Smernice za evaluaciju agenata uključujući utemeljenost, pokrivenost i provere kvaliteta izvora za istraživačke agente.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Zajednički priručnik za pouzdane evaluacije trećih strana\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Smernice za evaluaciju koje naglašavaju da performanse savremenih agenata zavise od radnog toka i okruženja, a ne samo od konačnog izlaza modela.\u003C\u002Fp>\u003C\u002Fa>",{"time":212,"blocks":213,"version":852},1790368140485,[214,222,228,236,243,248,253,258,263,289,294,299,304,309,314,319,324,329,334,341,346,351,356,361,366,394,401,406,442,447,452,457,491,496,501,506,511,516,521,526,531,536,541,579,584,625,630,660,665,670,675,680,685,690,695,700,705,710,715,720,725,730,739,747,752,778,783,810,815,825,834,843],{"id":215,"data":216,"type":220,"tunes":221},"0hk9UtwqZf",{"title":217,"maxLevel":218,"minLevel":219},"Sadržaj",3,2,"tableOfContents",{},{"id":223,"data":224,"type":226,"tunes":227},"intro",{"text":225},"AI agent može navoditi izvore, preuzimati dokumente, a ipak koristiti pogrešne dokaze. Izvor može biti merodavan, ali nerelevantan za samu tvrdnju. Preuzeti odlomak može podržavati samo deo odgovora. Tačan izvor može biti zastareo, zamenjen novijim ili važeći za pogrešnu nadležnost, verziju proizvoda, korisnika ili stanje sistema. To stvara teži problem evaluacije od jednostavne provere citata: da li je agent zaista koristio prave dokaze za tvrdnju koju je izneo?","paragraph",{},{"id":229,"data":230,"type":234,"tunes":235},"direct",{"body":231,"title":232,"variant":233},"Da biste znali da li je AI agent koristio prave dokaze, procenite lanac \u003Cstrong>Tvrdnja → Dokaz → Primenljivost → Upotreba\u003C\u002Fstrong>. Za svaku materijalnu tvrdnju proverite da li je dokaz direktno podržava, da li potiče od odgovarajućeg autoriteta, da li se primenjuje na trenutne uslove i da li je zaista bio dostupan agentu pre nego što je tvrdnja generisana. Sam citat ne dokazuje ništa od toga.","Direktan odgovor","info","callout",{},{"id":237,"data":238,"type":234,"tunes":242},"method-note",{"body":239,"title":240,"variant":241},"Model Tvrdnja–Dokaz–Primenljivost–Upotreba i Test iskorišćenosti dokaza u ovom članku su praktične metode evaluacije, a ne formalni industrijski standardi. Oni se nadovezuju na utvrđene koncepte kao što su utemeljenost (groundedness), kvalitet izvora, pokrivenost citatima, evaluacija tragova izvršavanja i procene specifične za zadatak.","O metodu","note",{},{"id":244,"data":245,"type":42,"tunes":247},"h-citations",{"text":246,"level":219},"Zašto citati nisu dovoljni",{},{"id":249,"data":250,"type":226,"tunes":252},"p-citations-1",{"text":251},"Citat odgovara samo na usko pitanje: sistem je povezao tvrdnju ili odgovor sa izvorom. On ne utvrđuje automatski da izvor podržava konkretnu tvrdnju, da je izvor dovoljno merodavan za dati zadatak, da citirani odlomak sadrži neophodan uslov ili izuzetak, niti da se model oslonio na taj dokaz umesto da generiše odgovor na osnovu prethodnog znanja modela.",{},{"id":254,"data":255,"type":226,"tunes":257},"p-citations-2",{"text":256},"Anthropic-ove smernice za evaluaciju istraživačkih agenata izričito razdvajaju utemeljenost, pokrivenost i kvalitet izvora. OpenAI-jeve smernice za evaluaciju agenata na sličan način naglašavaju tragove izvršavanja (traces), jer konačni izlaz ne otkriva da li je agent odabrao prave alate ili sledio predviđeni tok rada. Te ideje ukazuju na širi zaključak: kvalitet dokaza je svojstvo putanje izvršavanja, a ne samo konačnog teksta.",{},{"id":259,"data":260,"type":42,"tunes":262},"h-four",{"text":261,"level":219},"Četiri pitanja koja svaka materijalna tvrdnja mora da prođe",{},{"id":264,"data":265,"type":287,"tunes":288},"table-four",{"content":266,"stretched":43,"withHeadings":14},[267,271,275,279,283],[268,269,270],"Dimenzija","Pitanje","Tipičan propust",[272,273,274],"Podrška tvrdnji","Da li dokaz direktno podržava upravo ovu tvrdnju?","Izvor je tematski povezan, ali ne dokazuje tvrdnju",[276,277,278],"Merodavnost dokaza","Da li je ovo odgovarajući izvor za ovu vrstu tvrdnje?","Korišćen je sekundarni sažetak tamo gde je potreban primarni izvor ili sistem uživo",[280,281,282],"Primenljivost","Da li se dokaz odnosi na ovo vreme, verziju, nadležnost, korisnika, stanje ili populaciju?","Istinita tvrdnja se primenjuje van uslova njenog važenja",[284,285,286],"Upotreba dokaza","Da li je ovaj dokaz zaista bio dostupan i korišćen u agentovoj putanji izvršavanja?","Konačan odgovor je tačan, ali su preuzeti dokazi bili nerelevantni ili nekorišćeni","table",{},{"id":290,"data":291,"type":42,"tunes":293},"h-support",{"text":292,"level":218},"1. Podrška tvrdnji: da li izvor potvrđuje ono što agent tvrdi?",{},{"id":295,"data":296,"type":226,"tunes":298},"p-support-1",{"text":297},"Dokaze treba procenjivati na nivou tvrdnje. Dokument može biti relevantan za temu, a da ipak ne podržava konkretnu izjavu. Ako izvor navodi da je funkcionalnost dostupna u odabranim regionima, odgovor „funkcionalnost je dostupna globalno” nije podržan iako citat deluje uverljivo.",{},{"id":300,"data":301,"type":226,"tunes":303},"p-support-2",{"text":302},"Tu su opšte procene tipa „utemeljeno \u002F neutemeljeno” često previše grube. Podelite odgovor na materijalne tvrdnje, mapirajte svaku tvrdnju na najmanji raspon dokaza koji je podržava i klasifikujte odnos: direktna podrška, delimična podrška, protivrečnost ili nedostatak podrške.",{},{"id":305,"data":306,"type":42,"tunes":308},"h-authority",{"text":307,"level":218},"2. Merodavnost dokaza: da li je ovo prava vrsta izvora?",{},{"id":310,"data":311,"type":226,"tunes":313},"p-authority-1",{"text":312},"Ispravan izbor dokaza nije samo semantička relevantnost. Izvor mora biti prikladan za donošenje odluke. Trenutni status naloga treba da potiče iz sistema naloga, a ne iz stare e-pošte. Tvrdnju o ponašanju API-ja po pravilu treba proveriti u odnosu na aktuelnu dokumentaciju proizvođača ili ponovljivo ponašanje. Pravni zahtev može zahtevati važeći zakon, regulatorno telo ili merodavne smernice umesto generičkog blog posta.",{},{"id":315,"data":316,"type":226,"tunes":318},"p-authority-2",{"text":317},"Merodavnost izvora zavisi od specifičnog zadatka. Prijava zajednice može biti najbolji dokaz za grešku u praksi koju dokumentacija proizvođača ne priznaje. Saopštenje proizvođača može biti merodavno za ono što proizvođač tvrdi, ali slab dokaz za nezavisne performanse. Zato je evaluatoru potrebna izričita hijerarhija izvora za dati zadatak, a ne jedinstvena univerzalna ocena autoriteta.",{},{"id":320,"data":321,"type":42,"tunes":323},"h-applicability",{"text":322,"level":218},"3. Primenljivost: pravi dokaz, pogrešni uslovi",{},{"id":325,"data":326,"type":226,"tunes":328},"p-apply-1",{"text":327},"Najopasnije greške u dokazima često nisu izmišljeni izvori, već validni izvori upotrebljeni van svojih granica. Preporuka se može promeniti sa verzijom softvera, datumom, nadležnošću, revizijom hardvera, korisničkim dozvolama, dostupnošću proizvoda, trenutnim stanjem igre, konfiguracijom zakupca ili drugim promenljivama okruženja.",{},{"id":330,"data":331,"type":226,"tunes":333},"p-apply-2",{"text":332},"Za svaki materijalni izvor sačuvajte uslove koji određuju da li se on i dalje primenjuje. Ovo je posebno važno nakon sažimanja: komprimovana memorija ili citat mogu zadržati zaključak, a izostaviti izuzetak, datum ili preduslov koji je taj zaključak činio važećim.",{},{"id":335,"data":336,"type":234,"tunes":340},"apply-warning",{"body":337,"title":338,"variant":339},"Pravi izvor, precizno citiran, i dalje može dovesti do pogrešnog odgovora ako se njegovo vreme, verzija, populacija, nadležnost ili stanje ne poklapaju sa trenutnim pitanjem.","Dokaz može biti verodostojan, a ipak pogrešan za dati odgovor","warning",{},{"id":342,"data":343,"type":42,"tunes":345},"h-use",{"text":344,"level":218},"4. Korišćenje dokaza: da li se agent zaista oslonio na dokaz?",{},{"id":347,"data":348,"type":226,"tunes":350},"p-use-1",{"text":349},"Odgovor može biti tačan čak i kada pronalaženje informacija (retrieval) nije uspelo. Model možda već zna odgovor, može ga izvesti iz nepovezanog konteksta ili jednostavno tačno pogoditi. Ako evaluacija proverava samo konačnu tačnost, sistem može delovati dobro utemeljeno iako je putanja dokaza narušena.",{},{"id":352,"data":353,"type":226,"tunes":355},"p-use-2",{"text":354},"Da biste procenili korišćenje dokaza, pregledajte trag izvršavanja (trace). Potvrdite koji su izvori pronađeni, koji su odlomci stigli do konteksta modela, kada su postali dostupni i da li se konačna tvrdnja može objasniti tim ulaznim podacima. Trenutni alati kompanije OpenAI za evaluaciju agenata naglašavaju ocenjivanje traga izvršavanja upravo zato što se ponašanje na nivou toka rada ne može pouzdano rekonstruisati samo iz konačnog odgovora.",{},{"id":357,"data":358,"type":42,"tunes":360},"h-eut",{"text":359,"level":219},"Test iskorišćenosti dokaza",{},{"id":362,"data":363,"type":226,"tunes":365},"p-eut-intro",{"text":364},"Praktična evaluacija se može koncipirati kao kontrolisani kontrafaktički test. Umesto da samo pitate da li je odgovor tačan, promenite dokaze i posmatrajte da li se tvrdnja menja u očekivanom pravcu.",{},{"id":367,"data":368,"type":392,"tunes":393},"eut-flow",{"steps":369,"title":359,"orientation":391},[370,373,376,379,382,385,388],{"label":371,"description":372},"1. Izaberite jednu ključnu tvrdnju","Izaberite tvrdnju čija je tačnost važna i precizno definišite očekivani odgovor.",{"label":374,"description":375},"2. Definišite zlatni standard dokaza","Obezbedite najmanji autoritativni skup dokaza koji je dovoljan da potkrepi tvrdnju.",{"label":377,"description":378},"3. Pokrenite sa zlatnim standardom dokaza","Proverite da li agent daje podržani odgovor kada su tačni dokazi dostupni.",{"label":380,"description":381},"4. Uklonite presudni dokaz","Pokrenite isti zadatak bez ključnog potkrepljujućeg odlomka, dok ostali ulazi ostaju nepromenjeni.",{"label":383,"description":384},"5. Zamenite ga kontradiktornim ili novijim dokazom","Gde je bezbedno, pružite kontrolisane dokaze koji menjaju tačan zaključak.",{"label":386,"description":387},"6. Uporedite tvrdnje","Proverite da li odgovor prati promenu dokaza ili ostaje vezan za prethodno znanje modela.",{"label":389,"description":390},"7. Pregledajte trag izvršavanja","Potvrdite šta je pronađeno, šta je dospelo u kontekst i koji izvor ili rezultat alata je prethodio tvrdnji.","auto","processFlow",{},{"id":395,"data":396,"type":234,"tunes":400},"eut-tip",{"body":397,"title":398,"variant":399},"Ako se presudni dokaz promeni, a agentova tvrdnja ostane ista, imate dokaz da sistem možda ne koristi pronalaženje informacija onako kako je predviđeno — čak i kada se desilo da je prvobitni odgovor bio tačan.","Ključni signal","tip",{},{"id":402,"data":403,"type":42,"tunes":405},"h-matrix",{"text":404,"level":219},"Matrica tvrdnji i dokaza je korisnija od liste izvora",{},{"id":407,"data":408,"type":287,"tunes":441},"claim-matrix",{"content":409,"stretched":43,"withHeadings":14},[410,417,424,430,436],[411,412,413,414,415,416],"Tvrdnja","Dokaz","Podrška","Autoritet","Primenjivost","Korišćeno u tragu",[418,419,420,421,422,423],"Funkcionalnost X je dostupna","Dokumentacija proizvođača","Direktna","Visok za tvrdnju o dostupnosti","Trenutna verzija i region se moraju poklapati","Da \u002F Ne",[425,426,427,428,429,423],"Konfiguracija Y je brža","Benchmark test proizvođača","Delimična","Visok za test proizvođača, ne za nezavisne performanse","Hardver i radno opterećenje se moraju poklapati",[431,432,433,434,435,423],"Politika se primenjuje na ovog korisnika","Važeća politika + stanje naloga","Direktna samo kada su kombinovani","Visok","Nadležnost, datum, uloga i stanje naloga se moraju poklapati",[437,438,420,439,440,423],"Proizvod je na stanju","API za stanje zaliha uživo","Autoritativan za trenutno stanje zaliha","Brzo ističe",{},{"id":443,"data":444,"type":226,"tunes":446},"p-matrix-1",{"text":445},"Ova matrica nameće nekoliko pitanja koja konvencionalna provera citata skriva. Jedna tvrdnja može zahtevati više izvora. Jedan izvor može podržavati samo deo tvrdnje. Autoritativni izvor može imati kratak period važenja. I savršeno dobar izvor može biti irelevantan ako nikada nije ušao u putanju izvršavanja.",{},{"id":448,"data":449,"type":42,"tunes":451},"h-retrieval-evidence",{"text":450,"level":219},"Razlikujte kvalitet pronalaženja od kvaliteta dokaza",{},{"id":453,"data":454,"type":226,"tunes":456},"p-re-1",{"text":455},"Metrike pronalaženja postavljaju pitanje da li je relevantan materijal pronađen i rangiran. Evaluacija dokaza postavlja pitanje da li taj materijal opravdava izvedene tvrdnje. Ova dva koncepta su povezana, ali nisu identična.",{},{"id":458,"data":459,"type":489,"tunes":490},"retrieval-comparison",{"rows":460,"title":478,"layout":287,"columns":479},[461,466,470,474],{"id":462,"label":463,"values":464},"a","Pravi dokument, pogrešna tvrdnja",[465,465,465],"",{"id":467,"label":468,"values":469},"b","Prava činjenica, zastareo izvor",[465,465,465],{"id":471,"label":472,"values":473},"c","Slab izvor, tačan odgovor",[465,465,465],{"id":475,"label":476,"values":477},"d","Potrebno je više izvora",[465,465,465],"Uspešno pronalaženje ne znači i uspeh dokaza",[480,483,486],{"id":481,"label":482},"situation","Situacija",{"id":484,"label":485},"retrieval","Pronalaženje (Retrieval)",{"id":487,"label":488},"evidence","Kvalitet dokaza","comparison",{},{"id":492,"data":493,"type":42,"tunes":495},"h-source-quality",{"text":494,"level":219},"Procenjujte kvalitet izvora pomoću rubrike, a ne bele liste domena",{},{"id":497,"data":498,"type":226,"tunes":500},"p-source-quality-1",{"text":499},"Fiksne liste „pouzdanih domena“ deluju primamljivo, ali su često nepouzdane. Umesto toga, kvalitet izvora treba da odražava tip tvrdnje. Korisne dimenzije uključuju primarni naspram sekundarnog statusa, ažurnost, direktnost, ponovljivost, nezavisnost, stručnost u domenu, poreklo podataka, učestalost ažuriranja i to da li izvor ima motiv da preuveliča tvrdnju.",{},{"id":502,"data":503,"type":226,"tunes":505},"p-source-quality-2",{"text":504},"Smernice kompanije Anthropic za evaluaciju istraživačkih agenata izričito navode provere kvaliteta izvora uporedo sa utemeljenošću i pokrivenošću. Praktična primena bi stoga trebalo da ocenjuje i ono što izvor kaže i da li je taj izvor odgovarajući za takvu vrstu izjave.",{},{"id":507,"data":508,"type":42,"tunes":510},"h-coverage",{"text":509,"level":219},"Pokrivenost dokazima: svakoj važnoj tvrdnji je potrebna podrška, a ne svakoj rečenici",{},{"id":512,"data":513,"type":226,"tunes":515},"p-coverage-1",{"text":514},"Nije svakoj rečenici potreban citat. Prelazne fraze, aritmetika transparentno izvedena iz citiranih vrednosti ili jasno označeno tumačenje možda ne zahtevaju poseban izvor. Ali svaka materijalna, eksterno proverljiva tvrdnja treba da ima dovoljno potpore kako bi procenjivač mogao da rekonstruiše zašto je agentu bilo dozvoljeno da je iznese.",{},{"id":517,"data":518,"type":226,"tunes":520},"p-coverage-2",{"text":519},"Pokrivenost bi stoga trebalo ponderisati prema važnosti tvrdnje. Nedostatak potpore za dekorativni detalj nije isto što i nedostatak potpore za cenu, odluku o ispunjavanju uslova, bezbednosno uputstvo, zakonski zahtev, izjavu o tehničkoj kompatibilnosti ili činjenicu koja usmerava preporuku.",{},{"id":522,"data":523,"type":42,"tunes":525},"h-provenance",{"text":524,"level":219},"Poreklo dokaza mora preživeti sažimanje i memoriju",{},{"id":527,"data":528,"type":226,"tunes":530},"p-prov-1",{"text":529},"Agenti sa dugim radom često sažimaju prethodni rad ili zapisuju trajne memorije. Ako se poreklo dokaza ukloni tokom te transformacije, budući agenti mogu preuzeti čist zaključak bez znanja o tome da li potiče iz izjave korisnika, API-ja uživo, starog dokumenta, zaključivanja modela ili neproverenog veb rezultata.",{},{"id":532,"data":533,"type":226,"tunes":535},"p-prov-2",{"text":534},"Za važne činjenice sačuvajte bar identitet izvora, vreme preuzimanja ili opažanja, tip dokaza, relevantnu verziju ili stanje, kao i to da li je sačuvani tekst citiran, sažet, izveden zaključivanjem ili izračunat. Poreklo je ono što omogućava kasnijem agentu da odluči da li dokazu treba verovati, da li ga treba osvežiti, ograničiti ili odbaciti.",{},{"id":537,"data":538,"type":42,"tunes":540},"h-record",{"text":539,"level":219},"Praktičan zapis o dokazu",{},{"id":542,"data":543,"type":287,"tunes":578},"evidence-record",{"content":544,"stretched":43,"withHeadings":14},[545,548,551,554,557,560,563,566,569,572,575],[546,547],"Polje","Svrha",[549,550],"claim_id","Identifikuje materijalnu tvrdnju koja se potkrepljuje",[552,553],"source_id \u002F source_url \u002F system","Identifikuje odakle dokaz potiče",[555,556],"evidence_span","Čuva najmanji odlomak, zapis ili rezultat alata koji potkrepljuje tvrdnju",[558,559],"retrieved_at \u002F observed_at","Omogućava provere svežine i vremenskog toka",[561,562],"source_version \u002F object_version","Omogućava provere zamenjenosti i ponovljivosti",[564,565],"authority_role","Objašnjava zašto je ovaj izvor prikladan za ovu tvrdnju",[567,568],"applicability","Čuva relevantan datum, jurisdikciju, verziju proizvoda, korisnika, zakupca, stanje ili druge uslove",[570,571],"transformation","Označava da li je dokaz sirov, citiran, sažet, normalizovan ili izveden",[573,574],"trace_step","Prikazuje kada je dokaz postao dostupan agentu",[576,577],"support_status","Direktan, delimičan, kontradiktoran, nepodržan ili neizvestan",{},{"id":580,"data":581,"type":42,"tunes":583},"h-failures",{"text":582,"level":219},"Obrasci neuspeha koji deluju utemeljeno, a to nisu",{},{"id":585,"data":586,"type":287,"tunes":624},"failure-table",{"content":587,"stretched":43,"withHeadings":14},[588,592,596,600,604,608,612,616,620],[589,590,591],"Obrazac neuspeha","Zašto zavarava procenjivače","Šta testirati",[593,594,595],"Dekorativno citiranje","Odgovor sadrži izvore, pa deluje istraženo","Mapirati svaku materijalnu tvrdnju na tačan potkrepljujući odlomak",[597,598,599],"Neusklađenost autoriteta","Izvor je ugledan, ali nije merodavan za konkretnu činjenicu","Definisati hijerarhiju izvora specifičnu za tvrdnju",[601,602,603],"Vremenska neusklađenost","Izvor je bio tačan u trenutku objavljivanja","Proveriti vreme preuzimanja, datum izvora i dokaze koji ga zamenjuju",[605,606,607],"Uklanjanje uslova","Sažetak zadržava zaključak, ali izostavlja izuzetke","Uporediti generisanu tvrdnju sa punim lokalnim kontekstom izvora",[609,610,611],"Naknadno citiranje (post-hoc)","Uverljiv izvor se dodaje tek nakon što je odgovor generisan","Ispitati redosled u tragu i da li je dokaz prethodio tvrdnji",[613,614,615],"Parametarsko preinačenje","Model ignoriše preuzeti dokaz i odgovara na osnovu prethodnog znanja","Pokrenuti kontračinjenične testove korišćenja dokaza",[617,618,619],"Pranje dokaza","Zaključak modela se sažima i kasnije čuva kao da je izvorna činjenica","Sačuvati tip transformacije i poreklo prilikom svakog upisivanja u memoriju",[621,622,623],"Zabluda većine izvora","Nekoliko sekundarnih stranica ponavlja istu nepotkrepljenu tvrdnju","Pratiti tvrdnje unazad do nezavisnih ili primarnih dokaza",{},{"id":626,"data":627,"type":42,"tunes":629},"h-production",{"text":628,"level":219},"Kako evaluirati agenta u produkciji",{},{"id":631,"data":632,"type":392,"tunes":659},"production-flow",{"steps":633,"title":658,"orientation":391},[634,637,640,643,646,649,652,655],{"label":635,"description":636},"1. Definišite materijalne tvrdnje","Identifikujte činjenice, preporuke ili odluke čija je tačnost važna za zadatak.",{"label":638,"description":639},"2. Izgradite referentne dokaze","Kreirajte referentne dokaze i očekivanja o kvalitetu izvora za reprezentativne slučajeve.",{"label":641,"description":642},"3. Beležite tragove","Zapisujte upite za preuzimanje, pozive alata, vraćene dokaze, konstrukciju konteksta, izlaz modela i citate.",{"label":644,"description":645},"4. Ocenite nivo potpore","Proverite da li je svaka materijalna tvrdnja direktno, delimično, kontradiktorno ili uopšte nije podržana.",{"label":647,"description":648},"5. Ocenite autoritet i primenjivost","Procenite da li je izvor prikladan i da li njegovi uslovi odgovaraju trenutnom zadatku.",{"label":650,"description":651},"6. Pokrenite kontračinjenične testove","Uklonite, zamenite ili oborite presudan dokaz i testirajte da li odgovor prati tu promenu.",{"label":653,"description":654},"7. Pregledajte neuspehe visokog uticaja","Koristite ljudski pregled ili stručnjake za datu oblast gde automatizovano ocenjivanje nije dovoljno pouzdano.",{"label":656,"description":657},"8. Pretvorite neuspehe u test primere","Dodajte produkcijske neuspehe i granične slučajeve u ponovljivi skup podataka za regresiju.","Tok evaluacije dokaza",{},{"id":661,"data":662,"type":226,"tunes":664},"p-production-1",{"text":663},"OpenAI-jeve aktuelne smernice za evaluaciju preporučuju evaluacije specifične za zadatak, kontinuiranu evaluaciju, skupove podataka izvedene iz produkcije i tragove za otklanjanje grešaka u ponašanju agenta. Anthropic slično tome preporučuje kombinovanje različitih tipova ocenjivača za istraživačke agente, jer su tačnost, kvalitet izvora, pokrivenost i utemeljenost zasebne dimenzije. Evaluacija dokaza treba da prati isti obrazac: nekoliko usko usmerenih ocenjivača pruža bolju dijagnostiku od jedne neprozirne ocene „kvaliteta“.",{},{"id":666,"data":667,"type":42,"tunes":669},"h-judge",{"text":668,"level":219},"Ne dozvolite da LLM sudija postane jedini sudija za dokaze",{},{"id":671,"data":672,"type":226,"tunes":674},"p-judge-1",{"text":673},"LLM ocenjivači su korisni za skalabilnu klasifikaciju tvrdnji, provere relevantnosti i poređenja u parovima, ali mogu deliti iste slepe mrlje kao i sistem koji procenjuju. Ocenjivač može prihvatiti uverljivu, ali nepodržanu tvrdnju, propustiti suptilnu granicu verzije ili preceniti doteran izvor.",{},{"id":676,"data":677,"type":226,"tunes":679},"p-judge-2",{"text":678},"OpenAI-jeve smernice za evaluaciju preporučuju kalibraciju automatizovanih ocenjivača u odnosu na ljudsko rasuđivanje i korišćenje jasnih, precizno definisanih kriterijuma. Za sisteme koji se u velikoj meri oslanjaju na dokaze, determinističke provere treba koristiti gde god je to moguće: vremenske oznake, verzije objekata, opseg dozvola, tačne ID-jeve izvora, redosled preuzimanja, heševe dokumenata i to da li je dokaz postojao pre nego što je model generisao tvrdnju.",{},{"id":681,"data":682,"type":42,"tunes":684},"h-change",{"text":683,"level":219},"Šta bi promenilo ovaj odgovor?",{},{"id":686,"data":687,"type":226,"tunes":689},"p-change-1",{"text":688},"Evaluacija može biti jednostavnija kada agent radi nad malim, nepromenljivim, autoritativnim korpusom i kada je svaki odgovor striktno ekstraktivan. U tom okruženju autoritet izvora i primenjivost su uglavnom fiksni, pa potpora na relaciji tvrdnja-odlomak može biti dovoljna.",{},{"id":691,"data":692,"type":226,"tunes":694},"p-change-2",{"text":693},"Evaluacija mora postati stroža kada agent kombinuje veb pretragu, dugoročnu memoriju, alate uživo, više jurisdikcija, informacije koje se brzo menjaju, stanje specifično za korisnika ili autonomne akcije. U takvim sistemima validnost dokaza zavisi ne samo od teksta izvora, već i od toga kada su i kako dokazi pribavljeni.",{},{"id":696,"data":697,"type":226,"tunes":699},"p-change-3",{"text":698},"Budući modeli mogu postati bolji u internom praćenju porekla i nesigurnosti, ali to ne bi uklonilo potrebu za eksternim zapisima dokaza u sistemima koji zahtevaju proverljivost. Sistem ne bi trebalo da zavisi od modelovog sopstvenog izveštavanja o tome šta je uticalo na njega kada tragovi i metapodaci izvora mogu pružiti jače dokaze.",{},{"id":701,"data":702,"type":42,"tunes":704},"h-limitations",{"text":703,"level":219},"Ograničenja",{},{"id":706,"data":707,"type":226,"tunes":709},"p-limit-1",{"text":708},"Nije uvek moguće dokazati uzročnu upotrebu dokaza samo na osnovu tragova izvršavanja. Izvor može biti prisutan u kontekstu bez uticaja na odgovor, a model može nezavisno znati istu činjenicu. Kontračinjenični testovi pojačavaju zaključivanje, ali mogu i sami promeniti raspodelu zadatka.",{},{"id":711,"data":712,"type":226,"tunes":714},"p-limit-2",{"text":713},"Autoritet izvora takođe može biti osporavan ili zavisan od domena. Neka pitanja nemaju jedan autoritativan izvor, a stručnjaci se mogu razilaziti u mišljenjima o tome koji dokaz zaslužuje veću težinu. U tim slučajevima, procenjivač treba da sačuva neslaganje i oceni transparentnost, pokrivenost i rezonovanje u odnosu na eksplicitnu rubriku, umesto da se pretvara da postoji jedan neprikosnoveni izvor istine.",{},{"id":716,"data":717,"type":42,"tunes":719},"h-conclusion",{"text":718,"level":219},"Zaključak",{},{"id":721,"data":722,"type":226,"tunes":724},"p-conclusion-1",{"text":723},"Pitanje „Da li je agent naveo izvor?“ suviše je slabo za produkcioni AI. Jače pitanje je: Da li je svaka važna tvrdnja proizašla iz dokaza koji je zaista podržavaju, poseduju odgovarajući autoritet, i dalje važe u trenutnim uslovima i bili su dostupni na putanji izvršavanja pre nego što je tvrdnja izrečena?",{},{"id":726,"data":727,"type":226,"tunes":729},"p-conclusion-2",{"text":728},"To pretvara dokaze iz pukog ukrasa u procenjivo svojstvo sistema. Zabeležite trag izvršavanja. Mapirajte tvrdnje na dokaze. Proverite autoritet i primenljivost. Pokrenite kontračinjenične testove dokaza. Sačuvajte poreklo kroz sažetke i memoriju. Tada tačan odgovor nije samo verovatan — on ima dokazni put koji možete pregledati.",{},{"id":731,"data":732,"type":737,"tunes":738},"internal-reliability",{"url":733,"title":734,"excerpt":735,"ctaLabel":736},"https:\u002F\u002Fstajic.de\u002Fsr\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Pouzdanost AI agenata: Zašto konačni odgovor nije dovoljan","Tačnost samog ishoda ne može dokazati da je agentova putanja izvršavanja bila bezbedna ili pouzdana. Ovaj povezani članak objašnjava zašto su putanje, alati i posredne odluke važni.","Pročitajte povezani članak","referralArticle",{},{"id":740,"data":741,"type":737,"tunes":746},"internal-reasoning",{"url":742,"title":743,"excerpt":744,"ctaLabel":745},"https:\u002F\u002Fstajic.de\u002Fsr\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","Od protokola istraživanja do opšteg okvira za AI rezonovanje","Praktičan metod rezonovanja za razdvajanje dokaza, pretpostavki, suprotstavljenih hipoteza i validacije specifične za domen.","Pročitajte okvir za rezonovanje",{},{"id":748,"data":749,"type":42,"tunes":751},"h-faq",{"text":750,"level":219},"Često postavljana pitanja",{},{"id":753,"data":754,"type":753,"tunes":777},"faq",{"items":755,"title":776},[756,760,764,768,772],{"id":757,"answer":758,"question":759},"faq1","Ne. Citat može biti relevantan za temu bez podržavanja tačne tvrdnje, može poticati od pogrešnog autoriteta, više ne mora da važi ili je mogao biti pridodat bez suštinskog uticaja na generisani odgovor.","Da li citiranje dokazuje da je odgovor AI-ja utemeljen?",{"id":761,"answer":762,"question":763},"faq2","Upotrebite kontračinjenični test korišćenja dokaza: pokrenite zadatak sa dokazano tačnim dokazima, a zatim uklonite ili zamenite presudni dokaz dok druge ulaze držite stabilnim. Ako odgovor ne reaguje na promenu dokaza, proverite da li se model oslanja na prethodno znanje ili drugi izvor.","Kako mogu da testiram da li je AI agent zaista koristio preuzete dokaze?",{"id":765,"answer":766,"question":767},"faq3","Utemeljenost postavlja pitanje da li su tvrdnje podržane priloženim dokazima. Kvalitet izvora postavlja pitanje da li je sam dokaz prikladan i dovoljno autoritativan za tip tvrdnje koja se iznosi.","Koja je razlika između utemeljenosti i kvaliteta izvora?",{"id":769,"answer":770,"question":771},"faq4","Izvor može biti zastareo, prevaziđen, važeći za drugu verziju, jurisdikciju, korisnika, populaciju ili stanje sistema, ili može sadržati uslove koji su izgubljeni tokom preuzimanja ili sažimanja.","Zašto stvarni izvor i dalje može proizvesti pogrešan odgovor AI-ja?",{"id":773,"answer":774,"question":775},"faq5","Zabeležite upit za pretragu, vraćene izvore, tačne odlomke dokaza, vremenske oznake i verzije, filtere, konačni kontekst, izlaz modela, citate i redosled tragova, kako bi procenjivači mogli da rekonstruišu koji su dokazi bili dostupni pre svake materijalne tvrdnje.","Šta treba beležiti u dnevnik radi evaluacije dokaza?","Evaluacija upotrebe dokaza kod AI agenata",{},{"id":779,"data":780,"type":42,"tunes":782},"h-glossary",{"text":781,"level":219},"Rečnik pojmova",{},{"id":784,"data":785,"type":784,"tunes":809},"glossary",{"title":786,"entries":787},"Ključni pojmovi evaluacije dokaza",[788,791,795,797,801,805],{"term":272,"anchor":789,"definition":790},"claim-support","Stepen u kojem određeni fragment dokaza direktno potvrđuje generisanu tvrdnju.",{"term":792,"anchor":793,"definition":794},"Autoritet dokaza","evidence-authority","Koliko je izvor prikladan za utvrđivanje određenog tipa tvrdnje, s obzirom na njegovu ulogu, poreklo i odnos prema osnovnoj činjenici.",{"term":280,"anchor":567,"definition":796},"Uslovi pod kojima dokaz ostaje važeći za tvrdnju, uključujući vreme, verziju, jurisdikciju, korisnika, populaciju, stanje sistema ili druge granice.",{"term":798,"anchor":799,"definition":800},"Korišćenje dokaza","evidence-utilization","Da li izlaz agenta zaista reaguje na dokaze koji su mu stavljeni na raspolaganje na putanji izvršavanja i zavisi od njih.",{"term":802,"anchor":803,"definition":804},"Kontračinjenični test dokaza","counterfactual-evidence-test","Evaluacija koja uklanja, zamenjuje ili menja presudne dokaze kako bi se proverilo da li se tvrdnja agenta adekvatno menja.",{"term":806,"anchor":807,"definition":808},"Poreklo podataka","provenance","Metapodaci koji beleže odakle dokaz potiče, kada je dobijen, kako je transformisan i koju verziju ili stanje je predstavljao.",{},{"id":811,"data":812,"type":42,"tunes":814},"h-sources",{"text":813,"level":219},"Primarni izvori i dodatna literatura",{},{"id":816,"data":817,"type":823,"tunes":824},"src-openai-agent-evals",{"link":818,"meta":819},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals",{"image":820,"title":821,"description":822},{"url":465},"OpenAI — Evaluacija radnih tokova agenata","Smernice za ocenjivanje tragova izvršavanja, evaluaciju na nivou radnog toka, skupove podataka i ponovljiva pokretanja evaluacije za agente.","linkTool",{},{"id":826,"data":827,"type":823,"tunes":833},"src-openai-eval-best",{"link":828,"meta":829},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices",{"image":830,"title":831,"description":832},{"url":465},"OpenAI — Najbolje prakse za evaluaciju","Smernice za evaluacije specifične za zadatke, skupove podataka izvedene iz produkcije, metrike uskog opsega, kontinuiranu evaluaciju i kalibraciju ocenjivača.",{},{"id":835,"data":836,"type":823,"tunes":842},"src-anthropic-evals",{"link":837,"meta":838},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"image":839,"title":840,"description":841},{"url":465},"Anthropic — Demistifikacija evaluacija za AI agente","Smernice za evaluaciju agenata uključujući utemeljenost, pokrivenost i provere kvaliteta izvora za istraživačke agente.",{},{"id":844,"data":845,"type":823,"tunes":851},"src-openai-thirdparty",{"link":846,"meta":847},"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F",{"image":848,"title":849,"description":850},{"url":465},"OpenAI — Zajednički priručnik za pouzdane evaluacije trećih strana","Smernice za evaluaciju koje naglašavaju da performanse savremenih agenata zavise od radnog toka i okruženja, a ne samo od konačnog izlaza modela.",{},"2.31","AI agent može citirati izvore i ipak koristiti pogrešne dokaze. Ovaj članak predstavlja praktičnu metodu za proveru potkrepljenosti tvrdnji, autoriteta izvora, primenjivosti, porekla i toga da li su dokazi zaista uticali na odgovor.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve","PUBLISHED","2026-09-25T11:47:00.000Z","2026-09-25T15:47:02.186Z","2026-09-25T20:33:01.720Z",{"en":861,"de":862,"sr":863,"es":864,"fr":865,"it":866,"ru":867,"zh":868},"\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fde\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fsr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fes\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Ffr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fit\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fru\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fzh\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence",[870,874,878],{"id":871,"name":872,"slug":873},84,"Politike i granice podataka","policy-and-data",{"id":875,"name":876,"slug":877},97,"Verifikacija na test setu","verification",{"id":879,"name":880,"slug":881},66,"Operacije sadržaja","content-ops",{"id":883,"login":884,"email":885,"displayName":886},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[888,1415],{"lang":889,"title":890,"content":891,"contentJson":892,"excerpt":1414},"en","How to Know Whether an AI Agent Actually Used the Right Evidence","{\"time\":1790351390243,\"blocks\":[{\"id\":\"0hk9UtwqZf\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.\"},\"tunes\":{}},{\"id\":\"method-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"About the method\",\"body\":\"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.\"},\"tunes\":{}},{\"id\":\"h-citations\",\"type\":\"header\",\"data\":{\"text\":\"Why citations are not enough\",\"level\":2},\"tunes\":{}},{\"id\":\"p-citations-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.\"},\"tunes\":{}},{\"id\":\"p-citations-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.\"},\"tunes\":{}},{\"id\":\"h-four\",\"type\":\"header\",\"data\":{\"text\":\"The four questions every material claim should pass\",\"level\":2},\"tunes\":{}},{\"id\":\"table-four\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Dimension\",\"Question\",\"Typical failure\"],[\"Claim support\",\"Does the evidence directly support this exact claim?\",\"The source is topically related but does not establish the statement\"],[\"Evidence authority\",\"Is this an appropriate source for this kind of claim?\",\"A secondary summary is used where a primary source or live system is required\"],[\"Applicability\",\"Does the evidence apply to this time, version, jurisdiction, user, state, or population?\",\"A true statement is applied outside its valid conditions\"],[\"Evidence use\",\"Was this evidence actually available and used in the agent's execution path?\",\"The final answer is correct, but the retrieved evidence was irrelevant or unused\"]]},\"tunes\":{}},{\"id\":\"h-support\",\"type\":\"header\",\"data\":{\"text\":\"1. Claim support: does the source establish what the agent says?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-support-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.\"},\"tunes\":{}},{\"id\":\"p-support-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.\"},\"tunes\":{}},{\"id\":\"h-authority\",\"type\":\"header\",\"data\":{\"text\":\"2. Evidence authority: is this the right kind of source?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-authority-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.\"},\"tunes\":{}},{\"id\":\"p-authority-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.\"},\"tunes\":{}},{\"id\":\"h-applicability\",\"type\":\"header\",\"data\":{\"text\":\"3. Applicability: right evidence, wrong conditions\",\"level\":3},\"tunes\":{}},{\"id\":\"p-apply-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.\"},\"tunes\":{}},{\"id\":\"p-apply-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.\"},\"tunes\":{}},{\"id\":\"apply-warning\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Evidence can be authentic and still be wrong for the answer\",\"body\":\"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.\"},\"tunes\":{}},{\"id\":\"h-use\",\"type\":\"header\",\"data\":{\"text\":\"4. Evidence use: did the agent actually rely on the evidence?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-use-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.\"},\"tunes\":{}},{\"id\":\"p-use-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.\"},\"tunes\":{}},{\"id\":\"h-eut\",\"type\":\"header\",\"data\":{\"text\":\"The Evidence Utilization Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-eut-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.\"},\"tunes\":{}},{\"id\":\"eut-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence Utilization Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Select one material claim\",\"description\":\"Choose a claim whose correctness matters and define the expected answer precisely.\"},{\"label\":\"2. Identify gold evidence\",\"description\":\"Provide the smallest authoritative evidence set sufficient to support the claim.\"},{\"label\":\"3. Run with gold evidence\",\"description\":\"Verify that the agent produces the supported answer when the correct evidence is available.\"},{\"label\":\"4. Remove the decisive evidence\",\"description\":\"Run the same task without the key supporting passage while keeping other inputs stable.\"},{\"label\":\"5. Replace it with contradictory or superseding evidence\",\"description\":\"Where safe, provide controlled evidence that changes the correct conclusion.\"},{\"label\":\"6. Compare the claims\",\"description\":\"Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.\"},{\"label\":\"7. Inspect the trace\",\"description\":\"Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.\"}]},\"tunes\":{}},{\"id\":\"eut-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"The key signal\",\"body\":\"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A claim–evidence matrix is more useful than a source list\",\"level\":2},\"tunes\":{}},{\"id\":\"claim-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Claim\",\"Evidence\",\"Support\",\"Authority\",\"Applicability\",\"Used in trace\"],[\"Feature X is available\",\"Vendor documentation\",\"Direct\",\"High for availability claim\",\"Current version and region must match\",\"Yes \u002F No\"],[\"Configuration Y is faster\",\"Vendor benchmark\",\"Partial\",\"High for vendor's test, not independent performance\",\"Hardware and workload must match\",\"Yes \u002F No\"],[\"Policy applies to this user\",\"Current policy + account state\",\"Direct only when combined\",\"High\",\"Jurisdiction, date, role and account state must match\",\"Yes \u002F No\"],[\"A product is in stock\",\"Live inventory API\",\"Direct\",\"Authoritative for current stock\",\"Expires quickly\",\"Yes \u002F No\"]]},\"tunes\":{}},{\"id\":\"p-matrix-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.\"},\"tunes\":{}},{\"id\":\"h-retrieval-evidence\",\"type\":\"header\",\"data\":{\"text\":\"Separate retrieval quality from evidence quality\",\"level\":2},\"tunes\":{}},{\"id\":\"p-re-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.\"},\"tunes\":{}},{\"id\":\"retrieval-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Retrieval success is not evidence success\",\"layout\":\"table\",\"columns\":[{\"id\":\"situation\",\"label\":\"Situation\"},{\"id\":\"retrieval\",\"label\":\"Retrieval\"},{\"id\":\"evidence\",\"label\":\"Evidence quality\"}],\"rows\":[{\"id\":\"a\",\"label\":\"Right document, wrong claim\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"b\",\"label\":\"Right fact, stale source\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"c\",\"label\":\"Weak source, correct answer\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"d\",\"label\":\"Multiple sources required\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-source-quality\",\"type\":\"header\",\"data\":{\"text\":\"Evaluate source quality as a rubric, not a domain whitelist\",\"level\":2},\"tunes\":{}},{\"id\":\"p-source-quality-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.\"},\"tunes\":{}},{\"id\":\"p-source-quality-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.\"},\"tunes\":{}},{\"id\":\"h-coverage\",\"type\":\"header\",\"data\":{\"text\":\"Evidence coverage: every important claim needs support, not every sentence\",\"level\":2},\"tunes\":{}},{\"id\":\"p-coverage-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.\"},\"tunes\":{}},{\"id\":\"p-coverage-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.\"},\"tunes\":{}},{\"id\":\"h-provenance\",\"type\":\"header\",\"data\":{\"text\":\"Evidence provenance must survive summarization and memory\",\"level\":2},\"tunes\":{}},{\"id\":\"p-prov-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.\"},\"tunes\":{}},{\"id\":\"p-prov-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.\"},\"tunes\":{}},{\"id\":\"h-record\",\"type\":\"header\",\"data\":{\"text\":\"A practical evidence record\",\"level\":2},\"tunes\":{}},{\"id\":\"evidence-record\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Field\",\"Purpose\"],[\"claim_id\",\"Identifies the material claim being supported\"],[\"source_id \u002F source_url \u002F system\",\"Identifies where the evidence came from\"],[\"evidence_span\",\"Preserves the smallest passage, record, or tool result that supports the claim\"],[\"retrieved_at \u002F observed_at\",\"Allows freshness and timeline checks\"],[\"source_version \u002F object_version\",\"Allows supersession and reproducibility checks\"],[\"authority_role\",\"Explains why this source is suitable for this claim\"],[\"applicability\",\"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions\"],[\"transformation\",\"Marks whether evidence is raw, quoted, summarized, normalized, or derived\"],[\"trace_step\",\"Shows when the evidence became available to the agent\"],[\"support_status\",\"Direct, partial, contradictory, unsupported, or uncertain\"]]},\"tunes\":{}},{\"id\":\"h-failures\",\"type\":\"header\",\"data\":{\"text\":\"Failure modes that look grounded but are not\",\"level\":2},\"tunes\":{}},{\"id\":\"failure-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Failure mode\",\"Why it fools evaluators\",\"What to test\"],[\"Citation decoration\",\"The answer contains sources, so it looks researched\",\"Map each material claim to an exact supporting span\"],[\"Authority mismatch\",\"The source is reputable but not authoritative for the specific fact\",\"Define claim-specific source hierarchy\"],[\"Temporal mismatch\",\"The source was correct when published\",\"Check retrieval time, source date, and superseding evidence\"],[\"Condition stripping\",\"A summary keeps the conclusion but drops exceptions\",\"Compare generated claim with full local source context\"],[\"Post-hoc citation\",\"A plausible source is attached after the answer is generated\",\"Inspect trace ordering and whether evidence preceded the claim\"],[\"Parametric override\",\"The model ignores retrieved evidence and answers from prior knowledge\",\"Run counterfactual evidence-utilization tests\"],[\"Evidence laundering\",\"Model inference is summarized and later stored as if it were a source fact\",\"Preserve transformation type and provenance across memory writes\"],[\"Source majority fallacy\",\"Several secondary pages repeat the same unsupported statement\",\"Trace claims back to independent or primary evidence\"]]},\"tunes\":{}},{\"id\":\"h-production\",\"type\":\"header\",\"data\":{\"text\":\"How to evaluate the agent in production\",\"level\":2},\"tunes\":{}},{\"id\":\"production-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence evaluation pipeline\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Define material claims\",\"description\":\"Identify the facts, recommendations, or decisions whose correctness matters to the task.\"},{\"label\":\"2. Build gold evidence\",\"description\":\"Create reference evidence and source-quality expectations for representative cases.\"},{\"label\":\"3. Capture traces\",\"description\":\"Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.\"},{\"label\":\"4. Grade support\",\"description\":\"Check whether each material claim is directly, partially, contradictorily, or not supported.\"},{\"label\":\"5. Grade authority and applicability\",\"description\":\"Evaluate whether the source is appropriate and whether its conditions match the current task.\"},{\"label\":\"6. Run counterfactuals\",\"description\":\"Remove, replace, or supersede decisive evidence and test whether the answer follows the change.\"},{\"label\":\"7. Review high-impact failures\",\"description\":\"Use human or domain-expert review where automated grading is not reliable enough.\"},{\"label\":\"8. Convert failures into eval cases\",\"description\":\"Add production failures and edge cases to a repeatable regression dataset.\"}]},\"tunes\":{}},{\"id\":\"p-production-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.\"},\"tunes\":{}},{\"id\":\"h-judge\",\"type\":\"header\",\"data\":{\"text\":\"Do not let an LLM judge become the only evidence judge\",\"level\":2},\"tunes\":{}},{\"id\":\"p-judge-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.\"},\"tunes\":{}},{\"id\":\"p-judge-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.\"},\"tunes\":{}},{\"id\":\"p-change-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.\"},\"tunes\":{}},{\"id\":\"internal-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.\",\"ctaLabel\":\"Read the related article\"},\"tunes\":{}},{\"id\":\"internal-reasoning\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\",\"title\":\"From Research Protocol to a General AI Reasoning Framework\",\"excerpt\":\"A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.\",\"ctaLabel\":\"Read the reasoning framework\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Evaluating evidence use in AI agents\",\"items\":[{\"id\":\"faq1\",\"question\":\"Does a citation prove that an AI answer is grounded?\",\"answer\":\"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.\"},{\"id\":\"faq2\",\"question\":\"How can I test whether an AI agent actually used retrieved evidence?\",\"answer\":\"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.\"},{\"id\":\"faq3\",\"question\":\"What is the difference between groundedness and source quality?\",\"answer\":\"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.\"},{\"id\":\"faq4\",\"question\":\"Why can a real source still produce a wrong AI answer?\",\"answer\":\"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.\"},{\"id\":\"faq5\",\"question\":\"What should I log for evidence evaluation?\",\"answer\":\"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key evidence-evaluation terms\",\"entries\":[{\"term\":\"Claim support\",\"definition\":\"The degree to which a specific evidence span directly establishes a generated claim.\",\"anchor\":\"claim-support\"},{\"term\":\"Evidence authority\",\"definition\":\"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.\",\"anchor\":\"evidence-authority\"},{\"term\":\"Applicability\",\"definition\":\"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.\",\"anchor\":\"applicability\"},{\"term\":\"Evidence utilization\",\"definition\":\"Whether the agent's output actually responds to and depends on the evidence made available in its execution path.\",\"anchor\":\"evidence-utilization\"},{\"term\":\"Counterfactual evidence test\",\"definition\":\"An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.\",\"anchor\":\"counterfactual-evidence-test\"},{\"term\":\"Provenance\",\"definition\":\"Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.\",\"anchor\":\"provenance\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-agent-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluate Agent Workflows\",\"description\":\"Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-eval-best\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluation Best Practices\",\"description\":\"Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.\"}},\"tunes\":{}},{\"id\":\"src-anthropic-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Demystifying Evals for AI Agents\",\"description\":\"Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-thirdparty\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations\",\"description\":\"Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":893,"blocks":894,"version":1413},1790351390243,[895,899,903,908,913,917,921,925,929,953,957,961,965,969,973,977,981,985,989,994,998,1002,1006,1010,1014,1040,1045,1049,1083,1087,1091,1095,1119,1123,1127,1131,1135,1139,1143,1147,1151,1155,1159,1186,1190,1230,1234,1263,1267,1271,1275,1279,1283,1287,1291,1295,1299,1303,1307,1311,1315,1319,1326,1333,1337,1357,1361,1381,1385,1392,1399,1406],{"id":215,"data":896,"type":220,"tunes":898},{"title":897,"maxLevel":218,"minLevel":219},"Contents",{},{"id":223,"data":900,"type":226,"tunes":902},{"text":901},"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?",{},{"id":229,"data":904,"type":234,"tunes":907},{"body":905,"title":906,"variant":233},"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.","Direct answer",{},{"id":237,"data":909,"type":234,"tunes":912},{"body":910,"title":911,"variant":241},"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.","About the method",{},{"id":244,"data":914,"type":42,"tunes":916},{"text":915,"level":219},"Why citations are not enough",{},{"id":249,"data":918,"type":226,"tunes":920},{"text":919},"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.",{},{"id":254,"data":922,"type":226,"tunes":924},{"text":923},"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.",{},{"id":259,"data":926,"type":42,"tunes":928},{"text":927,"level":219},"The four questions every material claim should pass",{},{"id":264,"data":930,"type":287,"tunes":952},{"content":931,"stretched":43,"withHeadings":14},[932,936,940,944,948],[933,934,935],"Dimension","Question","Typical failure",[937,938,939],"Claim support","Does the evidence directly support this exact claim?","The source is topically related but does not establish the statement",[941,942,943],"Evidence authority","Is this an appropriate source for this kind of claim?","A secondary summary is used where a primary source or live system is required",[945,946,947],"Applicability","Does the evidence apply to this time, version, jurisdiction, user, state, or population?","A true statement is applied outside its valid conditions",[949,950,951],"Evidence use","Was this evidence actually available and used in the agent's execution path?","The final answer is correct, but the retrieved evidence was irrelevant or unused",{},{"id":290,"data":954,"type":42,"tunes":956},{"text":955,"level":218},"1. Claim support: does the source establish what the agent says?",{},{"id":295,"data":958,"type":226,"tunes":960},{"text":959},"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.",{},{"id":300,"data":962,"type":226,"tunes":964},{"text":963},"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.",{},{"id":305,"data":966,"type":42,"tunes":968},{"text":967,"level":218},"2. Evidence authority: is this the right kind of source?",{},{"id":310,"data":970,"type":226,"tunes":972},{"text":971},"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.",{},{"id":315,"data":974,"type":226,"tunes":976},{"text":975},"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.",{},{"id":320,"data":978,"type":42,"tunes":980},{"text":979,"level":218},"3. Applicability: right evidence, wrong conditions",{},{"id":325,"data":982,"type":226,"tunes":984},{"text":983},"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.",{},{"id":330,"data":986,"type":226,"tunes":988},{"text":987},"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.",{},{"id":335,"data":990,"type":234,"tunes":993},{"body":991,"title":992,"variant":339},"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.","Evidence can be authentic and still be wrong for the answer",{},{"id":342,"data":995,"type":42,"tunes":997},{"text":996,"level":218},"4. Evidence use: did the agent actually rely on the evidence?",{},{"id":347,"data":999,"type":226,"tunes":1001},{"text":1000},"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.",{},{"id":352,"data":1003,"type":226,"tunes":1005},{"text":1004},"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.",{},{"id":357,"data":1007,"type":42,"tunes":1009},{"text":1008,"level":219},"The Evidence Utilization Test",{},{"id":362,"data":1011,"type":226,"tunes":1013},{"text":1012},"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.",{},{"id":367,"data":1015,"type":392,"tunes":1039},{"steps":1016,"title":1038,"orientation":391},[1017,1020,1023,1026,1029,1032,1035],{"label":1018,"description":1019},"1. Select one material claim","Choose a claim whose correctness matters and define the expected answer precisely.",{"label":1021,"description":1022},"2. Identify gold evidence","Provide the smallest authoritative evidence set sufficient to support the claim.",{"label":1024,"description":1025},"3. Run with gold evidence","Verify that the agent produces the supported answer when the correct evidence is available.",{"label":1027,"description":1028},"4. Remove the decisive evidence","Run the same task without the key supporting passage while keeping other inputs stable.",{"label":1030,"description":1031},"5. Replace it with contradictory or superseding evidence","Where safe, provide controlled evidence that changes the correct conclusion.",{"label":1033,"description":1034},"6. Compare the claims","Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.",{"label":1036,"description":1037},"7. Inspect the trace","Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.","Evidence Utilization Test",{},{"id":395,"data":1041,"type":234,"tunes":1044},{"body":1042,"title":1043,"variant":399},"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.","The key signal",{},{"id":402,"data":1046,"type":42,"tunes":1048},{"text":1047,"level":219},"A claim–evidence matrix is more useful than a source list",{},{"id":407,"data":1050,"type":287,"tunes":1082},{"content":1051,"stretched":43,"withHeadings":14},[1052,1058,1065,1071,1077],[1053,1054,1055,1056,945,1057],"Claim","Evidence","Support","Authority","Used in trace",[1059,1060,1061,1062,1063,1064],"Feature X is available","Vendor documentation","Direct","High for availability claim","Current version and region must match","Yes \u002F No",[1066,1067,1068,1069,1070,1064],"Configuration Y is faster","Vendor benchmark","Partial","High for vendor's test, not independent performance","Hardware and workload must match",[1072,1073,1074,1075,1076,1064],"Policy applies to this user","Current policy + account state","Direct only when combined","High","Jurisdiction, date, role and account state must match",[1078,1079,1061,1080,1081,1064],"A product is in stock","Live inventory API","Authoritative for current stock","Expires quickly",{},{"id":443,"data":1084,"type":226,"tunes":1086},{"text":1085},"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.",{},{"id":448,"data":1088,"type":42,"tunes":1090},{"text":1089,"level":219},"Separate retrieval quality from evidence quality",{},{"id":453,"data":1092,"type":226,"tunes":1094},{"text":1093},"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.",{},{"id":458,"data":1096,"type":489,"tunes":1118},{"rows":1097,"title":1110,"layout":287,"columns":1111},[1098,1101,1104,1107],{"id":462,"label":1099,"values":1100},"Right document, wrong claim",[465,465,465],{"id":467,"label":1102,"values":1103},"Right fact, stale source",[465,465,465],{"id":471,"label":1105,"values":1106},"Weak source, correct answer",[465,465,465],{"id":475,"label":1108,"values":1109},"Multiple sources required",[465,465,465],"Retrieval success is not evidence success",[1112,1114,1116],{"id":481,"label":1113},"Situation",{"id":484,"label":1115},"Retrieval",{"id":487,"label":1117},"Evidence quality",{},{"id":492,"data":1120,"type":42,"tunes":1122},{"text":1121,"level":219},"Evaluate source quality as a rubric, not a domain whitelist",{},{"id":497,"data":1124,"type":226,"tunes":1126},{"text":1125},"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.",{},{"id":502,"data":1128,"type":226,"tunes":1130},{"text":1129},"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.",{},{"id":507,"data":1132,"type":42,"tunes":1134},{"text":1133,"level":219},"Evidence coverage: every important claim needs support, not every sentence",{},{"id":512,"data":1136,"type":226,"tunes":1138},{"text":1137},"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.",{},{"id":517,"data":1140,"type":226,"tunes":1142},{"text":1141},"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.",{},{"id":522,"data":1144,"type":42,"tunes":1146},{"text":1145,"level":219},"Evidence provenance must survive summarization and memory",{},{"id":527,"data":1148,"type":226,"tunes":1150},{"text":1149},"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.",{},{"id":532,"data":1152,"type":226,"tunes":1154},{"text":1153},"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.",{},{"id":537,"data":1156,"type":42,"tunes":1158},{"text":1157,"level":219},"A practical evidence record",{},{"id":542,"data":1160,"type":287,"tunes":1185},{"content":1161,"stretched":43,"withHeadings":14},[1162,1165,1167,1169,1171,1173,1175,1177,1179,1181,1183],[1163,1164],"Field","Purpose",[549,1166],"Identifies the material claim being supported",[552,1168],"Identifies where the evidence came from",[555,1170],"Preserves the smallest passage, record, or tool result that supports the claim",[558,1172],"Allows freshness and timeline checks",[561,1174],"Allows supersession and reproducibility checks",[564,1176],"Explains why this source is suitable for this claim",[567,1178],"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions",[570,1180],"Marks whether evidence is raw, quoted, summarized, normalized, or derived",[573,1182],"Shows when the evidence became available to the agent",[576,1184],"Direct, partial, contradictory, unsupported, or uncertain",{},{"id":580,"data":1187,"type":42,"tunes":1189},{"text":1188,"level":219},"Failure modes that look grounded but are not",{},{"id":585,"data":1191,"type":287,"tunes":1229},{"content":1192,"stretched":43,"withHeadings":14},[1193,1197,1201,1205,1209,1213,1217,1221,1225],[1194,1195,1196],"Failure mode","Why it fools evaluators","What to test",[1198,1199,1200],"Citation decoration","The answer contains sources, so it looks researched","Map each material claim to an exact supporting span",[1202,1203,1204],"Authority mismatch","The source is reputable but not authoritative for the specific fact","Define claim-specific source hierarchy",[1206,1207,1208],"Temporal mismatch","The source was correct when published","Check retrieval time, source date, and superseding evidence",[1210,1211,1212],"Condition stripping","A summary keeps the conclusion but drops exceptions","Compare generated claim with full local source context",[1214,1215,1216],"Post-hoc citation","A plausible source is attached after the answer is generated","Inspect trace ordering and whether evidence preceded the claim",[1218,1219,1220],"Parametric override","The model ignores retrieved evidence and answers from prior knowledge","Run counterfactual evidence-utilization tests",[1222,1223,1224],"Evidence laundering","Model inference is summarized and later stored as if it were a source fact","Preserve transformation type and provenance across memory writes",[1226,1227,1228],"Source majority fallacy","Several secondary pages repeat the same unsupported statement","Trace claims back to independent or primary evidence",{},{"id":626,"data":1231,"type":42,"tunes":1233},{"text":1232,"level":219},"How to evaluate the agent in production",{},{"id":631,"data":1235,"type":392,"tunes":1262},{"steps":1236,"title":1261,"orientation":391},[1237,1240,1243,1246,1249,1252,1255,1258],{"label":1238,"description":1239},"1. Define material claims","Identify the facts, recommendations, or decisions whose correctness matters to the task.",{"label":1241,"description":1242},"2. Build gold evidence","Create reference evidence and source-quality expectations for representative cases.",{"label":1244,"description":1245},"3. Capture traces","Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.",{"label":1247,"description":1248},"4. Grade support","Check whether each material claim is directly, partially, contradictorily, or not supported.",{"label":1250,"description":1251},"5. Grade authority and applicability","Evaluate whether the source is appropriate and whether its conditions match the current task.",{"label":1253,"description":1254},"6. Run counterfactuals","Remove, replace, or supersede decisive evidence and test whether the answer follows the change.",{"label":1256,"description":1257},"7. Review high-impact failures","Use human or domain-expert review where automated grading is not reliable enough.",{"label":1259,"description":1260},"8. Convert failures into eval cases","Add production failures and edge cases to a repeatable regression dataset.","Evidence evaluation pipeline",{},{"id":661,"data":1264,"type":226,"tunes":1266},{"text":1265},"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.",{},{"id":666,"data":1268,"type":42,"tunes":1270},{"text":1269,"level":219},"Do not let an LLM judge become the only evidence judge",{},{"id":671,"data":1272,"type":226,"tunes":1274},{"text":1273},"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.",{},{"id":676,"data":1276,"type":226,"tunes":1278},{"text":1277},"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.",{},{"id":681,"data":1280,"type":42,"tunes":1282},{"text":1281,"level":219},"What would change this answer?",{},{"id":686,"data":1284,"type":226,"tunes":1286},{"text":1285},"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.",{},{"id":691,"data":1288,"type":226,"tunes":1290},{"text":1289},"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.",{},{"id":696,"data":1292,"type":226,"tunes":1294},{"text":1293},"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.",{},{"id":701,"data":1296,"type":42,"tunes":1298},{"text":1297,"level":219},"Limitations",{},{"id":706,"data":1300,"type":226,"tunes":1302},{"text":1301},"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.",{},{"id":711,"data":1304,"type":226,"tunes":1306},{"text":1305},"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.",{},{"id":716,"data":1308,"type":42,"tunes":1310},{"text":1309,"level":219},"Conclusion",{},{"id":721,"data":1312,"type":226,"tunes":1314},{"text":1313},"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?",{},{"id":726,"data":1316,"type":226,"tunes":1318},{"text":1317},"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.",{},{"id":731,"data":1320,"type":737,"tunes":1325},{"url":1321,"title":1322,"excerpt":1323,"ctaLabel":1324},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.","Read the related article",{},{"id":740,"data":1327,"type":737,"tunes":1332},{"url":1328,"title":1329,"excerpt":1330,"ctaLabel":1331},"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","From Research Protocol to a General AI Reasoning Framework","A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.","Read the reasoning framework",{},{"id":748,"data":1334,"type":42,"tunes":1336},{"text":1335,"level":219},"FAQ",{},{"id":753,"data":1338,"type":753,"tunes":1356},{"items":1339,"title":1355},[1340,1343,1346,1349,1352],{"id":757,"answer":1341,"question":1342},"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.","Does a citation prove that an AI answer is grounded?",{"id":761,"answer":1344,"question":1345},"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.","How can I test whether an AI agent actually used retrieved evidence?",{"id":765,"answer":1347,"question":1348},"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.","What is the difference between groundedness and source quality?",{"id":769,"answer":1350,"question":1351},"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.","Why can a real source still produce a wrong AI answer?",{"id":773,"answer":1353,"question":1354},"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.","What should I log for evidence evaluation?","Evaluating evidence use in AI agents",{},{"id":779,"data":1358,"type":42,"tunes":1360},{"text":1359,"level":219},"Glossary",{},{"id":784,"data":1362,"type":784,"tunes":1380},{"title":1363,"entries":1364},"Key evidence-evaluation terms",[1365,1367,1369,1371,1374,1377],{"term":937,"anchor":789,"definition":1366},"The degree to which a specific evidence span directly establishes a generated claim.",{"term":941,"anchor":793,"definition":1368},"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.",{"term":945,"anchor":567,"definition":1370},"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.",{"term":1372,"anchor":799,"definition":1373},"Evidence utilization","Whether the agent's output actually responds to and depends on the evidence made available in its execution path.",{"term":1375,"anchor":803,"definition":1376},"Counterfactual evidence test","An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.",{"term":1378,"anchor":807,"definition":1379},"Provenance","Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.",{},{"id":811,"data":1382,"type":42,"tunes":1384},{"text":1383,"level":219},"Primary sources and further reading",{},{"id":816,"data":1386,"type":823,"tunes":1391},{"link":818,"meta":1387},{"image":1388,"title":1389,"description":1390},{"url":465},"OpenAI — Evaluate Agent Workflows","Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.",{},{"id":826,"data":1393,"type":823,"tunes":1398},{"link":828,"meta":1394},{"image":1395,"title":1396,"description":1397},{"url":465},"OpenAI — Evaluation Best Practices","Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.",{},{"id":835,"data":1400,"type":823,"tunes":1405},{"link":837,"meta":1401},{"image":1402,"title":1403,"description":1404},{"url":465},"Anthropic — Demystifying Evals for AI Agents","Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.",{},{"id":844,"data":1407,"type":823,"tunes":1412},{"link":846,"meta":1408},{"image":1409,"title":1410,"description":1411},{"url":465},"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations","Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.",{},"2.31.6","An AI agent can cite sources and still use the wrong evidence. This article introduces a practical method for checking claim support, source authority, applicability, provenance, and whether the evidence actually influenced the answer.",{"lang":7,"title":208,"content":210,"contentJson":1416,"excerpt":853},{"time":212,"blocks":1417,"version":852},[1418,1421,1424,1427,1430,1433,1436,1439,1442,1451,1454,1457,1460,1463,1466,1469,1472,1475,1478,1481,1484,1487,1490,1493,1496,1507,1510,1513,1522,1525,1528,1531,1547,1550,1553,1556,1559,1562,1565,1568,1571,1574,1577,1592,1595,1608,1611,1623,1626,1629,1632,1635,1638,1641,1644,1647,1650,1653,1656,1659,1662,1665,1668,1671,1674,1683,1686,1696,1699,1704,1709,1714],{"id":215,"data":1419,"type":220,"tunes":1420},{"title":217,"maxLevel":218,"minLevel":219},{},{"id":223,"data":1422,"type":226,"tunes":1423},{"text":225},{},{"id":229,"data":1425,"type":234,"tunes":1426},{"body":231,"title":232,"variant":233},{},{"id":237,"data":1428,"type":234,"tunes":1429},{"body":239,"title":240,"variant":241},{},{"id":244,"data":1431,"type":42,"tunes":1432},{"text":246,"level":219},{},{"id":249,"data":1434,"type":226,"tunes":1435},{"text":251},{},{"id":254,"data":1437,"type":226,"tunes":1438},{"text":256},{},{"id":259,"data":1440,"type":42,"tunes":1441},{"text":261,"level":219},{},{"id":264,"data":1443,"type":287,"tunes":1450},{"content":1444,"stretched":43,"withHeadings":14},[1445,1446,1447,1448,1449],[268,269,270],[272,273,274],[276,277,278],[280,281,282],[284,285,286],{},{"id":290,"data":1452,"type":42,"tunes":1453},{"text":292,"level":218},{},{"id":295,"data":1455,"type":226,"tunes":1456},{"text":297},{},{"id":300,"data":1458,"type":226,"tunes":1459},{"text":302},{},{"id":305,"data":1461,"type":42,"tunes":1462},{"text":307,"level":218},{},{"id":310,"data":1464,"type":226,"tunes":1465},{"text":312},{},{"id":315,"data":1467,"type":226,"tunes":1468},{"text":317},{},{"id":320,"data":1470,"type":42,"tunes":1471},{"text":322,"level":218},{},{"id":325,"data":1473,"type":226,"tunes":1474},{"text":327},{},{"id":330,"data":1476,"type":226,"tunes":1477},{"text":332},{},{"id":335,"data":1479,"type":234,"tunes":1480},{"body":337,"title":338,"variant":339},{},{"id":342,"data":1482,"type":42,"tunes":1483},{"text":344,"level":218},{},{"id":347,"data":1485,"type":226,"tunes":1486},{"text":349},{},{"id":352,"data":1488,"type":226,"tunes":1489},{"text":354},{},{"id":357,"data":1491,"type":42,"tunes":1492},{"text":359,"level":219},{},{"id":362,"data":1494,"type":226,"tunes":1495},{"text":364},{},{"id":367,"data":1497,"type":392,"tunes":1506},{"steps":1498,"title":359,"orientation":391},[1499,1500,1501,1502,1503,1504,1505],{"label":371,"description":372},{"label":374,"description":375},{"label":377,"description":378},{"label":380,"description":381},{"label":383,"description":384},{"label":386,"description":387},{"label":389,"description":390},{},{"id":395,"data":1508,"type":234,"tunes":1509},{"body":397,"title":398,"variant":399},{},{"id":402,"data":1511,"type":42,"tunes":1512},{"text":404,"level":219},{},{"id":407,"data":1514,"type":287,"tunes":1521},{"content":1515,"stretched":43,"withHeadings":14},[1516,1517,1518,1519,1520],[411,412,413,414,415,416],[418,419,420,421,422,423],[425,426,427,428,429,423],[431,432,433,434,435,423],[437,438,420,439,440,423],{},{"id":443,"data":1523,"type":226,"tunes":1524},{"text":445},{},{"id":448,"data":1526,"type":42,"tunes":1527},{"text":450,"level":219},{},{"id":453,"data":1529,"type":226,"tunes":1530},{"text":455},{},{"id":458,"data":1532,"type":489,"tunes":1546},{"rows":1533,"title":478,"layout":287,"columns":1542},[1534,1536,1538,1540],{"id":462,"label":463,"values":1535},[465,465,465],{"id":467,"label":468,"values":1537},[465,465,465],{"id":471,"label":472,"values":1539},[465,465,465],{"id":475,"label":476,"values":1541},[465,465,465],[1543,1544,1545],{"id":481,"label":482},{"id":484,"label":485},{"id":487,"label":488},{},{"id":492,"data":1548,"type":42,"tunes":1549},{"text":494,"level":219},{},{"id":497,"data":1551,"type":226,"tunes":1552},{"text":499},{},{"id":502,"data":1554,"type":226,"tunes":1555},{"text":504},{},{"id":507,"data":1557,"type":42,"tunes":1558},{"text":509,"level":219},{},{"id":512,"data":1560,"type":226,"tunes":1561},{"text":514},{},{"id":517,"data":1563,"type":226,"tunes":1564},{"text":519},{},{"id":522,"data":1566,"type":42,"tunes":1567},{"text":524,"level":219},{},{"id":527,"data":1569,"type":226,"tunes":1570},{"text":529},{},{"id":532,"data":1572,"type":226,"tunes":1573},{"text":534},{},{"id":537,"data":1575,"type":42,"tunes":1576},{"text":539,"level":219},{},{"id":542,"data":1578,"type":287,"tunes":1591},{"content":1579,"stretched":43,"withHeadings":14},[1580,1581,1582,1583,1584,1585,1586,1587,1588,1589,1590],[546,547],[549,550],[552,553],[555,556],[558,559],[561,562],[564,565],[567,568],[570,571],[573,574],[576,577],{},{"id":580,"data":1593,"type":42,"tunes":1594},{"text":582,"level":219},{},{"id":585,"data":1596,"type":287,"tunes":1607},{"content":1597,"stretched":43,"withHeadings":14},[1598,1599,1600,1601,1602,1603,1604,1605,1606],[589,590,591],[593,594,595],[597,598,599],[601,602,603],[605,606,607],[609,610,611],[613,614,615],[617,618,619],[621,622,623],{},{"id":626,"data":1609,"type":42,"tunes":1610},{"text":628,"level":219},{},{"id":631,"data":1612,"type":392,"tunes":1622},{"steps":1613,"title":658,"orientation":391},[1614,1615,1616,1617,1618,1619,1620,1621],{"label":635,"description":636},{"label":638,"description":639},{"label":641,"description":642},{"label":644,"description":645},{"label":647,"description":648},{"label":650,"description":651},{"label":653,"description":654},{"label":656,"description":657},{},{"id":661,"data":1624,"type":226,"tunes":1625},{"text":663},{},{"id":666,"data":1627,"type":42,"tunes":1628},{"text":668,"level":219},{},{"id":671,"data":1630,"type":226,"tunes":1631},{"text":673},{},{"id":676,"data":1633,"type":226,"tunes":1634},{"text":678},{},{"id":681,"data":1636,"type":42,"tunes":1637},{"text":683,"level":219},{},{"id":686,"data":1639,"type":226,"tunes":1640},{"text":688},{},{"id":691,"data":1642,"type":226,"tunes":1643},{"text":693},{},{"id":696,"data":1645,"type":226,"tunes":1646},{"text":698},{},{"id":701,"data":1648,"type":42,"tunes":1649},{"text":703,"level":219},{},{"id":706,"data":1651,"type":226,"tunes":1652},{"text":708},{},{"id":711,"data":1654,"type":226,"tunes":1655},{"text":713},{},{"id":716,"data":1657,"type":42,"tunes":1658},{"text":718,"level":219},{},{"id":721,"data":1660,"type":226,"tunes":1661},{"text":723},{},{"id":726,"data":1663,"type":226,"tunes":1664},{"text":728},{},{"id":731,"data":1666,"type":737,"tunes":1667},{"url":733,"title":734,"excerpt":735,"ctaLabel":736},{},{"id":740,"data":1669,"type":737,"tunes":1670},{"url":742,"title":743,"excerpt":744,"ctaLabel":745},{},{"id":748,"data":1672,"type":42,"tunes":1673},{"text":750,"level":219},{},{"id":753,"data":1675,"type":753,"tunes":1682},{"items":1676,"title":776},[1677,1678,1679,1680,1681],{"id":757,"answer":758,"question":759},{"id":761,"answer":762,"question":763},{"id":765,"answer":766,"question":767},{"id":769,"answer":770,"question":771},{"id":773,"answer":774,"question":775},{},{"id":779,"data":1684,"type":42,"tunes":1685},{"text":781,"level":219},{},{"id":784,"data":1687,"type":784,"tunes":1695},{"title":786,"entries":1688},[1689,1690,1691,1692,1693,1694],{"term":272,"anchor":789,"definition":790},{"term":792,"anchor":793,"definition":794},{"term":280,"anchor":567,"definition":796},{"term":798,"anchor":799,"definition":800},{"term":802,"anchor":803,"definition":804},{"term":806,"anchor":807,"definition":808},{},{"id":811,"data":1697,"type":42,"tunes":1698},{"text":813,"level":219},{},{"id":816,"data":1700,"type":823,"tunes":1703},{"link":818,"meta":1701},{"image":1702,"title":821,"description":822},{"url":465},{},{"id":826,"data":1705,"type":823,"tunes":1708},{"link":828,"meta":1706},{"image":1707,"title":831,"description":832},{"url":465},{},{"id":835,"data":1710,"type":823,"tunes":1713},{"link":837,"meta":1711},{"image":1712,"title":840,"description":841},{"url":465},{},{"id":844,"data":1715,"type":823,"tunes":1718},{"link":846,"meta":1716},{"image":1717,"title":849,"description":850},{"url":465},{},"Post erfolgreich abgerufen",{"items":1721,"source":1785,"manualIds":1786,"manualMatchedIds":1787},[1722,1729,1736,1743,1750,1757,1764,1771,1778],{"id":1723,"slug":1724,"title":1725,"excerpt":1726,"featuredImage":1727,"publishedAt":1728},"383","canonical-architecture-url-design-resolver-logic-api-scalability-specification","Kanonska Arhitektura, Dizajn URL-a, Logika Rezolvera, Specifikacija API-ja i Skalabilnosti","Geografski zasnovana arhitektura za otkrivanje za višekorisničke portale. Definiše kanonske URL adrese, logiku razrešavanja, strategiju keširanja i geo model za čitanje bez sprezanja sa CMS-om ili refaktorisanja baze podataka. Dizajnirano za SEO stabilnost, skalabilnost i buduća proširenja poput rezervacija i mapa.","\u002Fuploads\u002F2026\u002F01\u002Fcanonical-architecture-url-design-resolver-logic-api-scalability-specification-1769890763607-7rghbp.webp","2026-01-31T06:12:00.000Z",{"id":1730,"slug":1731,"title":1732,"excerpt":1733,"featuredImage":1734,"publishedAt":1735},"472","why-more-context-can-make-ai-answers-worse","Zašto više konteksta može pogoršati AI odgovore","Veći kontekstni prozor ne garantuje bolji odgovor. Ovaj članak objašnjava kako razblaživanje signala, protivrečni dokazi, zastarelo stanje, osetljivost na poziciju i kompresija sa gubicima mogu smanjiti pouzdanost veštačke inteligencije—i uvodi praktičan test pritiska konteksta.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z",{"id":1737,"slug":1738,"title":1739,"excerpt":1740,"featuredImage":1741,"publishedAt":1742},"476","mcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained","MCP vs A2A vs UCP vs AP2 vs A2UI: Objašnjen stek agentskih protokola","MCP, A2A, UCP, AP2 i A2UI se često predstavljaju kao konkurentski standardi za agente. Oni uglavnom rešavaju različite probleme interoperabilnosti. Ovaj vodič mapira svaki protokol na granicu koju zapravo standardizuje—i pokazuje kako oni mogu da rade zajedno u jednom produkcionom sistemu.","\u002Fuploads\u002F2026\u002F09\u002Fmcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained-1790352625869-2ezle0.webp","2026-09-25T12:09:00.000Z",{"id":1744,"slug":1745,"title":1746,"excerpt":1747,"featuredImage":1748,"publishedAt":1749},"477","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","Agenti za korišćenje računara: Zašto uspešan demo i dalje može biti nepouzdan sistem","Agenti za korišćenje računara sada mogu da završe impresivne radne tokove u pregledaču i na radnoj površini, ali jedno uspešno izvršavanje dokazuje sposobnost—ne pouzdanost. Ovaj članak pokazuje kako testirati ponovljivost, robusnost u odnosu na okruženje, kontrolu dugog horizonta, svest o stanju, verifikaciju ishoda i bezbedno upravljanje ciljevima.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","2026-09-25T12:13:00.000Z",{"id":1751,"slug":1752,"title":1753,"excerpt":1754,"featuredImage":1755,"publishedAt":1756},"456","zbt-z8102ax-hardware-packaging-review","ZBT Z8102AX recenzija hardvera i pakovanja: Snažan ruter, slaba kutija","ZBT Z8102AX ostavlja solidan prvi utisak kao tanak crni metalni 5G OpenWrt ruter sa više konektora za antene, dual-SIM slotovima, USB, LAN\u002FWAN portovima i praktičnim kompletom dodatne opreme. Hardver deluje korisno i ozbiljno, ali je pakovanje očigledno slaba tačka.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-02-1781620590938-y33j4b.webp","2026-06-16T04:40:00.000Z",{"id":1758,"slug":1759,"title":1760,"excerpt":1761,"featuredImage":1762,"publishedAt":1763},"467","the-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","Granica valjanosti odgovora: Nedostajući sloj između relevantnosti i pouzdanih AI odgovora","Izvor može biti relevantan, autoritativan i ipak pogrešan za pitanje koje se postavlja. Sloj koji nedostaje je primenljivost: uslovi pod kojima odgovor važi i promene koje ga primoravaju na preispitivanje. Ovaj članak predstavlja Granicu važenja odgovora kao obrazac za dizajn izvora za ljude, AI pretragu i RAG sisteme.","\u002Fuploads\u002F2026\u002F09\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers-1790272901306-1g5jly.webp","2026-09-24T11:59:00.000Z",{"id":1765,"slug":1766,"title":1767,"excerpt":1768,"featuredImage":1769,"publishedAt":1770},"457","should-you-buy-5g-openwrt-router-old-firmware","Treba li kupiti 5G OpenWrt ruter sa starim firmverom? ZBT Z8102AX kao praktičan primer","Kupovina 5G OpenWrt rutera sa starijim firmverom može imati smisla, ali samo pod pravim uslovima. ZBT Z8102AX jasno pokazuje obe strane: hardver je koristan, modem radi, a ruter je ostao stabilan u testiranju, ali OpenWrt 21.02, slabo pakovanje i nejasni putevi nadogradnje zahtevaju pažljivu odluku o kupovini.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1772,"slug":1773,"title":1774,"excerpt":1775,"featuredImage":1776,"publishedAt":1777},"470","what-should-an-ai-agent-remember-forget-recompute-or-retrieve-again","Šta bi AI agent trebalo da zapamti, zaboravi, ponovo izračuna ili ponovo preuzme?","Dugotrajni agenti ne bi trebalo da pamte sve. Ovaj članak pruža praktičan model životnog ciklusa za odlučivanje o tome šta pripada trajnoj memoriji, šta bi trebalo ponovo preuzeti, šta je bezbednije ponovo izračunati i šta bi trebalo da istekne ili bude zamenjeno.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-should-an-ai-agent-remember-forget-recompute-or-retrieve-again-1790351131087-iehz28.webp","2026-09-25T09:43:00.000Z",{"id":1779,"slug":1780,"title":1781,"excerpt":1782,"featuredImage":1783,"publishedAt":1784},"454","zbt-z8102ax-rm500u-ea-5g-modem-test","Quectel RM500U-EA u ZBT Z8102AX: 5G opsezi, o2 Nemačka i ponašanje signala u stvarnom svetu","ZBT Z8102AX koristi Quectel RM500U-EA modem za 4G i 5G povezivost. U prvom praktičnom testu, ruter se uspešno povezao na o2 Germany sa LTE Band 3 i NR n28. Modem radi, ali dublja dijagnostika poput RSRP, RSRQ, SINR, zaključavanja opsega i ponašanja ćelije još uvek zahteva odgovarajuće testiranje.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-06-1781620597879-qay2sx.webp","2026-06-16T08:39:00.000Z","fallback",[],[]]