Kako znati da li je AI agent zaista koristio prave dokaze

AI agent može navoditi izvore, preuzimati dokumente, a ipak koristiti pogrešne dokaze. Izvor može biti merodavan, ali nerelevantan za samu tvrdnju. Preuzeti odlomak može podržavati samo deo odgovora. Tačan izvor može biti zastareo, zamenjen novijim ili važeći za pogrešnu nadležnost, verziju proizvoda, korisnika ili stanje sistema. To stvara teži problem evaluacije od jednostavne provere citata: da li je agent zaista koristio prave dokaze za tvrdnju koju je izneo?
Zašto citati nisu dovoljni
Citat odgovara samo na usko pitanje: sistem je povezao tvrdnju ili odgovor sa izvorom. On ne utvrđuje automatski da izvor podržava konkretnu tvrdnju, da je izvor dovoljno merodavan za dati zadatak, da citirani odlomak sadrži neophodan uslov ili izuzetak, niti da se model oslonio na taj dokaz umesto da generiše odgovor na osnovu prethodnog znanja modela.
Anthropic-ove smernice za evaluaciju istraživačkih agenata izričito razdvajaju utemeljenost, pokrivenost i kvalitet izvora. OpenAI-jeve smernice za evaluaciju agenata na sličan način naglašavaju tragove izvršavanja (traces), jer konačni izlaz ne otkriva da li je agent odabrao prave alate ili sledio predviđeni tok rada. Te ideje ukazuju na širi zaključak: kvalitet dokaza je svojstvo putanje izvršavanja, a ne samo konačnog teksta.
Četiri pitanja koja svaka materijalna tvrdnja mora da prođe
| Dimenzija | Pitanje | Tipičan propust |
|---|---|---|
| Podrška tvrdnji | Da li dokaz direktno podržava upravo ovu tvrdnju? | Izvor je tematski povezan, ali ne dokazuje tvrdnju |
| Merodavnost dokaza | Da li je ovo odgovarajući izvor za ovu vrstu tvrdnje? | Korišćen je sekundarni sažetak tamo gde je potreban primarni izvor ili sistem uživo |
| Primenljivost | Da li se dokaz odnosi na ovo vreme, verziju, nadležnost, korisnika, stanje ili populaciju? | Istinita tvrdnja se primenjuje van uslova njenog važenja |
| Upotreba dokaza | Da li je ovaj dokaz zaista bio dostupan i korišćen u agentovoj putanji izvršavanja? | Konačan odgovor je tačan, ali su preuzeti dokazi bili nerelevantni ili nekorišćeni |
1. Podrška tvrdnji: da li izvor potvrđuje ono što agent tvrdi?
Dokaze treba procenjivati na nivou tvrdnje. Dokument može biti relevantan za temu, a da ipak ne podržava konkretnu izjavu. Ako izvor navodi da je funkcionalnost dostupna u odabranim regionima, odgovor „funkcionalnost je dostupna globalno” nije podržan iako citat deluje uverljivo.
Tu su opšte procene tipa „utemeljeno / neutemeljeno” često previše grube. Podelite odgovor na materijalne tvrdnje, mapirajte svaku tvrdnju na najmanji raspon dokaza koji je podržava i klasifikujte odnos: direktna podrška, delimična podrška, protivrečnost ili nedostatak podrške.
2. Merodavnost dokaza: da li je ovo prava vrsta izvora?
Ispravan izbor dokaza nije samo semantička relevantnost. Izvor mora biti prikladan za donošenje odluke. Trenutni status naloga treba da potiče iz sistema naloga, a ne iz stare e-pošte. Tvrdnju o ponašanju API-ja po pravilu treba proveriti u odnosu na aktuelnu dokumentaciju proizvođača ili ponovljivo ponašanje. Pravni zahtev može zahtevati važeći zakon, regulatorno telo ili merodavne smernice umesto generičkog blog posta.
Merodavnost izvora zavisi od specifičnog zadatka. Prijava zajednice može biti najbolji dokaz za grešku u praksi koju dokumentacija proizvođača ne priznaje. Saopštenje proizvođača može biti merodavno za ono što proizvođač tvrdi, ali slab dokaz za nezavisne performanse. Zato je evaluatoru potrebna izričita hijerarhija izvora za dati zadatak, a ne jedinstvena univerzalna ocena autoriteta.
3. Primenljivost: pravi dokaz, pogrešni uslovi
Najopasnije greške u dokazima često nisu izmišljeni izvori, već validni izvori upotrebljeni van svojih granica. Preporuka se može promeniti sa verzijom softvera, datumom, nadležnošću, revizijom hardvera, korisničkim dozvolama, dostupnošću proizvoda, trenutnim stanjem igre, konfiguracijom zakupca ili drugim promenljivama okruženja.
Za svaki materijalni izvor sačuvajte uslove koji određuju da li se on i dalje primenjuje. Ovo je posebno važno nakon sažimanja: komprimovana memorija ili citat mogu zadržati zaključak, a izostaviti izuzetak, datum ili preduslov koji je taj zaključak činio važećim.
4. Korišćenje dokaza: da li se agent zaista oslonio na dokaz?
Odgovor može biti tačan čak i kada pronalaženje informacija (retrieval) nije uspelo. Model možda već zna odgovor, može ga izvesti iz nepovezanog konteksta ili jednostavno tačno pogoditi. Ako evaluacija proverava samo konačnu tačnost, sistem može delovati dobro utemeljeno iako je putanja dokaza narušena.
Da biste procenili korišćenje dokaza, pregledajte trag izvršavanja (trace). Potvrdite koji su izvori pronađeni, koji su odlomci stigli do konteksta modela, kada su postali dostupni i da li se konačna tvrdnja može objasniti tim ulaznim podacima. Trenutni alati kompanije OpenAI za evaluaciju agenata naglašavaju ocenjivanje traga izvršavanja upravo zato što se ponašanje na nivou toka rada ne može pouzdano rekonstruisati samo iz konačnog odgovora.
Test iskorišćenosti dokaza
Praktična evaluacija se može koncipirati kao kontrolisani kontrafaktički test. Umesto da samo pitate da li je odgovor tačan, promenite dokaze i posmatrajte da li se tvrdnja menja u očekivanom pravcu.
Test iskorišćenosti dokaza
Matrica tvrdnji i dokaza je korisnija od liste izvora
| Tvrdnja | Dokaz | Podrška | Autoritet | Primenjivost | Korišćeno u tragu |
|---|---|---|---|---|---|
| Funkcionalnost X je dostupna | Dokumentacija proizvođača | Direktna | Visok za tvrdnju o dostupnosti | Trenutna verzija i region se moraju poklapati | Da / Ne |
| Konfiguracija Y je brža | Benchmark test proizvođača | Delimična | Visok za test proizvođača, ne za nezavisne performanse | Hardver i radno opterećenje se moraju poklapati | Da / Ne |
| Politika se primenjuje na ovog korisnika | Važeća politika + stanje naloga | Direktna samo kada su kombinovani | Visok | Nadležnost, datum, uloga i stanje naloga se moraju poklapati | Da / Ne |
| Proizvod je na stanju | API za stanje zaliha uživo | Direktna | Autoritativan za trenutno stanje zaliha | Brzo ističe | Da / Ne |
Ova matrica nameće nekoliko pitanja koja konvencionalna provera citata skriva. Jedna tvrdnja može zahtevati više izvora. Jedan izvor može podržavati samo deo tvrdnje. Autoritativni izvor može imati kratak period važenja. I savršeno dobar izvor može biti irelevantan ako nikada nije ušao u putanju izvršavanja.
Razlikujte kvalitet pronalaženja od kvaliteta dokaza
Metrike pronalaženja postavljaju pitanje da li je relevantan materijal pronađen i rangiran. Evaluacija dokaza postavlja pitanje da li taj materijal opravdava izvedene tvrdnje. Ova dva koncepta su povezana, ali nisu identična.
Uspešno pronalaženje ne znači i uspeh dokaza
| Situacija | Pronalaženje (Retrieval) | Kvalitet dokaza | |
|---|---|---|---|
| Pravi dokument, pogrešna tvrdnja | |||
| Prava činjenica, zastareo izvor | |||
| Slab izvor, tačan odgovor | |||
| Potrebno je više izvora |
Procenjujte kvalitet izvora pomoću rubrike, a ne bele liste domena
Fiksne liste „pouzdanih domena“ deluju primamljivo, ali su često nepouzdane. Umesto toga, kvalitet izvora treba da odražava tip tvrdnje. Korisne dimenzije uključuju primarni naspram sekundarnog statusa, ažurnost, direktnost, ponovljivost, nezavisnost, stručnost u domenu, poreklo podataka, učestalost ažuriranja i to da li izvor ima motiv da preuveliča tvrdnju.
Smernice kompanije Anthropic za evaluaciju istraživačkih agenata izričito navode provere kvaliteta izvora uporedo sa utemeljenošću i pokrivenošću. Praktična primena bi stoga trebalo da ocenjuje i ono što izvor kaže i da li je taj izvor odgovarajući za takvu vrstu izjave.
Pokrivenost dokazima: svakoj važnoj tvrdnji je potrebna podrška, a ne svakoj rečenici
Nije svakoj rečenici potreban citat. Prelazne fraze, aritmetika transparentno izvedena iz citiranih vrednosti ili jasno označeno tumačenje možda ne zahtevaju poseban izvor. Ali svaka materijalna, eksterno proverljiva tvrdnja treba da ima dovoljno potpore kako bi procenjivač mogao da rekonstruiše zašto je agentu bilo dozvoljeno da je iznese.
Pokrivenost bi stoga trebalo ponderisati prema važnosti tvrdnje. Nedostatak potpore za dekorativni detalj nije isto što i nedostatak potpore za cenu, odluku o ispunjavanju uslova, bezbednosno uputstvo, zakonski zahtev, izjavu o tehničkoj kompatibilnosti ili činjenicu koja usmerava preporuku.
Poreklo dokaza mora preživeti sažimanje i memoriju
Agenti sa dugim radom često sažimaju prethodni rad ili zapisuju trajne memorije. Ako se poreklo dokaza ukloni tokom te transformacije, budući agenti mogu preuzeti čist zaključak bez znanja o tome da li potiče iz izjave korisnika, API-ja uživo, starog dokumenta, zaključivanja modela ili neproverenog veb rezultata.
Za važne činjenice sačuvajte bar identitet izvora, vreme preuzimanja ili opažanja, tip dokaza, relevantnu verziju ili stanje, kao i to da li je sačuvani tekst citiran, sažet, izveden zaključivanjem ili izračunat. Poreklo je ono što omogućava kasnijem agentu da odluči da li dokazu treba verovati, da li ga treba osvežiti, ograničiti ili odbaciti.
Praktičan zapis o dokazu
| Polje | Svrha |
|---|---|
| claim_id | Identifikuje materijalnu tvrdnju koja se potkrepljuje |
| source_id / source_url / system | Identifikuje odakle dokaz potiče |
| evidence_span | Čuva najmanji odlomak, zapis ili rezultat alata koji potkrepljuje tvrdnju |
| retrieved_at / observed_at | Omogućava provere svežine i vremenskog toka |
| source_version / object_version | Omogućava provere zamenjenosti i ponovljivosti |
| authority_role | Objašnjava zašto je ovaj izvor prikladan za ovu tvrdnju |
| applicability | Čuva relevantan datum, jurisdikciju, verziju proizvoda, korisnika, zakupca, stanje ili druge uslove |
| transformation | Označava da li je dokaz sirov, citiran, sažet, normalizovan ili izveden |
| trace_step | Prikazuje kada je dokaz postao dostupan agentu |
| support_status | Direktan, delimičan, kontradiktoran, nepodržan ili neizvestan |
Obrasci neuspeha koji deluju utemeljeno, a to nisu
| Obrazac neuspeha | Zašto zavarava procenjivače | Šta testirati |
|---|---|---|
| Dekorativno citiranje | Odgovor sadrži izvore, pa deluje istraženo | Mapirati svaku materijalnu tvrdnju na tačan potkrepljujući odlomak |
| Neusklađenost autoriteta | Izvor je ugledan, ali nije merodavan za konkretnu činjenicu | Definisati hijerarhiju izvora specifičnu za tvrdnju |
| Vremenska neusklađenost | Izvor je bio tačan u trenutku objavljivanja | Proveriti vreme preuzimanja, datum izvora i dokaze koji ga zamenjuju |
| Uklanjanje uslova | Sažetak zadržava zaključak, ali izostavlja izuzetke | Uporediti generisanu tvrdnju sa punim lokalnim kontekstom izvora |
| Naknadno citiranje (post-hoc) | Uverljiv izvor se dodaje tek nakon što je odgovor generisan | Ispitati redosled u tragu i da li je dokaz prethodio tvrdnji |
| Parametarsko preinačenje | Model ignoriše preuzeti dokaz i odgovara na osnovu prethodnog znanja | Pokrenuti kontračinjenične testove korišćenja dokaza |
| Pranje dokaza | Zaključak modela se sažima i kasnije čuva kao da je izvorna činjenica | Sačuvati tip transformacije i poreklo prilikom svakog upisivanja u memoriju |
| Zabluda većine izvora | Nekoliko sekundarnih stranica ponavlja istu nepotkrepljenu tvrdnju | Pratiti tvrdnje unazad do nezavisnih ili primarnih dokaza |
Kako evaluirati agenta u produkciji
Tok evaluacije dokaza
OpenAI-jeve aktuelne smernice za evaluaciju preporučuju evaluacije specifične za zadatak, kontinuiranu evaluaciju, skupove podataka izvedene iz produkcije i tragove za otklanjanje grešaka u ponašanju agenta. Anthropic slično tome preporučuje kombinovanje različitih tipova ocenjivača za istraživačke agente, jer su tačnost, kvalitet izvora, pokrivenost i utemeljenost zasebne dimenzije. Evaluacija dokaza treba da prati isti obrazac: nekoliko usko usmerenih ocenjivača pruža bolju dijagnostiku od jedne neprozirne ocene „kvaliteta“.
Ne dozvolite da LLM sudija postane jedini sudija za dokaze
LLM ocenjivači su korisni za skalabilnu klasifikaciju tvrdnji, provere relevantnosti i poređenja u parovima, ali mogu deliti iste slepe mrlje kao i sistem koji procenjuju. Ocenjivač može prihvatiti uverljivu, ali nepodržanu tvrdnju, propustiti suptilnu granicu verzije ili preceniti doteran izvor.
OpenAI-jeve smernice za evaluaciju preporučuju kalibraciju automatizovanih ocenjivača u odnosu na ljudsko rasuđivanje i korišćenje jasnih, precizno definisanih kriterijuma. Za sisteme koji se u velikoj meri oslanjaju na dokaze, determinističke provere treba koristiti gde god je to moguće: vremenske oznake, verzije objekata, opseg dozvola, tačne ID-jeve izvora, redosled preuzimanja, heševe dokumenata i to da li je dokaz postojao pre nego što je model generisao tvrdnju.
Šta bi promenilo ovaj odgovor?
Evaluacija može biti jednostavnija kada agent radi nad malim, nepromenljivim, autoritativnim korpusom i kada je svaki odgovor striktno ekstraktivan. U tom okruženju autoritet izvora i primenjivost su uglavnom fiksni, pa potpora na relaciji tvrdnja-odlomak može biti dovoljna.
Evaluacija mora postati stroža kada agent kombinuje veb pretragu, dugoročnu memoriju, alate uživo, više jurisdikcija, informacije koje se brzo menjaju, stanje specifično za korisnika ili autonomne akcije. U takvim sistemima validnost dokaza zavisi ne samo od teksta izvora, već i od toga kada su i kako dokazi pribavljeni.
Budući modeli mogu postati bolji u internom praćenju porekla i nesigurnosti, ali to ne bi uklonilo potrebu za eksternim zapisima dokaza u sistemima koji zahtevaju proverljivost. Sistem ne bi trebalo da zavisi od modelovog sopstvenog izveštavanja o tome šta je uticalo na njega kada tragovi i metapodaci izvora mogu pružiti jače dokaze.
Ograničenja
Nije uvek moguće dokazati uzročnu upotrebu dokaza samo na osnovu tragova izvršavanja. Izvor može biti prisutan u kontekstu bez uticaja na odgovor, a model može nezavisno znati istu činjenicu. Kontračinjenični testovi pojačavaju zaključivanje, ali mogu i sami promeniti raspodelu zadatka.
Autoritet izvora takođe može biti osporavan ili zavisan od domena. Neka pitanja nemaju jedan autoritativan izvor, a stručnjaci se mogu razilaziti u mišljenjima o tome koji dokaz zaslužuje veću težinu. U tim slučajevima, procenjivač treba da sačuva neslaganje i oceni transparentnost, pokrivenost i rezonovanje u odnosu na eksplicitnu rubriku, umesto da se pretvara da postoji jedan neprikosnoveni izvor istine.
Zaključak
Pitanje „Da li je agent naveo izvor?“ suviše je slabo za produkcioni AI. Jače pitanje je: Da li je svaka važna tvrdnja proizašla iz dokaza koji je zaista podržavaju, poseduju odgovarajući autoritet, i dalje važe u trenutnim uslovima i bili su dostupni na putanji izvršavanja pre nego što je tvrdnja izrečena?
To pretvara dokaze iz pukog ukrasa u procenjivo svojstvo sistema. Zabeležite trag izvršavanja. Mapirajte tvrdnje na dokaze. Proverite autoritet i primenljivost. Pokrenite kontračinjenične testove dokaza. Sačuvajte poreklo kroz sažetke i memoriju. Tada tačan odgovor nije samo verovatan — on ima dokazni put koji možete pregledati.
Često postavljana pitanja
Evaluacija upotrebe dokaza kod AI agenata
Da li citiranje dokazuje da je odgovor AI-ja utemeljen?
Kako mogu da testiram da li je AI agent zaista koristio preuzete dokaze?
Koja je razlika između utemeljenosti i kvaliteta izvora?
Zašto stvarni izvor i dalje može proizvesti pogrešan odgovor AI-ja?
Šta treba beležiti u dnevnik radi evaluacije dokaza?
Rečnik pojmova
Ključni pojmovi evaluacije dokaza
- Podrška tvrdnji
- Stepen u kojem određeni fragment dokaza direktno potvrđuje generisanu tvrdnju.
- Primenljivost
- Uslovi pod kojima dokaz ostaje važeći za tvrdnju, uključujući vreme, verziju, jurisdikciju, korisnika, populaciju, stanje sistema ili druge granice.
- Korišćenje dokaza
- Da li izlaz agenta zaista reaguje na dokaze koji su mu stavljeni na raspolaganje na putanji izvršavanja i zavisi od njih.
- Kontračinjenični test dokaza
- Evaluacija koja uklanja, zamenjuje ili menja presudne dokaze kako bi se proverilo da li se tvrdnja agenta adekvatno menja.
- Poreklo podataka
- Metapodaci koji beleže odakle dokaz potiče, kada je dobijen, kako je transformisan i koju verziju ili stanje je predstavljao.
Primarni izvori i dodatna literatura
OpenAI — Evaluacija radnih tokova agenataSmernice za ocenjivanje tragova izvršavanja, evaluaciju na nivou radnog toka, skupove podataka i ponovljiva pokretanja evaluacije za agente.
OpenAI — Najbolje prakse za evaluacijuSmernice za evaluacije specifične za zadatke, skupove podataka izvedene iz produkcije, metrike uskog opsega, kontinuiranu evaluaciju i kalibraciju ocenjivača.
Anthropic — Demistifikacija evaluacija za AI agenteSmernice za evaluaciju agenata uključujući utemeljenost, pokrivenost i provere kvaliteta izvora za istraživačke agente.
OpenAI — Zajednički priručnik za pouzdane evaluacije trećih stranaSmernice za evaluaciju koje naglašavaju da performanse savremenih agenata zavise od radnog toka i okruženja, a ne samo od konačnog izlaza modela.
Related Articles

ZBT Z8102AX recenzija hardvera i pakovanja: Snažan ruter, slaba kutija
ZBT Z8102AX ostavlja solidan prvi utisak kao tanak crni metalni 5G OpenWrt ruter sa više konektora za antene, dual-SIM slotovima, USB, LAN/WAN portovima i praktičnim kompletom dodatne opreme. Hardver deluje korisno i ozbiljno, ali je pakovanje očigledno slaba tačka.

Šta bi AI agent trebalo da zapamti, zaboravi, ponovo izračuna ili ponovo preuzme?
Dugotrajni agenti ne bi trebalo da pamte sve. Ovaj članak pruža praktičan model životnog ciklusa za odlučivanje o tome šta pripada trajnoj memoriji, šta bi trebalo ponovo preuzeti, šta je bezbednije ponovo izračunati i šta bi trebalo da istekne ili bude zamenjeno.

Granica valjanosti odgovora: Nedostajući sloj između relevantnosti i pouzdanih AI odgovora
Izvor može biti relevantan, autoritativan i ipak pogrešan za pitanje koje se postavlja. Sloj koji nedostaje je primenljivost: uslovi pod kojima odgovor važi i promene koje ga primoravaju na preispitivanje. Ovaj članak predstavlja Granicu važenja odgovora kao obrazac za dizajn izvora za ljude, AI pretragu i RAG sisteme.

Treba li kupiti 5G OpenWrt ruter sa starim firmverom? ZBT Z8102AX kao praktičan primer
Kupovina 5G OpenWrt rutera sa starijim firmverom može imati smisla, ali samo pod pravim uslovima. ZBT Z8102AX jasno pokazuje obe strane: hardver je koristan, modem radi, a ruter je ostao stabilan u testiranju, ali OpenWrt 21.02, slabo pakovanje i nejasni putevi nadogradnje zahtevaju pažljivu odluku o kupovini.

Kanonska Arhitektura, Dizajn URL-a, Logika Rezolvera, Specifikacija API-ja i Skalabilnosti
Geografski zasnovana arhitektura za otkrivanje za višekorisničke portale. Definiše kanonske URL adrese, logiku razrešavanja, strategiju keširanja i geo model za čitanje bez sprezanja sa CMS-om ili refaktorisanja baze podataka. Dizajnirano za SEO stabilnost, skalabilnost i buduća proširenja poput rezervacija i mapa.

Zašto više konteksta može pogoršati AI odgovore
Veći kontekstni prozor ne garantuje bolji odgovor. Ovaj članak objašnjava kako razblaživanje signala, protivrečni dokazi, zastarelo stanje, osetljivost na poziciju i kompresija sa gubicima mogu smanjiti pouzdanost veštačke inteligencije—i uvodi praktičan test pritiska konteksta.

Quectel RM500U-EA u ZBT Z8102AX: 5G opsezi, o2 Nemačka i ponašanje signala u stvarnom svetu
ZBT Z8102AX koristi Quectel RM500U-EA modem za 4G i 5G povezivost. U prvom praktičnom testu, ruter se uspešno povezao na o2 Germany sa LTE Band 3 i NR n28. Modem radi, ali dublja dijagnostika poput RSRP, RSRQ, SINR, zaključavanja opsega i ponašanja ćelije još uvek zahteva odgovarajuće testiranje.

MCP vs A2A vs UCP vs AP2 vs A2UI: Objašnjen stek agentskih protokola
MCP, A2A, UCP, AP2 i A2UI se često predstavljaju kao konkurentski standardi za agente. Oni uglavnom rešavaju različite probleme interoperabilnosti. Ovaj vodič mapira svaki protokol na granicu koju zapravo standardizuje—i pokazuje kako oni mogu da rade zajedno u jednom produkcionom sistemu.

Agenti za korišćenje računara: Zašto uspešan demo i dalje može biti nepouzdan sistem
Agenti za korišćenje računara sada mogu da završe impresivne radne tokove u pregledaču i na radnoj površini, ali jedno uspešno izvršavanje dokazuje sposobnost—ne pouzdanost. Ovaj članak pokazuje kako testirati ponovljivost, robusnost u odnosu na okruženje, kontrolu dugog horizonta, svest o stanju, verifikaciju ishoda i bezbedno upravljanje ciljevima.