[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:it":3,"public-menus:all":38,"post:ai-agent-reliability-why-the-final-answer-is-not-enough:it":205,"related:post:ai-agent-reliability-why-the-final-answer-is-not-enough:it:1":1130},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","it","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1129},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":561,"featuredImage":562,"featuredImageAlt":563,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":564,"publishedAt":565,"createdAt":566,"updatedAt":567,"seoLocalePaths":568,"categories":577,"author":586,"translations":591},"460","Affidabilità degli Agenti AI: Perché la Risposta Finale Non è Sufficiente","ai-agent-reliability-why-the-final-answer-is-not-enough","\u003Cp>\u003Cb>Un output corretto non dimostra un ragionamento corretto, un'esecuzione sicura o un sistema affidabile.\u003C\u002Fb>\u003C\u002Fp>\n\u003Cp>Per anni, la valutazione dell'IA è stata dominata da una domanda ingannevolmente semplice: \u003Cb>La risposta era corretta?\u003C\u002Fb> Per un chatbot, questo può talvolta essere sufficiente. Per un agente capace di cercare nei sistemi, leggere dati, chiamare strumenti, modificare lo stato, eseguire flussi di lavoro, scrivere file, interagire con API o prendere decisioni, non lo è.\u003C\u002Fp>\n\u003Cp>Un agente può produrre la risposta finale corretta mentre fa diverse cose sbagliate lungo il percorso. Può usare la fonte sbagliata, fraintendere un'istruzione e poi compensare l'errore, accedere a informazioni non necessarie, eseguire un'azione intermedia non autorizzata, riprendersi silenziosamente da un errore che avrebbe dovuto innescare un'escalation, o lasciare dietro di sé effetti collaterali che nessuno ha notato.\u003C\u002Fp>\n\u003Cp>Questo crea uno dei problemi centrali dell'IA agentica: \u003Cb>un risultato corretto non prova una traiettoria corretta.\u003C\u002Fb>\u003C\u002Fp>\n\u003Ch2>L'illusione del risultato\u003C\u002Fh2>\n\u003Cp>Il software tradizionale ci offre un modello intuitivo di correttezza. L'input entra in un sistema deterministico o per lo più deterministico, la logica viene eseguita, l'output viene prodotto e i test verificano il comportamento atteso. I sistemi basati su LLM indeboliscono questa assunzione. I sistemi agentici vanno oltre.\u003C\u002Fp>\n\u003Cul>\u003Cli>interpretazione del modello\u003C\u002Fli>\u003Cli>contesto recuperato\u003C\u002Fli>\u003Cli>selezione degli strumenti\u003C\u002Fli>\u003Cli>osservazioni intermedie\u003C\u002Fli>\u003Cli>stato esterno\u003C\u002Fli>\u003Cli>azioni precedenti\u003C\u002Fli>\u003Cli>piani generati dal modello\u003C\u002Fli>\u003Cli>limiti di autorizzazione\u003C\u002Fli>\u003Cli>retry e comportamento di fallback\u003C\u002Fli>\u003Cli>interazione umana\u003C\u002Fli>\u003C\u002Ful>\n\u003Cp>Due esecuzioni che partono da input quasi identici possono raggiungere lo stesso risultato attraverso percorsi molto diversi. Se la valutazione osserva solo l'output finale, la maggior parte del sistema rimane invisibile.\u003C\u002Fp>\n\u003Cp>Immagina che un agente AI riceva l'istruzione: \u003Ci>Aggiorna l'indirizzo di fatturazione del cliente.\u003C\u002Fi> L'indirizzo viene infine aggiornato correttamente. Una valutazione convenzionale potrebbe classificare il compito come riuscito.\u003C\u002Fp>\n\u003Col>\u003Cli>L'agente cerca diversi record di clienti non correlati.\u003C\u002Fli>\u003Cli>Recupera più informazioni personali del necessario.\u003C\u002Fli>\u003Cli>Inizialmente modifica l'account sbagliato.\u003C\u002Fli>\u003Cli>Nota l'errore.\u003C\u002Fli>\u003Cli>Annulla la modifica.\u003C\u002Fli>\u003Cli>Aggiorna l'account corretto.\u003C\u002Fli>\u003Cli>Riporta il successo.\u003C\u002Fli>\u003C\u002Fol>\n\u003Cp>\u003Cb>Stato finale: corretto. Comportamento del sistema: inaccettabile.\u003C\u002Fb> Un benchmark basato solo sui risultati dà a questa esecuzione un esito positivo. Un sistema di garanzia di produzione non dovrebbe.\u003C\u002Fp>\n\u003Ch2>La traiettoria è parte del prodotto\u003C\u002Fh2>\n\u003Cp>Questo è il motivo per cui la \u003Cb>traiettoria\u003C\u002Fb> di un agente AI deve diventare un oggetto ingegneristico di prima classe. Una traiettoria è la sequenza di stati e azioni rilevanti tra la richiesta originale e il risultato finale.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>Intent → Contesto → Decisione → Strumento → Azione → Osservazione → Decisione → Cambiamento di stato → Risultato\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Zachary J. Stevens sviluppa questa idea in \u003Ci>La traiettoria è il sistema\u003C\u002Fi>, sostenendo che la valutazione agentica deve andare oltre la risposta finale ed esaminare il percorso completo dell'azione attraverso un ambiente in cambiamento.\u003C\u002Fp>\n\u003Cblockquote class=\"border-l-4 border-gray-300 pl-4 italic\">Un risultato corretto non scusa una traiettoria inaccettabile.\u003Ccite class=\"block mt-2 text-sm\">— Zachary J. Stevens, La traiettoria è il sistema\u003C\u002Fcite>\u003C\u002Fblockquote>\n\u003Ca href=\"https:\u002F\u002Fzacharyjstevens.com\u002Fdispatches\u002Fvanguard-signal\u002F009-the-trajectory-is-the-system\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">La traiettoria è il sistema\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Zachary J. Stevens — DFEI.009 sulla valutazione dei sistemi agentici tramite la loro traiettoria completa piuttosto che solo il risultato finale.\u003C\u002Fp>\u003C\u002Fa>\n\u003Cp>La distinzione conta enormemente. L'affidabilità quindi non è semplicemente \u003Cb>output corretto\u003C\u002Fb>. È più vicino a \u003Cb>risultato accettabile + traiettoria accettabile + recuperabilità + evidenza\u003C\u002Fb>.\u003C\u002Fp>\n\u003Ch2>Una risposta corretta può nascondere un sistema rotto\u003C\u002Fh2>\n\u003Ctable class=\"w-full border-collapse\">\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Agente\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Risultato finale\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Esecuzione\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">A\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Corretto\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Percorso corretto\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">B\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Corretto\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Percorso non sicuro\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">C\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Errato\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Fallimento sicuro\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">D\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Errato\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Fallimento non sicuro\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftable>\n\u003Cp>La maggior parte delle valutazioni basate su benchmark premia fortemente A e B e penalizza C e D. Operativamente, tuttavia, \u003Cb>B può essere più pericoloso di C\u003C\u002Fb>. L'agente C può riconoscere l'incertezza, fermare l'esecuzione e richiedere una revisione umana. L'agente B può produrre con sicurezza risultati corretti violando presupposti che nessuno sta monitorando.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>output riuscito → maggiore fiducia → permessi più ampi → più automazione → raggio d&#39;azione più ampio\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Ch2>Abbiamo bisogno di prove, non di fiducia\u003C\u002Fh2>\n\u003Cp>Uno dei più grandi errori nell'adozione dell'IA è trattare la fiducia del modello, la soddisfazione dell'utente o il tasso di successo storico come prova dell'affidabilità del sistema. Non sono equivalenti.\u003C\u002Fp>\n\u003Cul>\u003Cli>Cosa ha ricevuto l'agente?\u003C\u002Fli>\u003Cli>Quale contesto ha recuperato?\u003C\u002Fli>\u003Cli>Quali strumenti ha chiamato?\u003C\u002Fli>\u003Cli>Perché l'azione è stata consentita?\u003C\u002Fli>\u003Cli>Quale stato esisteva prima dell'azione?\u003C\u002Fli>\u003Cli>Cosa è cambiato?\u003C\u002Fli>\u003Cli>Quali errori intermedi si sono verificati?\u003C\u002Fli>\u003Cli>È stato ritentato qualcosa?\u003C\u002Fli>\u003Cli>È stata richiesta l'approvazione umana?\u003C\u002Fli>\u003Cli>L'esecuzione avrebbe potuto essere interrotta?\u003C\u002Fli>\u003Cli>L'azione può essere annullata?\u003C\u002Fli>\u003Cli>Quali versioni di modello, prompt e strumenti sono state coinvolte?\u003C\u002Fli>\u003C\u002Ful>\n\u003Cp>Senza queste risposte, non esiste una seria garanzia operativa. C'è solo un output. L'osservabilità e le prove devono quindi essere progettate nell'architettura dell'agente piuttosto che aggiunte dopo la distribuzione.\u003C\u002Fp>\n\u003Ch2>La registrazione non è la stessa cosa del controllo\u003C\u002Fh2>\n\u003Cp>Le organizzazioni spesso rispondono: \u003Ci>Tutto è registrato.\u003C\u002Fi> Bene. Ma la registrazione da sola non controlla nulla. Un registro ti dice cosa è successo. Un controllo determina se qualcosa \u003Cb>può accadere\u003C\u002Fb>.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>L&#39;agente richiede DELETE \u002Fcustomer\u002F123 ↓\nAzione registrata ↓\nDELETE eseguita\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Questo offre osservabilità. Confrontalo con:\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>L&#39;agente richiede DELETE \u002Fcustomer\u002F123 ↓\nValutazione della policy ↓\nIdentità corrente verificata ↓\nParametri dell&#39;azione corrente controllati ↓\nSoglia di rischio valutata ↓\nApprovazione umana se richiesta ↓\nAzione eseguita ↓\nRisultato verificato ↓\nProve memorizzate\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Ora ci stiamo avvicinando a un sistema di controllo. La differenza è architetturale, non cosmetica.\u003C\u002Fp>\n\u003Ch2>Il permesso è necessario, ma non è una garanzia\u003C\u002Fh2>\n\u003Cp>Supponiamo che un agente abbia il permesso di inviare email. Il controllo degli accessi risponde: \u003Cb>Questo agente può inviare email?\u003C\u002Fb> Non risponde: \u003Cb>Questa particolare email dovrebbe essere inviata a questa particolare persona con questo particolare allegato in questo momento?\u003C\u002Fb>\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>CONTROLLO DELLE CAPACITÀ\nCosa è tecnicamente consentito fare all&#39;agente? + GARANZIA DELL&#39;AZIONE\nQuesta azione specifica è appropriata nello stato attuale?\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>RBAC, ambiti OAuth, permessi API e identità degli agenti definiscono lo spazio delle azioni possibili. Non dimostrano che un'azione all'interno di quello spazio sia appropriata. Una solida architettura degli agenti richiede entrambi i livelli.\u003C\u002Fp>\n\u003Ch2>Il Primo Passo Sbagliato Conta\u003C\u002Fh2>\n\u003Cp>Quando un agente fallisce, l'azione finale errata spesso non è dove è iniziato il fallimento. Il vero fallimento potrebbe essere avvenuto molto prima.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>Recupero errato ↓\nAssunzione errata ↓\nRagionamento plausibile ↓\nChiamata strumento valida ↓\nAzione sbagliata\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Se indaghiamo solo sull'azione finale, correggiamo il sintomo. Se ispezioniamo la traiettoria, possiamo identificare il \u003Cb>primo passo sbagliato\u003C\u002Fb>. Questo trasforma un fallimento non attribuibile in un problema ingegneristico concreto.\u003C\u002Fp>\n\u003Ch2>Il Test degli Agenti Deve Andare Oltre il Test dei Prompt\u003C\u002Fh2>\n\u003Cp>I prompt contano, ma il comportamento di un agente in produzione emerge da un intero sistema.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>MODELLO\n+\nPROMPT DI SISTEMA\n+\nCONTESTO\n+\nMEMORIA\n+\nRECUPERO\n+\nSTRUMENTI\n+\nPERMESSI\n+\nFLUSSO DI LAVORO\n+\nSTATO ESTERNO\n+\nLOGICA DI CONTROLLO\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Cambiare uno qualsiasi di questi elementi può cambiare la traiettoria. Pertanto, versionare solo il prompt non è sufficiente.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>versione_modello\nversione_prompt\nversione_strumento\nversione_politica\nversione_recupero\nversione_flusso_di_lavoro\nstato_ambiente\nid_esecuzione\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Ch2>I Criteri di Accettazione per gli Agenti Devono Includere il Comportamento\u003C\u002Fh2>\n\u003Cp>I criteri di accettazione tradizionali spesso appaiono così: \u003Ci>Dato X, il sistema produce Y.\u003C\u002Fi> Per i sistemi agentici, questo è incompleto. I criteri di accettazione dovrebbero anche definire vincoli sulla traiettoria.\u003C\u002Fp>\n\u003Ch3>Risultato\u003C\u002Fh3>\n\u003Cp>L'indirizzo del cliente viene aggiornato correttamente.\u003C\u002Fp>\n\u003Ch3>Autorizzazione\u003C\u002Fh3>\n\u003Cp>L'agente modifica solo il cliente esplicitamente selezionato.\u003C\u002Fp>\n\u003Ch3>Accesso ai dati\u003C\u002Fh3>\n\u003Cp>Nessun record di cliente non correlato viene accesso.\u003C\u002Fp>\n\u003Ch3>Strumenti\u003C\u002Fh3>\n\u003Cp>Vengono utilizzate solo operazioni CRM approvate.\u003C\u002Fp>\n\u003Ch3>Verifica\u003C\u002Fh3>\n\u003Cp>Il nuovo indirizzo viene riletto e confrontato con il valore richiesto.\u003C\u002Fp>\n\u003Ch3>Errore\u003C\u002Fh3>\n\u003Cp>Una risoluzione ambigua dell'identità interrompe l'esecuzione.\u003C\u002Fp>\n\u003Ch3>Autorità umana\u003C\u002Fh3>\n\u003Cp>Un essere umano può rifiutare la modifica prima dell'esecuzione quando le soglie di rischio richiedono l'approvazione.\u003C\u002Fp>\n\u003Ch3>Evidenza\u003C\u002Fh3>\n\u003Cp>L'esecuzione lascia una traccia sufficiente per ricostruire la decisione e la transizione di stato.\u003C\u002Fp>\n\u003Ch3>Recupero\u003C\u002Fh3>\n\u003Cp>Il valore precedente rimane recuperabile.\u003C\u002Fp>\n\u003Ch2>L'Umano nel Ciclo Non è Sufficiente\u003C\u002Fh2>\n\u003Cp>Aggiungere una casella di approvazione umana non risolve automaticamente il problema. Un essere umano può controllare un agente solo se la persona ha visibilità, autorità, tempo, contesto e capacità di recupero.\u003C\u002Fp>\n\u003Cul>\u003Cli>\u003Cb>Visibilità:\u003C\u002Fb> informazioni sufficienti per capire cosa sta accadendo.\u003C\u002Fli>\u003Cli>\u003Cb>Autorità:\u003C\u002Fb> capacità effettiva di fermare o modificare l'azione.\u003C\u002Fli>\u003Cli>\u003Cb>Tempo:\u003C\u002Fb> intervento prima che la conseguenza si verifichi.\u003C\u002Fli>\u003Cli>\u003Cb>Contesto:\u003C\u002Fb> prove sufficienti per prendere la decisione.\u003C\u002Fli>\u003Cli>\u003Cb>Capacità di recupero:\u003C\u002Fb> capacità di invertire o riparare l'azione.\u003C\u002Fli>\u003C\u002Ful>\n\u003Cp>Un utente che clicca su \u003Cb>Approva\u003C\u002Fb> su qualcosa che non può ispezionare in modo significativo non è una governance forte. È teatro dell'approvazione.\u003C\u002Fp>\n\u003Ch2>Il Rollback Deve Diventare una Capacità AI Nativa\u003C\u002Fh2>\n\u003Cp>Il deployment software tradizionale ci ha insegnato qualcosa di prezioso: \u003Cb>Non distribuire mai ciò che non puoi ripristinare.\u003C\u002Fb> Dovremmo applicare lo stesso principio alle azioni agentiche.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>REVERSIBILE\nPuò annullare automaticamente. COMPENSABILE\nNon può annullare direttamente ma può eseguire un&#39;azione compensativa. IRREVERSIBILE\nNon può ripristinare in modo affidabile lo stato precedente.\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Maggiore è l'irreversibilità, più forte deve essere il requisito di controllo.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>Leggere un documento pubblico → bassa conseguenza\nCreare una bozza → reversibile\nModificare un record CRM → reversibile ma con conseguenze\nInviare un&#39;email esterna → praticamente irreversibile\nTrasferire denaro → alta conseguenza\nEliminare dati di produzione → potenzialmente catastrofico\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Ch2>L'Agente ha Bisogno di un Piano di Controllo\u003C\u002Fh2>\n\u003Cpre class=\"code-block\">\u003Ccode>INTENZIONE UTENTE \u002F SISTEMA │ ▼ AGENTE AI │ azione proposta │ ▼ ┌───────────────────┐ │ PIANO DI CONTROLLO │ ├───────────────────┤ │ Identità │ │ Autorizzazione │ │ Policy │ │ Rischio │ │ Stato │ │ Evidenza │ │ Autorità umana │ │ Rollback │ └───────────────────┘ │ approvato? \u002F \\ NO SÌ │ │ FERMA ▼ STRUMENTO │ ▼ CAMBIO DI STATO │ ▼ VERIFICA\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>\u003Cb>L'LLM dovrebbe proporre. Il piano di controllo dovrebbe governare.\u003C\u002Fb> Questa separazione è cruciale. Il modello non dovrebbe essere l'autorità ultima che determina se la propria azione ad alto impatto proposta sia sicura.\u003C\u002Fp>\n\u003Ch2>Dai Benchmark alla Fiducia Operativa\u003C\u002Fh2>\n\u003Cp>I benchmark rimangono utili. Ci dicono qualcosa sulle capacità, confrontano modelli, rilevano regressioni e aiutano a stimare le prestazioni attese. Ma la valutazione delle capacità e la fiducia operativa rispondono a domande diverse.\u003C\u002Fp>\n\u003Cp>Un benchmark chiede: \u003Cb>Il sistema può fare questo?\u003C\u002Fb> La garanzia operativa chiede: \u003Cb>Possiamo permettere al sistema di fare questo qui, in queste condizioni, con questi permessi e conseguenze?\u003C\u002Fb>\u003C\u002Fp>\n\u003Ch2>L'Affidabilità Dovrebbe Essere Misurata come Proprietà di Sistema\u003C\u002Fh2>\n\u003Col>\u003Cli>\u003Cb>Correttezza del risultato:\u003C\u002Fb> Il sistema ha prodotto il risultato atteso?\u003C\u002Fli>\u003Cli>\u003Cb>Correttezza della traiettoria:\u003C\u002Fb> Ha seguito un percorso accettabile?\u003C\u002Fli>\u003Cli>\u003Cb>Integrità del controllo:\u003C\u002Fb> Sono stati rispettati i confini di autorizzazione, policy e intervento?\u003C\u002Fli>\u003Cli>\u003Cb>Recuperabilità:\u003C\u002Fb> I guasti possono essere contenuti, invertiti o riparati?\u003C\u002Fli>\u003Cli>\u003Cb>Completezza delle evidenze:\u003C\u002Fb> L'esecuzione può essere ricostruita e verificata?\u003C\u002Fli>\u003C\u002Fol>\n\u003Cpre class=\"code-block\">\u003Ccode>Affidabilità Operativa\n=\nRisultato × Traiettoria × Controllo × Recuperabilità × Evidenza\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>La moltiplicazione è intenzionale. Se una dimensione critica si avvicina a zero, un punteggio alto altrove non dovrebbe nasconderlo. Un output perfettamente corretto con zero integrità di autorizzazione non è un sistema affidabile all'80%. È un'esecuzione inaccettabile che per caso ha prodotto la risposta giusta.\u003C\u002Fp>\n\u003Ch2>Il Successo è a Volte il Fallimento Più Pericoloso\u003C\u002Fh2>\n\u003Cp>I fallimenti attirano l'attenzione. Il successo spesso no. Questo rende le traiettorie di agente riuscite ma non controllate particolarmente pericolose. Un fallimento evidente crea un incidente. Un difetto nascosto nella traiettoria crea \u003Cb>fiducia\u003C\u002Fb>. E la fiducia espande l'autonomia.\u003C\u002Fp>\n\u003Cp>Le organizzazioni dovrebbero quindi non solo indagare \u003Ci>Perché l'agente ha fallito?\u003C\u002Fi> Dovrebbero periodicamente chiedersi: \u003Cb>Perché l'agente ha avuto successo?\u003C\u002Fb> Ha avuto successo perché l'architettura ha vincolato e verificato in modo affidabile l'esecuzione, o perché questa volta non è andato storto nulla?\u003C\u002Fp>\n\u003Ch2>Conclusione\u003C\u002Fh2>\n\u003Cp>L'industria si sta muovendo rapidamente dall'IA che \u003Cb>risponde\u003C\u002Fb> verso l'IA che \u003Cb>agisce\u003C\u002Fb>. Questa transizione cambia ciò che significa affidabilità. Per un sistema di risposta, valutare la risposta può spesso essere sufficiente. Per un sistema di azione, dobbiamo valutare il percorso.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>Prompt ↓\nLa risposta diventa Intento ↓\nTraiettoria ↓\nAzioni ↓\nCambi di stato ↓\nEvidenza ↓\nRisultato\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>La risposta finale rimane importante, ma è solo la fine visibile di un sistema molto più grande. Una volta che all'IA viene permesso di influenzare il mondo reale, \u003Cb>il percorso verso la risposta diventa parte della risposta.\u003C\u002Fb>\u003C\u002Fp>",{"time":212,"blocks":213,"version":560},1788955804168,[214,218,221,224,227,231,234,249,252,255,266,269,272,275,279,282,288,296,299,302,324,327,330,333,336,351,354,357,360,363,366,369,372,375,378,381,384,387,390,393,396,399,402,405,408,411,414,417,421,424,427,430,433,436,439,442,445,448,451,454,457,460,463,466,469,472,475,478,486,489,492,495,498,501,504,507,510,513,516,519,522,525,533,536,539,542,545,548,551,554,557],{"data":215,"type":217},{"text":216},"\u003Cb>Un output corretto non dimostra un ragionamento corretto, un'esecuzione sicura o un sistema affidabile.\u003C\u002Fb>","paragraph",{"data":219,"type":217},{"text":220},"Per anni, la valutazione dell'IA è stata dominata da una domanda ingannevolmente semplice: \u003Cb>La risposta era corretta?\u003C\u002Fb> Per un chatbot, questo può talvolta essere sufficiente. Per un agente capace di cercare nei sistemi, leggere dati, chiamare strumenti, modificare lo stato, eseguire flussi di lavoro, scrivere file, interagire con API o prendere decisioni, non lo è.",{"data":222,"type":217},{"text":223},"Un agente può produrre la risposta finale corretta mentre fa diverse cose sbagliate lungo il percorso. Può usare la fonte sbagliata, fraintendere un'istruzione e poi compensare l'errore, accedere a informazioni non necessarie, eseguire un'azione intermedia non autorizzata, riprendersi silenziosamente da un errore che avrebbe dovuto innescare un'escalation, o lasciare dietro di sé effetti collaterali che nessuno ha notato.",{"data":225,"type":217},{"text":226},"Questo crea uno dei problemi centrali dell'IA agentica: \u003Cb>un risultato corretto non prova una traiettoria corretta.\u003C\u002Fb>",{"data":228,"type":42},{"text":229,"level":230},"L'illusione del risultato",2,{"data":232,"type":217},{"text":233},"Il software tradizionale ci offre un modello intuitivo di correttezza. L'input entra in un sistema deterministico o per lo più deterministico, la logica viene eseguita, l'output viene prodotto e i test verificano il comportamento atteso. I sistemi basati su LLM indeboliscono questa assunzione. I sistemi agentici vanno oltre.",{"data":235,"type":248},{"items":236,"style":247},[237,238,239,240,241,242,243,244,245,246],"interpretazione del modello","contesto recuperato","selezione degli strumenti","osservazioni intermedie","stato esterno","azioni precedenti","piani generati dal modello","limiti di autorizzazione","retry e comportamento di fallback","interazione umana","unordered","list",{"data":250,"type":217},{"text":251},"Due esecuzioni che partono da input quasi identici possono raggiungere lo stesso risultato attraverso percorsi molto diversi. Se la valutazione osserva solo l'output finale, la maggior parte del sistema rimane invisibile.",{"data":253,"type":217},{"text":254},"Immagina che un agente AI riceva l'istruzione: \u003Ci>Aggiorna l'indirizzo di fatturazione del cliente.\u003C\u002Fi> L'indirizzo viene infine aggiornato correttamente. Una valutazione convenzionale potrebbe classificare il compito come riuscito.",{"data":256,"type":248},{"items":257,"style":265},[258,259,260,261,262,263,264],"L'agente cerca diversi record di clienti non correlati.","Recupera più informazioni personali del necessario.","Inizialmente modifica l'account sbagliato.","Nota l'errore.","Annulla la modifica.","Aggiorna l'account corretto.","Riporta il successo.","ordered",{"data":267,"type":217},{"text":268},"\u003Cb>Stato finale: corretto. Comportamento del sistema: inaccettabile.\u003C\u002Fb> Un benchmark basato solo sui risultati dà a questa esecuzione un esito positivo. Un sistema di garanzia di produzione non dovrebbe.",{"data":270,"type":42},{"text":271,"level":230},"La traiettoria è parte del prodotto",{"data":273,"type":217},{"text":274},"Questo è il motivo per cui la \u003Cb>traiettoria\u003C\u002Fb> di un agente AI deve diventare un oggetto ingegneristico di prima classe. Una traiettoria è la sequenza di stati e azioni rilevanti tra la richiesta originale e il risultato finale.",{"data":276,"type":278},{"code":277},"Intent → Contesto → Decisione → Strumento → Azione → Osservazione → Decisione → Cambiamento di stato → Risultato","code",{"data":280,"type":217},{"text":281},"Zachary J. Stevens sviluppa questa idea in \u003Ci>La traiettoria è il sistema\u003C\u002Fi>, sostenendo che la valutazione agentica deve andare oltre la risposta finale ed esaminare il percorso completo dell'azione attraverso un ambiente in cambiamento.",{"data":283,"type":287},{"text":284,"caption":285,"alignment":286},"Un risultato corretto non scusa una traiettoria inaccettabile.","Zachary J. Stevens, La traiettoria è il sistema","left","quote",{"data":289,"type":295},{"link":290,"meta":291},"https:\u002F\u002Fzacharyjstevens.com\u002Fdispatches\u002Fvanguard-signal\u002F009-the-trajectory-is-the-system\u002F",{"image":292,"title":293,"description":294},{},"La traiettoria è il sistema","Zachary J. Stevens — DFEI.009 sulla valutazione dei sistemi agentici tramite la loro traiettoria completa piuttosto che solo il risultato finale.","linkTool",{"data":297,"type":217},{"text":298},"La distinzione conta enormemente. L'affidabilità quindi non è semplicemente \u003Cb>output corretto\u003C\u002Fb>. È più vicino a \u003Cb>risultato accettabile + traiettoria accettabile + recuperabilità + evidenza\u003C\u002Fb>.",{"data":300,"type":42},{"text":301,"level":230},"Una risposta corretta può nascondere un sistema rotto",{"data":303,"type":323},{"content":304,"withHeadings":14},[305,309,313,316,320],[306,307,308],"Agente","Risultato finale","Esecuzione",[310,311,312],"A","Corretto","Percorso corretto",[314,311,315],"B","Percorso non sicuro",[317,318,319],"C","Errato","Fallimento sicuro",[321,318,322],"D","Fallimento non sicuro","table",{"data":325,"type":217},{"text":326},"La maggior parte delle valutazioni basate su benchmark premia fortemente A e B e penalizza C e D. Operativamente, tuttavia, \u003Cb>B può essere più pericoloso di C\u003C\u002Fb>. L'agente C può riconoscere l'incertezza, fermare l'esecuzione e richiedere una revisione umana. L'agente B può produrre con sicurezza risultati corretti violando presupposti che nessuno sta monitorando.",{"data":328,"type":278},{"code":329},"output riuscito → maggiore fiducia → permessi più ampi → più automazione → raggio d'azione più ampio",{"data":331,"type":42},{"text":332,"level":230},"Abbiamo bisogno di prove, non di fiducia",{"data":334,"type":217},{"text":335},"Uno dei più grandi errori nell'adozione dell'IA è trattare la fiducia del modello, la soddisfazione dell'utente o il tasso di successo storico come prova dell'affidabilità del sistema. Non sono equivalenti.",{"data":337,"type":248},{"items":338,"style":247},[339,340,341,342,343,344,345,346,347,348,349,350],"Cosa ha ricevuto l'agente?","Quale contesto ha recuperato?","Quali strumenti ha chiamato?","Perché l'azione è stata consentita?","Quale stato esisteva prima dell'azione?","Cosa è cambiato?","Quali errori intermedi si sono verificati?","È stato ritentato qualcosa?","È stata richiesta l'approvazione umana?","L'esecuzione avrebbe potuto essere interrotta?","L'azione può essere annullata?","Quali versioni di modello, prompt e strumenti sono state coinvolte?",{"data":352,"type":217},{"text":353},"Senza queste risposte, non esiste una seria garanzia operativa. C'è solo un output. L'osservabilità e le prove devono quindi essere progettate nell'architettura dell'agente piuttosto che aggiunte dopo la distribuzione.",{"data":355,"type":42},{"text":356,"level":230},"La registrazione non è la stessa cosa del controllo",{"data":358,"type":217},{"text":359},"Le organizzazioni spesso rispondono: \u003Ci>Tutto è registrato.\u003C\u002Fi> Bene. Ma la registrazione da sola non controlla nulla. Un registro ti dice cosa è successo. Un controllo determina se qualcosa \u003Cb>può accadere\u003C\u002Fb>.",{"data":361,"type":278},{"code":362},"L'agente richiede DELETE \u002Fcustomer\u002F123 ↓\nAzione registrata ↓\nDELETE eseguita",{"data":364,"type":217},{"text":365},"Questo offre osservabilità. Confrontalo con:",{"data":367,"type":278},{"code":368},"L'agente richiede DELETE \u002Fcustomer\u002F123 ↓\nValutazione della policy ↓\nIdentità corrente verificata ↓\nParametri dell'azione corrente controllati ↓\nSoglia di rischio valutata ↓\nApprovazione umana se richiesta ↓\nAzione eseguita ↓\nRisultato verificato ↓\nProve memorizzate",{"data":370,"type":217},{"text":371},"Ora ci stiamo avvicinando a un sistema di controllo. La differenza è architetturale, non cosmetica.",{"data":373,"type":42},{"text":374,"level":230},"Il permesso è necessario, ma non è una garanzia",{"data":376,"type":217},{"text":377},"Supponiamo che un agente abbia il permesso di inviare email. Il controllo degli accessi risponde: \u003Cb>Questo agente può inviare email?\u003C\u002Fb> Non risponde: \u003Cb>Questa particolare email dovrebbe essere inviata a questa particolare persona con questo particolare allegato in questo momento?\u003C\u002Fb>",{"data":379,"type":278},{"code":380},"CONTROLLO DELLE CAPACITÀ\nCosa è tecnicamente consentito fare all'agente? + GARANZIA DELL'AZIONE\nQuesta azione specifica è appropriata nello stato attuale?",{"data":382,"type":217},{"text":383},"RBAC, ambiti OAuth, permessi API e identità degli agenti definiscono lo spazio delle azioni possibili. Non dimostrano che un'azione all'interno di quello spazio sia appropriata. Una solida architettura degli agenti richiede entrambi i livelli.",{"data":385,"type":42},{"text":386,"level":230},"Il Primo Passo Sbagliato Conta",{"data":388,"type":217},{"text":389},"Quando un agente fallisce, l'azione finale errata spesso non è dove è iniziato il fallimento. Il vero fallimento potrebbe essere avvenuto molto prima.",{"data":391,"type":278},{"code":392},"Recupero errato ↓\nAssunzione errata ↓\nRagionamento plausibile ↓\nChiamata strumento valida ↓\nAzione sbagliata",{"data":394,"type":217},{"text":395},"Se indaghiamo solo sull'azione finale, correggiamo il sintomo. Se ispezioniamo la traiettoria, possiamo identificare il \u003Cb>primo passo sbagliato\u003C\u002Fb>. Questo trasforma un fallimento non attribuibile in un problema ingegneristico concreto.",{"data":397,"type":42},{"text":398,"level":230},"Il Test degli Agenti Deve Andare Oltre il Test dei Prompt",{"data":400,"type":217},{"text":401},"I prompt contano, ma il comportamento di un agente in produzione emerge da un intero sistema.",{"data":403,"type":278},{"code":404},"MODELLO\n+\nPROMPT DI SISTEMA\n+\nCONTESTO\n+\nMEMORIA\n+\nRECUPERO\n+\nSTRUMENTI\n+\nPERMESSI\n+\nFLUSSO DI LAVORO\n+\nSTATO ESTERNO\n+\nLOGICA DI CONTROLLO",{"data":406,"type":217},{"text":407},"Cambiare uno qualsiasi di questi elementi può cambiare la traiettoria. Pertanto, versionare solo il prompt non è sufficiente.",{"data":409,"type":278},{"code":410},"versione_modello\nversione_prompt\nversione_strumento\nversione_politica\nversione_recupero\nversione_flusso_di_lavoro\nstato_ambiente\nid_esecuzione",{"data":412,"type":42},{"text":413,"level":230},"I Criteri di Accettazione per gli Agenti Devono Includere il Comportamento",{"data":415,"type":217},{"text":416},"I criteri di accettazione tradizionali spesso appaiono così: \u003Ci>Dato X, il sistema produce Y.\u003C\u002Fi> Per i sistemi agentici, questo è incompleto. I criteri di accettazione dovrebbero anche definire vincoli sulla traiettoria.",{"data":418,"type":42},{"text":419,"level":420},"Risultato",3,{"data":422,"type":217},{"text":423},"L'indirizzo del cliente viene aggiornato correttamente.",{"data":425,"type":42},{"text":426,"level":420},"Autorizzazione",{"data":428,"type":217},{"text":429},"L'agente modifica solo il cliente esplicitamente selezionato.",{"data":431,"type":42},{"text":432,"level":420},"Accesso ai dati",{"data":434,"type":217},{"text":435},"Nessun record di cliente non correlato viene accesso.",{"data":437,"type":42},{"text":438,"level":420},"Strumenti",{"data":440,"type":217},{"text":441},"Vengono utilizzate solo operazioni CRM approvate.",{"data":443,"type":42},{"text":444,"level":420},"Verifica",{"data":446,"type":217},{"text":447},"Il nuovo indirizzo viene riletto e confrontato con il valore richiesto.",{"data":449,"type":42},{"text":450,"level":420},"Errore",{"data":452,"type":217},{"text":453},"Una risoluzione ambigua dell'identità interrompe l'esecuzione.",{"data":455,"type":42},{"text":456,"level":420},"Autorità umana",{"data":458,"type":217},{"text":459},"Un essere umano può rifiutare la modifica prima dell'esecuzione quando le soglie di rischio richiedono l'approvazione.",{"data":461,"type":42},{"text":462,"level":420},"Evidenza",{"data":464,"type":217},{"text":465},"L'esecuzione lascia una traccia sufficiente per ricostruire la decisione e la transizione di stato.",{"data":467,"type":42},{"text":468,"level":420},"Recupero",{"data":470,"type":217},{"text":471},"Il valore precedente rimane recuperabile.",{"data":473,"type":42},{"text":474,"level":230},"L'Umano nel Ciclo Non è Sufficiente",{"data":476,"type":217},{"text":477},"Aggiungere una casella di approvazione umana non risolve automaticamente il problema. Un essere umano può controllare un agente solo se la persona ha visibilità, autorità, tempo, contesto e capacità di recupero.",{"data":479,"type":248},{"items":480,"style":247},[481,482,483,484,485],"\u003Cb>Visibilità:\u003C\u002Fb> informazioni sufficienti per capire cosa sta accadendo.","\u003Cb>Autorità:\u003C\u002Fb> capacità effettiva di fermare o modificare l'azione.","\u003Cb>Tempo:\u003C\u002Fb> intervento prima che la conseguenza si verifichi.","\u003Cb>Contesto:\u003C\u002Fb> prove sufficienti per prendere la decisione.","\u003Cb>Capacità di recupero:\u003C\u002Fb> capacità di invertire o riparare l'azione.",{"data":487,"type":217},{"text":488},"Un utente che clicca su \u003Cb>Approva\u003C\u002Fb> su qualcosa che non può ispezionare in modo significativo non è una governance forte. È teatro dell'approvazione.",{"data":490,"type":42},{"text":491,"level":230},"Il Rollback Deve Diventare una Capacità AI Nativa",{"data":493,"type":217},{"text":494},"Il deployment software tradizionale ci ha insegnato qualcosa di prezioso: \u003Cb>Non distribuire mai ciò che non puoi ripristinare.\u003C\u002Fb> Dovremmo applicare lo stesso principio alle azioni agentiche.",{"data":496,"type":278},{"code":497},"REVERSIBILE\nPuò annullare automaticamente. COMPENSABILE\nNon può annullare direttamente ma può eseguire un'azione compensativa. IRREVERSIBILE\nNon può ripristinare in modo affidabile lo stato precedente.",{"data":499,"type":217},{"text":500},"Maggiore è l'irreversibilità, più forte deve essere il requisito di controllo.",{"data":502,"type":278},{"code":503},"Leggere un documento pubblico → bassa conseguenza\nCreare una bozza → reversibile\nModificare un record CRM → reversibile ma con conseguenze\nInviare un'email esterna → praticamente irreversibile\nTrasferire denaro → alta conseguenza\nEliminare dati di produzione → potenzialmente catastrofico",{"data":505,"type":42},{"text":506,"level":230},"L'Agente ha Bisogno di un Piano di Controllo",{"data":508,"type":278},{"code":509},"INTENZIONE UTENTE \u002F SISTEMA │ ▼ AGENTE AI │ azione proposta │ ▼ ┌───────────────────┐ │ PIANO DI CONTROLLO │ ├───────────────────┤ │ Identità │ │ Autorizzazione │ │ Policy │ │ Rischio │ │ Stato │ │ Evidenza │ │ Autorità umana │ │ Rollback │ └───────────────────┘ │ approvato? \u002F \\ NO SÌ │ │ FERMA ▼ STRUMENTO │ ▼ CAMBIO DI STATO │ ▼ VERIFICA",{"data":511,"type":217},{"text":512},"\u003Cb>L'LLM dovrebbe proporre. Il piano di controllo dovrebbe governare.\u003C\u002Fb> Questa separazione è cruciale. Il modello non dovrebbe essere l'autorità ultima che determina se la propria azione ad alto impatto proposta sia sicura.",{"data":514,"type":42},{"text":515,"level":230},"Dai Benchmark alla Fiducia Operativa",{"data":517,"type":217},{"text":518},"I benchmark rimangono utili. Ci dicono qualcosa sulle capacità, confrontano modelli, rilevano regressioni e aiutano a stimare le prestazioni attese. Ma la valutazione delle capacità e la fiducia operativa rispondono a domande diverse.",{"data":520,"type":217},{"text":521},"Un benchmark chiede: \u003Cb>Il sistema può fare questo?\u003C\u002Fb> La garanzia operativa chiede: \u003Cb>Possiamo permettere al sistema di fare questo qui, in queste condizioni, con questi permessi e conseguenze?\u003C\u002Fb>",{"data":523,"type":42},{"text":524,"level":230},"L'Affidabilità Dovrebbe Essere Misurata come Proprietà di Sistema",{"data":526,"type":248},{"items":527,"style":265},[528,529,530,531,532],"\u003Cb>Correttezza del risultato:\u003C\u002Fb> Il sistema ha prodotto il risultato atteso?","\u003Cb>Correttezza della traiettoria:\u003C\u002Fb> Ha seguito un percorso accettabile?","\u003Cb>Integrità del controllo:\u003C\u002Fb> Sono stati rispettati i confini di autorizzazione, policy e intervento?","\u003Cb>Recuperabilità:\u003C\u002Fb> I guasti possono essere contenuti, invertiti o riparati?","\u003Cb>Completezza delle evidenze:\u003C\u002Fb> L'esecuzione può essere ricostruita e verificata?",{"data":534,"type":278},{"code":535},"Affidabilità Operativa\n=\nRisultato × Traiettoria × Controllo × Recuperabilità × Evidenza",{"data":537,"type":217},{"text":538},"La moltiplicazione è intenzionale. Se una dimensione critica si avvicina a zero, un punteggio alto altrove non dovrebbe nasconderlo. Un output perfettamente corretto con zero integrità di autorizzazione non è un sistema affidabile all'80%. È un'esecuzione inaccettabile che per caso ha prodotto la risposta giusta.",{"data":540,"type":42},{"text":541,"level":230},"Il Successo è a Volte il Fallimento Più Pericoloso",{"data":543,"type":217},{"text":544},"I fallimenti attirano l'attenzione. Il successo spesso no. Questo rende le traiettorie di agente riuscite ma non controllate particolarmente pericolose. Un fallimento evidente crea un incidente. Un difetto nascosto nella traiettoria crea \u003Cb>fiducia\u003C\u002Fb>. E la fiducia espande l'autonomia.",{"data":546,"type":217},{"text":547},"Le organizzazioni dovrebbero quindi non solo indagare \u003Ci>Perché l'agente ha fallito?\u003C\u002Fi> Dovrebbero periodicamente chiedersi: \u003Cb>Perché l'agente ha avuto successo?\u003C\u002Fb> Ha avuto successo perché l'architettura ha vincolato e verificato in modo affidabile l'esecuzione, o perché questa volta non è andato storto nulla?",{"data":549,"type":42},{"text":550,"level":230},"Conclusione",{"data":552,"type":217},{"text":553},"L'industria si sta muovendo rapidamente dall'IA che \u003Cb>risponde\u003C\u002Fb> verso l'IA che \u003Cb>agisce\u003C\u002Fb>. Questa transizione cambia ciò che significa affidabilità. Per un sistema di risposta, valutare la risposta può spesso essere sufficiente. Per un sistema di azione, dobbiamo valutare il percorso.",{"data":555,"type":278},{"code":556},"Prompt ↓\nLa risposta diventa Intento ↓\nTraiettoria ↓\nAzioni ↓\nCambi di stato ↓\nEvidenza ↓\nRisultato",{"data":558,"type":217},{"text":559},"La risposta finale rimane importante, ma è solo la fine visibile di un sistema molto più grande. Una volta che all'IA viene permesso di influenzare il mondo reale, \u003Cb>il percorso verso la risposta diventa parte della risposta.\u003C\u002Fb>","2.31","Un output corretto non dimostra un ragionamento corretto, un'esecuzione sicura o un sistema affidabile.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-reliability-why-the-final-answer-is-not-enough-1788955466306-pl0qhz.webp","ai-agent-reliability-why-the-final-answer-is-not-enough-1788955466306-pl0qhz","PUBLISHED","2026-09-09T04:01:00.000Z","2026-09-09T12:01:07.219Z","2026-09-09T13:08:53.481Z",{"en":569,"de":570,"sr":571,"es":572,"fr":573,"it":574,"ru":575,"zh":576},"\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fde\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fsr\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fes\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Ffr\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fit\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fru\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fzh\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough",[578,582],{"id":579,"name":580,"slug":581},58,"Valutazione e gate di qualità","evaluation",{"id":583,"name":584,"slug":585},59,"Governance e audit","governance",{"id":587,"login":588,"email":589,"displayName":590},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[592,931],{"lang":593,"title":594,"content":595,"contentJson":596,"excerpt":930},"en","AI Agent Reliability: Why the Final Answer Is Not Enough","{\"time\":1788955485785,\"blocks\":[{\"data\":{\"text\":\"\u003Cb>Correct output does not prove correct reasoning, safe execution, or a trustworthy system.\u003C\u002Fb>\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"For years, AI evaluation has been dominated by a deceptively simple question: \u003Cb>Was the answer correct?\u003C\u002Fb> For a chatbot, this may sometimes be sufficient. For an agent capable of searching systems, reading data, calling tools, modifying state, executing workflows, writing files, interacting with APIs, or making decisions, it is not.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"An agent can produce the correct final answer while doing several things wrong on the way there. It can use the wrong source, misunderstand an instruction and later compensate for the mistake, access unnecessary information, execute an unauthorized intermediate action, silently recover from an error that should have triggered escalation, or leave behind side effects nobody noticed.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"That creates one of the central problems of agentic AI: \u003Cb>a correct outcome does not prove a correct trajectory.\u003C\u002Fb>\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"The Outcome Illusion\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Traditional software gives us an intuitive model of correctness. Input enters a deterministic or mostly deterministic system, logic is executed, output is produced, and tests verify expected behavior. LLM-based systems weaken this assumption. Agentic systems go further.\"},\"type\":\"paragraph\"},{\"data\":{\"items\":[\"model interpretation\",\"retrieved context\",\"tool selection\",\"intermediate observations\",\"external state\",\"previous actions\",\"model-generated plans\",\"permission boundaries\",\"retries and fallback behavior\",\"human interaction\"],\"style\":\"unordered\"},\"type\":\"list\"},{\"data\":{\"text\":\"Two executions starting from nearly identical inputs may reach the same result through very different paths. If evaluation observes only the final output, most of the system remains invisible.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Imagine an AI agent receives the instruction: \u003Ci>Update the customer's billing address.\u003C\u002Fi> The address is ultimately updated correctly. A conventional evaluation might classify the task as successful.\"},\"type\":\"paragraph\"},{\"data\":{\"items\":[\"The agent searches several unrelated customer records.\",\"It retrieves more personal information than required.\",\"It initially modifies the wrong account.\",\"It notices the mistake.\",\"It reverses the change.\",\"It updates the correct account.\",\"It reports success.\"],\"style\":\"ordered\"},\"type\":\"list\"},{\"data\":{\"text\":\"\u003Cb>Final state: correct. System behavior: unacceptable.\u003C\u002Fb> An outcome-only benchmark gives this execution a pass. A production assurance system should not.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"The Trajectory Is Part of the Product\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"This is why the \u003Cb>trajectory\u003C\u002Fb> of an AI agent must become a first-class engineering object. A trajectory is the sequence of relevant states and actions between the original request and the final result.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Intent → Context → Decision → Tool → Action → Observation → Decision → State change → Result\"},\"type\":\"code\"},{\"data\":{\"text\":\"Zachary J. Stevens develops this idea in \u003Ci>The Trajectory Is the System\u003C\u002Fi>, arguing that agentic evaluation must move beyond the final answer and examine the complete path of action through a changing environment.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"A correct outcome does not excuse an unacceptable trajectory.\",\"caption\":\"Zachary J. Stevens, The Trajectory Is the System\",\"alignment\":\"left\"},\"type\":\"quote\"},{\"data\":{\"link\":\"https:\u002F\u002Fzacharyjstevens.com\u002Fdispatches\u002Fvanguard-signal\u002F009-the-trajectory-is-the-system\u002F\",\"meta\":{\"image\":{},\"title\":\"The Trajectory Is the System\",\"description\":\"Zachary J. Stevens — DFEI.009 on evaluating agentic systems by their complete trajectory rather than only the final outcome.\"}},\"type\":\"linkTool\"},{\"data\":{\"text\":\"The distinction matters enormously. Reliability is therefore not simply \u003Cb>correct output\u003C\u002Fb>. It is closer to \u003Cb>acceptable outcome + acceptable trajectory + recoverability + evidence\u003C\u002Fb>.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"A Correct Answer Can Hide a Broken System\",\"level\":2},\"type\":\"header\"},{\"data\":{\"content\":[[\"Agent\",\"Final result\",\"Execution\"],[\"A\",\"Correct\",\"Correct path\"],[\"B\",\"Correct\",\"Unsafe path\"],[\"C\",\"Incorrect\",\"Safe failure\"],[\"D\",\"Incorrect\",\"Unsafe failure\"]],\"withHeadings\":true},\"type\":\"table\"},{\"data\":{\"text\":\"Most benchmark-driven evaluation strongly rewards A and B and penalizes C and D. Operationally, however, \u003Cb>B can be more dangerous than C\u003C\u002Fb>. Agent C may recognize uncertainty, stop execution and request human review. Agent B may confidently produce correct results while violating assumptions that nobody is monitoring.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"successful output → increased trust → broader permissions → more automation → larger blast radius\"},\"type\":\"code\"},{\"data\":{\"text\":\"We Need Evidence, Not Confidence\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"One of the biggest mistakes in AI adoption is treating model confidence, user satisfaction or historical success rate as evidence of system reliability. They are not equivalent.\"},\"type\":\"paragraph\"},{\"data\":{\"items\":[\"What did the agent receive?\",\"What context did it retrieve?\",\"Which tools did it call?\",\"Why was the action allowed?\",\"What state existed before the action?\",\"What changed?\",\"Which intermediate failures occurred?\",\"Was anything retried?\",\"Was human approval required?\",\"Could execution have been stopped?\",\"Can the action be reversed?\",\"Which model, prompt and tool versions were involved?\"],\"style\":\"unordered\"},\"type\":\"list\"},{\"data\":{\"text\":\"Without these answers, there is no serious operational assurance. There is only an output. Observability and evidence must therefore be designed into agent architecture rather than added after deployment.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Logging Is Not the Same as Control\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Organizations often respond: \u003Ci>Everything is logged.\u003C\u002Fi> Good. But logging alone does not control anything. A log tells you what happened. A control determines whether something \u003Cb>may happen\u003C\u002Fb>.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Agent requests DELETE \u002Fcustomer\u002F123 ↓\\nAction logged ↓\\nDELETE executed\"},\"type\":\"code\"},{\"data\":{\"text\":\"That gives observability. Compare it with:\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Agent requests DELETE \u002Fcustomer\u002F123 ↓\\nPolicy evaluation ↓\\nCurrent identity verified ↓\\nCurrent action parameters checked ↓\\nRisk threshold evaluated ↓\\nHuman approval if required ↓\\nAction executed ↓\\nResult verified ↓\\nEvidence stored\"},\"type\":\"code\"},{\"data\":{\"text\":\"Now we are approaching a control system. The difference is architectural, not cosmetic.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Permission Is Necessary — but It Is Not Assurance\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Suppose an agent has permission to send email. Access control answers: \u003Cb>Can this agent send email?\u003C\u002Fb> It does not answer: \u003Cb>Should this particular email be sent to this particular person with this particular attachment right now?\u003C\u002Fb>\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"CAPABILITY CONTROL\\nWhat is the agent technically allowed to do? + ACTION ASSURANCE\\nIs this specific action appropriate in the current state?\"},\"type\":\"code\"},{\"data\":{\"text\":\"RBAC, OAuth scopes, API permissions and agent identities define the space of possible actions. They do not prove that an action inside that space is appropriate. Strong agent architecture needs both layers.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"The First Wrong Step Matters\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"When an agent fails, the final incorrect action is often not where the failure started. The real failure may have happened much earlier.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Wrong retrieval ↓\\nWrong assumption ↓\\nPlausible reasoning ↓\\nValid tool call ↓\\nWrong action\"},\"type\":\"code\"},{\"data\":{\"text\":\"If we investigate only the final action, we fix the symptom. If we inspect the trajectory, we can identify the \u003Cb>first wrong step\u003C\u002Fb>. That turns an unattributable failure into a concrete engineering problem.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Agent Testing Must Move Beyond Prompt Testing\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Prompts matter, but production agent behavior emerges from an entire system.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"MODEL\\n+\\nSYSTEM PROMPT\\n+\\nCONTEXT\\n+\\nMEMORY\\n+\\nRETRIEVAL\\n+\\nTOOLS\\n+\\nPERMISSIONS\\n+\\nWORKFLOW\\n+\\nEXTERNAL STATE\\n+\\nCONTROL LOGIC\"},\"type\":\"code\"},{\"data\":{\"text\":\"Changing any one of these can change the trajectory. Therefore versioning only the prompt is insufficient.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"model_version\\nprompt_version\\ntool_version\\npolicy_version\\nretrieval_version\\nworkflow_version\\nenvironment_state\\nexecution_id\"},\"type\":\"code\"},{\"data\":{\"text\":\"Acceptance Criteria for Agents Must Include Behavior\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Traditional acceptance criteria often look like this: \u003Ci>Given X, the system produces Y.\u003C\u002Fi> For agentic systems, that is incomplete. Acceptance criteria should also define constraints on the trajectory.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Outcome\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"The customer's address is updated correctly.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Authorization\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"The agent modifies only the explicitly selected customer.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Data access\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"No unrelated customer records are accessed.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Tools\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"Only approved CRM operations are used.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Verification\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"The new address is read back and compared with the requested value.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Failure\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"Ambiguous identity resolution stops execution.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Human authority\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"A human can reject the modification before execution when risk thresholds require approval.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Evidence\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"The execution leaves a trace sufficient to reconstruct the decision and state transition.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Recovery\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"The previous value remains recoverable.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Human-in-the-Loop Is Not Enough\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Adding a human approval box does not automatically solve the problem. A human can only control an agent if the person has visibility, authority, time, context and recovery capability.\"},\"type\":\"paragraph\"},{\"data\":{\"items\":[\"\u003Cb>Visibility:\u003C\u002Fb> enough information to understand what is happening.\",\"\u003Cb>Authority:\u003C\u002Fb> actual ability to stop or modify the action.\",\"\u003Cb>Time:\u003C\u002Fb> intervention before the consequence occurs.\",\"\u003Cb>Context:\u003C\u002Fb> sufficient evidence to make the decision.\",\"\u003Cb>Recovery capability:\u003C\u002Fb> ability to reverse or repair the action.\"],\"style\":\"unordered\"},\"type\":\"list\"},{\"data\":{\"text\":\"A user clicking \u003Cb>Approve\u003C\u002Fb> on something they cannot meaningfully inspect is not strong governance. It is approval theater.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Rollback Must Become a Native AI Capability\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Traditional software deployment has taught us something valuable: \u003Cb>Never deploy what you cannot roll back.\u003C\u002Fb> We should apply the same principle to agentic actions.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"REVERSIBLE\\nCan automatically undo. COMPENSATABLE\\nCannot undo directly but can execute a compensating action. IRREVERSIBLE\\nCannot reliably restore the previous state.\"},\"type\":\"code\"},{\"data\":{\"text\":\"The higher the irreversibility, the stronger the control requirement should become.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Read public document → low consequence\\nCreate draft → reversible\\nModify CRM record → reversible but consequential\\nSend external email → practically irreversible\\nTransfer money → high consequence\\nDelete production data → potentially catastrophic\"},\"type\":\"code\"},{\"data\":{\"text\":\"The Agent Needs a Control Plane\",\"level\":2},\"type\":\"header\"},{\"data\":{\"code\":\"USER \u002F SYSTEM INTENT │ ▼ AI AGENT │ proposed action │ ▼ ┌───────────────────┐ │ CONTROL PLANE │ ├───────────────────┤ │ Identity │ │ Authorization │ │ Policy │ │ Risk │ │ State │ │ Evidence │ │ Human authority │ │ Rollback │ └───────────────────┘ │ approved? \u002F \\\\ NO YES │ │ STOP ▼ TOOL │ ▼ STATE CHANGE │ ▼ VERIFICATION\"},\"type\":\"code\"},{\"data\":{\"text\":\"\u003Cb>The LLM should propose. The control plane should govern.\u003C\u002Fb> That separation is crucial. The model should not be the ultimate authority determining whether its own proposed high-impact action is safe.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"From Benchmarks to Operational Trust\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Benchmarks remain useful. They tell us about capability, compare models, detect regressions and help estimate expected performance. But capability evaluation and operational trust answer different questions.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"A benchmark asks: \u003Cb>Can the system do this?\u003C\u002Fb> Operational assurance asks: \u003Cb>Can we allow the system to do this here, under these conditions, with these permissions and consequences?\u003C\u002Fb>\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Reliability Should Be Measured as a System Property\",\"level\":2},\"type\":\"header\"},{\"data\":{\"items\":[\"\u003Cb>Outcome correctness:\u003C\u002Fb> Did the system produce the expected result?\",\"\u003Cb>Trajectory correctness:\u003C\u002Fb> Did it follow an acceptable path?\",\"\u003Cb>Control integrity:\u003C\u002Fb> Were authorization, policy and intervention boundaries respected?\",\"\u003Cb>Recoverability:\u003C\u002Fb> Can failures be contained, reversed or repaired?\",\"\u003Cb>Evidence completeness:\u003C\u002Fb> Can the execution be reconstructed and audited?\"],\"style\":\"ordered\"},\"type\":\"list\"},{\"data\":{\"code\":\"Operational Reliability\\n=\\nOutcome × Trajectory × Control × Recoverability × Evidence\"},\"type\":\"code\"},{\"data\":{\"text\":\"The multiplication is intentional. If one critical dimension approaches zero, a high score elsewhere should not hide it. A perfectly correct output with zero authorization integrity is not an 80% reliable system. It is an unacceptable execution that happened to produce the right answer.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Success Is Sometimes the Most Dangerous Failure\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Failures attract attention. Success often does not. That makes successful but uncontrolled agent trajectories particularly dangerous. An obvious failure creates an incident. A hidden trajectory defect creates \u003Cb>confidence\u003C\u002Fb>. And confidence expands autonomy.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Organizations should therefore not only investigate \u003Ci>Why did the agent fail?\u003C\u002Fi> They should periodically ask: \u003Cb>Why did the agent succeed?\u003C\u002Fb> Did it succeed because the architecture reliably constrained and verified the execution, or because nothing went wrong this time?\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Conclusion\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"The industry is moving rapidly from AI that \u003Cb>answers\u003C\u002Fb> toward AI that \u003Cb>acts\u003C\u002Fb>. That transition changes what reliability means. For an answer system, evaluating the answer may often be sufficient. For an action system, we must evaluate the path.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Prompt ↓\\nResponse becomes Intent ↓\\nTrajectory ↓\\nActions ↓\\nState changes ↓\\nEvidence ↓\\nOutcome\"},\"type\":\"code\"},{\"data\":{\"text\":\"The final answer remains important, but it is only the visible end of a much larger system. Once AI is allowed to affect the real world, \u003Cb>the path to the answer becomes part of the answer.\u003C\u002Fb>\"},\"type\":\"paragraph\"}],\"version\":\"2.31.0\"}",{"time":597,"blocks":598,"version":929},1788955485785,[599,602,605,608,611,614,617,630,633,636,646,649,652,655,658,661,665,671,674,677,694,697,700,703,706,721,724,727,730,733,736,739,742,745,748,751,754,757,760,763,766,769,772,775,778,781,784,787,790,793,796,799,802,805,808,811,814,817,820,823,826,829,832,835,838,841,844,847,855,858,861,864,867,870,873,876,879,882,885,888,891,894,902,905,908,911,914,917,920,923,926],{"data":600,"type":217},{"text":601},"\u003Cb>Correct output does not prove correct reasoning, safe execution, or a trustworthy system.\u003C\u002Fb>",{"data":603,"type":217},{"text":604},"For years, AI evaluation has been dominated by a deceptively simple question: \u003Cb>Was the answer correct?\u003C\u002Fb> For a chatbot, this may sometimes be sufficient. For an agent capable of searching systems, reading data, calling tools, modifying state, executing workflows, writing files, interacting with APIs, or making decisions, it is not.",{"data":606,"type":217},{"text":607},"An agent can produce the correct final answer while doing several things wrong on the way there. It can use the wrong source, misunderstand an instruction and later compensate for the mistake, access unnecessary information, execute an unauthorized intermediate action, silently recover from an error that should have triggered escalation, or leave behind side effects nobody noticed.",{"data":609,"type":217},{"text":610},"That creates one of the central problems of agentic AI: \u003Cb>a correct outcome does not prove a correct trajectory.\u003C\u002Fb>",{"data":612,"type":42},{"text":613,"level":230},"The Outcome Illusion",{"data":615,"type":217},{"text":616},"Traditional software gives us an intuitive model of correctness. Input enters a deterministic or mostly deterministic system, logic is executed, output is produced, and tests verify expected behavior. LLM-based systems weaken this assumption. Agentic systems go further.",{"data":618,"type":248},{"items":619,"style":247},[620,621,622,623,624,625,626,627,628,629],"model interpretation","retrieved context","tool selection","intermediate observations","external state","previous actions","model-generated plans","permission boundaries","retries and fallback behavior","human interaction",{"data":631,"type":217},{"text":632},"Two executions starting from nearly identical inputs may reach the same result through very different paths. If evaluation observes only the final output, most of the system remains invisible.",{"data":634,"type":217},{"text":635},"Imagine an AI agent receives the instruction: \u003Ci>Update the customer's billing address.\u003C\u002Fi> The address is ultimately updated correctly. A conventional evaluation might classify the task as successful.",{"data":637,"type":248},{"items":638,"style":265},[639,640,641,642,643,644,645],"The agent searches several unrelated customer records.","It retrieves more personal information than required.","It initially modifies the wrong account.","It notices the mistake.","It reverses the change.","It updates the correct account.","It reports success.",{"data":647,"type":217},{"text":648},"\u003Cb>Final state: correct. System behavior: unacceptable.\u003C\u002Fb> An outcome-only benchmark gives this execution a pass. A production assurance system should not.",{"data":650,"type":42},{"text":651,"level":230},"The Trajectory Is Part of the Product",{"data":653,"type":217},{"text":654},"This is why the \u003Cb>trajectory\u003C\u002Fb> of an AI agent must become a first-class engineering object. A trajectory is the sequence of relevant states and actions between the original request and the final result.",{"data":656,"type":278},{"code":657},"Intent → Context → Decision → Tool → Action → Observation → Decision → State change → Result",{"data":659,"type":217},{"text":660},"Zachary J. Stevens develops this idea in \u003Ci>The Trajectory Is the System\u003C\u002Fi>, arguing that agentic evaluation must move beyond the final answer and examine the complete path of action through a changing environment.",{"data":662,"type":287},{"text":663,"caption":664,"alignment":286},"A correct outcome does not excuse an unacceptable trajectory.","Zachary J. Stevens, The Trajectory Is the System",{"data":666,"type":295},{"link":290,"meta":667},{"image":668,"title":669,"description":670},{},"The Trajectory Is the System","Zachary J. Stevens — DFEI.009 on evaluating agentic systems by their complete trajectory rather than only the final outcome.",{"data":672,"type":217},{"text":673},"The distinction matters enormously. Reliability is therefore not simply \u003Cb>correct output\u003C\u002Fb>. It is closer to \u003Cb>acceptable outcome + acceptable trajectory + recoverability + evidence\u003C\u002Fb>.",{"data":675,"type":42},{"text":676,"level":230},"A Correct Answer Can Hide a Broken System",{"data":678,"type":323},{"content":679,"withHeadings":14},[680,684,687,689,692],[681,682,683],"Agent","Final result","Execution",[310,685,686],"Correct","Correct path",[314,685,688],"Unsafe path",[317,690,691],"Incorrect","Safe failure",[321,690,693],"Unsafe failure",{"data":695,"type":217},{"text":696},"Most benchmark-driven evaluation strongly rewards A and B and penalizes C and D. Operationally, however, \u003Cb>B can be more dangerous than C\u003C\u002Fb>. Agent C may recognize uncertainty, stop execution and request human review. Agent B may confidently produce correct results while violating assumptions that nobody is monitoring.",{"data":698,"type":278},{"code":699},"successful output → increased trust → broader permissions → more automation → larger blast radius",{"data":701,"type":42},{"text":702,"level":230},"We Need Evidence, Not Confidence",{"data":704,"type":217},{"text":705},"One of the biggest mistakes in AI adoption is treating model confidence, user satisfaction or historical success rate as evidence of system reliability. They are not equivalent.",{"data":707,"type":248},{"items":708,"style":247},[709,710,711,712,713,714,715,716,717,718,719,720],"What did the agent receive?","What context did it retrieve?","Which tools did it call?","Why was the action allowed?","What state existed before the action?","What changed?","Which intermediate failures occurred?","Was anything retried?","Was human approval required?","Could execution have been stopped?","Can the action be reversed?","Which model, prompt and tool versions were involved?",{"data":722,"type":217},{"text":723},"Without these answers, there is no serious operational assurance. There is only an output. Observability and evidence must therefore be designed into agent architecture rather than added after deployment.",{"data":725,"type":42},{"text":726,"level":230},"Logging Is Not the Same as Control",{"data":728,"type":217},{"text":729},"Organizations often respond: \u003Ci>Everything is logged.\u003C\u002Fi> Good. But logging alone does not control anything. A log tells you what happened. A control determines whether something \u003Cb>may happen\u003C\u002Fb>.",{"data":731,"type":278},{"code":732},"Agent requests DELETE \u002Fcustomer\u002F123 ↓\nAction logged ↓\nDELETE executed",{"data":734,"type":217},{"text":735},"That gives observability. Compare it with:",{"data":737,"type":278},{"code":738},"Agent requests DELETE \u002Fcustomer\u002F123 ↓\nPolicy evaluation ↓\nCurrent identity verified ↓\nCurrent action parameters checked ↓\nRisk threshold evaluated ↓\nHuman approval if required ↓\nAction executed ↓\nResult verified ↓\nEvidence stored",{"data":740,"type":217},{"text":741},"Now we are approaching a control system. The difference is architectural, not cosmetic.",{"data":743,"type":42},{"text":744,"level":230},"Permission Is Necessary — but It Is Not Assurance",{"data":746,"type":217},{"text":747},"Suppose an agent has permission to send email. Access control answers: \u003Cb>Can this agent send email?\u003C\u002Fb> It does not answer: \u003Cb>Should this particular email be sent to this particular person with this particular attachment right now?\u003C\u002Fb>",{"data":749,"type":278},{"code":750},"CAPABILITY CONTROL\nWhat is the agent technically allowed to do? + ACTION ASSURANCE\nIs this specific action appropriate in the current state?",{"data":752,"type":217},{"text":753},"RBAC, OAuth scopes, API permissions and agent identities define the space of possible actions. They do not prove that an action inside that space is appropriate. Strong agent architecture needs both layers.",{"data":755,"type":42},{"text":756,"level":230},"The First Wrong Step Matters",{"data":758,"type":217},{"text":759},"When an agent fails, the final incorrect action is often not where the failure started. The real failure may have happened much earlier.",{"data":761,"type":278},{"code":762},"Wrong retrieval ↓\nWrong assumption ↓\nPlausible reasoning ↓\nValid tool call ↓\nWrong action",{"data":764,"type":217},{"text":765},"If we investigate only the final action, we fix the symptom. If we inspect the trajectory, we can identify the \u003Cb>first wrong step\u003C\u002Fb>. That turns an unattributable failure into a concrete engineering problem.",{"data":767,"type":42},{"text":768,"level":230},"Agent Testing Must Move Beyond Prompt Testing",{"data":770,"type":217},{"text":771},"Prompts matter, but production agent behavior emerges from an entire system.",{"data":773,"type":278},{"code":774},"MODEL\n+\nSYSTEM PROMPT\n+\nCONTEXT\n+\nMEMORY\n+\nRETRIEVAL\n+\nTOOLS\n+\nPERMISSIONS\n+\nWORKFLOW\n+\nEXTERNAL STATE\n+\nCONTROL LOGIC",{"data":776,"type":217},{"text":777},"Changing any one of these can change the trajectory. Therefore versioning only the prompt is insufficient.",{"data":779,"type":278},{"code":780},"model_version\nprompt_version\ntool_version\npolicy_version\nretrieval_version\nworkflow_version\nenvironment_state\nexecution_id",{"data":782,"type":42},{"text":783,"level":230},"Acceptance Criteria for Agents Must Include Behavior",{"data":785,"type":217},{"text":786},"Traditional acceptance criteria often look like this: \u003Ci>Given X, the system produces Y.\u003C\u002Fi> For agentic systems, that is incomplete. Acceptance criteria should also define constraints on the trajectory.",{"data":788,"type":42},{"text":789,"level":420},"Outcome",{"data":791,"type":217},{"text":792},"The customer's address is updated correctly.",{"data":794,"type":42},{"text":795,"level":420},"Authorization",{"data":797,"type":217},{"text":798},"The agent modifies only the explicitly selected customer.",{"data":800,"type":42},{"text":801,"level":420},"Data access",{"data":803,"type":217},{"text":804},"No unrelated customer records are accessed.",{"data":806,"type":42},{"text":807,"level":420},"Tools",{"data":809,"type":217},{"text":810},"Only approved CRM operations are used.",{"data":812,"type":42},{"text":813,"level":420},"Verification",{"data":815,"type":217},{"text":816},"The new address is read back and compared with the requested value.",{"data":818,"type":42},{"text":819,"level":420},"Failure",{"data":821,"type":217},{"text":822},"Ambiguous identity resolution stops execution.",{"data":824,"type":42},{"text":825,"level":420},"Human authority",{"data":827,"type":217},{"text":828},"A human can reject the modification before execution when risk thresholds require approval.",{"data":830,"type":42},{"text":831,"level":420},"Evidence",{"data":833,"type":217},{"text":834},"The execution leaves a trace sufficient to reconstruct the decision and state transition.",{"data":836,"type":42},{"text":837,"level":420},"Recovery",{"data":839,"type":217},{"text":840},"The previous value remains recoverable.",{"data":842,"type":42},{"text":843,"level":230},"Human-in-the-Loop Is Not Enough",{"data":845,"type":217},{"text":846},"Adding a human approval box does not automatically solve the problem. A human can only control an agent if the person has visibility, authority, time, context and recovery capability.",{"data":848,"type":248},{"items":849,"style":247},[850,851,852,853,854],"\u003Cb>Visibility:\u003C\u002Fb> enough information to understand what is happening.","\u003Cb>Authority:\u003C\u002Fb> actual ability to stop or modify the action.","\u003Cb>Time:\u003C\u002Fb> intervention before the consequence occurs.","\u003Cb>Context:\u003C\u002Fb> sufficient evidence to make the decision.","\u003Cb>Recovery capability:\u003C\u002Fb> ability to reverse or repair the action.",{"data":856,"type":217},{"text":857},"A user clicking \u003Cb>Approve\u003C\u002Fb> on something they cannot meaningfully inspect is not strong governance. It is approval theater.",{"data":859,"type":42},{"text":860,"level":230},"Rollback Must Become a Native AI Capability",{"data":862,"type":217},{"text":863},"Traditional software deployment has taught us something valuable: \u003Cb>Never deploy what you cannot roll back.\u003C\u002Fb> We should apply the same principle to agentic actions.",{"data":865,"type":278},{"code":866},"REVERSIBLE\nCan automatically undo. COMPENSATABLE\nCannot undo directly but can execute a compensating action. IRREVERSIBLE\nCannot reliably restore the previous state.",{"data":868,"type":217},{"text":869},"The higher the irreversibility, the stronger the control requirement should become.",{"data":871,"type":278},{"code":872},"Read public document → low consequence\nCreate draft → reversible\nModify CRM record → reversible but consequential\nSend external email → practically irreversible\nTransfer money → high consequence\nDelete production data → potentially catastrophic",{"data":874,"type":42},{"text":875,"level":230},"The Agent Needs a Control Plane",{"data":877,"type":278},{"code":878},"USER \u002F SYSTEM INTENT │ ▼ AI AGENT │ proposed action │ ▼ ┌───────────────────┐ │ CONTROL PLANE │ ├───────────────────┤ │ Identity │ │ Authorization │ │ Policy │ │ Risk │ │ State │ │ Evidence │ │ Human authority │ │ Rollback │ └───────────────────┘ │ approved? \u002F \\ NO YES │ │ STOP ▼ TOOL │ ▼ STATE CHANGE │ ▼ VERIFICATION",{"data":880,"type":217},{"text":881},"\u003Cb>The LLM should propose. The control plane should govern.\u003C\u002Fb> That separation is crucial. The model should not be the ultimate authority determining whether its own proposed high-impact action is safe.",{"data":883,"type":42},{"text":884,"level":230},"From Benchmarks to Operational Trust",{"data":886,"type":217},{"text":887},"Benchmarks remain useful. They tell us about capability, compare models, detect regressions and help estimate expected performance. But capability evaluation and operational trust answer different questions.",{"data":889,"type":217},{"text":890},"A benchmark asks: \u003Cb>Can the system do this?\u003C\u002Fb> Operational assurance asks: \u003Cb>Can we allow the system to do this here, under these conditions, with these permissions and consequences?\u003C\u002Fb>",{"data":892,"type":42},{"text":893,"level":230},"Reliability Should Be Measured as a System Property",{"data":895,"type":248},{"items":896,"style":265},[897,898,899,900,901],"\u003Cb>Outcome correctness:\u003C\u002Fb> Did the system produce the expected result?","\u003Cb>Trajectory correctness:\u003C\u002Fb> Did it follow an acceptable path?","\u003Cb>Control integrity:\u003C\u002Fb> Were authorization, policy and intervention boundaries respected?","\u003Cb>Recoverability:\u003C\u002Fb> Can failures be contained, reversed or repaired?","\u003Cb>Evidence completeness:\u003C\u002Fb> Can the execution be reconstructed and audited?",{"data":903,"type":278},{"code":904},"Operational Reliability\n=\nOutcome × Trajectory × Control × Recoverability × Evidence",{"data":906,"type":217},{"text":907},"The multiplication is intentional. If one critical dimension approaches zero, a high score elsewhere should not hide it. A perfectly correct output with zero authorization integrity is not an 80% reliable system. It is an unacceptable execution that happened to produce the right answer.",{"data":909,"type":42},{"text":910,"level":230},"Success Is Sometimes the Most Dangerous Failure",{"data":912,"type":217},{"text":913},"Failures attract attention. Success often does not. That makes successful but uncontrolled agent trajectories particularly dangerous. An obvious failure creates an incident. A hidden trajectory defect creates \u003Cb>confidence\u003C\u002Fb>. And confidence expands autonomy.",{"data":915,"type":217},{"text":916},"Organizations should therefore not only investigate \u003Ci>Why did the agent fail?\u003C\u002Fi> They should periodically ask: \u003Cb>Why did the agent succeed?\u003C\u002Fb> Did it succeed because the architecture reliably constrained and verified the execution, or because nothing went wrong this time?",{"data":918,"type":42},{"text":919,"level":230},"Conclusion",{"data":921,"type":217},{"text":922},"The industry is moving rapidly from AI that \u003Cb>answers\u003C\u002Fb> toward AI that \u003Cb>acts\u003C\u002Fb>. That transition changes what reliability means. For an answer system, evaluating the answer may often be sufficient. For an action system, we must evaluate the path.",{"data":924,"type":278},{"code":925},"Prompt ↓\nResponse becomes Intent ↓\nTrajectory ↓\nActions ↓\nState changes ↓\nEvidence ↓\nOutcome",{"data":927,"type":217},{"text":928},"The final answer remains important, but it is only the visible end of a much larger system. Once AI is allowed to affect the real world, \u003Cb>the path to the answer becomes part of the answer.\u003C\u002Fb>","2.31.0","Correct output does not prove correct reasoning, safe execution, or a trustworthy system.",{"lang":7,"title":208,"content":210,"contentJson":932,"excerpt":561},{"time":212,"blocks":933,"version":560},[934,936,938,940,942,944,946,949,951,953,956,958,960,962,964,966,968,972,974,976,984,986,988,990,992,995,997,999,1001,1003,1005,1007,1009,1011,1013,1015,1017,1019,1021,1023,1025,1027,1029,1031,1033,1035,1037,1039,1041,1043,1045,1047,1049,1051,1053,1055,1057,1059,1061,1063,1065,1067,1069,1071,1073,1075,1077,1079,1082,1084,1086,1088,1090,1092,1094,1096,1098,1100,1102,1104,1106,1108,1111,1113,1115,1117,1119,1121,1123,1125,1127],{"data":935,"type":217},{"text":216},{"data":937,"type":217},{"text":220},{"data":939,"type":217},{"text":223},{"data":941,"type":217},{"text":226},{"data":943,"type":42},{"text":229,"level":230},{"data":945,"type":217},{"text":233},{"data":947,"type":248},{"items":948,"style":247},[237,238,239,240,241,242,243,244,245,246],{"data":950,"type":217},{"text":251},{"data":952,"type":217},{"text":254},{"data":954,"type":248},{"items":955,"style":265},[258,259,260,261,262,263,264],{"data":957,"type":217},{"text":268},{"data":959,"type":42},{"text":271,"level":230},{"data":961,"type":217},{"text":274},{"data":963,"type":278},{"code":277},{"data":965,"type":217},{"text":281},{"data":967,"type":287},{"text":284,"caption":285,"alignment":286},{"data":969,"type":295},{"link":290,"meta":970},{"image":971,"title":293,"description":294},{},{"data":973,"type":217},{"text":298},{"data":975,"type":42},{"text":301,"level":230},{"data":977,"type":323},{"content":978,"withHeadings":14},[979,980,981,982,983],[306,307,308],[310,311,312],[314,311,315],[317,318,319],[321,318,322],{"data":985,"type":217},{"text":326},{"data":987,"type":278},{"code":329},{"data":989,"type":42},{"text":332,"level":230},{"data":991,"type":217},{"text":335},{"data":993,"type":248},{"items":994,"style":247},[339,340,341,342,343,344,345,346,347,348,349,350],{"data":996,"type":217},{"text":353},{"data":998,"type":42},{"text":356,"level":230},{"data":1000,"type":217},{"text":359},{"data":1002,"type":278},{"code":362},{"data":1004,"type":217},{"text":365},{"data":1006,"type":278},{"code":368},{"data":1008,"type":217},{"text":371},{"data":1010,"type":42},{"text":374,"level":230},{"data":1012,"type":217},{"text":377},{"data":1014,"type":278},{"code":380},{"data":1016,"type":217},{"text":383},{"data":1018,"type":42},{"text":386,"level":230},{"data":1020,"type":217},{"text":389},{"data":1022,"type":278},{"code":392},{"data":1024,"type":217},{"text":395},{"data":1026,"type":42},{"text":398,"level":230},{"data":1028,"type":217},{"text":401},{"data":1030,"type":278},{"code":404},{"data":1032,"type":217},{"text":407},{"data":1034,"type":278},{"code":410},{"data":1036,"type":42},{"text":413,"level":230},{"data":1038,"type":217},{"text":416},{"data":1040,"type":42},{"text":419,"level":420},{"data":1042,"type":217},{"text":423},{"data":1044,"type":42},{"text":426,"level":420},{"data":1046,"type":217},{"text":429},{"data":1048,"type":42},{"text":432,"level":420},{"data":1050,"type":217},{"text":435},{"data":1052,"type":42},{"text":438,"level":420},{"data":1054,"type":217},{"text":441},{"data":1056,"type":42},{"text":444,"level":420},{"data":1058,"type":217},{"text":447},{"data":1060,"type":42},{"text":450,"level":420},{"data":1062,"type":217},{"text":453},{"data":1064,"type":42},{"text":456,"level":420},{"data":1066,"type":217},{"text":459},{"data":1068,"type":42},{"text":462,"level":420},{"data":1070,"type":217},{"text":465},{"data":1072,"type":42},{"text":468,"level":420},{"data":1074,"type":217},{"text":471},{"data":1076,"type":42},{"text":474,"level":230},{"data":1078,"type":217},{"text":477},{"data":1080,"type":248},{"items":1081,"style":247},[481,482,483,484,485],{"data":1083,"type":217},{"text":488},{"data":1085,"type":42},{"text":491,"level":230},{"data":1087,"type":217},{"text":494},{"data":1089,"type":278},{"code":497},{"data":1091,"type":217},{"text":500},{"data":1093,"type":278},{"code":503},{"data":1095,"type":42},{"text":506,"level":230},{"data":1097,"type":278},{"code":509},{"data":1099,"type":217},{"text":512},{"data":1101,"type":42},{"text":515,"level":230},{"data":1103,"type":217},{"text":518},{"data":1105,"type":217},{"text":521},{"data":1107,"type":42},{"text":524,"level":230},{"data":1109,"type":248},{"items":1110,"style":265},[528,529,530,531,532],{"data":1112,"type":278},{"code":535},{"data":1114,"type":217},{"text":538},{"data":1116,"type":42},{"text":541,"level":230},{"data":1118,"type":217},{"text":544},{"data":1120,"type":217},{"text":547},{"data":1122,"type":42},{"text":550,"level":230},{"data":1124,"type":217},{"text":553},{"data":1126,"type":278},{"code":556},{"data":1128,"type":217},{"text":559},"Post erfolgreich abgerufen",{"items":1131,"source":1202,"manualIds":1203,"manualMatchedIds":1204},[1132,1139,1146,1153,1160,1167,1174,1181,1188,1195],{"id":1133,"slug":1134,"title":1135,"excerpt":1136,"featuredImage":1137,"publishedAt":1138},"479","where-does-an-llm-get-its-data-rag-data-sources-in-python","Da dove prende i dati un LLM? Fonti di dati RAG in Python","Un LLM non conosce magicamente i tuoi file, database o API. Questa continuazione pratica della serie RAG mostra, con semplice Python, come i dati esterni diventano prove recuperabili: dai file di testo e SQL alla ricerca full-text, agli embedding, all'assemblaggio del contesto e alla chiamata finale all'LLM.","\u002Fuploads\u002F2026\u002F09\u002Fwhere-does-an-llm-get-its-data-rag-data-sources-in-python-1790517200521-nfsi5i.webp","2026-09-27T05:51:00.000Z",{"id":1140,"slug":1141,"title":1142,"excerpt":1143,"featuredImage":1144,"publishedAt":1145},"469","rag-failed-but-which-layer-actually-failed-a-diagnostic-method","RAG non riuscito — Ma quale livello ha effettivamente fallito? Un metodo diagnostico","Quando una risposta RAG è sbagliata, dare la colpa al recupero o al modello è troppo vago. Questo metodo diagnostico isola la copertura delle fonti, la costruzione della query, il recupero, il ranking, l'assemblaggio del contesto, la generazione, l'attribuzione delle evidenze e l'aggiornamento—così il guasto effettivo può essere riprodotto e corretto.","\u002Fuploads\u002F2026\u002F09\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method-1790350847177-pior4c.webp","2026-09-24T19:39:00.000Z",{"id":1147,"slug":1148,"title":1149,"excerpt":1150,"featuredImage":1151,"publishedAt":1152},"459","ollama-is-not-the-product-building-production-ready-open-llm-applications","Ollama non è il prodotto: costruire applicazioni Open-LLM pronte per la produzione","Eseguire un modello locale con Ollama è facile. Costruire un'applicazione Open-LLM pronta per la produzione è più difficile: richiede RAG, controllo degli accessi, astrazione del provider, valutazione, logging, disciplina di deployment e un livello applicativo controllato attorno al modello.","\u002Fuploads\u002F2026\u002F06\u002Follama-is-not-the-product-building-production-ready-open-llm-applications-1782679361640-h0usqf.webp","2026-06-28T16:39:00.000Z",{"id":1154,"slug":1155,"title":1156,"excerpt":1157,"featuredImage":1158,"publishedAt":1159},"364","tipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung","Padroneggiare il Flusso di Lavoro SEO: Strategie di Ottimizzazione Essenziali per la Crescita Organica","Un flusso di lavoro SEO strutturato è fondamentale per una crescita organica sostenibile. Scopri le dieci strategie fondamentali, dalla ricerca di parole chiave e dall'ottimizzazione tecnica alla qualità dei contenuti e all'analisi delle prestazioni.","\u002Fuploads\u002F2026\u002F03\u002Ftipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung-1774866098131-hwkzrg.webp","2024-01-26T06:35:00.000Z",{"id":1161,"slug":1162,"title":1163,"excerpt":1164,"featuredImage":1165,"publishedAt":1166},"477","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","Agenti per l'uso del computer: perché una demo di successo può comunque essere un sistema inaffidabile","Gli agenti computer-use possono ora completare impressionanti flussi di lavoro su browser e desktop, ma una singola esecuzione riuscita dimostra la capacità—non l'affidabilità. Questo articolo mostra come testare la ripetibilità, la robustezza ambientale, il controllo a lungo orizzonte, la consapevolezza dello stato, la verifica dei risultati e la gestione sicura degli obiettivi.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","2026-09-25T12:13:00.000Z",{"id":1168,"slug":1169,"title":1170,"excerpt":1171,"featuredImage":1172,"publishedAt":1173},"478","what-is-rag-the-simplest-explanation-of-how-it-works","Cos'è il RAG? La spiegazione più semplice di come funziona","RAG sembra complicato, ma l'idea è semplice: prima che un'IA risponda, cerca prima informazioni utili da una fonte di conoscenza e fornisce tali informazioni al modello linguistico. Questa guida spiega RAG, LLM, stato, memoria e strumenti utilizzando un semplice modello mentale.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":1175,"slug":1176,"title":1177,"excerpt":1178,"featuredImage":1179,"publishedAt":1180},"485","enterprise-ai-architecture-what-changes-when-ai-enters-a-company","Architettura AI aziendale: cosa cambia quando l'AI entra in un'azienda","L'architettura AI aziendale spiega come l'AI cambia i sistemi aziendali attraverso autorità sui dati, identità, permessi, fornitori, rischio, governance, valutazione, conformità e operazioni.","\u002Fuploads\u002F2026\u002F10\u002Fenterprise-ai-architecture-what-changes-when-ai-enters-a-company-1791478161363-czrwaq.webp","2026-10-08T10:48:00.000Z",{"id":1182,"slug":1183,"title":1184,"excerpt":1185,"featuredImage":1186,"publishedAt":1187},"489","agentic-ai-explained-when-an-ai-system-can-plan-use-tools-and-act","IA agentica spiegata: quando un sistema di IA può pianificare, usare strumenti e agire","L'IA agentica utilizza modelli all'interno di cicli di esecuzione a più passaggi, in cui possono scegliere strumenti, osservare i risultati, aggiornare lo stato e adattare l'azione successiva entro limiti espliciti di runtime e di autorizzazione.","\u002Fuploads\u002F2026\u002F10\u002Fagentic-ai-explained-when-an-ai-system-can-plan-use-tools-and-act-1791481499084-wnji2a.webp","2026-10-08T11:43:00.000Z",{"id":1189,"slug":1190,"title":1191,"excerpt":1192,"featuredImage":1193,"publishedAt":1194},"480","when-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger","Quando dovrebbe un'IA smettere di fidarsi della propria conoscenza? — Il grilletto del recupero","Un modello di IA non necessita del recupero per ogni domanda. Il problema importante è sapere quando la sua conoscenza interna non è più sufficiente. Il Trigger di Recupero è un confine decisionale pratico che determina quando un sistema di IA dovrebbe smettere di affidarsi esclusivamente alla conoscenza del modello e ottenere prove esterne prima di rispondere.","\u002Fuploads\u002F2026\u002F09\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger-1790574991244-f4rpyg.webp","2026-09-28T01:49:00.000Z",{"id":1196,"slug":1197,"title":1198,"excerpt":1199,"featuredImage":1200,"publishedAt":1201},"493","mlops-vs-llmops-what-changes-when-the-model-is-an-llm","MLOps vs LLMOps: cosa cambia quando il modello è un LLM","MLOps gestisce i sistemi di machine learning; LLMOps estende tali pratiche a prompt, contesto, recupero, provider, strumenti, valutazioni e comportamento a runtime attorno ai modelli linguistici di grandi dimensioni.","\u002Fuploads\u002F2026\u002F10\u002Fmlops-vs-llmops-what-changes-when-the-model-is-an-llm-1791487319869-2v7hxo.webp","2026-10-08T15:20:00.000Z","fallback",[],[]]