[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:de":3,"public-menus:all":37,"post:ai-agent-reliability-why-the-final-answer-is-not-enough:de":204,"related:post:ai-agent-reliability-why-the-final-answer-is-not-enough:de:1":1128},{"statusCode":4,"data":5,"message":36},200,{"tenantId":6,"lang":7,"defaultLang":7,"siteUrl":8,"contactEmail":9,"brandName":10,"logoUrl":11,"siteName":10,"siteDescription":12,"ogImage":9,"robotsIndex":13,"socialLinks":9,"reservedSlugs":9,"seoPolicy":14},"stajic","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":15,"relatedContent":16,"crossDomainLinks":17},{"logoUrl":11},{"enabled":13},[18,21,24,27,30,33],{"url":19,"label":20,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":22,"label":23,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":25,"label":26,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.com","bazify.com",{"url":28,"label":29,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.de","bazify.de",{"url":31,"label":32,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.at","bazify.at",{"url":34,"label":35,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[38,44],{"id":39,"name":40,"location":41,"isActive":13,"isDefault":42,"items":43},1,"main-navigation","header",false,[],{"id":45,"name":46,"location":47,"isActive":13,"isDefault":13,"items":48},4,"main-menu","sidebar",[49,65,78,92,102,117,132],{"id":50,"title":51,"url":59,"target":60,"icon":61,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":63,"portfolioId":9,"children":64},"item-18",{"de":52,"en":53,"es":54,"fr":55,"it":53,"ru":56,"sr":57,"zh":58},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":66,"title":67,"url":74,"target":60,"icon":75,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":76,"portfolioId":9,"children":77},"item-22",{"de":68,"en":68,"es":69,"fr":68,"it":70,"ru":71,"sr":72,"zh":73},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":79,"title":80,"url":88,"target":60,"icon":89,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":90,"portfolioId":9,"children":91},"item-19",{"de":81,"en":82,"es":83,"fr":82,"it":84,"ru":85,"sr":86,"zh":87},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":93,"title":94,"url":98,"target":60,"icon":99,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":100,"portfolioId":9,"children":101},"item-23",{"de":95,"en":95,"es":95,"fr":95,"it":95,"ru":96,"sr":96,"zh":97},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":103,"title":104,"url":113,"target":60,"icon":114,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":115,"portfolioId":9,"children":116},"item-32",{"de":105,"en":106,"es":107,"fr":108,"it":109,"ru":110,"sr":111,"zh":112},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":118,"title":119,"url":128,"target":60,"icon":129,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":130,"portfolioId":9,"children":131},"item-20",{"de":120,"en":121,"es":122,"fr":123,"it":124,"ru":125,"sr":126,"zh":127},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":133,"title":134,"url":143,"target":60,"icon":144,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":146},"item-21",{"de":135,"en":136,"es":137,"fr":138,"it":139,"ru":140,"sr":141,"zh":142},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[147,160,174,180,192],{"id":148,"title":149,"url":143,"target":60,"icon":158,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":159},"item-24",{"de":150,"en":151,"es":152,"fr":153,"it":154,"ru":155,"sr":156,"zh":157},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":161,"title":162,"url":170,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":173},"item-29",{"de":163,"en":164,"es":165,"fr":166,"it":167,"ru":168,"sr":169,"zh":142},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":175,"title":176,"url":178,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":179},"item-28",{"de":177,"en":177,"es":177,"fr":177,"it":177,"ru":177,"sr":177,"zh":177},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":181,"title":182,"url":190,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":191},"item-27",{"de":183,"en":184,"es":185,"fr":186,"it":187,"ru":188,"sr":189,"zh":184},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":193,"title":194,"url":202,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":203},"item-31",{"de":195,"en":196,"es":197,"fr":198,"it":199,"ru":200,"sr":201,"zh":196},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":205,"message":1127},{"id":206,"title":207,"slug":208,"content":209,"contentJson":210,"excerpt":560,"featuredImage":561,"featuredImageAlt":562,"featuredImageCaption":9,"featuredImageTitle":9,"featuredImageCopyright":9,"featuredImageAuthor":9,"featuredImageSourceUrl":9,"featuredImageLicense":9,"featuredImageIsAiGenerated":42,"status":563,"publishedAt":564,"createdAt":565,"updatedAt":566,"seoLocalePaths":567,"categories":576,"author":585,"translations":590},"460","Zuverlässigkeit von KI-Agenten: Warum die endgültige Antwort nicht ausreicht","ai-agent-reliability-why-the-final-answer-is-not-enough","\u003Cp>\u003Cb>Korrekte Ausgabe beweist weder korrektes Denken, sichere Ausführung noch ein vertrauenswürdiges System.\u003C\u002Fb>\u003C\u002Fp>\n\u003Cp>Jahrelang wurde die KI-Bewertung von einer trügerisch einfachen Frage dominiert: \u003Cb>War die Antwort korrekt?\u003C\u002Fb> Für einen Chatbot mag das manchmal ausreichen. Für einen Agenten, der Systeme durchsuchen, Daten lesen, Tools aufrufen, Zustände ändern, Workflows ausführen, Dateien schreiben, mit APIs interagieren oder Entscheidungen treffen kann, reicht das nicht.\u003C\u002Fp>\n\u003Cp>Ein Agent kann die korrekte endgültige Antwort liefern und dabei auf dem Weg dorthin mehrere Dinge falsch machen. Er kann die falsche Quelle verwenden, eine Anweisung missverstehen und den Fehler später kompensieren, auf unnötige Informationen zugreifen, eine nicht autorisierte Zwischenaktion ausführen, sich stillschweigend von einem Fehler erholen, der eine Eskalation hätte auslösen sollen, oder Nebenwirkungen hinterlassen, die niemand bemerkt.\u003C\u002Fp>\n\u003Cp>Das schafft eines der zentralen Probleme agentischer KI: \u003Cb>Ein korrektes Ergebnis beweist keinen korrekten Verlauf.\u003C\u002Fb>\u003C\u002Fp>\n\u003Ch2>Die Ergebnis-Illusion\u003C\u002Fh2>\n\u003Cp>Traditionelle Software gibt uns ein intuitives Modell der Korrektheit. Eingaben gelangen in ein deterministisches oder weitgehend deterministisches System, Logik wird ausgeführt, Ausgaben werden erzeugt, und Tests verifizieren das erwartete Verhalten. LLM-basierte Systeme schwächen diese Annahme. Agentische Systeme gehen noch weiter.\u003C\u002Fp>\n\u003Cul>\u003Cli>Modellinterpretation\u003C\u002Fli>\u003Cli>abgerufener Kontext\u003C\u002Fli>\u003Cli>Tool-Auswahl\u003C\u002Fli>\u003Cli>Zwischenbeobachtungen\u003C\u002Fli>\u003Cli>externer Zustand\u003C\u002Fli>\u003Cli>frühere Aktionen\u003C\u002Fli>\u003Cli>modellgenerierte Pläne\u003C\u002Fli>\u003Cli>Berechtigungsgrenzen\u003C\u002Fli>\u003Cli>Wiederholungen und Fallback-Verhalten\u003C\u002Fli>\u003Cli>menschliche Interaktion\u003C\u002Fli>\u003C\u002Ful>\n\u003Cp>Zwei Ausführungen, die mit nahezu identischen Eingaben beginnen, können über sehr unterschiedliche Wege zum gleichen Ergebnis gelangen. Wenn die Bewertung nur die endgültige Ausgabe beobachtet, bleibt der größte Teil des Systems unsichtbar.\u003C\u002Fp>\n\u003Cp>Stellen Sie sich vor, ein KI-Agent erhält die Anweisung: \u003Ci>Aktualisieren Sie die Rechnungsadresse des Kunden.\u003C\u002Fi> Die Adresse wird letztendlich korrekt aktualisiert. Eine herkömmliche Bewertung könnte die Aufgabe als erfolgreich einstufen.\u003C\u002Fp>\n\u003Col>\u003Cli>Der Agent durchsucht mehrere nicht zusammenhängende Kundendatensätze.\u003C\u002Fli>\u003Cli>Er ruft mehr persönliche Informationen ab als erforderlich.\u003C\u002Fli>\u003Cli>Er ändert zunächst das falsche Konto.\u003C\u002Fli>\u003Cli>Er bemerkt den Fehler.\u003C\u002Fli>\u003Cli>Er macht die Änderung rückgängig.\u003C\u002Fli>\u003Cli>Er aktualisiert das richtige Konto.\u003C\u002Fli>\u003Cli>Er meldet Erfolg.\u003C\u002Fli>\u003C\u002Fol>\n\u003Cp>\u003Cb>Endzustand: korrekt. Systemverhalten: inakzeptabel.\u003C\u002Fb> Ein reines Ergebnis-Benchmark gibt dieser Ausführung eine Bestehensnote. Ein Produktionssicherungssystem sollte das nicht tun.\u003C\u002Fp>\n\u003Ch2>Der Verlauf ist Teil des Produkts\u003C\u002Fh2>\n\u003Cp>Deshalb muss der \u003Cb>Verlauf\u003C\u002Fb> eines KI-Agenten zu einem erstklassigen technischen Objekt werden. Ein Verlauf ist die Sequenz relevanter Zustände und Aktionen zwischen der ursprünglichen Anfrage und dem endgültigen Ergebnis.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>Absicht → Kontext → Entscheidung → Werkzeug → Aktion → Beobachtung → Entscheidung → Zustandsänderung → Ergebnis\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Zachary J. Stevens entwickelt diese Idee in \u003Ci>Der Verlauf ist das System\u003C\u002Fi> und argumentiert, dass agentische Bewertung über die endgültige Antwort hinausgehen und den vollständigen Aktionspfad durch eine sich verändernde Umgebung untersuchen muss.\u003C\u002Fp>\n\u003Cblockquote class=\"border-l-4 border-gray-300 pl-4 italic\">Ein korrektes Ergebnis entschuldigt keinen inakzeptablen Verlauf.\u003Ccite class=\"block mt-2 text-sm\">— Zachary J. Stevens, Der Verlauf ist das System\u003C\u002Fcite>\u003C\u002Fblockquote>\n\u003Ca href=\"https:\u002F\u002Fzacharyjstevens.com\u002Fdispatches\u002Fvanguard-signal\u002F009-the-trajectory-is-the-system\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Der Verlauf ist das System\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Zachary J. Stevens — DFEI.009 zur Bewertung agentischer Systeme anhand ihres vollständigen Verlaufs und nicht nur des endgültigen Ergebnisses.\u003C\u002Fp>\u003C\u002Fa>\n\u003Cp>Der Unterschied ist enorm wichtig. Zuverlässigkeit ist daher nicht einfach \u003Cb>korrekte Ausgabe\u003C\u002Fb>. Sie ist eher \u003Cb>akzeptables Ergebnis + akzeptabler Verlauf + Wiederherstellbarkeit + Nachweise\u003C\u002Fb>.\u003C\u002Fp>\n\u003Ch2>Eine richtige Antwort kann ein kaputtes System verbergen\u003C\u002Fh2>\n\u003Ctable class=\"w-full border-collapse\">\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Agent\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Endergebnis\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ausführung\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">A\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Richtig\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Richtiger Pfad\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">B\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Richtig\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Unsicherer Pfad\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">C\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Falsch\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sicherer Fehler\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">D\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Falsch\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Unsicherer Fehler\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftable>\n\u003Cp>Die meisten benchmarkbasierten Bewertungen belohnen stark A und B und bestrafen C und D. Operativ kann jedoch \u003Cb>B gefährlicher sein als C\u003C\u002Fb>. Agent C könnte Unsicherheit erkennen, die Ausführung stoppen und eine menschliche Überprüfung anfordern. Agent B könnte selbstbewusst korrekte Ergebnisse liefern, während er Annahmen verletzt, die niemand überwacht.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>erfolgreiche Ausgabe → erhöhtes Vertrauen → breitere Berechtigungen → mehr Automatisierung → größerer Schadensradius\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Ch2>Wir brauchen Beweise, nicht Vertrauen\u003C\u002Fh2>\n\u003Cp>Einer der größten Fehler bei der Einführung von KI ist es, Modellvertrauen, Benutzerzufriedenheit oder historische Erfolgsraten als Beweis für die Zuverlässigkeit des Systems zu behandeln. Sie sind nicht gleichwertig.\u003C\u002Fp>\n\u003Cul>\u003Cli>Was hat der Agent erhalten?\u003C\u002Fli>\u003Cli>Welchen Kontext hat er abgerufen?\u003C\u002Fli>\u003Cli>Welche Werkzeuge hat er aufgerufen?\u003C\u002Fli>\u003Cli>Warum war die Aktion erlaubt?\u003C\u002Fli>\u003Cli>Welcher Zustand bestand vor der Aktion?\u003C\u002Fli>\u003Cli>Was hat sich geändert?\u003C\u002Fli>\u003Cli>Welche Zwischenfehler sind aufgetreten?\u003C\u002Fli>\u003Cli>Wurde etwas wiederholt?\u003C\u002Fli>\u003Cli>War eine menschliche Genehmigung erforderlich?\u003C\u002Fli>\u003Cli>Hätte die Ausführung gestoppt werden können?\u003C\u002Fli>\u003Cli>Kann die Aktion rückgängig gemacht werden?\u003C\u002Fli>\u003Cli>Welche Modell-, Prompt- und Tool-Versionen waren beteiligt?\u003C\u002Fli>\u003C\u002Ful>\n\u003Cp>Ohne diese Antworten gibt es keine ernsthafte operative Sicherheit. Es gibt nur eine Ausgabe. Beobachtbarkeit und Beweise müssen daher in die Agentenarchitektur eingebaut werden, anstatt nach der Bereitstellung hinzugefügt zu werden.\u003C\u002Fp>\n\u003Ch2>Protokollierung ist nicht dasselbe wie Kontrolle\u003C\u002Fh2>\n\u003Cp>Organisationen antworten oft: \u003Ci>Alles wird protokolliert.\u003C\u002Fi> Gut. Aber Protokollierung allein kontrolliert nichts. Ein Protokoll sagt Ihnen, was passiert ist. Eine Kontrolle bestimmt, ob etwas \u003Cb>passieren darf\u003C\u002Fb>.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>Agent fordert DELETE \u002Fcustomer\u002F123 an ↓\nAktion protokolliert ↓\nDELETE ausgeführt\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Das bietet Beobachtbarkeit. Vergleichen Sie das mit:\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>Agent fordert DELETE \u002Fcustomer\u002F123 an ↓\nRichtlinienbewertung ↓\nAktuelle Identität verifiziert ↓\nAktuelle Aktionsparameter geprüft ↓\nRisikoschwelle bewertet ↓\nMenschliche Genehmigung falls erforderlich ↓\nAktion ausgeführt ↓\nErgebnis verifiziert ↓\nBeweise gespeichert\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Jetzt nähern wir uns einem Kontrollsystem. Der Unterschied ist architektonisch, nicht kosmetisch.\u003C\u002Fp>\n\u003Ch2>Berechtigung ist notwendig – aber sie ist keine Sicherheit\u003C\u002Fh2>\n\u003Cp>Angenommen, ein Agent hat die Berechtigung, E-Mails zu senden. Zugriffskontrolle beantwortet: \u003Cb>Kann dieser Agent E-Mails senden?\u003C\u002Fb> Sie beantwortet nicht: \u003Cb>Sollte diese bestimmte E-Mail an diese bestimmte Person mit diesem bestimmten Anhang jetzt gesendet werden?\u003C\u002Fb>\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>FÄHIGKEITSKONTROLLE\nWas darf der Agent technisch tun? + AKTIONSSICHERHEIT\nIst diese spezifische Aktion im aktuellen Zustand angemessen?\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>RBAC, OAuth-Bereiche, API-Berechtigungen und Agentenidentitäten definieren den Raum möglicher Aktionen. Sie beweisen nicht, dass eine Aktion innerhalb dieses Raums angemessen ist. Eine starke Agentenarchitektur benötigt beide Ebenen.\u003C\u002Fp>\n\u003Ch2>Der erste falsche Schritt ist entscheidend\u003C\u002Fh2>\n\u003Cp>Wenn ein Agent scheitert, liegt der Ursprung des Fehlers oft nicht in der letzten falschen Aktion. Der eigentliche Fehler kann viel früher passiert sein.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>Falscher Abruf ↓\nFalsche Annahme ↓\nPlausible Argumentation ↓\nGültiger Tool-Aufruf ↓\nFalsche Aktion\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Wenn wir nur die letzte Aktion untersuchen, behandeln wir das Symptom. Wenn wir den Verlauf prüfen, können wir den \u003Cb>ersten falschen Schritt\u003C\u002Fb> identifizieren. Das verwandelt einen nicht zuzuordnenden Fehler in ein konkretes technisches Problem.\u003C\u002Fp>\n\u003Ch2>Agententests müssen über Prompt-Tests hinausgehen\u003C\u002Fh2>\n\u003Cp>Prompts sind wichtig, aber das Verhalten eines Agenten in der Produktion entsteht aus einem gesamten System.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>MODELL\n+\nSYSTEM PROMPT\n+\nKONTEXT\n+\nSPEICHER\n+\nABRUF\n+\nWERKZEUGE\n+\nBERECHTIGUNGEN\n+\nARBEITSABLAUF\n+\nEXTERNER ZUSTAND\n+\nSTEUERLOGIK\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Die Änderung einer dieser Komponenten kann den Verlauf verändern. Daher reicht es nicht aus, nur den Prompt zu versionieren.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>modell_version\nprompt_version\nwerkzeug_version\nrichtlinien_version\nabruf_version\narbeitsablauf_version\numgebungszustand\nausführungs_id\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Ch2>Abnahmekriterien für Agenten müssen Verhalten einschließen\u003C\u002Fh2>\n\u003Cp>Traditionelle Abnahmekriterien sehen oft so aus: \u003Ci>Gegeben X, erzeugt das System Y.\u003C\u002Fi> Für agentische Systeme ist das unvollständig. Abnahmekriterien sollten auch Einschränkungen für den Verlauf definieren.\u003C\u002Fp>\n\u003Ch3>Ergebnis\u003C\u002Fh3>\n\u003Cp>Die Adresse des Kunden wird korrekt aktualisiert.\u003C\u002Fp>\n\u003Ch3>Autorisierung\u003C\u002Fh3>\n\u003Cp>Der Agent ändert nur den explizit ausgewählten Kunden.\u003C\u002Fp>\n\u003Ch3>Datenzugriff\u003C\u002Fh3>\n\u003Cp>Es wird auf keine nicht zusammenhängenden Kundendatensätze zugegriffen.\u003C\u002Fp>\n\u003Ch3>Werkzeuge\u003C\u002Fh3>\n\u003Cp>Es werden nur genehmigte CRM-Operationen verwendet.\u003C\u002Fp>\n\u003Ch3>Verifizierung\u003C\u002Fh3>\n\u003Cp>Die neue Adresse wird zurückgelesen und mit dem angeforderten Wert verglichen.\u003C\u002Fp>\n\u003Ch3>Fehlerfall\u003C\u002Fh3>\n\u003Cp>Mehrdeutige Identitätsauflösung stoppt die Ausführung.\u003C\u002Fp>\n\u003Ch3>Menschliche Autorität\u003C\u002Fh3>\n\u003Cp>Ein Mensch kann die Änderung vor der Ausführung ablehnen, wenn Risikoschwellen eine Genehmigung erfordern.\u003C\u002Fp>\n\u003Ch3>Nachweis\u003C\u002Fh3>\n\u003Cp>Die Ausführung hinterlässt eine Spur, die ausreicht, um die Entscheidung und den Zustandsübergang zu rekonstruieren.\u003C\u002Fp>\n\u003Ch3>Wiederherstellung\u003C\u002Fh3>\n\u003Cp>Der vorherige Wert bleibt wiederherstellbar.\u003C\u002Fp>\n\u003Ch2>Human-in-the-Loop ist nicht genug\u003C\u002Fh2>\n\u003Cp>Das Hinzufügen eines menschlichen Genehmigungsfelds löst das Problem nicht automatisch. Ein Mensch kann einen Agenten nur kontrollieren, wenn die Person Sichtbarkeit, Autorität, Zeit, Kontext und Wiederherstellungsfähigkeit hat.\u003C\u002Fp>\n\u003Cul>\u003Cli>\u003Cb>Sichtbarkeit:\u003C\u002Fb> genügend Informationen, um zu verstehen, was passiert.\u003C\u002Fli>\u003Cli>\u003Cb>Autorität:\u003C\u002Fb> tatsächliche Fähigkeit, die Aktion zu stoppen oder zu ändern.\u003C\u002Fli>\u003Cli>\u003Cb>Zeit:\u003C\u002Fb> Eingreifen, bevor die Konsequenz eintritt.\u003C\u002Fli>\u003Cli>\u003Cb>Kontext:\u003C\u002Fb> ausreichende Beweise, um die Entscheidung zu treffen.\u003C\u002Fli>\u003Cli>\u003Cb>Wiederherstellungsfähigkeit:\u003C\u002Fb> Fähigkeit, die Aktion rückgängig zu machen oder zu reparieren.\u003C\u002Fli>\u003C\u002Ful>\n\u003Cp>Ein Benutzer, der auf \u003Cb>Genehmigen\u003C\u002Fb> klickt, ohne etwas sinnvoll prüfen zu können, ist keine starke Governance. Es ist Genehmigungstheater.\u003C\u002Fp>\n\u003Ch2>Rollback muss eine native KI-Fähigkeit werden\u003C\u002Fh2>\n\u003Cp>Traditionelle Softwarebereitstellung hat uns etwas Wertvolles gelehrt: \u003Cb>Stelle niemals etwas bereit, das du nicht zurückrollen kannst.\u003C\u002Fb> Wir sollten dasselbe Prinzip auf agentische Aktionen anwenden.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>REVERSIBEL\nKann automatisch rückgängig gemacht werden. KOMPENSIERBAR\nKann nicht direkt rückgängig gemacht werden, aber eine kompensierende Aktion kann ausgeführt werden. UNUMKEHRBAR\nKann den vorherigen Zustand nicht zuverlässig wiederherstellen.\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Je höher die Irreversibilität, desto stärker sollte die Kontrollanforderung werden.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>Öffentliches Dokument lesen → geringe Konsequenz\nEntwurf erstellen → reversibel\nCRM-Datensatz ändern → reversibel, aber folgenreich\nExterne E-Mail senden → praktisch irreversibel\nGeld überweisen → hohe Konsequenz\nProduktionsdaten löschen → potenziell katastrophal\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Ch2>Der Agent braucht eine Kontrollebene\u003C\u002Fh2>\n\u003Cpre class=\"code-block\">\u003Ccode>BENUTZER \u002F SYSTEMABSICHT │ ▼ KI-AGENT │ vorgeschlagene Aktion │ ▼ ┌───────────────────┐ │ KONTROLLEBENE │ ├───────────────────┤ │ Identität │ │ Autorisierung │ │ Richtlinie │ │ Risiko │ │ Zustand │ │ Nachweis │ │ Menschliche Autorität │ │ Rollback │ └───────────────────┘ │ genehmigt? \u002F \\ NEIN JA │ │ STOPP ▼ WERKZEUG │ ▼ ZUSTANDSÄNDERUNG │ ▼ VERIFIKATION\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>\u003Cb>Das LLM sollte vorschlagen. Die Kontrollebene sollte regieren.\u003C\u002Fb> Diese Trennung ist entscheidend. Das Modell sollte nicht die letzte Instanz sein, die bestimmt, ob seine eigene vorgeschlagene Aktion mit hoher Auswirkung sicher ist.\u003C\u002Fp>\n\u003Ch2>Von Benchmarks zu operativem Vertrauen\u003C\u002Fh2>\n\u003Cp>Benchmarks bleiben nützlich. Sie sagen uns etwas über die Fähigkeiten, vergleichen Modelle, erkennen Regressionen und helfen, die erwartete Leistung einzuschätzen. Aber Fähigkeitsbewertung und operatives Vertrauen beantworten unterschiedliche Fragen.\u003C\u002Fp>\n\u003Cp>Ein Benchmark fragt: \u003Cb>Kann das System das tun?\u003C\u002Fb> Operative Sicherheit fragt: \u003Cb>Können wir dem System erlauben, das hier zu tun, unter diesen Bedingungen, mit diesen Berechtigungen und Konsequenzen?\u003C\u002Fb>\u003C\u002Fp>\n\u003Ch2>Zuverlässigkeit sollte als Systemeigenschaft gemessen werden\u003C\u002Fh2>\n\u003Col>\u003Cli>\u003Cb>Ergebniskorrektheit:\u003C\u002Fb> Hat das System das erwartete Ergebnis geliefert?\u003C\u002Fli>\u003Cli>\u003Cb>Pfadkorrektheit:\u003C\u002Fb> Hat es einen akzeptablen Weg eingeschlagen?\u003C\u002Fli>\u003Cli>\u003Cb>Kontrollintegrität:\u003C\u002Fb> Wurden Autorisierungs-, Richtlinien- und Interventionsgrenzen eingehalten?\u003C\u002Fli>\u003Cli>\u003Cb>Wiederherstellbarkeit:\u003C\u002Fb> Können Fehler eingedämmt, rückgängig gemacht oder repariert werden?\u003C\u002Fli>\u003Cli>\u003Cb>Nachweisvollständigkeit:\u003C\u002Fb> Kann die Ausführung rekonstruiert und geprüft werden?\u003C\u002Fli>\u003C\u002Fol>\n\u003Cpre class=\"code-block\">\u003Ccode>Operative Zuverlässigkeit\n=\nErgebnis × Pfad × Kontrolle × Wiederherstellbarkeit × Nachweis\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Die Multiplikation ist beabsichtigt. Wenn eine kritische Dimension gegen Null geht, sollte eine hohe Punktzahl anderswo das nicht verbergen. Ein perfekt korrektes Ergebnis ohne Autorisierungsintegrität ist kein 80% zuverlässiges System. Es ist eine inakzeptable Ausführung, die zufällig die richtige Antwort hervorgebracht hat.\u003C\u002Fp>\n\u003Ch2>Erfolg ist manchmal der gefährlichste Fehler\u003C\u002Fh2>\n\u003Cp>Fehler ziehen Aufmerksamkeit auf sich. Erfolg oft nicht. Das macht erfolgreiche, aber unkontrollierte Agentenpfade besonders gefährlich. Ein offensichtlicher Fehler erzeugt einen Vorfall. Ein versteckter Pfadfehler erzeugt \u003Cb>Vertrauen\u003C\u002Fb>. Und Vertrauen erweitert Autonomie.\u003C\u002Fp>\n\u003Cp>Organisationen sollten daher nicht nur untersuchen, \u003Ci>Warum hat der Agent versagt?\u003C\u002Fi> Sie sollten regelmäßig fragen: \u003Cb>Warum ist der Agent erfolgreich gewesen?\u003C\u002Fb> War es, weil die Architektur die Ausführung zuverlässig eingeschränkt und verifiziert hat, oder weil diesmal nichts schiefgegangen ist?\u003C\u002Fp>\n\u003Ch2>Fazit\u003C\u002Fh2>\n\u003Cp>Die Branche bewegt sich schnell von KI, die \u003Cb>antwortet\u003C\u002Fb>, zu KI, die \u003Cb>handelt\u003C\u002Fb>. Dieser Übergang verändert, was Zuverlässigkeit bedeutet. Für ein Antwortsystem kann die Bewertung der Antwort oft ausreichen. Für ein Handlungssystem müssen wir den Pfad bewerten.\u003C\u002Fp>\n\u003Cpre class=\"code-block\">\u003Ccode>Eingabeaufforderung ↓\nAntwort wird Absicht ↓\nPfad ↓\nAktionen ↓\nZustandsänderungen ↓\nNachweis ↓\nErgebnis\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>Die endgültige Antwort bleibt wichtig, aber sie ist nur das sichtbare Ende eines viel größeren Systems. Sobald KI die reale Welt beeinflussen darf, \u003Cb>wird der Weg zur Antwort Teil der Antwort.\u003C\u002Fb>\u003C\u002Fp>",{"time":211,"blocks":212,"version":559},1788955647726,[213,217,220,223,226,230,233,248,251,254,265,268,271,274,278,281,287,295,298,301,323,326,329,332,335,350,353,356,359,362,365,368,371,374,377,380,383,386,389,392,395,398,401,404,407,410,413,416,420,423,426,429,432,435,438,441,444,447,450,453,456,459,462,465,468,471,474,477,485,488,491,494,497,500,503,506,509,512,515,518,521,524,532,535,538,541,544,547,550,553,556],{"data":214,"type":216},{"text":215},"\u003Cb>Korrekte Ausgabe beweist weder korrektes Denken, sichere Ausführung noch ein vertrauenswürdiges System.\u003C\u002Fb>","paragraph",{"data":218,"type":216},{"text":219},"Jahrelang wurde die KI-Bewertung von einer trügerisch einfachen Frage dominiert: \u003Cb>War die Antwort korrekt?\u003C\u002Fb> Für einen Chatbot mag das manchmal ausreichen. Für einen Agenten, der Systeme durchsuchen, Daten lesen, Tools aufrufen, Zustände ändern, Workflows ausführen, Dateien schreiben, mit APIs interagieren oder Entscheidungen treffen kann, reicht das nicht.",{"data":221,"type":216},{"text":222},"Ein Agent kann die korrekte endgültige Antwort liefern und dabei auf dem Weg dorthin mehrere Dinge falsch machen. Er kann die falsche Quelle verwenden, eine Anweisung missverstehen und den Fehler später kompensieren, auf unnötige Informationen zugreifen, eine nicht autorisierte Zwischenaktion ausführen, sich stillschweigend von einem Fehler erholen, der eine Eskalation hätte auslösen sollen, oder Nebenwirkungen hinterlassen, die niemand bemerkt.",{"data":224,"type":216},{"text":225},"Das schafft eines der zentralen Probleme agentischer KI: \u003Cb>Ein korrektes Ergebnis beweist keinen korrekten Verlauf.\u003C\u002Fb>",{"data":227,"type":41},{"text":228,"level":229},"Die Ergebnis-Illusion",2,{"data":231,"type":216},{"text":232},"Traditionelle Software gibt uns ein intuitives Modell der Korrektheit. Eingaben gelangen in ein deterministisches oder weitgehend deterministisches System, Logik wird ausgeführt, Ausgaben werden erzeugt, und Tests verifizieren das erwartete Verhalten. LLM-basierte Systeme schwächen diese Annahme. Agentische Systeme gehen noch weiter.",{"data":234,"type":247},{"items":235,"style":246},[236,237,238,239,240,241,242,243,244,245],"Modellinterpretation","abgerufener Kontext","Tool-Auswahl","Zwischenbeobachtungen","externer Zustand","frühere Aktionen","modellgenerierte Pläne","Berechtigungsgrenzen","Wiederholungen und Fallback-Verhalten","menschliche Interaktion","unordered","list",{"data":249,"type":216},{"text":250},"Zwei Ausführungen, die mit nahezu identischen Eingaben beginnen, können über sehr unterschiedliche Wege zum gleichen Ergebnis gelangen. Wenn die Bewertung nur die endgültige Ausgabe beobachtet, bleibt der größte Teil des Systems unsichtbar.",{"data":252,"type":216},{"text":253},"Stellen Sie sich vor, ein KI-Agent erhält die Anweisung: \u003Ci>Aktualisieren Sie die Rechnungsadresse des Kunden.\u003C\u002Fi> Die Adresse wird letztendlich korrekt aktualisiert. Eine herkömmliche Bewertung könnte die Aufgabe als erfolgreich einstufen.",{"data":255,"type":247},{"items":256,"style":264},[257,258,259,260,261,262,263],"Der Agent durchsucht mehrere nicht zusammenhängende Kundendatensätze.","Er ruft mehr persönliche Informationen ab als erforderlich.","Er ändert zunächst das falsche Konto.","Er bemerkt den Fehler.","Er macht die Änderung rückgängig.","Er aktualisiert das richtige Konto.","Er meldet Erfolg.","ordered",{"data":266,"type":216},{"text":267},"\u003Cb>Endzustand: korrekt. Systemverhalten: inakzeptabel.\u003C\u002Fb> Ein reines Ergebnis-Benchmark gibt dieser Ausführung eine Bestehensnote. Ein Produktionssicherungssystem sollte das nicht tun.",{"data":269,"type":41},{"text":270,"level":229},"Der Verlauf ist Teil des Produkts",{"data":272,"type":216},{"text":273},"Deshalb muss der \u003Cb>Verlauf\u003C\u002Fb> eines KI-Agenten zu einem erstklassigen technischen Objekt werden. Ein Verlauf ist die Sequenz relevanter Zustände und Aktionen zwischen der ursprünglichen Anfrage und dem endgültigen Ergebnis.",{"data":275,"type":277},{"code":276},"Absicht → Kontext → Entscheidung → Werkzeug → Aktion → Beobachtung → Entscheidung → Zustandsänderung → Ergebnis","code",{"data":279,"type":216},{"text":280},"Zachary J. Stevens entwickelt diese Idee in \u003Ci>Der Verlauf ist das System\u003C\u002Fi> und argumentiert, dass agentische Bewertung über die endgültige Antwort hinausgehen und den vollständigen Aktionspfad durch eine sich verändernde Umgebung untersuchen muss.",{"data":282,"type":286},{"text":283,"caption":284,"alignment":285},"Ein korrektes Ergebnis entschuldigt keinen inakzeptablen Verlauf.","Zachary J. Stevens, Der Verlauf ist das System","left","quote",{"data":288,"type":294},{"link":289,"meta":290},"https:\u002F\u002Fzacharyjstevens.com\u002Fdispatches\u002Fvanguard-signal\u002F009-the-trajectory-is-the-system\u002F",{"image":291,"title":292,"description":293},{},"Der Verlauf ist das System","Zachary J. Stevens — DFEI.009 zur Bewertung agentischer Systeme anhand ihres vollständigen Verlaufs und nicht nur des endgültigen Ergebnisses.","linkTool",{"data":296,"type":216},{"text":297},"Der Unterschied ist enorm wichtig. Zuverlässigkeit ist daher nicht einfach \u003Cb>korrekte Ausgabe\u003C\u002Fb>. Sie ist eher \u003Cb>akzeptables Ergebnis + akzeptabler Verlauf + Wiederherstellbarkeit + Nachweise\u003C\u002Fb>.",{"data":299,"type":41},{"text":300,"level":229},"Eine richtige Antwort kann ein kaputtes System verbergen",{"data":302,"type":322},{"content":303,"withHeadings":13},[304,308,312,315,319],[305,306,307],"Agent","Endergebnis","Ausführung",[309,310,311],"A","Richtig","Richtiger Pfad",[313,310,314],"B","Unsicherer Pfad",[316,317,318],"C","Falsch","Sicherer Fehler",[320,317,321],"D","Unsicherer Fehler","table",{"data":324,"type":216},{"text":325},"Die meisten benchmarkbasierten Bewertungen belohnen stark A und B und bestrafen C und D. Operativ kann jedoch \u003Cb>B gefährlicher sein als C\u003C\u002Fb>. Agent C könnte Unsicherheit erkennen, die Ausführung stoppen und eine menschliche Überprüfung anfordern. Agent B könnte selbstbewusst korrekte Ergebnisse liefern, während er Annahmen verletzt, die niemand überwacht.",{"data":327,"type":277},{"code":328},"erfolgreiche Ausgabe → erhöhtes Vertrauen → breitere Berechtigungen → mehr Automatisierung → größerer Schadensradius",{"data":330,"type":41},{"text":331,"level":229},"Wir brauchen Beweise, nicht Vertrauen",{"data":333,"type":216},{"text":334},"Einer der größten Fehler bei der Einführung von KI ist es, Modellvertrauen, Benutzerzufriedenheit oder historische Erfolgsraten als Beweis für die Zuverlässigkeit des Systems zu behandeln. Sie sind nicht gleichwertig.",{"data":336,"type":247},{"items":337,"style":246},[338,339,340,341,342,343,344,345,346,347,348,349],"Was hat der Agent erhalten?","Welchen Kontext hat er abgerufen?","Welche Werkzeuge hat er aufgerufen?","Warum war die Aktion erlaubt?","Welcher Zustand bestand vor der Aktion?","Was hat sich geändert?","Welche Zwischenfehler sind aufgetreten?","Wurde etwas wiederholt?","War eine menschliche Genehmigung erforderlich?","Hätte die Ausführung gestoppt werden können?","Kann die Aktion rückgängig gemacht werden?","Welche Modell-, Prompt- und Tool-Versionen waren beteiligt?",{"data":351,"type":216},{"text":352},"Ohne diese Antworten gibt es keine ernsthafte operative Sicherheit. Es gibt nur eine Ausgabe. Beobachtbarkeit und Beweise müssen daher in die Agentenarchitektur eingebaut werden, anstatt nach der Bereitstellung hinzugefügt zu werden.",{"data":354,"type":41},{"text":355,"level":229},"Protokollierung ist nicht dasselbe wie Kontrolle",{"data":357,"type":216},{"text":358},"Organisationen antworten oft: \u003Ci>Alles wird protokolliert.\u003C\u002Fi> Gut. Aber Protokollierung allein kontrolliert nichts. Ein Protokoll sagt Ihnen, was passiert ist. Eine Kontrolle bestimmt, ob etwas \u003Cb>passieren darf\u003C\u002Fb>.",{"data":360,"type":277},{"code":361},"Agent fordert DELETE \u002Fcustomer\u002F123 an ↓\nAktion protokolliert ↓\nDELETE ausgeführt",{"data":363,"type":216},{"text":364},"Das bietet Beobachtbarkeit. Vergleichen Sie das mit:",{"data":366,"type":277},{"code":367},"Agent fordert DELETE \u002Fcustomer\u002F123 an ↓\nRichtlinienbewertung ↓\nAktuelle Identität verifiziert ↓\nAktuelle Aktionsparameter geprüft ↓\nRisikoschwelle bewertet ↓\nMenschliche Genehmigung falls erforderlich ↓\nAktion ausgeführt ↓\nErgebnis verifiziert ↓\nBeweise gespeichert",{"data":369,"type":216},{"text":370},"Jetzt nähern wir uns einem Kontrollsystem. Der Unterschied ist architektonisch, nicht kosmetisch.",{"data":372,"type":41},{"text":373,"level":229},"Berechtigung ist notwendig – aber sie ist keine Sicherheit",{"data":375,"type":216},{"text":376},"Angenommen, ein Agent hat die Berechtigung, E-Mails zu senden. Zugriffskontrolle beantwortet: \u003Cb>Kann dieser Agent E-Mails senden?\u003C\u002Fb> Sie beantwortet nicht: \u003Cb>Sollte diese bestimmte E-Mail an diese bestimmte Person mit diesem bestimmten Anhang jetzt gesendet werden?\u003C\u002Fb>",{"data":378,"type":277},{"code":379},"FÄHIGKEITSKONTROLLE\nWas darf der Agent technisch tun? + AKTIONSSICHERHEIT\nIst diese spezifische Aktion im aktuellen Zustand angemessen?",{"data":381,"type":216},{"text":382},"RBAC, OAuth-Bereiche, API-Berechtigungen und Agentenidentitäten definieren den Raum möglicher Aktionen. Sie beweisen nicht, dass eine Aktion innerhalb dieses Raums angemessen ist. Eine starke Agentenarchitektur benötigt beide Ebenen.",{"data":384,"type":41},{"text":385,"level":229},"Der erste falsche Schritt ist entscheidend",{"data":387,"type":216},{"text":388},"Wenn ein Agent scheitert, liegt der Ursprung des Fehlers oft nicht in der letzten falschen Aktion. Der eigentliche Fehler kann viel früher passiert sein.",{"data":390,"type":277},{"code":391},"Falscher Abruf ↓\nFalsche Annahme ↓\nPlausible Argumentation ↓\nGültiger Tool-Aufruf ↓\nFalsche Aktion",{"data":393,"type":216},{"text":394},"Wenn wir nur die letzte Aktion untersuchen, behandeln wir das Symptom. Wenn wir den Verlauf prüfen, können wir den \u003Cb>ersten falschen Schritt\u003C\u002Fb> identifizieren. Das verwandelt einen nicht zuzuordnenden Fehler in ein konkretes technisches Problem.",{"data":396,"type":41},{"text":397,"level":229},"Agententests müssen über Prompt-Tests hinausgehen",{"data":399,"type":216},{"text":400},"Prompts sind wichtig, aber das Verhalten eines Agenten in der Produktion entsteht aus einem gesamten System.",{"data":402,"type":277},{"code":403},"MODELL\n+\nSYSTEM PROMPT\n+\nKONTEXT\n+\nSPEICHER\n+\nABRUF\n+\nWERKZEUGE\n+\nBERECHTIGUNGEN\n+\nARBEITSABLAUF\n+\nEXTERNER ZUSTAND\n+\nSTEUERLOGIK",{"data":405,"type":216},{"text":406},"Die Änderung einer dieser Komponenten kann den Verlauf verändern. Daher reicht es nicht aus, nur den Prompt zu versionieren.",{"data":408,"type":277},{"code":409},"modell_version\nprompt_version\nwerkzeug_version\nrichtlinien_version\nabruf_version\narbeitsablauf_version\numgebungszustand\nausführungs_id",{"data":411,"type":41},{"text":412,"level":229},"Abnahmekriterien für Agenten müssen Verhalten einschließen",{"data":414,"type":216},{"text":415},"Traditionelle Abnahmekriterien sehen oft so aus: \u003Ci>Gegeben X, erzeugt das System Y.\u003C\u002Fi> Für agentische Systeme ist das unvollständig. Abnahmekriterien sollten auch Einschränkungen für den Verlauf definieren.",{"data":417,"type":41},{"text":418,"level":419},"Ergebnis",3,{"data":421,"type":216},{"text":422},"Die Adresse des Kunden wird korrekt aktualisiert.",{"data":424,"type":41},{"text":425,"level":419},"Autorisierung",{"data":427,"type":216},{"text":428},"Der Agent ändert nur den explizit ausgewählten Kunden.",{"data":430,"type":41},{"text":431,"level":419},"Datenzugriff",{"data":433,"type":216},{"text":434},"Es wird auf keine nicht zusammenhängenden Kundendatensätze zugegriffen.",{"data":436,"type":41},{"text":437,"level":419},"Werkzeuge",{"data":439,"type":216},{"text":440},"Es werden nur genehmigte CRM-Operationen verwendet.",{"data":442,"type":41},{"text":443,"level":419},"Verifizierung",{"data":445,"type":216},{"text":446},"Die neue Adresse wird zurückgelesen und mit dem angeforderten Wert verglichen.",{"data":448,"type":41},{"text":449,"level":419},"Fehlerfall",{"data":451,"type":216},{"text":452},"Mehrdeutige Identitätsauflösung stoppt die Ausführung.",{"data":454,"type":41},{"text":455,"level":419},"Menschliche Autorität",{"data":457,"type":216},{"text":458},"Ein Mensch kann die Änderung vor der Ausführung ablehnen, wenn Risikoschwellen eine Genehmigung erfordern.",{"data":460,"type":41},{"text":461,"level":419},"Nachweis",{"data":463,"type":216},{"text":464},"Die Ausführung hinterlässt eine Spur, die ausreicht, um die Entscheidung und den Zustandsübergang zu rekonstruieren.",{"data":466,"type":41},{"text":467,"level":419},"Wiederherstellung",{"data":469,"type":216},{"text":470},"Der vorherige Wert bleibt wiederherstellbar.",{"data":472,"type":41},{"text":473,"level":229},"Human-in-the-Loop ist nicht genug",{"data":475,"type":216},{"text":476},"Das Hinzufügen eines menschlichen Genehmigungsfelds löst das Problem nicht automatisch. Ein Mensch kann einen Agenten nur kontrollieren, wenn die Person Sichtbarkeit, Autorität, Zeit, Kontext und Wiederherstellungsfähigkeit hat.",{"data":478,"type":247},{"items":479,"style":246},[480,481,482,483,484],"\u003Cb>Sichtbarkeit:\u003C\u002Fb> genügend Informationen, um zu verstehen, was passiert.","\u003Cb>Autorität:\u003C\u002Fb> tatsächliche Fähigkeit, die Aktion zu stoppen oder zu ändern.","\u003Cb>Zeit:\u003C\u002Fb> Eingreifen, bevor die Konsequenz eintritt.","\u003Cb>Kontext:\u003C\u002Fb> ausreichende Beweise, um die Entscheidung zu treffen.","\u003Cb>Wiederherstellungsfähigkeit:\u003C\u002Fb> Fähigkeit, die Aktion rückgängig zu machen oder zu reparieren.",{"data":486,"type":216},{"text":487},"Ein Benutzer, der auf \u003Cb>Genehmigen\u003C\u002Fb> klickt, ohne etwas sinnvoll prüfen zu können, ist keine starke Governance. Es ist Genehmigungstheater.",{"data":489,"type":41},{"text":490,"level":229},"Rollback muss eine native KI-Fähigkeit werden",{"data":492,"type":216},{"text":493},"Traditionelle Softwarebereitstellung hat uns etwas Wertvolles gelehrt: \u003Cb>Stelle niemals etwas bereit, das du nicht zurückrollen kannst.\u003C\u002Fb> Wir sollten dasselbe Prinzip auf agentische Aktionen anwenden.",{"data":495,"type":277},{"code":496},"REVERSIBEL\nKann automatisch rückgängig gemacht werden. KOMPENSIERBAR\nKann nicht direkt rückgängig gemacht werden, aber eine kompensierende Aktion kann ausgeführt werden. UNUMKEHRBAR\nKann den vorherigen Zustand nicht zuverlässig wiederherstellen.",{"data":498,"type":216},{"text":499},"Je höher die Irreversibilität, desto stärker sollte die Kontrollanforderung werden.",{"data":501,"type":277},{"code":502},"Öffentliches Dokument lesen → geringe Konsequenz\nEntwurf erstellen → reversibel\nCRM-Datensatz ändern → reversibel, aber folgenreich\nExterne E-Mail senden → praktisch irreversibel\nGeld überweisen → hohe Konsequenz\nProduktionsdaten löschen → potenziell katastrophal",{"data":504,"type":41},{"text":505,"level":229},"Der Agent braucht eine Kontrollebene",{"data":507,"type":277},{"code":508},"BENUTZER \u002F SYSTEMABSICHT │ ▼ KI-AGENT │ vorgeschlagene Aktion │ ▼ ┌───────────────────┐ │ KONTROLLEBENE │ ├───────────────────┤ │ Identität │ │ Autorisierung │ │ Richtlinie │ │ Risiko │ │ Zustand │ │ Nachweis │ │ Menschliche Autorität │ │ Rollback │ └───────────────────┘ │ genehmigt? \u002F \\ NEIN JA │ │ STOPP ▼ WERKZEUG │ ▼ ZUSTANDSÄNDERUNG │ ▼ VERIFIKATION",{"data":510,"type":216},{"text":511},"\u003Cb>Das LLM sollte vorschlagen. Die Kontrollebene sollte regieren.\u003C\u002Fb> Diese Trennung ist entscheidend. Das Modell sollte nicht die letzte Instanz sein, die bestimmt, ob seine eigene vorgeschlagene Aktion mit hoher Auswirkung sicher ist.",{"data":513,"type":41},{"text":514,"level":229},"Von Benchmarks zu operativem Vertrauen",{"data":516,"type":216},{"text":517},"Benchmarks bleiben nützlich. Sie sagen uns etwas über die Fähigkeiten, vergleichen Modelle, erkennen Regressionen und helfen, die erwartete Leistung einzuschätzen. Aber Fähigkeitsbewertung und operatives Vertrauen beantworten unterschiedliche Fragen.",{"data":519,"type":216},{"text":520},"Ein Benchmark fragt: \u003Cb>Kann das System das tun?\u003C\u002Fb> Operative Sicherheit fragt: \u003Cb>Können wir dem System erlauben, das hier zu tun, unter diesen Bedingungen, mit diesen Berechtigungen und Konsequenzen?\u003C\u002Fb>",{"data":522,"type":41},{"text":523,"level":229},"Zuverlässigkeit sollte als Systemeigenschaft gemessen werden",{"data":525,"type":247},{"items":526,"style":264},[527,528,529,530,531],"\u003Cb>Ergebniskorrektheit:\u003C\u002Fb> Hat das System das erwartete Ergebnis geliefert?","\u003Cb>Pfadkorrektheit:\u003C\u002Fb> Hat es einen akzeptablen Weg eingeschlagen?","\u003Cb>Kontrollintegrität:\u003C\u002Fb> Wurden Autorisierungs-, Richtlinien- und Interventionsgrenzen eingehalten?","\u003Cb>Wiederherstellbarkeit:\u003C\u002Fb> Können Fehler eingedämmt, rückgängig gemacht oder repariert werden?","\u003Cb>Nachweisvollständigkeit:\u003C\u002Fb> Kann die Ausführung rekonstruiert und geprüft werden?",{"data":533,"type":277},{"code":534},"Operative Zuverlässigkeit\n=\nErgebnis × Pfad × Kontrolle × Wiederherstellbarkeit × Nachweis",{"data":536,"type":216},{"text":537},"Die Multiplikation ist beabsichtigt. Wenn eine kritische Dimension gegen Null geht, sollte eine hohe Punktzahl anderswo das nicht verbergen. Ein perfekt korrektes Ergebnis ohne Autorisierungsintegrität ist kein 80% zuverlässiges System. Es ist eine inakzeptable Ausführung, die zufällig die richtige Antwort hervorgebracht hat.",{"data":539,"type":41},{"text":540,"level":229},"Erfolg ist manchmal der gefährlichste Fehler",{"data":542,"type":216},{"text":543},"Fehler ziehen Aufmerksamkeit auf sich. Erfolg oft nicht. Das macht erfolgreiche, aber unkontrollierte Agentenpfade besonders gefährlich. Ein offensichtlicher Fehler erzeugt einen Vorfall. Ein versteckter Pfadfehler erzeugt \u003Cb>Vertrauen\u003C\u002Fb>. Und Vertrauen erweitert Autonomie.",{"data":545,"type":216},{"text":546},"Organisationen sollten daher nicht nur untersuchen, \u003Ci>Warum hat der Agent versagt?\u003C\u002Fi> Sie sollten regelmäßig fragen: \u003Cb>Warum ist der Agent erfolgreich gewesen?\u003C\u002Fb> War es, weil die Architektur die Ausführung zuverlässig eingeschränkt und verifiziert hat, oder weil diesmal nichts schiefgegangen ist?",{"data":548,"type":41},{"text":549,"level":229},"Fazit",{"data":551,"type":216},{"text":552},"Die Branche bewegt sich schnell von KI, die \u003Cb>antwortet\u003C\u002Fb>, zu KI, die \u003Cb>handelt\u003C\u002Fb>. Dieser Übergang verändert, was Zuverlässigkeit bedeutet. Für ein Antwortsystem kann die Bewertung der Antwort oft ausreichen. Für ein Handlungssystem müssen wir den Pfad bewerten.",{"data":554,"type":277},{"code":555},"Eingabeaufforderung ↓\nAntwort wird Absicht ↓\nPfad ↓\nAktionen ↓\nZustandsänderungen ↓\nNachweis ↓\nErgebnis",{"data":557,"type":216},{"text":558},"Die endgültige Antwort bleibt wichtig, aber sie ist nur das sichtbare Ende eines viel größeren Systems. Sobald KI die reale Welt beeinflussen darf, \u003Cb>wird der Weg zur Antwort Teil der Antwort.\u003C\u002Fb>","2.31","Korrekte Ausgabe beweist weder korrektes Denken, sichere Ausführung noch ein vertrauenswürdiges System.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-reliability-why-the-final-answer-is-not-enough-1788955466306-pl0qhz.webp","ai-agent-reliability-why-the-final-answer-is-not-enough-1788955466306-pl0qhz","PUBLISHED","2026-09-09T04:01:00.000Z","2026-09-09T12:01:07.219Z","2026-09-09T13:08:53.481Z",{"en":568,"de":569,"sr":570,"es":571,"fr":572,"it":573,"ru":574,"zh":575},"\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fde\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fsr\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fes\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Ffr\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fit\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fru\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","\u002Fzh\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough",[577,581],{"id":578,"name":579,"slug":580},58,"Evaluation & Qualitäts-Gates","evaluation",{"id":582,"name":583,"slug":584},59,"Governance & Auditierbarkeit","governance",{"id":586,"login":587,"email":588,"displayName":589},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[591,789],{"lang":7,"title":207,"content":209,"contentJson":592,"excerpt":560},{"time":211,"blocks":593,"version":559},[594,596,598,600,602,604,606,609,611,613,616,618,620,622,624,626,628,632,634,636,644,646,648,650,652,655,657,659,661,663,665,667,669,671,673,675,677,679,681,683,685,687,689,691,693,695,697,699,701,703,705,707,709,711,713,715,717,719,721,723,725,727,729,731,733,735,737,739,742,744,746,748,750,752,754,756,758,760,762,764,766,768,771,773,775,777,779,781,783,785,787],{"data":595,"type":216},{"text":215},{"data":597,"type":216},{"text":219},{"data":599,"type":216},{"text":222},{"data":601,"type":216},{"text":225},{"data":603,"type":41},{"text":228,"level":229},{"data":605,"type":216},{"text":232},{"data":607,"type":247},{"items":608,"style":246},[236,237,238,239,240,241,242,243,244,245],{"data":610,"type":216},{"text":250},{"data":612,"type":216},{"text":253},{"data":614,"type":247},{"items":615,"style":264},[257,258,259,260,261,262,263],{"data":617,"type":216},{"text":267},{"data":619,"type":41},{"text":270,"level":229},{"data":621,"type":216},{"text":273},{"data":623,"type":277},{"code":276},{"data":625,"type":216},{"text":280},{"data":627,"type":286},{"text":283,"caption":284,"alignment":285},{"data":629,"type":294},{"link":289,"meta":630},{"image":631,"title":292,"description":293},{},{"data":633,"type":216},{"text":297},{"data":635,"type":41},{"text":300,"level":229},{"data":637,"type":322},{"content":638,"withHeadings":13},[639,640,641,642,643],[305,306,307],[309,310,311],[313,310,314],[316,317,318],[320,317,321],{"data":645,"type":216},{"text":325},{"data":647,"type":277},{"code":328},{"data":649,"type":41},{"text":331,"level":229},{"data":651,"type":216},{"text":334},{"data":653,"type":247},{"items":654,"style":246},[338,339,340,341,342,343,344,345,346,347,348,349],{"data":656,"type":216},{"text":352},{"data":658,"type":41},{"text":355,"level":229},{"data":660,"type":216},{"text":358},{"data":662,"type":277},{"code":361},{"data":664,"type":216},{"text":364},{"data":666,"type":277},{"code":367},{"data":668,"type":216},{"text":370},{"data":670,"type":41},{"text":373,"level":229},{"data":672,"type":216},{"text":376},{"data":674,"type":277},{"code":379},{"data":676,"type":216},{"text":382},{"data":678,"type":41},{"text":385,"level":229},{"data":680,"type":216},{"text":388},{"data":682,"type":277},{"code":391},{"data":684,"type":216},{"text":394},{"data":686,"type":41},{"text":397,"level":229},{"data":688,"type":216},{"text":400},{"data":690,"type":277},{"code":403},{"data":692,"type":216},{"text":406},{"data":694,"type":277},{"code":409},{"data":696,"type":41},{"text":412,"level":229},{"data":698,"type":216},{"text":415},{"data":700,"type":41},{"text":418,"level":419},{"data":702,"type":216},{"text":422},{"data":704,"type":41},{"text":425,"level":419},{"data":706,"type":216},{"text":428},{"data":708,"type":41},{"text":431,"level":419},{"data":710,"type":216},{"text":434},{"data":712,"type":41},{"text":437,"level":419},{"data":714,"type":216},{"text":440},{"data":716,"type":41},{"text":443,"level":419},{"data":718,"type":216},{"text":446},{"data":720,"type":41},{"text":449,"level":419},{"data":722,"type":216},{"text":452},{"data":724,"type":41},{"text":455,"level":419},{"data":726,"type":216},{"text":458},{"data":728,"type":41},{"text":461,"level":419},{"data":730,"type":216},{"text":464},{"data":732,"type":41},{"text":467,"level":419},{"data":734,"type":216},{"text":470},{"data":736,"type":41},{"text":473,"level":229},{"data":738,"type":216},{"text":476},{"data":740,"type":247},{"items":741,"style":246},[480,481,482,483,484],{"data":743,"type":216},{"text":487},{"data":745,"type":41},{"text":490,"level":229},{"data":747,"type":216},{"text":493},{"data":749,"type":277},{"code":496},{"data":751,"type":216},{"text":499},{"data":753,"type":277},{"code":502},{"data":755,"type":41},{"text":505,"level":229},{"data":757,"type":277},{"code":508},{"data":759,"type":216},{"text":511},{"data":761,"type":41},{"text":514,"level":229},{"data":763,"type":216},{"text":517},{"data":765,"type":216},{"text":520},{"data":767,"type":41},{"text":523,"level":229},{"data":769,"type":247},{"items":770,"style":264},[527,528,529,530,531],{"data":772,"type":277},{"code":534},{"data":774,"type":216},{"text":537},{"data":776,"type":41},{"text":540,"level":229},{"data":778,"type":216},{"text":543},{"data":780,"type":216},{"text":546},{"data":782,"type":41},{"text":549,"level":229},{"data":784,"type":216},{"text":552},{"data":786,"type":277},{"code":555},{"data":788,"type":216},{"text":558},{"lang":790,"title":791,"content":792,"contentJson":793,"excerpt":1126},"en","AI Agent Reliability: Why the Final Answer Is Not Enough","{\"time\":1788955485785,\"blocks\":[{\"data\":{\"text\":\"\u003Cb>Correct output does not prove correct reasoning, safe execution, or a trustworthy system.\u003C\u002Fb>\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"For years, AI evaluation has been dominated by a deceptively simple question: \u003Cb>Was the answer correct?\u003C\u002Fb> For a chatbot, this may sometimes be sufficient. For an agent capable of searching systems, reading data, calling tools, modifying state, executing workflows, writing files, interacting with APIs, or making decisions, it is not.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"An agent can produce the correct final answer while doing several things wrong on the way there. It can use the wrong source, misunderstand an instruction and later compensate for the mistake, access unnecessary information, execute an unauthorized intermediate action, silently recover from an error that should have triggered escalation, or leave behind side effects nobody noticed.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"That creates one of the central problems of agentic AI: \u003Cb>a correct outcome does not prove a correct trajectory.\u003C\u002Fb>\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"The Outcome Illusion\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Traditional software gives us an intuitive model of correctness. Input enters a deterministic or mostly deterministic system, logic is executed, output is produced, and tests verify expected behavior. LLM-based systems weaken this assumption. Agentic systems go further.\"},\"type\":\"paragraph\"},{\"data\":{\"items\":[\"model interpretation\",\"retrieved context\",\"tool selection\",\"intermediate observations\",\"external state\",\"previous actions\",\"model-generated plans\",\"permission boundaries\",\"retries and fallback behavior\",\"human interaction\"],\"style\":\"unordered\"},\"type\":\"list\"},{\"data\":{\"text\":\"Two executions starting from nearly identical inputs may reach the same result through very different paths. If evaluation observes only the final output, most of the system remains invisible.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Imagine an AI agent receives the instruction: \u003Ci>Update the customer's billing address.\u003C\u002Fi> The address is ultimately updated correctly. A conventional evaluation might classify the task as successful.\"},\"type\":\"paragraph\"},{\"data\":{\"items\":[\"The agent searches several unrelated customer records.\",\"It retrieves more personal information than required.\",\"It initially modifies the wrong account.\",\"It notices the mistake.\",\"It reverses the change.\",\"It updates the correct account.\",\"It reports success.\"],\"style\":\"ordered\"},\"type\":\"list\"},{\"data\":{\"text\":\"\u003Cb>Final state: correct. System behavior: unacceptable.\u003C\u002Fb> An outcome-only benchmark gives this execution a pass. A production assurance system should not.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"The Trajectory Is Part of the Product\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"This is why the \u003Cb>trajectory\u003C\u002Fb> of an AI agent must become a first-class engineering object. A trajectory is the sequence of relevant states and actions between the original request and the final result.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Intent → Context → Decision → Tool → Action → Observation → Decision → State change → Result\"},\"type\":\"code\"},{\"data\":{\"text\":\"Zachary J. Stevens develops this idea in \u003Ci>The Trajectory Is the System\u003C\u002Fi>, arguing that agentic evaluation must move beyond the final answer and examine the complete path of action through a changing environment.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"A correct outcome does not excuse an unacceptable trajectory.\",\"caption\":\"Zachary J. Stevens, The Trajectory Is the System\",\"alignment\":\"left\"},\"type\":\"quote\"},{\"data\":{\"link\":\"https:\u002F\u002Fzacharyjstevens.com\u002Fdispatches\u002Fvanguard-signal\u002F009-the-trajectory-is-the-system\u002F\",\"meta\":{\"image\":{},\"title\":\"The Trajectory Is the System\",\"description\":\"Zachary J. Stevens — DFEI.009 on evaluating agentic systems by their complete trajectory rather than only the final outcome.\"}},\"type\":\"linkTool\"},{\"data\":{\"text\":\"The distinction matters enormously. Reliability is therefore not simply \u003Cb>correct output\u003C\u002Fb>. It is closer to \u003Cb>acceptable outcome + acceptable trajectory + recoverability + evidence\u003C\u002Fb>.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"A Correct Answer Can Hide a Broken System\",\"level\":2},\"type\":\"header\"},{\"data\":{\"content\":[[\"Agent\",\"Final result\",\"Execution\"],[\"A\",\"Correct\",\"Correct path\"],[\"B\",\"Correct\",\"Unsafe path\"],[\"C\",\"Incorrect\",\"Safe failure\"],[\"D\",\"Incorrect\",\"Unsafe failure\"]],\"withHeadings\":true},\"type\":\"table\"},{\"data\":{\"text\":\"Most benchmark-driven evaluation strongly rewards A and B and penalizes C and D. Operationally, however, \u003Cb>B can be more dangerous than C\u003C\u002Fb>. Agent C may recognize uncertainty, stop execution and request human review. Agent B may confidently produce correct results while violating assumptions that nobody is monitoring.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"successful output → increased trust → broader permissions → more automation → larger blast radius\"},\"type\":\"code\"},{\"data\":{\"text\":\"We Need Evidence, Not Confidence\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"One of the biggest mistakes in AI adoption is treating model confidence, user satisfaction or historical success rate as evidence of system reliability. They are not equivalent.\"},\"type\":\"paragraph\"},{\"data\":{\"items\":[\"What did the agent receive?\",\"What context did it retrieve?\",\"Which tools did it call?\",\"Why was the action allowed?\",\"What state existed before the action?\",\"What changed?\",\"Which intermediate failures occurred?\",\"Was anything retried?\",\"Was human approval required?\",\"Could execution have been stopped?\",\"Can the action be reversed?\",\"Which model, prompt and tool versions were involved?\"],\"style\":\"unordered\"},\"type\":\"list\"},{\"data\":{\"text\":\"Without these answers, there is no serious operational assurance. There is only an output. Observability and evidence must therefore be designed into agent architecture rather than added after deployment.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Logging Is Not the Same as Control\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Organizations often respond: \u003Ci>Everything is logged.\u003C\u002Fi> Good. But logging alone does not control anything. A log tells you what happened. A control determines whether something \u003Cb>may happen\u003C\u002Fb>.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Agent requests DELETE \u002Fcustomer\u002F123 ↓\\nAction logged ↓\\nDELETE executed\"},\"type\":\"code\"},{\"data\":{\"text\":\"That gives observability. Compare it with:\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Agent requests DELETE \u002Fcustomer\u002F123 ↓\\nPolicy evaluation ↓\\nCurrent identity verified ↓\\nCurrent action parameters checked ↓\\nRisk threshold evaluated ↓\\nHuman approval if required ↓\\nAction executed ↓\\nResult verified ↓\\nEvidence stored\"},\"type\":\"code\"},{\"data\":{\"text\":\"Now we are approaching a control system. The difference is architectural, not cosmetic.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Permission Is Necessary — but It Is Not Assurance\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Suppose an agent has permission to send email. Access control answers: \u003Cb>Can this agent send email?\u003C\u002Fb> It does not answer: \u003Cb>Should this particular email be sent to this particular person with this particular attachment right now?\u003C\u002Fb>\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"CAPABILITY CONTROL\\nWhat is the agent technically allowed to do? + ACTION ASSURANCE\\nIs this specific action appropriate in the current state?\"},\"type\":\"code\"},{\"data\":{\"text\":\"RBAC, OAuth scopes, API permissions and agent identities define the space of possible actions. They do not prove that an action inside that space is appropriate. Strong agent architecture needs both layers.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"The First Wrong Step Matters\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"When an agent fails, the final incorrect action is often not where the failure started. The real failure may have happened much earlier.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Wrong retrieval ↓\\nWrong assumption ↓\\nPlausible reasoning ↓\\nValid tool call ↓\\nWrong action\"},\"type\":\"code\"},{\"data\":{\"text\":\"If we investigate only the final action, we fix the symptom. If we inspect the trajectory, we can identify the \u003Cb>first wrong step\u003C\u002Fb>. That turns an unattributable failure into a concrete engineering problem.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Agent Testing Must Move Beyond Prompt Testing\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Prompts matter, but production agent behavior emerges from an entire system.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"MODEL\\n+\\nSYSTEM PROMPT\\n+\\nCONTEXT\\n+\\nMEMORY\\n+\\nRETRIEVAL\\n+\\nTOOLS\\n+\\nPERMISSIONS\\n+\\nWORKFLOW\\n+\\nEXTERNAL STATE\\n+\\nCONTROL LOGIC\"},\"type\":\"code\"},{\"data\":{\"text\":\"Changing any one of these can change the trajectory. Therefore versioning only the prompt is insufficient.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"model_version\\nprompt_version\\ntool_version\\npolicy_version\\nretrieval_version\\nworkflow_version\\nenvironment_state\\nexecution_id\"},\"type\":\"code\"},{\"data\":{\"text\":\"Acceptance Criteria for Agents Must Include Behavior\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Traditional acceptance criteria often look like this: \u003Ci>Given X, the system produces Y.\u003C\u002Fi> For agentic systems, that is incomplete. Acceptance criteria should also define constraints on the trajectory.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Outcome\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"The customer's address is updated correctly.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Authorization\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"The agent modifies only the explicitly selected customer.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Data access\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"No unrelated customer records are accessed.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Tools\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"Only approved CRM operations are used.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Verification\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"The new address is read back and compared with the requested value.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Failure\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"Ambiguous identity resolution stops execution.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Human authority\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"A human can reject the modification before execution when risk thresholds require approval.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Evidence\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"The execution leaves a trace sufficient to reconstruct the decision and state transition.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Recovery\",\"level\":3},\"type\":\"header\"},{\"data\":{\"text\":\"The previous value remains recoverable.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Human-in-the-Loop Is Not Enough\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Adding a human approval box does not automatically solve the problem. A human can only control an agent if the person has visibility, authority, time, context and recovery capability.\"},\"type\":\"paragraph\"},{\"data\":{\"items\":[\"\u003Cb>Visibility:\u003C\u002Fb> enough information to understand what is happening.\",\"\u003Cb>Authority:\u003C\u002Fb> actual ability to stop or modify the action.\",\"\u003Cb>Time:\u003C\u002Fb> intervention before the consequence occurs.\",\"\u003Cb>Context:\u003C\u002Fb> sufficient evidence to make the decision.\",\"\u003Cb>Recovery capability:\u003C\u002Fb> ability to reverse or repair the action.\"],\"style\":\"unordered\"},\"type\":\"list\"},{\"data\":{\"text\":\"A user clicking \u003Cb>Approve\u003C\u002Fb> on something they cannot meaningfully inspect is not strong governance. It is approval theater.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Rollback Must Become a Native AI Capability\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Traditional software deployment has taught us something valuable: \u003Cb>Never deploy what you cannot roll back.\u003C\u002Fb> We should apply the same principle to agentic actions.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"REVERSIBLE\\nCan automatically undo. COMPENSATABLE\\nCannot undo directly but can execute a compensating action. IRREVERSIBLE\\nCannot reliably restore the previous state.\"},\"type\":\"code\"},{\"data\":{\"text\":\"The higher the irreversibility, the stronger the control requirement should become.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Read public document → low consequence\\nCreate draft → reversible\\nModify CRM record → reversible but consequential\\nSend external email → practically irreversible\\nTransfer money → high consequence\\nDelete production data → potentially catastrophic\"},\"type\":\"code\"},{\"data\":{\"text\":\"The Agent Needs a Control Plane\",\"level\":2},\"type\":\"header\"},{\"data\":{\"code\":\"USER \u002F SYSTEM INTENT │ ▼ AI AGENT │ proposed action │ ▼ ┌───────────────────┐ │ CONTROL PLANE │ ├───────────────────┤ │ Identity │ │ Authorization │ │ Policy │ │ Risk │ │ State │ │ Evidence │ │ Human authority │ │ Rollback │ └───────────────────┘ │ approved? \u002F \\\\ NO YES │ │ STOP ▼ TOOL │ ▼ STATE CHANGE │ ▼ VERIFICATION\"},\"type\":\"code\"},{\"data\":{\"text\":\"\u003Cb>The LLM should propose. The control plane should govern.\u003C\u002Fb> That separation is crucial. The model should not be the ultimate authority determining whether its own proposed high-impact action is safe.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"From Benchmarks to Operational Trust\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Benchmarks remain useful. They tell us about capability, compare models, detect regressions and help estimate expected performance. But capability evaluation and operational trust answer different questions.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"A benchmark asks: \u003Cb>Can the system do this?\u003C\u002Fb> Operational assurance asks: \u003Cb>Can we allow the system to do this here, under these conditions, with these permissions and consequences?\u003C\u002Fb>\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Reliability Should Be Measured as a System Property\",\"level\":2},\"type\":\"header\"},{\"data\":{\"items\":[\"\u003Cb>Outcome correctness:\u003C\u002Fb> Did the system produce the expected result?\",\"\u003Cb>Trajectory correctness:\u003C\u002Fb> Did it follow an acceptable path?\",\"\u003Cb>Control integrity:\u003C\u002Fb> Were authorization, policy and intervention boundaries respected?\",\"\u003Cb>Recoverability:\u003C\u002Fb> Can failures be contained, reversed or repaired?\",\"\u003Cb>Evidence completeness:\u003C\u002Fb> Can the execution be reconstructed and audited?\"],\"style\":\"ordered\"},\"type\":\"list\"},{\"data\":{\"code\":\"Operational Reliability\\n=\\nOutcome × Trajectory × Control × Recoverability × Evidence\"},\"type\":\"code\"},{\"data\":{\"text\":\"The multiplication is intentional. If one critical dimension approaches zero, a high score elsewhere should not hide it. A perfectly correct output with zero authorization integrity is not an 80% reliable system. It is an unacceptable execution that happened to produce the right answer.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Success Is Sometimes the Most Dangerous Failure\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"Failures attract attention. Success often does not. That makes successful but uncontrolled agent trajectories particularly dangerous. An obvious failure creates an incident. A hidden trajectory defect creates \u003Cb>confidence\u003C\u002Fb>. And confidence expands autonomy.\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Organizations should therefore not only investigate \u003Ci>Why did the agent fail?\u003C\u002Fi> They should periodically ask: \u003Cb>Why did the agent succeed?\u003C\u002Fb> Did it succeed because the architecture reliably constrained and verified the execution, or because nothing went wrong this time?\"},\"type\":\"paragraph\"},{\"data\":{\"text\":\"Conclusion\",\"level\":2},\"type\":\"header\"},{\"data\":{\"text\":\"The industry is moving rapidly from AI that \u003Cb>answers\u003C\u002Fb> toward AI that \u003Cb>acts\u003C\u002Fb>. That transition changes what reliability means. For an answer system, evaluating the answer may often be sufficient. For an action system, we must evaluate the path.\"},\"type\":\"paragraph\"},{\"data\":{\"code\":\"Prompt ↓\\nResponse becomes Intent ↓\\nTrajectory ↓\\nActions ↓\\nState changes ↓\\nEvidence ↓\\nOutcome\"},\"type\":\"code\"},{\"data\":{\"text\":\"The final answer remains important, but it is only the visible end of a much larger system. Once AI is allowed to affect the real world, \u003Cb>the path to the answer becomes part of the answer.\u003C\u002Fb>\"},\"type\":\"paragraph\"}],\"version\":\"2.31.0\"}",{"time":794,"blocks":795,"version":1125},1788955485785,[796,799,802,805,808,811,814,827,830,833,843,846,849,852,855,858,862,868,871,874,890,893,896,899,902,917,920,923,926,929,932,935,938,941,944,947,950,953,956,959,962,965,968,971,974,977,980,983,986,989,992,995,998,1001,1004,1007,1010,1013,1016,1019,1022,1025,1028,1031,1034,1037,1040,1043,1051,1054,1057,1060,1063,1066,1069,1072,1075,1078,1081,1084,1087,1090,1098,1101,1104,1107,1110,1113,1116,1119,1122],{"data":797,"type":216},{"text":798},"\u003Cb>Correct output does not prove correct reasoning, safe execution, or a trustworthy system.\u003C\u002Fb>",{"data":800,"type":216},{"text":801},"For years, AI evaluation has been dominated by a deceptively simple question: \u003Cb>Was the answer correct?\u003C\u002Fb> For a chatbot, this may sometimes be sufficient. For an agent capable of searching systems, reading data, calling tools, modifying state, executing workflows, writing files, interacting with APIs, or making decisions, it is not.",{"data":803,"type":216},{"text":804},"An agent can produce the correct final answer while doing several things wrong on the way there. It can use the wrong source, misunderstand an instruction and later compensate for the mistake, access unnecessary information, execute an unauthorized intermediate action, silently recover from an error that should have triggered escalation, or leave behind side effects nobody noticed.",{"data":806,"type":216},{"text":807},"That creates one of the central problems of agentic AI: \u003Cb>a correct outcome does not prove a correct trajectory.\u003C\u002Fb>",{"data":809,"type":41},{"text":810,"level":229},"The Outcome Illusion",{"data":812,"type":216},{"text":813},"Traditional software gives us an intuitive model of correctness. Input enters a deterministic or mostly deterministic system, logic is executed, output is produced, and tests verify expected behavior. LLM-based systems weaken this assumption. Agentic systems go further.",{"data":815,"type":247},{"items":816,"style":246},[817,818,819,820,821,822,823,824,825,826],"model interpretation","retrieved context","tool selection","intermediate observations","external state","previous actions","model-generated plans","permission boundaries","retries and fallback behavior","human interaction",{"data":828,"type":216},{"text":829},"Two executions starting from nearly identical inputs may reach the same result through very different paths. If evaluation observes only the final output, most of the system remains invisible.",{"data":831,"type":216},{"text":832},"Imagine an AI agent receives the instruction: \u003Ci>Update the customer's billing address.\u003C\u002Fi> The address is ultimately updated correctly. A conventional evaluation might classify the task as successful.",{"data":834,"type":247},{"items":835,"style":264},[836,837,838,839,840,841,842],"The agent searches several unrelated customer records.","It retrieves more personal information than required.","It initially modifies the wrong account.","It notices the mistake.","It reverses the change.","It updates the correct account.","It reports success.",{"data":844,"type":216},{"text":845},"\u003Cb>Final state: correct. System behavior: unacceptable.\u003C\u002Fb> An outcome-only benchmark gives this execution a pass. A production assurance system should not.",{"data":847,"type":41},{"text":848,"level":229},"The Trajectory Is Part of the Product",{"data":850,"type":216},{"text":851},"This is why the \u003Cb>trajectory\u003C\u002Fb> of an AI agent must become a first-class engineering object. A trajectory is the sequence of relevant states and actions between the original request and the final result.",{"data":853,"type":277},{"code":854},"Intent → Context → Decision → Tool → Action → Observation → Decision → State change → Result",{"data":856,"type":216},{"text":857},"Zachary J. Stevens develops this idea in \u003Ci>The Trajectory Is the System\u003C\u002Fi>, arguing that agentic evaluation must move beyond the final answer and examine the complete path of action through a changing environment.",{"data":859,"type":286},{"text":860,"caption":861,"alignment":285},"A correct outcome does not excuse an unacceptable trajectory.","Zachary J. Stevens, The Trajectory Is the System",{"data":863,"type":294},{"link":289,"meta":864},{"image":865,"title":866,"description":867},{},"The Trajectory Is the System","Zachary J. Stevens — DFEI.009 on evaluating agentic systems by their complete trajectory rather than only the final outcome.",{"data":869,"type":216},{"text":870},"The distinction matters enormously. Reliability is therefore not simply \u003Cb>correct output\u003C\u002Fb>. It is closer to \u003Cb>acceptable outcome + acceptable trajectory + recoverability + evidence\u003C\u002Fb>.",{"data":872,"type":41},{"text":873,"level":229},"A Correct Answer Can Hide a Broken System",{"data":875,"type":322},{"content":876,"withHeadings":13},[877,880,883,885,888],[305,878,879],"Final result","Execution",[309,881,882],"Correct","Correct path",[313,881,884],"Unsafe path",[316,886,887],"Incorrect","Safe failure",[320,886,889],"Unsafe failure",{"data":891,"type":216},{"text":892},"Most benchmark-driven evaluation strongly rewards A and B and penalizes C and D. Operationally, however, \u003Cb>B can be more dangerous than C\u003C\u002Fb>. Agent C may recognize uncertainty, stop execution and request human review. Agent B may confidently produce correct results while violating assumptions that nobody is monitoring.",{"data":894,"type":277},{"code":895},"successful output → increased trust → broader permissions → more automation → larger blast radius",{"data":897,"type":41},{"text":898,"level":229},"We Need Evidence, Not Confidence",{"data":900,"type":216},{"text":901},"One of the biggest mistakes in AI adoption is treating model confidence, user satisfaction or historical success rate as evidence of system reliability. They are not equivalent.",{"data":903,"type":247},{"items":904,"style":246},[905,906,907,908,909,910,911,912,913,914,915,916],"What did the agent receive?","What context did it retrieve?","Which tools did it call?","Why was the action allowed?","What state existed before the action?","What changed?","Which intermediate failures occurred?","Was anything retried?","Was human approval required?","Could execution have been stopped?","Can the action be reversed?","Which model, prompt and tool versions were involved?",{"data":918,"type":216},{"text":919},"Without these answers, there is no serious operational assurance. There is only an output. Observability and evidence must therefore be designed into agent architecture rather than added after deployment.",{"data":921,"type":41},{"text":922,"level":229},"Logging Is Not the Same as Control",{"data":924,"type":216},{"text":925},"Organizations often respond: \u003Ci>Everything is logged.\u003C\u002Fi> Good. But logging alone does not control anything. A log tells you what happened. A control determines whether something \u003Cb>may happen\u003C\u002Fb>.",{"data":927,"type":277},{"code":928},"Agent requests DELETE \u002Fcustomer\u002F123 ↓\nAction logged ↓\nDELETE executed",{"data":930,"type":216},{"text":931},"That gives observability. Compare it with:",{"data":933,"type":277},{"code":934},"Agent requests DELETE \u002Fcustomer\u002F123 ↓\nPolicy evaluation ↓\nCurrent identity verified ↓\nCurrent action parameters checked ↓\nRisk threshold evaluated ↓\nHuman approval if required ↓\nAction executed ↓\nResult verified ↓\nEvidence stored",{"data":936,"type":216},{"text":937},"Now we are approaching a control system. The difference is architectural, not cosmetic.",{"data":939,"type":41},{"text":940,"level":229},"Permission Is Necessary — but It Is Not Assurance",{"data":942,"type":216},{"text":943},"Suppose an agent has permission to send email. Access control answers: \u003Cb>Can this agent send email?\u003C\u002Fb> It does not answer: \u003Cb>Should this particular email be sent to this particular person with this particular attachment right now?\u003C\u002Fb>",{"data":945,"type":277},{"code":946},"CAPABILITY CONTROL\nWhat is the agent technically allowed to do? + ACTION ASSURANCE\nIs this specific action appropriate in the current state?",{"data":948,"type":216},{"text":949},"RBAC, OAuth scopes, API permissions and agent identities define the space of possible actions. They do not prove that an action inside that space is appropriate. Strong agent architecture needs both layers.",{"data":951,"type":41},{"text":952,"level":229},"The First Wrong Step Matters",{"data":954,"type":216},{"text":955},"When an agent fails, the final incorrect action is often not where the failure started. The real failure may have happened much earlier.",{"data":957,"type":277},{"code":958},"Wrong retrieval ↓\nWrong assumption ↓\nPlausible reasoning ↓\nValid tool call ↓\nWrong action",{"data":960,"type":216},{"text":961},"If we investigate only the final action, we fix the symptom. If we inspect the trajectory, we can identify the \u003Cb>first wrong step\u003C\u002Fb>. That turns an unattributable failure into a concrete engineering problem.",{"data":963,"type":41},{"text":964,"level":229},"Agent Testing Must Move Beyond Prompt Testing",{"data":966,"type":216},{"text":967},"Prompts matter, but production agent behavior emerges from an entire system.",{"data":969,"type":277},{"code":970},"MODEL\n+\nSYSTEM PROMPT\n+\nCONTEXT\n+\nMEMORY\n+\nRETRIEVAL\n+\nTOOLS\n+\nPERMISSIONS\n+\nWORKFLOW\n+\nEXTERNAL STATE\n+\nCONTROL LOGIC",{"data":972,"type":216},{"text":973},"Changing any one of these can change the trajectory. Therefore versioning only the prompt is insufficient.",{"data":975,"type":277},{"code":976},"model_version\nprompt_version\ntool_version\npolicy_version\nretrieval_version\nworkflow_version\nenvironment_state\nexecution_id",{"data":978,"type":41},{"text":979,"level":229},"Acceptance Criteria for Agents Must Include Behavior",{"data":981,"type":216},{"text":982},"Traditional acceptance criteria often look like this: \u003Ci>Given X, the system produces Y.\u003C\u002Fi> For agentic systems, that is incomplete. Acceptance criteria should also define constraints on the trajectory.",{"data":984,"type":41},{"text":985,"level":419},"Outcome",{"data":987,"type":216},{"text":988},"The customer's address is updated correctly.",{"data":990,"type":41},{"text":991,"level":419},"Authorization",{"data":993,"type":216},{"text":994},"The agent modifies only the explicitly selected customer.",{"data":996,"type":41},{"text":997,"level":419},"Data access",{"data":999,"type":216},{"text":1000},"No unrelated customer records are accessed.",{"data":1002,"type":41},{"text":1003,"level":419},"Tools",{"data":1005,"type":216},{"text":1006},"Only approved CRM operations are used.",{"data":1008,"type":41},{"text":1009,"level":419},"Verification",{"data":1011,"type":216},{"text":1012},"The new address is read back and compared with the requested value.",{"data":1014,"type":41},{"text":1015,"level":419},"Failure",{"data":1017,"type":216},{"text":1018},"Ambiguous identity resolution stops execution.",{"data":1020,"type":41},{"text":1021,"level":419},"Human authority",{"data":1023,"type":216},{"text":1024},"A human can reject the modification before execution when risk thresholds require approval.",{"data":1026,"type":41},{"text":1027,"level":419},"Evidence",{"data":1029,"type":216},{"text":1030},"The execution leaves a trace sufficient to reconstruct the decision and state transition.",{"data":1032,"type":41},{"text":1033,"level":419},"Recovery",{"data":1035,"type":216},{"text":1036},"The previous value remains recoverable.",{"data":1038,"type":41},{"text":1039,"level":229},"Human-in-the-Loop Is Not Enough",{"data":1041,"type":216},{"text":1042},"Adding a human approval box does not automatically solve the problem. A human can only control an agent if the person has visibility, authority, time, context and recovery capability.",{"data":1044,"type":247},{"items":1045,"style":246},[1046,1047,1048,1049,1050],"\u003Cb>Visibility:\u003C\u002Fb> enough information to understand what is happening.","\u003Cb>Authority:\u003C\u002Fb> actual ability to stop or modify the action.","\u003Cb>Time:\u003C\u002Fb> intervention before the consequence occurs.","\u003Cb>Context:\u003C\u002Fb> sufficient evidence to make the decision.","\u003Cb>Recovery capability:\u003C\u002Fb> ability to reverse or repair the action.",{"data":1052,"type":216},{"text":1053},"A user clicking \u003Cb>Approve\u003C\u002Fb> on something they cannot meaningfully inspect is not strong governance. It is approval theater.",{"data":1055,"type":41},{"text":1056,"level":229},"Rollback Must Become a Native AI Capability",{"data":1058,"type":216},{"text":1059},"Traditional software deployment has taught us something valuable: \u003Cb>Never deploy what you cannot roll back.\u003C\u002Fb> We should apply the same principle to agentic actions.",{"data":1061,"type":277},{"code":1062},"REVERSIBLE\nCan automatically undo. COMPENSATABLE\nCannot undo directly but can execute a compensating action. IRREVERSIBLE\nCannot reliably restore the previous state.",{"data":1064,"type":216},{"text":1065},"The higher the irreversibility, the stronger the control requirement should become.",{"data":1067,"type":277},{"code":1068},"Read public document → low consequence\nCreate draft → reversible\nModify CRM record → reversible but consequential\nSend external email → practically irreversible\nTransfer money → high consequence\nDelete production data → potentially catastrophic",{"data":1070,"type":41},{"text":1071,"level":229},"The Agent Needs a Control Plane",{"data":1073,"type":277},{"code":1074},"USER \u002F SYSTEM INTENT │ ▼ AI AGENT │ proposed action │ ▼ ┌───────────────────┐ │ CONTROL PLANE │ ├───────────────────┤ │ Identity │ │ Authorization │ │ Policy │ │ Risk │ │ State │ │ Evidence │ │ Human authority │ │ Rollback │ └───────────────────┘ │ approved? \u002F \\ NO YES │ │ STOP ▼ TOOL │ ▼ STATE CHANGE │ ▼ VERIFICATION",{"data":1076,"type":216},{"text":1077},"\u003Cb>The LLM should propose. The control plane should govern.\u003C\u002Fb> That separation is crucial. The model should not be the ultimate authority determining whether its own proposed high-impact action is safe.",{"data":1079,"type":41},{"text":1080,"level":229},"From Benchmarks to Operational Trust",{"data":1082,"type":216},{"text":1083},"Benchmarks remain useful. They tell us about capability, compare models, detect regressions and help estimate expected performance. But capability evaluation and operational trust answer different questions.",{"data":1085,"type":216},{"text":1086},"A benchmark asks: \u003Cb>Can the system do this?\u003C\u002Fb> Operational assurance asks: \u003Cb>Can we allow the system to do this here, under these conditions, with these permissions and consequences?\u003C\u002Fb>",{"data":1088,"type":41},{"text":1089,"level":229},"Reliability Should Be Measured as a System Property",{"data":1091,"type":247},{"items":1092,"style":264},[1093,1094,1095,1096,1097],"\u003Cb>Outcome correctness:\u003C\u002Fb> Did the system produce the expected result?","\u003Cb>Trajectory correctness:\u003C\u002Fb> Did it follow an acceptable path?","\u003Cb>Control integrity:\u003C\u002Fb> Were authorization, policy and intervention boundaries respected?","\u003Cb>Recoverability:\u003C\u002Fb> Can failures be contained, reversed or repaired?","\u003Cb>Evidence completeness:\u003C\u002Fb> Can the execution be reconstructed and audited?",{"data":1099,"type":277},{"code":1100},"Operational Reliability\n=\nOutcome × Trajectory × Control × Recoverability × Evidence",{"data":1102,"type":216},{"text":1103},"The multiplication is intentional. If one critical dimension approaches zero, a high score elsewhere should not hide it. A perfectly correct output with zero authorization integrity is not an 80% reliable system. It is an unacceptable execution that happened to produce the right answer.",{"data":1105,"type":41},{"text":1106,"level":229},"Success Is Sometimes the Most Dangerous Failure",{"data":1108,"type":216},{"text":1109},"Failures attract attention. Success often does not. That makes successful but uncontrolled agent trajectories particularly dangerous. An obvious failure creates an incident. A hidden trajectory defect creates \u003Cb>confidence\u003C\u002Fb>. And confidence expands autonomy.",{"data":1111,"type":216},{"text":1112},"Organizations should therefore not only investigate \u003Ci>Why did the agent fail?\u003C\u002Fi> They should periodically ask: \u003Cb>Why did the agent succeed?\u003C\u002Fb> Did it succeed because the architecture reliably constrained and verified the execution, or because nothing went wrong this time?",{"data":1114,"type":41},{"text":1115,"level":229},"Conclusion",{"data":1117,"type":216},{"text":1118},"The industry is moving rapidly from AI that \u003Cb>answers\u003C\u002Fb> toward AI that \u003Cb>acts\u003C\u002Fb>. That transition changes what reliability means. For an answer system, evaluating the answer may often be sufficient. For an action system, we must evaluate the path.",{"data":1120,"type":277},{"code":1121},"Prompt ↓\nResponse becomes Intent ↓\nTrajectory ↓\nActions ↓\nState changes ↓\nEvidence ↓\nOutcome",{"data":1123,"type":216},{"text":1124},"The final answer remains important, but it is only the visible end of a much larger system. Once AI is allowed to affect the real world, \u003Cb>the path to the answer becomes part of the answer.\u003C\u002Fb>","2.31.0","Correct output does not prove correct reasoning, safe execution, or a trustworthy system.","Post erfolgreich abgerufen",{"items":1129,"source":1200,"manualIds":1201,"manualMatchedIds":1202},[1130,1137,1144,1151,1158,1165,1172,1179,1186,1193],{"id":1131,"slug":1132,"title":1133,"excerpt":1134,"featuredImage":1135,"publishedAt":1136},"477","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","Computer-Use-Agenten: Warum eine erfolgreiche Demo dennoch ein unzuverlässiges System sein kann","Computer-Use-Agenten können mittlerweile beeindruckende Browser- und Desktop-Workflows abschließen, aber ein erfolgreicher Durchlauf beweist Fähigkeit—nicht Zuverlässigkeit. Dieser Artikel zeigt, wie man Wiederholbarkeit, Umgebungsrobustheit, Steuerung über lange Zeithorizonte, Zustandsbewusstsein, Ergebnisüberprüfung und sichere Zielhandhabung testet.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","2026-09-25T12:13:00.000Z",{"id":1138,"slug":1139,"title":1140,"excerpt":1141,"featuredImage":1142,"publishedAt":1143},"478","what-is-rag-the-simplest-explanation-of-how-it-works","Was ist RAG? Die einfachste Erklärung, wie es funktioniert","RAG klingt kompliziert, aber die Idee ist einfach: Bevor eine KI antwortet, sucht sie zunächst nützliche Informationen aus einer Wissensquelle und gibt diese Informationen an das Sprachmodell weiter. Dieser Leitfaden erklärt RAG, LLMs, Zustand, Gedächtnis und Werkzeuge anhand eines einfachen mentalen Modells.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":1145,"slug":1146,"title":1147,"excerpt":1148,"featuredImage":1149,"publishedAt":1150},"489","agentic-ai-explained-when-an-ai-system-can-plan-use-tools-and-act","Agentische KI erklärt: Wenn ein KI-System planen, Werkzeuge nutzen und handeln kann","Agentische KI verwendet Modelle innerhalb mehrstufiger Ausführungsschleifen, in denen sie Werkzeuge auswählen, Ergebnisse beobachten, den Zustand aktualisieren und ihre nächste Aktion innerhalb expliziter Laufzeit- und Berechtigungsgrenzen anpassen können.","\u002Fuploads\u002F2026\u002F10\u002Fagentic-ai-explained-when-an-ai-system-can-plan-use-tools-and-act-1791481499084-wnji2a.webp","2026-10-08T11:43:00.000Z",{"id":1152,"slug":1153,"title":1154,"excerpt":1155,"featuredImage":1156,"publishedAt":1157},"479","where-does-an-llm-get-its-data-rag-data-sources-in-python","Woher bezieht ein LLM seine Daten? RAG-Datenquellen in Python","Ein LLM kennt deine Dateien, Datenbanken oder APIs nicht auf magische Weise. Diese praktische Fortsetzung der RAG-Reihe zeigt mit einfachem Python, wie externe Daten zu abrufbaren Belegen werden: von Textdateien und SQL bis hin zu Volltextsuche, Embeddings, Kontextzusammenstellung und dem abschließenden LLM-Aufruf.","\u002Fuploads\u002F2026\u002F09\u002Fwhere-does-an-llm-get-its-data-rag-data-sources-in-python-1790517200521-nfsi5i.webp","2026-09-27T05:51:00.000Z",{"id":1159,"slug":1160,"title":1161,"excerpt":1162,"featuredImage":1163,"publishedAt":1164},"459","ollama-is-not-the-product-building-production-ready-open-llm-applications","Ollama ist nicht das Produkt: Entwicklung produktionsreifer Open-LLM-Anwendungen","Das Ausführen eines lokalen Modells mit Ollama ist einfach. Das Erstellen einer produktionsreifen Open-LLM-Anwendung ist schwieriger: Es erfordert RAG, Zugriffskontrolle, Anbieterabstraktion, Evaluierung, Protokollierung, Bereitstellungsdisziplin und eine kontrollierte Anwendungsschicht um das Modell herum.","\u002Fuploads\u002F2026\u002F06\u002Follama-is-not-the-product-building-production-ready-open-llm-applications-1782679361640-h0usqf.webp","2026-06-28T16:39:00.000Z",{"id":1166,"slug":1167,"title":1168,"excerpt":1169,"featuredImage":1170,"publishedAt":1171},"493","mlops-vs-llmops-what-changes-when-the-model-is-an-llm","MLOps vs. LLMOps: Was sich ändert, wenn das Modell ein LLM ist","MLOps betreibt Systeme für maschinelles Lernen; LLMOps erweitert diese Praktiken auf Prompts, Kontext, Retrieval, Anbieter, Tools, Evaluierungen und Laufzeitverhalten rund um große Sprachmodelle.","\u002Fuploads\u002F2026\u002F10\u002Fmlops-vs-llmops-what-changes-when-the-model-is-an-llm-1791487319869-2v7hxo.webp","2026-10-08T15:20:00.000Z",{"id":1173,"slug":1174,"title":1175,"excerpt":1176,"featuredImage":1177,"publishedAt":1178},"480","when-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger","Wann sollte eine KI aufhören, ihrem eigenen Wissen zu vertrauen? — Der Retrieval-Trigger","Ein KI-Modell benötigt nicht für jede Frage einen Retrieval. Das wichtige Problem ist zu erkennen, wann sein internes Wissen nicht mehr ausreicht. Der Retrieval-Trigger ist eine praktische Entscheidungsgrenze, die bestimmt, wann ein KI-System aufhören sollte, sich allein auf das Modellwissen zu verlassen, und vor der Beantwortung externe Evidenz einholen sollte.","\u002Fuploads\u002F2026\u002F09\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger-1790574991244-f4rpyg.webp","2026-09-28T01:49:00.000Z",{"id":1180,"slug":1181,"title":1182,"excerpt":1183,"featuredImage":1184,"publishedAt":1185},"469","rag-failed-but-which-layer-actually-failed-a-diagnostic-method","RAG fehlgeschlagen – aber welche Ebene ist tatsächlich fehlgeschlagen? Eine diagnostische Methode","Wenn eine RAG-Antwort falsch ist, ist es zu vage, das Retrieval oder das Modell verantwortlich zu machen. Diese Diagnosemethode isoliert Quellenabdeckung, Query-Konstruktion, Retrieval, Ranking, Kontextzusammenstellung, Generierung, Evidenzzuordnung und Aktualität – sodass der tatsächliche Fehler reproduziert und behoben werden kann.","\u002Fuploads\u002F2026\u002F09\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method-1790350847177-pior4c.webp","2026-09-24T19:39:00.000Z",{"id":1187,"slug":1188,"title":1189,"excerpt":1190,"featuredImage":1191,"publishedAt":1192},"485","enterprise-ai-architecture-what-changes-when-ai-enters-a-company","Enterprise-KI-Architektur: Was ändert sich, wenn KI in ein Unternehmen eintritt","Enterprise-KI-Architektur erklärt, wie KI Unternehmenssysteme über Datenhoheit, Identität, Berechtigungen, Anbieter, Risiko, Governance, Evaluierung, Compliance und Betrieb hinweg verändert.","\u002Fuploads\u002F2026\u002F10\u002Fenterprise-ai-architecture-what-changes-when-ai-enters-a-company-1791478161363-czrwaq.webp","2026-10-08T10:48:00.000Z",{"id":1194,"slug":1195,"title":1196,"excerpt":1197,"featuredImage":1198,"publishedAt":1199},"364","tipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung","Meistern des SEO-Workflows: Essenzielle Optimierungsstrategien für organisches Wachstum","Ein strukturierter SEO-Workflow ist entscheidend für nachhaltiges organisches Wachstum. Lerne die zehn grundlegenden Strategien, von der Keyword-Recherche und technischen Optimierung bis hin zur Content-Qualität und Performance-Analyse.","\u002Fuploads\u002F2026\u002F03\u002Ftipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung-1774866098131-hwkzrg.webp","2024-01-26T06:35:00.000Z","fallback",[],[]]