[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:de":3,"public-menus:all":37,"post:computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system:de":204,"related:post:computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system:de:1":1915},{"statusCode":4,"data":5,"message":36},200,{"tenantId":6,"lang":7,"defaultLang":7,"siteUrl":8,"contactEmail":9,"brandName":10,"logoUrl":11,"siteName":10,"siteDescription":12,"ogImage":9,"robotsIndex":13,"socialLinks":9,"reservedSlugs":9,"seoPolicy":14},"stajic","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":15,"relatedContent":16,"crossDomainLinks":17},{"logoUrl":11},{"enabled":13},[18,21,24,27,30,33],{"url":19,"label":20,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":22,"label":23,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":25,"label":26,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.com","bazify.com",{"url":28,"label":29,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.de","bazify.de",{"url":31,"label":32,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.at","bazify.at",{"url":34,"label":35,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[38,44],{"id":39,"name":40,"location":41,"isActive":13,"isDefault":42,"items":43},1,"main-navigation","header",false,[],{"id":45,"name":46,"location":47,"isActive":13,"isDefault":13,"items":48},4,"main-menu","sidebar",[49,65,78,92,102,117,132],{"id":50,"title":51,"url":59,"target":60,"icon":61,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":63,"portfolioId":9,"children":64},"item-18",{"de":52,"en":53,"es":54,"fr":55,"it":53,"ru":56,"sr":57,"zh":58},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":66,"title":67,"url":74,"target":60,"icon":75,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":76,"portfolioId":9,"children":77},"item-22",{"de":68,"en":68,"es":69,"fr":68,"it":70,"ru":71,"sr":72,"zh":73},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":79,"title":80,"url":88,"target":60,"icon":89,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":90,"portfolioId":9,"children":91},"item-19",{"de":81,"en":82,"es":83,"fr":82,"it":84,"ru":85,"sr":86,"zh":87},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":93,"title":94,"url":98,"target":60,"icon":99,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":100,"portfolioId":9,"children":101},"item-23",{"de":95,"en":95,"es":95,"fr":95,"it":95,"ru":96,"sr":96,"zh":97},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":103,"title":104,"url":113,"target":60,"icon":114,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":115,"portfolioId":9,"children":116},"item-32",{"de":105,"en":106,"es":107,"fr":108,"it":109,"ru":110,"sr":111,"zh":112},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":118,"title":119,"url":128,"target":60,"icon":129,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":130,"portfolioId":9,"children":131},"item-20",{"de":120,"en":121,"es":122,"fr":123,"it":124,"ru":125,"sr":126,"zh":127},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":133,"title":134,"url":143,"target":60,"icon":144,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":146},"item-21",{"de":135,"en":136,"es":137,"fr":138,"it":139,"ru":140,"sr":141,"zh":142},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[147,160,174,180,192],{"id":148,"title":149,"url":143,"target":60,"icon":158,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":159},"item-24",{"de":150,"en":151,"es":152,"fr":153,"it":154,"ru":155,"sr":156,"zh":157},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":161,"title":162,"url":170,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":173},"item-29",{"de":163,"en":164,"es":165,"fr":166,"it":167,"ru":168,"sr":169,"zh":142},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":175,"title":176,"url":178,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":179},"item-28",{"de":177,"en":177,"es":177,"fr":177,"it":177,"ru":177,"sr":177,"zh":177},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":181,"title":182,"url":190,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":191},"item-27",{"de":183,"en":184,"es":185,"fr":186,"it":187,"ru":188,"sr":189,"zh":184},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":193,"title":194,"url":202,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":203},"item-31",{"de":195,"en":196,"es":197,"fr":198,"it":199,"ru":200,"sr":201,"zh":196},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":205,"message":1914},{"id":206,"title":207,"slug":208,"content":209,"contentJson":210,"excerpt":938,"featuredImage":939,"featuredImageAlt":940,"featuredImageCaption":9,"featuredImageTitle":9,"featuredImageCopyright":9,"featuredImageAuthor":9,"featuredImageSourceUrl":9,"featuredImageLicense":9,"featuredImageIsAiGenerated":42,"status":941,"publishedAt":942,"createdAt":943,"updatedAt":944,"seoLocalePaths":945,"categories":954,"author":967,"translations":972},"477","Computer-Use-Agenten: Warum eine erfolgreiche Demo dennoch ein unzuverlässiges System sein kann","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Inhalt\">\u003Cstrong class=\"editorjs-toc__title\">Inhalt\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-6\" class=\"editorjs-toc__link\">Warum die Demo der denkbar einfachste Zuverlässigkeitstest ist\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">Leistungsfähigkeit, Erfolgsquote, Zuverlässigkeit und Sicherheit sind unterschiedliche Aussagen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-12\" class=\"editorjs-toc__link\">Die Zuverlässigkeitsleiter für Computer-Use\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-15\" class=\"editorjs-toc__link\">Stufe 1 – Leistungsfähigkeit: Die Demo-Frage\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-18\" class=\"editorjs-toc__link\">Stufe 2 – Wiederholbarkeit: Bleibt dieselbe Aufgabe gelöst?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-21\" class=\"editorjs-toc__link\">Stufe 3 — Robustheit gegenüber der Umgebung: Was passiert, wenn sich das Web wie das Web verhält?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-25\" class=\"editorjs-toc__link\">Stufe 4 — Langzeitorchestrierung: Erfolg verändert sich, wenn die Aufgabe zu echter Arbeit wird\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-29\" class=\"editorjs-toc__link\">Stufe 5 — Zustandsbewusstsein: Die Umgebung kann sich unter dem Plan verändern\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">Stufe 6 — Ergebnisüberprüfung: Hat die Aktion tatsächlich funktioniert?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-37\" class=\"editorjs-toc__link\">Stufe 7 — Sicherer Umgang mit Zielen: Der Agent muss wissen, wann er nicht weitermachen darf\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-41\" class=\"editorjs-toc__link\">Der Stresstest vom Prototyp zur Produktion\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-44\" class=\"editorjs-toc__link\">Benchmark-Erfolg hat eine Gültigkeitsgrenze\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-48\" class=\"editorjs-toc__link\">Prozess- und Ergebnis-Erfolg müssen getrennt bewertet werden\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-51\" class=\"editorjs-toc__link\">Produktionszuverlässigkeit ist eine Verteilung, keine einzelne Erfolgsquote\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-54\" class=\"editorjs-toc__link\">Zuverlässigkeit erfordert ein Fehlerbudget, keine Perfektion\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-57\" class=\"editorjs-toc__link\">Eine praktische Zuverlässigkeitsmatrix für die Computernutzung\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-59\" class=\"editorjs-toc__link\">Was bei einem Fehler bei der Computernutzung protokolliert werden sollte\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-63\" class=\"editorjs-toc__link\">Sicherheit ist ein Teil der Zuverlässigkeit für computergestützte Agenten\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-67\" class=\"editorjs-toc__link\">Was würde diese Einschätzung ändern?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-70\" class=\"editorjs-toc__link\">Grenzen und Einschränkungen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-73\" class=\"editorjs-toc__link\">Fazit\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-76\" class=\"editorjs-toc__link\">FAQ\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-78\" class=\"editorjs-toc__link\">Glossar\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-80\" class=\"editorjs-toc__link\">Primärquellen und weiterführende Literatur\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>Computer-Use-Agenten können mittlerweile klicken, tippen, im Web surfen, Dateien bearbeiten, Desktop-Anwendungen bedienen und beeindruckende mehrstufige Aufgaben erledigen. Das macht erfolgreiche Demos leicht verständlich – und verleitet dazu, sie überzuinterpretieren. Ein einzelner abgeschlossener Workflow zeigt lediglich, dass der Agent unter genau diesen Bedingungen erfolgreich sein kann. Er zeigt nicht, wie oft er erfolgreich ist, wie er sich bei Veränderungen der Umgebung verhält, ob er das Ergebnis überprüft oder wie sicher er agiert, wenn das Ziel mehrdeutig wird.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Direkte Antwort\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">&lt;strong&gt;Eine erfolgreiche Computer-Use-Demo beweist Leistungsfähigkeit, nicht Zuverlässigkeit.&lt;\u002Fstrong&gt; Zuverlässigkeit im Produktivbetrieb erfordert, dass der Agent bei Umgebungsschwankungen wiederholt erfolgreich ist, sich von vorübergehenden Fehlern erholt, Rahmenbedingungen über lange Zeiträume einhält, verborgene oder sich verändernde Zustände erkennt, das tatsächliche Ergebnis verifiziert und anhält oder nachfragt, wenn das Ziel mehrdeutig oder unsicher wird. Die richtige Frage für den Produktiveinsatz lautet nicht: „Kann der Agent diese Aufgabe erledigen?“, sondern: „Unter welchen Bedingungen können wir ihm vertrauen, diese Aufgabe wiederholt auszuführen?“\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Ein sich schnell entwickelndes Feld\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Dieser Artikel spiegelt den Forschungsstand zu Computer-Use-Agenten sowie Plattformrichtlinien mit Stand vom &lt;strong&gt;25. September 2026&lt;\u002Fstrong&gt; wider. Benchmark-Ergebnisse lassen sich nicht ohne Weiteres über unterschiedliche Aufgabensets, Umgebungen, Modelle, Schrittlimits, Bewertungsinstanzen oder Testumgebungen hinweg vergleichen. Betrachten Sie jeden Benchmark-Wert stets im Kontext seiner spezifischen Evaluierungsbedingungen.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Das in diesem Artikel verwendete Modell\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Die nachfolgende Zuverlässigkeitsleiter für Computer-Use sowie der Stresstest vom Demo- zum Produktivbetrieb sind hier vorgeschlagene praktische Evaluierungsmodelle. Sie stellen keine formellen Industriestandards dar.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-6\">Warum die Demo der denkbar einfachste Zuverlässigkeitstest ist\u003C\u002Fh2>\n\u003Cp>Eine Demo zeigt normalerweise einen einzigen Pfad, der funktioniert hat. Die Umgebung ist bekannt, die Aufgabe im Voraus ausgewählt, der Operator kann nach einem Fehlschlag neu starten, und das Publikum sieht den erfolgreichen Ablauf. Produktivsysteme sind stattdessen mit einer Verteilung konfrontiert: unterschiedliche Seiten, Netzwerkbedingungen, Kontostatus, Pop-ups, Latenzen, UI-Änderungen, verborgene Zustände, Berechtigungen, Unterbrechungen und Nutzer, die Ziele unvollständig beschreiben.\u003C\u002Fp>\n\u003Cp>Dieser Unterschied ist entscheidend, da Computer-Use-Agenten über Schnittstellen agieren, die für Menschen und nicht für deterministische APIs entwickelt wurden. Ihre Handlungsschleife hängt von Wahrnehmung, Zustandsinterpretation, Planung, dem Timing von Interaktionen und Reaktionen der Umgebung ab. Kleinste Änderungen können den Ablauf verändern, selbst wenn das Ziel des Nutzers unverändert bleibt.\u003C\u002Fp>\n\u003Cp>Die WAREX-Forschungsarbeit von Microsoft Research verdeutlicht das Problem: Benchmark-Agenten, die in kontrollierten Umgebungen leistungsfähig wirken, büßen erheblich an Erfolgsquote ein, sobald realistische Web-Instabilitäten hinzukommen. Der Fehler liegt nicht zwingend darin, dass „das Modell weniger intelligent wurde“. Die Umgebung hat lediglich aufgehört, deterministisch zu sein.\u003C\u002Fp>\n\u003Ch2 id=\"section-10\">Leistungsfähigkeit, Erfolgsquote, Zuverlässigkeit und Sicherheit sind unterschiedliche Aussagen\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Aussage\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Was sie tatsächlich belegt\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Was sie nicht belegt\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Der Agent hat die Aufgabe einmal abgeschlossen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Leistungsfähigkeit unter einem beobachteten Ablauf\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Wiederholbarkeit, Robustheit, Sicherheit oder Generalisierung\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Der Agent erzielt ein hohes Benchmark-Ergebnis\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Leistung unter den Aufgaben- und Evaluierungsbedingungen dieses Benchmarks\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Gleichwertige Produktivleistung in abweichenden Umgebungen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Der Agent erreicht das Ziel meistens\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Häufigkeit des Zielerreichungserfolgs\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Korrekter Prozess, sicheres Verhalten oder Nachweis, dass das Ergebnis überprüft wurde\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Der Agent folgt dem beabsichtigten Prozess\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Qualität des Ablaufs gemäß dem evaluierten Kriterienkatalog\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Dass die externe Umgebung das Endergebnis tatsächlich akzeptiert hat\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Der Agent vermeidet unsichere Aktionen in einem Testset\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Leistung bei den abgedeckten Sicherheitsfällen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sicherheit bei neuartigen Unklarheiten, Injection-Angriffen oder Seiteneffekten\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-12\">Die Zuverlässigkeitsleiter für Computer-Use\u003C\u002Fh2>\n\u003Cp>Ein sinnvoller Ansatz zur Evaluierung von Computer-Use-Systemen besteht darin, sich von punktueller Leistungsfähigkeit hin zu schrittweise anspruchsvolleren Zuverlässigkeitseigenschaften zu bewegen. Höhere Stufen setzen die unteren Stufen voraus, ergeben sich jedoch nicht automatisch aus ihnen.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Zuverlässigkeitsleiter für Computer-Use\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Leistungsfähigkeit\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Kann der Agent die Aufgabe unter bekannten Bedingungen mindestens einmal abschließen?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Wiederholbarkeit\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Kann er dieselbe Aufgabe über wiederholte Durchläufe hinweg konsistent ausführen?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Robustheit gegenüber Umwelteinflüssen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Hält er Timing-Änderungen, Netzwerkproblemen, Pop-ups, UI-Variationen und kleinen Störungen der Umgebung stand?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Steuerung über lange Horizonte\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Kann er Ziele, Einschränkungen und Fortschritte über viele Schritte, Anwendungen und verzögerte Ereignisse hinweg aufrechterhalten?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Zustandsbewusstsein\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Kann er erkennen, wann sich die Umgebung geändert hat, wann verborgene Zustände eine Rolle spielen oder wann eine Annahme nicht mehr zutrifft?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Ergebnisverifikation\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Überprüft er, ob das beabsichtigte Ergebnis tatsächlich eingetreten ist, anstatt blind auf seine eigene Aktionssequenz zu vertrauen?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Sicherer Umgang mit Zielvorgaben\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Kann er anhalten, nachfragen, ablehnen oder die Kontrolle zurückgeben, wenn das Ziel mehrdeutig, undurchführbar, widersprüchlich oder folgenschwer ist?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch3 id=\"section-15\">Stufe 1 – Leistungsfähigkeit: Die Demo-Frage\u003C\u002Fh3>\n\u003Cp>Die Leistungsfähigkeit fragt, ob ein Agent die Aufgabe überhaupt ausführen kann. Das ist wertvoll. Computer-Use-Systeme haben sich rasant weiterentwickelt, und moderne Agenten können Workflows bewältigen, die ältere Systeme nicht verlässlich ausführen konnten.\u003C\u002Fp>\n\u003Cp>Doch Leistungsfähigkeit ist ein schwaches Kriterium für den Produktiveinsatz. Ein einzelner erfolgreicher Durchlauf verrät Ihnen nicht, ob der Agent in 95 % oder in 30 % der Fälle erfolgreich ist, ob Fehlschläge harmlos oder destruktiv sind oder ob der Erfolg lediglich von einem glücklichen Seitenzustand abhing.\u003C\u002Fp>\n\u003Ch3 id=\"section-18\">Stufe 2 – Wiederholbarkeit: Bleibt dieselbe Aufgabe gelöst?\u003C\u002Fh3>\n\u003Cp>Trajektorien der Computernutzung sind stochastisch. Modellausgaben variieren, Seiten laden mit unterschiedlichen Geschwindigkeiten, visuelle Zustände ändern sich und lange Workflows schaffen viele Verzweigungsmöglichkeiten. Ein Produktionstest sollte daher dieselbe Aufgabe mehrfach ausführen, anstatt einen einzelnen erfolgreichen Durchlauf als repräsentativ zu betrachten.\u003C\u002Fp>\n\u003Cp>Messen Sie nicht nur die durchschnittliche Erfolgsquote, sondern auch die Verteilung der Fehlermuster: falscher Klick, vorzeitiger Abbruch, verpasste Bestätigung, fehlerhaftes Feld, doppelte Aktion, Navigationsschleife, Annahme veralteter Zustände und falsche Erfolgsmeldung.\u003C\u002Fp>\n\u003Ch3 id=\"section-21\">Stufe 3 — Robustheit gegenüber der Umgebung: Was passiert, wenn sich das Web wie das Web verhält?\u003C\u002Fh3>\n\u003Cp>Reale Websites sind keine Benchmark-Prüfstände. Anfragen schlagen fehl, Elemente laden verzögert, Sitzungen laufen ab, Seiten verändern sich, Cookie-Banner tauchen auf, Server geben Fehler zurück und Netzwerkbedingungen schwanken.\u003C\u002Fp>\n\u003Cp>WAREX evaluiert diese Diskrepanz, indem es realistische Web-Unzuverlässigkeiten in bestehende Benchmark-Umgebungen einstreut, und berichtet von erheblichen Einbrüchen beim Aufgabenerfolg. Dies ist eine entscheidende Erkenntnis für den Produktiveinsatz: Ein Benchmark kann die Aufgabenkompetenz messen und gleichzeitig die Fähigkeit zur Wiederherstellung nach Umgebungsinstabilitäten unterschätzen.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Zuverlässigkeitstest\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Bringen Sie Verzögerungen, vorübergehende HTTP-Fehler, veraltete Seitenzustände, Modaldialoge, Sitzungsabläufe, doppelte Antworten und kontrollierte UI-Variationen ein. Funktioniert der Agent nur auf dem Idealpfad, handelt es sich um ein demofähiges System, nicht um ein produktionstaugliches.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-25\">Stufe 4 — Langzeitorchestrierung: Erfolg verändert sich, wenn die Aufgabe zu echter Arbeit wird\u003C\u002Fh3>\n\u003Cp>Kurze Aufgaben verbergen eine Klasse von Fehlern, die erst nach Dutzenden oder Hunderten von Aktionen auftreten: vergessene Einschränkungen, doppelte Arbeit, vorzeitige Fertigstellung, verpasste Zustandsänderungen, Inkonsistenzen über Anwendungen hinweg und kumulierte kleine Fehler.\u003C\u002Fp>\n\u003Cp>OSWorld 2.0 wurde speziell für langfristige Workflows aus der Praxis konzipiert. Menschliche Nutzer benötigen für die Aufgaben im Median etwa 1,6 Stunden, und es sind deutlich mehr Tool-Aufrufe erforderlich als bei früheren Computernutzungs-Benchmarks. Gemessen an der primären Abschlussmetrik sind selbst die stärksten evaluierten Systeme noch weit von einer lückenlosen Aufgabenzuverlässigkeit entfernt.\u003C\u002Fp>\n\u003Cp>WeaveBench kommt aus einer anderen Perspektive zu einem ähnlichen Ergebnis. Es evaluiert hybride Workflows aus GUI, CLI und Code und berichtet, dass das am besten bewertete Modell-Runtime-Paar nur 41,2 % der Aufgaben besteht. Das wichtige Ergebnis ist nicht eine einzelne Zahl auf der Bestenliste; es ist die Tatsache, dass eine realistische schnittstellenübergreifende Orchestrierung Fehler aufdeckt, die bei einfacheren Einzel-Schnittstellen-Aufgaben verborgen bleiben.\u003C\u002Fp>\n\u003Ch3 id=\"section-29\">Stufe 5 — Zustandsbewusstsein: Die Umgebung kann sich unter dem Plan verändern\u003C\u002Fh3>\n\u003Cp>Länger laufende Aufgaben hängen oft von versteckten oder sich verändernden Zuständen ab: Eine E-Mail trifft ein, ein Kalender ändert sich, ein Formular wird abgeschickt, ein Hintergrundprozess wird beendet, eine Browser-Sitzung läuft ab, ein Benutzer ändert eine Datei oder ein externes System ändert seine Verfügbarkeit.\u003C\u002Fp>\n\u003Cp>SentinelBench von Microsoft argumentiert, dass viele länger laufende Aufgaben keineswegs durch kontinuierliches Handeln gelöst werden sollten. Das korrekte Verhalten kann darin bestehen, zu überwachen, auf ein externes Ereignis zu warten und erst bei einer Zustandsänderung zu agieren. Dies ist eine andere Fähigkeit als schneller zu klicken oder mehr Schritte zu planen.\u003C\u002Fp>\n\u003Cp>Ein zuverlässiger Agent zur Computernutzung muss daher zwischen „jetzt ausführbar“, „wartet auf Zustand“, „Zustand geändert“ und „Annahme ungültig“ unterscheiden können.\u003C\u002Fp>\n\u003Ch3 id=\"section-33\">Stufe 6 — Ergebnisüberprüfung: Hat die Aktion tatsächlich funktioniert?\u003C\u002Fh3>\n\u003Cp>Ein Agent kann eine scheinbar korrekte Abfolge ausführen und dennoch an der Aufgabe scheitern. Ein Klick auf eine Schaltfläche wird möglicherweise nicht registriert. Ein Formular lehnt eine unsichtbare Validierung ab. Eine Datei wird im falschen Verzeichnis gespeichert. Ein Kauf bleibt unbestätigt. Eine Website zeigt möglicherweise eine nach Erfolg aussehende Ansicht, während der zugrunde liegende Vorgang fehlgeschlagen ist.\u003C\u002Fp>\n\u003Cp>OpenAIs aktuelle Leitlinien zur Computernutzung empfehlen ausdrücklich, den Ablauf einzugrenzen und zu verifizieren, anstatt sich ausschließlich auf die finale Antwort des Modells zu verlassen. Die Forschung von Microsoft Research zu Verifizierern für die Computernutzung kommt bei Evaluationen zum selben Schluss: Prozess und Ergebnis müssen getrennt voneinander bewertet werden.\u003C\u002Fp>\n\u003Cp>Die Forschung zum Universal Verifier berichtet, dass frühere Verifizierer-Setups hohe Falsch-Positiv-Raten erzeugen können, während ein fundierteres Bewertungsraster und eine explizite Trennung von Prozess, Ergebnis, kontrollierbaren Fehlern und unkontrollierbaren Fehlern die Übereinstimmung mit menschlichen Bewertungen erheblich verbessern.\u003C\u002Fp>\n\u003Ch3 id=\"section-37\">Stufe 7 — Sicherer Umgang mit Zielen: Der Agent muss wissen, wann er nicht weitermachen darf\u003C\u002Fh3>\n\u003Cp>Computer-Use-Agenten sind darauf optimiert, Ziele zu erreichen, aber Zielbeharrlichkeit kann selbst zu einer Fehlerursache werden. Eine mehrdeutige Anfrage, eine unmögliche Bedingung, eine widersprüchliche Anweisung, eine verdächtige Webseite oder eine veränderte Umgebung erfordern möglicherweise eine Klarstellung oder das Abbrechen statt weiteren Handelns.\u003C\u002Fp>\n\u003Cp>Der BLIND-ACT-Benchmark untersucht dieses Problem als blinde Zielgerichtetheit (Blind Goal-Directedness). Bei den in dieser Arbeit evaluierten Systemen verfolgten Agenten Aufgaben häufig weiter, trotz Mehrdeutigkeit, Undurchführbarkeit, widersprüchlichem Kontext oder anderen Gründen zum Innehalten. Die Autoren identifizieren Muster wie den Execution-First-Bias und den Vorrang von Benutzeranfragen (Request Primacy).\u003C\u002Fp>\n\u003Cp>Diese Fehlerklasse ist von Bedeutung, da ein hochgradig fähiger Agent eine schlechte Situation schneller noch verschlimmern kann. Zuverlässigkeit beinhaltet daher auch Richtlinien dafür, wann nicht gehandelt werden darf.\u003C\u002Fp>\n\u003Ch2 id=\"section-41\">Der Stresstest vom Prototyp zur Produktion\u003C\u002Fh2>\n\u003Cp>Bevor Sie einen Computer-Use-Workflow bereitstellen, nehmen Sie die erfolgreiche Demo und entfernen Sie systematisch die Annahmen, die sie einfach gemacht haben.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Stresstest vom Prototyp zur Produktion\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Saubere Aufgabe erneut ausführen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Stellen Sie die Wiederholbarkeit über mehrere Durchläufe hinweg sicher, bevor Sie Komplexität hinzufügen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Umgebung stören\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Fügen Sie Latenz, Neuversuche, Pop-ups, Seitenvariationen, veraltete Sitzungen und vorübergehende Fehler hinzu.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Zeithorizont erweitern\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Verwandeln Sie die kurze Demo in den vollständigen realen Workflow mit Zwischenzuständen, mehreren Anwendungen und zeitverzögerten Schritten.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Verborgenen Zustand ändern\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Modifizieren Sie Konto-, Datei-, Aufgaben- oder externe Zustände, nachdem der Agent einen Plan erstellt hat, und testen Sie, ob er die Änderung bemerkt.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Mehrdeutigkeit einfügen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Entfernen Sie eine wichtige Annahme und testen Sie, ob der Agent nachfragt, anstatt zu raten.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Kontrollierten Widerspruch einfügen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Präsentieren Sie alten und neuen Zustand gemeinsam und überprüfen Sie, ob der maßgebliche aktuelle Zustand Vorrang hat.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Ergebnisnachweis einfordern\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Machen Sie den Aufgabenabschluss von einem verifizierbaren Endzustand abhängig, nicht vom Selbstbericht des Modells.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Folgenkritische Grenzen testen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Bestätigen Sie, dass irreversible oder sensible Aktionen die erwartete Genehmigung, Verweigerung oder Übergabe auslösen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">9\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">9. Nach Harness- oder Modelländerungen wiederholen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Betrachten Sie Laufzeit-Upgrades als Zuverlässigkeitsänderungen, die Regressionstests erfordern.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-44\">Benchmark-Erfolg hat eine Gültigkeitsgrenze\u003C\u002Fh2>\n\u003Cp>Ein Benchmark-Ergebnis ist eine bedingte Aussage. Es gilt für ein bestimmtes Modell, einen bestimmten Harness, eine bestimmte Umgebung, ein bestimmtes Aufgabenset, einen Beurteiler, eine Toolschnittstelle, ein Schrittbudget, eine Retry-Richtlinie, ein Datum und eine Evaluierungsmethode.\u003C\u002Fp>\n\u003Cp>Der Wert wird irreführend, wenn diese Bedingungen aus der Aussage verschwinden. „Agent X erzielt 80 %“ ist schwächer als „Agent X hat auf Benchmark Y in Umgebung Z mit Beurteiler J und Schrittbudget N 80 % erzielt“. Der zweite Satz wahrt die Grenze, die Ihnen verrät, ob die Zahl auf Ihre Anwendung übertragbar ist.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">The Answer Validity Boundary: Die fehlende Ebene zwischen Relevanz und verlässlichen KI-Antworten\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Ein Framework, um die Bedingungen explizit zu machen, unter denen eine KI-Aussage gültig bleibt und welche Änderungen Einschränkungen, Neuberechnungen oder ein Verwerfen erfordern.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Lesen Sie The Answer Validity Boundary →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-48\">Prozess- und Ergebnis-Erfolg müssen getrennt bewertet werden\u003C\u002Fh2>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Vier mögliche Ausgänge eines Computer-Use-Durchlaufs\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Prozess\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Ergebnis\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Interpretation\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Korrekter Prozess \u002F korrektes Ergebnis\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Falscher Prozess \u002F korrektes Ergebnis\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Korrekter Prozess \u002F falsches Ergebnis\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Falscher Prozess \u002F falsches Ergebnis\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>WeaveBench berichtet, dass eine reine Ergebnisbewertung die Computer-Use-Leistung erheblich überschätzen kann, da ein Agent ein scheinbar erfolgreiches Artefakt über eine Abkürzung oder fabrizierte Beweise erzeugen kann. Der Prüfer muss die Trajektorie und die Zwischenergebnisse inspizieren, nicht bloß die finale Behauptung.\u003C\u002Fp>\n\u003Ch2 id=\"section-51\">Produktionszuverlässigkeit ist eine Verteilung, keine einzelne Erfolgsquote\u003C\u002Fh2>\n\u003Cp>Eine aussagekräftige Produktionsevaluierung erfasst die Dimensionen, die in Ihrer Umgebung tatsächlich variieren. Bei einem Browser-Workflow können dies Kontoalter, Sprache\u002FRegion, Viewport, Seitenversion, Netzwerkqualität, Authentifizierungsstatus, bestehender Warenkorbinhalt, Cookies, Pop-ups, Benutzerberechtigungen und die Frage sein, ob ein Mensch den Durchlauf unterbricht.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Dimension\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Beispielhafte Variation\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Warum es wichtig ist\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Umgebung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Schnelles vs. langsames Netzwerk, transiente Fehler, Seiten-Timing\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testet Wiederherstellungs- und Warteverhalten\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">UI\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Anderer Viewport, Modal, umgeordnete Elemente, kleineres Redesign\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testet fragile visuelle\u002Faktionsbezogene Annahmen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Zustand\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">An-\u002Fabgemeldet, leerer\u002Fnicht-leerer Warenkorb, vorhandene Datei, geänderte Berechtigungen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testet das Denken über verborgene Zustände\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Aufgabenhorizont\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">5 Schritte vs. 50+ Schritte, eine App vs. mehrere Apps\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testet akkumulierte Trajektorienfehler\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Mehrdeutigkeit\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Fehlende Präferenz oder unvollständige Benutzeranweisung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testet, ob der Agent nachfragt, anstatt zu raten\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Konsequenz\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Nur lesend vs. kaufen\u002Fsenden\u002Flöschen\u002Fändern\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testet Bestätigungs- und Autorisierungskontrollen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Adversarieller Inhalt\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prompt Injection oder irreführender Seitentext\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testet Anweisungshierarchie und Eindämmung\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modell- \u002F Harness-Version\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Laufzeit-Upgrade\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testet Regressionen durch Änderungen auf Systemebene\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-54\">Zuverlässigkeit erfordert ein Fehlerbudget, keine Perfektion\u003C\u002Fh2>\n\u003Cp>Kein Produktivsystem ist vollkommen zuverlässig. Die entscheidende technische Frage ist, welche Fehler akzeptabel, erkennbar und behebbar sind. Ein fehlgeschlagener Versuch, einen lokalen Ordner zu sortieren, ist nicht gleichbedeutend damit, die falsche E-Mail zu senden, das falsche Produkt zu kaufen oder eine Kontoeinstellung zu ändern.\u003C\u002Fp>\n\u003Cp>Klassifizieren Sie Aktionen nach Tragweite und Reversibilität. Reversible Aktionen mit geringer Auswirkung vertragen mehr Autonomie. Weitreichende, extern sichtbare oder schwer rückgängig zu machende Aktionen erfordern eine stärkere Bestätigung, Zustandsüberprüfung, Autorisierung und Kontrollen nach der Ausführung.\u003C\u002Fp>\n\u003Ch2 id=\"section-57\">Eine praktische Zuverlässigkeitsmatrix für die Computernutzung\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Aktionsklasse\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Beispiel\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Empfohlene Kontrollmaßnahme\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Lesen \u002F Prüfen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Seiten öffnen, Dateien lesen, Informationen sammeln\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Geltungsbereich eingrenzen, Quellen protokollieren, behebbare Navigationsfehler tolerieren\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Reversible lokale Änderung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Entwurfsdatei bearbeiten, temporären Arbeitsbereich neu organisieren\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prüfpunkt (Checkpoint) oder Version vor der Änderung setzen; Ergebnis überprüfen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Externe Kommunikation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">E-Mail senden, Inhalte veröffentlichen, Formular absenden\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Benutzerbestätigung oder explizite delegierte Befugnis; akzeptierten Zustand überprüfen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Finanziell \u002F Transaktional\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kauf, Checkout, kostenpflichtiges Abonnement\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Striktes Mandat, Betrags-\u002FHändlerbeschränkungen, abschließende Bestätigung und Belegprüfung\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Destruktiv \u002F Rechte ändernd\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Daten löschen, Berechtigungen ändern, Zugriff widerrufen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eng gefasste Autorisierung, explizite Bestätigung, reversibler Pfad wo möglich, Audit nach der Ausführung\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-59\">Was bei einem Fehler bei der Computernutzung protokolliert werden sollte\u003C\u002Fh2>\n\u003Cul>\u003Cli>Ziel des Benutzers und explizite Einschränkungen.\u003C\u002Fli>\u003Cli>Modell- und Testumgebungs-Version (Harness).\u003C\u002Fli>\u003Cli>Umgebungs- und Anwendungsversionen.\u003C\u002Fli>\u003Cli>Für den Fehler relevante Screenshots oder strukturierte Beobachtungen.\u003C\u002Fli>\u003Cli>Durchgeführte Aktionen mit Zeitstempeln.\u003C\u002Fli>\u003Cli>Tool-, Klick-, Tastatur- und Navigationsergebnisse.\u003C\u002Fli>\u003Cli>Zustandsübergänge und Wartezeiten.\u003C\u002Fli>\u003Cli>Genehmigungs-, Verweigerungs- oder Übergabe-Ereignisse (Handoffs).\u003C\u002Fli>\u003Cli>Externe Fehler und Netzwerkausfälle.\u003C\u002Fli>\u003Cli>Abschließender beobachtbarer Umgebungszustand.\u003C\u002Fli>\u003Cli>Das vom Agenten gemeldete Ergebnis.\u003C\u002Fli>\u003Cli>Prüfergebnis (Verifier) und ob der Fehler durch den Agenten kontrollierbar war.\u003C\u002Fli>\u003C\u002Ful>\n\u003Cp>Der entscheidende Vergleich findet zwischen dem gemeldeten Erfolg und dem beobachtbaren Erfolg statt. Ein System, das diese beiden nicht unterscheiden kann, wird in der Produktion unweigerlich falsch-positive Ergebnisse anhäufen.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Zuverlässigkeit von KI-Agenten: Warum die finale Antwort nicht ausreicht\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Ein umfassenderes Zuverlässigkeitsmodell zur Bewertung von Agenten-Trajektorien, Tool-Nutzung und Zwischenentscheidungen, anstatt die finale Antwort als Beweis für die korrekte Funktionsweise des Systems zu akzeptieren.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Den Artikel zur Agenten-Zuverlässigkeit lesen →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-63\">Sicherheit ist ein Teil der Zuverlässigkeit für computergestützte Agenten\u003C\u002Fh2>\n\u003Cp>Computer-Use-Agenten lesen nicht nur nicht vertrauenswürdige Inhalte; sie können nach dem Lesen auch handeln. Dadurch werden Prompt Injections, bösartige Seiteninhalte und Phishing zu Risiken im Ausführungspfad.\u003C\u002Fp>\n\u003Cp>Die aktuellen Computer-Use-Richtlinien von OpenAI empfehlen, die Umgebung zu isolieren, Websites und Aktionen per Positivliste (Allowlist) freizugeben, Bildschirminhalte als nicht vertrauenswürdig zu behandeln, folgenreiche Aktionen zu bestätigen, den Ausführungsrahmen einzugrenzen und das tatsächliche Ergebnis zu überprüfen. Der ChatGPT-Agent verwendet für sensible Kontexte gleichermaßen Bestätigungen, Prompt-Injection-Überwachung und überwachte Modi.\u003C\u002Fp>\n\u003Cp>Das Architekturprinzip geht über einen einzelnen Anbieter hinaus: Von dem Agenten beobachtete Inhalte dürfen die Berechtigungen des Benutzers nicht neu definieren. Eine Webseite kann Daten bereitstellen. Sie kann jedoch keine Erlaubnis erteilen, Daten an anderer Stelle zu senden, etwas zu kaufen, Zugangsdaten zu ändern oder Aufgabengrenzen zu überschreiten.\u003C\u002Fp>\n\u003Ch2 id=\"section-67\">Was würde diese Einschätzung ändern?\u003C\u002Fh2>\n\u003Cp>Die Zuverlässigkeitslücke würde sich verringern, wenn Computer-Use-Modelle über repräsentative Produktionsverteilungen hinweg robust gegenüber langen Zeithorizonten, dynamischen Zuständen, UI-Variationen, Umgebungsfehlern und mehrdeutigen Zielen würden. Bessere native Zustands-APIs, standardisierte maschinenlesbare Schnittstellen und eine stärkere Verifier-Infrastruktur könnten zudem das Ausmaß der erforderlichen fehleranfälligen GUI-Interaktionen reduzieren.\u003C\u002Fp>\n\u003Cp>Der Bereitstellungsschwellenwert verschiebt sich ebenfalls mit den Konsequenzen einer Aufgabe. Eine Erfolgsquote von 70 % kann für eine überwachte Rechercheaufgabe mit geringem Risiko nützlich und für einen autonomen finanziellen oder destruktiven Workflow inakzeptabel sein. Zuverlässigkeit muss daher an den Kosten der jeweiligen Fehlerklasse gemessen werden und nicht an einem universellen Schwellenwert für die Erfolgsquote.\u003C\u002Fp>\n\u003Ch2 id=\"section-70\">Grenzen und Einschränkungen\u003C\u002Fh2>\n\u003Cp>Die zitierten Benchmarks evaluieren unterschiedliche Umgebungen und sollten nicht miteinander verglichen werden, als würden sie dasselbe messen. WAREX testet die Unzuverlässigkeit im Web; WeaveBench zielt auf hybride, langfristige Workflows ab; OSWorld 2.0 konzentriert sich auf realistische lange Workflows; BLIND-ACT legt den Schwerpunkt auf den Umgang mit Zielen bei Mehrdeutigkeit und Nicht-Machbarkeit.\u003C\u002Fp>\n\u003Cp>Benchmark-Ergebnisse altern zudem schnell. Verbesserungen an Modellen, Testumgebungen und Verifiern können die Bewertungen innerhalb weniger Monate erheblich verändern. Die bleibende Erkenntnis liegt daher in der Evaluierungsmethode: Bedingungen variieren, Prozess vom Ergebnis trennen, externen Zustand überprüfen und den Rahmen jeder Leistungsbehauptung wahren.\u003C\u002Fp>\n\u003Ch2 id=\"section-73\">Fazit\u003C\u002Fh2>\n\u003Cp>Computer-Use-Agenten sind bereits leistungsfähig genug, um nützlich zu sein. Genau deshalb hat sich die Frage der Evaluierung geändert. Die Herausforderung besteht nicht mehr nur darin, ob ein Agent einen Workflow durchklicken kann. Sie besteht darin, ob das System verlässlich bleibt, wenn die sauberen Demobedingungen wegfallen.\u003C\u002Fp>\n\u003Cp>Betrachten Sie einen erfolgreichen Durchlauf als Beleg für die prinzipielle Fähigkeit. Testen Sie anschließend Wiederholbarkeit, Robustheit gegenüber Umgebungsbedingungen, Long-Horizon-Steuerung, Zustandserkennung, Ergebnisüberprüfung und den sicheren Umgang mit Zielen. Ein produktionsreifer Computer-Use-Agent ist nicht derjenige, der die Demo abschließen kann. Es ist derjenige, dessen Fehlergrenzen bekannt, gemessen und beherrscht sind.\u003C\u002Fp>\n\u003Ch2 id=\"section-76\">FAQ\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Zuverlässigkeit von Computer-Use-Agenten\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Beweist eine erfolgreiche Demo eines Computer-Use-Agenten dessen Zuverlässigkeit im Produktivbetrieb?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nein. Sie beweist lediglich die Leistungsfähigkeit unter einem einzigen beobachteten Verlauf. Produktionsreife Zuverlässigkeit erfordert wiederholten Erfolg bei Umgebungsvariationen, langlebigen Aufgaben, sich ändernden Zuständen, Mehrdeutigkeiten, Wiederherstellungsbedingungen und folgenreichen Aktionen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Warum schneiden Benchmarks für Computer-Use oft deutlich besser ab als reale Praxiseinsätze?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Benchmarks können kontrolliertere Umgebungen, kürzere Aufgaben, stabile Netzwerkbedingungen, einfachere Anwendungskombinationen oder Ergebniskriterien nutzen, die nicht alle Prozessfehler erfassen. Die genaue Validitätsgrenze hängt vom jeweiligen Benchmark ab.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Was ist die wichtigste Zuverlässigkeitsprüfung nach einer Computer-Use-Aktion?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Überprüfen Sie das tatsächliche externe Ergebnis. Betrachten Sie die finale Aussage des Agenten oder die beabsichtigte Klicksequenz nicht als Beweis dafür, dass das Zielsystem den Vorgang auch akzeptiert hat.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Warum bleiben Aufgaben am Computer mit langem Zeithorizont weiterhin schwierig?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Fehler summieren sich über viele Aktionen hinweg, Einschränkungen geraten in Vergessenheit, der externe Zustand ändert sich, die Arbeit erstreckt sich über mehrere Anwendungen, verborgene Zustände spielen eine Rolle und der Agent muss entscheiden, wann er warten, nachfragen, verifizieren oder den Fehler beheben muss, anstatt einfach weiterzuhandeln.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Wie sollte ich einen Browser- oder Desktop-Agenten vor dem Produktiveinsatz testen?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Wiederholen Sie saubere Aufgaben, fügen Sie realistische Umgebungsfehler ein, variieren Sie UI und Zustand, verlängern Sie den Workflow-Horizont, bringen Sie Mehrdeutigkeiten ein, verlangen Sie nachweisbare Ergebnisbelege, testen Sie Kontrollen für weitreichende Aktionen und führen Sie die Testsuite nach Modell- oder Harness-Änderungen erneut aus.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq6\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Sollten Computer-Use-Agenten immer eine menschliche Bestätigung erfordern?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nicht bei jeder risikoarmen Aktion. Bestätigungsanforderungen sollten sich nach Tragweite, Reversibilität, Autorisierung und Unsicherheit richten. Aktionen mit hoher Auswirkung, externer Sichtbarkeit oder schwer rückgängig zu machende Vorgänge erfordern strengere Kontrollen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-78\">Glossar\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Wichtige Begriffe zur Zuverlässigkeit\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"computer-use-agent\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Computer-Use-Agent\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Ein KI-Agent, der über Beobachtungen und Aktionen wie Klicken, Tippen, Scrollen, Dateioperationen oder anwendungsübergreifende Workflows mit grafischen Benutzeroberflächen oder Computerumgebungen interagiert.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"repeatability\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Wiederholbarkeit\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Der Grad, in dem ein Agent dieselbe Aufgabe über wiederholte Durchläufe hinweg konsistent abschließen kann, anstatt nur bei ausgewählten Verläufen erfolgreich zu sein.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"environmental-robustness\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Umgebungsrobustheit\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Die Fähigkeit, trotz realistischer Schwankungen wie Latenz, vorübergehender Fehler, UI-Änderungen, Sitzungszuständen und unerwarteten Seitenbedingungen ein korrektes Verhalten beizubehalten.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"outcome-verification\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Ergebnisüberprüfung\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Die Überprüfung des tatsächlichen externen Zustands nach einer Aktion, um zu bestätigen, dass das beabsichtigte Ergebnis eingetreten ist, anstatt sich auf die Selbsteinschätzung des Agenten zu verlassen.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"blind-goal-directedness\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Blind Goal-Directedness\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Ein Fehlermuster, bei dem ein Computer-Use-Agent trotz Mehrdeutigkeit, Undurchführbarkeit, widersprüchlicher Bedingungen oder Gründen zum Innehalten und Neubewerten weiterhin ein Ziel verfolgt.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"reliability-boundary\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Zuverlässigkeitsgrenze\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Die Gesamtheit der Bedingungen, unter denen eine beobachtete Erfolgsquote oder ein Leistungsanspruch repräsentativ genug für eine konkrete Bereitstellungsentscheidung bleibt.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-80\">Primärquellen und weiterführende Literatur\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Computer use\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Aktuelle Entwicklerrichtlinien zur Isolierung von Umgebungen, zum Umgang mit Bildschirminhalten als nicht vertrauenswürdig, zur Bestätigung folgenreicher Aktionen, zur Begrenzung von Durchläufen und zur Überprüfung von Ergebnissen.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Running Codex safely at OpenAI\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Aktuelle Produktionsrichtlinien zu technischen Grenzen, menschlicher Freigabe, Telemetrie und Steuerung für Agenten, die auf realen Systemen agieren.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — WAREX\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Evaluierung von 2026, die zeigt, dass realistische Unzuverlässigkeiten im Web bei bestehenden Benchmarks zu erheblichen Einbrüchen beim Aufgabenerfolg von Browser-Agenten führen.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — The Art of Building Verifiers for Computer Use Agents\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Arbeit von 2026 über Prozess- versus Ergebnisbewertung, kontrollierbare versus unkontrollierbare Fehler und zuverlässige Verifikationspfade.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — WeaveBench\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Long-Horizon-Benchmark von 2026, der GUI-, CLI- und Code-Workflows kombiniert und eine erhebliche Lücke zwischen aktuellen Agenten und zuverlässiger realer Aufgabenerfüllung aufzeigt.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Benchmark von 2026 mit Schwerpunkt auf realistischen Long-Horizon-Computer-Use-Workflows, verborgenen Zuständen und quellenübergreifender logischer Schlussfolgerung.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — SentinelBench\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Benchmark von 2026 für zeitlich fortschreitende Aufgaben, bei denen Agenten Umgebungen überwachen und auf Zustandsänderungen reagieren müssen, anstatt kontinuierlich zu agieren.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">ICLR-2026-Forschung darüber, wie Agenten weiterhin mehrdeutige, widersprüchliche oder undurchführbare Ziele verfolgen.\u003C\u002Fp>\u003C\u002Fa>",{"time":211,"blocks":212,"version":937},1790353097246,[213,221,227,235,242,249,254,259,264,269,274,304,309,314,343,348,353,358,363,368,373,378,383,388,395,400,405,410,415,420,425,430,435,440,445,450,455,460,465,470,475,480,485,518,523,528,533,542,547,581,586,591,596,637,642,647,652,657,686,691,711,716,724,729,734,739,744,749,754,759,764,769,774,779,784,789,794,824,829,859,864,874,883,892,901,910,919,928],{"id":214,"data":215,"type":219,"tunes":220},"IYG9UPcPY0",{"title":216,"maxLevel":217,"minLevel":218},"Inhalt",3,2,"tableOfContents",{},{"id":222,"data":223,"type":225,"tunes":226},"intro",{"text":224},"Computer-Use-Agenten können mittlerweile klicken, tippen, im Web surfen, Dateien bearbeiten, Desktop-Anwendungen bedienen und beeindruckende mehrstufige Aufgaben erledigen. Das macht erfolgreiche Demos leicht verständlich – und verleitet dazu, sie überzuinterpretieren. Ein einzelner abgeschlossener Workflow zeigt lediglich, dass der Agent unter genau diesen Bedingungen erfolgreich sein kann. Er zeigt nicht, wie oft er erfolgreich ist, wie er sich bei Veränderungen der Umgebung verhält, ob er das Ergebnis überprüft oder wie sicher er agiert, wenn das Ziel mehrdeutig wird.","paragraph",{},{"id":228,"data":229,"type":233,"tunes":234},"direct",{"body":230,"title":231,"variant":232},"\u003Cstrong>Eine erfolgreiche Computer-Use-Demo beweist Leistungsfähigkeit, nicht Zuverlässigkeit.\u003C\u002Fstrong> Zuverlässigkeit im Produktivbetrieb erfordert, dass der Agent bei Umgebungsschwankungen wiederholt erfolgreich ist, sich von vorübergehenden Fehlern erholt, Rahmenbedingungen über lange Zeiträume einhält, verborgene oder sich verändernde Zustände erkennt, das tatsächliche Ergebnis verifiziert und anhält oder nachfragt, wenn das Ziel mehrdeutig oder unsicher wird. Die richtige Frage für den Produktiveinsatz lautet nicht: „Kann der Agent diese Aufgabe erledigen?“, sondern: „Unter welchen Bedingungen können wir ihm vertrauen, diese Aufgabe wiederholt auszuführen?“","Direkte Antwort","info","callout",{},{"id":236,"data":237,"type":233,"tunes":241},"freshness",{"body":238,"title":239,"variant":240},"Dieser Artikel spiegelt den Forschungsstand zu Computer-Use-Agenten sowie Plattformrichtlinien mit Stand vom \u003Cstrong>25. September 2026\u003C\u002Fstrong> wider. Benchmark-Ergebnisse lassen sich nicht ohne Weiteres über unterschiedliche Aufgabensets, Umgebungen, Modelle, Schrittlimits, Bewertungsinstanzen oder Testumgebungen hinweg vergleichen. Betrachten Sie jeden Benchmark-Wert stets im Kontext seiner spezifischen Evaluierungsbedingungen.","Ein sich schnell entwickelndes Feld","warning",{},{"id":243,"data":244,"type":233,"tunes":248},"model-note",{"body":245,"title":246,"variant":247},"Die nachfolgende Zuverlässigkeitsleiter für Computer-Use sowie der Stresstest vom Demo- zum Produktivbetrieb sind hier vorgeschlagene praktische Evaluierungsmodelle. Sie stellen keine formellen Industriestandards dar.","Das in diesem Artikel verwendete Modell","note",{},{"id":250,"data":251,"type":41,"tunes":253},"h-demo",{"text":252,"level":218},"Warum die Demo der denkbar einfachste Zuverlässigkeitstest ist",{},{"id":255,"data":256,"type":225,"tunes":258},"p-demo-1",{"text":257},"Eine Demo zeigt normalerweise einen einzigen Pfad, der funktioniert hat. Die Umgebung ist bekannt, die Aufgabe im Voraus ausgewählt, der Operator kann nach einem Fehlschlag neu starten, und das Publikum sieht den erfolgreichen Ablauf. Produktivsysteme sind stattdessen mit einer Verteilung konfrontiert: unterschiedliche Seiten, Netzwerkbedingungen, Kontostatus, Pop-ups, Latenzen, UI-Änderungen, verborgene Zustände, Berechtigungen, Unterbrechungen und Nutzer, die Ziele unvollständig beschreiben.",{},{"id":260,"data":261,"type":225,"tunes":263},"p-demo-2",{"text":262},"Dieser Unterschied ist entscheidend, da Computer-Use-Agenten über Schnittstellen agieren, die für Menschen und nicht für deterministische APIs entwickelt wurden. Ihre Handlungsschleife hängt von Wahrnehmung, Zustandsinterpretation, Planung, dem Timing von Interaktionen und Reaktionen der Umgebung ab. Kleinste Änderungen können den Ablauf verändern, selbst wenn das Ziel des Nutzers unverändert bleibt.",{},{"id":265,"data":266,"type":225,"tunes":268},"p-demo-3",{"text":267},"Die WAREX-Forschungsarbeit von Microsoft Research verdeutlicht das Problem: Benchmark-Agenten, die in kontrollierten Umgebungen leistungsfähig wirken, büßen erheblich an Erfolgsquote ein, sobald realistische Web-Instabilitäten hinzukommen. Der Fehler liegt nicht zwingend darin, dass „das Modell weniger intelligent wurde“. Die Umgebung hat lediglich aufgehört, deterministisch zu sein.",{},{"id":270,"data":271,"type":41,"tunes":273},"h-claims",{"text":272,"level":218},"Leistungsfähigkeit, Erfolgsquote, Zuverlässigkeit und Sicherheit sind unterschiedliche Aussagen",{},{"id":275,"data":276,"type":302,"tunes":303},"claims-table",{"content":277,"stretched":42,"withHeadings":13},[278,282,286,290,294,298],[279,280,281],"Aussage","Was sie tatsächlich belegt","Was sie nicht belegt",[283,284,285],"Der Agent hat die Aufgabe einmal abgeschlossen","Leistungsfähigkeit unter einem beobachteten Ablauf","Wiederholbarkeit, Robustheit, Sicherheit oder Generalisierung",[287,288,289],"Der Agent erzielt ein hohes Benchmark-Ergebnis","Leistung unter den Aufgaben- und Evaluierungsbedingungen dieses Benchmarks","Gleichwertige Produktivleistung in abweichenden Umgebungen",[291,292,293],"Der Agent erreicht das Ziel meistens","Häufigkeit des Zielerreichungserfolgs","Korrekter Prozess, sicheres Verhalten oder Nachweis, dass das Ergebnis überprüft wurde",[295,296,297],"Der Agent folgt dem beabsichtigten Prozess","Qualität des Ablaufs gemäß dem evaluierten Kriterienkatalog","Dass die externe Umgebung das Endergebnis tatsächlich akzeptiert hat",[299,300,301],"Der Agent vermeidet unsichere Aktionen in einem Testset","Leistung bei den abgedeckten Sicherheitsfällen","Sicherheit bei neuartigen Unklarheiten, Injection-Angriffen oder Seiteneffekten","table",{},{"id":305,"data":306,"type":41,"tunes":308},"h-ladder",{"text":307,"level":218},"Die Zuverlässigkeitsleiter für Computer-Use",{},{"id":310,"data":311,"type":225,"tunes":313},"p-ladder-intro",{"text":312},"Ein sinnvoller Ansatz zur Evaluierung von Computer-Use-Systemen besteht darin, sich von punktueller Leistungsfähigkeit hin zu schrittweise anspruchsvolleren Zuverlässigkeitseigenschaften zu bewegen. Höhere Stufen setzen die unteren Stufen voraus, ergeben sich jedoch nicht automatisch aus ihnen.",{},{"id":315,"data":316,"type":341,"tunes":342},"ladder-flow",{"steps":317,"title":339,"orientation":340},[318,321,324,327,330,333,336],{"label":319,"description":320},"1. Leistungsfähigkeit","Kann der Agent die Aufgabe unter bekannten Bedingungen mindestens einmal abschließen?",{"label":322,"description":323},"2. Wiederholbarkeit","Kann er dieselbe Aufgabe über wiederholte Durchläufe hinweg konsistent ausführen?",{"label":325,"description":326},"3. Robustheit gegenüber Umwelteinflüssen","Hält er Timing-Änderungen, Netzwerkproblemen, Pop-ups, UI-Variationen und kleinen Störungen der Umgebung stand?",{"label":328,"description":329},"4. Steuerung über lange Horizonte","Kann er Ziele, Einschränkungen und Fortschritte über viele Schritte, Anwendungen und verzögerte Ereignisse hinweg aufrechterhalten?",{"label":331,"description":332},"5. Zustandsbewusstsein","Kann er erkennen, wann sich die Umgebung geändert hat, wann verborgene Zustände eine Rolle spielen oder wann eine Annahme nicht mehr zutrifft?",{"label":334,"description":335},"6. Ergebnisverifikation","Überprüft er, ob das beabsichtigte Ergebnis tatsächlich eingetreten ist, anstatt blind auf seine eigene Aktionssequenz zu vertrauen?",{"label":337,"description":338},"7. Sicherer Umgang mit Zielvorgaben","Kann er anhalten, nachfragen, ablehnen oder die Kontrolle zurückgeben, wenn das Ziel mehrdeutig, undurchführbar, widersprüchlich oder folgenschwer ist?","Zuverlässigkeitsleiter für Computer-Use","auto","processFlow",{},{"id":344,"data":345,"type":41,"tunes":347},"h-capability",{"text":346,"level":217},"Stufe 1 – Leistungsfähigkeit: Die Demo-Frage",{},{"id":349,"data":350,"type":225,"tunes":352},"p-capability-1",{"text":351},"Die Leistungsfähigkeit fragt, ob ein Agent die Aufgabe überhaupt ausführen kann. Das ist wertvoll. Computer-Use-Systeme haben sich rasant weiterentwickelt, und moderne Agenten können Workflows bewältigen, die ältere Systeme nicht verlässlich ausführen konnten.",{},{"id":354,"data":355,"type":225,"tunes":357},"p-capability-2",{"text":356},"Doch Leistungsfähigkeit ist ein schwaches Kriterium für den Produktiveinsatz. Ein einzelner erfolgreicher Durchlauf verrät Ihnen nicht, ob der Agent in 95 % oder in 30 % der Fälle erfolgreich ist, ob Fehlschläge harmlos oder destruktiv sind oder ob der Erfolg lediglich von einem glücklichen Seitenzustand abhing.",{},{"id":359,"data":360,"type":41,"tunes":362},"h-repeatability",{"text":361,"level":217},"Stufe 2 – Wiederholbarkeit: Bleibt dieselbe Aufgabe gelöst?",{},{"id":364,"data":365,"type":225,"tunes":367},"p-repeat-1",{"text":366},"Trajektorien der Computernutzung sind stochastisch. Modellausgaben variieren, Seiten laden mit unterschiedlichen Geschwindigkeiten, visuelle Zustände ändern sich und lange Workflows schaffen viele Verzweigungsmöglichkeiten. Ein Produktionstest sollte daher dieselbe Aufgabe mehrfach ausführen, anstatt einen einzelnen erfolgreichen Durchlauf als repräsentativ zu betrachten.",{},{"id":369,"data":370,"type":225,"tunes":372},"p-repeat-2",{"text":371},"Messen Sie nicht nur die durchschnittliche Erfolgsquote, sondern auch die Verteilung der Fehlermuster: falscher Klick, vorzeitiger Abbruch, verpasste Bestätigung, fehlerhaftes Feld, doppelte Aktion, Navigationsschleife, Annahme veralteter Zustände und falsche Erfolgsmeldung.",{},{"id":374,"data":375,"type":41,"tunes":377},"h-robustness",{"text":376,"level":217},"Stufe 3 — Robustheit gegenüber der Umgebung: Was passiert, wenn sich das Web wie das Web verhält?",{},{"id":379,"data":380,"type":225,"tunes":382},"p-robust-1",{"text":381},"Reale Websites sind keine Benchmark-Prüfstände. Anfragen schlagen fehl, Elemente laden verzögert, Sitzungen laufen ab, Seiten verändern sich, Cookie-Banner tauchen auf, Server geben Fehler zurück und Netzwerkbedingungen schwanken.",{},{"id":384,"data":385,"type":225,"tunes":387},"p-robust-2",{"text":386},"WAREX evaluiert diese Diskrepanz, indem es realistische Web-Unzuverlässigkeiten in bestehende Benchmark-Umgebungen einstreut, und berichtet von erheblichen Einbrüchen beim Aufgabenerfolg. Dies ist eine entscheidende Erkenntnis für den Produktiveinsatz: Ein Benchmark kann die Aufgabenkompetenz messen und gleichzeitig die Fähigkeit zur Wiederherstellung nach Umgebungsinstabilitäten unterschätzen.",{},{"id":389,"data":390,"type":233,"tunes":394},"robust-tip",{"body":391,"title":392,"variant":393},"Bringen Sie Verzögerungen, vorübergehende HTTP-Fehler, veraltete Seitenzustände, Modaldialoge, Sitzungsabläufe, doppelte Antworten und kontrollierte UI-Variationen ein. Funktioniert der Agent nur auf dem Idealpfad, handelt es sich um ein demofähiges System, nicht um ein produktionstaugliches.","Zuverlässigkeitstest","tip",{},{"id":396,"data":397,"type":41,"tunes":399},"h-long",{"text":398,"level":217},"Stufe 4 — Langzeitorchestrierung: Erfolg verändert sich, wenn die Aufgabe zu echter Arbeit wird",{},{"id":401,"data":402,"type":225,"tunes":404},"p-long-1",{"text":403},"Kurze Aufgaben verbergen eine Klasse von Fehlern, die erst nach Dutzenden oder Hunderten von Aktionen auftreten: vergessene Einschränkungen, doppelte Arbeit, vorzeitige Fertigstellung, verpasste Zustandsänderungen, Inkonsistenzen über Anwendungen hinweg und kumulierte kleine Fehler.",{},{"id":406,"data":407,"type":225,"tunes":409},"p-long-2",{"text":408},"OSWorld 2.0 wurde speziell für langfristige Workflows aus der Praxis konzipiert. Menschliche Nutzer benötigen für die Aufgaben im Median etwa 1,6 Stunden, und es sind deutlich mehr Tool-Aufrufe erforderlich als bei früheren Computernutzungs-Benchmarks. Gemessen an der primären Abschlussmetrik sind selbst die stärksten evaluierten Systeme noch weit von einer lückenlosen Aufgabenzuverlässigkeit entfernt.",{},{"id":411,"data":412,"type":225,"tunes":414},"p-long-3",{"text":413},"WeaveBench kommt aus einer anderen Perspektive zu einem ähnlichen Ergebnis. Es evaluiert hybride Workflows aus GUI, CLI und Code und berichtet, dass das am besten bewertete Modell-Runtime-Paar nur 41,2 % der Aufgaben besteht. Das wichtige Ergebnis ist nicht eine einzelne Zahl auf der Bestenliste; es ist die Tatsache, dass eine realistische schnittstellenübergreifende Orchestrierung Fehler aufdeckt, die bei einfacheren Einzel-Schnittstellen-Aufgaben verborgen bleiben.",{},{"id":416,"data":417,"type":41,"tunes":419},"h-state",{"text":418,"level":217},"Stufe 5 — Zustandsbewusstsein: Die Umgebung kann sich unter dem Plan verändern",{},{"id":421,"data":422,"type":225,"tunes":424},"p-state-1",{"text":423},"Länger laufende Aufgaben hängen oft von versteckten oder sich verändernden Zuständen ab: Eine E-Mail trifft ein, ein Kalender ändert sich, ein Formular wird abgeschickt, ein Hintergrundprozess wird beendet, eine Browser-Sitzung läuft ab, ein Benutzer ändert eine Datei oder ein externes System ändert seine Verfügbarkeit.",{},{"id":426,"data":427,"type":225,"tunes":429},"p-state-2",{"text":428},"SentinelBench von Microsoft argumentiert, dass viele länger laufende Aufgaben keineswegs durch kontinuierliches Handeln gelöst werden sollten. Das korrekte Verhalten kann darin bestehen, zu überwachen, auf ein externes Ereignis zu warten und erst bei einer Zustandsänderung zu agieren. Dies ist eine andere Fähigkeit als schneller zu klicken oder mehr Schritte zu planen.",{},{"id":431,"data":432,"type":225,"tunes":434},"p-state-3",{"text":433},"Ein zuverlässiger Agent zur Computernutzung muss daher zwischen „jetzt ausführbar“, „wartet auf Zustand“, „Zustand geändert“ und „Annahme ungültig“ unterscheiden können.",{},{"id":436,"data":437,"type":41,"tunes":439},"h-verify",{"text":438,"level":217},"Stufe 6 — Ergebnisüberprüfung: Hat die Aktion tatsächlich funktioniert?",{},{"id":441,"data":442,"type":225,"tunes":444},"p-verify-1",{"text":443},"Ein Agent kann eine scheinbar korrekte Abfolge ausführen und dennoch an der Aufgabe scheitern. Ein Klick auf eine Schaltfläche wird möglicherweise nicht registriert. Ein Formular lehnt eine unsichtbare Validierung ab. Eine Datei wird im falschen Verzeichnis gespeichert. Ein Kauf bleibt unbestätigt. Eine Website zeigt möglicherweise eine nach Erfolg aussehende Ansicht, während der zugrunde liegende Vorgang fehlgeschlagen ist.",{},{"id":446,"data":447,"type":225,"tunes":449},"p-verify-2",{"text":448},"OpenAIs aktuelle Leitlinien zur Computernutzung empfehlen ausdrücklich, den Ablauf einzugrenzen und zu verifizieren, anstatt sich ausschließlich auf die finale Antwort des Modells zu verlassen. Die Forschung von Microsoft Research zu Verifizierern für die Computernutzung kommt bei Evaluationen zum selben Schluss: Prozess und Ergebnis müssen getrennt voneinander bewertet werden.",{},{"id":451,"data":452,"type":225,"tunes":454},"p-verify-3",{"text":453},"Die Forschung zum Universal Verifier berichtet, dass frühere Verifizierer-Setups hohe Falsch-Positiv-Raten erzeugen können, während ein fundierteres Bewertungsraster und eine explizite Trennung von Prozess, Ergebnis, kontrollierbaren Fehlern und unkontrollierbaren Fehlern die Übereinstimmung mit menschlichen Bewertungen erheblich verbessern.",{},{"id":456,"data":457,"type":41,"tunes":459},"h-safe-goal",{"text":458,"level":217},"Stufe 7 — Sicherer Umgang mit Zielen: Der Agent muss wissen, wann er nicht weitermachen darf",{},{"id":461,"data":462,"type":225,"tunes":464},"p-safe-1",{"text":463},"Computer-Use-Agenten sind darauf optimiert, Ziele zu erreichen, aber Zielbeharrlichkeit kann selbst zu einer Fehlerursache werden. Eine mehrdeutige Anfrage, eine unmögliche Bedingung, eine widersprüchliche Anweisung, eine verdächtige Webseite oder eine veränderte Umgebung erfordern möglicherweise eine Klarstellung oder das Abbrechen statt weiteren Handelns.",{},{"id":466,"data":467,"type":225,"tunes":469},"p-safe-2",{"text":468},"Der BLIND-ACT-Benchmark untersucht dieses Problem als blinde Zielgerichtetheit (Blind Goal-Directedness). Bei den in dieser Arbeit evaluierten Systemen verfolgten Agenten Aufgaben häufig weiter, trotz Mehrdeutigkeit, Undurchführbarkeit, widersprüchlichem Kontext oder anderen Gründen zum Innehalten. Die Autoren identifizieren Muster wie den Execution-First-Bias und den Vorrang von Benutzeranfragen (Request Primacy).",{},{"id":471,"data":472,"type":225,"tunes":474},"p-safe-3",{"text":473},"Diese Fehlerklasse ist von Bedeutung, da ein hochgradig fähiger Agent eine schlechte Situation schneller noch verschlimmern kann. Zuverlässigkeit beinhaltet daher auch Richtlinien dafür, wann nicht gehandelt werden darf.",{},{"id":476,"data":477,"type":41,"tunes":479},"h-stress",{"text":478,"level":218},"Der Stresstest vom Prototyp zur Produktion",{},{"id":481,"data":482,"type":225,"tunes":484},"p-stress-intro",{"text":483},"Bevor Sie einen Computer-Use-Workflow bereitstellen, nehmen Sie die erfolgreiche Demo und entfernen Sie systematisch die Annahmen, die sie einfach gemacht haben.",{},{"id":486,"data":487,"type":341,"tunes":517},"stress-flow",{"steps":488,"title":516,"orientation":340},[489,492,495,498,501,504,507,510,513],{"label":490,"description":491},"1. Saubere Aufgabe erneut ausführen","Stellen Sie die Wiederholbarkeit über mehrere Durchläufe hinweg sicher, bevor Sie Komplexität hinzufügen.",{"label":493,"description":494},"2. Umgebung stören","Fügen Sie Latenz, Neuversuche, Pop-ups, Seitenvariationen, veraltete Sitzungen und vorübergehende Fehler hinzu.",{"label":496,"description":497},"3. Zeithorizont erweitern","Verwandeln Sie die kurze Demo in den vollständigen realen Workflow mit Zwischenzuständen, mehreren Anwendungen und zeitverzögerten Schritten.",{"label":499,"description":500},"4. Verborgenen Zustand ändern","Modifizieren Sie Konto-, Datei-, Aufgaben- oder externe Zustände, nachdem der Agent einen Plan erstellt hat, und testen Sie, ob er die Änderung bemerkt.",{"label":502,"description":503},"5. Mehrdeutigkeit einfügen","Entfernen Sie eine wichtige Annahme und testen Sie, ob der Agent nachfragt, anstatt zu raten.",{"label":505,"description":506},"6. Kontrollierten Widerspruch einfügen","Präsentieren Sie alten und neuen Zustand gemeinsam und überprüfen Sie, ob der maßgebliche aktuelle Zustand Vorrang hat.",{"label":508,"description":509},"7. Ergebnisnachweis einfordern","Machen Sie den Aufgabenabschluss von einem verifizierbaren Endzustand abhängig, nicht vom Selbstbericht des Modells.",{"label":511,"description":512},"8. Folgenkritische Grenzen testen","Bestätigen Sie, dass irreversible oder sensible Aktionen die erwartete Genehmigung, Verweigerung oder Übergabe auslösen.",{"label":514,"description":515},"9. Nach Harness- oder Modelländerungen wiederholen","Betrachten Sie Laufzeit-Upgrades als Zuverlässigkeitsänderungen, die Regressionstests erfordern.","Stresstest vom Prototyp zur Produktion",{},{"id":519,"data":520,"type":41,"tunes":522},"h-benchmark-boundary",{"text":521,"level":218},"Benchmark-Erfolg hat eine Gültigkeitsgrenze",{},{"id":524,"data":525,"type":225,"tunes":527},"p-boundary-1",{"text":526},"Ein Benchmark-Ergebnis ist eine bedingte Aussage. Es gilt für ein bestimmtes Modell, einen bestimmten Harness, eine bestimmte Umgebung, ein bestimmtes Aufgabenset, einen Beurteiler, eine Toolschnittstelle, ein Schrittbudget, eine Retry-Richtlinie, ein Datum und eine Evaluierungsmethode.",{},{"id":529,"data":530,"type":225,"tunes":532},"p-boundary-2",{"text":531},"Der Wert wird irreführend, wenn diese Bedingungen aus der Aussage verschwinden. „Agent X erzielt 80 %“ ist schwächer als „Agent X hat auf Benchmark Y in Umgebung Z mit Beurteiler J und Schrittbudget N 80 % erzielt“. Der zweite Satz wahrt die Grenze, die Ihnen verrät, ob die Zahl auf Ihre Anwendung übertragbar ist.",{},{"id":534,"data":535,"type":540,"tunes":541},"ref-avb",{"url":536,"title":537,"excerpt":538,"ctaLabel":539},"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","The Answer Validity Boundary: Die fehlende Ebene zwischen Relevanz und verlässlichen KI-Antworten","Ein Framework, um die Bedingungen explizit zu machen, unter denen eine KI-Aussage gültig bleibt und welche Änderungen Einschränkungen, Neuberechnungen oder ein Verwerfen erfordern.","Lesen Sie The Answer Validity Boundary","referralArticle",{},{"id":543,"data":544,"type":41,"tunes":546},"h-process-outcome",{"text":545,"level":218},"Prozess- und Ergebnis-Erfolg müssen getrennt bewertet werden",{},{"id":548,"data":549,"type":579,"tunes":580},"process-outcome-comparison",{"rows":550,"title":568,"layout":302,"columns":569},[551,556,560,564],{"id":552,"label":553,"values":554},"good-good","Korrekter Prozess \u002F korrektes Ergebnis",[555,555,555],"",{"id":557,"label":558,"values":559},"bad-good","Falscher Prozess \u002F korrektes Ergebnis",[555,555,555],{"id":561,"label":562,"values":563},"good-bad","Korrekter Prozess \u002F falsches Ergebnis",[555,555,555],{"id":565,"label":566,"values":567},"bad-bad","Falscher Prozess \u002F falsches Ergebnis",[555,555,555],"Vier mögliche Ausgänge eines Computer-Use-Durchlaufs",[570,573,576],{"id":571,"label":572},"process","Prozess",{"id":574,"label":575},"outcome","Ergebnis",{"id":577,"label":578},"interpretation","Interpretation","comparison",{},{"id":582,"data":583,"type":225,"tunes":585},"p-process-1",{"text":584},"WeaveBench berichtet, dass eine reine Ergebnisbewertung die Computer-Use-Leistung erheblich überschätzen kann, da ein Agent ein scheinbar erfolgreiches Artefakt über eine Abkürzung oder fabrizierte Beweise erzeugen kann. Der Prüfer muss die Trajektorie und die Zwischenergebnisse inspizieren, nicht bloß die finale Behauptung.",{},{"id":587,"data":588,"type":41,"tunes":590},"h-distribution",{"text":589,"level":218},"Produktionszuverlässigkeit ist eine Verteilung, keine einzelne Erfolgsquote",{},{"id":592,"data":593,"type":225,"tunes":595},"p-dist-1",{"text":594},"Eine aussagekräftige Produktionsevaluierung erfasst die Dimensionen, die in Ihrer Umgebung tatsächlich variieren. Bei einem Browser-Workflow können dies Kontoalter, Sprache\u002FRegion, Viewport, Seitenversion, Netzwerkqualität, Authentifizierungsstatus, bestehender Warenkorbinhalt, Cookies, Pop-ups, Benutzerberechtigungen und die Frage sein, ob ein Mensch den Durchlauf unterbricht.",{},{"id":597,"data":598,"type":302,"tunes":636},"distribution-table",{"content":599,"stretched":42,"withHeadings":13},[600,604,608,612,616,620,624,628,632],[601,602,603],"Dimension","Beispielhafte Variation","Warum es wichtig ist",[605,606,607],"Umgebung","Schnelles vs. langsames Netzwerk, transiente Fehler, Seiten-Timing","Testet Wiederherstellungs- und Warteverhalten",[609,610,611],"UI","Anderer Viewport, Modal, umgeordnete Elemente, kleineres Redesign","Testet fragile visuelle\u002Faktionsbezogene Annahmen",[613,614,615],"Zustand","An-\u002Fabgemeldet, leerer\u002Fnicht-leerer Warenkorb, vorhandene Datei, geänderte Berechtigungen","Testet das Denken über verborgene Zustände",[617,618,619],"Aufgabenhorizont","5 Schritte vs. 50+ Schritte, eine App vs. mehrere Apps","Testet akkumulierte Trajektorienfehler",[621,622,623],"Mehrdeutigkeit","Fehlende Präferenz oder unvollständige Benutzeranweisung","Testet, ob der Agent nachfragt, anstatt zu raten",[625,626,627],"Konsequenz","Nur lesend vs. kaufen\u002Fsenden\u002Flöschen\u002Fändern","Testet Bestätigungs- und Autorisierungskontrollen",[629,630,631],"Adversarieller Inhalt","Prompt Injection oder irreführender Seitentext","Testet Anweisungshierarchie und Eindämmung",[633,634,635],"Modell- \u002F Harness-Version","Laufzeit-Upgrade","Testet Regressionen durch Änderungen auf Systemebene",{},{"id":638,"data":639,"type":41,"tunes":641},"h-budget",{"text":640,"level":218},"Zuverlässigkeit erfordert ein Fehlerbudget, keine Perfektion",{},{"id":643,"data":644,"type":225,"tunes":646},"p-budget-1",{"text":645},"Kein Produktivsystem ist vollkommen zuverlässig. Die entscheidende technische Frage ist, welche Fehler akzeptabel, erkennbar und behebbar sind. Ein fehlgeschlagener Versuch, einen lokalen Ordner zu sortieren, ist nicht gleichbedeutend damit, die falsche E-Mail zu senden, das falsche Produkt zu kaufen oder eine Kontoeinstellung zu ändern.",{},{"id":648,"data":649,"type":225,"tunes":651},"p-budget-2",{"text":650},"Klassifizieren Sie Aktionen nach Tragweite und Reversibilität. Reversible Aktionen mit geringer Auswirkung vertragen mehr Autonomie. Weitreichende, extern sichtbare oder schwer rückgängig zu machende Aktionen erfordern eine stärkere Bestätigung, Zustandsüberprüfung, Autorisierung und Kontrollen nach der Ausführung.",{},{"id":653,"data":654,"type":41,"tunes":656},"h-matrix",{"text":655,"level":218},"Eine praktische Zuverlässigkeitsmatrix für die Computernutzung",{},{"id":658,"data":659,"type":302,"tunes":685},"control-matrix",{"content":660,"stretched":42,"withHeadings":13},[661,665,669,673,677,681],[662,663,664],"Aktionsklasse","Beispiel","Empfohlene Kontrollmaßnahme",[666,667,668],"Lesen \u002F Prüfen","Seiten öffnen, Dateien lesen, Informationen sammeln","Geltungsbereich eingrenzen, Quellen protokollieren, behebbare Navigationsfehler tolerieren",[670,671,672],"Reversible lokale Änderung","Entwurfsdatei bearbeiten, temporären Arbeitsbereich neu organisieren","Prüfpunkt (Checkpoint) oder Version vor der Änderung setzen; Ergebnis überprüfen",[674,675,676],"Externe Kommunikation","E-Mail senden, Inhalte veröffentlichen, Formular absenden","Benutzerbestätigung oder explizite delegierte Befugnis; akzeptierten Zustand überprüfen",[678,679,680],"Finanziell \u002F Transaktional","Kauf, Checkout, kostenpflichtiges Abonnement","Striktes Mandat, Betrags-\u002FHändlerbeschränkungen, abschließende Bestätigung und Belegprüfung",[682,683,684],"Destruktiv \u002F Rechte ändernd","Daten löschen, Berechtigungen ändern, Zugriff widerrufen","Eng gefasste Autorisierung, explizite Bestätigung, reversibler Pfad wo möglich, Audit nach der Ausführung",{},{"id":687,"data":688,"type":41,"tunes":690},"h-log",{"text":689,"level":218},"Was bei einem Fehler bei der Computernutzung protokolliert werden sollte",{},{"id":692,"data":693,"type":709,"tunes":710},"log-list",{"meta":694,"items":695,"style":708},{},[696,697,698,699,700,701,702,703,704,705,706,707],"Ziel des Benutzers und explizite Einschränkungen.","Modell- und Testumgebungs-Version (Harness).","Umgebungs- und Anwendungsversionen.","Für den Fehler relevante Screenshots oder strukturierte Beobachtungen.","Durchgeführte Aktionen mit Zeitstempeln.","Tool-, Klick-, Tastatur- und Navigationsergebnisse.","Zustandsübergänge und Wartezeiten.","Genehmigungs-, Verweigerungs- oder Übergabe-Ereignisse (Handoffs).","Externe Fehler und Netzwerkausfälle.","Abschließender beobachtbarer Umgebungszustand.","Das vom Agenten gemeldete Ergebnis.","Prüfergebnis (Verifier) und ob der Fehler durch den Agenten kontrollierbar war.","unordered","list",{},{"id":712,"data":713,"type":225,"tunes":715},"p-log-1",{"text":714},"Der entscheidende Vergleich findet zwischen dem gemeldeten Erfolg und dem beobachtbaren Erfolg statt. Ein System, das diese beiden nicht unterscheiden kann, wird in der Produktion unweigerlich falsch-positive Ergebnisse anhäufen.",{},{"id":717,"data":718,"type":540,"tunes":723},"ref-reliability",{"url":719,"title":720,"excerpt":721,"ctaLabel":722},"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Zuverlässigkeit von KI-Agenten: Warum die finale Antwort nicht ausreicht","Ein umfassenderes Zuverlässigkeitsmodell zur Bewertung von Agenten-Trajektorien, Tool-Nutzung und Zwischenentscheidungen, anstatt die finale Antwort als Beweis für die korrekte Funktionsweise des Systems zu akzeptieren.","Den Artikel zur Agenten-Zuverlässigkeit lesen",{},{"id":725,"data":726,"type":41,"tunes":728},"h-security",{"text":727,"level":218},"Sicherheit ist ein Teil der Zuverlässigkeit für computergestützte Agenten",{},{"id":730,"data":731,"type":225,"tunes":733},"p-sec-1",{"text":732},"Computer-Use-Agenten lesen nicht nur nicht vertrauenswürdige Inhalte; sie können nach dem Lesen auch handeln. Dadurch werden Prompt Injections, bösartige Seiteninhalte und Phishing zu Risiken im Ausführungspfad.",{},{"id":735,"data":736,"type":225,"tunes":738},"p-sec-2",{"text":737},"Die aktuellen Computer-Use-Richtlinien von OpenAI empfehlen, die Umgebung zu isolieren, Websites und Aktionen per Positivliste (Allowlist) freizugeben, Bildschirminhalte als nicht vertrauenswürdig zu behandeln, folgenreiche Aktionen zu bestätigen, den Ausführungsrahmen einzugrenzen und das tatsächliche Ergebnis zu überprüfen. Der ChatGPT-Agent verwendet für sensible Kontexte gleichermaßen Bestätigungen, Prompt-Injection-Überwachung und überwachte Modi.",{},{"id":740,"data":741,"type":225,"tunes":743},"p-sec-3",{"text":742},"Das Architekturprinzip geht über einen einzelnen Anbieter hinaus: Von dem Agenten beobachtete Inhalte dürfen die Berechtigungen des Benutzers nicht neu definieren. Eine Webseite kann Daten bereitstellen. Sie kann jedoch keine Erlaubnis erteilen, Daten an anderer Stelle zu senden, etwas zu kaufen, Zugangsdaten zu ändern oder Aufgabengrenzen zu überschreiten.",{},{"id":745,"data":746,"type":41,"tunes":748},"h-change",{"text":747,"level":218},"Was würde diese Einschätzung ändern?",{},{"id":750,"data":751,"type":225,"tunes":753},"p-change-1",{"text":752},"Die Zuverlässigkeitslücke würde sich verringern, wenn Computer-Use-Modelle über repräsentative Produktionsverteilungen hinweg robust gegenüber langen Zeithorizonten, dynamischen Zuständen, UI-Variationen, Umgebungsfehlern und mehrdeutigen Zielen würden. Bessere native Zustands-APIs, standardisierte maschinenlesbare Schnittstellen und eine stärkere Verifier-Infrastruktur könnten zudem das Ausmaß der erforderlichen fehleranfälligen GUI-Interaktionen reduzieren.",{},{"id":755,"data":756,"type":225,"tunes":758},"p-change-2",{"text":757},"Der Bereitstellungsschwellenwert verschiebt sich ebenfalls mit den Konsequenzen einer Aufgabe. Eine Erfolgsquote von 70 % kann für eine überwachte Rechercheaufgabe mit geringem Risiko nützlich und für einen autonomen finanziellen oder destruktiven Workflow inakzeptabel sein. Zuverlässigkeit muss daher an den Kosten der jeweiligen Fehlerklasse gemessen werden und nicht an einem universellen Schwellenwert für die Erfolgsquote.",{},{"id":760,"data":761,"type":41,"tunes":763},"h-limitations",{"text":762,"level":218},"Grenzen und Einschränkungen",{},{"id":765,"data":766,"type":225,"tunes":768},"p-limit-1",{"text":767},"Die zitierten Benchmarks evaluieren unterschiedliche Umgebungen und sollten nicht miteinander verglichen werden, als würden sie dasselbe messen. WAREX testet die Unzuverlässigkeit im Web; WeaveBench zielt auf hybride, langfristige Workflows ab; OSWorld 2.0 konzentriert sich auf realistische lange Workflows; BLIND-ACT legt den Schwerpunkt auf den Umgang mit Zielen bei Mehrdeutigkeit und Nicht-Machbarkeit.",{},{"id":770,"data":771,"type":225,"tunes":773},"p-limit-2",{"text":772},"Benchmark-Ergebnisse altern zudem schnell. Verbesserungen an Modellen, Testumgebungen und Verifiern können die Bewertungen innerhalb weniger Monate erheblich verändern. Die bleibende Erkenntnis liegt daher in der Evaluierungsmethode: Bedingungen variieren, Prozess vom Ergebnis trennen, externen Zustand überprüfen und den Rahmen jeder Leistungsbehauptung wahren.",{},{"id":775,"data":776,"type":41,"tunes":778},"h-conclusion",{"text":777,"level":218},"Fazit",{},{"id":780,"data":781,"type":225,"tunes":783},"p-conclusion-1",{"text":782},"Computer-Use-Agenten sind bereits leistungsfähig genug, um nützlich zu sein. Genau deshalb hat sich die Frage der Evaluierung geändert. Die Herausforderung besteht nicht mehr nur darin, ob ein Agent einen Workflow durchklicken kann. Sie besteht darin, ob das System verlässlich bleibt, wenn die sauberen Demobedingungen wegfallen.",{},{"id":785,"data":786,"type":225,"tunes":788},"p-conclusion-2",{"text":787},"Betrachten Sie einen erfolgreichen Durchlauf als Beleg für die prinzipielle Fähigkeit. Testen Sie anschließend Wiederholbarkeit, Robustheit gegenüber Umgebungsbedingungen, Long-Horizon-Steuerung, Zustandserkennung, Ergebnisüberprüfung und den sicheren Umgang mit Zielen. Ein produktionsreifer Computer-Use-Agent ist nicht derjenige, der die Demo abschließen kann. Es ist derjenige, dessen Fehlergrenzen bekannt, gemessen und beherrscht sind.",{},{"id":790,"data":791,"type":41,"tunes":793},"h-faq",{"text":792,"level":218},"FAQ",{},{"id":795,"data":796,"type":795,"tunes":823},"faq",{"items":797,"title":822},[798,802,806,810,814,818],{"id":799,"answer":800,"question":801},"faq1","Nein. Sie beweist lediglich die Leistungsfähigkeit unter einem einzigen beobachteten Verlauf. Produktionsreife Zuverlässigkeit erfordert wiederholten Erfolg bei Umgebungsvariationen, langlebigen Aufgaben, sich ändernden Zuständen, Mehrdeutigkeiten, Wiederherstellungsbedingungen und folgenreichen Aktionen.","Beweist eine erfolgreiche Demo eines Computer-Use-Agenten dessen Zuverlässigkeit im Produktivbetrieb?",{"id":803,"answer":804,"question":805},"faq2","Benchmarks können kontrolliertere Umgebungen, kürzere Aufgaben, stabile Netzwerkbedingungen, einfachere Anwendungskombinationen oder Ergebniskriterien nutzen, die nicht alle Prozessfehler erfassen. Die genaue Validitätsgrenze hängt vom jeweiligen Benchmark ab.","Warum schneiden Benchmarks für Computer-Use oft deutlich besser ab als reale Praxiseinsätze?",{"id":807,"answer":808,"question":809},"faq3","Überprüfen Sie das tatsächliche externe Ergebnis. Betrachten Sie die finale Aussage des Agenten oder die beabsichtigte Klicksequenz nicht als Beweis dafür, dass das Zielsystem den Vorgang auch akzeptiert hat.","Was ist die wichtigste Zuverlässigkeitsprüfung nach einer Computer-Use-Aktion?",{"id":811,"answer":812,"question":813},"faq4","Fehler summieren sich über viele Aktionen hinweg, Einschränkungen geraten in Vergessenheit, der externe Zustand ändert sich, die Arbeit erstreckt sich über mehrere Anwendungen, verborgene Zustände spielen eine Rolle und der Agent muss entscheiden, wann er warten, nachfragen, verifizieren oder den Fehler beheben muss, anstatt einfach weiterzuhandeln.","Warum bleiben Aufgaben am Computer mit langem Zeithorizont weiterhin schwierig?",{"id":815,"answer":816,"question":817},"faq5","Wiederholen Sie saubere Aufgaben, fügen Sie realistische Umgebungsfehler ein, variieren Sie UI und Zustand, verlängern Sie den Workflow-Horizont, bringen Sie Mehrdeutigkeiten ein, verlangen Sie nachweisbare Ergebnisbelege, testen Sie Kontrollen für weitreichende Aktionen und führen Sie die Testsuite nach Modell- oder Harness-Änderungen erneut aus.","Wie sollte ich einen Browser- oder Desktop-Agenten vor dem Produktiveinsatz testen?",{"id":819,"answer":820,"question":821},"faq6","Nicht bei jeder risikoarmen Aktion. Bestätigungsanforderungen sollten sich nach Tragweite, Reversibilität, Autorisierung und Unsicherheit richten. Aktionen mit hoher Auswirkung, externer Sichtbarkeit oder schwer rückgängig zu machende Vorgänge erfordern strengere Kontrollen.","Sollten Computer-Use-Agenten immer eine menschliche Bestätigung erfordern?","Zuverlässigkeit von Computer-Use-Agenten",{},{"id":825,"data":826,"type":41,"tunes":828},"h-glossary",{"text":827,"level":218},"Glossar",{},{"id":830,"data":831,"type":830,"tunes":858},"glossary",{"title":832,"entries":833},"Wichtige Begriffe zur Zuverlässigkeit",[834,838,842,846,850,854],{"term":835,"anchor":836,"definition":837},"Computer-Use-Agent","computer-use-agent","Ein KI-Agent, der über Beobachtungen und Aktionen wie Klicken, Tippen, Scrollen, Dateioperationen oder anwendungsübergreifende Workflows mit grafischen Benutzeroberflächen oder Computerumgebungen interagiert.",{"term":839,"anchor":840,"definition":841},"Wiederholbarkeit","repeatability","Der Grad, in dem ein Agent dieselbe Aufgabe über wiederholte Durchläufe hinweg konsistent abschließen kann, anstatt nur bei ausgewählten Verläufen erfolgreich zu sein.",{"term":843,"anchor":844,"definition":845},"Umgebungsrobustheit","environmental-robustness","Die Fähigkeit, trotz realistischer Schwankungen wie Latenz, vorübergehender Fehler, UI-Änderungen, Sitzungszuständen und unerwarteten Seitenbedingungen ein korrektes Verhalten beizubehalten.",{"term":847,"anchor":848,"definition":849},"Ergebnisüberprüfung","outcome-verification","Die Überprüfung des tatsächlichen externen Zustands nach einer Aktion, um zu bestätigen, dass das beabsichtigte Ergebnis eingetreten ist, anstatt sich auf die Selbsteinschätzung des Agenten zu verlassen.",{"term":851,"anchor":852,"definition":853},"Blind Goal-Directedness","blind-goal-directedness","Ein Fehlermuster, bei dem ein Computer-Use-Agent trotz Mehrdeutigkeit, Undurchführbarkeit, widersprüchlicher Bedingungen oder Gründen zum Innehalten und Neubewerten weiterhin ein Ziel verfolgt.",{"term":855,"anchor":856,"definition":857},"Zuverlässigkeitsgrenze","reliability-boundary","Die Gesamtheit der Bedingungen, unter denen eine beobachtete Erfolgsquote oder ein Leistungsanspruch repräsentativ genug für eine konkrete Bereitstellungsentscheidung bleibt.",{},{"id":860,"data":861,"type":41,"tunes":863},"h-sources",{"text":862,"level":218},"Primärquellen und weiterführende Literatur",{},{"id":865,"data":866,"type":872,"tunes":873},"src-openai-computer",{"link":867,"meta":868},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use",{"image":869,"title":870,"description":871},{"url":555},"OpenAI — Computer use","Aktuelle Entwicklerrichtlinien zur Isolierung von Umgebungen, zum Umgang mit Bildschirminhalten als nicht vertrauenswürdig, zur Bestätigung folgenreicher Aktionen, zur Begrenzung von Durchläufen und zur Überprüfung von Ergebnissen.","linkTool",{},{"id":875,"data":876,"type":872,"tunes":882},"src-openai-safety",{"link":877,"meta":878},"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F",{"image":879,"title":880,"description":881},{"url":555},"OpenAI — Running Codex safely at OpenAI","Aktuelle Produktionsrichtlinien zu technischen Grenzen, menschlicher Freigabe, Telemetrie und Steuerung für Agenten, die auf realen Systemen agieren.",{},{"id":884,"data":885,"type":872,"tunes":891},"src-ms-warex",{"link":886,"meta":887},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F",{"image":888,"title":889,"description":890},{"url":555},"Microsoft Research — WAREX","Evaluierung von 2026, die zeigt, dass realistische Unzuverlässigkeiten im Web bei bestehenden Benchmarks zu erheblichen Einbrüchen beim Aufgabenerfolg von Browser-Agenten führen.",{},{"id":893,"data":894,"type":872,"tunes":900},"src-ms-verifier",{"link":895,"meta":896},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F",{"image":897,"title":898,"description":899},{"url":555},"Microsoft Research — The Art of Building Verifiers for Computer Use Agents","Arbeit von 2026 über Prozess- versus Ergebnisbewertung, kontrollierbare versus unkontrollierbare Fehler und zuverlässige Verifikationspfade.",{},{"id":902,"data":903,"type":872,"tunes":909},"src-ms-weavebench",{"link":904,"meta":905},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F",{"image":906,"title":907,"description":908},{"url":555},"Microsoft Research — WeaveBench","Long-Horizon-Benchmark von 2026, der GUI-, CLI- und Code-Workflows kombiniert und eine erhebliche Lücke zwischen aktuellen Agenten und zuverlässiger realer Aufgabenerfüllung aufzeigt.",{},{"id":911,"data":912,"type":872,"tunes":918},"src-osworld2",{"link":913,"meta":914},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537",{"image":915,"title":916,"description":917},{"url":555},"OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","Benchmark von 2026 mit Schwerpunkt auf realistischen Long-Horizon-Computer-Use-Workflows, verborgenen Zuständen und quellenübergreifender logischer Schlussfolgerung.",{},{"id":920,"data":921,"type":872,"tunes":927},"src-ms-sentinel",{"link":922,"meta":923},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F",{"image":924,"title":925,"description":926},{"url":555},"Microsoft Research — SentinelBench","Benchmark von 2026 für zeitlich fortschreitende Aufgaben, bei denen Agenten Umgebungen überwachen und auf Zustandsänderungen reagieren müssen, anstatt kontinuierlich zu agieren.",{},{"id":929,"data":930,"type":872,"tunes":936},"src-ms-blind",{"link":931,"meta":932},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F",{"image":933,"title":934,"description":935},{"url":555},"Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness","ICLR-2026-Forschung darüber, wie Agenten weiterhin mehrdeutige, widersprüchliche oder undurchführbare Ziele verfolgen.",{},"2.31","Computer-Use-Agenten können mittlerweile beeindruckende Browser- und Desktop-Workflows abschließen, aber ein erfolgreicher Durchlauf beweist Fähigkeit—nicht Zuverlässigkeit. Dieser Artikel zeigt, wie man Wiederholbarkeit, Umgebungsrobustheit, Steuerung über lange Zeithorizonte, Zustandsbewusstsein, Ergebnisüberprüfung und sichere Zielhandhabung testet.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg","PUBLISHED","2026-09-25T12:13:00.000Z","2026-09-25T16:13:28.344Z","2026-09-25T19:19:11.089Z",{"en":946,"de":947,"sr":948,"es":949,"fr":950,"it":951,"ru":952,"zh":953},"\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fde\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fsr\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fes\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Ffr\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fit\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fru\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fzh\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system",[955,959,963],{"id":956,"name":957,"slug":958},58,"Evaluation & Qualitäts-Gates","evaluation",{"id":960,"name":961,"slug":962},97,"Verifikation am Test-Set","verification",{"id":964,"name":965,"slug":966},73,"Verifikation & Diffing","verification-and-diffing",{"id":968,"login":969,"email":970,"displayName":971},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[973,1327],{"lang":7,"title":207,"content":209,"contentJson":974,"excerpt":938},{"time":211,"blocks":975,"version":937},[976,979,982,985,988,991,994,997,1000,1003,1006,1016,1019,1022,1033,1036,1039,1042,1045,1048,1051,1054,1057,1060,1063,1066,1069,1072,1075,1078,1081,1084,1087,1090,1093,1096,1099,1102,1105,1108,1111,1114,1117,1130,1133,1136,1139,1142,1145,1161,1164,1167,1170,1183,1186,1189,1192,1195,1205,1208,1213,1216,1219,1222,1225,1228,1231,1234,1237,1240,1243,1246,1249,1252,1255,1258,1261,1271,1274,1284,1287,1292,1297,1302,1307,1312,1317,1322],{"id":214,"data":977,"type":219,"tunes":978},{"title":216,"maxLevel":217,"minLevel":218},{},{"id":222,"data":980,"type":225,"tunes":981},{"text":224},{},{"id":228,"data":983,"type":233,"tunes":984},{"body":230,"title":231,"variant":232},{},{"id":236,"data":986,"type":233,"tunes":987},{"body":238,"title":239,"variant":240},{},{"id":243,"data":989,"type":233,"tunes":990},{"body":245,"title":246,"variant":247},{},{"id":250,"data":992,"type":41,"tunes":993},{"text":252,"level":218},{},{"id":255,"data":995,"type":225,"tunes":996},{"text":257},{},{"id":260,"data":998,"type":225,"tunes":999},{"text":262},{},{"id":265,"data":1001,"type":225,"tunes":1002},{"text":267},{},{"id":270,"data":1004,"type":41,"tunes":1005},{"text":272,"level":218},{},{"id":275,"data":1007,"type":302,"tunes":1015},{"content":1008,"stretched":42,"withHeadings":13},[1009,1010,1011,1012,1013,1014],[279,280,281],[283,284,285],[287,288,289],[291,292,293],[295,296,297],[299,300,301],{},{"id":305,"data":1017,"type":41,"tunes":1018},{"text":307,"level":218},{},{"id":310,"data":1020,"type":225,"tunes":1021},{"text":312},{},{"id":315,"data":1023,"type":341,"tunes":1032},{"steps":1024,"title":339,"orientation":340},[1025,1026,1027,1028,1029,1030,1031],{"label":319,"description":320},{"label":322,"description":323},{"label":325,"description":326},{"label":328,"description":329},{"label":331,"description":332},{"label":334,"description":335},{"label":337,"description":338},{},{"id":344,"data":1034,"type":41,"tunes":1035},{"text":346,"level":217},{},{"id":349,"data":1037,"type":225,"tunes":1038},{"text":351},{},{"id":354,"data":1040,"type":225,"tunes":1041},{"text":356},{},{"id":359,"data":1043,"type":41,"tunes":1044},{"text":361,"level":217},{},{"id":364,"data":1046,"type":225,"tunes":1047},{"text":366},{},{"id":369,"data":1049,"type":225,"tunes":1050},{"text":371},{},{"id":374,"data":1052,"type":41,"tunes":1053},{"text":376,"level":217},{},{"id":379,"data":1055,"type":225,"tunes":1056},{"text":381},{},{"id":384,"data":1058,"type":225,"tunes":1059},{"text":386},{},{"id":389,"data":1061,"type":233,"tunes":1062},{"body":391,"title":392,"variant":393},{},{"id":396,"data":1064,"type":41,"tunes":1065},{"text":398,"level":217},{},{"id":401,"data":1067,"type":225,"tunes":1068},{"text":403},{},{"id":406,"data":1070,"type":225,"tunes":1071},{"text":408},{},{"id":411,"data":1073,"type":225,"tunes":1074},{"text":413},{},{"id":416,"data":1076,"type":41,"tunes":1077},{"text":418,"level":217},{},{"id":421,"data":1079,"type":225,"tunes":1080},{"text":423},{},{"id":426,"data":1082,"type":225,"tunes":1083},{"text":428},{},{"id":431,"data":1085,"type":225,"tunes":1086},{"text":433},{},{"id":436,"data":1088,"type":41,"tunes":1089},{"text":438,"level":217},{},{"id":441,"data":1091,"type":225,"tunes":1092},{"text":443},{},{"id":446,"data":1094,"type":225,"tunes":1095},{"text":448},{},{"id":451,"data":1097,"type":225,"tunes":1098},{"text":453},{},{"id":456,"data":1100,"type":41,"tunes":1101},{"text":458,"level":217},{},{"id":461,"data":1103,"type":225,"tunes":1104},{"text":463},{},{"id":466,"data":1106,"type":225,"tunes":1107},{"text":468},{},{"id":471,"data":1109,"type":225,"tunes":1110},{"text":473},{},{"id":476,"data":1112,"type":41,"tunes":1113},{"text":478,"level":218},{},{"id":481,"data":1115,"type":225,"tunes":1116},{"text":483},{},{"id":486,"data":1118,"type":341,"tunes":1129},{"steps":1119,"title":516,"orientation":340},[1120,1121,1122,1123,1124,1125,1126,1127,1128],{"label":490,"description":491},{"label":493,"description":494},{"label":496,"description":497},{"label":499,"description":500},{"label":502,"description":503},{"label":505,"description":506},{"label":508,"description":509},{"label":511,"description":512},{"label":514,"description":515},{},{"id":519,"data":1131,"type":41,"tunes":1132},{"text":521,"level":218},{},{"id":524,"data":1134,"type":225,"tunes":1135},{"text":526},{},{"id":529,"data":1137,"type":225,"tunes":1138},{"text":531},{},{"id":534,"data":1140,"type":540,"tunes":1141},{"url":536,"title":537,"excerpt":538,"ctaLabel":539},{},{"id":543,"data":1143,"type":41,"tunes":1144},{"text":545,"level":218},{},{"id":548,"data":1146,"type":579,"tunes":1160},{"rows":1147,"title":568,"layout":302,"columns":1156},[1148,1150,1152,1154],{"id":552,"label":553,"values":1149},[555,555,555],{"id":557,"label":558,"values":1151},[555,555,555],{"id":561,"label":562,"values":1153},[555,555,555],{"id":565,"label":566,"values":1155},[555,555,555],[1157,1158,1159],{"id":571,"label":572},{"id":574,"label":575},{"id":577,"label":578},{},{"id":582,"data":1162,"type":225,"tunes":1163},{"text":584},{},{"id":587,"data":1165,"type":41,"tunes":1166},{"text":589,"level":218},{},{"id":592,"data":1168,"type":225,"tunes":1169},{"text":594},{},{"id":597,"data":1171,"type":302,"tunes":1182},{"content":1172,"stretched":42,"withHeadings":13},[1173,1174,1175,1176,1177,1178,1179,1180,1181],[601,602,603],[605,606,607],[609,610,611],[613,614,615],[617,618,619],[621,622,623],[625,626,627],[629,630,631],[633,634,635],{},{"id":638,"data":1184,"type":41,"tunes":1185},{"text":640,"level":218},{},{"id":643,"data":1187,"type":225,"tunes":1188},{"text":645},{},{"id":648,"data":1190,"type":225,"tunes":1191},{"text":650},{},{"id":653,"data":1193,"type":41,"tunes":1194},{"text":655,"level":218},{},{"id":658,"data":1196,"type":302,"tunes":1204},{"content":1197,"stretched":42,"withHeadings":13},[1198,1199,1200,1201,1202,1203],[662,663,664],[666,667,668],[670,671,672],[674,675,676],[678,679,680],[682,683,684],{},{"id":687,"data":1206,"type":41,"tunes":1207},{"text":689,"level":218},{},{"id":692,"data":1209,"type":709,"tunes":1212},{"meta":1210,"items":1211,"style":708},{},[696,697,698,699,700,701,702,703,704,705,706,707],{},{"id":712,"data":1214,"type":225,"tunes":1215},{"text":714},{},{"id":717,"data":1217,"type":540,"tunes":1218},{"url":719,"title":720,"excerpt":721,"ctaLabel":722},{},{"id":725,"data":1220,"type":41,"tunes":1221},{"text":727,"level":218},{},{"id":730,"data":1223,"type":225,"tunes":1224},{"text":732},{},{"id":735,"data":1226,"type":225,"tunes":1227},{"text":737},{},{"id":740,"data":1229,"type":225,"tunes":1230},{"text":742},{},{"id":745,"data":1232,"type":41,"tunes":1233},{"text":747,"level":218},{},{"id":750,"data":1235,"type":225,"tunes":1236},{"text":752},{},{"id":755,"data":1238,"type":225,"tunes":1239},{"text":757},{},{"id":760,"data":1241,"type":41,"tunes":1242},{"text":762,"level":218},{},{"id":765,"data":1244,"type":225,"tunes":1245},{"text":767},{},{"id":770,"data":1247,"type":225,"tunes":1248},{"text":772},{},{"id":775,"data":1250,"type":41,"tunes":1251},{"text":777,"level":218},{},{"id":780,"data":1253,"type":225,"tunes":1254},{"text":782},{},{"id":785,"data":1256,"type":225,"tunes":1257},{"text":787},{},{"id":790,"data":1259,"type":41,"tunes":1260},{"text":792,"level":218},{},{"id":795,"data":1262,"type":795,"tunes":1270},{"items":1263,"title":822},[1264,1265,1266,1267,1268,1269],{"id":799,"answer":800,"question":801},{"id":803,"answer":804,"question":805},{"id":807,"answer":808,"question":809},{"id":811,"answer":812,"question":813},{"id":815,"answer":816,"question":817},{"id":819,"answer":820,"question":821},{},{"id":825,"data":1272,"type":41,"tunes":1273},{"text":827,"level":218},{},{"id":830,"data":1275,"type":830,"tunes":1283},{"title":832,"entries":1276},[1277,1278,1279,1280,1281,1282],{"term":835,"anchor":836,"definition":837},{"term":839,"anchor":840,"definition":841},{"term":843,"anchor":844,"definition":845},{"term":847,"anchor":848,"definition":849},{"term":851,"anchor":852,"definition":853},{"term":855,"anchor":856,"definition":857},{},{"id":860,"data":1285,"type":41,"tunes":1286},{"text":862,"level":218},{},{"id":865,"data":1288,"type":872,"tunes":1291},{"link":867,"meta":1289},{"image":1290,"title":870,"description":871},{"url":555},{},{"id":875,"data":1293,"type":872,"tunes":1296},{"link":877,"meta":1294},{"image":1295,"title":880,"description":881},{"url":555},{},{"id":884,"data":1298,"type":872,"tunes":1301},{"link":886,"meta":1299},{"image":1300,"title":889,"description":890},{"url":555},{},{"id":893,"data":1303,"type":872,"tunes":1306},{"link":895,"meta":1304},{"image":1305,"title":898,"description":899},{"url":555},{},{"id":902,"data":1308,"type":872,"tunes":1311},{"link":904,"meta":1309},{"image":1310,"title":907,"description":908},{"url":555},{},{"id":911,"data":1313,"type":872,"tunes":1316},{"link":913,"meta":1314},{"image":1315,"title":916,"description":917},{"url":555},{},{"id":920,"data":1318,"type":872,"tunes":1321},{"link":922,"meta":1319},{"image":1320,"title":925,"description":926},{"url":555},{},{"id":929,"data":1323,"type":872,"tunes":1326},{"link":931,"meta":1324},{"image":1325,"title":934,"description":935},{"url":555},{},{"lang":1328,"title":1329,"content":1330,"contentJson":1331,"excerpt":1913},"en","Computer-Use Agents: Why a Successful Demo Can Still Be an Unreliable System","{\"time\":1790352872794,\"blocks\":[{\"id\":\"IYG9UPcPY0\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents can now click, type, browse, edit files, operate desktop applications, and complete impressive multi-step tasks. That makes successful demos easy to understand and easy to overinterpret. A single completed workflow shows that the agent can succeed under those conditions. It does not show how often it succeeds, how it behaves when the environment changes, whether it verifies the result, or how safely it acts when the goal becomes ambiguous.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"\u003Cstrong>A successful computer-use demo proves capability, not reliability.\u003C\u002Fstrong> Production reliability requires the agent to succeed repeatedly across environmental variation, recover from transient failures, preserve constraints over long horizons, detect hidden or changing state, verify the actual outcome, and stop or ask when the goal becomes ambiguous or unsafe. The correct production question is not “Can the agent do this task?” but “Under which conditions can we trust it to do this task repeatedly?”\"},\"tunes\":{}},{\"id\":\"freshness\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Fast-moving field\",\"body\":\"This article reflects computer-use agent research and platform guidance available on \u003Cstrong>25 September 2026\u003C\u002Fstrong>. Benchmark results are not directly comparable across different task sets, environments, models, step limits, judges, or harnesses. Treat every benchmark number together with its evaluation conditions.\"},\"tunes\":{}},{\"id\":\"model-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"The model used in this article\",\"body\":\"The Computer-Use Reliability Ladder and Demo-to-Production Stress Test below are practical evaluation models proposed here. They are not formal industry standards.\"},\"tunes\":{}},{\"id\":\"h-demo\",\"type\":\"header\",\"data\":{\"text\":\"Why the demo is the easiest possible reliability test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-demo-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A demo normally shows one trajectory that worked. The environment is known, the task is selected in advance, the operator can restart after a failure, and the audience sees the successful path. Production systems face a distribution instead: different pages, network conditions, account states, pop-ups, latency, UI changes, hidden state, permissions, interruptions, and users who describe goals imperfectly.\"},\"tunes\":{}},{\"id\":\"p-demo-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That distinction matters because computer-use agents operate through interfaces designed for humans rather than deterministic APIs. Their action loop depends on perception, state interpretation, planning, interaction timing, and environment response. Small changes can alter the trajectory even when the user goal is unchanged.\"},\"tunes\":{}},{\"id\":\"p-demo-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Microsoft Research's WAREX work makes the problem explicit: benchmark agents that look capable in controlled settings lose substantial task success when realistic web instability is introduced. The failure is not necessarily “the model became less intelligent.” The environment stopped being deterministic.\"},\"tunes\":{}},{\"id\":\"h-claims\",\"type\":\"header\",\"data\":{\"text\":\"Capability, success rate, reliability, and safety are different claims\",\"level\":2},\"tunes\":{}},{\"id\":\"claims-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Claim\",\"What it actually establishes\",\"What it does not establish\"],[\"The agent completed the task once\",\"Capability under one observed trajectory\",\"Repeatability, robustness, safety, or generalization\"],[\"The agent scores highly on a benchmark\",\"Performance under that benchmark's task and evaluation conditions\",\"Equivalent production performance on different environments\"],[\"The agent usually reaches the goal\",\"Outcome success frequency\",\"Correct process, safe behaviour, or evidence that the result was verified\"],[\"The agent follows the intended process\",\"Trajectory quality under the evaluated rubric\",\"That the external environment actually accepted the final outcome\"],[\"The agent avoids unsafe actions in a test set\",\"Performance on represented safety cases\",\"Safety under every novel ambiguity, injection, or side effect\"]]},\"tunes\":{}},{\"id\":\"h-ladder\",\"type\":\"header\",\"data\":{\"text\":\"The Computer-Use Reliability Ladder\",\"level\":2},\"tunes\":{}},{\"id\":\"p-ladder-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A useful way to evaluate computer-use systems is to move from one-off capability toward progressively harder reliability properties. Higher levels assume the lower levels but do not follow automatically from them.\"},\"tunes\":{}},{\"id\":\"ladder-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Computer-Use Reliability Ladder\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Capability\",\"description\":\"Can the agent complete the task at least once under known conditions?\"},{\"label\":\"2. Repeatability\",\"description\":\"Can it complete the same task consistently across repeated trials?\"},{\"label\":\"3. Environmental robustness\",\"description\":\"Does it survive timing changes, network issues, pop-ups, UI variation, and small environmental perturbations?\"},{\"label\":\"4. Long-horizon control\",\"description\":\"Can it preserve goals, constraints, and progress across many steps, applications, and delayed events?\"},{\"label\":\"5. State awareness\",\"description\":\"Can it detect when the environment changed, when hidden state matters, or when an assumption is no longer valid?\"},{\"label\":\"6. Outcome verification\",\"description\":\"Does it verify that the intended result actually happened instead of trusting its own action sequence?\"},{\"label\":\"7. Safe goal handling\",\"description\":\"Can it stop, ask, refuse, or hand control back when the goal is ambiguous, infeasible, contradictory, or high impact?\"}]},\"tunes\":{}},{\"id\":\"h-capability\",\"type\":\"header\",\"data\":{\"text\":\"Level 1 — Capability: the demo question\",\"level\":3},\"tunes\":{}},{\"id\":\"p-capability-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Capability asks whether an agent can perform the task at all. This is valuable. Computer-use systems have advanced rapidly, and modern agents can complete workflows that older systems could not execute reliably.\"},\"tunes\":{}},{\"id\":\"p-capability-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"But capability is a weak deployment criterion. One successful run does not tell you whether the agent succeeds 95% of the time or 30% of the time, whether failures are harmless or destructive, or whether success depends on a lucky page state.\"},\"tunes\":{}},{\"id\":\"h-repeatability\",\"type\":\"header\",\"data\":{\"text\":\"Level 2 — Repeatability: does the same task stay solved?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-repeat-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use trajectories are stochastic. Model outputs vary, pages load at different speeds, visual states change, and long workflows create many branching opportunities. A production test should therefore run the same task multiple times rather than treating one passing trace as representative.\"},\"tunes\":{}},{\"id\":\"p-repeat-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Measure not only the average success rate but also the distribution of failure modes: wrong click, premature termination, missed confirmation, incorrect field, duplicate action, navigation loop, stale-state assumption, and false success report.\"},\"tunes\":{}},{\"id\":\"h-robustness\",\"type\":\"header\",\"data\":{\"text\":\"Level 3 — Environmental robustness: what happens when the web behaves like the web?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-robust-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Real websites are not benchmark fixtures. Requests fail, elements load late, sessions expire, pages change, consent banners appear, servers return errors, and network conditions fluctuate.\"},\"tunes\":{}},{\"id\":\"p-robust-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"WAREX evaluates this gap by injecting realistic web unreliability into existing benchmark environments and reports significant drops in task success. This is a critical production insight: a benchmark can measure task competence while under-measuring recovery from environmental instability.\"},\"tunes\":{}},{\"id\":\"robust-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"Reliability test\",\"body\":\"Inject delays, transient HTTP failures, stale page state, modal dialogs, session expiration, duplicate responses, and controlled UI variation. If the agent only works on the clean path, it is a demo-capable system, not a production-reliable one.\"},\"tunes\":{}},{\"id\":\"h-long\",\"type\":\"header\",\"data\":{\"text\":\"Level 4 — Long-horizon control: success changes when the task becomes real work\",\"level\":3},\"tunes\":{}},{\"id\":\"p-long-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Short tasks hide a class of failures that appear only after dozens or hundreds of actions: forgotten constraints, duplicated work, premature completion, missed state changes, cross-application inconsistencies, and accumulated small errors.\"},\"tunes\":{}},{\"id\":\"p-long-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OSWorld 2.0 was designed specifically around long-horizon real-world workflows. Its tasks take human users a median of roughly 1.6 hours and require many more tool calls than earlier computer-use benchmarks. Under its primary completion metric, even the strongest evaluated systems remain far from complete task reliability.\"},\"tunes\":{}},{\"id\":\"p-long-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"WeaveBench reaches a similar conclusion from another angle. It evaluates hybrid GUI, CLI and code workflows and reports that the best evaluated model-runtime pairing passes only 41.2% of tasks. The important result is not one leaderboard number; it is that realistic cross-interface orchestration exposes failures hidden by simpler single-interface tasks.\"},\"tunes\":{}},{\"id\":\"h-state\",\"type\":\"header\",\"data\":{\"text\":\"Level 5 — State awareness: the environment can change underneath the plan\",\"level\":3},\"tunes\":{}},{\"id\":\"p-state-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running tasks often depend on hidden or changing state: an email arrives, a calendar changes, a form is submitted, a background process finishes, a browser session expires, a user modifies a file, or an external system changes availability.\"},\"tunes\":{}},{\"id\":\"p-state-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Microsoft's SentinelBench argues that many long-running tasks should not be solved through continuous action at all. The correct behaviour may be to monitor, wait for an external event, then act when the state changes. This is a different capability from clicking faster or planning more steps.\"},\"tunes\":{}},{\"id\":\"p-state-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"A reliable computer-use agent therefore needs to distinguish actionable now, waiting for state, state changed, and assumption invalidated.\"},\"tunes\":{}},{\"id\":\"h-verify\",\"type\":\"header\",\"data\":{\"text\":\"Level 6 — Outcome verification: did the action actually work?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-verify-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An agent can execute an apparently correct sequence and still fail the task. A button click may not register. A form may reject hidden validation. A file may save to the wrong directory. A purchase may remain unconfirmed. A site may display a success-looking screen while the underlying operation failed.\"},\"tunes\":{}},{\"id\":\"p-verify-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current computer-use guidance explicitly recommends bounding and verifying the run instead of relying only on the model's final answer. Microsoft Research's work on computer-use verifiers reaches the same conclusion from evaluation: process and outcome need to be judged separately.\"},\"tunes\":{}},{\"id\":\"p-verify-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The Universal Verifier research reports that earlier verifier setups can produce high false-positive rates, while stronger rubric design and explicit separation of process, outcome, controllable failures, and uncontrollable failures substantially improve agreement with human labels.\"},\"tunes\":{}},{\"id\":\"h-safe-goal\",\"type\":\"header\",\"data\":{\"text\":\"Level 7 — Safe goal handling: the agent must know when not to continue\",\"level\":3},\"tunes\":{}},{\"id\":\"p-safe-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents are optimized to complete goals, but goal persistence can itself become a failure mode. An ambiguous request, impossible condition, contradictory instruction, suspicious webpage, or changed environment may require clarification or stopping rather than more action.\"},\"tunes\":{}},{\"id\":\"p-safe-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The BLIND-ACT benchmark studies this problem as Blind Goal-Directedness. Across the systems evaluated in that work, agents frequently continued pursuing tasks despite ambiguity, infeasibility, conflicting context, or other reasons to reconsider. The authors identify patterns such as execution-first bias and request primacy.\"},\"tunes\":{}},{\"id\":\"p-safe-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"This failure class matters because a highly capable agent can make a bad situation worse faster. Reliability therefore includes a policy for when not to act.\"},\"tunes\":{}},{\"id\":\"h-stress\",\"type\":\"header\",\"data\":{\"text\":\"The Demo-to-Production Stress Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-stress-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Before deploying a computer-use workflow, take the successful demo and systematically remove the assumptions that made it easy.\"},\"tunes\":{}},{\"id\":\"stress-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Demo-to-Production Stress Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Re-run the clean task\",\"description\":\"Establish repeatability over multiple trials before adding complexity.\"},{\"label\":\"2. Perturb the environment\",\"description\":\"Add latency, retries, pop-ups, page variation, stale sessions and temporary failures.\"},{\"label\":\"3. Extend the horizon\",\"description\":\"Turn the short demo into the full real workflow with intermediate state, multiple applications and delayed steps.\"},{\"label\":\"4. Change hidden state\",\"description\":\"Modify account, file, task or external state after the agent has formed a plan and test whether it detects the change.\"},{\"label\":\"5. Inject ambiguity\",\"description\":\"Remove one important assumption and test whether the agent asks instead of guessing.\"},{\"label\":\"6. Inject a controlled contradiction\",\"description\":\"Present old and new state together and verify that authoritative current state wins.\"},{\"label\":\"7. Require outcome proof\",\"description\":\"Make task completion depend on verifiable final state, not the model's self-report.\"},{\"label\":\"8. Test consequential boundaries\",\"description\":\"Confirm that irreversible or sensitive actions trigger the expected approval, refusal or handoff.\"},{\"label\":\"9. Repeat after harness or model changes\",\"description\":\"Treat runtime upgrades as reliability changes that need regression testing.\"}]},\"tunes\":{}},{\"id\":\"h-benchmark-boundary\",\"type\":\"header\",\"data\":{\"text\":\"Benchmark success has a validity boundary\",\"level\":2},\"tunes\":{}},{\"id\":\"p-boundary-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A benchmark score is a conditional statement. It is valid for a particular model, harness, environment, task set, judge, tool interface, step budget, retry policy, date and evaluation method.\"},\"tunes\":{}},{\"id\":\"p-boundary-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The number becomes misleading when those conditions disappear from the claim. “Agent X scores 80%” is weaker than “Agent X scored 80% on benchmark Y under environment Z with judge J and step budget N.” The second statement preserves the boundary that tells you whether the number transfers to your application.\"},\"tunes\":{}},{\"id\":\"ref-avb\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\",\"title\":\"The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers\",\"excerpt\":\"A framework for making explicit the conditions under which an AI claim remains valid and what changes require restriction, recalculation, or abandonment.\",\"ctaLabel\":\"Read the Answer Validity Boundary\"},\"tunes\":{}},{\"id\":\"h-process-outcome\",\"type\":\"header\",\"data\":{\"text\":\"Process success and outcome success must be scored separately\",\"level\":2},\"tunes\":{}},{\"id\":\"process-outcome-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Four possible outcomes of one computer-use run\",\"layout\":\"table\",\"columns\":[{\"id\":\"process\",\"label\":\"Process\"},{\"id\":\"outcome\",\"label\":\"Outcome\"},{\"id\":\"interpretation\",\"label\":\"Interpretation\"}],\"rows\":[{\"id\":\"good-good\",\"label\":\"Correct process \u002F correct outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"bad-good\",\"label\":\"Wrong process \u002F correct outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"good-bad\",\"label\":\"Correct process \u002F wrong outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"bad-bad\",\"label\":\"Wrong process \u002F wrong outcome\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"p-process-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"WeaveBench reports that outcome-only grading can materially overestimate computer-use performance because an agent may produce an apparently successful artifact through a shortcut or fabricated evidence. The verifier must inspect the trajectory and deliverables, not merely the final claim.\"},\"tunes\":{}},{\"id\":\"h-distribution\",\"type\":\"header\",\"data\":{\"text\":\"Production reliability is a distribution, not a single pass rate\",\"level\":2},\"tunes\":{}},{\"id\":\"p-dist-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A useful production evaluation samples the dimensions that actually vary in your environment. For a browser workflow, that might include account age, locale, viewport, page version, network quality, authentication state, existing cart state, cookies, pop-ups, user permissions and whether a human interrupts the run.\"},\"tunes\":{}},{\"id\":\"distribution-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Dimension\",\"Example variation\",\"Why it matters\"],[\"Environment\",\"Fast vs slow network, transient failures, page timing\",\"Tests recovery and waiting behaviour\"],[\"UI\",\"Different viewport, modal, reordered element, minor redesign\",\"Tests brittle visual\u002Faction assumptions\"],[\"State\",\"Logged in\u002Fout, empty\u002Fnon-empty cart, existing file, changed permissions\",\"Tests hidden-state reasoning\"],[\"Task horizon\",\"5 steps vs 50+ steps, one app vs several apps\",\"Tests accumulated trajectory error\"],[\"Ambiguity\",\"Missing preference or incomplete user instruction\",\"Tests whether the agent asks instead of guesses\"],[\"Consequence\",\"Read-only vs purchase\u002Fsend\u002Fdelete\u002Fchange\",\"Tests confirmation and authorization controls\"],[\"Adversarial content\",\"Prompt injection or misleading page text\",\"Tests instruction hierarchy and containment\"],[\"Model \u002F harness version\",\"Runtime upgrade\",\"Tests regression from system-level changes\"]]},\"tunes\":{}},{\"id\":\"h-budget\",\"type\":\"header\",\"data\":{\"text\":\"Reliability needs a failure budget, not perfection\",\"level\":2},\"tunes\":{}},{\"id\":\"p-budget-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"No production system is perfectly reliable. The useful engineering question is which failures are acceptable, detectable and recoverable. A failed attempt to sort a local folder is not equivalent to sending the wrong email, purchasing the wrong product or changing an account setting.\"},\"tunes\":{}},{\"id\":\"p-budget-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Classify actions by consequence and reversibility. Low-impact reversible actions can tolerate more autonomy. High-impact, externally visible or hard-to-reverse actions need stronger confirmation, state verification, authorization and post-action checks.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A practical computer-use reliability matrix\",\"level\":2},\"tunes\":{}},{\"id\":\"control-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Action class\",\"Example\",\"Recommended control\"],[\"Read \u002F inspect\",\"Open pages, read files, gather information\",\"Bound scope, log sources, tolerate recoverable navigation errors\"],[\"Reversible local change\",\"Edit draft file, reorganize temporary workspace\",\"Checkpoint or version before change; verify result\"],[\"External communication\",\"Send email, publish content, submit form\",\"User confirmation or explicit delegated authority; verify accepted state\"],[\"Financial \u002F transactional\",\"Purchase, checkout, paid subscription\",\"Strict mandate, amount\u002Fmerchant constraints, final confirmation and receipt verification\"],[\"Destructive \u002F privilege-changing\",\"Delete data, change permissions, revoke access\",\"Narrow authorization, explicit confirmation, reversible path where possible, post-action audit\"]]},\"tunes\":{}},{\"id\":\"h-log\",\"type\":\"header\",\"data\":{\"text\":\"What to log for a computer-use failure\",\"level\":2},\"tunes\":{}},{\"id\":\"log-list\",\"type\":\"list\",\"data\":{\"style\":\"unordered\",\"meta\":{},\"items\":[\"User goal and explicit constraints.\",\"Model and harness version.\",\"Environment and application versions.\",\"Screenshots or structured observations relevant to the failure.\",\"Actions taken with timestamps.\",\"Tool, click, keyboard and navigation results.\",\"State transitions and waiting periods.\",\"Approval, refusal or handoff events.\",\"External errors and network failures.\",\"Final observable environment state.\",\"The agent's reported outcome.\",\"Verifier result and whether the failure was controllable by the agent.\"]},\"tunes\":{}},{\"id\":\"p-log-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The crucial comparison is between reported success and observable success. A system that cannot distinguish those two will eventually accumulate false positives in production.\"},\"tunes\":{}},{\"id\":\"ref-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"A broader reliability model for evaluating agent trajectories, tool use and intermediate decisions instead of accepting the final answer as proof that the system worked correctly.\",\"ctaLabel\":\"Read the agent reliability article\"},\"tunes\":{}},{\"id\":\"h-security\",\"type\":\"header\",\"data\":{\"text\":\"Security is part of reliability for computer-use agents\",\"level\":2},\"tunes\":{}},{\"id\":\"p-sec-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents do not merely read untrusted content; they can act after reading it. That turns prompt injection, malicious page content and phishing into execution-path risks.\"},\"tunes\":{}},{\"id\":\"p-sec-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current computer-use guidance recommends isolating the environment, allow-listing sites and actions, treating screen content as untrusted, confirming consequential actions, bounding the run and verifying the actual outcome. ChatGPT agent similarly uses confirmations, prompt-injection monitoring and supervised modes for sensitive contexts.\"},\"tunes\":{}},{\"id\":\"p-sec-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The architecture principle is broader than any one provider: content observed by the agent must not be allowed to redefine the user's authority. A webpage can provide data. It cannot grant permission to send data elsewhere, purchase something, change credentials or override the task boundary.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The reliability gap would narrow if computer-use models became robust to long horizons, dynamic state, UI variation, environmental failures and ambiguous goals across representative production distributions. Better native state APIs, standardized machine-readable interfaces and stronger verifier infrastructure could also reduce the amount of fragile GUI interaction required.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The deployment threshold also changes with task consequence. A 70% success rate can be useful for a supervised low-risk research task and unacceptable for an autonomous financial or destructive workflow. Reliability must therefore be evaluated against the cost of each failure class, not one universal pass-rate threshold.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The cited benchmarks evaluate different environments and should not be ranked against one another as if they measured the same thing. WAREX stresses web unreliability; WeaveBench targets hybrid long-horizon work; OSWorld 2.0 targets realistic long workflows; BLIND-ACT focuses on goal handling under ambiguity and infeasibility.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Benchmark results also age quickly. Model, harness and verifier improvements can materially change scores within months. The durable lesson is therefore the evaluation method: vary conditions, separate process from outcome, verify external state, and preserve the boundary around each performance claim.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents are already capable enough to be useful. That is exactly why the evaluation question has changed. The challenge is no longer only whether an agent can click through a workflow. It is whether the system remains dependable when the clean demo conditions disappear.\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Treat one successful run as evidence of capability. Then test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification and safe goal handling. A production computer-use agent is not the one that can complete the demo. It is the one whose failure boundaries are known, measured and controlled.\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Computer-use agent reliability\",\"items\":[{\"id\":\"faq1\",\"question\":\"Does a successful computer-use agent demo prove production reliability?\",\"answer\":\"No. It proves capability under one observed trajectory. Production reliability requires repeated success across environmental variation, long-running tasks, changing state, ambiguity, recovery conditions and consequential actions.\"},{\"id\":\"faq2\",\"question\":\"Why can computer-use benchmarks look much better than real-world performance?\",\"answer\":\"Benchmarks can use more controlled environments, shorter tasks, stable network conditions, simpler application combinations or outcome criteria that do not capture all process failures. The exact validity boundary depends on each benchmark.\"},{\"id\":\"faq3\",\"question\":\"What is the most important reliability check after a computer-use action?\",\"answer\":\"Verify the actual external outcome. Do not treat the agent's final statement or intended click sequence as proof that the target system accepted the operation.\"},{\"id\":\"faq4\",\"question\":\"Why do long-horizon computer tasks remain difficult?\",\"answer\":\"Errors accumulate across many actions, constraints are forgotten, external state changes, work spans multiple applications, hidden state matters, and the agent must decide when to wait, ask, verify or recover rather than simply continue acting.\"},{\"id\":\"faq5\",\"question\":\"How should I test a browser or desktop agent before deployment?\",\"answer\":\"Repeat clean tasks, inject realistic environmental failures, vary UI and state, extend the workflow horizon, introduce ambiguity, require observable outcome proof, test high-impact action controls and rerun the suite after model or harness changes.\"},{\"id\":\"faq6\",\"question\":\"Should computer-use agents always require human confirmation?\",\"answer\":\"Not for every low-risk action. Confirmation requirements should scale with consequence, reversibility, authority and uncertainty. High-impact, externally visible or difficult-to-reverse actions need stronger controls.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key reliability terms\",\"entries\":[{\"term\":\"Computer-use agent\",\"definition\":\"An AI agent that interacts with graphical user interfaces or computer environments through observations and actions such as clicking, typing, scrolling, file operations or cross-application workflows.\",\"anchor\":\"computer-use-agent\"},{\"term\":\"Repeatability\",\"definition\":\"The degree to which an agent can complete the same task consistently across repeated runs rather than succeeding only on selected trajectories.\",\"anchor\":\"repeatability\"},{\"term\":\"Environmental robustness\",\"definition\":\"The ability to preserve correct behaviour despite realistic variation such as latency, transient errors, UI changes, session state and unexpected page conditions.\",\"anchor\":\"environmental-robustness\"},{\"term\":\"Outcome verification\",\"definition\":\"Checking the actual external state after an action to confirm that the intended result occurred instead of relying on the agent's self-report.\",\"anchor\":\"outcome-verification\"},{\"term\":\"Blind Goal-Directedness\",\"definition\":\"A failure pattern in which a computer-use agent continues pursuing a goal despite ambiguity, infeasibility, contradictory conditions or reasons to stop and reassess.\",\"anchor\":\"blind-goal-directedness\"},{\"term\":\"Reliability boundary\",\"definition\":\"The set of conditions under which an observed success rate or capability claim remains representative enough for a specific deployment decision.\",\"anchor\":\"reliability-boundary\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-computer\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use\",\"meta\":{\"title\":\"OpenAI — Computer use\",\"description\":\"Current developer guidance on isolating environments, treating screen content as untrusted, confirming consequential actions, bounding runs and verifying outcomes.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-openai-safety\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F\",\"meta\":{\"title\":\"OpenAI — Running Codex safely at OpenAI\",\"description\":\"Current production guidance on technical boundaries, human approval, telemetry and control for agents that act on real systems.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-warex\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F\",\"meta\":{\"title\":\"Microsoft Research — WAREX\",\"description\":\"2026 evaluation showing that realistic web unreliability causes significant drops in browser-agent task success on existing benchmarks.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-verifier\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F\",\"meta\":{\"title\":\"Microsoft Research — The Art of Building Verifiers for Computer Use Agents\",\"description\":\"2026 work on process versus outcome evaluation, controllable versus uncontrollable failures and reliable trajectory verification.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-weavebench\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F\",\"meta\":{\"title\":\"Microsoft Research — WeaveBench\",\"description\":\"2026 long-horizon benchmark combining GUI, CLI and code workflows and showing a substantial gap between current agents and reliable real-world completion.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-osworld2\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537\",\"meta\":{\"title\":\"OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks\",\"description\":\"2026 benchmark focused on realistic long-horizon computer-use workflows, hidden state and cross-source reasoning.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-sentinel\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F\",\"meta\":{\"title\":\"Microsoft Research — SentinelBench\",\"description\":\"2026 benchmark for time-evolving tasks where agents must monitor environments and respond to state changes rather than continuously act.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-blind\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F\",\"meta\":{\"title\":\"Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness\",\"description\":\"ICLR 2026 research on agents continuing to pursue ambiguous, contradictory or infeasible goals.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":1332,"blocks":1333,"version":1912},1790352872794,[1334,1338,1342,1347,1352,1357,1361,1365,1369,1373,1377,1405,1409,1413,1439,1443,1447,1451,1455,1459,1463,1467,1471,1475,1480,1484,1488,1492,1496,1500,1504,1508,1512,1516,1520,1524,1528,1532,1536,1540,1544,1548,1552,1584,1588,1592,1596,1603,1607,1630,1634,1638,1642,1680,1684,1688,1692,1696,1724,1728,1745,1749,1756,1760,1764,1768,1772,1776,1780,1784,1788,1792,1796,1800,1804,1808,1811,1834,1838,1860,1864,1870,1876,1882,1888,1894,1900,1906],{"id":214,"data":1335,"type":219,"tunes":1337},{"title":1336,"maxLevel":217,"minLevel":218},"Contents",{},{"id":222,"data":1339,"type":225,"tunes":1341},{"text":1340},"Computer-use agents can now click, type, browse, edit files, operate desktop applications, and complete impressive multi-step tasks. That makes successful demos easy to understand and easy to overinterpret. A single completed workflow shows that the agent can succeed under those conditions. It does not show how often it succeeds, how it behaves when the environment changes, whether it verifies the result, or how safely it acts when the goal becomes ambiguous.",{},{"id":228,"data":1343,"type":233,"tunes":1346},{"body":1344,"title":1345,"variant":232},"\u003Cstrong>A successful computer-use demo proves capability, not reliability.\u003C\u002Fstrong> Production reliability requires the agent to succeed repeatedly across environmental variation, recover from transient failures, preserve constraints over long horizons, detect hidden or changing state, verify the actual outcome, and stop or ask when the goal becomes ambiguous or unsafe. The correct production question is not “Can the agent do this task?” but “Under which conditions can we trust it to do this task repeatedly?”","Direct answer",{},{"id":236,"data":1348,"type":233,"tunes":1351},{"body":1349,"title":1350,"variant":240},"This article reflects computer-use agent research and platform guidance available on \u003Cstrong>25 September 2026\u003C\u002Fstrong>. Benchmark results are not directly comparable across different task sets, environments, models, step limits, judges, or harnesses. Treat every benchmark number together with its evaluation conditions.","Fast-moving field",{},{"id":243,"data":1353,"type":233,"tunes":1356},{"body":1354,"title":1355,"variant":247},"The Computer-Use Reliability Ladder and Demo-to-Production Stress Test below are practical evaluation models proposed here. They are not formal industry standards.","The model used in this article",{},{"id":250,"data":1358,"type":41,"tunes":1360},{"text":1359,"level":218},"Why the demo is the easiest possible reliability test",{},{"id":255,"data":1362,"type":225,"tunes":1364},{"text":1363},"A demo normally shows one trajectory that worked. The environment is known, the task is selected in advance, the operator can restart after a failure, and the audience sees the successful path. Production systems face a distribution instead: different pages, network conditions, account states, pop-ups, latency, UI changes, hidden state, permissions, interruptions, and users who describe goals imperfectly.",{},{"id":260,"data":1366,"type":225,"tunes":1368},{"text":1367},"That distinction matters because computer-use agents operate through interfaces designed for humans rather than deterministic APIs. Their action loop depends on perception, state interpretation, planning, interaction timing, and environment response. Small changes can alter the trajectory even when the user goal is unchanged.",{},{"id":265,"data":1370,"type":225,"tunes":1372},{"text":1371},"Microsoft Research's WAREX work makes the problem explicit: benchmark agents that look capable in controlled settings lose substantial task success when realistic web instability is introduced. The failure is not necessarily “the model became less intelligent.” The environment stopped being deterministic.",{},{"id":270,"data":1374,"type":41,"tunes":1376},{"text":1375,"level":218},"Capability, success rate, reliability, and safety are different claims",{},{"id":275,"data":1378,"type":302,"tunes":1404},{"content":1379,"stretched":42,"withHeadings":13},[1380,1384,1388,1392,1396,1400],[1381,1382,1383],"Claim","What it actually establishes","What it does not establish",[1385,1386,1387],"The agent completed the task once","Capability under one observed trajectory","Repeatability, robustness, safety, or generalization",[1389,1390,1391],"The agent scores highly on a benchmark","Performance under that benchmark's task and evaluation conditions","Equivalent production performance on different environments",[1393,1394,1395],"The agent usually reaches the goal","Outcome success frequency","Correct process, safe behaviour, or evidence that the result was verified",[1397,1398,1399],"The agent follows the intended process","Trajectory quality under the evaluated rubric","That the external environment actually accepted the final outcome",[1401,1402,1403],"The agent avoids unsafe actions in a test set","Performance on represented safety cases","Safety under every novel ambiguity, injection, or side effect",{},{"id":305,"data":1406,"type":41,"tunes":1408},{"text":1407,"level":218},"The Computer-Use Reliability Ladder",{},{"id":310,"data":1410,"type":225,"tunes":1412},{"text":1411},"A useful way to evaluate computer-use systems is to move from one-off capability toward progressively harder reliability properties. Higher levels assume the lower levels but do not follow automatically from them.",{},{"id":315,"data":1414,"type":341,"tunes":1438},{"steps":1415,"title":1437,"orientation":340},[1416,1419,1422,1425,1428,1431,1434],{"label":1417,"description":1418},"1. Capability","Can the agent complete the task at least once under known conditions?",{"label":1420,"description":1421},"2. Repeatability","Can it complete the same task consistently across repeated trials?",{"label":1423,"description":1424},"3. Environmental robustness","Does it survive timing changes, network issues, pop-ups, UI variation, and small environmental perturbations?",{"label":1426,"description":1427},"4. Long-horizon control","Can it preserve goals, constraints, and progress across many steps, applications, and delayed events?",{"label":1429,"description":1430},"5. State awareness","Can it detect when the environment changed, when hidden state matters, or when an assumption is no longer valid?",{"label":1432,"description":1433},"6. Outcome verification","Does it verify that the intended result actually happened instead of trusting its own action sequence?",{"label":1435,"description":1436},"7. Safe goal handling","Can it stop, ask, refuse, or hand control back when the goal is ambiguous, infeasible, contradictory, or high impact?","Computer-Use Reliability Ladder",{},{"id":344,"data":1440,"type":41,"tunes":1442},{"text":1441,"level":217},"Level 1 — Capability: the demo question",{},{"id":349,"data":1444,"type":225,"tunes":1446},{"text":1445},"Capability asks whether an agent can perform the task at all. This is valuable. Computer-use systems have advanced rapidly, and modern agents can complete workflows that older systems could not execute reliably.",{},{"id":354,"data":1448,"type":225,"tunes":1450},{"text":1449},"But capability is a weak deployment criterion. One successful run does not tell you whether the agent succeeds 95% of the time or 30% of the time, whether failures are harmless or destructive, or whether success depends on a lucky page state.",{},{"id":359,"data":1452,"type":41,"tunes":1454},{"text":1453,"level":217},"Level 2 — Repeatability: does the same task stay solved?",{},{"id":364,"data":1456,"type":225,"tunes":1458},{"text":1457},"Computer-use trajectories are stochastic. Model outputs vary, pages load at different speeds, visual states change, and long workflows create many branching opportunities. A production test should therefore run the same task multiple times rather than treating one passing trace as representative.",{},{"id":369,"data":1460,"type":225,"tunes":1462},{"text":1461},"Measure not only the average success rate but also the distribution of failure modes: wrong click, premature termination, missed confirmation, incorrect field, duplicate action, navigation loop, stale-state assumption, and false success report.",{},{"id":374,"data":1464,"type":41,"tunes":1466},{"text":1465,"level":217},"Level 3 — Environmental robustness: what happens when the web behaves like the web?",{},{"id":379,"data":1468,"type":225,"tunes":1470},{"text":1469},"Real websites are not benchmark fixtures. Requests fail, elements load late, sessions expire, pages change, consent banners appear, servers return errors, and network conditions fluctuate.",{},{"id":384,"data":1472,"type":225,"tunes":1474},{"text":1473},"WAREX evaluates this gap by injecting realistic web unreliability into existing benchmark environments and reports significant drops in task success. This is a critical production insight: a benchmark can measure task competence while under-measuring recovery from environmental instability.",{},{"id":389,"data":1476,"type":233,"tunes":1479},{"body":1477,"title":1478,"variant":393},"Inject delays, transient HTTP failures, stale page state, modal dialogs, session expiration, duplicate responses, and controlled UI variation. If the agent only works on the clean path, it is a demo-capable system, not a production-reliable one.","Reliability test",{},{"id":396,"data":1481,"type":41,"tunes":1483},{"text":1482,"level":217},"Level 4 — Long-horizon control: success changes when the task becomes real work",{},{"id":401,"data":1485,"type":225,"tunes":1487},{"text":1486},"Short tasks hide a class of failures that appear only after dozens or hundreds of actions: forgotten constraints, duplicated work, premature completion, missed state changes, cross-application inconsistencies, and accumulated small errors.",{},{"id":406,"data":1489,"type":225,"tunes":1491},{"text":1490},"OSWorld 2.0 was designed specifically around long-horizon real-world workflows. Its tasks take human users a median of roughly 1.6 hours and require many more tool calls than earlier computer-use benchmarks. Under its primary completion metric, even the strongest evaluated systems remain far from complete task reliability.",{},{"id":411,"data":1493,"type":225,"tunes":1495},{"text":1494},"WeaveBench reaches a similar conclusion from another angle. It evaluates hybrid GUI, CLI and code workflows and reports that the best evaluated model-runtime pairing passes only 41.2% of tasks. The important result is not one leaderboard number; it is that realistic cross-interface orchestration exposes failures hidden by simpler single-interface tasks.",{},{"id":416,"data":1497,"type":41,"tunes":1499},{"text":1498,"level":217},"Level 5 — State awareness: the environment can change underneath the plan",{},{"id":421,"data":1501,"type":225,"tunes":1503},{"text":1502},"Long-running tasks often depend on hidden or changing state: an email arrives, a calendar changes, a form is submitted, a background process finishes, a browser session expires, a user modifies a file, or an external system changes availability.",{},{"id":426,"data":1505,"type":225,"tunes":1507},{"text":1506},"Microsoft's SentinelBench argues that many long-running tasks should not be solved through continuous action at all. The correct behaviour may be to monitor, wait for an external event, then act when the state changes. This is a different capability from clicking faster or planning more steps.",{},{"id":431,"data":1509,"type":225,"tunes":1511},{"text":1510},"A reliable computer-use agent therefore needs to distinguish actionable now, waiting for state, state changed, and assumption invalidated.",{},{"id":436,"data":1513,"type":41,"tunes":1515},{"text":1514,"level":217},"Level 6 — Outcome verification: did the action actually work?",{},{"id":441,"data":1517,"type":225,"tunes":1519},{"text":1518},"An agent can execute an apparently correct sequence and still fail the task. A button click may not register. A form may reject hidden validation. A file may save to the wrong directory. A purchase may remain unconfirmed. A site may display a success-looking screen while the underlying operation failed.",{},{"id":446,"data":1521,"type":225,"tunes":1523},{"text":1522},"OpenAI's current computer-use guidance explicitly recommends bounding and verifying the run instead of relying only on the model's final answer. Microsoft Research's work on computer-use verifiers reaches the same conclusion from evaluation: process and outcome need to be judged separately.",{},{"id":451,"data":1525,"type":225,"tunes":1527},{"text":1526},"The Universal Verifier research reports that earlier verifier setups can produce high false-positive rates, while stronger rubric design and explicit separation of process, outcome, controllable failures, and uncontrollable failures substantially improve agreement with human labels.",{},{"id":456,"data":1529,"type":41,"tunes":1531},{"text":1530,"level":217},"Level 7 — Safe goal handling: the agent must know when not to continue",{},{"id":461,"data":1533,"type":225,"tunes":1535},{"text":1534},"Computer-use agents are optimized to complete goals, but goal persistence can itself become a failure mode. An ambiguous request, impossible condition, contradictory instruction, suspicious webpage, or changed environment may require clarification or stopping rather than more action.",{},{"id":466,"data":1537,"type":225,"tunes":1539},{"text":1538},"The BLIND-ACT benchmark studies this problem as Blind Goal-Directedness. Across the systems evaluated in that work, agents frequently continued pursuing tasks despite ambiguity, infeasibility, conflicting context, or other reasons to reconsider. The authors identify patterns such as execution-first bias and request primacy.",{},{"id":471,"data":1541,"type":225,"tunes":1543},{"text":1542},"This failure class matters because a highly capable agent can make a bad situation worse faster. Reliability therefore includes a policy for when not to act.",{},{"id":476,"data":1545,"type":41,"tunes":1547},{"text":1546,"level":218},"The Demo-to-Production Stress Test",{},{"id":481,"data":1549,"type":225,"tunes":1551},{"text":1550},"Before deploying a computer-use workflow, take the successful demo and systematically remove the assumptions that made it easy.",{},{"id":486,"data":1553,"type":341,"tunes":1583},{"steps":1554,"title":1582,"orientation":340},[1555,1558,1561,1564,1567,1570,1573,1576,1579],{"label":1556,"description":1557},"1. Re-run the clean task","Establish repeatability over multiple trials before adding complexity.",{"label":1559,"description":1560},"2. Perturb the environment","Add latency, retries, pop-ups, page variation, stale sessions and temporary failures.",{"label":1562,"description":1563},"3. Extend the horizon","Turn the short demo into the full real workflow with intermediate state, multiple applications and delayed steps.",{"label":1565,"description":1566},"4. Change hidden state","Modify account, file, task or external state after the agent has formed a plan and test whether it detects the change.",{"label":1568,"description":1569},"5. Inject ambiguity","Remove one important assumption and test whether the agent asks instead of guessing.",{"label":1571,"description":1572},"6. Inject a controlled contradiction","Present old and new state together and verify that authoritative current state wins.",{"label":1574,"description":1575},"7. Require outcome proof","Make task completion depend on verifiable final state, not the model's self-report.",{"label":1577,"description":1578},"8. Test consequential boundaries","Confirm that irreversible or sensitive actions trigger the expected approval, refusal or handoff.",{"label":1580,"description":1581},"9. Repeat after harness or model changes","Treat runtime upgrades as reliability changes that need regression testing.","Demo-to-Production Stress Test",{},{"id":519,"data":1585,"type":41,"tunes":1587},{"text":1586,"level":218},"Benchmark success has a validity boundary",{},{"id":524,"data":1589,"type":225,"tunes":1591},{"text":1590},"A benchmark score is a conditional statement. It is valid for a particular model, harness, environment, task set, judge, tool interface, step budget, retry policy, date and evaluation method.",{},{"id":529,"data":1593,"type":225,"tunes":1595},{"text":1594},"The number becomes misleading when those conditions disappear from the claim. “Agent X scores 80%” is weaker than “Agent X scored 80% on benchmark Y under environment Z with judge J and step budget N.” The second statement preserves the boundary that tells you whether the number transfers to your application.",{},{"id":534,"data":1597,"type":540,"tunes":1602},{"url":1598,"title":1599,"excerpt":1600,"ctaLabel":1601},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers","A framework for making explicit the conditions under which an AI claim remains valid and what changes require restriction, recalculation, or abandonment.","Read the Answer Validity Boundary",{},{"id":543,"data":1604,"type":41,"tunes":1606},{"text":1605,"level":218},"Process success and outcome success must be scored separately",{},{"id":548,"data":1608,"type":579,"tunes":1629},{"rows":1609,"title":1622,"layout":302,"columns":1623},[1610,1613,1616,1619],{"id":552,"label":1611,"values":1612},"Correct process \u002F correct outcome",[555,555,555],{"id":557,"label":1614,"values":1615},"Wrong process \u002F correct outcome",[555,555,555],{"id":561,"label":1617,"values":1618},"Correct process \u002F wrong outcome",[555,555,555],{"id":565,"label":1620,"values":1621},"Wrong process \u002F wrong outcome",[555,555,555],"Four possible outcomes of one computer-use run",[1624,1626,1628],{"id":571,"label":1625},"Process",{"id":574,"label":1627},"Outcome",{"id":577,"label":578},{},{"id":582,"data":1631,"type":225,"tunes":1633},{"text":1632},"WeaveBench reports that outcome-only grading can materially overestimate computer-use performance because an agent may produce an apparently successful artifact through a shortcut or fabricated evidence. The verifier must inspect the trajectory and deliverables, not merely the final claim.",{},{"id":587,"data":1635,"type":41,"tunes":1637},{"text":1636,"level":218},"Production reliability is a distribution, not a single pass rate",{},{"id":592,"data":1639,"type":225,"tunes":1641},{"text":1640},"A useful production evaluation samples the dimensions that actually vary in your environment. For a browser workflow, that might include account age, locale, viewport, page version, network quality, authentication state, existing cart state, cookies, pop-ups, user permissions and whether a human interrupts the run.",{},{"id":597,"data":1643,"type":302,"tunes":1679},{"content":1644,"stretched":42,"withHeadings":13},[1645,1648,1652,1655,1659,1663,1667,1671,1675],[601,1646,1647],"Example variation","Why it matters",[1649,1650,1651],"Environment","Fast vs slow network, transient failures, page timing","Tests recovery and waiting behaviour",[609,1653,1654],"Different viewport, modal, reordered element, minor redesign","Tests brittle visual\u002Faction assumptions",[1656,1657,1658],"State","Logged in\u002Fout, empty\u002Fnon-empty cart, existing file, changed permissions","Tests hidden-state reasoning",[1660,1661,1662],"Task horizon","5 steps vs 50+ steps, one app vs several apps","Tests accumulated trajectory error",[1664,1665,1666],"Ambiguity","Missing preference or incomplete user instruction","Tests whether the agent asks instead of guesses",[1668,1669,1670],"Consequence","Read-only vs purchase\u002Fsend\u002Fdelete\u002Fchange","Tests confirmation and authorization controls",[1672,1673,1674],"Adversarial content","Prompt injection or misleading page text","Tests instruction hierarchy and containment",[1676,1677,1678],"Model \u002F harness version","Runtime upgrade","Tests regression from system-level changes",{},{"id":638,"data":1681,"type":41,"tunes":1683},{"text":1682,"level":218},"Reliability needs a failure budget, not perfection",{},{"id":643,"data":1685,"type":225,"tunes":1687},{"text":1686},"No production system is perfectly reliable. The useful engineering question is which failures are acceptable, detectable and recoverable. A failed attempt to sort a local folder is not equivalent to sending the wrong email, purchasing the wrong product or changing an account setting.",{},{"id":648,"data":1689,"type":225,"tunes":1691},{"text":1690},"Classify actions by consequence and reversibility. Low-impact reversible actions can tolerate more autonomy. High-impact, externally visible or hard-to-reverse actions need stronger confirmation, state verification, authorization and post-action checks.",{},{"id":653,"data":1693,"type":41,"tunes":1695},{"text":1694,"level":218},"A practical computer-use reliability matrix",{},{"id":658,"data":1697,"type":302,"tunes":1723},{"content":1698,"stretched":42,"withHeadings":13},[1699,1703,1707,1711,1715,1719],[1700,1701,1702],"Action class","Example","Recommended control",[1704,1705,1706],"Read \u002F inspect","Open pages, read files, gather information","Bound scope, log sources, tolerate recoverable navigation errors",[1708,1709,1710],"Reversible local change","Edit draft file, reorganize temporary workspace","Checkpoint or version before change; verify result",[1712,1713,1714],"External communication","Send email, publish content, submit form","User confirmation or explicit delegated authority; verify accepted state",[1716,1717,1718],"Financial \u002F transactional","Purchase, checkout, paid subscription","Strict mandate, amount\u002Fmerchant constraints, final confirmation and receipt verification",[1720,1721,1722],"Destructive \u002F privilege-changing","Delete data, change permissions, revoke access","Narrow authorization, explicit confirmation, reversible path where possible, post-action audit",{},{"id":687,"data":1725,"type":41,"tunes":1727},{"text":1726,"level":218},"What to log for a computer-use failure",{},{"id":692,"data":1729,"type":709,"tunes":1744},{"meta":1730,"items":1731,"style":708},{},[1732,1733,1734,1735,1736,1737,1738,1739,1740,1741,1742,1743],"User goal and explicit constraints.","Model and harness version.","Environment and application versions.","Screenshots or structured observations relevant to the failure.","Actions taken with timestamps.","Tool, click, keyboard and navigation results.","State transitions and waiting periods.","Approval, refusal or handoff events.","External errors and network failures.","Final observable environment state.","The agent's reported outcome.","Verifier result and whether the failure was controllable by the agent.",{},{"id":712,"data":1746,"type":225,"tunes":1748},{"text":1747},"The crucial comparison is between reported success and observable success. A system that cannot distinguish those two will eventually accumulate false positives in production.",{},{"id":717,"data":1750,"type":540,"tunes":1755},{"url":1751,"title":1752,"excerpt":1753,"ctaLabel":1754},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","A broader reliability model for evaluating agent trajectories, tool use and intermediate decisions instead of accepting the final answer as proof that the system worked correctly.","Read the agent reliability article",{},{"id":725,"data":1757,"type":41,"tunes":1759},{"text":1758,"level":218},"Security is part of reliability for computer-use agents",{},{"id":730,"data":1761,"type":225,"tunes":1763},{"text":1762},"Computer-use agents do not merely read untrusted content; they can act after reading it. That turns prompt injection, malicious page content and phishing into execution-path risks.",{},{"id":735,"data":1765,"type":225,"tunes":1767},{"text":1766},"OpenAI's current computer-use guidance recommends isolating the environment, allow-listing sites and actions, treating screen content as untrusted, confirming consequential actions, bounding the run and verifying the actual outcome. ChatGPT agent similarly uses confirmations, prompt-injection monitoring and supervised modes for sensitive contexts.",{},{"id":740,"data":1769,"type":225,"tunes":1771},{"text":1770},"The architecture principle is broader than any one provider: content observed by the agent must not be allowed to redefine the user's authority. A webpage can provide data. It cannot grant permission to send data elsewhere, purchase something, change credentials or override the task boundary.",{},{"id":745,"data":1773,"type":41,"tunes":1775},{"text":1774,"level":218},"What would change this answer?",{},{"id":750,"data":1777,"type":225,"tunes":1779},{"text":1778},"The reliability gap would narrow if computer-use models became robust to long horizons, dynamic state, UI variation, environmental failures and ambiguous goals across representative production distributions. Better native state APIs, standardized machine-readable interfaces and stronger verifier infrastructure could also reduce the amount of fragile GUI interaction required.",{},{"id":755,"data":1781,"type":225,"tunes":1783},{"text":1782},"The deployment threshold also changes with task consequence. A 70% success rate can be useful for a supervised low-risk research task and unacceptable for an autonomous financial or destructive workflow. Reliability must therefore be evaluated against the cost of each failure class, not one universal pass-rate threshold.",{},{"id":760,"data":1785,"type":41,"tunes":1787},{"text":1786,"level":218},"Limitations",{},{"id":765,"data":1789,"type":225,"tunes":1791},{"text":1790},"The cited benchmarks evaluate different environments and should not be ranked against one another as if they measured the same thing. WAREX stresses web unreliability; WeaveBench targets hybrid long-horizon work; OSWorld 2.0 targets realistic long workflows; BLIND-ACT focuses on goal handling under ambiguity and infeasibility.",{},{"id":770,"data":1793,"type":225,"tunes":1795},{"text":1794},"Benchmark results also age quickly. Model, harness and verifier improvements can materially change scores within months. The durable lesson is therefore the evaluation method: vary conditions, separate process from outcome, verify external state, and preserve the boundary around each performance claim.",{},{"id":775,"data":1797,"type":41,"tunes":1799},{"text":1798,"level":218},"Conclusion",{},{"id":780,"data":1801,"type":225,"tunes":1803},{"text":1802},"Computer-use agents are already capable enough to be useful. That is exactly why the evaluation question has changed. The challenge is no longer only whether an agent can click through a workflow. It is whether the system remains dependable when the clean demo conditions disappear.",{},{"id":785,"data":1805,"type":225,"tunes":1807},{"text":1806},"Treat one successful run as evidence of capability. Then test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification and safe goal handling. A production computer-use agent is not the one that can complete the demo. It is the one whose failure boundaries are known, measured and controlled.",{},{"id":790,"data":1809,"type":41,"tunes":1810},{"text":792,"level":218},{},{"id":795,"data":1812,"type":795,"tunes":1833},{"items":1813,"title":1832},[1814,1817,1820,1823,1826,1829],{"id":799,"answer":1815,"question":1816},"No. It proves capability under one observed trajectory. Production reliability requires repeated success across environmental variation, long-running tasks, changing state, ambiguity, recovery conditions and consequential actions.","Does a successful computer-use agent demo prove production reliability?",{"id":803,"answer":1818,"question":1819},"Benchmarks can use more controlled environments, shorter tasks, stable network conditions, simpler application combinations or outcome criteria that do not capture all process failures. The exact validity boundary depends on each benchmark.","Why can computer-use benchmarks look much better than real-world performance?",{"id":807,"answer":1821,"question":1822},"Verify the actual external outcome. Do not treat the agent's final statement or intended click sequence as proof that the target system accepted the operation.","What is the most important reliability check after a computer-use action?",{"id":811,"answer":1824,"question":1825},"Errors accumulate across many actions, constraints are forgotten, external state changes, work spans multiple applications, hidden state matters, and the agent must decide when to wait, ask, verify or recover rather than simply continue acting.","Why do long-horizon computer tasks remain difficult?",{"id":815,"answer":1827,"question":1828},"Repeat clean tasks, inject realistic environmental failures, vary UI and state, extend the workflow horizon, introduce ambiguity, require observable outcome proof, test high-impact action controls and rerun the suite after model or harness changes.","How should I test a browser or desktop agent before deployment?",{"id":819,"answer":1830,"question":1831},"Not for every low-risk action. Confirmation requirements should scale with consequence, reversibility, authority and uncertainty. High-impact, externally visible or difficult-to-reverse actions need stronger controls.","Should computer-use agents always require human confirmation?","Computer-use agent reliability",{},{"id":825,"data":1835,"type":41,"tunes":1837},{"text":1836,"level":218},"Glossary",{},{"id":830,"data":1839,"type":830,"tunes":1859},{"title":1840,"entries":1841},"Key reliability terms",[1842,1845,1848,1851,1854,1856],{"term":1843,"anchor":836,"definition":1844},"Computer-use agent","An AI agent that interacts with graphical user interfaces or computer environments through observations and actions such as clicking, typing, scrolling, file operations or cross-application workflows.",{"term":1846,"anchor":840,"definition":1847},"Repeatability","The degree to which an agent can complete the same task consistently across repeated runs rather than succeeding only on selected trajectories.",{"term":1849,"anchor":844,"definition":1850},"Environmental robustness","The ability to preserve correct behaviour despite realistic variation such as latency, transient errors, UI changes, session state and unexpected page conditions.",{"term":1852,"anchor":848,"definition":1853},"Outcome verification","Checking the actual external state after an action to confirm that the intended result occurred instead of relying on the agent's self-report.",{"term":851,"anchor":852,"definition":1855},"A failure pattern in which a computer-use agent continues pursuing a goal despite ambiguity, infeasibility, contradictory conditions or reasons to stop and reassess.",{"term":1857,"anchor":856,"definition":1858},"Reliability boundary","The set of conditions under which an observed success rate or capability claim remains representative enough for a specific deployment decision.",{},{"id":860,"data":1861,"type":41,"tunes":1863},{"text":1862,"level":218},"Primary sources and further reading",{},{"id":865,"data":1865,"type":872,"tunes":1869},{"link":867,"meta":1866},{"image":1867,"title":870,"description":1868},{"url":555},"Current developer guidance on isolating environments, treating screen content as untrusted, confirming consequential actions, bounding runs and verifying outcomes.",{},{"id":875,"data":1871,"type":872,"tunes":1875},{"link":877,"meta":1872},{"image":1873,"title":880,"description":1874},{"url":555},"Current production guidance on technical boundaries, human approval, telemetry and control for agents that act on real systems.",{},{"id":884,"data":1877,"type":872,"tunes":1881},{"link":886,"meta":1878},{"image":1879,"title":889,"description":1880},{"url":555},"2026 evaluation showing that realistic web unreliability causes significant drops in browser-agent task success on existing benchmarks.",{},{"id":893,"data":1883,"type":872,"tunes":1887},{"link":895,"meta":1884},{"image":1885,"title":898,"description":1886},{"url":555},"2026 work on process versus outcome evaluation, controllable versus uncontrollable failures and reliable trajectory verification.",{},{"id":902,"data":1889,"type":872,"tunes":1893},{"link":904,"meta":1890},{"image":1891,"title":907,"description":1892},{"url":555},"2026 long-horizon benchmark combining GUI, CLI and code workflows and showing a substantial gap between current agents and reliable real-world completion.",{},{"id":911,"data":1895,"type":872,"tunes":1899},{"link":913,"meta":1896},{"image":1897,"title":916,"description":1898},{"url":555},"2026 benchmark focused on realistic long-horizon computer-use workflows, hidden state and cross-source reasoning.",{},{"id":920,"data":1901,"type":872,"tunes":1905},{"link":922,"meta":1902},{"image":1903,"title":925,"description":1904},{"url":555},"2026 benchmark for time-evolving tasks where agents must monitor environments and respond to state changes rather than continuously act.",{},{"id":929,"data":1907,"type":872,"tunes":1911},{"link":931,"meta":1908},{"image":1909,"title":934,"description":1910},{"url":555},"ICLR 2026 research on agents continuing to pursue ambiguous, contradictory or infeasible goals.",{},"2.31.6","Computer-use agents can now complete impressive browser and desktop workflows, but one successful run proves capability—not reliability. This article shows how to test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification, and safe goal handling.","Post erfolgreich abgerufen",{"items":1916,"source":1980,"manualIds":1981,"manualMatchedIds":1982},[1917,1924,1931,1938,1945,1952,1959,1966,1973],{"id":1918,"slug":1919,"title":1920,"excerpt":1921,"featuredImage":1922,"publishedAt":1923},"474","migrating-from-openai-agents-sdk-to-the-agents-api-what-actually-changes-architecturally","Migration vom OpenAI Agents SDK zur Agents API: Was ändert sich tatsächlich architektonisch?","Die Migration vom OpenAI Agents SDK zur neuen Agents API ist keine reine Umbenennung von Imports. Die Laufzeitgrenze verschiebt sich: Die Agent-Schleife, die dauerhafte Sitzung, die Orchestrierung, die Kontextkomprimierung und die Wiederherstellung bewegen sich in Richtung einer verwalteten Harness. Dieser Leitfaden zeigt, was verschoben werden sollte, was in Ihrer Anwendung bleiben sollte und wie Sie die Migration vor dem Cutover nachweisen können.","\u002Fuploads\u002F2026\u002F09\u002Fmigrating-from-openai-agents-sdk-to-the-agents-api-what-actually-changes-architecturally-1790352171968-ienxr9.webp","2026-09-25T12:01:00.000Z",{"id":1925,"slug":1926,"title":1927,"excerpt":1928,"featuredImage":1929,"publishedAt":1930},"469","rag-failed-but-which-layer-actually-failed-a-diagnostic-method","RAG fehlgeschlagen – aber welche Ebene ist tatsächlich fehlgeschlagen? Eine diagnostische Methode","Wenn eine RAG-Antwort falsch ist, ist es zu vage, das Retrieval oder das Modell verantwortlich zu machen. Diese Diagnosemethode isoliert Quellenabdeckung, Query-Konstruktion, Retrieval, Ranking, Kontextzusammenstellung, Generierung, Evidenzzuordnung und Aktualität – sodass der tatsächliche Fehler reproduziert und behoben werden kann.","\u002Fuploads\u002F2026\u002F09\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method-1790350847177-pior4c.webp","2026-09-24T19:39:00.000Z",{"id":1932,"slug":1933,"title":1934,"excerpt":1935,"featuredImage":1936,"publishedAt":1937},"457","should-you-buy-5g-openwrt-router-old-firmware","Sollten Sie einen 5G-OpenWrt-Router mit alter Firmware kaufen? ZBT Z8102AX als praktisches Beispiel","Kauf eines 5G-OpenWrt-Routers mit älterer Firmware kann sinnvoll sein, aber nur unter den richtigen Bedingungen. Der ZBT Z8102AX zeigt beide Seiten deutlich: Die Hardware ist nützlich, das Modem funktioniert, und der Router blieb im Test stabil, aber OpenWrt 21.02, schwache Verpackung und unklare Upgrade-Pfade erfordern eine sorgfältige Kaufentscheidung.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1939,"slug":1940,"title":1941,"excerpt":1942,"featuredImage":1943,"publishedAt":1944},"478","what-is-rag-the-simplest-explanation-of-how-it-works","Was ist RAG? Die einfachste Erklärung, wie es funktioniert","RAG klingt kompliziert, aber die Idee ist einfach: Bevor eine KI antwortet, sucht sie zunächst nützliche Informationen aus einer Wissensquelle und gibt diese Informationen an das Sprachmodell weiter. Dieser Leitfaden erklärt RAG, LLMs, Zustand, Gedächtnis und Werkzeuge anhand eines einfachen mentalen Modells.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":1946,"slug":1947,"title":1948,"excerpt":1949,"featuredImage":1950,"publishedAt":1951},"472","why-more-context-can-make-ai-answers-worse","Warum mehr Kontext KI-Antworten verschlechtern kann","Ein größeres Kontextfenster garantiert keine bessere Antwort. Dieser Artikel erklärt, wie Signalverwässerung, widersprüchliche Belege, veralteter Zustand, Positionssensitivität und verlustbehaftete Kompression die KI-Zuverlässigkeit verringern können—und stellt einen praktischen Context Pressure Test vor.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z",{"id":1953,"slug":1954,"title":1955,"excerpt":1956,"featuredImage":1957,"publishedAt":1958},"460","ai-agent-reliability-why-the-final-answer-is-not-enough","Zuverlässigkeit von KI-Agenten: Warum die endgültige Antwort nicht ausreicht","Korrekte Ausgabe beweist weder korrektes Denken, sichere Ausführung noch ein vertrauenswürdiges System.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-reliability-why-the-final-answer-is-not-enough-1788955466306-pl0qhz.webp","2026-09-09T04:01:00.000Z",{"id":1960,"slug":1961,"title":1962,"excerpt":1963,"featuredImage":1964,"publishedAt":1965},"471","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","Wie man erkennt, ob ein KI-Agent tatsächlich die richtigen Belege verwendet hat","Ein KI-Agent kann Quellen zitieren und trotzdem die falschen Belege verwenden. Dieser Artikel stellt eine praktische Methode zur Überprüfung der Belegung von Behauptungen, der Quellenautorität, der Anwendbarkeit, der Herkunft sowie der Frage vor, ob die Belege die Antwort tatsächlich beeinflusst haben.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","2026-09-25T11:47:00.000Z",{"id":1967,"slug":1968,"title":1969,"excerpt":1970,"featuredImage":1971,"publishedAt":1972},"459","ollama-is-not-the-product-building-production-ready-open-llm-applications","Ollama ist nicht das Produkt: Entwicklung produktionsreifer Open-LLM-Anwendungen","Das Ausführen eines lokalen Modells mit Ollama ist einfach. Das Erstellen einer produktionsreifen Open-LLM-Anwendung ist schwieriger: Es erfordert RAG, Zugriffskontrolle, Anbieterabstraktion, Evaluierung, Protokollierung, Bereitstellungsdisziplin und eine kontrollierte Anwendungsschicht um das Modell herum.","\u002Fuploads\u002F2026\u002F06\u002Follama-is-not-the-product-building-production-ready-open-llm-applications-1782679361640-h0usqf.webp","2026-06-28T16:39:00.000Z",{"id":1974,"slug":1975,"title":1976,"excerpt":1977,"featuredImage":1978,"publishedAt":1979},"364","tipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung","Meistern des SEO-Workflows: Essenzielle Optimierungsstrategien für organisches Wachstum","Ein strukturierter SEO-Workflow ist entscheidend für nachhaltiges organisches Wachstum. Lerne die zehn grundlegenden Strategien, von der Keyword-Recherche und technischen Optimierung bis hin zur Content-Qualität und Performance-Analyse.","\u002Fuploads\u002F2026\u002F03\u002Ftipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung-1774866098131-hwkzrg.webp","2024-01-26T06:35:00.000Z","fallback",[],[]]