[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:it":3,"public-menus:all":38,"post:computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system:it":205,"related:post:computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system:it:1":1920},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","it","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1919},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":939,"featuredImage":940,"featuredImageAlt":941,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":942,"publishedAt":943,"createdAt":944,"updatedAt":945,"seoLocalePaths":946,"categories":955,"author":968,"translations":973},"477","Agenti per l'uso del computer: perché una demo di successo può comunque essere un sistema inaffidabile","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Indice dei contenuti\">\u003Cstrong class=\"editorjs-toc__title\">Indice dei contenuti\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-6\" class=\"editorjs-toc__link\">Perché la demo è il test di affidabilità più semplice possibile\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">Capacità, tasso di successo, affidabilità e sicurezza sono affermazioni diverse\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-12\" class=\"editorjs-toc__link\">La scala di affidabilità dell&#39;uso del computer\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-15\" class=\"editorjs-toc__link\">Livello 1 — Capacità: la domanda della demo\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-18\" class=\"editorjs-toc__link\">Livello 2 — Ripetibilità: la stessa attività rimane risolta?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-21\" class=\"editorjs-toc__link\">Livello 3 — Robustezza ambientale: cosa succede quando il web si comporta come il web?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-25\" class=\"editorjs-toc__link\">Livello 4 — Controllo su orizzonti lunghi: il successo cambia quando l&#39;attività diventa lavoro reale\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-29\" class=\"editorjs-toc__link\">Livello 5 — Consapevolezza dello stato: l&#39;ambiente può cambiare sotto al piano d&#39;azione\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">Livello 6 — Verifica del risultato: l&#39;azione ha funzionato davvero?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-37\" class=\"editorjs-toc__link\">Livello 7 — Gestione sicura dell&#39;obiettivo: l&#39;agente deve sapere quando non proseguire\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-41\" class=\"editorjs-toc__link\">Lo stress test dal passaggio da demo a produzione\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-44\" class=\"editorjs-toc__link\">Il successo nei benchmark ha un confine di validità\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-48\" class=\"editorjs-toc__link\">Il successo del processo e il successo dell&#39;esito devono essere valutati separatamente\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-51\" class=\"editorjs-toc__link\">L&#39;affidabilità in produzione è una distribuzione, non una singola percentuale di successo\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-54\" class=\"editorjs-toc__link\">L&#39;affidabilità necessita di un budget di errore, non della perfezione\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-57\" class=\"editorjs-toc__link\">Una matrice pratica di affidabilità per l&#39;uso del computer\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-59\" class=\"editorjs-toc__link\">Cosa registrare per un fallimento di computer-use\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-63\" class=\"editorjs-toc__link\">La sicurezza fa parte dell&#39;affidabilità per gli agenti computer-use\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-67\" class=\"editorjs-toc__link\">Cosa potrebbe cambiare questa risposta?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-70\" class=\"editorjs-toc__link\">Limitazioni\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-73\" class=\"editorjs-toc__link\">Conclusione\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-76\" class=\"editorjs-toc__link\">FAQ\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-78\" class=\"editorjs-toc__link\">Glossario\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-80\" class=\"editorjs-toc__link\">Fonti primarie e ulteriori letture\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>Gli agenti per l'uso del computer possono ora cliccare, digitare, navigare, modificare file, utilizzare applicazioni desktop e completare impressionanti attività in più passaggi. Ciò rende le demo di successo facili da capire e facili da interpretare eccessivamente. Un singolo flusso di lavoro completato dimostra che l'agente può avere successo in quelle condizioni. Non mostra con quale frequenza ha successo, come si comporta quando l'ambiente cambia, se verifica il risultato o con quanta sicurezza agisce quando l'obiettivo diventa ambiguo.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Risposta diretta\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">&lt;strong&gt;Una demo di successo sull&#39;uso del computer dimostra la capacità, non l&#39;affidabilità.&lt;\u002Fstrong&gt; L&#39;affidabilità in produzione richiede che l&#39;agente riesca ripetutamente attraverso variazioni ambientali, si riprenda da guasti transitori, mantenga i vincoli su orizzonti temporali lunghi, rilevi stati nascosti o mutevoli, verifichi il risultato effettivo e si fermi o chieda chiarimenti quando l&#39;obiettivo diventa ambiguo o non sicuro. La domanda corretta per la produzione non è &quot;L&#39;agente può svolgere questo compito?&quot;, bensì &quot;In quali condizioni possiamo fidarci che svolga questo compito ripetutamente?&quot;\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Un settore in rapida evoluzione\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Questo articolo riflette la ricerca sugli agenti per l&#39;uso del computer e le linee guida delle piattaforme disponibili al &lt;strong&gt;25 settembre 2026&lt;\u002Fstrong&gt;. I risultati dei benchmark non sono direttamente confrontabili tra diversi set di attività, ambienti, modelli, limiti di passaggi, valutatori o harness. Considera ogni dato di benchmark insieme alle sue condizioni di valutazione.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Il modello utilizzato in questo articolo\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">La scala di affidabilità dell&#39;uso del computer (Computer-Use Reliability Ladder) e lo stress test dalla demo alla produzione proposti di seguito sono modelli di valutazione pratici formulati in questo contesto. Non costituiscono standard industriali formali.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-6\">Perché la demo è il test di affidabilità più semplice possibile\u003C\u002Fh2>\n\u003Cp>Una demo mostra normalmente una traiettoria che ha funzionato. L'ambiente è noto, l'attività viene selezionata in anticipo, l'operatore può riavviare dopo un errore e il pubblico vede solo il percorso riuscito. I sistemi in produzione affrontano invece una distribuzione: pagine diverse, condizioni di rete, stati dell'account, pop-up, latenza, modifiche alla UI, stati nascosti, permessi, interruzioni e utenti che descrivono gli obiettivi in modo imperfetto.\u003C\u002Fp>\n\u003Cp>Tale distinzione è importante perché gli agenti per l'uso del computer operano attraverso interfacce progettate per gli esseri umani piuttosto che tramite API deterministiche. Il loro ciclo di azione dipende dalla percezione, dall'interpretazione dello stato, dalla pianificazione, dalle tempistiche di interazione e dalla risposta dell'ambiente. Piccoli cambiamenti possono alterare la traiettoria anche quando l'obiettivo dell'utente rimane invariato.\u003C\u002Fp>\n\u003Cp>Il lavoro WAREX di Microsoft Research rende esplicito questo problema: agenti che ottengono ottimi punteggi nei benchmark in contesti controllati perdono gran parte del successo nelle attività quando viene introdotta una realistica instabilità del web. Il fallimento non è necessariamente dovuto al fatto che \"il modello è diventato meno intelligente\". È l'ambiente che ha smesso di essere deterministico.\u003C\u002Fp>\n\u003Ch2 id=\"section-10\">Capacità, tasso di successo, affidabilità e sicurezza sono affermazioni diverse\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Affermazione\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Cosa stabilisce effettivamente\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Cosa non stabilisce\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'agente ha completato l'attività una volta\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Capacità nell'ambito di una traiettoria osservata\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ripetibilità, robustezza, sicurezza o generalizzazione\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'agente ottiene un punteggio elevato in un benchmark\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prestazioni secondo le condizioni di valutazione e le attività di quel benchmark\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prestazioni equivalenti in produzione su ambienti diversi\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'agente di solito raggiunge l'obiettivo\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Frequenza di successo del risultato\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Processo corretto, comportamento sicuro o prova che il risultato sia stato verificato\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'agente segue il processo previsto\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Qualità della traiettoria in base alla rubrica valutata\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Che l'ambiente esterno abbia effettivamente accettato il risultato finale\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'agente evita azioni non sicure in un set di test\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prestazioni sui casi di sicurezza rappresentati\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sicurezza rispetto a ogni nuova ambiguità, injection o effetto collaterale\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-12\">La scala di affidabilità dell'uso del computer\u003C\u002Fh2>\n\u003Cp>Un modo utile per valutare i sistemi di uso del computer è passare dalla capacità isolata a proprietà di affidabilità progressivamente più complesse. I livelli superiori presuppongono i livelli inferiori, ma non ne conseguono automaticamente.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Scala di affidabilità dell'uso del computer\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Capacità\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">L'agente può completare l'attività almeno una volta in condizioni note?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Ripetibilità\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Può completare la stessa attività in modo coerente attraverso prove ripetute?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Robustezza ambientale\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Riesce a gestire variazioni di timing, problemi di rete, pop-up, cambiamenti della UI e piccole perturbazioni ambientali?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Controllo su lungo orizzonte\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Può preservare obiettivi, vincoli e progressi attraverso molti passaggi, applicazioni ed eventi differiti?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Consapevolezza dello stato\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Può rilevare quando l'ambiente è cambiato, quando uno stato nascosto è rilevante o quando un'ipotesi non è più valida?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Verifica del risultato\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Verifica che il risultato previsto sia effettivamente avvenuto invece di fidarsi della propria sequenza di azioni?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Gestione sicura degli obiettivi\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Può fermarsi, chiedere, rifiutare o restituire il controllo quando l'obiettivo è ambiguo, irrealizzabile, contraddittorio o ad alto impatto?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch3 id=\"section-15\">Livello 1 — Capacità: la domanda della demo\u003C\u002Fh3>\n\u003Cp>La capacità si domanda se un agente possa eseguire l'attività in assoluto. Questo è prezioso. I sistemi di uso del computer sono progrediti rapidamente e gli agenti moderni possono completare flussi di lavoro che i sistemi precedenti non potevano eseguire in modo affidabile.\u003C\u002Fp>\n\u003Cp>Ma la capacità è un criterio debole per il deployment. Una singola esecuzione riuscita non dice se l'agente ha successo nel 95% dei casi o nel 30% dei casi, se i fallimenti sono innocui o distruttivi, o se il successo dipende da uno stato fortuito della pagina.\u003C\u002Fp>\n\u003Ch3 id=\"section-18\">Livello 2 — Ripetibilità: la stessa attività rimane risolta?\u003C\u002Fh3>\n\u003Cp>Le traiettorie di computer-use sono stocastiche. Gli output dei modelli variano, le pagine si caricano a velocità diverse, gli stati visivi cambiano e i flussi di lavoro lunghi creano molteplici opportunità di ramificazione. Un test di produzione dovrebbe quindi eseguire la stessa attività più volte, invece di considerare una singola traccia superata come rappresentativa.\u003C\u002Fp>\n\u003Cp>Misura non solo il tasso di successo medio, ma anche la distribuzione delle modalità di fallimento: clic errato, interruzione prematura, mancata conferma, campo non corretto, azione duplicata, loop di navigazione, presupposto di stato obsoleto e falsa segnalazione di successo.\u003C\u002Fp>\n\u003Ch3 id=\"section-21\">Livello 3 — Robustezza ambientale: cosa succede quando il web si comporta come il web?\u003C\u002Fh3>\n\u003Cp>I siti web reali non sono fixture di benchmark. Le richieste falliscono, gli elementi si caricano in ritardo, le sessioni scadono, le pagine cambiano, compaiono banner di consenso, i server restituiscono errori e le condizioni di rete fluttuano.\u003C\u002Fp>\n\u003Cp>WAREX valuta questo divario introducendo un'inaffidabilità web realistica negli ambienti di benchmark esistenti e registra cali significativi nel successo delle attività. Si tratta di un'indicazione fondamentale per la produzione: un benchmark può misurare la competenza nell'attività sottovalutando al contempo il ripristino dall'instabilità ambientale.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Test di affidabilità\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Inietta ritardi, errori HTTP transitori, stati di pagina obsoleti, finestre di dialogo modali, scadenze di sessione, risposte duplicate e variazioni controllate dell&#39;interfaccia utente. Se l&#39;agente funziona solo sul percorso ideale, è un sistema adatto a una demo, non affidabile per la produzione.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-25\">Livello 4 — Controllo su orizzonti lunghi: il successo cambia quando l'attività diventa lavoro reale\u003C\u002Fh3>\n\u003Cp>I compiti brevi nascondono una classe di errori che compaiono solo dopo decine o centinaia di azioni: vincoli dimenticati, lavoro duplicato, completamento prematuro, modifiche di stato mancate, incoerenze tra applicazioni diverse e accumulo di piccoli errori.\u003C\u002Fp>\n\u003Cp>OSWorld 2.0 è stato progettato specificamente attorno a flussi di lavoro reali a lungo raggio. I suoi task richiedono agli utenti umani una mediana di circa 1,6 ore e comportano molte più chiamate di strumenti rispetto ai precedenti benchmark di computer-use. In base alla sua metrica di completamento primaria, anche i sistemi più avanzati valutati rimangono lontani da una completa affidabilità operativa.\u003C\u002Fp>\n\u003Cp>WeaveBench giunge a una conclusione simile da un'altra prospettiva. Valuta flussi di lavoro ibridi tra GUI, CLI e codice e segnala che la migliore combinazione modello-runtime valutata supera solo il 41,2% delle attività. Il risultato rilevante non è un singolo punteggio in classifica; è che l'orchestrazione realistica tra interfacce diverse rivela fallimenti nascosti da compiti più semplici a interfaccia singola.\u003C\u002Fp>\n\u003Ch3 id=\"section-29\">Livello 5 — Consapevolezza dello stato: l'ambiente può cambiare sotto al piano d'azione\u003C\u002Fh3>\n\u003Cp>Le attività a lunga esecuzione dipendono spesso da stati nascosti o mutevoli: arriva un'email, un calendario cambia, un modulo viene inviato, un processo in background termina, una sessione del browser scade, un utente modifica un file o un sistema esterno cambia disponibilità.\u003C\u002Fp>\n\u003Cp>SentinelBench di Microsoft sostiene che molte attività a lunga durata non dovrebbero affatto essere risolte tramite un'azione continua. Il comportamento corretto potrebbe consistere nel monitorare, attendere un evento esterno e poi agire quando lo stato cambia. Si tratta di una capacità diversa dal fare clic più rapidamente o dal pianificare più passaggi.\u003C\u002Fp>\n\u003Cp>Un agente di computer-use affidabile deve quindi distinguere tra azionabile ora, in attesa di stato, stato modificato e presupposto invalidato.\u003C\u002Fp>\n\u003Ch3 id=\"section-33\">Livello 6 — Verifica del risultato: l'azione ha funzionato davvero?\u003C\u002Fh3>\n\u003Cp>Un agente può eseguire una sequenza apparentemente corretta e comunque fallire l'attività. Un clic su un pulsante potrebbe non essere registrato. Un modulo potrebbe non superare una convalida nascosta. Un file potrebbe essere salvato nella directory errata. Un acquisto potrebbe rimanere non confermato. Un sito potrebbe mostrare una schermata apparentemente di successo mentre l'operazione sottostante è fallita.\u003C\u002Fp>\n\u003Cp>Le attuali linee guida di OpenAI sul computer-use raccomandano esplicitamente di delimitare e verificare l'esecuzione invece di affidarsi unicamente alla risposta finale del modello. Il lavoro di Microsoft Research sui verificatori di computer-use giunge alla stessa conclusione attraverso la valutazione: processo e risultato devono essere giudicati separatamente.\u003C\u002Fp>\n\u003Cp>La ricerca Universal Verifier evidenzia che le configurazioni di verifica precedenti possono produrre tassi elevati di falsi positivi, mentre una progettazione più rigorosa dei criteri di valutazione e la separazione esplicita tra processo, risultato, fallimenti controllabili e fallimenti incontrollabili migliorano sensibilmente la concordanza con le valutazioni umane.\u003C\u002Fp>\n\u003Ch3 id=\"section-37\">Livello 7 — Gestione sicura dell'obiettivo: l'agente deve sapere quando non proseguire\u003C\u002Fh3>\n\u003Cp>Gli agenti per l'uso del computer sono ottimizzati per completare obiettivi, ma la persistenza verso l'obiettivo può diventare essa stessa una modalità di fallimento. Una richiesta ambigua, una condizione impossibile, un'istruzione contraddittoria, una pagina web sospetta o un ambiente mutato possono richiedere chiarimenti o un arresto piuttosto che ulteriori azioni.\u003C\u002Fp>\n\u003Cp>Il benchmark BLIND-ACT studia questo problema definendolo Blind Goal-Directedness. Tra i sistemi valutati in quello studio, gli agenti hanno frequentemente continuato a perseguire i compiti nonostante l'ambiguità, l'irrealizzabilità, un contesto conflittuale o altri motivi per riconsiderare l'azione. Gli autori identificano schemi ricorrenti come l'execution-first bias e la request primacy.\u003C\u002Fp>\n\u003Cp>Questa classe di fallimento è rilevante perché un agente altamente capace può peggiorare una cattiva situazione molto più rapidamente. L'affidabilità include quindi una policy su quando non agire.\u003C\u002Fp>\n\u003Ch2 id=\"section-41\">Lo stress test dal passaggio da demo a produzione\u003C\u002Fh2>\n\u003Cp>Prima di distribuire un flusso di lavoro per l'uso del computer, prendi la demo riuscita e rimuovi sistematicamente le ipotesi che l'hanno resa facile.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Stress test dal passaggio da demo a produzione\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Esegui nuovamente il task pulito\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Stabilisci la ripetibilità su più tentativi prima di aggiungere complessità.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Perturba l'ambiente\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Aggiungi latenza, tentativi di retry, pop-up, variazioni di pagina, sessioni scadute e guasti temporanei.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Estendi l'orizzonte\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Trasforma la breve demo nel flusso di lavoro reale completo con stato intermedio, molteplici applicazioni e passaggi ritardati.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Modifica lo stato nascosto\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Modifica l'account, il file, il task o lo stato esterno dopo che l'agente ha elaborato un piano e verifica se rileva il cambiamento.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Inietta ambiguità\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Rimuovi un presupposto importante e verifica se l'agente chiede spiegazioni invece di tirare a indovinare.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Inietta una contraddizione controllata\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Presenta insieme il vecchio e il nuovo stato e verifica che lo stato attuale autorevole prevalga.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Richiedi la prova del risultato\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Fai dipendere il completamento del task da uno stato finale verificabile, non dall'auto-segnalazione del modello.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Testa i confini consequenziali\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Conferma che le azioni irreversibili o sensibili attivino l'approvazione, il rifiuto o il passaggio di consegne previsto.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">9\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">9. Ripeti dopo modifiche all'harness o al modello\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Tratta gli aggiornamenti di runtime come modifiche all'affidabilità che richiedono test di regressione.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-44\">Il successo nei benchmark ha un confine di validità\u003C\u002Fh2>\n\u003Cp>Il punteggio di un benchmark è un'affermazione condizionale. È valido per uno specifico modello, harness, ambiente, set di task, valutatore, interfaccia degli strumenti, budget di passaggi, policy di retry, data e metodo di valutazione.\u003C\u002Fp>\n\u003Cp>Il numero diventa fuorviante quando tali condizioni scompaiono dall'affermazione. \"L'Agente X ottiene l'80%\" è un'affermazione più debole di \"L'Agente X ha ottenuto l'80% nel benchmark Y nell'ambiente Z con il valutatore J e un budget di passaggi N\". La seconda affermazione preserva il confine che indica se il dato è trasferibile alla tua applicazione.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fit\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">The Answer Validity Boundary: il livello mancante tra pertinenza e risposte IA affidabili\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Un framework per rendere esplicite le condizioni in base alle quali un'affermazione dell'IA rimane valida e quali cambiamenti richiedono limitazioni, ricalcoli o l'abbandono.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Leggi The Answer Validity Boundary →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-48\">Il successo del processo e il successo dell'esito devono essere valutati separatamente\u003C\u002Fh2>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Quattro possibili esiti di una singola esecuzione di utilizzo del computer\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Processo\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Esito\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Interpretazione\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Processo corretto \u002F esito corretto\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Processo errato \u002F esito corretto\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Processo corretto \u002F esito errato\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Processo errato \u002F esito errato\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>WeaveBench rileva che una valutazione basata solo sull'esito può sovrastimare materialmente le prestazioni nell'uso del computer, poiché un agente potrebbe produrre un artefatto apparentemente riuscito tramite una scorciatoia o prove fittizie. Il verificatore deve esaminare la traiettoria e i deliverable, non semplicemente l'affermazione finale.\u003C\u002Fp>\n\u003Ch2 id=\"section-51\">L'affidabilità in produzione è una distribuzione, non una singola percentuale di successo\u003C\u002Fh2>\n\u003Cp>Una valutazione utile per la produzione campiona le dimensioni che variano effettivamente nel tuo ambiente. Per un flusso di lavoro basato su browser, queste potrebbero includere l'anzianità dell'account, le impostazioni internazionali, il viewport, la versione della pagina, la qualità della rete, lo stato di autenticazione, lo stato del carrello esistente, i cookie, i pop-up, i permessi dell'utente e l'eventuale interruzione dell'esecuzione da parte di un essere umano.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Dimensione\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Esempio di variazione\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Perché è importante\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ambiente\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Rete veloce o lenta, guasti transitori, tempistiche della pagina\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testa il ripristino e il comportamento di attesa\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Interfaccia utente\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Viewport differente, modale, elemento riordinato, restyling minore\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testa i presupposti fragili a livello visivo o di azione\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Stato\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Connesso\u002Fdisconnesso, carrello vuoto\u002Fnon vuoto, file esistente, permessi modificati\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testa il ragionamento sullo stato nascosto\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Orizzonte del task\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">5 passaggi rispetto a oltre 50 passaggi, una sola app rispetto a molteplici app\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testa l'errore accumulato lungo la traiettoria\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ambiguità\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Preferenza mancante o istruzione utente incompleta\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testa se l'agente chiede spiegazioni invece di tirare a indovinare\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Conseguenza\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sola lettura rispetto ad acquisto\u002Finvio\u002Fcancellazione\u002Fmodifica\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testa i controlli di conferma e di autorizzazione\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Contenuto avversariale\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prompt injection o testo fuorviante nella pagina\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testa la gerarchia delle istruzioni e il contenimento\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Versione del modello \u002F harness\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Aggiornamento del runtime\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testa la regressione causata da modifiche a livello di sistema\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-54\">L'affidabilità necessita di un budget di errore, non della perfezione\u003C\u002Fh2>\n\u003Cp>Nessun sistema di produzione è perfettamente affidabile. La vera domanda ingegneristica è quali fallimenti siano accettabili, rilevabili e recuperabili. Un tentativo fallito di ordinare una cartella locale non equivale all'invio dell'email sbagliata, all'acquisto del prodotto errato o alla modifica delle impostazioni di un account.\u003C\u002Fp>\n\u003Cp>Classifica le azioni in base alle conseguenze e alla reversibilità. Le azioni reversibili a basso impatto possono tollerare una maggiore autonomia. Le azioni ad alto impatto, visibili esternamente o difficili da annullare richiedono conferme più rigorose, verifica dello stato, autorizzazione e controlli post-azione.\u003C\u002Fp>\n\u003Ch2 id=\"section-57\">Una matrice pratica di affidabilità per l'uso del computer\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Classe di azione\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Esempio\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Controllo raccomandato\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Lettura \u002F ispezione\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Aprire pagine, leggere file, raccogliere informazioni\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Delimitare l'ambito, registrare le fonti, tollerare errori di navigazione recuperabili\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modifica locale reversibile\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modificare una bozza, riorganizzare l'area di lavoro temporanea\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Creare un checkpoint o versionare prima della modifica; verificare il risultato\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Comunicazione esterna\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Inviare un'email, pubblicare contenuti, inviare un modulo\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Conferma dell'utente o autorità esplicitamente delegata; verificare lo stato accettato\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Finanziaria \u002F transazionale\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Acquisto, checkout, abbonamento a pagamento\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Mandato rigoroso, vincoli su importo\u002Fesercente, conferma finale e verifica della ricevuta\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Distruttiva \u002F modifica dei privilegi\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eliminare dati, modificare permessi, revocare accessi\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autorizzazione ristretta, conferma esplicita, percorso reversibile ove possibile, audit post-azione\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-59\">Cosa registrare per un fallimento di computer-use\u003C\u002Fh2>\n\u003Cul>\u003Cli>Obiettivo dell'utente e vincoli espliciti.\u003C\u002Fli>\u003Cli>Versione del modello e dell'harness.\u003C\u002Fli>\u003Cli>Versioni dell'ambiente e delle applicazioni.\u003C\u002Fli>\u003Cli>Screenshot o osservazioni strutturate rilevanti per il fallimento.\u003C\u002Fli>\u003Cli>Azioni intraprese con timestamp.\u003C\u002Fli>\u003Cli>Risultati di strumenti, clic, tastiera e navigazione.\u003C\u002Fli>\u003Cli>Transizioni di stato e periodi di attesa.\u003C\u002Fli>\u003Cli>Eventi di approvazione, rifiuto o handoff.\u003C\u002Fli>\u003Cli>Errori esterni e guasti di rete.\u003C\u002Fli>\u003Cli>Stato finale osservabile dell'ambiente.\u003C\u002Fli>\u003Cli>L'esito dichiarato dall'agente.\u003C\u002Fli>\u003Cli>Risultato del verificatore e se il fallimento fosse controllabile dall'agente.\u003C\u002Fli>\u003C\u002Ful>\n\u003Cp>Il confronto cruciale è tra il successo dichiarato e il successo osservabile. Un sistema che non è in grado di distinguere i due finirà per accumulare falsi positivi in produzione.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fit\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Affidabilità degli agenti IA: perché la risposta finale non basta\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Un modello di affidabilità più ampio per valutare le traiettorie dell'agente, l'uso degli strumenti e le decisioni intermedie invece di accettare la risposta finale come prova che il sistema abbia funzionato correttamente.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Leggi l'articolo sull'affidabilità degli agenti →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-63\">La sicurezza fa parte dell'affidabilità per gli agenti computer-use\u003C\u002Fh2>\n\u003Cp>Gli agenti computer-use non si limitano a leggere contenuti non attendibili; possono agire dopo averli letti. Ciò trasforma il prompt injection, i contenuti dannosi delle pagine e il phishing in rischi legati al percorso di esecuzione.\u003C\u002Fp>\n\u003Cp>Le attuali linee guida di OpenAI per il computer-use raccomandano di isolare l'ambiente, inserire siti e azioni in whitelist, considerare non attendibile il contenuto dello schermo, confermare le azioni rilevanti, delimitare l'esecuzione e verificare il risultato effettivo. Analogamente, l'agente ChatGPT impiega conferme, monitoraggio del prompt injection e modalità supervisionate per i contesti sensibili.\u003C\u002Fp>\n\u003Cp>Il principio architetturale va oltre ogni singolo provider: al contenuto osservato dall'agente non deve essere consentito di ridefinire l'autorità dell'utente. Una pagina web può fornire dati. Non può concedere il permesso di inviare dati altrove, acquistare qualcosa, modificare credenziali o superare i limiti dell'incarico.\u003C\u002Fp>\n\u003Ch2 id=\"section-67\">Cosa potrebbe cambiare questa risposta?\u003C\u002Fh2>\n\u003Cp>Il divario di affidabilità si ridurrebbe se i modelli computer-use diventassero robusti rispetto a orizzonti temporali lunghi, stati dinamici, variazioni della UI, guasti ambientali e obiettivi ambigui attraverso distribuzioni di produzione rappresentative. API di stato native migliori, interfacce standardizzate machine-readable e un'infrastruttura di verifica più solida potrebbero anche ridurre la quantità di interazioni fragili con la GUI richieste.\u003C\u002Fp>\n\u003Cp>Anche la soglia di deployment varia in base alle conseguenze del compito. Una percentuale di successo del 70% può essere utile per un'attività di ricerca supervisionata a basso rischio e inaccettabile per un flusso di lavoro autonomo finanziario o distruttivo. L'affidabilità deve quindi essere valutata rispetto al costo di ciascuna classe di errore, e non tramite una soglia universale di superamento.\u003C\u002Fp>\n\u003Ch2 id=\"section-70\">Limitazioni\u003C\u002Fh2>\n\u003Cp>I benchmark citati valutano ambienti diversi e non dovrebbero essere confrontati direttamente come se misurassero la stessa cosa. WAREX mette alla prova l'inaffidabilità del web; WeaveBench punta al lavoro ibrido su orizzonti lunghi; OSWorld 2.0 si concentra su flussi di lavoro realistici ed estesi; BLIND-ACT è focalizzato sulla gestione degli obiettivi in condizioni di ambiguità e infattibilità.\u003C\u002Fp>\n\u003Cp>Inoltre, i risultati dei benchmark invecchiano rapidamente. I miglioramenti a livello di modelli, harness e verificatori possono modificare sensibilmente i punteggi nel giro di pochi mesi. La lezione duratura risiede quindi nel metodo di valutazione: variare le condizioni, separare il processo dall'esito, verificare lo stato esterno e preservare i limiti di ciascuna affermazione sulle prestazioni.\u003C\u002Fp>\n\u003Ch2 id=\"section-73\">Conclusione\u003C\u002Fh2>\n\u003Cp>Gli agenti per l'uso del computer sono già abbastanza capaci da risultare utili. È proprio per questo che la questione valutativa è cambiata. La sfida non è più solo se un agente sia in grado di completare un flusso di lavoro con una serie di clic. È se il sistema rimanga affidabile quando le condizioni perfette della demo vengono meno.\u003C\u002Fp>\n\u003Cp>Considera una singola esecuzione riuscita come prova di capacità. Poi testa la ripetibilità, la robustezza ambientale, il controllo su orizzonti lunghi, la consapevolezza dello stato, la verifica dei risultati e la gestione sicura degli obiettivi. Un agente per l'uso del computer pronto per la produzione non è quello che riesce a completare la demo. È quello i cui limiti di fallimento sono noti, misurati e controllati.\u003C\u002Fp>\n\u003Ch2 id=\"section-76\">FAQ\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Affidabilità degli agenti per l&#39;uso del computer\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Una demo riuscita di un agente per l&#39;uso del computer dimostra l&#39;affidabilità in produzione?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">No. Dimostra la capacità all&#39;interno di una singola traiettoria osservata. L&#39;affidabilità in produzione richiede successi ripetuti a fronte di variazioni ambientali, attività a lungo termine, variazioni di stato, ambiguità, condizioni di ripristino e azioni con conseguenze rilevanti.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Perché i benchmark per l&#39;uso del computer possono apparire molto migliori rispetto alle prestazioni nel mondo reale?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">I benchmark possono utilizzare ambienti più controllati, attività più brevi, condizioni di rete stabili, combinazioni di applicazioni più semplici o criteri di risultato che non catturano tutti i fallimenti di processo. Il confine esatto di validità dipende da ciascun benchmark.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Qual è il controllo di affidabilità più importante dopo un&#39;azione di utilizzo del computer?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Verificare l&#39;effettivo risultato esterno. Non considerare la dichiarazione finale dell&#39;agente o la sequenza di clic pianificata come una prova che il sistema di destinazione abbia accettato l&#39;operazione.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Perché le attività informatiche a lungo raggio rimangono difficili?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Gli errori si accumulano nel corso di molte azioni, i vincoli vengono dimenticati, lo stato esterno cambia, il lavoro abbraccia molteplici applicazioni, lo stato nascosto è rilevante e l&#39;agente deve decidere quando attendere, chiedere, verificare o recuperare anziché limitarsi a continuare ad agire.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Come dovrei testare un agente per browser o desktop prima del deployment?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Ripeti attività standard, inserisci errori ambientali realistici, varia l&#39;interfaccia utente e lo stato, estendi la durata del flusso di lavoro, introduci ambiguità, richiedi prove osservabili dei risultati, testa i controlli per le azioni ad alto impatto ed esegui nuovamente la suite di test dopo modifiche al modello o all&#39;infrastruttura.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq6\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Gli agenti per l&#39;uso del computer dovrebbero sempre richiedere la conferma umana?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Non per ogni azione a basso rischio. I requisiti di conferma dovrebbero essere proporzionati a conseguenze, reversibilità, autorità e incertezza. Le azioni ad alto impatto, visibili esternamente o difficili da annullare necessitano di controlli più rigorosi.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-78\">Glossario\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Termini chiave sull'affidabilità\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"computer-use-agent\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Computer-use agent (Agente per l'uso del computer)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Un agente IA che interagisce con interfacce grafiche o ambienti informatici attraverso osservazioni e azioni quali clic, digitazione, scorrimento, operazioni sui file o flussi di lavoro tra più applicazioni.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"repeatability\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Ripetibilità\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Il grado in cui un agente è in grado di completare la stessa attività in modo coerente attraverso esecuzioni ripetute, anziché avere successo solo su traiettorie selezionate.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"environmental-robustness\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Robustezza ambientale\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">La capacità di mantenere un comportamento corretto nonostante variazioni realistiche quali latenza, errori temporanei, modifiche dell'interfaccia utente, stato della sessione e condizioni impreviste della pagina.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"outcome-verification\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Verifica dei risultati\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Il controllo dell'effettivo stato esterno dopo un'azione per confermare che si sia verificato il risultato previsto, anziché fare affidamento sull'auto-segnalazione dell'agente.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"blind-goal-directedness\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Blind Goal-Directedness (Perseguimento cieco dell'obiettivo)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Un pattern di fallimento in cui un agente per l'uso del computer continua a perseguire un obiettivo nonostante ambiguità, irrealizzabilità, condizioni contraddittorie o motivi per fermarsi e ricalutare la situazione.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"reliability-boundary\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Confine di affidabilità\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">L'insieme delle condizioni entro le quali un tasso di successo osservato o una dichiarazione di capacità rimangono sufficientemente rappresentativi per una specifica decisione di implementazione.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-80\">Fonti primarie e ulteriori letture\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Computer use\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Linee guida attuali per sviluppatori sull&#39;isolamento degli ambienti, il trattamento dei contenuti a schermo come non attendibili, la conferma delle azioni consequenziali, la delimitazione delle esecuzioni e la verifica dei risultati.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Running Codex safely at OpenAI\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Linee guida attuali per la produzione su limiti tecnici, approvazione umana, telemetria e controllo per agenti che operano su sistemi reali.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — WAREX\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Valutazione del 2026 che dimostra come l&#39;inaffidabilità realistica del web provochi cali significativi nel successo delle attività degli agenti basati su browser nei benchmark esistenti.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — The Art of Building Verifiers for Computer Use Agents\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Lavoro del 2026 sulla valutazione del processo rispetto al risultato, sui fallimenti controllabili rispetto a quelli incontrollabili e sulla verifica affidabile della traiettoria.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — WeaveBench\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Benchmark a lungo raggio del 2026 che combina flussi di lavoro GUI, CLI e codice, evidenziando un divario sostanziale tra gli agenti attuali e il completamento affidabile nel mondo reale.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Benchmark del 2026 incentrato su flussi di lavoro realistici a lungo raggio per l&#39;uso del computer, stato nascosto e ragionamento tra più fonti.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — SentinelBench\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Benchmark del 2026 per attività che evolvono nel tempo in cui gli agenti devono monitorare gli ambienti e rispondere ai cambiamenti di stato anziché agire continuamente.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Ricerca ICLR 2026 sugli agenti che continuano a perseguire obiettivi ambigui, contraddittori o irrealizzabili.\u003C\u002Fp>\u003C\u002Fa>",{"time":212,"blocks":213,"version":938},1790353466752,[214,222,228,236,243,250,255,260,265,270,275,305,310,315,344,349,354,359,364,369,374,379,384,389,396,401,406,411,416,421,426,431,436,441,446,451,456,461,466,471,476,481,486,519,524,529,534,543,548,582,587,592,597,638,643,648,653,658,687,692,712,717,725,730,735,740,745,750,755,760,765,770,775,780,785,790,795,825,830,860,865,875,884,893,902,911,920,929],{"id":215,"data":216,"type":220,"tunes":221},"IYG9UPcPY0",{"title":217,"maxLevel":218,"minLevel":219},"Indice dei contenuti",3,2,"tableOfContents",{},{"id":223,"data":224,"type":226,"tunes":227},"intro",{"text":225},"Gli agenti per l'uso del computer possono ora cliccare, digitare, navigare, modificare file, utilizzare applicazioni desktop e completare impressionanti attività in più passaggi. Ciò rende le demo di successo facili da capire e facili da interpretare eccessivamente. Un singolo flusso di lavoro completato dimostra che l'agente può avere successo in quelle condizioni. Non mostra con quale frequenza ha successo, come si comporta quando l'ambiente cambia, se verifica il risultato o con quanta sicurezza agisce quando l'obiettivo diventa ambiguo.","paragraph",{},{"id":229,"data":230,"type":234,"tunes":235},"direct",{"body":231,"title":232,"variant":233},"\u003Cstrong>Una demo di successo sull'uso del computer dimostra la capacità, non l'affidabilità.\u003C\u002Fstrong> L'affidabilità in produzione richiede che l'agente riesca ripetutamente attraverso variazioni ambientali, si riprenda da guasti transitori, mantenga i vincoli su orizzonti temporali lunghi, rilevi stati nascosti o mutevoli, verifichi il risultato effettivo e si fermi o chieda chiarimenti quando l'obiettivo diventa ambiguo o non sicuro. La domanda corretta per la produzione non è \"L'agente può svolgere questo compito?\", bensì \"In quali condizioni possiamo fidarci che svolga questo compito ripetutamente?\"","Risposta diretta","info","callout",{},{"id":237,"data":238,"type":234,"tunes":242},"freshness",{"body":239,"title":240,"variant":241},"Questo articolo riflette la ricerca sugli agenti per l'uso del computer e le linee guida delle piattaforme disponibili al \u003Cstrong>25 settembre 2026\u003C\u002Fstrong>. I risultati dei benchmark non sono direttamente confrontabili tra diversi set di attività, ambienti, modelli, limiti di passaggi, valutatori o harness. Considera ogni dato di benchmark insieme alle sue condizioni di valutazione.","Un settore in rapida evoluzione","warning",{},{"id":244,"data":245,"type":234,"tunes":249},"model-note",{"body":246,"title":247,"variant":248},"La scala di affidabilità dell'uso del computer (Computer-Use Reliability Ladder) e lo stress test dalla demo alla produzione proposti di seguito sono modelli di valutazione pratici formulati in questo contesto. Non costituiscono standard industriali formali.","Il modello utilizzato in questo articolo","note",{},{"id":251,"data":252,"type":42,"tunes":254},"h-demo",{"text":253,"level":219},"Perché la demo è il test di affidabilità più semplice possibile",{},{"id":256,"data":257,"type":226,"tunes":259},"p-demo-1",{"text":258},"Una demo mostra normalmente una traiettoria che ha funzionato. L'ambiente è noto, l'attività viene selezionata in anticipo, l'operatore può riavviare dopo un errore e il pubblico vede solo il percorso riuscito. I sistemi in produzione affrontano invece una distribuzione: pagine diverse, condizioni di rete, stati dell'account, pop-up, latenza, modifiche alla UI, stati nascosti, permessi, interruzioni e utenti che descrivono gli obiettivi in modo imperfetto.",{},{"id":261,"data":262,"type":226,"tunes":264},"p-demo-2",{"text":263},"Tale distinzione è importante perché gli agenti per l'uso del computer operano attraverso interfacce progettate per gli esseri umani piuttosto che tramite API deterministiche. Il loro ciclo di azione dipende dalla percezione, dall'interpretazione dello stato, dalla pianificazione, dalle tempistiche di interazione e dalla risposta dell'ambiente. Piccoli cambiamenti possono alterare la traiettoria anche quando l'obiettivo dell'utente rimane invariato.",{},{"id":266,"data":267,"type":226,"tunes":269},"p-demo-3",{"text":268},"Il lavoro WAREX di Microsoft Research rende esplicito questo problema: agenti che ottengono ottimi punteggi nei benchmark in contesti controllati perdono gran parte del successo nelle attività quando viene introdotta una realistica instabilità del web. Il fallimento non è necessariamente dovuto al fatto che \"il modello è diventato meno intelligente\". È l'ambiente che ha smesso di essere deterministico.",{},{"id":271,"data":272,"type":42,"tunes":274},"h-claims",{"text":273,"level":219},"Capacità, tasso di successo, affidabilità e sicurezza sono affermazioni diverse",{},{"id":276,"data":277,"type":303,"tunes":304},"claims-table",{"content":278,"stretched":43,"withHeadings":14},[279,283,287,291,295,299],[280,281,282],"Affermazione","Cosa stabilisce effettivamente","Cosa non stabilisce",[284,285,286],"L'agente ha completato l'attività una volta","Capacità nell'ambito di una traiettoria osservata","Ripetibilità, robustezza, sicurezza o generalizzazione",[288,289,290],"L'agente ottiene un punteggio elevato in un benchmark","Prestazioni secondo le condizioni di valutazione e le attività di quel benchmark","Prestazioni equivalenti in produzione su ambienti diversi",[292,293,294],"L'agente di solito raggiunge l'obiettivo","Frequenza di successo del risultato","Processo corretto, comportamento sicuro o prova che il risultato sia stato verificato",[296,297,298],"L'agente segue il processo previsto","Qualità della traiettoria in base alla rubrica valutata","Che l'ambiente esterno abbia effettivamente accettato il risultato finale",[300,301,302],"L'agente evita azioni non sicure in un set di test","Prestazioni sui casi di sicurezza rappresentati","Sicurezza rispetto a ogni nuova ambiguità, injection o effetto collaterale","table",{},{"id":306,"data":307,"type":42,"tunes":309},"h-ladder",{"text":308,"level":219},"La scala di affidabilità dell'uso del computer",{},{"id":311,"data":312,"type":226,"tunes":314},"p-ladder-intro",{"text":313},"Un modo utile per valutare i sistemi di uso del computer è passare dalla capacità isolata a proprietà di affidabilità progressivamente più complesse. I livelli superiori presuppongono i livelli inferiori, ma non ne conseguono automaticamente.",{},{"id":316,"data":317,"type":342,"tunes":343},"ladder-flow",{"steps":318,"title":340,"orientation":341},[319,322,325,328,331,334,337],{"label":320,"description":321},"1. Capacità","L'agente può completare l'attività almeno una volta in condizioni note?",{"label":323,"description":324},"2. Ripetibilità","Può completare la stessa attività in modo coerente attraverso prove ripetute?",{"label":326,"description":327},"3. Robustezza ambientale","Riesce a gestire variazioni di timing, problemi di rete, pop-up, cambiamenti della UI e piccole perturbazioni ambientali?",{"label":329,"description":330},"4. Controllo su lungo orizzonte","Può preservare obiettivi, vincoli e progressi attraverso molti passaggi, applicazioni ed eventi differiti?",{"label":332,"description":333},"5. Consapevolezza dello stato","Può rilevare quando l'ambiente è cambiato, quando uno stato nascosto è rilevante o quando un'ipotesi non è più valida?",{"label":335,"description":336},"6. Verifica del risultato","Verifica che il risultato previsto sia effettivamente avvenuto invece di fidarsi della propria sequenza di azioni?",{"label":338,"description":339},"7. Gestione sicura degli obiettivi","Può fermarsi, chiedere, rifiutare o restituire il controllo quando l'obiettivo è ambiguo, irrealizzabile, contraddittorio o ad alto impatto?","Scala di affidabilità dell'uso del computer","auto","processFlow",{},{"id":345,"data":346,"type":42,"tunes":348},"h-capability",{"text":347,"level":218},"Livello 1 — Capacità: la domanda della demo",{},{"id":350,"data":351,"type":226,"tunes":353},"p-capability-1",{"text":352},"La capacità si domanda se un agente possa eseguire l'attività in assoluto. Questo è prezioso. I sistemi di uso del computer sono progrediti rapidamente e gli agenti moderni possono completare flussi di lavoro che i sistemi precedenti non potevano eseguire in modo affidabile.",{},{"id":355,"data":356,"type":226,"tunes":358},"p-capability-2",{"text":357},"Ma la capacità è un criterio debole per il deployment. Una singola esecuzione riuscita non dice se l'agente ha successo nel 95% dei casi o nel 30% dei casi, se i fallimenti sono innocui o distruttivi, o se il successo dipende da uno stato fortuito della pagina.",{},{"id":360,"data":361,"type":42,"tunes":363},"h-repeatability",{"text":362,"level":218},"Livello 2 — Ripetibilità: la stessa attività rimane risolta?",{},{"id":365,"data":366,"type":226,"tunes":368},"p-repeat-1",{"text":367},"Le traiettorie di computer-use sono stocastiche. Gli output dei modelli variano, le pagine si caricano a velocità diverse, gli stati visivi cambiano e i flussi di lavoro lunghi creano molteplici opportunità di ramificazione. Un test di produzione dovrebbe quindi eseguire la stessa attività più volte, invece di considerare una singola traccia superata come rappresentativa.",{},{"id":370,"data":371,"type":226,"tunes":373},"p-repeat-2",{"text":372},"Misura non solo il tasso di successo medio, ma anche la distribuzione delle modalità di fallimento: clic errato, interruzione prematura, mancata conferma, campo non corretto, azione duplicata, loop di navigazione, presupposto di stato obsoleto e falsa segnalazione di successo.",{},{"id":375,"data":376,"type":42,"tunes":378},"h-robustness",{"text":377,"level":218},"Livello 3 — Robustezza ambientale: cosa succede quando il web si comporta come il web?",{},{"id":380,"data":381,"type":226,"tunes":383},"p-robust-1",{"text":382},"I siti web reali non sono fixture di benchmark. Le richieste falliscono, gli elementi si caricano in ritardo, le sessioni scadono, le pagine cambiano, compaiono banner di consenso, i server restituiscono errori e le condizioni di rete fluttuano.",{},{"id":385,"data":386,"type":226,"tunes":388},"p-robust-2",{"text":387},"WAREX valuta questo divario introducendo un'inaffidabilità web realistica negli ambienti di benchmark esistenti e registra cali significativi nel successo delle attività. Si tratta di un'indicazione fondamentale per la produzione: un benchmark può misurare la competenza nell'attività sottovalutando al contempo il ripristino dall'instabilità ambientale.",{},{"id":390,"data":391,"type":234,"tunes":395},"robust-tip",{"body":392,"title":393,"variant":394},"Inietta ritardi, errori HTTP transitori, stati di pagina obsoleti, finestre di dialogo modali, scadenze di sessione, risposte duplicate e variazioni controllate dell'interfaccia utente. Se l'agente funziona solo sul percorso ideale, è un sistema adatto a una demo, non affidabile per la produzione.","Test di affidabilità","tip",{},{"id":397,"data":398,"type":42,"tunes":400},"h-long",{"text":399,"level":218},"Livello 4 — Controllo su orizzonti lunghi: il successo cambia quando l'attività diventa lavoro reale",{},{"id":402,"data":403,"type":226,"tunes":405},"p-long-1",{"text":404},"I compiti brevi nascondono una classe di errori che compaiono solo dopo decine o centinaia di azioni: vincoli dimenticati, lavoro duplicato, completamento prematuro, modifiche di stato mancate, incoerenze tra applicazioni diverse e accumulo di piccoli errori.",{},{"id":407,"data":408,"type":226,"tunes":410},"p-long-2",{"text":409},"OSWorld 2.0 è stato progettato specificamente attorno a flussi di lavoro reali a lungo raggio. I suoi task richiedono agli utenti umani una mediana di circa 1,6 ore e comportano molte più chiamate di strumenti rispetto ai precedenti benchmark di computer-use. In base alla sua metrica di completamento primaria, anche i sistemi più avanzati valutati rimangono lontani da una completa affidabilità operativa.",{},{"id":412,"data":413,"type":226,"tunes":415},"p-long-3",{"text":414},"WeaveBench giunge a una conclusione simile da un'altra prospettiva. Valuta flussi di lavoro ibridi tra GUI, CLI e codice e segnala che la migliore combinazione modello-runtime valutata supera solo il 41,2% delle attività. Il risultato rilevante non è un singolo punteggio in classifica; è che l'orchestrazione realistica tra interfacce diverse rivela fallimenti nascosti da compiti più semplici a interfaccia singola.",{},{"id":417,"data":418,"type":42,"tunes":420},"h-state",{"text":419,"level":218},"Livello 5 — Consapevolezza dello stato: l'ambiente può cambiare sotto al piano d'azione",{},{"id":422,"data":423,"type":226,"tunes":425},"p-state-1",{"text":424},"Le attività a lunga esecuzione dipendono spesso da stati nascosti o mutevoli: arriva un'email, un calendario cambia, un modulo viene inviato, un processo in background termina, una sessione del browser scade, un utente modifica un file o un sistema esterno cambia disponibilità.",{},{"id":427,"data":428,"type":226,"tunes":430},"p-state-2",{"text":429},"SentinelBench di Microsoft sostiene che molte attività a lunga durata non dovrebbero affatto essere risolte tramite un'azione continua. Il comportamento corretto potrebbe consistere nel monitorare, attendere un evento esterno e poi agire quando lo stato cambia. Si tratta di una capacità diversa dal fare clic più rapidamente o dal pianificare più passaggi.",{},{"id":432,"data":433,"type":226,"tunes":435},"p-state-3",{"text":434},"Un agente di computer-use affidabile deve quindi distinguere tra azionabile ora, in attesa di stato, stato modificato e presupposto invalidato.",{},{"id":437,"data":438,"type":42,"tunes":440},"h-verify",{"text":439,"level":218},"Livello 6 — Verifica del risultato: l'azione ha funzionato davvero?",{},{"id":442,"data":443,"type":226,"tunes":445},"p-verify-1",{"text":444},"Un agente può eseguire una sequenza apparentemente corretta e comunque fallire l'attività. Un clic su un pulsante potrebbe non essere registrato. Un modulo potrebbe non superare una convalida nascosta. Un file potrebbe essere salvato nella directory errata. Un acquisto potrebbe rimanere non confermato. Un sito potrebbe mostrare una schermata apparentemente di successo mentre l'operazione sottostante è fallita.",{},{"id":447,"data":448,"type":226,"tunes":450},"p-verify-2",{"text":449},"Le attuali linee guida di OpenAI sul computer-use raccomandano esplicitamente di delimitare e verificare l'esecuzione invece di affidarsi unicamente alla risposta finale del modello. Il lavoro di Microsoft Research sui verificatori di computer-use giunge alla stessa conclusione attraverso la valutazione: processo e risultato devono essere giudicati separatamente.",{},{"id":452,"data":453,"type":226,"tunes":455},"p-verify-3",{"text":454},"La ricerca Universal Verifier evidenzia che le configurazioni di verifica precedenti possono produrre tassi elevati di falsi positivi, mentre una progettazione più rigorosa dei criteri di valutazione e la separazione esplicita tra processo, risultato, fallimenti controllabili e fallimenti incontrollabili migliorano sensibilmente la concordanza con le valutazioni umane.",{},{"id":457,"data":458,"type":42,"tunes":460},"h-safe-goal",{"text":459,"level":218},"Livello 7 — Gestione sicura dell'obiettivo: l'agente deve sapere quando non proseguire",{},{"id":462,"data":463,"type":226,"tunes":465},"p-safe-1",{"text":464},"Gli agenti per l'uso del computer sono ottimizzati per completare obiettivi, ma la persistenza verso l'obiettivo può diventare essa stessa una modalità di fallimento. Una richiesta ambigua, una condizione impossibile, un'istruzione contraddittoria, una pagina web sospetta o un ambiente mutato possono richiedere chiarimenti o un arresto piuttosto che ulteriori azioni.",{},{"id":467,"data":468,"type":226,"tunes":470},"p-safe-2",{"text":469},"Il benchmark BLIND-ACT studia questo problema definendolo Blind Goal-Directedness. Tra i sistemi valutati in quello studio, gli agenti hanno frequentemente continuato a perseguire i compiti nonostante l'ambiguità, l'irrealizzabilità, un contesto conflittuale o altri motivi per riconsiderare l'azione. Gli autori identificano schemi ricorrenti come l'execution-first bias e la request primacy.",{},{"id":472,"data":473,"type":226,"tunes":475},"p-safe-3",{"text":474},"Questa classe di fallimento è rilevante perché un agente altamente capace può peggiorare una cattiva situazione molto più rapidamente. L'affidabilità include quindi una policy su quando non agire.",{},{"id":477,"data":478,"type":42,"tunes":480},"h-stress",{"text":479,"level":219},"Lo stress test dal passaggio da demo a produzione",{},{"id":482,"data":483,"type":226,"tunes":485},"p-stress-intro",{"text":484},"Prima di distribuire un flusso di lavoro per l'uso del computer, prendi la demo riuscita e rimuovi sistematicamente le ipotesi che l'hanno resa facile.",{},{"id":487,"data":488,"type":342,"tunes":518},"stress-flow",{"steps":489,"title":517,"orientation":341},[490,493,496,499,502,505,508,511,514],{"label":491,"description":492},"1. Esegui nuovamente il task pulito","Stabilisci la ripetibilità su più tentativi prima di aggiungere complessità.",{"label":494,"description":495},"2. Perturba l'ambiente","Aggiungi latenza, tentativi di retry, pop-up, variazioni di pagina, sessioni scadute e guasti temporanei.",{"label":497,"description":498},"3. Estendi l'orizzonte","Trasforma la breve demo nel flusso di lavoro reale completo con stato intermedio, molteplici applicazioni e passaggi ritardati.",{"label":500,"description":501},"4. Modifica lo stato nascosto","Modifica l'account, il file, il task o lo stato esterno dopo che l'agente ha elaborato un piano e verifica se rileva il cambiamento.",{"label":503,"description":504},"5. Inietta ambiguità","Rimuovi un presupposto importante e verifica se l'agente chiede spiegazioni invece di tirare a indovinare.",{"label":506,"description":507},"6. Inietta una contraddizione controllata","Presenta insieme il vecchio e il nuovo stato e verifica che lo stato attuale autorevole prevalga.",{"label":509,"description":510},"7. Richiedi la prova del risultato","Fai dipendere il completamento del task da uno stato finale verificabile, non dall'auto-segnalazione del modello.",{"label":512,"description":513},"8. Testa i confini consequenziali","Conferma che le azioni irreversibili o sensibili attivino l'approvazione, il rifiuto o il passaggio di consegne previsto.",{"label":515,"description":516},"9. Ripeti dopo modifiche all'harness o al modello","Tratta gli aggiornamenti di runtime come modifiche all'affidabilità che richiedono test di regressione.","Stress test dal passaggio da demo a produzione",{},{"id":520,"data":521,"type":42,"tunes":523},"h-benchmark-boundary",{"text":522,"level":219},"Il successo nei benchmark ha un confine di validità",{},{"id":525,"data":526,"type":226,"tunes":528},"p-boundary-1",{"text":527},"Il punteggio di un benchmark è un'affermazione condizionale. È valido per uno specifico modello, harness, ambiente, set di task, valutatore, interfaccia degli strumenti, budget di passaggi, policy di retry, data e metodo di valutazione.",{},{"id":530,"data":531,"type":226,"tunes":533},"p-boundary-2",{"text":532},"Il numero diventa fuorviante quando tali condizioni scompaiono dall'affermazione. \"L'Agente X ottiene l'80%\" è un'affermazione più debole di \"L'Agente X ha ottenuto l'80% nel benchmark Y nell'ambiente Z con il valutatore J e un budget di passaggi N\". La seconda affermazione preserva il confine che indica se il dato è trasferibile alla tua applicazione.",{},{"id":535,"data":536,"type":541,"tunes":542},"ref-avb",{"url":537,"title":538,"excerpt":539,"ctaLabel":540},"https:\u002F\u002Fstajic.de\u002Fit\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","The Answer Validity Boundary: il livello mancante tra pertinenza e risposte IA affidabili","Un framework per rendere esplicite le condizioni in base alle quali un'affermazione dell'IA rimane valida e quali cambiamenti richiedono limitazioni, ricalcoli o l'abbandono.","Leggi The Answer Validity Boundary","referralArticle",{},{"id":544,"data":545,"type":42,"tunes":547},"h-process-outcome",{"text":546,"level":219},"Il successo del processo e il successo dell'esito devono essere valutati separatamente",{},{"id":549,"data":550,"type":580,"tunes":581},"process-outcome-comparison",{"rows":551,"title":569,"layout":303,"columns":570},[552,557,561,565],{"id":553,"label":554,"values":555},"good-good","Processo corretto \u002F esito corretto",[556,556,556],"",{"id":558,"label":559,"values":560},"bad-good","Processo errato \u002F esito corretto",[556,556,556],{"id":562,"label":563,"values":564},"good-bad","Processo corretto \u002F esito errato",[556,556,556],{"id":566,"label":567,"values":568},"bad-bad","Processo errato \u002F esito errato",[556,556,556],"Quattro possibili esiti di una singola esecuzione di utilizzo del computer",[571,574,577],{"id":572,"label":573},"process","Processo",{"id":575,"label":576},"outcome","Esito",{"id":578,"label":579},"interpretation","Interpretazione","comparison",{},{"id":583,"data":584,"type":226,"tunes":586},"p-process-1",{"text":585},"WeaveBench rileva che una valutazione basata solo sull'esito può sovrastimare materialmente le prestazioni nell'uso del computer, poiché un agente potrebbe produrre un artefatto apparentemente riuscito tramite una scorciatoia o prove fittizie. Il verificatore deve esaminare la traiettoria e i deliverable, non semplicemente l'affermazione finale.",{},{"id":588,"data":589,"type":42,"tunes":591},"h-distribution",{"text":590,"level":219},"L'affidabilità in produzione è una distribuzione, non una singola percentuale di successo",{},{"id":593,"data":594,"type":226,"tunes":596},"p-dist-1",{"text":595},"Una valutazione utile per la produzione campiona le dimensioni che variano effettivamente nel tuo ambiente. Per un flusso di lavoro basato su browser, queste potrebbero includere l'anzianità dell'account, le impostazioni internazionali, il viewport, la versione della pagina, la qualità della rete, lo stato di autenticazione, lo stato del carrello esistente, i cookie, i pop-up, i permessi dell'utente e l'eventuale interruzione dell'esecuzione da parte di un essere umano.",{},{"id":598,"data":599,"type":303,"tunes":637},"distribution-table",{"content":600,"stretched":43,"withHeadings":14},[601,605,609,613,617,621,625,629,633],[602,603,604],"Dimensione","Esempio di variazione","Perché è importante",[606,607,608],"Ambiente","Rete veloce o lenta, guasti transitori, tempistiche della pagina","Testa il ripristino e il comportamento di attesa",[610,611,612],"Interfaccia utente","Viewport differente, modale, elemento riordinato, restyling minore","Testa i presupposti fragili a livello visivo o di azione",[614,615,616],"Stato","Connesso\u002Fdisconnesso, carrello vuoto\u002Fnon vuoto, file esistente, permessi modificati","Testa il ragionamento sullo stato nascosto",[618,619,620],"Orizzonte del task","5 passaggi rispetto a oltre 50 passaggi, una sola app rispetto a molteplici app","Testa l'errore accumulato lungo la traiettoria",[622,623,624],"Ambiguità","Preferenza mancante o istruzione utente incompleta","Testa se l'agente chiede spiegazioni invece di tirare a indovinare",[626,627,628],"Conseguenza","Sola lettura rispetto ad acquisto\u002Finvio\u002Fcancellazione\u002Fmodifica","Testa i controlli di conferma e di autorizzazione",[630,631,632],"Contenuto avversariale","Prompt injection o testo fuorviante nella pagina","Testa la gerarchia delle istruzioni e il contenimento",[634,635,636],"Versione del modello \u002F harness","Aggiornamento del runtime","Testa la regressione causata da modifiche a livello di sistema",{},{"id":639,"data":640,"type":42,"tunes":642},"h-budget",{"text":641,"level":219},"L'affidabilità necessita di un budget di errore, non della perfezione",{},{"id":644,"data":645,"type":226,"tunes":647},"p-budget-1",{"text":646},"Nessun sistema di produzione è perfettamente affidabile. La vera domanda ingegneristica è quali fallimenti siano accettabili, rilevabili e recuperabili. Un tentativo fallito di ordinare una cartella locale non equivale all'invio dell'email sbagliata, all'acquisto del prodotto errato o alla modifica delle impostazioni di un account.",{},{"id":649,"data":650,"type":226,"tunes":652},"p-budget-2",{"text":651},"Classifica le azioni in base alle conseguenze e alla reversibilità. Le azioni reversibili a basso impatto possono tollerare una maggiore autonomia. Le azioni ad alto impatto, visibili esternamente o difficili da annullare richiedono conferme più rigorose, verifica dello stato, autorizzazione e controlli post-azione.",{},{"id":654,"data":655,"type":42,"tunes":657},"h-matrix",{"text":656,"level":219},"Una matrice pratica di affidabilità per l'uso del computer",{},{"id":659,"data":660,"type":303,"tunes":686},"control-matrix",{"content":661,"stretched":43,"withHeadings":14},[662,666,670,674,678,682],[663,664,665],"Classe di azione","Esempio","Controllo raccomandato",[667,668,669],"Lettura \u002F ispezione","Aprire pagine, leggere file, raccogliere informazioni","Delimitare l'ambito, registrare le fonti, tollerare errori di navigazione recuperabili",[671,672,673],"Modifica locale reversibile","Modificare una bozza, riorganizzare l'area di lavoro temporanea","Creare un checkpoint o versionare prima della modifica; verificare il risultato",[675,676,677],"Comunicazione esterna","Inviare un'email, pubblicare contenuti, inviare un modulo","Conferma dell'utente o autorità esplicitamente delegata; verificare lo stato accettato",[679,680,681],"Finanziaria \u002F transazionale","Acquisto, checkout, abbonamento a pagamento","Mandato rigoroso, vincoli su importo\u002Fesercente, conferma finale e verifica della ricevuta",[683,684,685],"Distruttiva \u002F modifica dei privilegi","Eliminare dati, modificare permessi, revocare accessi","Autorizzazione ristretta, conferma esplicita, percorso reversibile ove possibile, audit post-azione",{},{"id":688,"data":689,"type":42,"tunes":691},"h-log",{"text":690,"level":219},"Cosa registrare per un fallimento di computer-use",{},{"id":693,"data":694,"type":710,"tunes":711},"log-list",{"meta":695,"items":696,"style":709},{},[697,698,699,700,701,702,703,704,705,706,707,708],"Obiettivo dell'utente e vincoli espliciti.","Versione del modello e dell'harness.","Versioni dell'ambiente e delle applicazioni.","Screenshot o osservazioni strutturate rilevanti per il fallimento.","Azioni intraprese con timestamp.","Risultati di strumenti, clic, tastiera e navigazione.","Transizioni di stato e periodi di attesa.","Eventi di approvazione, rifiuto o handoff.","Errori esterni e guasti di rete.","Stato finale osservabile dell'ambiente.","L'esito dichiarato dall'agente.","Risultato del verificatore e se il fallimento fosse controllabile dall'agente.","unordered","list",{},{"id":713,"data":714,"type":226,"tunes":716},"p-log-1",{"text":715},"Il confronto cruciale è tra il successo dichiarato e il successo osservabile. Un sistema che non è in grado di distinguere i due finirà per accumulare falsi positivi in produzione.",{},{"id":718,"data":719,"type":541,"tunes":724},"ref-reliability",{"url":720,"title":721,"excerpt":722,"ctaLabel":723},"https:\u002F\u002Fstajic.de\u002Fit\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Affidabilità degli agenti IA: perché la risposta finale non basta","Un modello di affidabilità più ampio per valutare le traiettorie dell'agente, l'uso degli strumenti e le decisioni intermedie invece di accettare la risposta finale come prova che il sistema abbia funzionato correttamente.","Leggi l'articolo sull'affidabilità degli agenti",{},{"id":726,"data":727,"type":42,"tunes":729},"h-security",{"text":728,"level":219},"La sicurezza fa parte dell'affidabilità per gli agenti computer-use",{},{"id":731,"data":732,"type":226,"tunes":734},"p-sec-1",{"text":733},"Gli agenti computer-use non si limitano a leggere contenuti non attendibili; possono agire dopo averli letti. Ciò trasforma il prompt injection, i contenuti dannosi delle pagine e il phishing in rischi legati al percorso di esecuzione.",{},{"id":736,"data":737,"type":226,"tunes":739},"p-sec-2",{"text":738},"Le attuali linee guida di OpenAI per il computer-use raccomandano di isolare l'ambiente, inserire siti e azioni in whitelist, considerare non attendibile il contenuto dello schermo, confermare le azioni rilevanti, delimitare l'esecuzione e verificare il risultato effettivo. Analogamente, l'agente ChatGPT impiega conferme, monitoraggio del prompt injection e modalità supervisionate per i contesti sensibili.",{},{"id":741,"data":742,"type":226,"tunes":744},"p-sec-3",{"text":743},"Il principio architetturale va oltre ogni singolo provider: al contenuto osservato dall'agente non deve essere consentito di ridefinire l'autorità dell'utente. Una pagina web può fornire dati. Non può concedere il permesso di inviare dati altrove, acquistare qualcosa, modificare credenziali o superare i limiti dell'incarico.",{},{"id":746,"data":747,"type":42,"tunes":749},"h-change",{"text":748,"level":219},"Cosa potrebbe cambiare questa risposta?",{},{"id":751,"data":752,"type":226,"tunes":754},"p-change-1",{"text":753},"Il divario di affidabilità si ridurrebbe se i modelli computer-use diventassero robusti rispetto a orizzonti temporali lunghi, stati dinamici, variazioni della UI, guasti ambientali e obiettivi ambigui attraverso distribuzioni di produzione rappresentative. API di stato native migliori, interfacce standardizzate machine-readable e un'infrastruttura di verifica più solida potrebbero anche ridurre la quantità di interazioni fragili con la GUI richieste.",{},{"id":756,"data":757,"type":226,"tunes":759},"p-change-2",{"text":758},"Anche la soglia di deployment varia in base alle conseguenze del compito. Una percentuale di successo del 70% può essere utile per un'attività di ricerca supervisionata a basso rischio e inaccettabile per un flusso di lavoro autonomo finanziario o distruttivo. L'affidabilità deve quindi essere valutata rispetto al costo di ciascuna classe di errore, e non tramite una soglia universale di superamento.",{},{"id":761,"data":762,"type":42,"tunes":764},"h-limitations",{"text":763,"level":219},"Limitazioni",{},{"id":766,"data":767,"type":226,"tunes":769},"p-limit-1",{"text":768},"I benchmark citati valutano ambienti diversi e non dovrebbero essere confrontati direttamente come se misurassero la stessa cosa. WAREX mette alla prova l'inaffidabilità del web; WeaveBench punta al lavoro ibrido su orizzonti lunghi; OSWorld 2.0 si concentra su flussi di lavoro realistici ed estesi; BLIND-ACT è focalizzato sulla gestione degli obiettivi in condizioni di ambiguità e infattibilità.",{},{"id":771,"data":772,"type":226,"tunes":774},"p-limit-2",{"text":773},"Inoltre, i risultati dei benchmark invecchiano rapidamente. I miglioramenti a livello di modelli, harness e verificatori possono modificare sensibilmente i punteggi nel giro di pochi mesi. La lezione duratura risiede quindi nel metodo di valutazione: variare le condizioni, separare il processo dall'esito, verificare lo stato esterno e preservare i limiti di ciascuna affermazione sulle prestazioni.",{},{"id":776,"data":777,"type":42,"tunes":779},"h-conclusion",{"text":778,"level":219},"Conclusione",{},{"id":781,"data":782,"type":226,"tunes":784},"p-conclusion-1",{"text":783},"Gli agenti per l'uso del computer sono già abbastanza capaci da risultare utili. È proprio per questo che la questione valutativa è cambiata. La sfida non è più solo se un agente sia in grado di completare un flusso di lavoro con una serie di clic. È se il sistema rimanga affidabile quando le condizioni perfette della demo vengono meno.",{},{"id":786,"data":787,"type":226,"tunes":789},"p-conclusion-2",{"text":788},"Considera una singola esecuzione riuscita come prova di capacità. Poi testa la ripetibilità, la robustezza ambientale, il controllo su orizzonti lunghi, la consapevolezza dello stato, la verifica dei risultati e la gestione sicura degli obiettivi. Un agente per l'uso del computer pronto per la produzione non è quello che riesce a completare la demo. È quello i cui limiti di fallimento sono noti, misurati e controllati.",{},{"id":791,"data":792,"type":42,"tunes":794},"h-faq",{"text":793,"level":219},"FAQ",{},{"id":796,"data":797,"type":796,"tunes":824},"faq",{"items":798,"title":823},[799,803,807,811,815,819],{"id":800,"answer":801,"question":802},"faq1","No. Dimostra la capacità all'interno di una singola traiettoria osservata. L'affidabilità in produzione richiede successi ripetuti a fronte di variazioni ambientali, attività a lungo termine, variazioni di stato, ambiguità, condizioni di ripristino e azioni con conseguenze rilevanti.","Una demo riuscita di un agente per l'uso del computer dimostra l'affidabilità in produzione?",{"id":804,"answer":805,"question":806},"faq2","I benchmark possono utilizzare ambienti più controllati, attività più brevi, condizioni di rete stabili, combinazioni di applicazioni più semplici o criteri di risultato che non catturano tutti i fallimenti di processo. Il confine esatto di validità dipende da ciascun benchmark.","Perché i benchmark per l'uso del computer possono apparire molto migliori rispetto alle prestazioni nel mondo reale?",{"id":808,"answer":809,"question":810},"faq3","Verificare l'effettivo risultato esterno. Non considerare la dichiarazione finale dell'agente o la sequenza di clic pianificata come una prova che il sistema di destinazione abbia accettato l'operazione.","Qual è il controllo di affidabilità più importante dopo un'azione di utilizzo del computer?",{"id":812,"answer":813,"question":814},"faq4","Gli errori si accumulano nel corso di molte azioni, i vincoli vengono dimenticati, lo stato esterno cambia, il lavoro abbraccia molteplici applicazioni, lo stato nascosto è rilevante e l'agente deve decidere quando attendere, chiedere, verificare o recuperare anziché limitarsi a continuare ad agire.","Perché le attività informatiche a lungo raggio rimangono difficili?",{"id":816,"answer":817,"question":818},"faq5","Ripeti attività standard, inserisci errori ambientali realistici, varia l'interfaccia utente e lo stato, estendi la durata del flusso di lavoro, introduci ambiguità, richiedi prove osservabili dei risultati, testa i controlli per le azioni ad alto impatto ed esegui nuovamente la suite di test dopo modifiche al modello o all'infrastruttura.","Come dovrei testare un agente per browser o desktop prima del deployment?",{"id":820,"answer":821,"question":822},"faq6","Non per ogni azione a basso rischio. I requisiti di conferma dovrebbero essere proporzionati a conseguenze, reversibilità, autorità e incertezza. Le azioni ad alto impatto, visibili esternamente o difficili da annullare necessitano di controlli più rigorosi.","Gli agenti per l'uso del computer dovrebbero sempre richiedere la conferma umana?","Affidabilità degli agenti per l'uso del computer",{},{"id":826,"data":827,"type":42,"tunes":829},"h-glossary",{"text":828,"level":219},"Glossario",{},{"id":831,"data":832,"type":831,"tunes":859},"glossary",{"title":833,"entries":834},"Termini chiave sull'affidabilità",[835,839,843,847,851,855],{"term":836,"anchor":837,"definition":838},"Computer-use agent (Agente per l'uso del computer)","computer-use-agent","Un agente IA che interagisce con interfacce grafiche o ambienti informatici attraverso osservazioni e azioni quali clic, digitazione, scorrimento, operazioni sui file o flussi di lavoro tra più applicazioni.",{"term":840,"anchor":841,"definition":842},"Ripetibilità","repeatability","Il grado in cui un agente è in grado di completare la stessa attività in modo coerente attraverso esecuzioni ripetute, anziché avere successo solo su traiettorie selezionate.",{"term":844,"anchor":845,"definition":846},"Robustezza ambientale","environmental-robustness","La capacità di mantenere un comportamento corretto nonostante variazioni realistiche quali latenza, errori temporanei, modifiche dell'interfaccia utente, stato della sessione e condizioni impreviste della pagina.",{"term":848,"anchor":849,"definition":850},"Verifica dei risultati","outcome-verification","Il controllo dell'effettivo stato esterno dopo un'azione per confermare che si sia verificato il risultato previsto, anziché fare affidamento sull'auto-segnalazione dell'agente.",{"term":852,"anchor":853,"definition":854},"Blind Goal-Directedness (Perseguimento cieco dell'obiettivo)","blind-goal-directedness","Un pattern di fallimento in cui un agente per l'uso del computer continua a perseguire un obiettivo nonostante ambiguità, irrealizzabilità, condizioni contraddittorie o motivi per fermarsi e ricalutare la situazione.",{"term":856,"anchor":857,"definition":858},"Confine di affidabilità","reliability-boundary","L'insieme delle condizioni entro le quali un tasso di successo osservato o una dichiarazione di capacità rimangono sufficientemente rappresentativi per una specifica decisione di implementazione.",{},{"id":861,"data":862,"type":42,"tunes":864},"h-sources",{"text":863,"level":219},"Fonti primarie e ulteriori letture",{},{"id":866,"data":867,"type":873,"tunes":874},"src-openai-computer",{"link":868,"meta":869},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use",{"image":870,"title":871,"description":872},{"url":556},"OpenAI — Computer use","Linee guida attuali per sviluppatori sull'isolamento degli ambienti, il trattamento dei contenuti a schermo come non attendibili, la conferma delle azioni consequenziali, la delimitazione delle esecuzioni e la verifica dei risultati.","linkTool",{},{"id":876,"data":877,"type":873,"tunes":883},"src-openai-safety",{"link":878,"meta":879},"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F",{"image":880,"title":881,"description":882},{"url":556},"OpenAI — Running Codex safely at OpenAI","Linee guida attuali per la produzione su limiti tecnici, approvazione umana, telemetria e controllo per agenti che operano su sistemi reali.",{},{"id":885,"data":886,"type":873,"tunes":892},"src-ms-warex",{"link":887,"meta":888},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F",{"image":889,"title":890,"description":891},{"url":556},"Microsoft Research — WAREX","Valutazione del 2026 che dimostra come l'inaffidabilità realistica del web provochi cali significativi nel successo delle attività degli agenti basati su browser nei benchmark esistenti.",{},{"id":894,"data":895,"type":873,"tunes":901},"src-ms-verifier",{"link":896,"meta":897},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F",{"image":898,"title":899,"description":900},{"url":556},"Microsoft Research — The Art of Building Verifiers for Computer Use Agents","Lavoro del 2026 sulla valutazione del processo rispetto al risultato, sui fallimenti controllabili rispetto a quelli incontrollabili e sulla verifica affidabile della traiettoria.",{},{"id":903,"data":904,"type":873,"tunes":910},"src-ms-weavebench",{"link":905,"meta":906},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F",{"image":907,"title":908,"description":909},{"url":556},"Microsoft Research — WeaveBench","Benchmark a lungo raggio del 2026 che combina flussi di lavoro GUI, CLI e codice, evidenziando un divario sostanziale tra gli agenti attuali e il completamento affidabile nel mondo reale.",{},{"id":912,"data":913,"type":873,"tunes":919},"src-osworld2",{"link":914,"meta":915},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537",{"image":916,"title":917,"description":918},{"url":556},"OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","Benchmark del 2026 incentrato su flussi di lavoro realistici a lungo raggio per l'uso del computer, stato nascosto e ragionamento tra più fonti.",{},{"id":921,"data":922,"type":873,"tunes":928},"src-ms-sentinel",{"link":923,"meta":924},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F",{"image":925,"title":926,"description":927},{"url":556},"Microsoft Research — SentinelBench","Benchmark del 2026 per attività che evolvono nel tempo in cui gli agenti devono monitorare gli ambienti e rispondere ai cambiamenti di stato anziché agire continuamente.",{},{"id":930,"data":931,"type":873,"tunes":937},"src-ms-blind",{"link":932,"meta":933},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F",{"image":934,"title":935,"description":936},{"url":556},"Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness","Ricerca ICLR 2026 sugli agenti che continuano a perseguire obiettivi ambigui, contraddittori o irrealizzabili.",{},"2.31","Gli agenti computer-use possono ora completare impressionanti flussi di lavoro su browser e desktop, ma una singola esecuzione riuscita dimostra la capacità—non l'affidabilità. Questo articolo mostra come testare la ripetibilità, la robustezza ambientale, il controllo a lungo orizzonte, la consapevolezza dello stato, la verifica dei risultati e la gestione sicura degli obiettivi.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg","PUBLISHED","2026-09-25T12:13:00.000Z","2026-09-25T16:13:28.344Z","2026-09-25T19:19:11.089Z",{"en":947,"de":948,"sr":949,"es":950,"fr":951,"it":952,"ru":953,"zh":954},"\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fde\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fsr\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fes\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Ffr\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fit\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fru\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fzh\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system",[956,960,964],{"id":957,"name":958,"slug":959},58,"Valutazione e gate di qualità","evaluation",{"id":961,"name":962,"slug":963},97,"Verifica su test set","verification",{"id":965,"name":966,"slug":967},73,"Verifica e diff","verification-and-diffing",{"id":969,"login":970,"email":971,"displayName":972},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[974,1565],{"lang":975,"title":976,"content":977,"contentJson":978,"excerpt":1564},"en","Computer-Use Agents: Why a Successful Demo Can Still Be an Unreliable System","{\"time\":1790352872794,\"blocks\":[{\"id\":\"IYG9UPcPY0\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents can now click, type, browse, edit files, operate desktop applications, and complete impressive multi-step tasks. That makes successful demos easy to understand and easy to overinterpret. A single completed workflow shows that the agent can succeed under those conditions. It does not show how often it succeeds, how it behaves when the environment changes, whether it verifies the result, or how safely it acts when the goal becomes ambiguous.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"\u003Cstrong>A successful computer-use demo proves capability, not reliability.\u003C\u002Fstrong> Production reliability requires the agent to succeed repeatedly across environmental variation, recover from transient failures, preserve constraints over long horizons, detect hidden or changing state, verify the actual outcome, and stop or ask when the goal becomes ambiguous or unsafe. The correct production question is not “Can the agent do this task?” but “Under which conditions can we trust it to do this task repeatedly?”\"},\"tunes\":{}},{\"id\":\"freshness\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Fast-moving field\",\"body\":\"This article reflects computer-use agent research and platform guidance available on \u003Cstrong>25 September 2026\u003C\u002Fstrong>. Benchmark results are not directly comparable across different task sets, environments, models, step limits, judges, or harnesses. Treat every benchmark number together with its evaluation conditions.\"},\"tunes\":{}},{\"id\":\"model-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"The model used in this article\",\"body\":\"The Computer-Use Reliability Ladder and Demo-to-Production Stress Test below are practical evaluation models proposed here. They are not formal industry standards.\"},\"tunes\":{}},{\"id\":\"h-demo\",\"type\":\"header\",\"data\":{\"text\":\"Why the demo is the easiest possible reliability test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-demo-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A demo normally shows one trajectory that worked. The environment is known, the task is selected in advance, the operator can restart after a failure, and the audience sees the successful path. Production systems face a distribution instead: different pages, network conditions, account states, pop-ups, latency, UI changes, hidden state, permissions, interruptions, and users who describe goals imperfectly.\"},\"tunes\":{}},{\"id\":\"p-demo-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That distinction matters because computer-use agents operate through interfaces designed for humans rather than deterministic APIs. Their action loop depends on perception, state interpretation, planning, interaction timing, and environment response. Small changes can alter the trajectory even when the user goal is unchanged.\"},\"tunes\":{}},{\"id\":\"p-demo-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Microsoft Research's WAREX work makes the problem explicit: benchmark agents that look capable in controlled settings lose substantial task success when realistic web instability is introduced. The failure is not necessarily “the model became less intelligent.” The environment stopped being deterministic.\"},\"tunes\":{}},{\"id\":\"h-claims\",\"type\":\"header\",\"data\":{\"text\":\"Capability, success rate, reliability, and safety are different claims\",\"level\":2},\"tunes\":{}},{\"id\":\"claims-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Claim\",\"What it actually establishes\",\"What it does not establish\"],[\"The agent completed the task once\",\"Capability under one observed trajectory\",\"Repeatability, robustness, safety, or generalization\"],[\"The agent scores highly on a benchmark\",\"Performance under that benchmark's task and evaluation conditions\",\"Equivalent production performance on different environments\"],[\"The agent usually reaches the goal\",\"Outcome success frequency\",\"Correct process, safe behaviour, or evidence that the result was verified\"],[\"The agent follows the intended process\",\"Trajectory quality under the evaluated rubric\",\"That the external environment actually accepted the final outcome\"],[\"The agent avoids unsafe actions in a test set\",\"Performance on represented safety cases\",\"Safety under every novel ambiguity, injection, or side effect\"]]},\"tunes\":{}},{\"id\":\"h-ladder\",\"type\":\"header\",\"data\":{\"text\":\"The Computer-Use Reliability Ladder\",\"level\":2},\"tunes\":{}},{\"id\":\"p-ladder-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A useful way to evaluate computer-use systems is to move from one-off capability toward progressively harder reliability properties. Higher levels assume the lower levels but do not follow automatically from them.\"},\"tunes\":{}},{\"id\":\"ladder-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Computer-Use Reliability Ladder\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Capability\",\"description\":\"Can the agent complete the task at least once under known conditions?\"},{\"label\":\"2. Repeatability\",\"description\":\"Can it complete the same task consistently across repeated trials?\"},{\"label\":\"3. Environmental robustness\",\"description\":\"Does it survive timing changes, network issues, pop-ups, UI variation, and small environmental perturbations?\"},{\"label\":\"4. Long-horizon control\",\"description\":\"Can it preserve goals, constraints, and progress across many steps, applications, and delayed events?\"},{\"label\":\"5. State awareness\",\"description\":\"Can it detect when the environment changed, when hidden state matters, or when an assumption is no longer valid?\"},{\"label\":\"6. Outcome verification\",\"description\":\"Does it verify that the intended result actually happened instead of trusting its own action sequence?\"},{\"label\":\"7. Safe goal handling\",\"description\":\"Can it stop, ask, refuse, or hand control back when the goal is ambiguous, infeasible, contradictory, or high impact?\"}]},\"tunes\":{}},{\"id\":\"h-capability\",\"type\":\"header\",\"data\":{\"text\":\"Level 1 — Capability: the demo question\",\"level\":3},\"tunes\":{}},{\"id\":\"p-capability-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Capability asks whether an agent can perform the task at all. This is valuable. Computer-use systems have advanced rapidly, and modern agents can complete workflows that older systems could not execute reliably.\"},\"tunes\":{}},{\"id\":\"p-capability-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"But capability is a weak deployment criterion. One successful run does not tell you whether the agent succeeds 95% of the time or 30% of the time, whether failures are harmless or destructive, or whether success depends on a lucky page state.\"},\"tunes\":{}},{\"id\":\"h-repeatability\",\"type\":\"header\",\"data\":{\"text\":\"Level 2 — Repeatability: does the same task stay solved?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-repeat-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use trajectories are stochastic. Model outputs vary, pages load at different speeds, visual states change, and long workflows create many branching opportunities. A production test should therefore run the same task multiple times rather than treating one passing trace as representative.\"},\"tunes\":{}},{\"id\":\"p-repeat-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Measure not only the average success rate but also the distribution of failure modes: wrong click, premature termination, missed confirmation, incorrect field, duplicate action, navigation loop, stale-state assumption, and false success report.\"},\"tunes\":{}},{\"id\":\"h-robustness\",\"type\":\"header\",\"data\":{\"text\":\"Level 3 — Environmental robustness: what happens when the web behaves like the web?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-robust-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Real websites are not benchmark fixtures. Requests fail, elements load late, sessions expire, pages change, consent banners appear, servers return errors, and network conditions fluctuate.\"},\"tunes\":{}},{\"id\":\"p-robust-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"WAREX evaluates this gap by injecting realistic web unreliability into existing benchmark environments and reports significant drops in task success. This is a critical production insight: a benchmark can measure task competence while under-measuring recovery from environmental instability.\"},\"tunes\":{}},{\"id\":\"robust-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"Reliability test\",\"body\":\"Inject delays, transient HTTP failures, stale page state, modal dialogs, session expiration, duplicate responses, and controlled UI variation. If the agent only works on the clean path, it is a demo-capable system, not a production-reliable one.\"},\"tunes\":{}},{\"id\":\"h-long\",\"type\":\"header\",\"data\":{\"text\":\"Level 4 — Long-horizon control: success changes when the task becomes real work\",\"level\":3},\"tunes\":{}},{\"id\":\"p-long-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Short tasks hide a class of failures that appear only after dozens or hundreds of actions: forgotten constraints, duplicated work, premature completion, missed state changes, cross-application inconsistencies, and accumulated small errors.\"},\"tunes\":{}},{\"id\":\"p-long-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OSWorld 2.0 was designed specifically around long-horizon real-world workflows. Its tasks take human users a median of roughly 1.6 hours and require many more tool calls than earlier computer-use benchmarks. Under its primary completion metric, even the strongest evaluated systems remain far from complete task reliability.\"},\"tunes\":{}},{\"id\":\"p-long-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"WeaveBench reaches a similar conclusion from another angle. It evaluates hybrid GUI, CLI and code workflows and reports that the best evaluated model-runtime pairing passes only 41.2% of tasks. The important result is not one leaderboard number; it is that realistic cross-interface orchestration exposes failures hidden by simpler single-interface tasks.\"},\"tunes\":{}},{\"id\":\"h-state\",\"type\":\"header\",\"data\":{\"text\":\"Level 5 — State awareness: the environment can change underneath the plan\",\"level\":3},\"tunes\":{}},{\"id\":\"p-state-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running tasks often depend on hidden or changing state: an email arrives, a calendar changes, a form is submitted, a background process finishes, a browser session expires, a user modifies a file, or an external system changes availability.\"},\"tunes\":{}},{\"id\":\"p-state-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Microsoft's SentinelBench argues that many long-running tasks should not be solved through continuous action at all. The correct behaviour may be to monitor, wait for an external event, then act when the state changes. This is a different capability from clicking faster or planning more steps.\"},\"tunes\":{}},{\"id\":\"p-state-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"A reliable computer-use agent therefore needs to distinguish actionable now, waiting for state, state changed, and assumption invalidated.\"},\"tunes\":{}},{\"id\":\"h-verify\",\"type\":\"header\",\"data\":{\"text\":\"Level 6 — Outcome verification: did the action actually work?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-verify-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An agent can execute an apparently correct sequence and still fail the task. A button click may not register. A form may reject hidden validation. A file may save to the wrong directory. A purchase may remain unconfirmed. A site may display a success-looking screen while the underlying operation failed.\"},\"tunes\":{}},{\"id\":\"p-verify-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current computer-use guidance explicitly recommends bounding and verifying the run instead of relying only on the model's final answer. Microsoft Research's work on computer-use verifiers reaches the same conclusion from evaluation: process and outcome need to be judged separately.\"},\"tunes\":{}},{\"id\":\"p-verify-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The Universal Verifier research reports that earlier verifier setups can produce high false-positive rates, while stronger rubric design and explicit separation of process, outcome, controllable failures, and uncontrollable failures substantially improve agreement with human labels.\"},\"tunes\":{}},{\"id\":\"h-safe-goal\",\"type\":\"header\",\"data\":{\"text\":\"Level 7 — Safe goal handling: the agent must know when not to continue\",\"level\":3},\"tunes\":{}},{\"id\":\"p-safe-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents are optimized to complete goals, but goal persistence can itself become a failure mode. An ambiguous request, impossible condition, contradictory instruction, suspicious webpage, or changed environment may require clarification or stopping rather than more action.\"},\"tunes\":{}},{\"id\":\"p-safe-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The BLIND-ACT benchmark studies this problem as Blind Goal-Directedness. Across the systems evaluated in that work, agents frequently continued pursuing tasks despite ambiguity, infeasibility, conflicting context, or other reasons to reconsider. The authors identify patterns such as execution-first bias and request primacy.\"},\"tunes\":{}},{\"id\":\"p-safe-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"This failure class matters because a highly capable agent can make a bad situation worse faster. Reliability therefore includes a policy for when not to act.\"},\"tunes\":{}},{\"id\":\"h-stress\",\"type\":\"header\",\"data\":{\"text\":\"The Demo-to-Production Stress Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-stress-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Before deploying a computer-use workflow, take the successful demo and systematically remove the assumptions that made it easy.\"},\"tunes\":{}},{\"id\":\"stress-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Demo-to-Production Stress Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Re-run the clean task\",\"description\":\"Establish repeatability over multiple trials before adding complexity.\"},{\"label\":\"2. Perturb the environment\",\"description\":\"Add latency, retries, pop-ups, page variation, stale sessions and temporary failures.\"},{\"label\":\"3. Extend the horizon\",\"description\":\"Turn the short demo into the full real workflow with intermediate state, multiple applications and delayed steps.\"},{\"label\":\"4. Change hidden state\",\"description\":\"Modify account, file, task or external state after the agent has formed a plan and test whether it detects the change.\"},{\"label\":\"5. Inject ambiguity\",\"description\":\"Remove one important assumption and test whether the agent asks instead of guessing.\"},{\"label\":\"6. Inject a controlled contradiction\",\"description\":\"Present old and new state together and verify that authoritative current state wins.\"},{\"label\":\"7. Require outcome proof\",\"description\":\"Make task completion depend on verifiable final state, not the model's self-report.\"},{\"label\":\"8. Test consequential boundaries\",\"description\":\"Confirm that irreversible or sensitive actions trigger the expected approval, refusal or handoff.\"},{\"label\":\"9. Repeat after harness or model changes\",\"description\":\"Treat runtime upgrades as reliability changes that need regression testing.\"}]},\"tunes\":{}},{\"id\":\"h-benchmark-boundary\",\"type\":\"header\",\"data\":{\"text\":\"Benchmark success has a validity boundary\",\"level\":2},\"tunes\":{}},{\"id\":\"p-boundary-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A benchmark score is a conditional statement. It is valid for a particular model, harness, environment, task set, judge, tool interface, step budget, retry policy, date and evaluation method.\"},\"tunes\":{}},{\"id\":\"p-boundary-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The number becomes misleading when those conditions disappear from the claim. “Agent X scores 80%” is weaker than “Agent X scored 80% on benchmark Y under environment Z with judge J and step budget N.” The second statement preserves the boundary that tells you whether the number transfers to your application.\"},\"tunes\":{}},{\"id\":\"ref-avb\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\",\"title\":\"The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers\",\"excerpt\":\"A framework for making explicit the conditions under which an AI claim remains valid and what changes require restriction, recalculation, or abandonment.\",\"ctaLabel\":\"Read the Answer Validity Boundary\"},\"tunes\":{}},{\"id\":\"h-process-outcome\",\"type\":\"header\",\"data\":{\"text\":\"Process success and outcome success must be scored separately\",\"level\":2},\"tunes\":{}},{\"id\":\"process-outcome-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Four possible outcomes of one computer-use run\",\"layout\":\"table\",\"columns\":[{\"id\":\"process\",\"label\":\"Process\"},{\"id\":\"outcome\",\"label\":\"Outcome\"},{\"id\":\"interpretation\",\"label\":\"Interpretation\"}],\"rows\":[{\"id\":\"good-good\",\"label\":\"Correct process \u002F correct outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"bad-good\",\"label\":\"Wrong process \u002F correct outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"good-bad\",\"label\":\"Correct process \u002F wrong outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"bad-bad\",\"label\":\"Wrong process \u002F wrong outcome\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"p-process-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"WeaveBench reports that outcome-only grading can materially overestimate computer-use performance because an agent may produce an apparently successful artifact through a shortcut or fabricated evidence. The verifier must inspect the trajectory and deliverables, not merely the final claim.\"},\"tunes\":{}},{\"id\":\"h-distribution\",\"type\":\"header\",\"data\":{\"text\":\"Production reliability is a distribution, not a single pass rate\",\"level\":2},\"tunes\":{}},{\"id\":\"p-dist-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A useful production evaluation samples the dimensions that actually vary in your environment. For a browser workflow, that might include account age, locale, viewport, page version, network quality, authentication state, existing cart state, cookies, pop-ups, user permissions and whether a human interrupts the run.\"},\"tunes\":{}},{\"id\":\"distribution-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Dimension\",\"Example variation\",\"Why it matters\"],[\"Environment\",\"Fast vs slow network, transient failures, page timing\",\"Tests recovery and waiting behaviour\"],[\"UI\",\"Different viewport, modal, reordered element, minor redesign\",\"Tests brittle visual\u002Faction assumptions\"],[\"State\",\"Logged in\u002Fout, empty\u002Fnon-empty cart, existing file, changed permissions\",\"Tests hidden-state reasoning\"],[\"Task horizon\",\"5 steps vs 50+ steps, one app vs several apps\",\"Tests accumulated trajectory error\"],[\"Ambiguity\",\"Missing preference or incomplete user instruction\",\"Tests whether the agent asks instead of guesses\"],[\"Consequence\",\"Read-only vs purchase\u002Fsend\u002Fdelete\u002Fchange\",\"Tests confirmation and authorization controls\"],[\"Adversarial content\",\"Prompt injection or misleading page text\",\"Tests instruction hierarchy and containment\"],[\"Model \u002F harness version\",\"Runtime upgrade\",\"Tests regression from system-level changes\"]]},\"tunes\":{}},{\"id\":\"h-budget\",\"type\":\"header\",\"data\":{\"text\":\"Reliability needs a failure budget, not perfection\",\"level\":2},\"tunes\":{}},{\"id\":\"p-budget-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"No production system is perfectly reliable. The useful engineering question is which failures are acceptable, detectable and recoverable. A failed attempt to sort a local folder is not equivalent to sending the wrong email, purchasing the wrong product or changing an account setting.\"},\"tunes\":{}},{\"id\":\"p-budget-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Classify actions by consequence and reversibility. Low-impact reversible actions can tolerate more autonomy. High-impact, externally visible or hard-to-reverse actions need stronger confirmation, state verification, authorization and post-action checks.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A practical computer-use reliability matrix\",\"level\":2},\"tunes\":{}},{\"id\":\"control-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Action class\",\"Example\",\"Recommended control\"],[\"Read \u002F inspect\",\"Open pages, read files, gather information\",\"Bound scope, log sources, tolerate recoverable navigation errors\"],[\"Reversible local change\",\"Edit draft file, reorganize temporary workspace\",\"Checkpoint or version before change; verify result\"],[\"External communication\",\"Send email, publish content, submit form\",\"User confirmation or explicit delegated authority; verify accepted state\"],[\"Financial \u002F transactional\",\"Purchase, checkout, paid subscription\",\"Strict mandate, amount\u002Fmerchant constraints, final confirmation and receipt verification\"],[\"Destructive \u002F privilege-changing\",\"Delete data, change permissions, revoke access\",\"Narrow authorization, explicit confirmation, reversible path where possible, post-action audit\"]]},\"tunes\":{}},{\"id\":\"h-log\",\"type\":\"header\",\"data\":{\"text\":\"What to log for a computer-use failure\",\"level\":2},\"tunes\":{}},{\"id\":\"log-list\",\"type\":\"list\",\"data\":{\"style\":\"unordered\",\"meta\":{},\"items\":[\"User goal and explicit constraints.\",\"Model and harness version.\",\"Environment and application versions.\",\"Screenshots or structured observations relevant to the failure.\",\"Actions taken with timestamps.\",\"Tool, click, keyboard and navigation results.\",\"State transitions and waiting periods.\",\"Approval, refusal or handoff events.\",\"External errors and network failures.\",\"Final observable environment state.\",\"The agent's reported outcome.\",\"Verifier result and whether the failure was controllable by the agent.\"]},\"tunes\":{}},{\"id\":\"p-log-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The crucial comparison is between reported success and observable success. A system that cannot distinguish those two will eventually accumulate false positives in production.\"},\"tunes\":{}},{\"id\":\"ref-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"A broader reliability model for evaluating agent trajectories, tool use and intermediate decisions instead of accepting the final answer as proof that the system worked correctly.\",\"ctaLabel\":\"Read the agent reliability article\"},\"tunes\":{}},{\"id\":\"h-security\",\"type\":\"header\",\"data\":{\"text\":\"Security is part of reliability for computer-use agents\",\"level\":2},\"tunes\":{}},{\"id\":\"p-sec-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents do not merely read untrusted content; they can act after reading it. That turns prompt injection, malicious page content and phishing into execution-path risks.\"},\"tunes\":{}},{\"id\":\"p-sec-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current computer-use guidance recommends isolating the environment, allow-listing sites and actions, treating screen content as untrusted, confirming consequential actions, bounding the run and verifying the actual outcome. ChatGPT agent similarly uses confirmations, prompt-injection monitoring and supervised modes for sensitive contexts.\"},\"tunes\":{}},{\"id\":\"p-sec-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The architecture principle is broader than any one provider: content observed by the agent must not be allowed to redefine the user's authority. A webpage can provide data. It cannot grant permission to send data elsewhere, purchase something, change credentials or override the task boundary.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The reliability gap would narrow if computer-use models became robust to long horizons, dynamic state, UI variation, environmental failures and ambiguous goals across representative production distributions. Better native state APIs, standardized machine-readable interfaces and stronger verifier infrastructure could also reduce the amount of fragile GUI interaction required.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The deployment threshold also changes with task consequence. A 70% success rate can be useful for a supervised low-risk research task and unacceptable for an autonomous financial or destructive workflow. Reliability must therefore be evaluated against the cost of each failure class, not one universal pass-rate threshold.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The cited benchmarks evaluate different environments and should not be ranked against one another as if they measured the same thing. WAREX stresses web unreliability; WeaveBench targets hybrid long-horizon work; OSWorld 2.0 targets realistic long workflows; BLIND-ACT focuses on goal handling under ambiguity and infeasibility.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Benchmark results also age quickly. Model, harness and verifier improvements can materially change scores within months. The durable lesson is therefore the evaluation method: vary conditions, separate process from outcome, verify external state, and preserve the boundary around each performance claim.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents are already capable enough to be useful. That is exactly why the evaluation question has changed. The challenge is no longer only whether an agent can click through a workflow. It is whether the system remains dependable when the clean demo conditions disappear.\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Treat one successful run as evidence of capability. Then test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification and safe goal handling. A production computer-use agent is not the one that can complete the demo. It is the one whose failure boundaries are known, measured and controlled.\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Computer-use agent reliability\",\"items\":[{\"id\":\"faq1\",\"question\":\"Does a successful computer-use agent demo prove production reliability?\",\"answer\":\"No. It proves capability under one observed trajectory. Production reliability requires repeated success across environmental variation, long-running tasks, changing state, ambiguity, recovery conditions and consequential actions.\"},{\"id\":\"faq2\",\"question\":\"Why can computer-use benchmarks look much better than real-world performance?\",\"answer\":\"Benchmarks can use more controlled environments, shorter tasks, stable network conditions, simpler application combinations or outcome criteria that do not capture all process failures. The exact validity boundary depends on each benchmark.\"},{\"id\":\"faq3\",\"question\":\"What is the most important reliability check after a computer-use action?\",\"answer\":\"Verify the actual external outcome. Do not treat the agent's final statement or intended click sequence as proof that the target system accepted the operation.\"},{\"id\":\"faq4\",\"question\":\"Why do long-horizon computer tasks remain difficult?\",\"answer\":\"Errors accumulate across many actions, constraints are forgotten, external state changes, work spans multiple applications, hidden state matters, and the agent must decide when to wait, ask, verify or recover rather than simply continue acting.\"},{\"id\":\"faq5\",\"question\":\"How should I test a browser or desktop agent before deployment?\",\"answer\":\"Repeat clean tasks, inject realistic environmental failures, vary UI and state, extend the workflow horizon, introduce ambiguity, require observable outcome proof, test high-impact action controls and rerun the suite after model or harness changes.\"},{\"id\":\"faq6\",\"question\":\"Should computer-use agents always require human confirmation?\",\"answer\":\"Not for every low-risk action. Confirmation requirements should scale with consequence, reversibility, authority and uncertainty. High-impact, externally visible or difficult-to-reverse actions need stronger controls.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key reliability terms\",\"entries\":[{\"term\":\"Computer-use agent\",\"definition\":\"An AI agent that interacts with graphical user interfaces or computer environments through observations and actions such as clicking, typing, scrolling, file operations or cross-application workflows.\",\"anchor\":\"computer-use-agent\"},{\"term\":\"Repeatability\",\"definition\":\"The degree to which an agent can complete the same task consistently across repeated runs rather than succeeding only on selected trajectories.\",\"anchor\":\"repeatability\"},{\"term\":\"Environmental robustness\",\"definition\":\"The ability to preserve correct behaviour despite realistic variation such as latency, transient errors, UI changes, session state and unexpected page conditions.\",\"anchor\":\"environmental-robustness\"},{\"term\":\"Outcome verification\",\"definition\":\"Checking the actual external state after an action to confirm that the intended result occurred instead of relying on the agent's self-report.\",\"anchor\":\"outcome-verification\"},{\"term\":\"Blind Goal-Directedness\",\"definition\":\"A failure pattern in which a computer-use agent continues pursuing a goal despite ambiguity, infeasibility, contradictory conditions or reasons to stop and reassess.\",\"anchor\":\"blind-goal-directedness\"},{\"term\":\"Reliability boundary\",\"definition\":\"The set of conditions under which an observed success rate or capability claim remains representative enough for a specific deployment decision.\",\"anchor\":\"reliability-boundary\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-computer\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use\",\"meta\":{\"title\":\"OpenAI — Computer use\",\"description\":\"Current developer guidance on isolating environments, treating screen content as untrusted, confirming consequential actions, bounding runs and verifying outcomes.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-openai-safety\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F\",\"meta\":{\"title\":\"OpenAI — Running Codex safely at OpenAI\",\"description\":\"Current production guidance on technical boundaries, human approval, telemetry and control for agents that act on real systems.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-warex\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F\",\"meta\":{\"title\":\"Microsoft Research — WAREX\",\"description\":\"2026 evaluation showing that realistic web unreliability causes significant drops in browser-agent task success on existing benchmarks.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-verifier\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F\",\"meta\":{\"title\":\"Microsoft Research — The Art of Building Verifiers for Computer Use Agents\",\"description\":\"2026 work on process versus outcome evaluation, controllable versus uncontrollable failures and reliable trajectory verification.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-weavebench\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F\",\"meta\":{\"title\":\"Microsoft Research — WeaveBench\",\"description\":\"2026 long-horizon benchmark combining GUI, CLI and code workflows and showing a substantial gap between current agents and reliable real-world completion.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-osworld2\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537\",\"meta\":{\"title\":\"OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks\",\"description\":\"2026 benchmark focused on realistic long-horizon computer-use workflows, hidden state and cross-source reasoning.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-sentinel\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F\",\"meta\":{\"title\":\"Microsoft Research — SentinelBench\",\"description\":\"2026 benchmark for time-evolving tasks where agents must monitor environments and respond to state changes rather than continuously act.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-blind\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F\",\"meta\":{\"title\":\"Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness\",\"description\":\"ICLR 2026 research on agents continuing to pursue ambiguous, contradictory or infeasible goals.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":979,"blocks":980,"version":1563},1790352872794,[981,985,989,994,999,1004,1008,1012,1016,1020,1024,1052,1056,1060,1086,1090,1094,1098,1102,1106,1110,1114,1118,1122,1127,1131,1135,1139,1143,1147,1151,1155,1159,1163,1167,1171,1175,1179,1183,1187,1191,1195,1199,1231,1235,1239,1243,1250,1254,1278,1282,1286,1290,1330,1334,1338,1342,1346,1374,1378,1395,1399,1406,1410,1414,1418,1422,1426,1430,1434,1438,1442,1446,1450,1454,1458,1461,1484,1488,1511,1515,1521,1527,1533,1539,1545,1551,1557],{"id":215,"data":982,"type":220,"tunes":984},{"title":983,"maxLevel":218,"minLevel":219},"Contents",{},{"id":223,"data":986,"type":226,"tunes":988},{"text":987},"Computer-use agents can now click, type, browse, edit files, operate desktop applications, and complete impressive multi-step tasks. That makes successful demos easy to understand and easy to overinterpret. A single completed workflow shows that the agent can succeed under those conditions. It does not show how often it succeeds, how it behaves when the environment changes, whether it verifies the result, or how safely it acts when the goal becomes ambiguous.",{},{"id":229,"data":990,"type":234,"tunes":993},{"body":991,"title":992,"variant":233},"\u003Cstrong>A successful computer-use demo proves capability, not reliability.\u003C\u002Fstrong> Production reliability requires the agent to succeed repeatedly across environmental variation, recover from transient failures, preserve constraints over long horizons, detect hidden or changing state, verify the actual outcome, and stop or ask when the goal becomes ambiguous or unsafe. The correct production question is not “Can the agent do this task?” but “Under which conditions can we trust it to do this task repeatedly?”","Direct answer",{},{"id":237,"data":995,"type":234,"tunes":998},{"body":996,"title":997,"variant":241},"This article reflects computer-use agent research and platform guidance available on \u003Cstrong>25 September 2026\u003C\u002Fstrong>. Benchmark results are not directly comparable across different task sets, environments, models, step limits, judges, or harnesses. Treat every benchmark number together with its evaluation conditions.","Fast-moving field",{},{"id":244,"data":1000,"type":234,"tunes":1003},{"body":1001,"title":1002,"variant":248},"The Computer-Use Reliability Ladder and Demo-to-Production Stress Test below are practical evaluation models proposed here. They are not formal industry standards.","The model used in this article",{},{"id":251,"data":1005,"type":42,"tunes":1007},{"text":1006,"level":219},"Why the demo is the easiest possible reliability test",{},{"id":256,"data":1009,"type":226,"tunes":1011},{"text":1010},"A demo normally shows one trajectory that worked. The environment is known, the task is selected in advance, the operator can restart after a failure, and the audience sees the successful path. Production systems face a distribution instead: different pages, network conditions, account states, pop-ups, latency, UI changes, hidden state, permissions, interruptions, and users who describe goals imperfectly.",{},{"id":261,"data":1013,"type":226,"tunes":1015},{"text":1014},"That distinction matters because computer-use agents operate through interfaces designed for humans rather than deterministic APIs. Their action loop depends on perception, state interpretation, planning, interaction timing, and environment response. Small changes can alter the trajectory even when the user goal is unchanged.",{},{"id":266,"data":1017,"type":226,"tunes":1019},{"text":1018},"Microsoft Research's WAREX work makes the problem explicit: benchmark agents that look capable in controlled settings lose substantial task success when realistic web instability is introduced. The failure is not necessarily “the model became less intelligent.” The environment stopped being deterministic.",{},{"id":271,"data":1021,"type":42,"tunes":1023},{"text":1022,"level":219},"Capability, success rate, reliability, and safety are different claims",{},{"id":276,"data":1025,"type":303,"tunes":1051},{"content":1026,"stretched":43,"withHeadings":14},[1027,1031,1035,1039,1043,1047],[1028,1029,1030],"Claim","What it actually establishes","What it does not establish",[1032,1033,1034],"The agent completed the task once","Capability under one observed trajectory","Repeatability, robustness, safety, or generalization",[1036,1037,1038],"The agent scores highly on a benchmark","Performance under that benchmark's task and evaluation conditions","Equivalent production performance on different environments",[1040,1041,1042],"The agent usually reaches the goal","Outcome success frequency","Correct process, safe behaviour, or evidence that the result was verified",[1044,1045,1046],"The agent follows the intended process","Trajectory quality under the evaluated rubric","That the external environment actually accepted the final outcome",[1048,1049,1050],"The agent avoids unsafe actions in a test set","Performance on represented safety cases","Safety under every novel ambiguity, injection, or side effect",{},{"id":306,"data":1053,"type":42,"tunes":1055},{"text":1054,"level":219},"The Computer-Use Reliability Ladder",{},{"id":311,"data":1057,"type":226,"tunes":1059},{"text":1058},"A useful way to evaluate computer-use systems is to move from one-off capability toward progressively harder reliability properties. Higher levels assume the lower levels but do not follow automatically from them.",{},{"id":316,"data":1061,"type":342,"tunes":1085},{"steps":1062,"title":1084,"orientation":341},[1063,1066,1069,1072,1075,1078,1081],{"label":1064,"description":1065},"1. Capability","Can the agent complete the task at least once under known conditions?",{"label":1067,"description":1068},"2. Repeatability","Can it complete the same task consistently across repeated trials?",{"label":1070,"description":1071},"3. Environmental robustness","Does it survive timing changes, network issues, pop-ups, UI variation, and small environmental perturbations?",{"label":1073,"description":1074},"4. Long-horizon control","Can it preserve goals, constraints, and progress across many steps, applications, and delayed events?",{"label":1076,"description":1077},"5. State awareness","Can it detect when the environment changed, when hidden state matters, or when an assumption is no longer valid?",{"label":1079,"description":1080},"6. Outcome verification","Does it verify that the intended result actually happened instead of trusting its own action sequence?",{"label":1082,"description":1083},"7. Safe goal handling","Can it stop, ask, refuse, or hand control back when the goal is ambiguous, infeasible, contradictory, or high impact?","Computer-Use Reliability Ladder",{},{"id":345,"data":1087,"type":42,"tunes":1089},{"text":1088,"level":218},"Level 1 — Capability: the demo question",{},{"id":350,"data":1091,"type":226,"tunes":1093},{"text":1092},"Capability asks whether an agent can perform the task at all. This is valuable. Computer-use systems have advanced rapidly, and modern agents can complete workflows that older systems could not execute reliably.",{},{"id":355,"data":1095,"type":226,"tunes":1097},{"text":1096},"But capability is a weak deployment criterion. One successful run does not tell you whether the agent succeeds 95% of the time or 30% of the time, whether failures are harmless or destructive, or whether success depends on a lucky page state.",{},{"id":360,"data":1099,"type":42,"tunes":1101},{"text":1100,"level":218},"Level 2 — Repeatability: does the same task stay solved?",{},{"id":365,"data":1103,"type":226,"tunes":1105},{"text":1104},"Computer-use trajectories are stochastic. Model outputs vary, pages load at different speeds, visual states change, and long workflows create many branching opportunities. A production test should therefore run the same task multiple times rather than treating one passing trace as representative.",{},{"id":370,"data":1107,"type":226,"tunes":1109},{"text":1108},"Measure not only the average success rate but also the distribution of failure modes: wrong click, premature termination, missed confirmation, incorrect field, duplicate action, navigation loop, stale-state assumption, and false success report.",{},{"id":375,"data":1111,"type":42,"tunes":1113},{"text":1112,"level":218},"Level 3 — Environmental robustness: what happens when the web behaves like the web?",{},{"id":380,"data":1115,"type":226,"tunes":1117},{"text":1116},"Real websites are not benchmark fixtures. Requests fail, elements load late, sessions expire, pages change, consent banners appear, servers return errors, and network conditions fluctuate.",{},{"id":385,"data":1119,"type":226,"tunes":1121},{"text":1120},"WAREX evaluates this gap by injecting realistic web unreliability into existing benchmark environments and reports significant drops in task success. This is a critical production insight: a benchmark can measure task competence while under-measuring recovery from environmental instability.",{},{"id":390,"data":1123,"type":234,"tunes":1126},{"body":1124,"title":1125,"variant":394},"Inject delays, transient HTTP failures, stale page state, modal dialogs, session expiration, duplicate responses, and controlled UI variation. If the agent only works on the clean path, it is a demo-capable system, not a production-reliable one.","Reliability test",{},{"id":397,"data":1128,"type":42,"tunes":1130},{"text":1129,"level":218},"Level 4 — Long-horizon control: success changes when the task becomes real work",{},{"id":402,"data":1132,"type":226,"tunes":1134},{"text":1133},"Short tasks hide a class of failures that appear only after dozens or hundreds of actions: forgotten constraints, duplicated work, premature completion, missed state changes, cross-application inconsistencies, and accumulated small errors.",{},{"id":407,"data":1136,"type":226,"tunes":1138},{"text":1137},"OSWorld 2.0 was designed specifically around long-horizon real-world workflows. Its tasks take human users a median of roughly 1.6 hours and require many more tool calls than earlier computer-use benchmarks. Under its primary completion metric, even the strongest evaluated systems remain far from complete task reliability.",{},{"id":412,"data":1140,"type":226,"tunes":1142},{"text":1141},"WeaveBench reaches a similar conclusion from another angle. It evaluates hybrid GUI, CLI and code workflows and reports that the best evaluated model-runtime pairing passes only 41.2% of tasks. The important result is not one leaderboard number; it is that realistic cross-interface orchestration exposes failures hidden by simpler single-interface tasks.",{},{"id":417,"data":1144,"type":42,"tunes":1146},{"text":1145,"level":218},"Level 5 — State awareness: the environment can change underneath the plan",{},{"id":422,"data":1148,"type":226,"tunes":1150},{"text":1149},"Long-running tasks often depend on hidden or changing state: an email arrives, a calendar changes, a form is submitted, a background process finishes, a browser session expires, a user modifies a file, or an external system changes availability.",{},{"id":427,"data":1152,"type":226,"tunes":1154},{"text":1153},"Microsoft's SentinelBench argues that many long-running tasks should not be solved through continuous action at all. The correct behaviour may be to monitor, wait for an external event, then act when the state changes. This is a different capability from clicking faster or planning more steps.",{},{"id":432,"data":1156,"type":226,"tunes":1158},{"text":1157},"A reliable computer-use agent therefore needs to distinguish actionable now, waiting for state, state changed, and assumption invalidated.",{},{"id":437,"data":1160,"type":42,"tunes":1162},{"text":1161,"level":218},"Level 6 — Outcome verification: did the action actually work?",{},{"id":442,"data":1164,"type":226,"tunes":1166},{"text":1165},"An agent can execute an apparently correct sequence and still fail the task. A button click may not register. A form may reject hidden validation. A file may save to the wrong directory. A purchase may remain unconfirmed. A site may display a success-looking screen while the underlying operation failed.",{},{"id":447,"data":1168,"type":226,"tunes":1170},{"text":1169},"OpenAI's current computer-use guidance explicitly recommends bounding and verifying the run instead of relying only on the model's final answer. Microsoft Research's work on computer-use verifiers reaches the same conclusion from evaluation: process and outcome need to be judged separately.",{},{"id":452,"data":1172,"type":226,"tunes":1174},{"text":1173},"The Universal Verifier research reports that earlier verifier setups can produce high false-positive rates, while stronger rubric design and explicit separation of process, outcome, controllable failures, and uncontrollable failures substantially improve agreement with human labels.",{},{"id":457,"data":1176,"type":42,"tunes":1178},{"text":1177,"level":218},"Level 7 — Safe goal handling: the agent must know when not to continue",{},{"id":462,"data":1180,"type":226,"tunes":1182},{"text":1181},"Computer-use agents are optimized to complete goals, but goal persistence can itself become a failure mode. An ambiguous request, impossible condition, contradictory instruction, suspicious webpage, or changed environment may require clarification or stopping rather than more action.",{},{"id":467,"data":1184,"type":226,"tunes":1186},{"text":1185},"The BLIND-ACT benchmark studies this problem as Blind Goal-Directedness. Across the systems evaluated in that work, agents frequently continued pursuing tasks despite ambiguity, infeasibility, conflicting context, or other reasons to reconsider. The authors identify patterns such as execution-first bias and request primacy.",{},{"id":472,"data":1188,"type":226,"tunes":1190},{"text":1189},"This failure class matters because a highly capable agent can make a bad situation worse faster. Reliability therefore includes a policy for when not to act.",{},{"id":477,"data":1192,"type":42,"tunes":1194},{"text":1193,"level":219},"The Demo-to-Production Stress Test",{},{"id":482,"data":1196,"type":226,"tunes":1198},{"text":1197},"Before deploying a computer-use workflow, take the successful demo and systematically remove the assumptions that made it easy.",{},{"id":487,"data":1200,"type":342,"tunes":1230},{"steps":1201,"title":1229,"orientation":341},[1202,1205,1208,1211,1214,1217,1220,1223,1226],{"label":1203,"description":1204},"1. Re-run the clean task","Establish repeatability over multiple trials before adding complexity.",{"label":1206,"description":1207},"2. Perturb the environment","Add latency, retries, pop-ups, page variation, stale sessions and temporary failures.",{"label":1209,"description":1210},"3. Extend the horizon","Turn the short demo into the full real workflow with intermediate state, multiple applications and delayed steps.",{"label":1212,"description":1213},"4. Change hidden state","Modify account, file, task or external state after the agent has formed a plan and test whether it detects the change.",{"label":1215,"description":1216},"5. Inject ambiguity","Remove one important assumption and test whether the agent asks instead of guessing.",{"label":1218,"description":1219},"6. Inject a controlled contradiction","Present old and new state together and verify that authoritative current state wins.",{"label":1221,"description":1222},"7. Require outcome proof","Make task completion depend on verifiable final state, not the model's self-report.",{"label":1224,"description":1225},"8. Test consequential boundaries","Confirm that irreversible or sensitive actions trigger the expected approval, refusal or handoff.",{"label":1227,"description":1228},"9. Repeat after harness or model changes","Treat runtime upgrades as reliability changes that need regression testing.","Demo-to-Production Stress Test",{},{"id":520,"data":1232,"type":42,"tunes":1234},{"text":1233,"level":219},"Benchmark success has a validity boundary",{},{"id":525,"data":1236,"type":226,"tunes":1238},{"text":1237},"A benchmark score is a conditional statement. It is valid for a particular model, harness, environment, task set, judge, tool interface, step budget, retry policy, date and evaluation method.",{},{"id":530,"data":1240,"type":226,"tunes":1242},{"text":1241},"The number becomes misleading when those conditions disappear from the claim. “Agent X scores 80%” is weaker than “Agent X scored 80% on benchmark Y under environment Z with judge J and step budget N.” The second statement preserves the boundary that tells you whether the number transfers to your application.",{},{"id":535,"data":1244,"type":541,"tunes":1249},{"url":1245,"title":1246,"excerpt":1247,"ctaLabel":1248},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers","A framework for making explicit the conditions under which an AI claim remains valid and what changes require restriction, recalculation, or abandonment.","Read the Answer Validity Boundary",{},{"id":544,"data":1251,"type":42,"tunes":1253},{"text":1252,"level":219},"Process success and outcome success must be scored separately",{},{"id":549,"data":1255,"type":580,"tunes":1277},{"rows":1256,"title":1269,"layout":303,"columns":1270},[1257,1260,1263,1266],{"id":553,"label":1258,"values":1259},"Correct process \u002F correct outcome",[556,556,556],{"id":558,"label":1261,"values":1262},"Wrong process \u002F correct outcome",[556,556,556],{"id":562,"label":1264,"values":1265},"Correct process \u002F wrong outcome",[556,556,556],{"id":566,"label":1267,"values":1268},"Wrong process \u002F wrong outcome",[556,556,556],"Four possible outcomes of one computer-use run",[1271,1273,1275],{"id":572,"label":1272},"Process",{"id":575,"label":1274},"Outcome",{"id":578,"label":1276},"Interpretation",{},{"id":583,"data":1279,"type":226,"tunes":1281},{"text":1280},"WeaveBench reports that outcome-only grading can materially overestimate computer-use performance because an agent may produce an apparently successful artifact through a shortcut or fabricated evidence. The verifier must inspect the trajectory and deliverables, not merely the final claim.",{},{"id":588,"data":1283,"type":42,"tunes":1285},{"text":1284,"level":219},"Production reliability is a distribution, not a single pass rate",{},{"id":593,"data":1287,"type":226,"tunes":1289},{"text":1288},"A useful production evaluation samples the dimensions that actually vary in your environment. For a browser workflow, that might include account age, locale, viewport, page version, network quality, authentication state, existing cart state, cookies, pop-ups, user permissions and whether a human interrupts the run.",{},{"id":598,"data":1291,"type":303,"tunes":1329},{"content":1292,"stretched":43,"withHeadings":14},[1293,1297,1301,1305,1309,1313,1317,1321,1325],[1294,1295,1296],"Dimension","Example variation","Why it matters",[1298,1299,1300],"Environment","Fast vs slow network, transient failures, page timing","Tests recovery and waiting behaviour",[1302,1303,1304],"UI","Different viewport, modal, reordered element, minor redesign","Tests brittle visual\u002Faction assumptions",[1306,1307,1308],"State","Logged in\u002Fout, empty\u002Fnon-empty cart, existing file, changed permissions","Tests hidden-state reasoning",[1310,1311,1312],"Task horizon","5 steps vs 50+ steps, one app vs several apps","Tests accumulated trajectory error",[1314,1315,1316],"Ambiguity","Missing preference or incomplete user instruction","Tests whether the agent asks instead of guesses",[1318,1319,1320],"Consequence","Read-only vs purchase\u002Fsend\u002Fdelete\u002Fchange","Tests confirmation and authorization controls",[1322,1323,1324],"Adversarial content","Prompt injection or misleading page text","Tests instruction hierarchy and containment",[1326,1327,1328],"Model \u002F harness version","Runtime upgrade","Tests regression from system-level changes",{},{"id":639,"data":1331,"type":42,"tunes":1333},{"text":1332,"level":219},"Reliability needs a failure budget, not perfection",{},{"id":644,"data":1335,"type":226,"tunes":1337},{"text":1336},"No production system is perfectly reliable. The useful engineering question is which failures are acceptable, detectable and recoverable. A failed attempt to sort a local folder is not equivalent to sending the wrong email, purchasing the wrong product or changing an account setting.",{},{"id":649,"data":1339,"type":226,"tunes":1341},{"text":1340},"Classify actions by consequence and reversibility. Low-impact reversible actions can tolerate more autonomy. High-impact, externally visible or hard-to-reverse actions need stronger confirmation, state verification, authorization and post-action checks.",{},{"id":654,"data":1343,"type":42,"tunes":1345},{"text":1344,"level":219},"A practical computer-use reliability matrix",{},{"id":659,"data":1347,"type":303,"tunes":1373},{"content":1348,"stretched":43,"withHeadings":14},[1349,1353,1357,1361,1365,1369],[1350,1351,1352],"Action class","Example","Recommended control",[1354,1355,1356],"Read \u002F inspect","Open pages, read files, gather information","Bound scope, log sources, tolerate recoverable navigation errors",[1358,1359,1360],"Reversible local change","Edit draft file, reorganize temporary workspace","Checkpoint or version before change; verify result",[1362,1363,1364],"External communication","Send email, publish content, submit form","User confirmation or explicit delegated authority; verify accepted state",[1366,1367,1368],"Financial \u002F transactional","Purchase, checkout, paid subscription","Strict mandate, amount\u002Fmerchant constraints, final confirmation and receipt verification",[1370,1371,1372],"Destructive \u002F privilege-changing","Delete data, change permissions, revoke access","Narrow authorization, explicit confirmation, reversible path where possible, post-action audit",{},{"id":688,"data":1375,"type":42,"tunes":1377},{"text":1376,"level":219},"What to log for a computer-use failure",{},{"id":693,"data":1379,"type":710,"tunes":1394},{"meta":1380,"items":1381,"style":709},{},[1382,1383,1384,1385,1386,1387,1388,1389,1390,1391,1392,1393],"User goal and explicit constraints.","Model and harness version.","Environment and application versions.","Screenshots or structured observations relevant to the failure.","Actions taken with timestamps.","Tool, click, keyboard and navigation results.","State transitions and waiting periods.","Approval, refusal or handoff events.","External errors and network failures.","Final observable environment state.","The agent's reported outcome.","Verifier result and whether the failure was controllable by the agent.",{},{"id":713,"data":1396,"type":226,"tunes":1398},{"text":1397},"The crucial comparison is between reported success and observable success. A system that cannot distinguish those two will eventually accumulate false positives in production.",{},{"id":718,"data":1400,"type":541,"tunes":1405},{"url":1401,"title":1402,"excerpt":1403,"ctaLabel":1404},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","A broader reliability model for evaluating agent trajectories, tool use and intermediate decisions instead of accepting the final answer as proof that the system worked correctly.","Read the agent reliability article",{},{"id":726,"data":1407,"type":42,"tunes":1409},{"text":1408,"level":219},"Security is part of reliability for computer-use agents",{},{"id":731,"data":1411,"type":226,"tunes":1413},{"text":1412},"Computer-use agents do not merely read untrusted content; they can act after reading it. That turns prompt injection, malicious page content and phishing into execution-path risks.",{},{"id":736,"data":1415,"type":226,"tunes":1417},{"text":1416},"OpenAI's current computer-use guidance recommends isolating the environment, allow-listing sites and actions, treating screen content as untrusted, confirming consequential actions, bounding the run and verifying the actual outcome. ChatGPT agent similarly uses confirmations, prompt-injection monitoring and supervised modes for sensitive contexts.",{},{"id":741,"data":1419,"type":226,"tunes":1421},{"text":1420},"The architecture principle is broader than any one provider: content observed by the agent must not be allowed to redefine the user's authority. A webpage can provide data. It cannot grant permission to send data elsewhere, purchase something, change credentials or override the task boundary.",{},{"id":746,"data":1423,"type":42,"tunes":1425},{"text":1424,"level":219},"What would change this answer?",{},{"id":751,"data":1427,"type":226,"tunes":1429},{"text":1428},"The reliability gap would narrow if computer-use models became robust to long horizons, dynamic state, UI variation, environmental failures and ambiguous goals across representative production distributions. Better native state APIs, standardized machine-readable interfaces and stronger verifier infrastructure could also reduce the amount of fragile GUI interaction required.",{},{"id":756,"data":1431,"type":226,"tunes":1433},{"text":1432},"The deployment threshold also changes with task consequence. A 70% success rate can be useful for a supervised low-risk research task and unacceptable for an autonomous financial or destructive workflow. Reliability must therefore be evaluated against the cost of each failure class, not one universal pass-rate threshold.",{},{"id":761,"data":1435,"type":42,"tunes":1437},{"text":1436,"level":219},"Limitations",{},{"id":766,"data":1439,"type":226,"tunes":1441},{"text":1440},"The cited benchmarks evaluate different environments and should not be ranked against one another as if they measured the same thing. WAREX stresses web unreliability; WeaveBench targets hybrid long-horizon work; OSWorld 2.0 targets realistic long workflows; BLIND-ACT focuses on goal handling under ambiguity and infeasibility.",{},{"id":771,"data":1443,"type":226,"tunes":1445},{"text":1444},"Benchmark results also age quickly. Model, harness and verifier improvements can materially change scores within months. The durable lesson is therefore the evaluation method: vary conditions, separate process from outcome, verify external state, and preserve the boundary around each performance claim.",{},{"id":776,"data":1447,"type":42,"tunes":1449},{"text":1448,"level":219},"Conclusion",{},{"id":781,"data":1451,"type":226,"tunes":1453},{"text":1452},"Computer-use agents are already capable enough to be useful. That is exactly why the evaluation question has changed. The challenge is no longer only whether an agent can click through a workflow. It is whether the system remains dependable when the clean demo conditions disappear.",{},{"id":786,"data":1455,"type":226,"tunes":1457},{"text":1456},"Treat one successful run as evidence of capability. Then test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification and safe goal handling. A production computer-use agent is not the one that can complete the demo. It is the one whose failure boundaries are known, measured and controlled.",{},{"id":791,"data":1459,"type":42,"tunes":1460},{"text":793,"level":219},{},{"id":796,"data":1462,"type":796,"tunes":1483},{"items":1463,"title":1482},[1464,1467,1470,1473,1476,1479],{"id":800,"answer":1465,"question":1466},"No. It proves capability under one observed trajectory. Production reliability requires repeated success across environmental variation, long-running tasks, changing state, ambiguity, recovery conditions and consequential actions.","Does a successful computer-use agent demo prove production reliability?",{"id":804,"answer":1468,"question":1469},"Benchmarks can use more controlled environments, shorter tasks, stable network conditions, simpler application combinations or outcome criteria that do not capture all process failures. The exact validity boundary depends on each benchmark.","Why can computer-use benchmarks look much better than real-world performance?",{"id":808,"answer":1471,"question":1472},"Verify the actual external outcome. Do not treat the agent's final statement or intended click sequence as proof that the target system accepted the operation.","What is the most important reliability check after a computer-use action?",{"id":812,"answer":1474,"question":1475},"Errors accumulate across many actions, constraints are forgotten, external state changes, work spans multiple applications, hidden state matters, and the agent must decide when to wait, ask, verify or recover rather than simply continue acting.","Why do long-horizon computer tasks remain difficult?",{"id":816,"answer":1477,"question":1478},"Repeat clean tasks, inject realistic environmental failures, vary UI and state, extend the workflow horizon, introduce ambiguity, require observable outcome proof, test high-impact action controls and rerun the suite after model or harness changes.","How should I test a browser or desktop agent before deployment?",{"id":820,"answer":1480,"question":1481},"Not for every low-risk action. Confirmation requirements should scale with consequence, reversibility, authority and uncertainty. High-impact, externally visible or difficult-to-reverse actions need stronger controls.","Should computer-use agents always require human confirmation?","Computer-use agent reliability",{},{"id":826,"data":1485,"type":42,"tunes":1487},{"text":1486,"level":219},"Glossary",{},{"id":831,"data":1489,"type":831,"tunes":1510},{"title":1490,"entries":1491},"Key reliability terms",[1492,1495,1498,1501,1504,1507],{"term":1493,"anchor":837,"definition":1494},"Computer-use agent","An AI agent that interacts with graphical user interfaces or computer environments through observations and actions such as clicking, typing, scrolling, file operations or cross-application workflows.",{"term":1496,"anchor":841,"definition":1497},"Repeatability","The degree to which an agent can complete the same task consistently across repeated runs rather than succeeding only on selected trajectories.",{"term":1499,"anchor":845,"definition":1500},"Environmental robustness","The ability to preserve correct behaviour despite realistic variation such as latency, transient errors, UI changes, session state and unexpected page conditions.",{"term":1502,"anchor":849,"definition":1503},"Outcome verification","Checking the actual external state after an action to confirm that the intended result occurred instead of relying on the agent's self-report.",{"term":1505,"anchor":853,"definition":1506},"Blind Goal-Directedness","A failure pattern in which a computer-use agent continues pursuing a goal despite ambiguity, infeasibility, contradictory conditions or reasons to stop and reassess.",{"term":1508,"anchor":857,"definition":1509},"Reliability boundary","The set of conditions under which an observed success rate or capability claim remains representative enough for a specific deployment decision.",{},{"id":861,"data":1512,"type":42,"tunes":1514},{"text":1513,"level":219},"Primary sources and further reading",{},{"id":866,"data":1516,"type":873,"tunes":1520},{"link":868,"meta":1517},{"image":1518,"title":871,"description":1519},{"url":556},"Current developer guidance on isolating environments, treating screen content as untrusted, confirming consequential actions, bounding runs and verifying outcomes.",{},{"id":876,"data":1522,"type":873,"tunes":1526},{"link":878,"meta":1523},{"image":1524,"title":881,"description":1525},{"url":556},"Current production guidance on technical boundaries, human approval, telemetry and control for agents that act on real systems.",{},{"id":885,"data":1528,"type":873,"tunes":1532},{"link":887,"meta":1529},{"image":1530,"title":890,"description":1531},{"url":556},"2026 evaluation showing that realistic web unreliability causes significant drops in browser-agent task success on existing benchmarks.",{},{"id":894,"data":1534,"type":873,"tunes":1538},{"link":896,"meta":1535},{"image":1536,"title":899,"description":1537},{"url":556},"2026 work on process versus outcome evaluation, controllable versus uncontrollable failures and reliable trajectory verification.",{},{"id":903,"data":1540,"type":873,"tunes":1544},{"link":905,"meta":1541},{"image":1542,"title":908,"description":1543},{"url":556},"2026 long-horizon benchmark combining GUI, CLI and code workflows and showing a substantial gap between current agents and reliable real-world completion.",{},{"id":912,"data":1546,"type":873,"tunes":1550},{"link":914,"meta":1547},{"image":1548,"title":917,"description":1549},{"url":556},"2026 benchmark focused on realistic long-horizon computer-use workflows, hidden state and cross-source reasoning.",{},{"id":921,"data":1552,"type":873,"tunes":1556},{"link":923,"meta":1553},{"image":1554,"title":926,"description":1555},{"url":556},"2026 benchmark for time-evolving tasks where agents must monitor environments and respond to state changes rather than continuously act.",{},{"id":930,"data":1558,"type":873,"tunes":1562},{"link":932,"meta":1559},{"image":1560,"title":935,"description":1561},{"url":556},"ICLR 2026 research on agents continuing to pursue ambiguous, contradictory or infeasible goals.",{},"2.31.6","Computer-use agents can now complete impressive browser and desktop workflows, but one successful run proves capability—not reliability. This article shows how to test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification, and safe goal handling.",{"lang":7,"title":208,"content":210,"contentJson":1566,"excerpt":939},{"time":212,"blocks":1567,"version":938},[1568,1571,1574,1577,1580,1583,1586,1589,1592,1595,1598,1608,1611,1614,1625,1628,1631,1634,1637,1640,1643,1646,1649,1652,1655,1658,1661,1664,1667,1670,1673,1676,1679,1682,1685,1688,1691,1694,1697,1700,1703,1706,1709,1722,1725,1728,1731,1734,1737,1753,1756,1759,1762,1775,1778,1781,1784,1787,1797,1800,1805,1808,1811,1814,1817,1820,1823,1826,1829,1832,1835,1838,1841,1844,1847,1850,1853,1863,1866,1876,1879,1884,1889,1894,1899,1904,1909,1914],{"id":215,"data":1569,"type":220,"tunes":1570},{"title":217,"maxLevel":218,"minLevel":219},{},{"id":223,"data":1572,"type":226,"tunes":1573},{"text":225},{},{"id":229,"data":1575,"type":234,"tunes":1576},{"body":231,"title":232,"variant":233},{},{"id":237,"data":1578,"type":234,"tunes":1579},{"body":239,"title":240,"variant":241},{},{"id":244,"data":1581,"type":234,"tunes":1582},{"body":246,"title":247,"variant":248},{},{"id":251,"data":1584,"type":42,"tunes":1585},{"text":253,"level":219},{},{"id":256,"data":1587,"type":226,"tunes":1588},{"text":258},{},{"id":261,"data":1590,"type":226,"tunes":1591},{"text":263},{},{"id":266,"data":1593,"type":226,"tunes":1594},{"text":268},{},{"id":271,"data":1596,"type":42,"tunes":1597},{"text":273,"level":219},{},{"id":276,"data":1599,"type":303,"tunes":1607},{"content":1600,"stretched":43,"withHeadings":14},[1601,1602,1603,1604,1605,1606],[280,281,282],[284,285,286],[288,289,290],[292,293,294],[296,297,298],[300,301,302],{},{"id":306,"data":1609,"type":42,"tunes":1610},{"text":308,"level":219},{},{"id":311,"data":1612,"type":226,"tunes":1613},{"text":313},{},{"id":316,"data":1615,"type":342,"tunes":1624},{"steps":1616,"title":340,"orientation":341},[1617,1618,1619,1620,1621,1622,1623],{"label":320,"description":321},{"label":323,"description":324},{"label":326,"description":327},{"label":329,"description":330},{"label":332,"description":333},{"label":335,"description":336},{"label":338,"description":339},{},{"id":345,"data":1626,"type":42,"tunes":1627},{"text":347,"level":218},{},{"id":350,"data":1629,"type":226,"tunes":1630},{"text":352},{},{"id":355,"data":1632,"type":226,"tunes":1633},{"text":357},{},{"id":360,"data":1635,"type":42,"tunes":1636},{"text":362,"level":218},{},{"id":365,"data":1638,"type":226,"tunes":1639},{"text":367},{},{"id":370,"data":1641,"type":226,"tunes":1642},{"text":372},{},{"id":375,"data":1644,"type":42,"tunes":1645},{"text":377,"level":218},{},{"id":380,"data":1647,"type":226,"tunes":1648},{"text":382},{},{"id":385,"data":1650,"type":226,"tunes":1651},{"text":387},{},{"id":390,"data":1653,"type":234,"tunes":1654},{"body":392,"title":393,"variant":394},{},{"id":397,"data":1656,"type":42,"tunes":1657},{"text":399,"level":218},{},{"id":402,"data":1659,"type":226,"tunes":1660},{"text":404},{},{"id":407,"data":1662,"type":226,"tunes":1663},{"text":409},{},{"id":412,"data":1665,"type":226,"tunes":1666},{"text":414},{},{"id":417,"data":1668,"type":42,"tunes":1669},{"text":419,"level":218},{},{"id":422,"data":1671,"type":226,"tunes":1672},{"text":424},{},{"id":427,"data":1674,"type":226,"tunes":1675},{"text":429},{},{"id":432,"data":1677,"type":226,"tunes":1678},{"text":434},{},{"id":437,"data":1680,"type":42,"tunes":1681},{"text":439,"level":218},{},{"id":442,"data":1683,"type":226,"tunes":1684},{"text":444},{},{"id":447,"data":1686,"type":226,"tunes":1687},{"text":449},{},{"id":452,"data":1689,"type":226,"tunes":1690},{"text":454},{},{"id":457,"data":1692,"type":42,"tunes":1693},{"text":459,"level":218},{},{"id":462,"data":1695,"type":226,"tunes":1696},{"text":464},{},{"id":467,"data":1698,"type":226,"tunes":1699},{"text":469},{},{"id":472,"data":1701,"type":226,"tunes":1702},{"text":474},{},{"id":477,"data":1704,"type":42,"tunes":1705},{"text":479,"level":219},{},{"id":482,"data":1707,"type":226,"tunes":1708},{"text":484},{},{"id":487,"data":1710,"type":342,"tunes":1721},{"steps":1711,"title":517,"orientation":341},[1712,1713,1714,1715,1716,1717,1718,1719,1720],{"label":491,"description":492},{"label":494,"description":495},{"label":497,"description":498},{"label":500,"description":501},{"label":503,"description":504},{"label":506,"description":507},{"label":509,"description":510},{"label":512,"description":513},{"label":515,"description":516},{},{"id":520,"data":1723,"type":42,"tunes":1724},{"text":522,"level":219},{},{"id":525,"data":1726,"type":226,"tunes":1727},{"text":527},{},{"id":530,"data":1729,"type":226,"tunes":1730},{"text":532},{},{"id":535,"data":1732,"type":541,"tunes":1733},{"url":537,"title":538,"excerpt":539,"ctaLabel":540},{},{"id":544,"data":1735,"type":42,"tunes":1736},{"text":546,"level":219},{},{"id":549,"data":1738,"type":580,"tunes":1752},{"rows":1739,"title":569,"layout":303,"columns":1748},[1740,1742,1744,1746],{"id":553,"label":554,"values":1741},[556,556,556],{"id":558,"label":559,"values":1743},[556,556,556],{"id":562,"label":563,"values":1745},[556,556,556],{"id":566,"label":567,"values":1747},[556,556,556],[1749,1750,1751],{"id":572,"label":573},{"id":575,"label":576},{"id":578,"label":579},{},{"id":583,"data":1754,"type":226,"tunes":1755},{"text":585},{},{"id":588,"data":1757,"type":42,"tunes":1758},{"text":590,"level":219},{},{"id":593,"data":1760,"type":226,"tunes":1761},{"text":595},{},{"id":598,"data":1763,"type":303,"tunes":1774},{"content":1764,"stretched":43,"withHeadings":14},[1765,1766,1767,1768,1769,1770,1771,1772,1773],[602,603,604],[606,607,608],[610,611,612],[614,615,616],[618,619,620],[622,623,624],[626,627,628],[630,631,632],[634,635,636],{},{"id":639,"data":1776,"type":42,"tunes":1777},{"text":641,"level":219},{},{"id":644,"data":1779,"type":226,"tunes":1780},{"text":646},{},{"id":649,"data":1782,"type":226,"tunes":1783},{"text":651},{},{"id":654,"data":1785,"type":42,"tunes":1786},{"text":656,"level":219},{},{"id":659,"data":1788,"type":303,"tunes":1796},{"content":1789,"stretched":43,"withHeadings":14},[1790,1791,1792,1793,1794,1795],[663,664,665],[667,668,669],[671,672,673],[675,676,677],[679,680,681],[683,684,685],{},{"id":688,"data":1798,"type":42,"tunes":1799},{"text":690,"level":219},{},{"id":693,"data":1801,"type":710,"tunes":1804},{"meta":1802,"items":1803,"style":709},{},[697,698,699,700,701,702,703,704,705,706,707,708],{},{"id":713,"data":1806,"type":226,"tunes":1807},{"text":715},{},{"id":718,"data":1809,"type":541,"tunes":1810},{"url":720,"title":721,"excerpt":722,"ctaLabel":723},{},{"id":726,"data":1812,"type":42,"tunes":1813},{"text":728,"level":219},{},{"id":731,"data":1815,"type":226,"tunes":1816},{"text":733},{},{"id":736,"data":1818,"type":226,"tunes":1819},{"text":738},{},{"id":741,"data":1821,"type":226,"tunes":1822},{"text":743},{},{"id":746,"data":1824,"type":42,"tunes":1825},{"text":748,"level":219},{},{"id":751,"data":1827,"type":226,"tunes":1828},{"text":753},{},{"id":756,"data":1830,"type":226,"tunes":1831},{"text":758},{},{"id":761,"data":1833,"type":42,"tunes":1834},{"text":763,"level":219},{},{"id":766,"data":1836,"type":226,"tunes":1837},{"text":768},{},{"id":771,"data":1839,"type":226,"tunes":1840},{"text":773},{},{"id":776,"data":1842,"type":42,"tunes":1843},{"text":778,"level":219},{},{"id":781,"data":1845,"type":226,"tunes":1846},{"text":783},{},{"id":786,"data":1848,"type":226,"tunes":1849},{"text":788},{},{"id":791,"data":1851,"type":42,"tunes":1852},{"text":793,"level":219},{},{"id":796,"data":1854,"type":796,"tunes":1862},{"items":1855,"title":823},[1856,1857,1858,1859,1860,1861],{"id":800,"answer":801,"question":802},{"id":804,"answer":805,"question":806},{"id":808,"answer":809,"question":810},{"id":812,"answer":813,"question":814},{"id":816,"answer":817,"question":818},{"id":820,"answer":821,"question":822},{},{"id":826,"data":1864,"type":42,"tunes":1865},{"text":828,"level":219},{},{"id":831,"data":1867,"type":831,"tunes":1875},{"title":833,"entries":1868},[1869,1870,1871,1872,1873,1874],{"term":836,"anchor":837,"definition":838},{"term":840,"anchor":841,"definition":842},{"term":844,"anchor":845,"definition":846},{"term":848,"anchor":849,"definition":850},{"term":852,"anchor":853,"definition":854},{"term":856,"anchor":857,"definition":858},{},{"id":861,"data":1877,"type":42,"tunes":1878},{"text":863,"level":219},{},{"id":866,"data":1880,"type":873,"tunes":1883},{"link":868,"meta":1881},{"image":1882,"title":871,"description":872},{"url":556},{},{"id":876,"data":1885,"type":873,"tunes":1888},{"link":878,"meta":1886},{"image":1887,"title":881,"description":882},{"url":556},{},{"id":885,"data":1890,"type":873,"tunes":1893},{"link":887,"meta":1891},{"image":1892,"title":890,"description":891},{"url":556},{},{"id":894,"data":1895,"type":873,"tunes":1898},{"link":896,"meta":1896},{"image":1897,"title":899,"description":900},{"url":556},{},{"id":903,"data":1900,"type":873,"tunes":1903},{"link":905,"meta":1901},{"image":1902,"title":908,"description":909},{"url":556},{},{"id":912,"data":1905,"type":873,"tunes":1908},{"link":914,"meta":1906},{"image":1907,"title":917,"description":918},{"url":556},{},{"id":921,"data":1910,"type":873,"tunes":1913},{"link":923,"meta":1911},{"image":1912,"title":926,"description":927},{"url":556},{},{"id":930,"data":1915,"type":873,"tunes":1918},{"link":932,"meta":1916},{"image":1917,"title":935,"description":936},{"url":556},{},"Post erfolgreich abgerufen",{"items":1921,"source":1985,"manualIds":1986,"manualMatchedIds":1987},[1922,1929,1936,1943,1950,1957,1964,1971,1978],{"id":1923,"slug":1924,"title":1925,"excerpt":1926,"featuredImage":1927,"publishedAt":1928},"478","what-is-rag-the-simplest-explanation-of-how-it-works","Cos'è il RAG? La spiegazione più semplice di come funziona","RAG sembra complicato, ma l'idea è semplice: prima che un'IA risponda, cerca prima informazioni utili da una fonte di conoscenza e fornisce tali informazioni al modello linguistico. Questa guida spiega RAG, LLM, stato, memoria e strumenti utilizzando un semplice modello mentale.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":1930,"slug":1931,"title":1932,"excerpt":1933,"featuredImage":1934,"publishedAt":1935},"459","ollama-is-not-the-product-building-production-ready-open-llm-applications","Ollama non è il prodotto: costruire applicazioni Open-LLM pronte per la produzione","Eseguire un modello locale con Ollama è facile. Costruire un'applicazione Open-LLM pronta per la produzione è più difficile: richiede RAG, controllo degli accessi, astrazione del provider, valutazione, logging, disciplina di deployment e un livello applicativo controllato attorno al modello.","\u002Fuploads\u002F2026\u002F06\u002Follama-is-not-the-product-building-production-ready-open-llm-applications-1782679361640-h0usqf.webp","2026-06-28T16:39:00.000Z",{"id":1937,"slug":1938,"title":1939,"excerpt":1940,"featuredImage":1941,"publishedAt":1942},"471","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","Come sapere se un agente IA ha effettivamente usato le prove giuste","Un agente IA può citare fonti e comunque utilizzare le prove sbagliate. Questo articolo introduce un metodo pratico per verificare il supporto delle affermazioni, l'autorevolezza della fonte, l'applicabilità, la provenienza e se le prove abbiano effettivamente influenzato la risposta.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","2026-09-25T11:47:00.000Z",{"id":1944,"slug":1945,"title":1946,"excerpt":1947,"featuredImage":1948,"publishedAt":1949},"460","ai-agent-reliability-why-the-final-answer-is-not-enough","Affidabilità degli Agenti AI: Perché la Risposta Finale Non è Sufficiente","Un output corretto non dimostra un ragionamento corretto, un'esecuzione sicura o un sistema affidabile.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-reliability-why-the-final-answer-is-not-enough-1788955466306-pl0qhz.webp","2026-09-09T04:01:00.000Z",{"id":1951,"slug":1952,"title":1953,"excerpt":1954,"featuredImage":1955,"publishedAt":1956},"469","rag-failed-but-which-layer-actually-failed-a-diagnostic-method","RAG non riuscito — Ma quale livello ha effettivamente fallito? Un metodo diagnostico","Quando una risposta RAG è sbagliata, dare la colpa al recupero o al modello è troppo vago. Questo metodo diagnostico isola la copertura delle fonti, la costruzione della query, il recupero, il ranking, l'assemblaggio del contesto, la generazione, l'attribuzione delle evidenze e l'aggiornamento—così il guasto effettivo può essere riprodotto e corretto.","\u002Fuploads\u002F2026\u002F09\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method-1790350847177-pior4c.webp","2026-09-24T19:39:00.000Z",{"id":1958,"slug":1959,"title":1960,"excerpt":1961,"featuredImage":1962,"publishedAt":1963},"457","should-you-buy-5g-openwrt-router-old-firmware","Dovresti Acquistare un Router OpenWrt 5G con Firmware Vecchio? ZBT Z8102AX come Esempio Pratico","Acquistare un router 5G OpenWrt con firmware più vecchio può avere senso, ma solo nelle giuste condizioni. Lo ZBT Z8102AX mostra chiaramente entrambi i lati: l'hardware è utile, il modem funziona e il router è rimasto stabile durante i test, ma OpenWrt 21.02, il packaging debole e i percorsi di aggiornamento poco chiari richiedono una decisione d'acquisto attenta.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1965,"slug":1966,"title":1967,"excerpt":1968,"featuredImage":1969,"publishedAt":1970},"474","migrating-from-openai-agents-sdk-to-the-agents-api-what-actually-changes-architecturally","Migrare dall'SDK OpenAI Agents all'API Agents: cosa cambia effettivamente a livello architetturale?","La migrazione dall'SDK OpenAI Agents alla nuova Agents API non è una semplice rinomina degli import. Il confine di runtime cambia: il ciclo dell'agente, la sessione durevole, l'orchestrazione, la compattazione del contesto e il ripristino si spostano verso un harness gestito. Questa guida mostra cosa dovrebbe essere spostato, cosa dovrebbe rimanere nella tua applicazione e come dimostrare la migrazione prima del passaggio.","\u002Fuploads\u002F2026\u002F09\u002Fmigrating-from-openai-agents-sdk-to-the-agents-api-what-actually-changes-architecturally-1790352171968-ienxr9.webp","2026-09-25T12:01:00.000Z",{"id":1972,"slug":1973,"title":1974,"excerpt":1975,"featuredImage":1976,"publishedAt":1977},"364","tipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung","Padroneggiare il Flusso di Lavoro SEO: Strategie di Ottimizzazione Essenziali per la Crescita Organica","Un flusso di lavoro SEO strutturato è fondamentale per una crescita organica sostenibile. Scopri le dieci strategie fondamentali, dalla ricerca di parole chiave e dall'ottimizzazione tecnica alla qualità dei contenuti e all'analisi delle prestazioni.","\u002Fuploads\u002F2026\u002F03\u002Ftipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung-1774866098131-hwkzrg.webp","2024-01-26T06:35:00.000Z",{"id":1979,"slug":1980,"title":1981,"excerpt":1982,"featuredImage":1983,"publishedAt":1984},"472","why-more-context-can-make-ai-answers-worse","Perché più contesto può peggiorare le risposte dell'IA","Una finestra di contesto più ampia non garantisce una risposta migliore. Questo articolo spiega come la diluizione del segnale, le prove contrastanti, lo stato obsoleto, la sensibilità alla posizione e la compressione con perdita possano ridurre l'affidabilità dell'IA—e introduce un pratico Context Pressure Test.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z","fallback",[],[]]