[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:sr":3,"public-menus:all":38,"post:computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system:sr":205,"related:post:computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system:sr:1":1919},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","sr","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1918},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":937,"featuredImage":938,"featuredImageAlt":939,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":940,"publishedAt":941,"createdAt":942,"updatedAt":943,"seoLocalePaths":944,"categories":953,"author":966,"translations":971},"477","Agenti za korišćenje računara: Zašto uspešan demo i dalje može biti nepouzdan sistem","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Sadržaj\">\u003Cstrong class=\"editorjs-toc__title\">Sadržaj\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-6\" class=\"editorjs-toc__link\">Zašto je demonstracija najlakši mogući test pouzdanosti\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">Sposobnost, stopa uspešnosti, pouzdanost i bezbednost su različite tvrdnje\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-12\" class=\"editorjs-toc__link\">Lestvica pouzdanosti za agente koji koriste računar\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-15\" class=\"editorjs-toc__link\">Nivo 1 — Sposobnost: pitanje demonstracije\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-18\" class=\"editorjs-toc__link\">Nivo 2 — Ponovljivost: ostaje li isti zadatak rešen?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-21\" class=\"editorjs-toc__link\">Nivo 3 — Robusnost u okruženju: šta se dešava kada se veb ponaša kao veb?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-25\" class=\"editorjs-toc__link\">Nivo 4 — Kontrola na dugim horizontima: uspeh se menja kada zadatak postane pravi posao\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-29\" class=\"editorjs-toc__link\">Nivo 5 — Svest o stanju: okruženje se može promeniti ispod samog plana\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">Nivo 6 — Verifikacija ishoda: da li je akcija zaista uspela?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-37\" class=\"editorjs-toc__link\">Nivo 7 — Bezbedno rukovanje ciljevima: agent mora znati kada ne treba da nastavi\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-41\" class=\"editorjs-toc__link\">Stres test prelaska iz demo verzije u produkciju\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-44\" class=\"editorjs-toc__link\">Uspeh na benčmarku ima granicu validnosti\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-48\" class=\"editorjs-toc__link\">Uspešnost procesa i uspešnost ishoda moraju se ocenjivati odvojeno\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-51\" class=\"editorjs-toc__link\">Pouzdanost u produkciji je distribucija, a ne jedinstvena stopa uspešnosti\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-54\" class=\"editorjs-toc__link\">Pouzdanost zahteva budžet za greške, a ne savršenstvo\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-57\" class=\"editorjs-toc__link\">Praktična matrica pouzdanosti za korišćenje računara\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-59\" class=\"editorjs-toc__link\">Šta beležiti prilikom neuspeha u korišćenju računara\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-63\" class=\"editorjs-toc__link\">Bezbednost je deo pouzdanosti agenata za korišćenje računara\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-67\" class=\"editorjs-toc__link\">Šta bi promenilo ovaj odgovor?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-70\" class=\"editorjs-toc__link\">Ograničenja\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-73\" class=\"editorjs-toc__link\">Zaključak\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-76\" class=\"editorjs-toc__link\">Često postavljana pitanja\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-78\" class=\"editorjs-toc__link\">Rečnik pojmova\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-80\" class=\"editorjs-toc__link\">Primarni izvori i preporučena literatura\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>Agenti koji koriste računar sada mogu da klikću, kucaju, pretražuju internet, uređuju datoteke, upravljaju desktop aplikacijama i izvršavaju impresivne višestepene zadatke. To čini uspešne demonstracije lakim za razumevanje i podložnim preteranom tumačenju. Jedan uspešno završen radni tok pokazuje da agent može da uspe pod tim uslovima. On ne pokazuje koliko često uspeva, kako se ponaša kada se okruženje promeni, da li verifikuje rezultat, niti koliko bezbedno postupa kada cilj postane dvosmislen.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Direktan odgovor\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">&lt;strong&gt;Uspešna demonstracija upotrebe računara dokazuje sposobnost, a ne pouzdanost.&lt;\u002Fstrong&gt; Pouzdanost u produkciji zahteva da agent uspeva uzastopno uprkos varijacijama u okruženju, da se oporavlja od prolaznih grešaka, očuva ograničenja tokom dugih vremenskih okvira, detektuje skriveno ili promenljivo stanje, verifikuje stvarni ishod i zaustavi se ili postavi pitanje kada cilj postane dvosmislen ili nebezbedan. Pravo pitanje za produkciju nije „Može li agent da izvrši ovaj zadatak?“, već „Pod kojim uslovima mu možemo verovati da ovaj zadatak izvršava iznova i iznova?“\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Oblast koja se brzo razvija\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Ovaj članak odražava istraživanja agenata koji koriste računar i smernice platformi dostupne na dan &lt;strong&gt;25. septembra 2026.&lt;\u002Fstrong&gt; Rezultati benčmarka nisu direktno uporedivi kroz različite skupove zadataka, okruženja, modele, ograničenja broja koraka, evaluatore ili testna okruženja. Posmatrajte svaki rezultat benčmarka u sklopu njegovih uslova evaluacije.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Model korišćen u ovom članku\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Lestvica pouzdanosti za agente koji koriste računar i stres-test prelaska sa demonstracije na produkciju, prikazani u nastavku, praktični su modeli evaluacije predloženi ovde. Oni ne predstavljaju formalne industrijske standarde.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-6\">Zašto je demonstracija najlakši mogući test pouzdanosti\u003C\u002Fh2>\n\u003Cp>Demonstracija obično prikazuje jednu putanju koja je uspela. Okruženje je poznato, zadatak je unapred izabran, operater može ponovo da pokrene proces nakon neuspeha, a publika vidi uspešan ishod. Produkcijski sistemi se umesto toga suočavaju sa celom distribucijom: različitim stranicama, mrežnim uslovima, stanjima naloga, iskačućim prozorima, kašnjenjem, promenama korisničkog interfejsa, skrivenim stanjem, dozvolama, prekidima i korisnicima koji nesavršeno opisuju ciljeve.\u003C\u002Fp>\n\u003Cp>Ova razlika je važna zato što agenti koji koriste računar funkcionišu putem interfejsa dizajniranih za ljude, a ne determinističkih API-ja. Njihov akcioni ciklus zavisi od percepcije, interpretacije stanja, planiranja, vremenskog usklađivanja interakcija i odziva okruženja. Male promene mogu promeniti putanju čak i kada cilj korisnika ostane nepromenjen.\u003C\u002Fp>\n\u003Cp>Rad WAREX odeljenja Microsoft Research-a jasno ukazuje na problem: benčmark agenti koji deluju sposobno u kontrolisanim uslovima beleže značajan pad uspešnosti kada se uvede realistična nestabilnost veba. Neuspeh ne znači nužno da je „model postao manje inteligentan“. Okruženje je jednostavno prestalo da bude determinističko.\u003C\u002Fp>\n\u003Ch2 id=\"section-10\">Sposobnost, stopa uspešnosti, pouzdanost i bezbednost su različite tvrdnje\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Tvrdnja\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Šta zapravo dokazuje\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Šta ne dokazuje\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Agent je jednom završio zadatak\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sposobnost u okviru jedne posmatrane putanje\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ponovljivost, robusnost, bezbednost ili generalizaciju\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Agent ima visok rezultat na benčmarku\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Učinak pod zadacima i uslovima evaluacije tog benčmarka\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ekvivalentan učinak u produkciji u različitim okruženjima\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Agent obično postiže cilj\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Učestalost uspešnog ishoda\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ispravan proces, bezbedno ponašanje ili dokaz da je rezultat verifikovan\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Agent sledi predviđeni proces\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kvalitet putanje prema evaluacionim kriterijumima\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Da je spoljno okruženje zaista prihvatilo konačni ishod\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Agent izbegava nebezbedne radnje u testnom skupu\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Učinak na zastupljenim bezbednosnim slučajevima\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Bezbednost pri svakoj novoj dvosmislenosti, ubacivanju instrukcija ili neželjenom sporednom efektu\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-12\">Lestvica pouzdanosti za agente koji koriste računar\u003C\u002Fh2>\n\u003Cp>Koristan način za evaluaciju sistema koji koriste računar jeste prelazak sa jednokratne sposobnosti ka progresivno zahtevnijim svojstvima pouzdanosti. Viši nivoi podrazumevaju niže nivoe, ali ne proističu automatski iz njih.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Lestvica pouzdanosti za agente koji koriste računar\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Sposobnost\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Može li agent da izvrši zadatak barem jednom u poznatim uslovima?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Ponovljivost\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Može li dosledno da završi isti zadatak u ponovljenim pokušajima?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Robusnost u okruženju\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Da li uspešno prevazilazi promene u vremenskom odzivu, probleme sa mrežom, iskačuće prozore, varijacije interfejsa i mala odstupanja u okruženju?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Kontrola dugih vremenskih okvira\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Može li da očuva ciljeve, ograničenja i napredak kroz mnogo koraka, aplikacija i odloženih događaja?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Svest o stanju\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Može li da detektuje kada se okruženje promenilo, kada je skriveno stanje važno ili kada pretpostavka više ne važi?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Verifikacija ishoda\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Da li proverava da li se željeni rezultat zaista dogodio umesto da samo veruje sopstvenom nizu radnji?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Bezbedno upravljanje ciljevima\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Može li da se zaustavi, postavi pitanje, odbije ili vrati kontrolu čoveku kada je cilj dvosmislen, neizvodljiv, kontradiktoran ili ima visok rizik?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch3 id=\"section-15\">Nivo 1 — Sposobnost: pitanje demonstracije\u003C\u002Fh3>\n\u003Cp>Sposobnost postavlja pitanje da li agent uopšte može da izvrši zadatak. To je dragoceno. Sistemi koji koriste računar su brzo napredovali, i savremeni agenti mogu da završe radne tokove koje stariji sistemi nisu mogli pouzdano da izvedu.\u003C\u002Fp>\n\u003Cp>Međutim, sposobnost je slab kriterijum za primenu u produkciji. Jedno uspešno izvršavanje ne govori vam da li agent uspeva u 95% ili u 30% slučajeva, da li su neuspesi bezazleni ili destruktivni, niti da li uspeh zavisi od pukog spleta okolnosti na stranici.\u003C\u002Fp>\n\u003Ch3 id=\"section-18\">Nivo 2 — Ponovljivost: ostaje li isti zadatak rešen?\u003C\u002Fh3>\n\u003Cp>Putanje korišćenja računara su stohastičke. Izlazi modela variraju, stranice se učitavaju različitim brzinama, vizuelna stanja se menjaju, a dugi tokovi rada stvaraju mnoge mogućnosti grananja. Zbog toga bi produkcijski test trebalo da pokrene isti zadatak više puta, umesto da jedan uspešan trag tretira kao reprezentativan.\u003C\u002Fp>\n\u003Cp>Merite ne samo prosečnu stopu uspeha već i distribuciju načina neuspeha: pogrešan klik, prevremeni prekid, propuštena potvrda, netačno polje, duplirana akcija, navigaciona petlja, pretpostavka zastarelog stanja i lažni izveštaj o uspehu.\u003C\u002Fp>\n\u003Ch3 id=\"section-21\">Nivo 3 — Robusnost u okruženju: šta se dešava kada se veb ponaša kao veb?\u003C\u002Fh3>\n\u003Cp>Pravi veb-sajtovi nisu fiksna okruženja za benčmark. Zahtevi ne uspevaju, elementi se kasno učitavaju, sesije ističu, stranice se menjaju, baneri za pristanak se pojavljuju, serveri vraćaju greške, a mrežni uslovi variraju.\u003C\u002Fp>\n\u003Cp>WAREX procenjuje ovaj jaz ubacivanjem realistične nepouzdanosti veba u postojeća benčmark okruženja i beleži značajne padove u uspešnosti zadataka. Ovo je ključan produkcijski uvid: benčmark može meriti kompetentnost za zadatak, dok nedovoljno meri oporavak od nestabilnosti okruženja.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Test pouzdanosti\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Ubacite kašnjenja, prolazne HTTP greške, zastarelo stanje stranice, modalne dijaloge, isticanje sesije, duplirane odgovore i kontrolisane varijacije korisničkog interfejsa. Ako agent radi samo na idealnoj putanji, to je sistem sposoban za demo, a ne sistem pouzdan za produkciju.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-25\">Nivo 4 — Kontrola na dugim horizontima: uspeh se menja kada zadatak postane pravi posao\u003C\u002Fh3>\n\u003Cp>Kratki zadaci skrivaju klasu neuspeha koji se pojavljuju tek nakon desetina ili stotina akcija: zaboravljena ograničenja, dupliran rad, preuranjeni završetak, propuštene promene stanja, nedoslednosti između aplikacija i nagomilane male greške.\u003C\u002Fp>\n\u003Cp>OSWorld 2.0 je dizajniran posebno oko realnih tokova rada sa dugim horizontom. Ljudskim korisnicima je u medijani potrebno oko 1,6 sati za njegove zadatke i zahtevaju znatno više poziva alata nego raniji benčmarkovi za korišćenje računara. Prema njegovoj primarnoj metrici završetka, čak i najjači ocenjeni sistemi ostaju daleko od potpune pouzdanosti u izvršavanju zadataka.\u003C\u002Fp>\n\u003Cp>WeaveBench dolazi do sličnog zaključka iz drugog ugla. On ocenjuje hibridne GUI, CLI i kodne tokove rada i izveštava da najbolja ocenjena kombinacija modela i izvršnog okruženja prolazi samo 41,2% zadataka. Važan rezultat nije samo jedan broj na rang-listi; već to što realistična orkestracija između interfejsa otkriva neuspehe skrivene jednostavnijim zadacima sa jednim interfejsom.\u003C\u002Fp>\n\u003Ch3 id=\"section-29\">Nivo 5 — Svest o stanju: okruženje se može promeniti ispod samog plana\u003C\u002Fh3>\n\u003Cp>Dugotrajni zadaci često zavise od skrivenog ili promenljivog stanja: stiže imejl, menja se kalendar, podnosi se obrazac, pozadinski proces se završava, sesija pretraživača ističe, korisnik modifikuje fajl ili spoljni sistem menja dostupnost.\u003C\u002Fp>\n\u003Cp>Microsoft-ov SentinelBench tvrdi da se mnogi dugotrajni zadaci uopšte ne bi trebali rešavati neprekidnim akcijama. Ispravno ponašanje može biti praćenje, čekanje na spoljni događaj, a zatim delovanje kada se stanje promeni. Ovo je drugačija sposobnost od bržeg kliktanja ili planiranja više koraka.\u003C\u002Fp>\n\u003Cp>Pouzdani agent za korišćenje računara stoga mora da razlikuje: odmah izvodljivo, čekanje na stanje, stanje promenjeno i pretpostavka poništena.\u003C\u002Fp>\n\u003Ch3 id=\"section-33\">Nivo 6 — Verifikacija ishoda: da li je akcija zaista uspela?\u003C\u002Fh3>\n\u003Cp>Agent može izvršiti naizgled tačan redosled i svejedno ne uspeti u zadatku. Klik na dugme se možda neće registrovati. Obrazac može odbiti skrivenu validaciju. Fajl se može sačuvati u pogrešnom direktorijumu. Kupovina može ostati nepotvrđena. Sajt može prikazati ekran koji izgleda kao uspeh dok osnovna operacija nije uspela.\u003C\u002Fp>\n\u003Cp>Trenutna uputstva kompanije OpenAI za korišćenje računara eksplicitno preporučuju ograničavanje i verifikaciju izvršavanja umesto oslanjanja samo na konačni odgovor modela. Rad Microsoft Research-a na verifikatorima korišćenja računara dolazi do istog zaključka iz evaluacije: proces i ishod se moraju procenjivati odvojeno.\u003C\u002Fp>\n\u003Cp>Istraživanje projekta Universal Verifier navodi da ranije postavke verifikatora mogu proizvesti visoke stope lažno pozitivnih rezultata, dok snažniji dizajn rubrika i eksplicitno razdvajanje procesa, ishoda, kontrolisanih neuspeha i nekontrolisanih neuspeha značajno poboljšavaju slaganje sa ljudskim oznakama.\u003C\u002Fp>\n\u003Ch3 id=\"section-37\">Nivo 7 — Bezbedno rukovanje ciljevima: agent mora znati kada ne treba da nastavi\u003C\u002Fh3>\n\u003Cp>Agenti koji koriste računar optimizovani su za ostvarivanje ciljeva, ali upornost u postizanju cilja može i sama postati obrazac otkazivanja. Dvosmislen zahtev, nemoguć uslov, protivrečna instrukcija, sumnjiva veb-stranica ili promenjeno okruženje mogu zahtevati pojašnjenje ili zaustavljanje umesto daljeg delovanja.\u003C\u002Fp>\n\u003Cp>Benčmark BLIND-ACT proučava ovaj problem kao slepu usmerenost ka cilju (Blind Goal-Directedness). Kroz sisteme procenjene u tom radu, agenti su često nastavljali da izvršavaju zadatke uprkos dvosmislenosti, neizvodljivosti, konfliktnom kontekstu ili drugim razlozima za preispitivanje. Autori identifikuju obrasce kao što su pristrasnost ka izvršavanju na prvom mestu (execution-first bias) i primat zahteva (request primacy).\u003C\u002Fp>\n\u003Cp>Ova klasa grešaka je važna zato što visoko sposoban agent može lošu situaciju učiniti još gorom i to brže. Pouzdanost stoga uključuje politiku o tome kada ne treba delovati.\u003C\u002Fp>\n\u003Ch2 id=\"section-41\">Stres test prelaska iz demo verzije u produkciju\u003C\u002Fh2>\n\u003Cp>Pre primene toka posla sa korišćenjem računara u produkciji, uzmite uspešan demo i sistematski uklonite pretpostavke koje su ga učinile lakim.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Stres test prelaska iz demo verzije u produkciju\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Ponovo pokrenite čist zadatak\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Uspostavite ponovljivost kroz više pokušaja pre dodavanja složenosti.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Unesite poremećaje u okruženje\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Dodajte kašnjenje, ponovne pokušaje, iskačuće prozore, varijacije stranica, zastarele sesije i privremene greške.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Proširite vremenski opseg (horizont)\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Pretvorite kratak demo u puni stvarni tok posla sa međustanjima, više aplikacija i odloženim koracima.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Promenite skriveno stanje\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Izmenite nalog, datoteku, zadatak ili spoljno stanje nakon što je agent formirao plan i proverite da li detektuje promenu.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Uvedite dvosmislenost\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Uklonite jednu važnu pretpostavku i proverite da li agent postavlja pitanje umesto da nagađa.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Uvedite kontrolisanu kontradikciju\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Prikažite staro i novo stanje zajedno i potvrdite da merodavno trenutno stanje pobeđuje.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Zahtevajte dokaz o ishodu\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Učinite da završetak zadatka zavisi od proverljivog konačnog stanja, a ne od samoprocene modela.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Testirajte granice odgovornosti i posledica\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Potvrdite da nepovratne ili osetljive radnje pokreću očekivano odobrenje, odbijanje ili predaju čoveku.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">9\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">9. Ponovite nakon izmena u okruženju (harness) ili modelu\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Tretirajte nadogradnje izvršnog okruženja kao promene pouzdanosti koje zahtevaju regresiono testiranje.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-44\">Uspeh na benčmarku ima granicu validnosti\u003C\u002Fh2>\n\u003Cp>Rezultat na benčmarku je uslovna izjava. Važi za određeni model, okruženje (harness), sistem, skup zadataka, procenjivača, interfejs alata, budžet koraka, politiku ponovnih pokušaja, datum i metod evaluacije.\u003C\u002Fp>\n\u003Cp>Broj postaje obmanjujući kada ti uslovi nestanu iz tvrdnje. „Agent X postiže 80%“ je slabija tvrdnja od „Agent X je postigao 80% na benčmarku Y u okruženju Z uz procenjivača J i budžet koraka N.“ Druga izjava čuva granicu koja vam govori da li se taj rezultat prenosi na vašu primenu.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fsr\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Granica validnosti odgovora: Sloj koji nedostaje između relevantnosti i pouzdanih AI odgovora\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Okvir za jasno definisanje uslova pod kojima AI tvrdnja ostaje validna i koje promene zahtevaju ograničenje, preračunavanje ili odustajanje.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Pročitajte o Granici validnosti odgovora →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-48\">Uspešnost procesa i uspešnost ishoda moraju se ocenjivati odvojeno\u003C\u002Fh2>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Četiri moguća ishoda jednog pokretanja korišćenja računara\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Proces\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Ishod\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Interpretacija\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Tačan proces \u002F tačan ishod\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Pogrešan proces \u002F tačan ishod\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Tačan proces \u002F pogrešan ishod\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Pogrešan proces \u002F pogrešan ishod\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>WeaveBench izveštava da ocena samo na osnovu ishoda može znatno preceniti performanse korišćenja računara, jer agent može proizvesti naizgled uspešan artefakt pomoću prečice ili fabrikovanih dokaza. Verifikator mora pregledati putanju i krajnje rezultate, a ne samo konačnu tvrdnju.\u003C\u002Fp>\n\u003Ch2 id=\"section-51\">Pouzdanost u produkciji je distribucija, a ne jedinstvena stopa uspešnosti\u003C\u002Fh2>\n\u003Cp>Korisna produkciona evaluacija uzorkuje dimenzije koje stvarno variraju u vašem okruženju. Za radni tok u pregledaču, to može uključivati starost naloga, lokalitet, veličinu ekrana (viewport), verziju stranice, kvalitet mreže, status autentifikacije, postojeće stanje korpe, kolačiće, iskačuće prozore, korisničke dozvole i to da li čovek prekida izvršavanje.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Dimenzija\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Primer varijacije\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Zašto je važno\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Okruženje\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Brza naspram spore mreže, prolazne greške, vreme odziva stranice\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testira oporavak i ponašanje čekanja\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Korisnički interfejs (UI)\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Drugačiji ekran (viewport), modalni prozor, preuređeni elementi, manji redizajn\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testira krhke vizuelne\u002Fakcione pretpostavke\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Stanje\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prijavljen\u002Fodjavljen, prazna\u002Fneprazna korpa, postojeća datoteka, promenjene dozvole\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testira zaključivanje o skrivenom stanju\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Vremenski opseg zadatka\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">5 koraka naspram 50+ koraka, jedna aplikacija naspram nekoliko aplikacija\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testira akumuliranu grešku putanje\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Dvosmislenost\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Nedostajuća preferencija ili nepotpuna korisnička instrukcija\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testira da li agent postavlja pitanje umesto da nagađa\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Posledica\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Samo za čitanje naspram kupovine\u002Fslanja\u002Fbrisanja\u002Fizmene\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testira kontrole potvrde i autorizacije\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Neprijateljski sadržaj\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prompt injection ili obmanjujući tekst stranice\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testira hijerarhiju instrukcija i izolaciju\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Verzija modela \u002F radnog okvira\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Nadogradnja izvršnog okruženja\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Testira regresiju usled promena na nivou sistema\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-54\">Pouzdanost zahteva budžet za greške, a ne savršenstvo\u003C\u002Fh2>\n\u003Cp>Nijedan produkcioni sistem nije savršeno pouzdan. Korisno inženjersko pitanje jeste koji su otkazi prihvatljivi, prepoznatljivi i popravljivi. Neuspešan pokušaj sortiranja lokalne fascikle nije ekvivalentan slanju pogrešne e-poruke, kupovini pogrešnog proizvoda ili promeni podešavanja naloga.\u003C\u002Fp>\n\u003Cp>Klasifikujte akcije prema posledicama i reverzibilnosti. Reverzibilne akcije niskog uticaja mogu tolerisati veću autonomiju. Akcije visokog uticaja, one koje su eksterno vidljive ili teško reverzibilne, zahtevaju jaču potvrdu, verifikaciju stanja, autorizaciju i provere nakon izvršenja.\u003C\u002Fp>\n\u003Ch2 id=\"section-57\">Praktična matrica pouzdanosti za korišćenje računara\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Klasa akcije\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Primer\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Preporučena kontrola\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Čitanje \u002F inspekcija\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Otvaranje stranica, čitanje datoteka, prikupljanje informacija\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ograničiti opseg, beležiti izvore, tolerisati navigacione greške koje se mogu ispraviti\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Reverzibilna lokalna promena\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Uređivanje nacrta datoteke, reorganizacija privremenog radnog prostora\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Tačka provere (checkpoint) ili verzija pre promene; verifikovati rezultat\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eksterna komunikacija\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Slanje e-pošte, objavljivanje sadržaja, slanje formulara\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Potvrda korisnika ili izričito delegirano ovlašćenje; verifikovati prihvaćeno stanje\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Finansijske \u002F transakcione akcije\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kupovina, plaćanje, plaćena pretplata\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Strogi mandat, ograničenja iznosa\u002Ftrgovca, konačna potvrda i verifikacija računa\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Destruktivne \u002F promene privilegija\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Brisanje podataka, promena dozvola, opoziv pristupa\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Uska autorizacija, izričita potvrda, reverzibilna putanja gde je moguće, revizija nakon akcije\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-59\">Šta beležiti prilikom neuspeha u korišćenju računara\u003C\u002Fh2>\n\u003Cul>\u003Cli>Cilj korisnika i izričita ograničenja.\u003C\u002Fli>\u003Cli>Verzija modela i okruženja za testiranje (harness).\u003C\u002Fli>\u003Cli>Verzije okruženja i aplikacija.\u003C\u002Fli>\u003Cli>Snimci ekrana ili strukturisana zapažanja relevantna za neuspeh.\u003C\u002Fli>\u003Cli>Preduzete akcije sa vremenskim oznakama.\u003C\u002Fli>\u003Cli>Rezultati alata, klikova, tastature i navigacije.\u003C\u002Fli>\u003Cli>Prelazi stanja i periodi čekanja.\u003C\u002Fli>\u003Cli>Događaji odobrenja, odbijanja ili predaje kontrole (handoff).\u003C\u002Fli>\u003Cli>Spoljne greške i mrežni prekidi.\u003C\u002Fli>\u003Cli>Konačno vidljivo stanje okruženja.\u003C\u002Fli>\u003Cli>Ishod koji je agent prijavio.\u003C\u002Fli>\u003Cli>Rezultat verifikatora i informacija o tome da li je agent mogao kontrolisati neuspeh.\u003C\u002Fli>\u003C\u002Ful>\n\u003Cp>Ključno poređenje je između prijavljenog uspeha i uočljivog uspeha. Sistem koji ne može da razlikuje to dvoje na kraju će akumulirati lažno pozitivne rezultate u produkciji.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fsr\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Pouzdanost AI agenata: Zašto konačni odgovor nije dovoljan\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Širi model pouzdanosti za procenu putanja agenata, korišćenja alata i međukoraka umesto prihvatanja konačnog odgovora kao dokaza da je sistem ispravno funkcionisao.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Pročitajte članak o pouzdanosti agenata →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-63\">Bezbednost je deo pouzdanosti agenata za korišćenje računara\u003C\u002Fh2>\n\u003Cp>Agenti za korišćenje računara ne čitaju samo nepouzdani sadržaj; oni mogu delovati nakon što ga pročitaju. To pretvara prompt injection, zlonamerni sadržaj stranice i phishing u rizike putanje izvršavanja.\u003C\u002Fp>\n\u003Cp>Trenutne OpenAI smernice za korišćenje računara preporučuju izolaciju okruženja, pravljenje liste dozvoljenih sajtova i akcija, tretiranje sadržaja ekrana kao nepouzdanog, potvrđivanje akcija sa posledicama, ograničavanje izvršavanja i verifikaciju stvarnog ishoda. ChatGPT agent na sličan način koristi potvrde, nadzor prompt injection napada i nadgledane režime za osetljive kontekste.\u003C\u002Fp>\n\u003Cp>Arhitektonski princip je širi od bilo kog pojedinačnog provajdera: sadržaju koji agent uoči ne sme se dozvoliti da redefiniše korisnička ovlašćenja. Veb-stranica može da pruži podatke. Ona ne može da dodeli dozvolu za slanje podataka na drugo mesto, kupovinu, promenu akreditiva ili prekoračenje granica zadatka.\u003C\u002Fp>\n\u003Ch2 id=\"section-67\">Šta bi promenilo ovaj odgovor?\u003C\u002Fh2>\n\u003Cp>Jaz u pouzdanosti bi se smanjio ako bi modeli za korišćenje računara postali otporni na duge horizonte, dinamičko stanje, varijacije korisničkog interfejsa, kvarove u okruženju i dvosmislene ciljeve kroz reprezentativne produkcione distribucije. Bolji izvorni API-ji za stanja, standardizovani mašinski čitljivi interfejsi i jača infrastruktura za verifikaciju takođe bi mogli smanjiti količinu krhke interakcije sa GUI-jem koja je neophodna.\u003C\u002Fp>\n\u003Cp>Prag za primenu se takođe menja sa posledicama zadatka. Stopa uspešnosti od 70% može biti korisna za nadgledani istraživački zadatak niskog rizika, a potpuno neprihvatljiva za autonoman finansijski ili destruktivni radni tok. Pouzdanost se stoga mora procenjivati u odnosu na cenu svake klase neuspeha, a ne prema jednom univerzalnom pragu prolaznosti.\u003C\u002Fp>\n\u003Ch2 id=\"section-70\">Ograničenja\u003C\u002Fh2>\n\u003Cp>Navedeni benčmark testovi procenjuju različita okruženja i ne bi trebalo da se rangiraju jedni protiv drugih kao da mere istu stvar. WAREX testira nepouzdanost veba; WeaveBench cilja hibridni rad dugog horizonta; OSWorld 2.0 cilja realistične duge radne tokove; BLIND-ACT se fokusira na rukovanje ciljevima pod dvosmislenošću i neizvodljivošću.\u003C\u002Fp>\n\u003Cp>Rezultati benčmarka takođe brzo zastarevaju. Poboljšanja modela, testnog okruženja i verifikatora mogu materijalno promeniti rezultate u roku od nekoliko meseci. Trajna pouka je stoga metod evaluacije: varirajte uslove, odvojte proces od ishoda, verifikujte eksterno stanje i očuvajte granice oko svake tvrdnje o performansama.\u003C\u002Fp>\n\u003Ch2 id=\"section-73\">Zaključak\u003C\u002Fh2>\n\u003Cp>Agenti za korišćenje računara već su dovoljno sposobni da budu korisni. Upravo zato se pitanje evaluacije promenilo. Izazov više nije samo da li agent može da prođe kroz radni tok kliktanjem. Pitanje je da li sistem ostaje pouzdan kada nestanu besprekorni uslovi demonstracije.\u003C\u002Fp>\n\u003Cp>Tretirajte jedno uspešno izvršavanje kao dokaz sposobnosti. Zatim testirajte ponovljivost, robusnost na promene u okruženju, kontrolu na dugim vremenskim horizontima, svest o stanju, verifikaciju ishoda i bezbedno upravljanje ciljevima. Produkcijski agent za korišćenje računara nije onaj koji može da završi demo. To je onaj čije su granice otkaza poznate, izmerene i kontrolisane.\u003C\u002Fp>\n\u003Ch2 id=\"section-76\">Često postavljana pitanja\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Pouzdanost agenata za korišćenje računara\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Da li uspešan demo agenta za korišćenje računara dokazuje produkcijsku pouzdanost?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Ne. To dokazuje sposobnost pod jednom posmatranom putanjom. Produkcijska pouzdanost zahteva ponovljeni uspeh kroz varijacije u okruženju, dugotrajne zadatke, promenljivo stanje, dvosmislenost, uslove oporavka i radnje sa posledicama.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Zašto benčmark testovi za korišćenje računara mogu izgledati znatno bolje od performansi u stvarnom svetu?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Benčmark testovi mogu koristiti više kontrolisana okruženja, kraće zadatke, stabilne mrežne uslove, jednostavnije kombinacije aplikacija ili kriterijume ishoda koji ne beleže sve greške u procesu. Tačna granica validnosti zavisi od svakog pojedinačnog benčmarka.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Koja je najvažnija provera pouzdanosti nakon radnje korišćenja računara?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Verifikujte stvarni spoljni ishod. Nemojte tretirati konačnu izjavu agenta ili planirani redosled klikova kao dokaz da je ciljni sistem prihvatio operaciju.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Zašto računarski zadaci sa dugim vremenskim horizontom ostaju teški?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Greške se akumuliraju kroz mnoge radnje, ograničenja se zaboravljaju, spoljno stanje se menja, rad obuhvata više aplikacija, skriveno stanje je važno, a agent mora da odluči kada da sačeka, pita, verifikuje ili se oporavi, umesto da jednostavno nastavi sa delovanjem.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Kako treba testirati agenta za pregledač ili desktop pre uvođenja u produkciju?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Ponavljajte čiste zadatke, ubacujte realistične greške u okruženju, varirajte korisnički interfejs i stanje, produžite horizont radnog toka, uvedite dvosmislenost, zahtevajte vidljiv dokaz ishoda, testirajte kontrole radnji visokog uticaja i ponovo pokrenite skup testova nakon izmena modela ili okvira.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq6\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Da li agenti za korišćenje računara uvek treba da zahtevaju ljudsku potvrdu?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Ne za svaku radnju niskog rizika. Zahtevi za potvrdom treba da budu srazmerni posledicama, reverzibilnosti, ovlašćenjima i neizvesnosti. Radnje visokog uticaja, spolja vidljive ili one koje je teško poništiti zahtevaju strože kontrole.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-78\">Rečnik pojmova\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Ključni pojmovi o pouzdanosti\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"computer-use-agent\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Agent za korišćenje računara\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">AI agent koji interaguje sa grafičkim korisničkim interfejsima ili računarskim okruženjima putem opažanja i radnji kao što su kliktanje, kucanje, skrolovanje, operacije sa datotekama ili radni tokovi kroz više aplikacija.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"repeatability\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Ponovljivost\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Stepen u kojem agent može dosledno da završi isti zadatak tokom ponovljenih pokretanja, umesto da bude uspešan samo na odabranim putanjama.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"environmental-robustness\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Robusnost na okruženje\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Sposobnost očuvanja ispravnog ponašanja uprkos realnim varijacijama kao što su kašnjenje, prolazne greške, izmene u korisničkom interfejsu, stanje sesije i neočekivani uslovi na stranici.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"outcome-verification\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Verifikacija ishoda\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Provera stvarnog spoljnog stanja nakon radnje radi potvrde da je došlo do željenog rezultata, umesto oslanjanja na agentov sopstveni izveštaj.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"blind-goal-directedness\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Slepa usmerenost ka cilju\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Obrazac otkaza u kojem agent za korišćenje računara nastavlja da teži cilju uprkos dvosmislenosti, neizvodljivosti, kontradiktornim uslovima ili razlozima za zaustavljanje i ponovnu procenu.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"reliability-boundary\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Granica pouzdanosti\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Skup uslova pod kojima uočena stopa uspeha ili tvrdnja o sposobnosti ostaje dovoljno reprezentativna za konkretnu odluku o uvođenju u produkciju.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-80\">Primarni izvori i preporučena literatura\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Computer use\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Aktuelna uputstva za programere o izolaciji okruženja, tretiranju sadržaja ekrana kao nepouzdanog, potvrđivanju radnji sa posledicama, ograničavanju izvršavanja i verifikaciji ishoda.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Running Codex safely at OpenAI\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Aktuelna uputstva za produkciju o tehničkim granicama, odobrenju ljudi, telemetriji i kontroli agenata koji deluju na stvarnim sistemima.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — WAREX\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Evaluacija iz 2026. koja pokazuje da realistična nepouzdanost veba dovodi do značajnog pada uspešnosti zadataka agenata za pregledače na postojećim benčmark testovima.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — The Art of Building Verifiers for Computer Use Agents\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Rad iz 2026. o evaluaciji procesa u odnosu na ishod, greškama koje se mogu kontrolisati u odnosu na one koje se ne mogu kontrolisati i pouzdanoj verifikaciji putanje.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — WeaveBench\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Benčmark iz 2026. za zadatke sa dugim vremenskim horizontom koji kombinuje GUI, CLI i tokove rada sa kodom, prikazujući znatan jaz između trenutnih agenata i pouzdanog završavanja zadataka u stvarnom svetu.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Benčmark iz 2026. fokusiran na realistične tokove rada korišćenja računara sa dugim vremenskim horizontom, skriveno stanje i rezonovanje kroz više izvora.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — SentinelBench\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Benčmark iz 2026. za vremenski promenljive zadatke gde agenti moraju da nadgledaju okruženja i reaguju na promene stanja, umesto da neprekidno deluju.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Istraživanje sa ICLR 2026 o agentima koji nastavljaju da teže dvosmislenim, kontradiktornim ili neizvodljivim ciljevima.\u003C\u002Fp>\u003C\u002Fa>",{"time":212,"blocks":213,"version":936},1790353211334,[214,222,228,236,243,250,255,260,265,270,275,305,310,315,343,348,353,358,363,368,373,378,383,388,395,400,405,410,415,420,425,430,435,440,445,450,455,460,465,470,475,480,485,517,522,527,532,541,546,580,585,590,595,636,641,646,651,656,685,690,710,715,723,728,733,738,743,748,753,758,763,768,773,778,783,788,793,823,828,858,863,873,882,891,900,909,918,927],{"id":215,"data":216,"type":220,"tunes":221},"IYG9UPcPY0",{"title":217,"maxLevel":218,"minLevel":219},"Sadržaj",3,2,"tableOfContents",{},{"id":223,"data":224,"type":226,"tunes":227},"intro",{"text":225},"Agenti koji koriste računar sada mogu da klikću, kucaju, pretražuju internet, uređuju datoteke, upravljaju desktop aplikacijama i izvršavaju impresivne višestepene zadatke. To čini uspešne demonstracije lakim za razumevanje i podložnim preteranom tumačenju. Jedan uspešno završen radni tok pokazuje da agent može da uspe pod tim uslovima. On ne pokazuje koliko često uspeva, kako se ponaša kada se okruženje promeni, da li verifikuje rezultat, niti koliko bezbedno postupa kada cilj postane dvosmislen.","paragraph",{},{"id":229,"data":230,"type":234,"tunes":235},"direct",{"body":231,"title":232,"variant":233},"\u003Cstrong>Uspešna demonstracija upotrebe računara dokazuje sposobnost, a ne pouzdanost.\u003C\u002Fstrong> Pouzdanost u produkciji zahteva da agent uspeva uzastopno uprkos varijacijama u okruženju, da se oporavlja od prolaznih grešaka, očuva ograničenja tokom dugih vremenskih okvira, detektuje skriveno ili promenljivo stanje, verifikuje stvarni ishod i zaustavi se ili postavi pitanje kada cilj postane dvosmislen ili nebezbedan. Pravo pitanje za produkciju nije „Može li agent da izvrši ovaj zadatak?“, već „Pod kojim uslovima mu možemo verovati da ovaj zadatak izvršava iznova i iznova?“","Direktan odgovor","info","callout",{},{"id":237,"data":238,"type":234,"tunes":242},"freshness",{"body":239,"title":240,"variant":241},"Ovaj članak odražava istraživanja agenata koji koriste računar i smernice platformi dostupne na dan \u003Cstrong>25. septembra 2026.\u003C\u002Fstrong> Rezultati benčmarka nisu direktno uporedivi kroz različite skupove zadataka, okruženja, modele, ograničenja broja koraka, evaluatore ili testna okruženja. Posmatrajte svaki rezultat benčmarka u sklopu njegovih uslova evaluacije.","Oblast koja se brzo razvija","warning",{},{"id":244,"data":245,"type":234,"tunes":249},"model-note",{"body":246,"title":247,"variant":248},"Lestvica pouzdanosti za agente koji koriste računar i stres-test prelaska sa demonstracije na produkciju, prikazani u nastavku, praktični su modeli evaluacije predloženi ovde. Oni ne predstavljaju formalne industrijske standarde.","Model korišćen u ovom članku","note",{},{"id":251,"data":252,"type":42,"tunes":254},"h-demo",{"text":253,"level":219},"Zašto je demonstracija najlakši mogući test pouzdanosti",{},{"id":256,"data":257,"type":226,"tunes":259},"p-demo-1",{"text":258},"Demonstracija obično prikazuje jednu putanju koja je uspela. Okruženje je poznato, zadatak je unapred izabran, operater može ponovo da pokrene proces nakon neuspeha, a publika vidi uspešan ishod. Produkcijski sistemi se umesto toga suočavaju sa celom distribucijom: različitim stranicama, mrežnim uslovima, stanjima naloga, iskačućim prozorima, kašnjenjem, promenama korisničkog interfejsa, skrivenim stanjem, dozvolama, prekidima i korisnicima koji nesavršeno opisuju ciljeve.",{},{"id":261,"data":262,"type":226,"tunes":264},"p-demo-2",{"text":263},"Ova razlika je važna zato što agenti koji koriste računar funkcionišu putem interfejsa dizajniranih za ljude, a ne determinističkih API-ja. Njihov akcioni ciklus zavisi od percepcije, interpretacije stanja, planiranja, vremenskog usklađivanja interakcija i odziva okruženja. Male promene mogu promeniti putanju čak i kada cilj korisnika ostane nepromenjen.",{},{"id":266,"data":267,"type":226,"tunes":269},"p-demo-3",{"text":268},"Rad WAREX odeljenja Microsoft Research-a jasno ukazuje na problem: benčmark agenti koji deluju sposobno u kontrolisanim uslovima beleže značajan pad uspešnosti kada se uvede realistična nestabilnost veba. Neuspeh ne znači nužno da je „model postao manje inteligentan“. Okruženje je jednostavno prestalo da bude determinističko.",{},{"id":271,"data":272,"type":42,"tunes":274},"h-claims",{"text":273,"level":219},"Sposobnost, stopa uspešnosti, pouzdanost i bezbednost su različite tvrdnje",{},{"id":276,"data":277,"type":303,"tunes":304},"claims-table",{"content":278,"stretched":43,"withHeadings":14},[279,283,287,291,295,299],[280,281,282],"Tvrdnja","Šta zapravo dokazuje","Šta ne dokazuje",[284,285,286],"Agent je jednom završio zadatak","Sposobnost u okviru jedne posmatrane putanje","Ponovljivost, robusnost, bezbednost ili generalizaciju",[288,289,290],"Agent ima visok rezultat na benčmarku","Učinak pod zadacima i uslovima evaluacije tog benčmarka","Ekvivalentan učinak u produkciji u različitim okruženjima",[292,293,294],"Agent obično postiže cilj","Učestalost uspešnog ishoda","Ispravan proces, bezbedno ponašanje ili dokaz da je rezultat verifikovan",[296,297,298],"Agent sledi predviđeni proces","Kvalitet putanje prema evaluacionim kriterijumima","Da je spoljno okruženje zaista prihvatilo konačni ishod",[300,301,302],"Agent izbegava nebezbedne radnje u testnom skupu","Učinak na zastupljenim bezbednosnim slučajevima","Bezbednost pri svakoj novoj dvosmislenosti, ubacivanju instrukcija ili neželjenom sporednom efektu","table",{},{"id":306,"data":307,"type":42,"tunes":309},"h-ladder",{"text":308,"level":219},"Lestvica pouzdanosti za agente koji koriste računar",{},{"id":311,"data":312,"type":226,"tunes":314},"p-ladder-intro",{"text":313},"Koristan način za evaluaciju sistema koji koriste računar jeste prelazak sa jednokratne sposobnosti ka progresivno zahtevnijim svojstvima pouzdanosti. Viši nivoi podrazumevaju niže nivoe, ali ne proističu automatski iz njih.",{},{"id":316,"data":317,"type":341,"tunes":342},"ladder-flow",{"steps":318,"title":308,"orientation":340},[319,322,325,328,331,334,337],{"label":320,"description":321},"1. Sposobnost","Može li agent da izvrši zadatak barem jednom u poznatim uslovima?",{"label":323,"description":324},"2. Ponovljivost","Može li dosledno da završi isti zadatak u ponovljenim pokušajima?",{"label":326,"description":327},"3. Robusnost u okruženju","Da li uspešno prevazilazi promene u vremenskom odzivu, probleme sa mrežom, iskačuće prozore, varijacije interfejsa i mala odstupanja u okruženju?",{"label":329,"description":330},"4. Kontrola dugih vremenskih okvira","Može li da očuva ciljeve, ograničenja i napredak kroz mnogo koraka, aplikacija i odloženih događaja?",{"label":332,"description":333},"5. Svest o stanju","Može li da detektuje kada se okruženje promenilo, kada je skriveno stanje važno ili kada pretpostavka više ne važi?",{"label":335,"description":336},"6. Verifikacija ishoda","Da li proverava da li se željeni rezultat zaista dogodio umesto da samo veruje sopstvenom nizu radnji?",{"label":338,"description":339},"7. Bezbedno upravljanje ciljevima","Može li da se zaustavi, postavi pitanje, odbije ili vrati kontrolu čoveku kada je cilj dvosmislen, neizvodljiv, kontradiktoran ili ima visok rizik?","auto","processFlow",{},{"id":344,"data":345,"type":42,"tunes":347},"h-capability",{"text":346,"level":218},"Nivo 1 — Sposobnost: pitanje demonstracije",{},{"id":349,"data":350,"type":226,"tunes":352},"p-capability-1",{"text":351},"Sposobnost postavlja pitanje da li agent uopšte može da izvrši zadatak. To je dragoceno. Sistemi koji koriste računar su brzo napredovali, i savremeni agenti mogu da završe radne tokove koje stariji sistemi nisu mogli pouzdano da izvedu.",{},{"id":354,"data":355,"type":226,"tunes":357},"p-capability-2",{"text":356},"Međutim, sposobnost je slab kriterijum za primenu u produkciji. Jedno uspešno izvršavanje ne govori vam da li agent uspeva u 95% ili u 30% slučajeva, da li su neuspesi bezazleni ili destruktivni, niti da li uspeh zavisi od pukog spleta okolnosti na stranici.",{},{"id":359,"data":360,"type":42,"tunes":362},"h-repeatability",{"text":361,"level":218},"Nivo 2 — Ponovljivost: ostaje li isti zadatak rešen?",{},{"id":364,"data":365,"type":226,"tunes":367},"p-repeat-1",{"text":366},"Putanje korišćenja računara su stohastičke. Izlazi modela variraju, stranice se učitavaju različitim brzinama, vizuelna stanja se menjaju, a dugi tokovi rada stvaraju mnoge mogućnosti grananja. Zbog toga bi produkcijski test trebalo da pokrene isti zadatak više puta, umesto da jedan uspešan trag tretira kao reprezentativan.",{},{"id":369,"data":370,"type":226,"tunes":372},"p-repeat-2",{"text":371},"Merite ne samo prosečnu stopu uspeha već i distribuciju načina neuspeha: pogrešan klik, prevremeni prekid, propuštena potvrda, netačno polje, duplirana akcija, navigaciona petlja, pretpostavka zastarelog stanja i lažni izveštaj o uspehu.",{},{"id":374,"data":375,"type":42,"tunes":377},"h-robustness",{"text":376,"level":218},"Nivo 3 — Robusnost u okruženju: šta se dešava kada se veb ponaša kao veb?",{},{"id":379,"data":380,"type":226,"tunes":382},"p-robust-1",{"text":381},"Pravi veb-sajtovi nisu fiksna okruženja za benčmark. Zahtevi ne uspevaju, elementi se kasno učitavaju, sesije ističu, stranice se menjaju, baneri za pristanak se pojavljuju, serveri vraćaju greške, a mrežni uslovi variraju.",{},{"id":384,"data":385,"type":226,"tunes":387},"p-robust-2",{"text":386},"WAREX procenjuje ovaj jaz ubacivanjem realistične nepouzdanosti veba u postojeća benčmark okruženja i beleži značajne padove u uspešnosti zadataka. Ovo je ključan produkcijski uvid: benčmark može meriti kompetentnost za zadatak, dok nedovoljno meri oporavak od nestabilnosti okruženja.",{},{"id":389,"data":390,"type":234,"tunes":394},"robust-tip",{"body":391,"title":392,"variant":393},"Ubacite kašnjenja, prolazne HTTP greške, zastarelo stanje stranice, modalne dijaloge, isticanje sesije, duplirane odgovore i kontrolisane varijacije korisničkog interfejsa. Ako agent radi samo na idealnoj putanji, to je sistem sposoban za demo, a ne sistem pouzdan za produkciju.","Test pouzdanosti","tip",{},{"id":396,"data":397,"type":42,"tunes":399},"h-long",{"text":398,"level":218},"Nivo 4 — Kontrola na dugim horizontima: uspeh se menja kada zadatak postane pravi posao",{},{"id":401,"data":402,"type":226,"tunes":404},"p-long-1",{"text":403},"Kratki zadaci skrivaju klasu neuspeha koji se pojavljuju tek nakon desetina ili stotina akcija: zaboravljena ograničenja, dupliran rad, preuranjeni završetak, propuštene promene stanja, nedoslednosti između aplikacija i nagomilane male greške.",{},{"id":406,"data":407,"type":226,"tunes":409},"p-long-2",{"text":408},"OSWorld 2.0 je dizajniran posebno oko realnih tokova rada sa dugim horizontom. Ljudskim korisnicima je u medijani potrebno oko 1,6 sati za njegove zadatke i zahtevaju znatno više poziva alata nego raniji benčmarkovi za korišćenje računara. Prema njegovoj primarnoj metrici završetka, čak i najjači ocenjeni sistemi ostaju daleko od potpune pouzdanosti u izvršavanju zadataka.",{},{"id":411,"data":412,"type":226,"tunes":414},"p-long-3",{"text":413},"WeaveBench dolazi do sličnog zaključka iz drugog ugla. On ocenjuje hibridne GUI, CLI i kodne tokove rada i izveštava da najbolja ocenjena kombinacija modela i izvršnog okruženja prolazi samo 41,2% zadataka. Važan rezultat nije samo jedan broj na rang-listi; već to što realistična orkestracija između interfejsa otkriva neuspehe skrivene jednostavnijim zadacima sa jednim interfejsom.",{},{"id":416,"data":417,"type":42,"tunes":419},"h-state",{"text":418,"level":218},"Nivo 5 — Svest o stanju: okruženje se može promeniti ispod samog plana",{},{"id":421,"data":422,"type":226,"tunes":424},"p-state-1",{"text":423},"Dugotrajni zadaci često zavise od skrivenog ili promenljivog stanja: stiže imejl, menja se kalendar, podnosi se obrazac, pozadinski proces se završava, sesija pretraživača ističe, korisnik modifikuje fajl ili spoljni sistem menja dostupnost.",{},{"id":426,"data":427,"type":226,"tunes":429},"p-state-2",{"text":428},"Microsoft-ov SentinelBench tvrdi da se mnogi dugotrajni zadaci uopšte ne bi trebali rešavati neprekidnim akcijama. Ispravno ponašanje može biti praćenje, čekanje na spoljni događaj, a zatim delovanje kada se stanje promeni. Ovo je drugačija sposobnost od bržeg kliktanja ili planiranja više koraka.",{},{"id":431,"data":432,"type":226,"tunes":434},"p-state-3",{"text":433},"Pouzdani agent za korišćenje računara stoga mora da razlikuje: odmah izvodljivo, čekanje na stanje, stanje promenjeno i pretpostavka poništena.",{},{"id":436,"data":437,"type":42,"tunes":439},"h-verify",{"text":438,"level":218},"Nivo 6 — Verifikacija ishoda: da li je akcija zaista uspela?",{},{"id":441,"data":442,"type":226,"tunes":444},"p-verify-1",{"text":443},"Agent može izvršiti naizgled tačan redosled i svejedno ne uspeti u zadatku. Klik na dugme se možda neće registrovati. Obrazac može odbiti skrivenu validaciju. Fajl se može sačuvati u pogrešnom direktorijumu. Kupovina može ostati nepotvrđena. Sajt može prikazati ekran koji izgleda kao uspeh dok osnovna operacija nije uspela.",{},{"id":446,"data":447,"type":226,"tunes":449},"p-verify-2",{"text":448},"Trenutna uputstva kompanije OpenAI za korišćenje računara eksplicitno preporučuju ograničavanje i verifikaciju izvršavanja umesto oslanjanja samo na konačni odgovor modela. Rad Microsoft Research-a na verifikatorima korišćenja računara dolazi do istog zaključka iz evaluacije: proces i ishod se moraju procenjivati odvojeno.",{},{"id":451,"data":452,"type":226,"tunes":454},"p-verify-3",{"text":453},"Istraživanje projekta Universal Verifier navodi da ranije postavke verifikatora mogu proizvesti visoke stope lažno pozitivnih rezultata, dok snažniji dizajn rubrika i eksplicitno razdvajanje procesa, ishoda, kontrolisanih neuspeha i nekontrolisanih neuspeha značajno poboljšavaju slaganje sa ljudskim oznakama.",{},{"id":456,"data":457,"type":42,"tunes":459},"h-safe-goal",{"text":458,"level":218},"Nivo 7 — Bezbedno rukovanje ciljevima: agent mora znati kada ne treba da nastavi",{},{"id":461,"data":462,"type":226,"tunes":464},"p-safe-1",{"text":463},"Agenti koji koriste računar optimizovani su za ostvarivanje ciljeva, ali upornost u postizanju cilja može i sama postati obrazac otkazivanja. Dvosmislen zahtev, nemoguć uslov, protivrečna instrukcija, sumnjiva veb-stranica ili promenjeno okruženje mogu zahtevati pojašnjenje ili zaustavljanje umesto daljeg delovanja.",{},{"id":466,"data":467,"type":226,"tunes":469},"p-safe-2",{"text":468},"Benčmark BLIND-ACT proučava ovaj problem kao slepu usmerenost ka cilju (Blind Goal-Directedness). Kroz sisteme procenjene u tom radu, agenti su često nastavljali da izvršavaju zadatke uprkos dvosmislenosti, neizvodljivosti, konfliktnom kontekstu ili drugim razlozima za preispitivanje. Autori identifikuju obrasce kao što su pristrasnost ka izvršavanju na prvom mestu (execution-first bias) i primat zahteva (request primacy).",{},{"id":471,"data":472,"type":226,"tunes":474},"p-safe-3",{"text":473},"Ova klasa grešaka je važna zato što visoko sposoban agent može lošu situaciju učiniti još gorom i to brže. Pouzdanost stoga uključuje politiku o tome kada ne treba delovati.",{},{"id":476,"data":477,"type":42,"tunes":479},"h-stress",{"text":478,"level":219},"Stres test prelaska iz demo verzije u produkciju",{},{"id":481,"data":482,"type":226,"tunes":484},"p-stress-intro",{"text":483},"Pre primene toka posla sa korišćenjem računara u produkciji, uzmite uspešan demo i sistematski uklonite pretpostavke koje su ga učinile lakim.",{},{"id":486,"data":487,"type":341,"tunes":516},"stress-flow",{"steps":488,"title":478,"orientation":340},[489,492,495,498,501,504,507,510,513],{"label":490,"description":491},"1. Ponovo pokrenite čist zadatak","Uspostavite ponovljivost kroz više pokušaja pre dodavanja složenosti.",{"label":493,"description":494},"2. Unesite poremećaje u okruženje","Dodajte kašnjenje, ponovne pokušaje, iskačuće prozore, varijacije stranica, zastarele sesije i privremene greške.",{"label":496,"description":497},"3. Proširite vremenski opseg (horizont)","Pretvorite kratak demo u puni stvarni tok posla sa međustanjima, više aplikacija i odloženim koracima.",{"label":499,"description":500},"4. Promenite skriveno stanje","Izmenite nalog, datoteku, zadatak ili spoljno stanje nakon što je agent formirao plan i proverite da li detektuje promenu.",{"label":502,"description":503},"5. Uvedite dvosmislenost","Uklonite jednu važnu pretpostavku i proverite da li agent postavlja pitanje umesto da nagađa.",{"label":505,"description":506},"6. Uvedite kontrolisanu kontradikciju","Prikažite staro i novo stanje zajedno i potvrdite da merodavno trenutno stanje pobeđuje.",{"label":508,"description":509},"7. Zahtevajte dokaz o ishodu","Učinite da završetak zadatka zavisi od proverljivog konačnog stanja, a ne od samoprocene modela.",{"label":511,"description":512},"8. Testirajte granice odgovornosti i posledica","Potvrdite da nepovratne ili osetljive radnje pokreću očekivano odobrenje, odbijanje ili predaju čoveku.",{"label":514,"description":515},"9. Ponovite nakon izmena u okruženju (harness) ili modelu","Tretirajte nadogradnje izvršnog okruženja kao promene pouzdanosti koje zahtevaju regresiono testiranje.",{},{"id":518,"data":519,"type":42,"tunes":521},"h-benchmark-boundary",{"text":520,"level":219},"Uspeh na benčmarku ima granicu validnosti",{},{"id":523,"data":524,"type":226,"tunes":526},"p-boundary-1",{"text":525},"Rezultat na benčmarku je uslovna izjava. Važi za određeni model, okruženje (harness), sistem, skup zadataka, procenjivača, interfejs alata, budžet koraka, politiku ponovnih pokušaja, datum i metod evaluacije.",{},{"id":528,"data":529,"type":226,"tunes":531},"p-boundary-2",{"text":530},"Broj postaje obmanjujući kada ti uslovi nestanu iz tvrdnje. „Agent X postiže 80%“ je slabija tvrdnja od „Agent X je postigao 80% na benčmarku Y u okruženju Z uz procenjivača J i budžet koraka N.“ Druga izjava čuva granicu koja vam govori da li se taj rezultat prenosi na vašu primenu.",{},{"id":533,"data":534,"type":539,"tunes":540},"ref-avb",{"url":535,"title":536,"excerpt":537,"ctaLabel":538},"https:\u002F\u002Fstajic.de\u002Fsr\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","Granica validnosti odgovora: Sloj koji nedostaje između relevantnosti i pouzdanih AI odgovora","Okvir za jasno definisanje uslova pod kojima AI tvrdnja ostaje validna i koje promene zahtevaju ograničenje, preračunavanje ili odustajanje.","Pročitajte o Granici validnosti odgovora","referralArticle",{},{"id":542,"data":543,"type":42,"tunes":545},"h-process-outcome",{"text":544,"level":219},"Uspešnost procesa i uspešnost ishoda moraju se ocenjivati odvojeno",{},{"id":547,"data":548,"type":578,"tunes":579},"process-outcome-comparison",{"rows":549,"title":567,"layout":303,"columns":568},[550,555,559,563],{"id":551,"label":552,"values":553},"good-good","Tačan proces \u002F tačan ishod",[554,554,554],"",{"id":556,"label":557,"values":558},"bad-good","Pogrešan proces \u002F tačan ishod",[554,554,554],{"id":560,"label":561,"values":562},"good-bad","Tačan proces \u002F pogrešan ishod",[554,554,554],{"id":564,"label":565,"values":566},"bad-bad","Pogrešan proces \u002F pogrešan ishod",[554,554,554],"Četiri moguća ishoda jednog pokretanja korišćenja računara",[569,572,575],{"id":570,"label":571},"process","Proces",{"id":573,"label":574},"outcome","Ishod",{"id":576,"label":577},"interpretation","Interpretacija","comparison",{},{"id":581,"data":582,"type":226,"tunes":584},"p-process-1",{"text":583},"WeaveBench izveštava da ocena samo na osnovu ishoda može znatno preceniti performanse korišćenja računara, jer agent može proizvesti naizgled uspešan artefakt pomoću prečice ili fabrikovanih dokaza. Verifikator mora pregledati putanju i krajnje rezultate, a ne samo konačnu tvrdnju.",{},{"id":586,"data":587,"type":42,"tunes":589},"h-distribution",{"text":588,"level":219},"Pouzdanost u produkciji je distribucija, a ne jedinstvena stopa uspešnosti",{},{"id":591,"data":592,"type":226,"tunes":594},"p-dist-1",{"text":593},"Korisna produkciona evaluacija uzorkuje dimenzije koje stvarno variraju u vašem okruženju. Za radni tok u pregledaču, to može uključivati starost naloga, lokalitet, veličinu ekrana (viewport), verziju stranice, kvalitet mreže, status autentifikacije, postojeće stanje korpe, kolačiće, iskačuće prozore, korisničke dozvole i to da li čovek prekida izvršavanje.",{},{"id":596,"data":597,"type":303,"tunes":635},"distribution-table",{"content":598,"stretched":43,"withHeadings":14},[599,603,607,611,615,619,623,627,631],[600,601,602],"Dimenzija","Primer varijacije","Zašto je važno",[604,605,606],"Okruženje","Brza naspram spore mreže, prolazne greške, vreme odziva stranice","Testira oporavak i ponašanje čekanja",[608,609,610],"Korisnički interfejs (UI)","Drugačiji ekran (viewport), modalni prozor, preuređeni elementi, manji redizajn","Testira krhke vizuelne\u002Fakcione pretpostavke",[612,613,614],"Stanje","Prijavljen\u002Fodjavljen, prazna\u002Fneprazna korpa, postojeća datoteka, promenjene dozvole","Testira zaključivanje o skrivenom stanju",[616,617,618],"Vremenski opseg zadatka","5 koraka naspram 50+ koraka, jedna aplikacija naspram nekoliko aplikacija","Testira akumuliranu grešku putanje",[620,621,622],"Dvosmislenost","Nedostajuća preferencija ili nepotpuna korisnička instrukcija","Testira da li agent postavlja pitanje umesto da nagađa",[624,625,626],"Posledica","Samo za čitanje naspram kupovine\u002Fslanja\u002Fbrisanja\u002Fizmene","Testira kontrole potvrde i autorizacije",[628,629,630],"Neprijateljski sadržaj","Prompt injection ili obmanjujući tekst stranice","Testira hijerarhiju instrukcija i izolaciju",[632,633,634],"Verzija modela \u002F radnog okvira","Nadogradnja izvršnog okruženja","Testira regresiju usled promena na nivou sistema",{},{"id":637,"data":638,"type":42,"tunes":640},"h-budget",{"text":639,"level":219},"Pouzdanost zahteva budžet za greške, a ne savršenstvo",{},{"id":642,"data":643,"type":226,"tunes":645},"p-budget-1",{"text":644},"Nijedan produkcioni sistem nije savršeno pouzdan. Korisno inženjersko pitanje jeste koji su otkazi prihvatljivi, prepoznatljivi i popravljivi. Neuspešan pokušaj sortiranja lokalne fascikle nije ekvivalentan slanju pogrešne e-poruke, kupovini pogrešnog proizvoda ili promeni podešavanja naloga.",{},{"id":647,"data":648,"type":226,"tunes":650},"p-budget-2",{"text":649},"Klasifikujte akcije prema posledicama i reverzibilnosti. Reverzibilne akcije niskog uticaja mogu tolerisati veću autonomiju. Akcije visokog uticaja, one koje su eksterno vidljive ili teško reverzibilne, zahtevaju jaču potvrdu, verifikaciju stanja, autorizaciju i provere nakon izvršenja.",{},{"id":652,"data":653,"type":42,"tunes":655},"h-matrix",{"text":654,"level":219},"Praktična matrica pouzdanosti za korišćenje računara",{},{"id":657,"data":658,"type":303,"tunes":684},"control-matrix",{"content":659,"stretched":43,"withHeadings":14},[660,664,668,672,676,680],[661,662,663],"Klasa akcije","Primer","Preporučena kontrola",[665,666,667],"Čitanje \u002F inspekcija","Otvaranje stranica, čitanje datoteka, prikupljanje informacija","Ograničiti opseg, beležiti izvore, tolerisati navigacione greške koje se mogu ispraviti",[669,670,671],"Reverzibilna lokalna promena","Uređivanje nacrta datoteke, reorganizacija privremenog radnog prostora","Tačka provere (checkpoint) ili verzija pre promene; verifikovati rezultat",[673,674,675],"Eksterna komunikacija","Slanje e-pošte, objavljivanje sadržaja, slanje formulara","Potvrda korisnika ili izričito delegirano ovlašćenje; verifikovati prihvaćeno stanje",[677,678,679],"Finansijske \u002F transakcione akcije","Kupovina, plaćanje, plaćena pretplata","Strogi mandat, ograničenja iznosa\u002Ftrgovca, konačna potvrda i verifikacija računa",[681,682,683],"Destruktivne \u002F promene privilegija","Brisanje podataka, promena dozvola, opoziv pristupa","Uska autorizacija, izričita potvrda, reverzibilna putanja gde je moguće, revizija nakon akcije",{},{"id":686,"data":687,"type":42,"tunes":689},"h-log",{"text":688,"level":219},"Šta beležiti prilikom neuspeha u korišćenju računara",{},{"id":691,"data":692,"type":708,"tunes":709},"log-list",{"meta":693,"items":694,"style":707},{},[695,696,697,698,699,700,701,702,703,704,705,706],"Cilj korisnika i izričita ograničenja.","Verzija modela i okruženja za testiranje (harness).","Verzije okruženja i aplikacija.","Snimci ekrana ili strukturisana zapažanja relevantna za neuspeh.","Preduzete akcije sa vremenskim oznakama.","Rezultati alata, klikova, tastature i navigacije.","Prelazi stanja i periodi čekanja.","Događaji odobrenja, odbijanja ili predaje kontrole (handoff).","Spoljne greške i mrežni prekidi.","Konačno vidljivo stanje okruženja.","Ishod koji je agent prijavio.","Rezultat verifikatora i informacija o tome da li je agent mogao kontrolisati neuspeh.","unordered","list",{},{"id":711,"data":712,"type":226,"tunes":714},"p-log-1",{"text":713},"Ključno poređenje je između prijavljenog uspeha i uočljivog uspeha. Sistem koji ne može da razlikuje to dvoje na kraju će akumulirati lažno pozitivne rezultate u produkciji.",{},{"id":716,"data":717,"type":539,"tunes":722},"ref-reliability",{"url":718,"title":719,"excerpt":720,"ctaLabel":721},"https:\u002F\u002Fstajic.de\u002Fsr\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Pouzdanost AI agenata: Zašto konačni odgovor nije dovoljan","Širi model pouzdanosti za procenu putanja agenata, korišćenja alata i međukoraka umesto prihvatanja konačnog odgovora kao dokaza da je sistem ispravno funkcionisao.","Pročitajte članak o pouzdanosti agenata",{},{"id":724,"data":725,"type":42,"tunes":727},"h-security",{"text":726,"level":219},"Bezbednost je deo pouzdanosti agenata za korišćenje računara",{},{"id":729,"data":730,"type":226,"tunes":732},"p-sec-1",{"text":731},"Agenti za korišćenje računara ne čitaju samo nepouzdani sadržaj; oni mogu delovati nakon što ga pročitaju. To pretvara prompt injection, zlonamerni sadržaj stranice i phishing u rizike putanje izvršavanja.",{},{"id":734,"data":735,"type":226,"tunes":737},"p-sec-2",{"text":736},"Trenutne OpenAI smernice za korišćenje računara preporučuju izolaciju okruženja, pravljenje liste dozvoljenih sajtova i akcija, tretiranje sadržaja ekrana kao nepouzdanog, potvrđivanje akcija sa posledicama, ograničavanje izvršavanja i verifikaciju stvarnog ishoda. ChatGPT agent na sličan način koristi potvrde, nadzor prompt injection napada i nadgledane režime za osetljive kontekste.",{},{"id":739,"data":740,"type":226,"tunes":742},"p-sec-3",{"text":741},"Arhitektonski princip je širi od bilo kog pojedinačnog provajdera: sadržaju koji agent uoči ne sme se dozvoliti da redefiniše korisnička ovlašćenja. Veb-stranica može da pruži podatke. Ona ne može da dodeli dozvolu za slanje podataka na drugo mesto, kupovinu, promenu akreditiva ili prekoračenje granica zadatka.",{},{"id":744,"data":745,"type":42,"tunes":747},"h-change",{"text":746,"level":219},"Šta bi promenilo ovaj odgovor?",{},{"id":749,"data":750,"type":226,"tunes":752},"p-change-1",{"text":751},"Jaz u pouzdanosti bi se smanjio ako bi modeli za korišćenje računara postali otporni na duge horizonte, dinamičko stanje, varijacije korisničkog interfejsa, kvarove u okruženju i dvosmislene ciljeve kroz reprezentativne produkcione distribucije. Bolji izvorni API-ji za stanja, standardizovani mašinski čitljivi interfejsi i jača infrastruktura za verifikaciju takođe bi mogli smanjiti količinu krhke interakcije sa GUI-jem koja je neophodna.",{},{"id":754,"data":755,"type":226,"tunes":757},"p-change-2",{"text":756},"Prag za primenu se takođe menja sa posledicama zadatka. Stopa uspešnosti od 70% može biti korisna za nadgledani istraživački zadatak niskog rizika, a potpuno neprihvatljiva za autonoman finansijski ili destruktivni radni tok. Pouzdanost se stoga mora procenjivati u odnosu na cenu svake klase neuspeha, a ne prema jednom univerzalnom pragu prolaznosti.",{},{"id":759,"data":760,"type":42,"tunes":762},"h-limitations",{"text":761,"level":219},"Ograničenja",{},{"id":764,"data":765,"type":226,"tunes":767},"p-limit-1",{"text":766},"Navedeni benčmark testovi procenjuju različita okruženja i ne bi trebalo da se rangiraju jedni protiv drugih kao da mere istu stvar. WAREX testira nepouzdanost veba; WeaveBench cilja hibridni rad dugog horizonta; OSWorld 2.0 cilja realistične duge radne tokove; BLIND-ACT se fokusira na rukovanje ciljevima pod dvosmislenošću i neizvodljivošću.",{},{"id":769,"data":770,"type":226,"tunes":772},"p-limit-2",{"text":771},"Rezultati benčmarka takođe brzo zastarevaju. Poboljšanja modela, testnog okruženja i verifikatora mogu materijalno promeniti rezultate u roku od nekoliko meseci. Trajna pouka je stoga metod evaluacije: varirajte uslove, odvojte proces od ishoda, verifikujte eksterno stanje i očuvajte granice oko svake tvrdnje o performansama.",{},{"id":774,"data":775,"type":42,"tunes":777},"h-conclusion",{"text":776,"level":219},"Zaključak",{},{"id":779,"data":780,"type":226,"tunes":782},"p-conclusion-1",{"text":781},"Agenti za korišćenje računara već su dovoljno sposobni da budu korisni. Upravo zato se pitanje evaluacije promenilo. Izazov više nije samo da li agent može da prođe kroz radni tok kliktanjem. Pitanje je da li sistem ostaje pouzdan kada nestanu besprekorni uslovi demonstracije.",{},{"id":784,"data":785,"type":226,"tunes":787},"p-conclusion-2",{"text":786},"Tretirajte jedno uspešno izvršavanje kao dokaz sposobnosti. Zatim testirajte ponovljivost, robusnost na promene u okruženju, kontrolu na dugim vremenskim horizontima, svest o stanju, verifikaciju ishoda i bezbedno upravljanje ciljevima. Produkcijski agent za korišćenje računara nije onaj koji može da završi demo. To je onaj čije su granice otkaza poznate, izmerene i kontrolisane.",{},{"id":789,"data":790,"type":42,"tunes":792},"h-faq",{"text":791,"level":219},"Često postavljana pitanja",{},{"id":794,"data":795,"type":794,"tunes":822},"faq",{"items":796,"title":821},[797,801,805,809,813,817],{"id":798,"answer":799,"question":800},"faq1","Ne. To dokazuje sposobnost pod jednom posmatranom putanjom. Produkcijska pouzdanost zahteva ponovljeni uspeh kroz varijacije u okruženju, dugotrajne zadatke, promenljivo stanje, dvosmislenost, uslove oporavka i radnje sa posledicama.","Da li uspešan demo agenta za korišćenje računara dokazuje produkcijsku pouzdanost?",{"id":802,"answer":803,"question":804},"faq2","Benčmark testovi mogu koristiti više kontrolisana okruženja, kraće zadatke, stabilne mrežne uslove, jednostavnije kombinacije aplikacija ili kriterijume ishoda koji ne beleže sve greške u procesu. Tačna granica validnosti zavisi od svakog pojedinačnog benčmarka.","Zašto benčmark testovi za korišćenje računara mogu izgledati znatno bolje od performansi u stvarnom svetu?",{"id":806,"answer":807,"question":808},"faq3","Verifikujte stvarni spoljni ishod. Nemojte tretirati konačnu izjavu agenta ili planirani redosled klikova kao dokaz da je ciljni sistem prihvatio operaciju.","Koja je najvažnija provera pouzdanosti nakon radnje korišćenja računara?",{"id":810,"answer":811,"question":812},"faq4","Greške se akumuliraju kroz mnoge radnje, ograničenja se zaboravljaju, spoljno stanje se menja, rad obuhvata više aplikacija, skriveno stanje je važno, a agent mora da odluči kada da sačeka, pita, verifikuje ili se oporavi, umesto da jednostavno nastavi sa delovanjem.","Zašto računarski zadaci sa dugim vremenskim horizontom ostaju teški?",{"id":814,"answer":815,"question":816},"faq5","Ponavljajte čiste zadatke, ubacujte realistične greške u okruženju, varirajte korisnički interfejs i stanje, produžite horizont radnog toka, uvedite dvosmislenost, zahtevajte vidljiv dokaz ishoda, testirajte kontrole radnji visokog uticaja i ponovo pokrenite skup testova nakon izmena modela ili okvira.","Kako treba testirati agenta za pregledač ili desktop pre uvođenja u produkciju?",{"id":818,"answer":819,"question":820},"faq6","Ne za svaku radnju niskog rizika. Zahtevi za potvrdom treba da budu srazmerni posledicama, reverzibilnosti, ovlašćenjima i neizvesnosti. Radnje visokog uticaja, spolja vidljive ili one koje je teško poništiti zahtevaju strože kontrole.","Da li agenti za korišćenje računara uvek treba da zahtevaju ljudsku potvrdu?","Pouzdanost agenata za korišćenje računara",{},{"id":824,"data":825,"type":42,"tunes":827},"h-glossary",{"text":826,"level":219},"Rečnik pojmova",{},{"id":829,"data":830,"type":829,"tunes":857},"glossary",{"title":831,"entries":832},"Ključni pojmovi o pouzdanosti",[833,837,841,845,849,853],{"term":834,"anchor":835,"definition":836},"Agent za korišćenje računara","computer-use-agent","AI agent koji interaguje sa grafičkim korisničkim interfejsima ili računarskim okruženjima putem opažanja i radnji kao što su kliktanje, kucanje, skrolovanje, operacije sa datotekama ili radni tokovi kroz više aplikacija.",{"term":838,"anchor":839,"definition":840},"Ponovljivost","repeatability","Stepen u kojem agent može dosledno da završi isti zadatak tokom ponovljenih pokretanja, umesto da bude uspešan samo na odabranim putanjama.",{"term":842,"anchor":843,"definition":844},"Robusnost na okruženje","environmental-robustness","Sposobnost očuvanja ispravnog ponašanja uprkos realnim varijacijama kao što su kašnjenje, prolazne greške, izmene u korisničkom interfejsu, stanje sesije i neočekivani uslovi na stranici.",{"term":846,"anchor":847,"definition":848},"Verifikacija ishoda","outcome-verification","Provera stvarnog spoljnog stanja nakon radnje radi potvrde da je došlo do željenog rezultata, umesto oslanjanja na agentov sopstveni izveštaj.",{"term":850,"anchor":851,"definition":852},"Slepa usmerenost ka cilju","blind-goal-directedness","Obrazac otkaza u kojem agent za korišćenje računara nastavlja da teži cilju uprkos dvosmislenosti, neizvodljivosti, kontradiktornim uslovima ili razlozima za zaustavljanje i ponovnu procenu.",{"term":854,"anchor":855,"definition":856},"Granica pouzdanosti","reliability-boundary","Skup uslova pod kojima uočena stopa uspeha ili tvrdnja o sposobnosti ostaje dovoljno reprezentativna za konkretnu odluku o uvođenju u produkciju.",{},{"id":859,"data":860,"type":42,"tunes":862},"h-sources",{"text":861,"level":219},"Primarni izvori i preporučena literatura",{},{"id":864,"data":865,"type":871,"tunes":872},"src-openai-computer",{"link":866,"meta":867},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use",{"image":868,"title":869,"description":870},{"url":554},"OpenAI — Computer use","Aktuelna uputstva za programere o izolaciji okruženja, tretiranju sadržaja ekrana kao nepouzdanog, potvrđivanju radnji sa posledicama, ograničavanju izvršavanja i verifikaciji ishoda.","linkTool",{},{"id":874,"data":875,"type":871,"tunes":881},"src-openai-safety",{"link":876,"meta":877},"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F",{"image":878,"title":879,"description":880},{"url":554},"OpenAI — Running Codex safely at OpenAI","Aktuelna uputstva za produkciju o tehničkim granicama, odobrenju ljudi, telemetriji i kontroli agenata koji deluju na stvarnim sistemima.",{},{"id":883,"data":884,"type":871,"tunes":890},"src-ms-warex",{"link":885,"meta":886},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F",{"image":887,"title":888,"description":889},{"url":554},"Microsoft Research — WAREX","Evaluacija iz 2026. koja pokazuje da realistična nepouzdanost veba dovodi do značajnog pada uspešnosti zadataka agenata za pregledače na postojećim benčmark testovima.",{},{"id":892,"data":893,"type":871,"tunes":899},"src-ms-verifier",{"link":894,"meta":895},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F",{"image":896,"title":897,"description":898},{"url":554},"Microsoft Research — The Art of Building Verifiers for Computer Use Agents","Rad iz 2026. o evaluaciji procesa u odnosu na ishod, greškama koje se mogu kontrolisati u odnosu na one koje se ne mogu kontrolisati i pouzdanoj verifikaciji putanje.",{},{"id":901,"data":902,"type":871,"tunes":908},"src-ms-weavebench",{"link":903,"meta":904},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F",{"image":905,"title":906,"description":907},{"url":554},"Microsoft Research — WeaveBench","Benčmark iz 2026. za zadatke sa dugim vremenskim horizontom koji kombinuje GUI, CLI i tokove rada sa kodom, prikazujući znatan jaz između trenutnih agenata i pouzdanog završavanja zadataka u stvarnom svetu.",{},{"id":910,"data":911,"type":871,"tunes":917},"src-osworld2",{"link":912,"meta":913},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537",{"image":914,"title":915,"description":916},{"url":554},"OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","Benčmark iz 2026. fokusiran na realistične tokove rada korišćenja računara sa dugim vremenskim horizontom, skriveno stanje i rezonovanje kroz više izvora.",{},{"id":919,"data":920,"type":871,"tunes":926},"src-ms-sentinel",{"link":921,"meta":922},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F",{"image":923,"title":924,"description":925},{"url":554},"Microsoft Research — SentinelBench","Benčmark iz 2026. za vremenski promenljive zadatke gde agenti moraju da nadgledaju okruženja i reaguju na promene stanja, umesto da neprekidno deluju.",{},{"id":928,"data":929,"type":871,"tunes":935},"src-ms-blind",{"link":930,"meta":931},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F",{"image":932,"title":933,"description":934},{"url":554},"Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness","Istraživanje sa ICLR 2026 o agentima koji nastavljaju da teže dvosmislenim, kontradiktornim ili neizvodljivim ciljevima.",{},"2.31","Agenti za korišćenje računara sada mogu da završe impresivne radne tokove u pregledaču i na radnoj površini, ali jedno uspešno izvršavanje dokazuje sposobnost—ne pouzdanost. Ovaj članak pokazuje kako testirati ponovljivost, robusnost u odnosu na okruženje, kontrolu dugog horizonta, svest o stanju, verifikaciju ishoda i bezbedno upravljanje ciljevima.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg","PUBLISHED","2026-09-25T12:13:00.000Z","2026-09-25T16:13:28.344Z","2026-09-25T19:19:11.089Z",{"en":945,"de":946,"sr":947,"es":948,"fr":949,"it":950,"ru":951,"zh":952},"\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fde\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fsr\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fes\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Ffr\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fit\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fru\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fzh\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system",[954,958,962],{"id":955,"name":956,"slug":957},58,"Evaluacija i gate-ovi kvaliteta","evaluation",{"id":959,"name":960,"slug":961},97,"Verifikacija na test setu","verification",{"id":963,"name":964,"slug":965},73,"Verifikacija i diff","verification-and-diffing",{"id":967,"login":968,"email":969,"displayName":970},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[972,1564],{"lang":973,"title":974,"content":975,"contentJson":976,"excerpt":1563},"en","Computer-Use Agents: Why a Successful Demo Can Still Be an Unreliable System","{\"time\":1790352872794,\"blocks\":[{\"id\":\"IYG9UPcPY0\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents can now click, type, browse, edit files, operate desktop applications, and complete impressive multi-step tasks. That makes successful demos easy to understand and easy to overinterpret. A single completed workflow shows that the agent can succeed under those conditions. It does not show how often it succeeds, how it behaves when the environment changes, whether it verifies the result, or how safely it acts when the goal becomes ambiguous.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"\u003Cstrong>A successful computer-use demo proves capability, not reliability.\u003C\u002Fstrong> Production reliability requires the agent to succeed repeatedly across environmental variation, recover from transient failures, preserve constraints over long horizons, detect hidden or changing state, verify the actual outcome, and stop or ask when the goal becomes ambiguous or unsafe. The correct production question is not “Can the agent do this task?” but “Under which conditions can we trust it to do this task repeatedly?”\"},\"tunes\":{}},{\"id\":\"freshness\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Fast-moving field\",\"body\":\"This article reflects computer-use agent research and platform guidance available on \u003Cstrong>25 September 2026\u003C\u002Fstrong>. Benchmark results are not directly comparable across different task sets, environments, models, step limits, judges, or harnesses. Treat every benchmark number together with its evaluation conditions.\"},\"tunes\":{}},{\"id\":\"model-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"The model used in this article\",\"body\":\"The Computer-Use Reliability Ladder and Demo-to-Production Stress Test below are practical evaluation models proposed here. They are not formal industry standards.\"},\"tunes\":{}},{\"id\":\"h-demo\",\"type\":\"header\",\"data\":{\"text\":\"Why the demo is the easiest possible reliability test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-demo-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A demo normally shows one trajectory that worked. The environment is known, the task is selected in advance, the operator can restart after a failure, and the audience sees the successful path. Production systems face a distribution instead: different pages, network conditions, account states, pop-ups, latency, UI changes, hidden state, permissions, interruptions, and users who describe goals imperfectly.\"},\"tunes\":{}},{\"id\":\"p-demo-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That distinction matters because computer-use agents operate through interfaces designed for humans rather than deterministic APIs. Their action loop depends on perception, state interpretation, planning, interaction timing, and environment response. Small changes can alter the trajectory even when the user goal is unchanged.\"},\"tunes\":{}},{\"id\":\"p-demo-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Microsoft Research's WAREX work makes the problem explicit: benchmark agents that look capable in controlled settings lose substantial task success when realistic web instability is introduced. The failure is not necessarily “the model became less intelligent.” The environment stopped being deterministic.\"},\"tunes\":{}},{\"id\":\"h-claims\",\"type\":\"header\",\"data\":{\"text\":\"Capability, success rate, reliability, and safety are different claims\",\"level\":2},\"tunes\":{}},{\"id\":\"claims-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Claim\",\"What it actually establishes\",\"What it does not establish\"],[\"The agent completed the task once\",\"Capability under one observed trajectory\",\"Repeatability, robustness, safety, or generalization\"],[\"The agent scores highly on a benchmark\",\"Performance under that benchmark's task and evaluation conditions\",\"Equivalent production performance on different environments\"],[\"The agent usually reaches the goal\",\"Outcome success frequency\",\"Correct process, safe behaviour, or evidence that the result was verified\"],[\"The agent follows the intended process\",\"Trajectory quality under the evaluated rubric\",\"That the external environment actually accepted the final outcome\"],[\"The agent avoids unsafe actions in a test set\",\"Performance on represented safety cases\",\"Safety under every novel ambiguity, injection, or side effect\"]]},\"tunes\":{}},{\"id\":\"h-ladder\",\"type\":\"header\",\"data\":{\"text\":\"The Computer-Use Reliability Ladder\",\"level\":2},\"tunes\":{}},{\"id\":\"p-ladder-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A useful way to evaluate computer-use systems is to move from one-off capability toward progressively harder reliability properties. Higher levels assume the lower levels but do not follow automatically from them.\"},\"tunes\":{}},{\"id\":\"ladder-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Computer-Use Reliability Ladder\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Capability\",\"description\":\"Can the agent complete the task at least once under known conditions?\"},{\"label\":\"2. Repeatability\",\"description\":\"Can it complete the same task consistently across repeated trials?\"},{\"label\":\"3. Environmental robustness\",\"description\":\"Does it survive timing changes, network issues, pop-ups, UI variation, and small environmental perturbations?\"},{\"label\":\"4. Long-horizon control\",\"description\":\"Can it preserve goals, constraints, and progress across many steps, applications, and delayed events?\"},{\"label\":\"5. State awareness\",\"description\":\"Can it detect when the environment changed, when hidden state matters, or when an assumption is no longer valid?\"},{\"label\":\"6. Outcome verification\",\"description\":\"Does it verify that the intended result actually happened instead of trusting its own action sequence?\"},{\"label\":\"7. Safe goal handling\",\"description\":\"Can it stop, ask, refuse, or hand control back when the goal is ambiguous, infeasible, contradictory, or high impact?\"}]},\"tunes\":{}},{\"id\":\"h-capability\",\"type\":\"header\",\"data\":{\"text\":\"Level 1 — Capability: the demo question\",\"level\":3},\"tunes\":{}},{\"id\":\"p-capability-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Capability asks whether an agent can perform the task at all. This is valuable. Computer-use systems have advanced rapidly, and modern agents can complete workflows that older systems could not execute reliably.\"},\"tunes\":{}},{\"id\":\"p-capability-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"But capability is a weak deployment criterion. One successful run does not tell you whether the agent succeeds 95% of the time or 30% of the time, whether failures are harmless or destructive, or whether success depends on a lucky page state.\"},\"tunes\":{}},{\"id\":\"h-repeatability\",\"type\":\"header\",\"data\":{\"text\":\"Level 2 — Repeatability: does the same task stay solved?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-repeat-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use trajectories are stochastic. Model outputs vary, pages load at different speeds, visual states change, and long workflows create many branching opportunities. A production test should therefore run the same task multiple times rather than treating one passing trace as representative.\"},\"tunes\":{}},{\"id\":\"p-repeat-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Measure not only the average success rate but also the distribution of failure modes: wrong click, premature termination, missed confirmation, incorrect field, duplicate action, navigation loop, stale-state assumption, and false success report.\"},\"tunes\":{}},{\"id\":\"h-robustness\",\"type\":\"header\",\"data\":{\"text\":\"Level 3 — Environmental robustness: what happens when the web behaves like the web?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-robust-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Real websites are not benchmark fixtures. Requests fail, elements load late, sessions expire, pages change, consent banners appear, servers return errors, and network conditions fluctuate.\"},\"tunes\":{}},{\"id\":\"p-robust-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"WAREX evaluates this gap by injecting realistic web unreliability into existing benchmark environments and reports significant drops in task success. This is a critical production insight: a benchmark can measure task competence while under-measuring recovery from environmental instability.\"},\"tunes\":{}},{\"id\":\"robust-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"Reliability test\",\"body\":\"Inject delays, transient HTTP failures, stale page state, modal dialogs, session expiration, duplicate responses, and controlled UI variation. If the agent only works on the clean path, it is a demo-capable system, not a production-reliable one.\"},\"tunes\":{}},{\"id\":\"h-long\",\"type\":\"header\",\"data\":{\"text\":\"Level 4 — Long-horizon control: success changes when the task becomes real work\",\"level\":3},\"tunes\":{}},{\"id\":\"p-long-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Short tasks hide a class of failures that appear only after dozens or hundreds of actions: forgotten constraints, duplicated work, premature completion, missed state changes, cross-application inconsistencies, and accumulated small errors.\"},\"tunes\":{}},{\"id\":\"p-long-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OSWorld 2.0 was designed specifically around long-horizon real-world workflows. Its tasks take human users a median of roughly 1.6 hours and require many more tool calls than earlier computer-use benchmarks. Under its primary completion metric, even the strongest evaluated systems remain far from complete task reliability.\"},\"tunes\":{}},{\"id\":\"p-long-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"WeaveBench reaches a similar conclusion from another angle. It evaluates hybrid GUI, CLI and code workflows and reports that the best evaluated model-runtime pairing passes only 41.2% of tasks. The important result is not one leaderboard number; it is that realistic cross-interface orchestration exposes failures hidden by simpler single-interface tasks.\"},\"tunes\":{}},{\"id\":\"h-state\",\"type\":\"header\",\"data\":{\"text\":\"Level 5 — State awareness: the environment can change underneath the plan\",\"level\":3},\"tunes\":{}},{\"id\":\"p-state-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running tasks often depend on hidden or changing state: an email arrives, a calendar changes, a form is submitted, a background process finishes, a browser session expires, a user modifies a file, or an external system changes availability.\"},\"tunes\":{}},{\"id\":\"p-state-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Microsoft's SentinelBench argues that many long-running tasks should not be solved through continuous action at all. The correct behaviour may be to monitor, wait for an external event, then act when the state changes. This is a different capability from clicking faster or planning more steps.\"},\"tunes\":{}},{\"id\":\"p-state-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"A reliable computer-use agent therefore needs to distinguish actionable now, waiting for state, state changed, and assumption invalidated.\"},\"tunes\":{}},{\"id\":\"h-verify\",\"type\":\"header\",\"data\":{\"text\":\"Level 6 — Outcome verification: did the action actually work?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-verify-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An agent can execute an apparently correct sequence and still fail the task. A button click may not register. A form may reject hidden validation. A file may save to the wrong directory. A purchase may remain unconfirmed. A site may display a success-looking screen while the underlying operation failed.\"},\"tunes\":{}},{\"id\":\"p-verify-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current computer-use guidance explicitly recommends bounding and verifying the run instead of relying only on the model's final answer. Microsoft Research's work on computer-use verifiers reaches the same conclusion from evaluation: process and outcome need to be judged separately.\"},\"tunes\":{}},{\"id\":\"p-verify-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The Universal Verifier research reports that earlier verifier setups can produce high false-positive rates, while stronger rubric design and explicit separation of process, outcome, controllable failures, and uncontrollable failures substantially improve agreement with human labels.\"},\"tunes\":{}},{\"id\":\"h-safe-goal\",\"type\":\"header\",\"data\":{\"text\":\"Level 7 — Safe goal handling: the agent must know when not to continue\",\"level\":3},\"tunes\":{}},{\"id\":\"p-safe-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents are optimized to complete goals, but goal persistence can itself become a failure mode. An ambiguous request, impossible condition, contradictory instruction, suspicious webpage, or changed environment may require clarification or stopping rather than more action.\"},\"tunes\":{}},{\"id\":\"p-safe-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The BLIND-ACT benchmark studies this problem as Blind Goal-Directedness. Across the systems evaluated in that work, agents frequently continued pursuing tasks despite ambiguity, infeasibility, conflicting context, or other reasons to reconsider. The authors identify patterns such as execution-first bias and request primacy.\"},\"tunes\":{}},{\"id\":\"p-safe-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"This failure class matters because a highly capable agent can make a bad situation worse faster. Reliability therefore includes a policy for when not to act.\"},\"tunes\":{}},{\"id\":\"h-stress\",\"type\":\"header\",\"data\":{\"text\":\"The Demo-to-Production Stress Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-stress-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Before deploying a computer-use workflow, take the successful demo and systematically remove the assumptions that made it easy.\"},\"tunes\":{}},{\"id\":\"stress-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Demo-to-Production Stress Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Re-run the clean task\",\"description\":\"Establish repeatability over multiple trials before adding complexity.\"},{\"label\":\"2. Perturb the environment\",\"description\":\"Add latency, retries, pop-ups, page variation, stale sessions and temporary failures.\"},{\"label\":\"3. Extend the horizon\",\"description\":\"Turn the short demo into the full real workflow with intermediate state, multiple applications and delayed steps.\"},{\"label\":\"4. Change hidden state\",\"description\":\"Modify account, file, task or external state after the agent has formed a plan and test whether it detects the change.\"},{\"label\":\"5. Inject ambiguity\",\"description\":\"Remove one important assumption and test whether the agent asks instead of guessing.\"},{\"label\":\"6. Inject a controlled contradiction\",\"description\":\"Present old and new state together and verify that authoritative current state wins.\"},{\"label\":\"7. Require outcome proof\",\"description\":\"Make task completion depend on verifiable final state, not the model's self-report.\"},{\"label\":\"8. Test consequential boundaries\",\"description\":\"Confirm that irreversible or sensitive actions trigger the expected approval, refusal or handoff.\"},{\"label\":\"9. Repeat after harness or model changes\",\"description\":\"Treat runtime upgrades as reliability changes that need regression testing.\"}]},\"tunes\":{}},{\"id\":\"h-benchmark-boundary\",\"type\":\"header\",\"data\":{\"text\":\"Benchmark success has a validity boundary\",\"level\":2},\"tunes\":{}},{\"id\":\"p-boundary-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A benchmark score is a conditional statement. It is valid for a particular model, harness, environment, task set, judge, tool interface, step budget, retry policy, date and evaluation method.\"},\"tunes\":{}},{\"id\":\"p-boundary-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The number becomes misleading when those conditions disappear from the claim. “Agent X scores 80%” is weaker than “Agent X scored 80% on benchmark Y under environment Z with judge J and step budget N.” The second statement preserves the boundary that tells you whether the number transfers to your application.\"},\"tunes\":{}},{\"id\":\"ref-avb\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\",\"title\":\"The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers\",\"excerpt\":\"A framework for making explicit the conditions under which an AI claim remains valid and what changes require restriction, recalculation, or abandonment.\",\"ctaLabel\":\"Read the Answer Validity Boundary\"},\"tunes\":{}},{\"id\":\"h-process-outcome\",\"type\":\"header\",\"data\":{\"text\":\"Process success and outcome success must be scored separately\",\"level\":2},\"tunes\":{}},{\"id\":\"process-outcome-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Four possible outcomes of one computer-use run\",\"layout\":\"table\",\"columns\":[{\"id\":\"process\",\"label\":\"Process\"},{\"id\":\"outcome\",\"label\":\"Outcome\"},{\"id\":\"interpretation\",\"label\":\"Interpretation\"}],\"rows\":[{\"id\":\"good-good\",\"label\":\"Correct process \u002F correct outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"bad-good\",\"label\":\"Wrong process \u002F correct outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"good-bad\",\"label\":\"Correct process \u002F wrong outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"bad-bad\",\"label\":\"Wrong process \u002F wrong outcome\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"p-process-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"WeaveBench reports that outcome-only grading can materially overestimate computer-use performance because an agent may produce an apparently successful artifact through a shortcut or fabricated evidence. The verifier must inspect the trajectory and deliverables, not merely the final claim.\"},\"tunes\":{}},{\"id\":\"h-distribution\",\"type\":\"header\",\"data\":{\"text\":\"Production reliability is a distribution, not a single pass rate\",\"level\":2},\"tunes\":{}},{\"id\":\"p-dist-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A useful production evaluation samples the dimensions that actually vary in your environment. For a browser workflow, that might include account age, locale, viewport, page version, network quality, authentication state, existing cart state, cookies, pop-ups, user permissions and whether a human interrupts the run.\"},\"tunes\":{}},{\"id\":\"distribution-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Dimension\",\"Example variation\",\"Why it matters\"],[\"Environment\",\"Fast vs slow network, transient failures, page timing\",\"Tests recovery and waiting behaviour\"],[\"UI\",\"Different viewport, modal, reordered element, minor redesign\",\"Tests brittle visual\u002Faction assumptions\"],[\"State\",\"Logged in\u002Fout, empty\u002Fnon-empty cart, existing file, changed permissions\",\"Tests hidden-state reasoning\"],[\"Task horizon\",\"5 steps vs 50+ steps, one app vs several apps\",\"Tests accumulated trajectory error\"],[\"Ambiguity\",\"Missing preference or incomplete user instruction\",\"Tests whether the agent asks instead of guesses\"],[\"Consequence\",\"Read-only vs purchase\u002Fsend\u002Fdelete\u002Fchange\",\"Tests confirmation and authorization controls\"],[\"Adversarial content\",\"Prompt injection or misleading page text\",\"Tests instruction hierarchy and containment\"],[\"Model \u002F harness version\",\"Runtime upgrade\",\"Tests regression from system-level changes\"]]},\"tunes\":{}},{\"id\":\"h-budget\",\"type\":\"header\",\"data\":{\"text\":\"Reliability needs a failure budget, not perfection\",\"level\":2},\"tunes\":{}},{\"id\":\"p-budget-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"No production system is perfectly reliable. The useful engineering question is which failures are acceptable, detectable and recoverable. A failed attempt to sort a local folder is not equivalent to sending the wrong email, purchasing the wrong product or changing an account setting.\"},\"tunes\":{}},{\"id\":\"p-budget-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Classify actions by consequence and reversibility. Low-impact reversible actions can tolerate more autonomy. High-impact, externally visible or hard-to-reverse actions need stronger confirmation, state verification, authorization and post-action checks.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A practical computer-use reliability matrix\",\"level\":2},\"tunes\":{}},{\"id\":\"control-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Action class\",\"Example\",\"Recommended control\"],[\"Read \u002F inspect\",\"Open pages, read files, gather information\",\"Bound scope, log sources, tolerate recoverable navigation errors\"],[\"Reversible local change\",\"Edit draft file, reorganize temporary workspace\",\"Checkpoint or version before change; verify result\"],[\"External communication\",\"Send email, publish content, submit form\",\"User confirmation or explicit delegated authority; verify accepted state\"],[\"Financial \u002F transactional\",\"Purchase, checkout, paid subscription\",\"Strict mandate, amount\u002Fmerchant constraints, final confirmation and receipt verification\"],[\"Destructive \u002F privilege-changing\",\"Delete data, change permissions, revoke access\",\"Narrow authorization, explicit confirmation, reversible path where possible, post-action audit\"]]},\"tunes\":{}},{\"id\":\"h-log\",\"type\":\"header\",\"data\":{\"text\":\"What to log for a computer-use failure\",\"level\":2},\"tunes\":{}},{\"id\":\"log-list\",\"type\":\"list\",\"data\":{\"style\":\"unordered\",\"meta\":{},\"items\":[\"User goal and explicit constraints.\",\"Model and harness version.\",\"Environment and application versions.\",\"Screenshots or structured observations relevant to the failure.\",\"Actions taken with timestamps.\",\"Tool, click, keyboard and navigation results.\",\"State transitions and waiting periods.\",\"Approval, refusal or handoff events.\",\"External errors and network failures.\",\"Final observable environment state.\",\"The agent's reported outcome.\",\"Verifier result and whether the failure was controllable by the agent.\"]},\"tunes\":{}},{\"id\":\"p-log-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The crucial comparison is between reported success and observable success. A system that cannot distinguish those two will eventually accumulate false positives in production.\"},\"tunes\":{}},{\"id\":\"ref-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"A broader reliability model for evaluating agent trajectories, tool use and intermediate decisions instead of accepting the final answer as proof that the system worked correctly.\",\"ctaLabel\":\"Read the agent reliability article\"},\"tunes\":{}},{\"id\":\"h-security\",\"type\":\"header\",\"data\":{\"text\":\"Security is part of reliability for computer-use agents\",\"level\":2},\"tunes\":{}},{\"id\":\"p-sec-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents do not merely read untrusted content; they can act after reading it. That turns prompt injection, malicious page content and phishing into execution-path risks.\"},\"tunes\":{}},{\"id\":\"p-sec-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current computer-use guidance recommends isolating the environment, allow-listing sites and actions, treating screen content as untrusted, confirming consequential actions, bounding the run and verifying the actual outcome. ChatGPT agent similarly uses confirmations, prompt-injection monitoring and supervised modes for sensitive contexts.\"},\"tunes\":{}},{\"id\":\"p-sec-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The architecture principle is broader than any one provider: content observed by the agent must not be allowed to redefine the user's authority. A webpage can provide data. It cannot grant permission to send data elsewhere, purchase something, change credentials or override the task boundary.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The reliability gap would narrow if computer-use models became robust to long horizons, dynamic state, UI variation, environmental failures and ambiguous goals across representative production distributions. Better native state APIs, standardized machine-readable interfaces and stronger verifier infrastructure could also reduce the amount of fragile GUI interaction required.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The deployment threshold also changes with task consequence. A 70% success rate can be useful for a supervised low-risk research task and unacceptable for an autonomous financial or destructive workflow. Reliability must therefore be evaluated against the cost of each failure class, not one universal pass-rate threshold.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The cited benchmarks evaluate different environments and should not be ranked against one another as if they measured the same thing. WAREX stresses web unreliability; WeaveBench targets hybrid long-horizon work; OSWorld 2.0 targets realistic long workflows; BLIND-ACT focuses on goal handling under ambiguity and infeasibility.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Benchmark results also age quickly. Model, harness and verifier improvements can materially change scores within months. The durable lesson is therefore the evaluation method: vary conditions, separate process from outcome, verify external state, and preserve the boundary around each performance claim.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents are already capable enough to be useful. That is exactly why the evaluation question has changed. The challenge is no longer only whether an agent can click through a workflow. It is whether the system remains dependable when the clean demo conditions disappear.\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Treat one successful run as evidence of capability. Then test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification and safe goal handling. A production computer-use agent is not the one that can complete the demo. It is the one whose failure boundaries are known, measured and controlled.\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Computer-use agent reliability\",\"items\":[{\"id\":\"faq1\",\"question\":\"Does a successful computer-use agent demo prove production reliability?\",\"answer\":\"No. It proves capability under one observed trajectory. Production reliability requires repeated success across environmental variation, long-running tasks, changing state, ambiguity, recovery conditions and consequential actions.\"},{\"id\":\"faq2\",\"question\":\"Why can computer-use benchmarks look much better than real-world performance?\",\"answer\":\"Benchmarks can use more controlled environments, shorter tasks, stable network conditions, simpler application combinations or outcome criteria that do not capture all process failures. The exact validity boundary depends on each benchmark.\"},{\"id\":\"faq3\",\"question\":\"What is the most important reliability check after a computer-use action?\",\"answer\":\"Verify the actual external outcome. Do not treat the agent's final statement or intended click sequence as proof that the target system accepted the operation.\"},{\"id\":\"faq4\",\"question\":\"Why do long-horizon computer tasks remain difficult?\",\"answer\":\"Errors accumulate across many actions, constraints are forgotten, external state changes, work spans multiple applications, hidden state matters, and the agent must decide when to wait, ask, verify or recover rather than simply continue acting.\"},{\"id\":\"faq5\",\"question\":\"How should I test a browser or desktop agent before deployment?\",\"answer\":\"Repeat clean tasks, inject realistic environmental failures, vary UI and state, extend the workflow horizon, introduce ambiguity, require observable outcome proof, test high-impact action controls and rerun the suite after model or harness changes.\"},{\"id\":\"faq6\",\"question\":\"Should computer-use agents always require human confirmation?\",\"answer\":\"Not for every low-risk action. Confirmation requirements should scale with consequence, reversibility, authority and uncertainty. High-impact, externally visible or difficult-to-reverse actions need stronger controls.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key reliability terms\",\"entries\":[{\"term\":\"Computer-use agent\",\"definition\":\"An AI agent that interacts with graphical user interfaces or computer environments through observations and actions such as clicking, typing, scrolling, file operations or cross-application workflows.\",\"anchor\":\"computer-use-agent\"},{\"term\":\"Repeatability\",\"definition\":\"The degree to which an agent can complete the same task consistently across repeated runs rather than succeeding only on selected trajectories.\",\"anchor\":\"repeatability\"},{\"term\":\"Environmental robustness\",\"definition\":\"The ability to preserve correct behaviour despite realistic variation such as latency, transient errors, UI changes, session state and unexpected page conditions.\",\"anchor\":\"environmental-robustness\"},{\"term\":\"Outcome verification\",\"definition\":\"Checking the actual external state after an action to confirm that the intended result occurred instead of relying on the agent's self-report.\",\"anchor\":\"outcome-verification\"},{\"term\":\"Blind Goal-Directedness\",\"definition\":\"A failure pattern in which a computer-use agent continues pursuing a goal despite ambiguity, infeasibility, contradictory conditions or reasons to stop and reassess.\",\"anchor\":\"blind-goal-directedness\"},{\"term\":\"Reliability boundary\",\"definition\":\"The set of conditions under which an observed success rate or capability claim remains representative enough for a specific deployment decision.\",\"anchor\":\"reliability-boundary\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-computer\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use\",\"meta\":{\"title\":\"OpenAI — Computer use\",\"description\":\"Current developer guidance on isolating environments, treating screen content as untrusted, confirming consequential actions, bounding runs and verifying outcomes.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-openai-safety\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F\",\"meta\":{\"title\":\"OpenAI — Running Codex safely at OpenAI\",\"description\":\"Current production guidance on technical boundaries, human approval, telemetry and control for agents that act on real systems.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-warex\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F\",\"meta\":{\"title\":\"Microsoft Research — WAREX\",\"description\":\"2026 evaluation showing that realistic web unreliability causes significant drops in browser-agent task success on existing benchmarks.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-verifier\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F\",\"meta\":{\"title\":\"Microsoft Research — The Art of Building Verifiers for Computer Use Agents\",\"description\":\"2026 work on process versus outcome evaluation, controllable versus uncontrollable failures and reliable trajectory verification.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-weavebench\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F\",\"meta\":{\"title\":\"Microsoft Research — WeaveBench\",\"description\":\"2026 long-horizon benchmark combining GUI, CLI and code workflows and showing a substantial gap between current agents and reliable real-world completion.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-osworld2\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537\",\"meta\":{\"title\":\"OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks\",\"description\":\"2026 benchmark focused on realistic long-horizon computer-use workflows, hidden state and cross-source reasoning.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-sentinel\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F\",\"meta\":{\"title\":\"Microsoft Research — SentinelBench\",\"description\":\"2026 benchmark for time-evolving tasks where agents must monitor environments and respond to state changes rather than continuously act.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-blind\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F\",\"meta\":{\"title\":\"Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness\",\"description\":\"ICLR 2026 research on agents continuing to pursue ambiguous, contradictory or infeasible goals.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":977,"blocks":978,"version":1562},1790352872794,[979,983,987,992,997,1002,1006,1010,1014,1018,1022,1050,1054,1058,1084,1088,1092,1096,1100,1104,1108,1112,1116,1120,1125,1129,1133,1137,1141,1145,1149,1153,1157,1161,1165,1169,1173,1177,1181,1185,1189,1193,1197,1229,1233,1237,1241,1248,1252,1276,1280,1284,1288,1328,1332,1336,1340,1344,1372,1376,1393,1397,1404,1408,1412,1416,1420,1424,1428,1432,1436,1440,1444,1448,1452,1456,1460,1483,1487,1510,1514,1520,1526,1532,1538,1544,1550,1556],{"id":215,"data":980,"type":220,"tunes":982},{"title":981,"maxLevel":218,"minLevel":219},"Contents",{},{"id":223,"data":984,"type":226,"tunes":986},{"text":985},"Computer-use agents can now click, type, browse, edit files, operate desktop applications, and complete impressive multi-step tasks. That makes successful demos easy to understand and easy to overinterpret. A single completed workflow shows that the agent can succeed under those conditions. It does not show how often it succeeds, how it behaves when the environment changes, whether it verifies the result, or how safely it acts when the goal becomes ambiguous.",{},{"id":229,"data":988,"type":234,"tunes":991},{"body":989,"title":990,"variant":233},"\u003Cstrong>A successful computer-use demo proves capability, not reliability.\u003C\u002Fstrong> Production reliability requires the agent to succeed repeatedly across environmental variation, recover from transient failures, preserve constraints over long horizons, detect hidden or changing state, verify the actual outcome, and stop or ask when the goal becomes ambiguous or unsafe. The correct production question is not “Can the agent do this task?” but “Under which conditions can we trust it to do this task repeatedly?”","Direct answer",{},{"id":237,"data":993,"type":234,"tunes":996},{"body":994,"title":995,"variant":241},"This article reflects computer-use agent research and platform guidance available on \u003Cstrong>25 September 2026\u003C\u002Fstrong>. Benchmark results are not directly comparable across different task sets, environments, models, step limits, judges, or harnesses. Treat every benchmark number together with its evaluation conditions.","Fast-moving field",{},{"id":244,"data":998,"type":234,"tunes":1001},{"body":999,"title":1000,"variant":248},"The Computer-Use Reliability Ladder and Demo-to-Production Stress Test below are practical evaluation models proposed here. They are not formal industry standards.","The model used in this article",{},{"id":251,"data":1003,"type":42,"tunes":1005},{"text":1004,"level":219},"Why the demo is the easiest possible reliability test",{},{"id":256,"data":1007,"type":226,"tunes":1009},{"text":1008},"A demo normally shows one trajectory that worked. The environment is known, the task is selected in advance, the operator can restart after a failure, and the audience sees the successful path. Production systems face a distribution instead: different pages, network conditions, account states, pop-ups, latency, UI changes, hidden state, permissions, interruptions, and users who describe goals imperfectly.",{},{"id":261,"data":1011,"type":226,"tunes":1013},{"text":1012},"That distinction matters because computer-use agents operate through interfaces designed for humans rather than deterministic APIs. Their action loop depends on perception, state interpretation, planning, interaction timing, and environment response. Small changes can alter the trajectory even when the user goal is unchanged.",{},{"id":266,"data":1015,"type":226,"tunes":1017},{"text":1016},"Microsoft Research's WAREX work makes the problem explicit: benchmark agents that look capable in controlled settings lose substantial task success when realistic web instability is introduced. The failure is not necessarily “the model became less intelligent.” The environment stopped being deterministic.",{},{"id":271,"data":1019,"type":42,"tunes":1021},{"text":1020,"level":219},"Capability, success rate, reliability, and safety are different claims",{},{"id":276,"data":1023,"type":303,"tunes":1049},{"content":1024,"stretched":43,"withHeadings":14},[1025,1029,1033,1037,1041,1045],[1026,1027,1028],"Claim","What it actually establishes","What it does not establish",[1030,1031,1032],"The agent completed the task once","Capability under one observed trajectory","Repeatability, robustness, safety, or generalization",[1034,1035,1036],"The agent scores highly on a benchmark","Performance under that benchmark's task and evaluation conditions","Equivalent production performance on different environments",[1038,1039,1040],"The agent usually reaches the goal","Outcome success frequency","Correct process, safe behaviour, or evidence that the result was verified",[1042,1043,1044],"The agent follows the intended process","Trajectory quality under the evaluated rubric","That the external environment actually accepted the final outcome",[1046,1047,1048],"The agent avoids unsafe actions in a test set","Performance on represented safety cases","Safety under every novel ambiguity, injection, or side effect",{},{"id":306,"data":1051,"type":42,"tunes":1053},{"text":1052,"level":219},"The Computer-Use Reliability Ladder",{},{"id":311,"data":1055,"type":226,"tunes":1057},{"text":1056},"A useful way to evaluate computer-use systems is to move from one-off capability toward progressively harder reliability properties. Higher levels assume the lower levels but do not follow automatically from them.",{},{"id":316,"data":1059,"type":341,"tunes":1083},{"steps":1060,"title":1082,"orientation":340},[1061,1064,1067,1070,1073,1076,1079],{"label":1062,"description":1063},"1. Capability","Can the agent complete the task at least once under known conditions?",{"label":1065,"description":1066},"2. Repeatability","Can it complete the same task consistently across repeated trials?",{"label":1068,"description":1069},"3. Environmental robustness","Does it survive timing changes, network issues, pop-ups, UI variation, and small environmental perturbations?",{"label":1071,"description":1072},"4. Long-horizon control","Can it preserve goals, constraints, and progress across many steps, applications, and delayed events?",{"label":1074,"description":1075},"5. State awareness","Can it detect when the environment changed, when hidden state matters, or when an assumption is no longer valid?",{"label":1077,"description":1078},"6. Outcome verification","Does it verify that the intended result actually happened instead of trusting its own action sequence?",{"label":1080,"description":1081},"7. Safe goal handling","Can it stop, ask, refuse, or hand control back when the goal is ambiguous, infeasible, contradictory, or high impact?","Computer-Use Reliability Ladder",{},{"id":344,"data":1085,"type":42,"tunes":1087},{"text":1086,"level":218},"Level 1 — Capability: the demo question",{},{"id":349,"data":1089,"type":226,"tunes":1091},{"text":1090},"Capability asks whether an agent can perform the task at all. This is valuable. Computer-use systems have advanced rapidly, and modern agents can complete workflows that older systems could not execute reliably.",{},{"id":354,"data":1093,"type":226,"tunes":1095},{"text":1094},"But capability is a weak deployment criterion. One successful run does not tell you whether the agent succeeds 95% of the time or 30% of the time, whether failures are harmless or destructive, or whether success depends on a lucky page state.",{},{"id":359,"data":1097,"type":42,"tunes":1099},{"text":1098,"level":218},"Level 2 — Repeatability: does the same task stay solved?",{},{"id":364,"data":1101,"type":226,"tunes":1103},{"text":1102},"Computer-use trajectories are stochastic. Model outputs vary, pages load at different speeds, visual states change, and long workflows create many branching opportunities. A production test should therefore run the same task multiple times rather than treating one passing trace as representative.",{},{"id":369,"data":1105,"type":226,"tunes":1107},{"text":1106},"Measure not only the average success rate but also the distribution of failure modes: wrong click, premature termination, missed confirmation, incorrect field, duplicate action, navigation loop, stale-state assumption, and false success report.",{},{"id":374,"data":1109,"type":42,"tunes":1111},{"text":1110,"level":218},"Level 3 — Environmental robustness: what happens when the web behaves like the web?",{},{"id":379,"data":1113,"type":226,"tunes":1115},{"text":1114},"Real websites are not benchmark fixtures. Requests fail, elements load late, sessions expire, pages change, consent banners appear, servers return errors, and network conditions fluctuate.",{},{"id":384,"data":1117,"type":226,"tunes":1119},{"text":1118},"WAREX evaluates this gap by injecting realistic web unreliability into existing benchmark environments and reports significant drops in task success. This is a critical production insight: a benchmark can measure task competence while under-measuring recovery from environmental instability.",{},{"id":389,"data":1121,"type":234,"tunes":1124},{"body":1122,"title":1123,"variant":393},"Inject delays, transient HTTP failures, stale page state, modal dialogs, session expiration, duplicate responses, and controlled UI variation. If the agent only works on the clean path, it is a demo-capable system, not a production-reliable one.","Reliability test",{},{"id":396,"data":1126,"type":42,"tunes":1128},{"text":1127,"level":218},"Level 4 — Long-horizon control: success changes when the task becomes real work",{},{"id":401,"data":1130,"type":226,"tunes":1132},{"text":1131},"Short tasks hide a class of failures that appear only after dozens or hundreds of actions: forgotten constraints, duplicated work, premature completion, missed state changes, cross-application inconsistencies, and accumulated small errors.",{},{"id":406,"data":1134,"type":226,"tunes":1136},{"text":1135},"OSWorld 2.0 was designed specifically around long-horizon real-world workflows. Its tasks take human users a median of roughly 1.6 hours and require many more tool calls than earlier computer-use benchmarks. Under its primary completion metric, even the strongest evaluated systems remain far from complete task reliability.",{},{"id":411,"data":1138,"type":226,"tunes":1140},{"text":1139},"WeaveBench reaches a similar conclusion from another angle. It evaluates hybrid GUI, CLI and code workflows and reports that the best evaluated model-runtime pairing passes only 41.2% of tasks. The important result is not one leaderboard number; it is that realistic cross-interface orchestration exposes failures hidden by simpler single-interface tasks.",{},{"id":416,"data":1142,"type":42,"tunes":1144},{"text":1143,"level":218},"Level 5 — State awareness: the environment can change underneath the plan",{},{"id":421,"data":1146,"type":226,"tunes":1148},{"text":1147},"Long-running tasks often depend on hidden or changing state: an email arrives, a calendar changes, a form is submitted, a background process finishes, a browser session expires, a user modifies a file, or an external system changes availability.",{},{"id":426,"data":1150,"type":226,"tunes":1152},{"text":1151},"Microsoft's SentinelBench argues that many long-running tasks should not be solved through continuous action at all. The correct behaviour may be to monitor, wait for an external event, then act when the state changes. This is a different capability from clicking faster or planning more steps.",{},{"id":431,"data":1154,"type":226,"tunes":1156},{"text":1155},"A reliable computer-use agent therefore needs to distinguish actionable now, waiting for state, state changed, and assumption invalidated.",{},{"id":436,"data":1158,"type":42,"tunes":1160},{"text":1159,"level":218},"Level 6 — Outcome verification: did the action actually work?",{},{"id":441,"data":1162,"type":226,"tunes":1164},{"text":1163},"An agent can execute an apparently correct sequence and still fail the task. A button click may not register. A form may reject hidden validation. A file may save to the wrong directory. A purchase may remain unconfirmed. A site may display a success-looking screen while the underlying operation failed.",{},{"id":446,"data":1166,"type":226,"tunes":1168},{"text":1167},"OpenAI's current computer-use guidance explicitly recommends bounding and verifying the run instead of relying only on the model's final answer. Microsoft Research's work on computer-use verifiers reaches the same conclusion from evaluation: process and outcome need to be judged separately.",{},{"id":451,"data":1170,"type":226,"tunes":1172},{"text":1171},"The Universal Verifier research reports that earlier verifier setups can produce high false-positive rates, while stronger rubric design and explicit separation of process, outcome, controllable failures, and uncontrollable failures substantially improve agreement with human labels.",{},{"id":456,"data":1174,"type":42,"tunes":1176},{"text":1175,"level":218},"Level 7 — Safe goal handling: the agent must know when not to continue",{},{"id":461,"data":1178,"type":226,"tunes":1180},{"text":1179},"Computer-use agents are optimized to complete goals, but goal persistence can itself become a failure mode. An ambiguous request, impossible condition, contradictory instruction, suspicious webpage, or changed environment may require clarification or stopping rather than more action.",{},{"id":466,"data":1182,"type":226,"tunes":1184},{"text":1183},"The BLIND-ACT benchmark studies this problem as Blind Goal-Directedness. Across the systems evaluated in that work, agents frequently continued pursuing tasks despite ambiguity, infeasibility, conflicting context, or other reasons to reconsider. The authors identify patterns such as execution-first bias and request primacy.",{},{"id":471,"data":1186,"type":226,"tunes":1188},{"text":1187},"This failure class matters because a highly capable agent can make a bad situation worse faster. Reliability therefore includes a policy for when not to act.",{},{"id":476,"data":1190,"type":42,"tunes":1192},{"text":1191,"level":219},"The Demo-to-Production Stress Test",{},{"id":481,"data":1194,"type":226,"tunes":1196},{"text":1195},"Before deploying a computer-use workflow, take the successful demo and systematically remove the assumptions that made it easy.",{},{"id":486,"data":1198,"type":341,"tunes":1228},{"steps":1199,"title":1227,"orientation":340},[1200,1203,1206,1209,1212,1215,1218,1221,1224],{"label":1201,"description":1202},"1. Re-run the clean task","Establish repeatability over multiple trials before adding complexity.",{"label":1204,"description":1205},"2. Perturb the environment","Add latency, retries, pop-ups, page variation, stale sessions and temporary failures.",{"label":1207,"description":1208},"3. Extend the horizon","Turn the short demo into the full real workflow with intermediate state, multiple applications and delayed steps.",{"label":1210,"description":1211},"4. Change hidden state","Modify account, file, task or external state after the agent has formed a plan and test whether it detects the change.",{"label":1213,"description":1214},"5. Inject ambiguity","Remove one important assumption and test whether the agent asks instead of guessing.",{"label":1216,"description":1217},"6. Inject a controlled contradiction","Present old and new state together and verify that authoritative current state wins.",{"label":1219,"description":1220},"7. Require outcome proof","Make task completion depend on verifiable final state, not the model's self-report.",{"label":1222,"description":1223},"8. Test consequential boundaries","Confirm that irreversible or sensitive actions trigger the expected approval, refusal or handoff.",{"label":1225,"description":1226},"9. Repeat after harness or model changes","Treat runtime upgrades as reliability changes that need regression testing.","Demo-to-Production Stress Test",{},{"id":518,"data":1230,"type":42,"tunes":1232},{"text":1231,"level":219},"Benchmark success has a validity boundary",{},{"id":523,"data":1234,"type":226,"tunes":1236},{"text":1235},"A benchmark score is a conditional statement. It is valid for a particular model, harness, environment, task set, judge, tool interface, step budget, retry policy, date and evaluation method.",{},{"id":528,"data":1238,"type":226,"tunes":1240},{"text":1239},"The number becomes misleading when those conditions disappear from the claim. “Agent X scores 80%” is weaker than “Agent X scored 80% on benchmark Y under environment Z with judge J and step budget N.” The second statement preserves the boundary that tells you whether the number transfers to your application.",{},{"id":533,"data":1242,"type":539,"tunes":1247},{"url":1243,"title":1244,"excerpt":1245,"ctaLabel":1246},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers","A framework for making explicit the conditions under which an AI claim remains valid and what changes require restriction, recalculation, or abandonment.","Read the Answer Validity Boundary",{},{"id":542,"data":1249,"type":42,"tunes":1251},{"text":1250,"level":219},"Process success and outcome success must be scored separately",{},{"id":547,"data":1253,"type":578,"tunes":1275},{"rows":1254,"title":1267,"layout":303,"columns":1268},[1255,1258,1261,1264],{"id":551,"label":1256,"values":1257},"Correct process \u002F correct outcome",[554,554,554],{"id":556,"label":1259,"values":1260},"Wrong process \u002F correct outcome",[554,554,554],{"id":560,"label":1262,"values":1263},"Correct process \u002F wrong outcome",[554,554,554],{"id":564,"label":1265,"values":1266},"Wrong process \u002F wrong outcome",[554,554,554],"Four possible outcomes of one computer-use run",[1269,1271,1273],{"id":570,"label":1270},"Process",{"id":573,"label":1272},"Outcome",{"id":576,"label":1274},"Interpretation",{},{"id":581,"data":1277,"type":226,"tunes":1279},{"text":1278},"WeaveBench reports that outcome-only grading can materially overestimate computer-use performance because an agent may produce an apparently successful artifact through a shortcut or fabricated evidence. The verifier must inspect the trajectory and deliverables, not merely the final claim.",{},{"id":586,"data":1281,"type":42,"tunes":1283},{"text":1282,"level":219},"Production reliability is a distribution, not a single pass rate",{},{"id":591,"data":1285,"type":226,"tunes":1287},{"text":1286},"A useful production evaluation samples the dimensions that actually vary in your environment. For a browser workflow, that might include account age, locale, viewport, page version, network quality, authentication state, existing cart state, cookies, pop-ups, user permissions and whether a human interrupts the run.",{},{"id":596,"data":1289,"type":303,"tunes":1327},{"content":1290,"stretched":43,"withHeadings":14},[1291,1295,1299,1303,1307,1311,1315,1319,1323],[1292,1293,1294],"Dimension","Example variation","Why it matters",[1296,1297,1298],"Environment","Fast vs slow network, transient failures, page timing","Tests recovery and waiting behaviour",[1300,1301,1302],"UI","Different viewport, modal, reordered element, minor redesign","Tests brittle visual\u002Faction assumptions",[1304,1305,1306],"State","Logged in\u002Fout, empty\u002Fnon-empty cart, existing file, changed permissions","Tests hidden-state reasoning",[1308,1309,1310],"Task horizon","5 steps vs 50+ steps, one app vs several apps","Tests accumulated trajectory error",[1312,1313,1314],"Ambiguity","Missing preference or incomplete user instruction","Tests whether the agent asks instead of guesses",[1316,1317,1318],"Consequence","Read-only vs purchase\u002Fsend\u002Fdelete\u002Fchange","Tests confirmation and authorization controls",[1320,1321,1322],"Adversarial content","Prompt injection or misleading page text","Tests instruction hierarchy and containment",[1324,1325,1326],"Model \u002F harness version","Runtime upgrade","Tests regression from system-level changes",{},{"id":637,"data":1329,"type":42,"tunes":1331},{"text":1330,"level":219},"Reliability needs a failure budget, not perfection",{},{"id":642,"data":1333,"type":226,"tunes":1335},{"text":1334},"No production system is perfectly reliable. The useful engineering question is which failures are acceptable, detectable and recoverable. A failed attempt to sort a local folder is not equivalent to sending the wrong email, purchasing the wrong product or changing an account setting.",{},{"id":647,"data":1337,"type":226,"tunes":1339},{"text":1338},"Classify actions by consequence and reversibility. Low-impact reversible actions can tolerate more autonomy. High-impact, externally visible or hard-to-reverse actions need stronger confirmation, state verification, authorization and post-action checks.",{},{"id":652,"data":1341,"type":42,"tunes":1343},{"text":1342,"level":219},"A practical computer-use reliability matrix",{},{"id":657,"data":1345,"type":303,"tunes":1371},{"content":1346,"stretched":43,"withHeadings":14},[1347,1351,1355,1359,1363,1367],[1348,1349,1350],"Action class","Example","Recommended control",[1352,1353,1354],"Read \u002F inspect","Open pages, read files, gather information","Bound scope, log sources, tolerate recoverable navigation errors",[1356,1357,1358],"Reversible local change","Edit draft file, reorganize temporary workspace","Checkpoint or version before change; verify result",[1360,1361,1362],"External communication","Send email, publish content, submit form","User confirmation or explicit delegated authority; verify accepted state",[1364,1365,1366],"Financial \u002F transactional","Purchase, checkout, paid subscription","Strict mandate, amount\u002Fmerchant constraints, final confirmation and receipt verification",[1368,1369,1370],"Destructive \u002F privilege-changing","Delete data, change permissions, revoke access","Narrow authorization, explicit confirmation, reversible path where possible, post-action audit",{},{"id":686,"data":1373,"type":42,"tunes":1375},{"text":1374,"level":219},"What to log for a computer-use failure",{},{"id":691,"data":1377,"type":708,"tunes":1392},{"meta":1378,"items":1379,"style":707},{},[1380,1381,1382,1383,1384,1385,1386,1387,1388,1389,1390,1391],"User goal and explicit constraints.","Model and harness version.","Environment and application versions.","Screenshots or structured observations relevant to the failure.","Actions taken with timestamps.","Tool, click, keyboard and navigation results.","State transitions and waiting periods.","Approval, refusal or handoff events.","External errors and network failures.","Final observable environment state.","The agent's reported outcome.","Verifier result and whether the failure was controllable by the agent.",{},{"id":711,"data":1394,"type":226,"tunes":1396},{"text":1395},"The crucial comparison is between reported success and observable success. A system that cannot distinguish those two will eventually accumulate false positives in production.",{},{"id":716,"data":1398,"type":539,"tunes":1403},{"url":1399,"title":1400,"excerpt":1401,"ctaLabel":1402},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","A broader reliability model for evaluating agent trajectories, tool use and intermediate decisions instead of accepting the final answer as proof that the system worked correctly.","Read the agent reliability article",{},{"id":724,"data":1405,"type":42,"tunes":1407},{"text":1406,"level":219},"Security is part of reliability for computer-use agents",{},{"id":729,"data":1409,"type":226,"tunes":1411},{"text":1410},"Computer-use agents do not merely read untrusted content; they can act after reading it. That turns prompt injection, malicious page content and phishing into execution-path risks.",{},{"id":734,"data":1413,"type":226,"tunes":1415},{"text":1414},"OpenAI's current computer-use guidance recommends isolating the environment, allow-listing sites and actions, treating screen content as untrusted, confirming consequential actions, bounding the run and verifying the actual outcome. ChatGPT agent similarly uses confirmations, prompt-injection monitoring and supervised modes for sensitive contexts.",{},{"id":739,"data":1417,"type":226,"tunes":1419},{"text":1418},"The architecture principle is broader than any one provider: content observed by the agent must not be allowed to redefine the user's authority. A webpage can provide data. It cannot grant permission to send data elsewhere, purchase something, change credentials or override the task boundary.",{},{"id":744,"data":1421,"type":42,"tunes":1423},{"text":1422,"level":219},"What would change this answer?",{},{"id":749,"data":1425,"type":226,"tunes":1427},{"text":1426},"The reliability gap would narrow if computer-use models became robust to long horizons, dynamic state, UI variation, environmental failures and ambiguous goals across representative production distributions. Better native state APIs, standardized machine-readable interfaces and stronger verifier infrastructure could also reduce the amount of fragile GUI interaction required.",{},{"id":754,"data":1429,"type":226,"tunes":1431},{"text":1430},"The deployment threshold also changes with task consequence. A 70% success rate can be useful for a supervised low-risk research task and unacceptable for an autonomous financial or destructive workflow. Reliability must therefore be evaluated against the cost of each failure class, not one universal pass-rate threshold.",{},{"id":759,"data":1433,"type":42,"tunes":1435},{"text":1434,"level":219},"Limitations",{},{"id":764,"data":1437,"type":226,"tunes":1439},{"text":1438},"The cited benchmarks evaluate different environments and should not be ranked against one another as if they measured the same thing. WAREX stresses web unreliability; WeaveBench targets hybrid long-horizon work; OSWorld 2.0 targets realistic long workflows; BLIND-ACT focuses on goal handling under ambiguity and infeasibility.",{},{"id":769,"data":1441,"type":226,"tunes":1443},{"text":1442},"Benchmark results also age quickly. Model, harness and verifier improvements can materially change scores within months. The durable lesson is therefore the evaluation method: vary conditions, separate process from outcome, verify external state, and preserve the boundary around each performance claim.",{},{"id":774,"data":1445,"type":42,"tunes":1447},{"text":1446,"level":219},"Conclusion",{},{"id":779,"data":1449,"type":226,"tunes":1451},{"text":1450},"Computer-use agents are already capable enough to be useful. That is exactly why the evaluation question has changed. The challenge is no longer only whether an agent can click through a workflow. It is whether the system remains dependable when the clean demo conditions disappear.",{},{"id":784,"data":1453,"type":226,"tunes":1455},{"text":1454},"Treat one successful run as evidence of capability. Then test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification and safe goal handling. A production computer-use agent is not the one that can complete the demo. It is the one whose failure boundaries are known, measured and controlled.",{},{"id":789,"data":1457,"type":42,"tunes":1459},{"text":1458,"level":219},"FAQ",{},{"id":794,"data":1461,"type":794,"tunes":1482},{"items":1462,"title":1481},[1463,1466,1469,1472,1475,1478],{"id":798,"answer":1464,"question":1465},"No. It proves capability under one observed trajectory. Production reliability requires repeated success across environmental variation, long-running tasks, changing state, ambiguity, recovery conditions and consequential actions.","Does a successful computer-use agent demo prove production reliability?",{"id":802,"answer":1467,"question":1468},"Benchmarks can use more controlled environments, shorter tasks, stable network conditions, simpler application combinations or outcome criteria that do not capture all process failures. The exact validity boundary depends on each benchmark.","Why can computer-use benchmarks look much better than real-world performance?",{"id":806,"answer":1470,"question":1471},"Verify the actual external outcome. Do not treat the agent's final statement or intended click sequence as proof that the target system accepted the operation.","What is the most important reliability check after a computer-use action?",{"id":810,"answer":1473,"question":1474},"Errors accumulate across many actions, constraints are forgotten, external state changes, work spans multiple applications, hidden state matters, and the agent must decide when to wait, ask, verify or recover rather than simply continue acting.","Why do long-horizon computer tasks remain difficult?",{"id":814,"answer":1476,"question":1477},"Repeat clean tasks, inject realistic environmental failures, vary UI and state, extend the workflow horizon, introduce ambiguity, require observable outcome proof, test high-impact action controls and rerun the suite after model or harness changes.","How should I test a browser or desktop agent before deployment?",{"id":818,"answer":1479,"question":1480},"Not for every low-risk action. Confirmation requirements should scale with consequence, reversibility, authority and uncertainty. High-impact, externally visible or difficult-to-reverse actions need stronger controls.","Should computer-use agents always require human confirmation?","Computer-use agent reliability",{},{"id":824,"data":1484,"type":42,"tunes":1486},{"text":1485,"level":219},"Glossary",{},{"id":829,"data":1488,"type":829,"tunes":1509},{"title":1489,"entries":1490},"Key reliability terms",[1491,1494,1497,1500,1503,1506],{"term":1492,"anchor":835,"definition":1493},"Computer-use agent","An AI agent that interacts with graphical user interfaces or computer environments through observations and actions such as clicking, typing, scrolling, file operations or cross-application workflows.",{"term":1495,"anchor":839,"definition":1496},"Repeatability","The degree to which an agent can complete the same task consistently across repeated runs rather than succeeding only on selected trajectories.",{"term":1498,"anchor":843,"definition":1499},"Environmental robustness","The ability to preserve correct behaviour despite realistic variation such as latency, transient errors, UI changes, session state and unexpected page conditions.",{"term":1501,"anchor":847,"definition":1502},"Outcome verification","Checking the actual external state after an action to confirm that the intended result occurred instead of relying on the agent's self-report.",{"term":1504,"anchor":851,"definition":1505},"Blind Goal-Directedness","A failure pattern in which a computer-use agent continues pursuing a goal despite ambiguity, infeasibility, contradictory conditions or reasons to stop and reassess.",{"term":1507,"anchor":855,"definition":1508},"Reliability boundary","The set of conditions under which an observed success rate or capability claim remains representative enough for a specific deployment decision.",{},{"id":859,"data":1511,"type":42,"tunes":1513},{"text":1512,"level":219},"Primary sources and further reading",{},{"id":864,"data":1515,"type":871,"tunes":1519},{"link":866,"meta":1516},{"image":1517,"title":869,"description":1518},{"url":554},"Current developer guidance on isolating environments, treating screen content as untrusted, confirming consequential actions, bounding runs and verifying outcomes.",{},{"id":874,"data":1521,"type":871,"tunes":1525},{"link":876,"meta":1522},{"image":1523,"title":879,"description":1524},{"url":554},"Current production guidance on technical boundaries, human approval, telemetry and control for agents that act on real systems.",{},{"id":883,"data":1527,"type":871,"tunes":1531},{"link":885,"meta":1528},{"image":1529,"title":888,"description":1530},{"url":554},"2026 evaluation showing that realistic web unreliability causes significant drops in browser-agent task success on existing benchmarks.",{},{"id":892,"data":1533,"type":871,"tunes":1537},{"link":894,"meta":1534},{"image":1535,"title":897,"description":1536},{"url":554},"2026 work on process versus outcome evaluation, controllable versus uncontrollable failures and reliable trajectory verification.",{},{"id":901,"data":1539,"type":871,"tunes":1543},{"link":903,"meta":1540},{"image":1541,"title":906,"description":1542},{"url":554},"2026 long-horizon benchmark combining GUI, CLI and code workflows and showing a substantial gap between current agents and reliable real-world completion.",{},{"id":910,"data":1545,"type":871,"tunes":1549},{"link":912,"meta":1546},{"image":1547,"title":915,"description":1548},{"url":554},"2026 benchmark focused on realistic long-horizon computer-use workflows, hidden state and cross-source reasoning.",{},{"id":919,"data":1551,"type":871,"tunes":1555},{"link":921,"meta":1552},{"image":1553,"title":924,"description":1554},{"url":554},"2026 benchmark for time-evolving tasks where agents must monitor environments and respond to state changes rather than continuously act.",{},{"id":928,"data":1557,"type":871,"tunes":1561},{"link":930,"meta":1558},{"image":1559,"title":933,"description":1560},{"url":554},"ICLR 2026 research on agents continuing to pursue ambiguous, contradictory or infeasible goals.",{},"2.31.6","Computer-use agents can now complete impressive browser and desktop workflows, but one successful run proves capability—not reliability. This article shows how to test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification, and safe goal handling.",{"lang":7,"title":208,"content":210,"contentJson":1565,"excerpt":937},{"time":212,"blocks":1566,"version":936},[1567,1570,1573,1576,1579,1582,1585,1588,1591,1594,1597,1607,1610,1613,1624,1627,1630,1633,1636,1639,1642,1645,1648,1651,1654,1657,1660,1663,1666,1669,1672,1675,1678,1681,1684,1687,1690,1693,1696,1699,1702,1705,1708,1721,1724,1727,1730,1733,1736,1752,1755,1758,1761,1774,1777,1780,1783,1786,1796,1799,1804,1807,1810,1813,1816,1819,1822,1825,1828,1831,1834,1837,1840,1843,1846,1849,1852,1862,1865,1875,1878,1883,1888,1893,1898,1903,1908,1913],{"id":215,"data":1568,"type":220,"tunes":1569},{"title":217,"maxLevel":218,"minLevel":219},{},{"id":223,"data":1571,"type":226,"tunes":1572},{"text":225},{},{"id":229,"data":1574,"type":234,"tunes":1575},{"body":231,"title":232,"variant":233},{},{"id":237,"data":1577,"type":234,"tunes":1578},{"body":239,"title":240,"variant":241},{},{"id":244,"data":1580,"type":234,"tunes":1581},{"body":246,"title":247,"variant":248},{},{"id":251,"data":1583,"type":42,"tunes":1584},{"text":253,"level":219},{},{"id":256,"data":1586,"type":226,"tunes":1587},{"text":258},{},{"id":261,"data":1589,"type":226,"tunes":1590},{"text":263},{},{"id":266,"data":1592,"type":226,"tunes":1593},{"text":268},{},{"id":271,"data":1595,"type":42,"tunes":1596},{"text":273,"level":219},{},{"id":276,"data":1598,"type":303,"tunes":1606},{"content":1599,"stretched":43,"withHeadings":14},[1600,1601,1602,1603,1604,1605],[280,281,282],[284,285,286],[288,289,290],[292,293,294],[296,297,298],[300,301,302],{},{"id":306,"data":1608,"type":42,"tunes":1609},{"text":308,"level":219},{},{"id":311,"data":1611,"type":226,"tunes":1612},{"text":313},{},{"id":316,"data":1614,"type":341,"tunes":1623},{"steps":1615,"title":308,"orientation":340},[1616,1617,1618,1619,1620,1621,1622],{"label":320,"description":321},{"label":323,"description":324},{"label":326,"description":327},{"label":329,"description":330},{"label":332,"description":333},{"label":335,"description":336},{"label":338,"description":339},{},{"id":344,"data":1625,"type":42,"tunes":1626},{"text":346,"level":218},{},{"id":349,"data":1628,"type":226,"tunes":1629},{"text":351},{},{"id":354,"data":1631,"type":226,"tunes":1632},{"text":356},{},{"id":359,"data":1634,"type":42,"tunes":1635},{"text":361,"level":218},{},{"id":364,"data":1637,"type":226,"tunes":1638},{"text":366},{},{"id":369,"data":1640,"type":226,"tunes":1641},{"text":371},{},{"id":374,"data":1643,"type":42,"tunes":1644},{"text":376,"level":218},{},{"id":379,"data":1646,"type":226,"tunes":1647},{"text":381},{},{"id":384,"data":1649,"type":226,"tunes":1650},{"text":386},{},{"id":389,"data":1652,"type":234,"tunes":1653},{"body":391,"title":392,"variant":393},{},{"id":396,"data":1655,"type":42,"tunes":1656},{"text":398,"level":218},{},{"id":401,"data":1658,"type":226,"tunes":1659},{"text":403},{},{"id":406,"data":1661,"type":226,"tunes":1662},{"text":408},{},{"id":411,"data":1664,"type":226,"tunes":1665},{"text":413},{},{"id":416,"data":1667,"type":42,"tunes":1668},{"text":418,"level":218},{},{"id":421,"data":1670,"type":226,"tunes":1671},{"text":423},{},{"id":426,"data":1673,"type":226,"tunes":1674},{"text":428},{},{"id":431,"data":1676,"type":226,"tunes":1677},{"text":433},{},{"id":436,"data":1679,"type":42,"tunes":1680},{"text":438,"level":218},{},{"id":441,"data":1682,"type":226,"tunes":1683},{"text":443},{},{"id":446,"data":1685,"type":226,"tunes":1686},{"text":448},{},{"id":451,"data":1688,"type":226,"tunes":1689},{"text":453},{},{"id":456,"data":1691,"type":42,"tunes":1692},{"text":458,"level":218},{},{"id":461,"data":1694,"type":226,"tunes":1695},{"text":463},{},{"id":466,"data":1697,"type":226,"tunes":1698},{"text":468},{},{"id":471,"data":1700,"type":226,"tunes":1701},{"text":473},{},{"id":476,"data":1703,"type":42,"tunes":1704},{"text":478,"level":219},{},{"id":481,"data":1706,"type":226,"tunes":1707},{"text":483},{},{"id":486,"data":1709,"type":341,"tunes":1720},{"steps":1710,"title":478,"orientation":340},[1711,1712,1713,1714,1715,1716,1717,1718,1719],{"label":490,"description":491},{"label":493,"description":494},{"label":496,"description":497},{"label":499,"description":500},{"label":502,"description":503},{"label":505,"description":506},{"label":508,"description":509},{"label":511,"description":512},{"label":514,"description":515},{},{"id":518,"data":1722,"type":42,"tunes":1723},{"text":520,"level":219},{},{"id":523,"data":1725,"type":226,"tunes":1726},{"text":525},{},{"id":528,"data":1728,"type":226,"tunes":1729},{"text":530},{},{"id":533,"data":1731,"type":539,"tunes":1732},{"url":535,"title":536,"excerpt":537,"ctaLabel":538},{},{"id":542,"data":1734,"type":42,"tunes":1735},{"text":544,"level":219},{},{"id":547,"data":1737,"type":578,"tunes":1751},{"rows":1738,"title":567,"layout":303,"columns":1747},[1739,1741,1743,1745],{"id":551,"label":552,"values":1740},[554,554,554],{"id":556,"label":557,"values":1742},[554,554,554],{"id":560,"label":561,"values":1744},[554,554,554],{"id":564,"label":565,"values":1746},[554,554,554],[1748,1749,1750],{"id":570,"label":571},{"id":573,"label":574},{"id":576,"label":577},{},{"id":581,"data":1753,"type":226,"tunes":1754},{"text":583},{},{"id":586,"data":1756,"type":42,"tunes":1757},{"text":588,"level":219},{},{"id":591,"data":1759,"type":226,"tunes":1760},{"text":593},{},{"id":596,"data":1762,"type":303,"tunes":1773},{"content":1763,"stretched":43,"withHeadings":14},[1764,1765,1766,1767,1768,1769,1770,1771,1772],[600,601,602],[604,605,606],[608,609,610],[612,613,614],[616,617,618],[620,621,622],[624,625,626],[628,629,630],[632,633,634],{},{"id":637,"data":1775,"type":42,"tunes":1776},{"text":639,"level":219},{},{"id":642,"data":1778,"type":226,"tunes":1779},{"text":644},{},{"id":647,"data":1781,"type":226,"tunes":1782},{"text":649},{},{"id":652,"data":1784,"type":42,"tunes":1785},{"text":654,"level":219},{},{"id":657,"data":1787,"type":303,"tunes":1795},{"content":1788,"stretched":43,"withHeadings":14},[1789,1790,1791,1792,1793,1794],[661,662,663],[665,666,667],[669,670,671],[673,674,675],[677,678,679],[681,682,683],{},{"id":686,"data":1797,"type":42,"tunes":1798},{"text":688,"level":219},{},{"id":691,"data":1800,"type":708,"tunes":1803},{"meta":1801,"items":1802,"style":707},{},[695,696,697,698,699,700,701,702,703,704,705,706],{},{"id":711,"data":1805,"type":226,"tunes":1806},{"text":713},{},{"id":716,"data":1808,"type":539,"tunes":1809},{"url":718,"title":719,"excerpt":720,"ctaLabel":721},{},{"id":724,"data":1811,"type":42,"tunes":1812},{"text":726,"level":219},{},{"id":729,"data":1814,"type":226,"tunes":1815},{"text":731},{},{"id":734,"data":1817,"type":226,"tunes":1818},{"text":736},{},{"id":739,"data":1820,"type":226,"tunes":1821},{"text":741},{},{"id":744,"data":1823,"type":42,"tunes":1824},{"text":746,"level":219},{},{"id":749,"data":1826,"type":226,"tunes":1827},{"text":751},{},{"id":754,"data":1829,"type":226,"tunes":1830},{"text":756},{},{"id":759,"data":1832,"type":42,"tunes":1833},{"text":761,"level":219},{},{"id":764,"data":1835,"type":226,"tunes":1836},{"text":766},{},{"id":769,"data":1838,"type":226,"tunes":1839},{"text":771},{},{"id":774,"data":1841,"type":42,"tunes":1842},{"text":776,"level":219},{},{"id":779,"data":1844,"type":226,"tunes":1845},{"text":781},{},{"id":784,"data":1847,"type":226,"tunes":1848},{"text":786},{},{"id":789,"data":1850,"type":42,"tunes":1851},{"text":791,"level":219},{},{"id":794,"data":1853,"type":794,"tunes":1861},{"items":1854,"title":821},[1855,1856,1857,1858,1859,1860],{"id":798,"answer":799,"question":800},{"id":802,"answer":803,"question":804},{"id":806,"answer":807,"question":808},{"id":810,"answer":811,"question":812},{"id":814,"answer":815,"question":816},{"id":818,"answer":819,"question":820},{},{"id":824,"data":1863,"type":42,"tunes":1864},{"text":826,"level":219},{},{"id":829,"data":1866,"type":829,"tunes":1874},{"title":831,"entries":1867},[1868,1869,1870,1871,1872,1873],{"term":834,"anchor":835,"definition":836},{"term":838,"anchor":839,"definition":840},{"term":842,"anchor":843,"definition":844},{"term":846,"anchor":847,"definition":848},{"term":850,"anchor":851,"definition":852},{"term":854,"anchor":855,"definition":856},{},{"id":859,"data":1876,"type":42,"tunes":1877},{"text":861,"level":219},{},{"id":864,"data":1879,"type":871,"tunes":1882},{"link":866,"meta":1880},{"image":1881,"title":869,"description":870},{"url":554},{},{"id":874,"data":1884,"type":871,"tunes":1887},{"link":876,"meta":1885},{"image":1886,"title":879,"description":880},{"url":554},{},{"id":883,"data":1889,"type":871,"tunes":1892},{"link":885,"meta":1890},{"image":1891,"title":888,"description":889},{"url":554},{},{"id":892,"data":1894,"type":871,"tunes":1897},{"link":894,"meta":1895},{"image":1896,"title":897,"description":898},{"url":554},{},{"id":901,"data":1899,"type":871,"tunes":1902},{"link":903,"meta":1900},{"image":1901,"title":906,"description":907},{"url":554},{},{"id":910,"data":1904,"type":871,"tunes":1907},{"link":912,"meta":1905},{"image":1906,"title":915,"description":916},{"url":554},{},{"id":919,"data":1909,"type":871,"tunes":1912},{"link":921,"meta":1910},{"image":1911,"title":924,"description":925},{"url":554},{},{"id":928,"data":1914,"type":871,"tunes":1917},{"link":930,"meta":1915},{"image":1916,"title":933,"description":934},{"url":554},{},"Post erfolgreich abgerufen",{"items":1920,"source":1983,"manualIds":1984,"manualMatchedIds":1985},[1921,1928,1935,1941,1948,1955,1962,1969,1976],{"id":1922,"slug":1923,"title":1924,"excerpt":1925,"featuredImage":1926,"publishedAt":1927},"459","ollama-is-not-the-product-building-production-ready-open-llm-applications","Ollama nije proizvod: Izgradnja aplikacija spremnih za produkciju sa otvorenim LLM-ovima","Pokretanje lokalnog modela pomoću Ollama-e je jednostavno. Izgradnja Open-LLM aplikacije spremne za produkciju je teža: zahteva RAG, kontrolu pristupa, apstrakciju provajdera, evaluaciju, logovanje, disciplinu puštanja u rad i kontrolisani aplikativni sloj oko modela.","\u002Fuploads\u002F2026\u002F06\u002Follama-is-not-the-product-building-production-ready-open-llm-applications-1782679361640-h0usqf.webp","2026-06-28T16:39:00.000Z",{"id":1929,"slug":1930,"title":1931,"excerpt":1932,"featuredImage":1933,"publishedAt":1934},"471","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","Kako znati da li je AI agent zaista koristio prave dokaze","AI agent može citirati izvore i ipak koristiti pogrešne dokaze. Ovaj članak predstavlja praktičnu metodu za proveru potkrepljenosti tvrdnji, autoriteta izvora, primenjivosti, porekla i toga da li su dokazi zaista uticali na odgovor.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","2026-09-25T11:47:00.000Z",{"id":1936,"slug":1937,"title":719,"excerpt":1938,"featuredImage":1939,"publishedAt":1940},"460","ai-agent-reliability-why-the-final-answer-is-not-enough","Tačan rezultat ne dokazuje ispravno razmišljanje, bezbedno izvršavanje ili pouzdan sistem.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-reliability-why-the-final-answer-is-not-enough-1788955466306-pl0qhz.webp","2026-09-09T04:01:00.000Z",{"id":1942,"slug":1943,"title":1944,"excerpt":1945,"featuredImage":1946,"publishedAt":1947},"474","migrating-from-openai-agents-sdk-to-the-agents-api-what-actually-changes-architecturally","Migracija sa OpenAI Agents SDK na Agents API: Šta se zapravo menja arhitektonski?","Migracija sa OpenAI Agents SDK na novi Agents API nije samo preimenovanje importa. Granica izvršnog okruženja se menja: petlja agenta, trajna sesija, orkestracija, sažimanje konteksta i oporavak premeštaju se ka upravljanom okviru. Ovaj vodič pokazuje šta treba premestiti, šta treba da ostane u vašoj aplikaciji i kako da dokažete migraciju pre prelaska.","\u002Fuploads\u002F2026\u002F09\u002Fmigrating-from-openai-agents-sdk-to-the-agents-api-what-actually-changes-architecturally-1790352171968-ienxr9.webp","2026-09-25T12:01:00.000Z",{"id":1949,"slug":1950,"title":1951,"excerpt":1952,"featuredImage":1953,"publishedAt":1954},"478","what-is-rag-the-simplest-explanation-of-how-it-works","Šta je RAG? Najjednostavnije objašnjenje kako funkcioniše","RAG zvuči komplikovano, ali ideja je jednostavna: pre nego što AI odgovori, prvo potraži korisne informacije iz izvora znanja i daje te informacije jezičkom modelu. Ovaj vodič objašnjava RAG, LLM-ove, stanje, memoriju i alate koristeći jedan jednostavan mentalni model.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":1956,"slug":1957,"title":1958,"excerpt":1959,"featuredImage":1960,"publishedAt":1961},"457","should-you-buy-5g-openwrt-router-old-firmware","Treba li kupiti 5G OpenWrt ruter sa starim firmverom? ZBT Z8102AX kao praktičan primer","Kupovina 5G OpenWrt rutera sa starijim firmverom može imati smisla, ali samo pod pravim uslovima. ZBT Z8102AX jasno pokazuje obe strane: hardver je koristan, modem radi, a ruter je ostao stabilan u testiranju, ali OpenWrt 21.02, slabo pakovanje i nejasni putevi nadogradnje zahtevaju pažljivu odluku o kupovini.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1963,"slug":1964,"title":1965,"excerpt":1966,"featuredImage":1967,"publishedAt":1968},"364","tipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung","Ovladavanje SEO radnim tokom: Ključne strategije optimizacije za organski rast","Strukturiran SEO tok posla je ključan za održiv organski rast. Naučite deset osnovnih strategija, od istraživanja ključnih reči i tehničke optimizacije do kvaliteta sadržaja i analize performansi.","\u002Fuploads\u002F2026\u002F03\u002Ftipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung-1774866098131-hwkzrg.webp","2024-01-26T06:35:00.000Z",{"id":1970,"slug":1971,"title":1972,"excerpt":1973,"featuredImage":1974,"publishedAt":1975},"469","rag-failed-but-which-layer-actually-failed-a-diagnostic-method","RAG nije uspeo — ali koji sloj je zapravo zakazao? Dijagnostička metoda","Kada je RAG odgovor pogrešan, kriviti pretragu ili model je previše neodređeno. Ova dijagnostička metoda izoluje pokrivenost izvora, konstrukciju upita, pretragu, rangiranje, sastavljanje konteksta, generisanje, pripisivanje dokaza i svežinu—tako da se stvarni kvar može reprodukovati i ispraviti.","\u002Fuploads\u002F2026\u002F09\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method-1790350847177-pior4c.webp","2026-09-24T19:39:00.000Z",{"id":1977,"slug":1978,"title":1979,"excerpt":1980,"featuredImage":1981,"publishedAt":1982},"472","why-more-context-can-make-ai-answers-worse","Zašto više konteksta može pogoršati AI odgovore","Veći kontekstni prozor ne garantuje bolji odgovor. Ovaj članak objašnjava kako razblaživanje signala, protivrečni dokazi, zastarelo stanje, osetljivost na poziciju i kompresija sa gubicima mogu smanjiti pouzdanost veštačke inteligencije—i uvodi praktičan test pritiska konteksta.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z","fallback",[],[]]