[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:es":3,"public-menus:all":38,"post:computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system:es":205,"related:post:computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system:es:1":1921},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","es","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1920},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":939,"featuredImage":940,"featuredImageAlt":941,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":942,"publishedAt":943,"createdAt":944,"updatedAt":945,"seoLocalePaths":946,"categories":955,"author":968,"translations":973},"477","Agentes de uso de computadoras: por qué una demostración exitosa aún puede ser un sistema poco confiable","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Contenidos\">\u003Cstrong class=\"editorjs-toc__title\">Contenidos\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-6\" class=\"editorjs-toc__link\">Por qué la demostración es la prueba de confiabilidad más sencilla posible\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">Capacidad, tasa de éxito, confiabilidad y seguridad son afirmaciones distintas\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-12\" class=\"editorjs-toc__link\">La Escala de Confiabilidad para el Uso de Computadoras\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-15\" class=\"editorjs-toc__link\">Nivel 1 — Capacidad: la pregunta de la demostración\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-18\" class=\"editorjs-toc__link\">Nivel 2 — Repetibilidad: ¿se mantiene resuelta la misma tarea?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-21\" class=\"editorjs-toc__link\">Nivel 3 — Robustez ambiental: ¿qué ocurre cuando la web se comporta como la web?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-25\" class=\"editorjs-toc__link\">Nivel 4 — Control de horizonte largo: el éxito cambia cuando la tarea se convierte en trabajo real\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-29\" class=\"editorjs-toc__link\">Nivel 5 — Conciencia del estado: el entorno puede cambiar por debajo del plan\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">Nivel 6 — Verificación de resultados: ¿realmente funcionó la acción?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-37\" class=\"editorjs-toc__link\">Nivel 7 — Gestión segura de objetivos: el agente debe saber cuándo no continuar\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-41\" class=\"editorjs-toc__link\">La prueba de estrés de la demo a producción\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-44\" class=\"editorjs-toc__link\">El éxito en los benchmarks tiene un límite de validez\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-48\" class=\"editorjs-toc__link\">El éxito del proceso y el éxito del resultado deben puntuarse por separado\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-51\" class=\"editorjs-toc__link\">La fiabilidad en producción es una distribución, no una única tasa de éxito\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-54\" class=\"editorjs-toc__link\">La fiabilidad necesita un presupuesto de fallos, no la perfección\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-57\" class=\"editorjs-toc__link\">Una matriz práctica de fiabilidad para el uso del ordenador\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-59\" class=\"editorjs-toc__link\">Qué registrar ante un fallo en el uso del ordenador\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-63\" class=\"editorjs-toc__link\">La seguridad es parte de la fiabilidad para los agentes de uso del ordenador\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-67\" class=\"editorjs-toc__link\">¿Qué cambiaría esta respuesta?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-70\" class=\"editorjs-toc__link\">Limitaciones\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-73\" class=\"editorjs-toc__link\">Conclusión\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-76\" class=\"editorjs-toc__link\">Preguntas frecuentes\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-78\" class=\"editorjs-toc__link\">Glosario\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-80\" class=\"editorjs-toc__link\">Fuentes primarias y lecturas complementarias\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>Los agentes de uso de computadoras ahora pueden hacer clic, escribir, navegar, editar archivos, operar aplicaciones de escritorio y completar impresionantes tareas de varios pasos. Eso hace que las demostraciones exitosas sean fáciles de entender y fáciles de sobreinterpretar. Un solo flujo de trabajo completado muestra que el agente puede tener éxito bajo esas condiciones. No muestra con qué frecuencia tiene éxito, cómo se comporta cuando el entorno cambia, si verifica el resultado o con qué seguridad actúa cuando el objetivo se vuelve ambiguo.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Respuesta directa\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">&lt;strong&gt;Una demostración exitosa de uso de computadora demuestra capacidad, no confiabilidad.&lt;\u002Fstrong&gt; La confiabilidad en producción requiere que el agente tenga éxito repetidamente a través de la variación ambiental, se recupere de fallas transitorias, preserve las restricciones en horizontes largos, detecte estados ocultos o cambiantes, verifique el resultado real y se detenga o pregunte cuando el objetivo se vuelva ambiguo o inseguro. La pregunta correcta en producción no es «¿Puede el agente realizar esta tarea?», sino «¿Bajo qué condiciones podemos confiar en que realice esta tarea repetidamente?»\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Un campo en rápida evolución\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Este artículo refleja la investigación sobre agentes de uso de computadoras y las directrices de plataformas disponibles al &lt;strong&gt;25 de septiembre de 2026&lt;\u002Fstrong&gt;. Los resultados de los benchmarks no son directamente comparables entre diferentes conjuntos de tareas, entornos, modelos, límites de pasos, evaluadores o entornos de prueba. Evalúe cada cifra de benchmark junto con sus condiciones de evaluación.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">El modelo utilizado en este artículo\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">La Escala de Confiabilidad para el Uso de Computadoras y la Prueba de Estrés de la Demostración a la Producción que se presentan a continuación son modelos prácticos de evaluación propuestos aquí. No constituyen estándares formales de la industria.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-6\">Por qué la demostración es la prueba de confiabilidad más sencilla posible\u003C\u002Fh2>\n\u003Cp>Una demostración suele mostrar una trayectoria que funcionó. El entorno es conocido, la tarea se selecciona con anticipación, el operador puede reiniciar tras un fallo y la audiencia ve la ruta exitosa. En cambio, los sistemas en producción se enfrentan a una distribución: diferentes páginas, condiciones de red, estados de cuenta, ventanas emergentes, latencia, cambios en la interfaz de usuario, estados ocultos, permisos, interrupciones y usuarios que describen los objetivos de forma imperfecta.\u003C\u002Fp>\n\u003Cp>Esa distinción es importante porque los agentes de uso de computadoras operan a través de interfaces diseñadas para humanos en lugar de APIs deterministas. Su ciclo de acción depende de la percepción, la interpretación del estado, la planificación, la sincronización de las interacciones y la respuesta del entorno. Pequeños cambios pueden alterar la trayectoria incluso cuando el objetivo del usuario no ha cambiado.\u003C\u002Fp>\n\u003Cp>El trabajo WAREX de Microsoft Research hace explícito el problema: los agentes de benchmark que parecen capaces en entornos controlados pierden un éxito sustancial en las tareas cuando se introduce una inestabilidad web realista. El fallo no se debe necesariamente a que «el modelo se volvió menos inteligente». El entorno dejó de ser determinista.\u003C\u002Fp>\n\u003Ch2 id=\"section-10\">Capacidad, tasa de éxito, confiabilidad y seguridad son afirmaciones distintas\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Afirmación\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Lo que realmente demuestra\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Lo que no demuestra\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">El agente completó la tarea una vez\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Capacidad bajo una trayectoria observada\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Repetibilidad, robustez, seguridad o generalización\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">El agente obtiene una puntuación alta en un benchmark\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Rendimiento bajo las tareas y condiciones de evaluación de ese benchmark\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Rendimiento de producción equivalente en diferentes entornos\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">El agente suele alcanzar el objetivo\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Frecuencia de éxito en el resultado\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Proceso correcto, comportamiento seguro o evidencia de que el resultado fue verificado\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">El agente sigue el proceso previsto\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Calidad de la trayectoria según la rúbrica evaluada\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Que el entorno externo haya aceptado realmente el resultado final\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">El agente evita acciones inseguras en un conjunto de prueba\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Rendimiento en los casos de seguridad representados\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Seguridad ante cualquier ambigüedad inédita, inyección o efecto secundario\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-12\">La Escala de Confiabilidad para el Uso de Computadoras\u003C\u002Fh2>\n\u003Cp>Una forma útil de evaluar los sistemas de uso de computadoras es avanzar desde la capacidad puntual hacia propiedades de confiabilidad progresivamente más complejas. Los niveles superiores asumen los inferiores, pero no se derivan automáticamente de ellos.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Escala de Confiabilidad para el Uso de Computadoras\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Capacidad\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">¿Puede el agente completar la tarea al menos una vez bajo condiciones conocidas?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Repetibilidad\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">¿Puede completar la misma tarea de manera consistente a lo largo de pruebas repetidas?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Robustez ambiental\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">¿Sobrevive a cambios de sincronización, problemas de red, ventanas emergentes, variaciones de la interfaz de usuario y pequeñas perturbaciones del entorno?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Control en horizontes largos\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">¿Puede preservar objetivos, restricciones y progreso a lo largo de muchos pasos, aplicaciones y eventos diferidos?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Conciencia del estado\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">¿Puede detectar cuándo cambió el entorno, cuándo importa un estado oculto o cuándo una suposición ya no es válida?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Verificación del resultado\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">¿Verifica que el resultado previsto realmente haya ocurrido en lugar de confiar en su propia secuencia de acciones?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Gestión segura de objetivos\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">¿Puede detenerse, preguntar, negarse o devolver el control cuando el objetivo es ambiguo, inviable, contradictorio o de alto impacto?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch3 id=\"section-15\">Nivel 1 — Capacidad: la pregunta de la demostración\u003C\u002Fh3>\n\u003Cp>La capacidad cuestiona si un agente puede realizar la tarea en absoluto. Esto es valioso. Los sistemas de uso de computadoras han avanzado rápidamente, y los agentes modernos pueden completar flujos de trabajo que los sistemas anteriores no podían ejecutar de forma confiable.\u003C\u002Fp>\n\u003Cp>Pero la capacidad es un criterio débil para el despliegue. Una sola ejecución exitosa no indica si el agente tiene éxito el 95% de las veces o el 30% de las veces, si los fallos son inofensivos o destructivos, o si el éxito depende de un estado afortunado de la página.\u003C\u002Fp>\n\u003Ch3 id=\"section-18\">Nivel 2 — Repetibilidad: ¿se mantiene resuelta la misma tarea?\u003C\u002Fh3>\n\u003Cp>Las trayectorias de uso de la computadora son estocásticas. Las respuestas de los modelos varían, las páginas cargan a diferentes velocidades, los estados visuales cambian y los flujos de trabajo largos generan múltiples ramificaciones. Por lo tanto, una prueba en producción debe ejecutar la misma tarea varias veces en lugar de tratar un único rastro exitoso como representativo.\u003C\u002Fp>\n\u003Cp>Mida no solo la tasa de éxito promedio, sino también la distribución de los modos de fallo: clic erróneo, finalización prematura, confirmación omitida, campo incorrecto, acción duplicada, bucle de navegación, suposición de estado obsoleto y reporte de falso éxito.\u003C\u002Fp>\n\u003Ch3 id=\"section-21\">Nivel 3 — Robustez ambiental: ¿qué ocurre cuando la web se comporta como la web?\u003C\u002Fh3>\n\u003Cp>Los sitios web reales no son entornos de referencia estáticos. Las solicitudes fallan, los elementos tardan en cargar, las sesiones caducan, las páginas cambian, aparecen banners de consentimiento, los servidores devuelven errores y las condiciones de la red fluctúan.\u003C\u002Fp>\n\u003Cp>WAREX evalúa esta brecha inyectando una falta de fiabilidad web realista en los entornos de referencia existentes y reporta caídas significativas en el éxito de las tareas. Esta es una perspectiva crítica para la producción: un benchmark puede medir la competencia en la tarea mientras subestima la recuperación ante la inestabilidad ambiental.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Prueba de fiabilidad\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Inyecte retrasos, fallos HTTP transitorios, estados de página obsoletos, cuadros de diálogo modales, caducidad de sesiones, respuestas duplicadas y variaciones controladas de la interfaz de usuario. Si el agente solo funciona en el camino ideal, es un sistema apto para demostraciones, no fiable para producción.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-25\">Nivel 4 — Control de horizonte largo: el éxito cambia cuando la tarea se convierte en trabajo real\u003C\u002Fh3>\n\u003Cp>Las tareas cortas ocultan una clase de fallos que solo aparecen tras decenas o cientos de acciones: restricciones olvidadas, trabajo duplicado, finalización prematura, cambios de estado no detectados, inconsistencias entre aplicaciones y pequeños errores acumulados.\u003C\u002Fp>\n\u003Cp>OSWorld 2.0 se diseñó específicamente en torno a flujos de trabajo reales de horizonte largo. Sus tareas toman a los usuarios humanos una mediana de aproximadamente 1,6 horas y requieren muchas más llamadas a herramientas que los benchmarks anteriores de uso de computadoras. Bajo su métrica principal de finalización, incluso los sistemas evaluados más avanzados siguen estando lejos de una fiabilidad completa en la tarea.\u003C\u002Fp>\n\u003Cp>WeaveBench llega a una conclusión similar desde otra perspectiva. Evalúa flujos de trabajo híbridos de GUI, CLI y código, e informa que la mejor combinación evaluada de modelo y entorno de ejecución supera solo el 41,2 % de las tareas. El resultado importante no es una cifra en una tabla de clasificación; es que la orquestación realista entre interfaces expone fallos ocultos en tareas más simples de una sola interfaz.\u003C\u002Fp>\n\u003Ch3 id=\"section-29\">Nivel 5 — Conciencia del estado: el entorno puede cambiar por debajo del plan\u003C\u002Fh3>\n\u003Cp>Las tareas de larga duración a menudo dependen de un estado oculto o cambiante: llega un correo electrónico, se modifica un calendario, se envía un formulario, finaliza un proceso en segundo plano, caduca una sesión del navegador, un usuario modifica un archivo o un sistema externo cambia su disponibilidad.\u003C\u002Fp>\n\u003Cp>SentinelBench de Microsoft sostiene que muchas tareas de larga duración no deberían resolverse en absoluto mediante una acción continua. El comportamiento correcto puede ser monitorizar, esperar un evento externo y luego actuar cuando el estado cambie. Esta es una capacidad diferente a hacer clic más rápido o planificar más pasos.\u003C\u002Fp>\n\u003Cp>Por lo tanto, un agente de uso de computadoras fiable necesita distinguir entre ejecutable ahora, esperando estado, estado cambiado y suposición invalidada.\u003C\u002Fp>\n\u003Ch3 id=\"section-33\">Nivel 6 — Verificación de resultados: ¿realmente funcionó la acción?\u003C\u002Fh3>\n\u003Cp>Un agente puede ejecutar una secuencia aparentemente correcta y, aun así, fracasar en la tarea. Es posible que no se registre el clic en un botón. Un formulario puede rechazar una validación oculta. Un archivo puede guardarse en el directorio incorrecto. Una compra puede quedar sin confirmar. Un sitio web puede mostrar una pantalla que aparenta éxito mientras la operación subyacente falló.\u003C\u002Fp>\n\u003Cp>Las directrices actuales de OpenAI sobre el uso de computadoras recomiendan explícitamente acotar y verificar la ejecución en lugar de confiar únicamente en la respuesta final del modelo. El trabajo de Microsoft Research sobre verificadores de uso de computadoras llega a la misma conclusión a partir de la evaluación: el proceso y el resultado deben juzgarse por separado.\u003C\u002Fp>\n\u003Cp>La investigación de Universal Verifier reporta que las configuraciones de verificación anteriores pueden producir altas tasas de falsos positivos, mientras que un diseño de rúbricas más sólido y la separación explícita de proceso, resultado, fallos controlables y fallos incontrolables mejoran sustancialmente la coincidencia con las etiquetas humanas.\u003C\u002Fp>\n\u003Ch3 id=\"section-37\">Nivel 7 — Gestión segura de objetivos: el agente debe saber cuándo no continuar\u003C\u002Fh3>\n\u003Cp>Los agentes de uso de computadoras están optimizados para cumplir objetivos, pero la persistencia hacia el objetivo puede convertirse en sí misma en un modo de fallo. Una solicitud ambigua, una condición imposible, una instrucción contradictoria, una página web sospechosa o un entorno modificado pueden requerir aclaración o detenerse en lugar de tomar más acciones.\u003C\u002Fp>\n\u003Cp>El benchmark BLIND-ACT estudia este problema como Direccionalidad Ciega hacia el Objetivo (Blind Goal-Directedness). En todos los sistemas evaluados en ese trabajo, los agentes continuaron con frecuencia persiguiendo tareas a pesar de la ambigüedad, la inviabilidad, el contexto conflictivo u otros motivos para reconsiderar. Los autores identifican patrones como el sesgo de ejecución primero (execution-first bias) y la primacía de la solicitud (request primacy).\u003C\u002Fp>\n\u003Cp>Esta clase de fallo es importante porque un agente altamente capaz puede empeorar una mala situación con mayor rapidez. Por lo tanto, la fiabilidad incluye una política sobre cuándo no actuar.\u003C\u002Fp>\n\u003Ch2 id=\"section-41\">La prueba de estrés de la demo a producción\u003C\u002Fh2>\n\u003Cp>Antes de implementar un flujo de trabajo de uso de computadora, tome la demo exitosa y elimine sistemáticamente los supuestos que la hicieron sencilla.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Prueba de estrés de la demo a producción\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Volver a ejecutar la tarea limpia\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Establezca la repetibilidad a lo largo de múltiples intentos antes de añadir complejidad.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Perturbar el entorno\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Añada latencia, reintentos, ventanas emergentes, variaciones de página, sesiones caducadas y fallos temporales.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Extender el horizonte\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Convierta la demo corta en el flujo de trabajo real completo con estado intermedio, múltiples aplicaciones y pasos diferidos.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Cambiar el estado oculto\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Modifique la cuenta, el archivo, la tarea o el estado externo después de que el agente haya formulado un plan y compruebe si detecta el cambio.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Inyectar ambigüedad\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Elimine un supuesto importante y compruebe si el agente pregunta en lugar de adivinar.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Inyectar una contradicción controlada\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Presente el estado antiguo y el nuevo juntos y verifique que prevalezca el estado actual fidedigno.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Requerir prueba del resultado\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Haga que la finalización de la tarea dependa de un estado final verificable, no del autoinforme del modelo.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Probar los límites con consecuencias\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Confirme que las acciones irreversibles o sensibles activen la aprobación, el rechazo o la transferencia esperados.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">9\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">9. Repetir tras cambios en el harness o en el modelo\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Trate las actualizaciones del entorno de ejecución como cambios de fiabilidad que requieren pruebas de regresión.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-44\">El éxito en los benchmarks tiene un límite de validez\u003C\u002Fh2>\n\u003Cp>Una puntuación de benchmark es una afirmación condicional. Es válida para un modelo, harness, entorno, conjunto de tareas, evaluador, interfaz de herramientas, presupuesto de pasos, política de reintentos, fecha y método de evaluación específicos.\u003C\u002Fp>\n\u003Cp>El número se vuelve engañoso cuando esas condiciones desaparecen de la afirmación. «El agente X obtiene un 80 %» es más débil que «El agente X obtuvo un 80 % en el benchmark Y bajo el entorno Z con el evaluador J y un presupuesto de pasos N». La segunda afirmación preserva el límite que indica si la cifra es extrapolable a su aplicación.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">El límite de validez de la respuesta: la capa que falta entre la relevancia y las respuestas confiables de IA\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Un marco de trabajo para explicitar las condiciones bajo las cuales una afirmación de la IA sigue siendo válida y qué cambios requieren restricción, recálculo o abandono.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Leer El límite de validez de la respuesta →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-48\">El éxito del proceso y el éxito del resultado deben puntuarse por separado\u003C\u002Fh2>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Cuatro posibles resultados de una ejecución de uso de computadora\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Proceso\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Resultado\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Interpretación\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Proceso correcto \u002F resultado correcto\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Proceso erróneo \u002F resultado correcto\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Proceso correcto \u002F resultado erróneo\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Proceso erróneo \u002F resultado erróneo\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>WeaveBench informa que la calificación basada únicamente en el resultado puede sobreestimar materialmente el rendimiento en el uso de computadoras, ya que un agente puede producir un artefacto aparentemente exitoso mediante un atajo o evidencia fabricada. El verificador debe inspeccionar la trayectoria y los entregables, no simplemente la afirmación final.\u003C\u002Fp>\n\u003Ch2 id=\"section-51\">La fiabilidad en producción es una distribución, no una única tasa de éxito\u003C\u002Fh2>\n\u003Cp>Una evaluación de producción útil muestrea las dimensiones que realmente varían en su entorno. Para un flujo de trabajo en el navegador, esto podría incluir la antigüedad de la cuenta, la configuración regional, el viewport, la versión de la página, la calidad de la red, el estado de autenticación, el estado existente del carrito, las cookies, las ventanas emergentes, los permisos de usuario y si un humano interrumpe la ejecución.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Dimensión\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Variación de ejemplo\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Por qué es importante\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Entorno\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Red rápida vs. lenta, fallos transitorios, tiempos de carga de página\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prueba la recuperación y el comportamiento de espera\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Interfaz de usuario (UI)\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Diferente viewport, modal, elemento reordenado, rediseño menor\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prueba supuestos visuales y de acción frágiles\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Estado\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sesión iniciada\u002Fcerrada, carrito vacío\u002Fno vacío, archivo existente, permisos modificados\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prueba el razonamiento sobre el estado oculto\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Horizonte de la tarea\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">5 pasos vs. más de 50 pasos, una aplicación vs. varias aplicaciones\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prueba el error acumulado en la trayectoria\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ambigüedad\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Preferencia faltante o instrucción incompleta del usuario\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prueba si el agente pregunta en lugar de adivinar\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Consecuencia\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Solo lectura vs. comprar\u002Fenviar\u002Feliminar\u002Fmodificar\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prueba los controles de confirmación y autorización\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Contenido adverso\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Inyección de instrucciones (prompt injection) o texto engañoso en la página\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prueba la jerarquía de instrucciones y la contención\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Versión del modelo \u002F harness\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Actualización del entorno de ejecución\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Prueba regresiones provocadas por cambios a nivel del sistema\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-54\">La fiabilidad necesita un presupuesto de fallos, no la perfección\u003C\u002Fh2>\n\u003Cp>Ningún sistema en producción es perfectamente fiable. La pregunta útil de ingeniería es qué fallos son aceptables, detectables y recuperables. Un intento fallido de ordenar una carpeta local no equivale a enviar el correo electrónico equivocado, comprar el producto erróneo o cambiar la configuración de una cuenta.\u003C\u002Fp>\n\u003Cp>Clasifique las acciones según sus consecuencias y reversibilidad. Las acciones reversibles de bajo impacto pueden tolerar una mayor autonomía. Las acciones de alto impacto, visibles externamente o difíciles de revertir requieren una confirmación más sólida, verificación de estado, autorización y comprobaciones posteriores a la acción.\u003C\u002Fp>\n\u003Ch2 id=\"section-57\">Una matriz práctica de fiabilidad para el uso del ordenador\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Clase de acción\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Ejemplo\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Control recomendado\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Lectura \u002F inspección\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Abrir páginas, leer archivos, recopilar información\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Delimitar el alcance, registrar fuentes, tolerar errores de navegación recuperables\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Cambio local reversible\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Editar archivo de borrador, reorganizar espacio de trabajo temporal\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Punto de control o versión antes del cambio; verificar el resultado\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Comunicación externa\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Enviar correo electrónico, publicar contenido, enviar formulario\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Confirmación del usuario o autoridad delegada explícita; verificar el estado aceptado\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Financiero \u002F transaccional\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Compra, proceso de pago, suscripción de pago\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Mandato estricto, restricciones de importe\u002Fcomerciante, confirmación final y verificación del recibo\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Destructivo \u002F cambio de privilegios\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eliminar datos, cambiar permisos, revocar acceso\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autorización limitada, confirmación explícita, vía reversible cuando sea posible, auditoría posterior a la acción\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-59\">Qué registrar ante un fallo en el uso del ordenador\u003C\u002Fh2>\n\u003Cul>\u003Cli>Objetivo del usuario y restricciones explícitas.\u003C\u002Fli>\u003Cli>Versión del modelo y del harness.\u003C\u002Fli>\u003Cli>Versiones del entorno y de las aplicaciones.\u003C\u002Fli>\u003Cli>Capturas de pantalla u observaciones estructuradas relevantes para el fallo.\u003C\u002Fli>\u003Cli>Acciones realizadas con marcas de tiempo.\u003C\u002Fli>\u003Cli>Resultados de herramientas, clics, teclado y navegación.\u003C\u002Fli>\u003Cli>Transiciones de estado y periodos de espera.\u003C\u002Fli>\u003Cli>Eventos de aprobación, rechazo o transferencia.\u003C\u002Fli>\u003Cli>Errores externos y fallos de red.\u003C\u002Fli>\u003Cli>Estado final observable del entorno.\u003C\u002Fli>\u003Cli>Resultado reportado por el agente.\u003C\u002Fli>\u003Cli>Resultado del verificador y si el fallo era controlable por el agente.\u003C\u002Fli>\u003C\u002Ful>\n\u003Cp>La comparación crucial es entre el éxito reportado y el éxito observable. Un sistema que no pueda distinguir entre ambos acumulará con el tiempo falsos positivos en producción.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Fiabilidad de los agentes de IA: por qué la respuesta final no es suficiente\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Un modelo de fiabilidad más amplio para evaluar las trayectorias de los agentes, el uso de herramientas y las decisiones intermedias en lugar de aceptar la respuesta final como prueba de que el sistema funcionó correctamente.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Leer el artículo sobre fiabilidad de agentes →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-63\">La seguridad es parte de la fiabilidad para los agentes de uso del ordenador\u003C\u002Fh2>\n\u003Cp>Los agentes de uso del ordenador no solo leen contenido no confiable; pueden actuar después de leerlo. Esto convierte la inyección de prompts, el contenido malicioso de páginas y el phishing en riesgos en la ruta de ejecución.\u003C\u002Fp>\n\u003Cp>La guía actual de OpenAI para el uso del ordenador recomienda aislar el entorno, crear listas de permitidos para sitios y acciones, tratar el contenido en pantalla como no confiable, confirmar las acciones de impacto, delimitar la ejecución y verificar el resultado real. El agente de ChatGPT utiliza de manera similar confirmaciones, monitorización de inyección de prompts y modos supervisados para contextos sensibles.\u003C\u002Fp>\n\u003Cp>El principio arquitectónico va más allá de cualquier proveedor concreto: no se debe permitir que el contenido observado por el agente redefina la autoridad del usuario. Una página web puede proporcionar datos. No puede otorgar permisos para enviar datos a otro lugar, realizar compras, modificar credenciales o anular los límites de la tarea.\u003C\u002Fp>\n\u003Ch2 id=\"section-67\">¿Qué cambiaría esta respuesta?\u003C\u002Fh2>\n\u003Cp>La brecha de fiabilidad se reduciría si los modelos de uso del ordenador se volvieran robustos frente a horizontes largos, estados dinámicos, variaciones en la interfaz de usuario, fallos del entorno y objetivos ambiguos en distribuciones representativas de producción. Unas mejores API de estado nativo, interfaces legibles por máquinas estandarizadas y una infraestructura de verificación más sólida también podrían reducir la cantidad de interacción frágil con la interfaz gráfica requerida.\u003C\u002Fp>\n\u003Cp>El umbral de despliegue también cambia según las consecuencias de la tarea. Una tasa de éxito del 70 % puede ser útil para una tarea de investigación supervisada y de bajo riesgo, e inaceptable para un flujo de trabajo financiero o destructivo autónomo. Por tanto, la fiabilidad debe evaluarse en función del coste de cada clase de fallo, no mediante un umbral universal de tasa de aprobación.\u003C\u002Fp>\n\u003Ch2 id=\"section-70\">Limitaciones\u003C\u002Fh2>\n\u003Cp>Los benchmarks citados evalúan entornos diferentes y no deberían clasificarse comparándose entre sí como si midieran lo mismo. WAREX pone a prueba la falta de fiabilidad web; WeaveBench se centra en el trabajo híbrido de horizonte largo; OSWorld 2.0 se enfoca en flujos de trabajo largos y realistas; BLIND-ACT se centra en la gestión de objetivos bajo ambigüedad e inviabilidad.\u003C\u002Fp>\n\u003Cp>Los resultados de los benchmarks también envejecen con rapidez. Las mejoras en el modelo, el harness y los verificadores pueden modificar sustancialmente las puntuaciones en cuestión de meses. Por consiguiente, la lección duradera radica en el método de evaluación: variar las condiciones, separar el proceso del resultado, verificar el estado externo y preservar los límites en torno a cada afirmación sobre el rendimiento.\u003C\u002Fp>\n\u003Ch2 id=\"section-73\">Conclusión\u003C\u002Fh2>\n\u003Cp>Los agentes con manejo de ordenadores ya son lo suficientemente competentes como para ser útiles. Por esa misma razón, la pregunta de evaluación ha cambiado. El reto ya no es solo si un agente puede completar un flujo de trabajo mediante clics. Consiste en saber si el sistema sigue siendo fiable cuando desaparecen las condiciones ideales de la demo.\u003C\u002Fp>\n\u003Cp>Considere una ejecución exitosa como prueba de capacidad. Luego, evalúe la repetibilidad, la robustez ambiental, el control de horizontes largos, la percepción del estado, la verificación de resultados y la gestión segura de objetivos. Un agente con manejo de ordenadores para producción no es aquel capaz de completar la demo, sino aquel cuyos límites de fallo se conocen, se miden y se controlan.\u003C\u002Fp>\n\u003Ch2 id=\"section-76\">Preguntas frecuentes\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Fiabilidad de los agentes con manejo de ordenadores\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">¿Demuestra una demo exitosa de un agente con manejo de ordenadores su fiabilidad en producción?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">No. Demuestra capacidad bajo una trayectoria observada concreta. La fiabilidad en producción requiere un éxito repetido ante la variación ambiental, tareas de larga duración, cambios de estado, ambigüedad, condiciones de recuperación y acciones con consecuencias relevantes.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">¿Por qué los benchmarks de uso de ordenadores pueden parecer mucho mejores que el rendimiento en el mundo real?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Los benchmarks pueden utilizar entornos más controlados, tareas más cortas, condiciones de red estables, combinaciones de aplicaciones más sencillas o criterios de resultado que no capturan todos los fallos del proceso. El límite exacto de validez depende de cada benchmark.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">¿Cuál es la comprobación de fiabilidad más importante tras una acción de uso de ordenador?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Verificar el resultado externo real. No tome la declaración final del agente o la secuencia de clics prevista como prueba de que el sistema de destino aceptó la operación.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">¿Por qué las tareas informáticas de horizonte largo siguen siendo difíciles?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Los errores se acumulan a lo largo de muchas acciones, se olvidan restricciones, el estado externo cambia, el trabajo abarca múltiples aplicaciones, el estado oculto importa y el agente debe decidir cuándo esperar, preguntar, verificar o recuperarse en lugar de limitarse a seguir actuando.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">¿Cómo debería probar un agente de navegador o de escritorio antes de su despliegue?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Repita tareas limpias, inyecte fallos ambientales realistas, varíe la interfaz y el estado, amplíe el horizonte del flujo de trabajo, introduzca ambigüedad, exija pruebas de resultados observables, evalúe los controles de acciones de alto impacto y vuelva a ejecutar la suite tras cambios en el modelo o en el entorno de ejecución.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq6\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">¿Deberían los agentes con manejo de ordenadores requerir siempre confirmación humana?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">No para cada acción de bajo riesgo. Los requisitos de confirmación deben ajustarse en función de las consecuencias, la reversibilidad, la autoridad y la incertidumbre. Las acciones de alto impacto, visibles externamente o difíciles de revertir precisan controles más estrictos.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-78\">Glosario\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Términos clave de fiabilidad\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"computer-use-agent\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Computer-use agent (Agente con manejo de ordenadores)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Un agente de IA que interactúa con interfaces gráficas de usuario o entornos informáticos mediante observaciones y acciones como hacer clic, escribir, desplazarse, operar con archivos o ejecutar flujos de trabajo entre aplicaciones.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"repeatability\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Repeatability (Repetibilidad)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">El grado en que un agente puede completar la misma tarea de forma coherente a lo largo de ejecuciones repetidas, en lugar de tener éxito únicamente en trayectorias seleccionadas.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"environmental-robustness\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Environmental robustness (Robustez ambiental)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">La capacidad de preservar un comportamiento correcto a pesar de variaciones realistas como la latencia, los errores transitorios, los cambios en la interfaz de usuario, el estado de la sesión y las condiciones inesperadas de las páginas.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"outcome-verification\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Outcome verification (Verificación de resultados)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Comprobar el estado externo real tras una acción para confirmar que se ha producido el resultado previsto, en lugar de fiarse del autoinforme del agente.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"blind-goal-directedness\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Blind Goal-Directedness (Orientación ciega a objetivos)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Un patrón de fallo en el que un agente con manejo de ordenadores continúa persiguiendo un objetivo a pesar de la ambigüedad, la inviabilidad, la presencia de condiciones contradictorias o la existencia de motivos para detenerse y reevaluar.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"reliability-boundary\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Reliability boundary (Límite de fiabilidad)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">El conjunto de condiciones bajo las cuales una tasa de éxito observada o una afirmación de capacidad sigue siendo lo suficientemente representativa para una decisión de despliegue específica.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-80\">Fuentes primarias y lecturas complementarias\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Computer use\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Guía actual para desarrolladores sobre el aislamiento de entornos, el tratamiento del contenido en pantalla como no confiable, la confirmación de acciones con consecuencias relevantes, la limitación de ejecuciones y la verificación de resultados.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Running Codex safely at OpenAI\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Guía de producción actual sobre límites técnicos, aprobación humana, telemetría y control para agentes que actúan en sistemas reales.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — WAREX\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Evaluación de 2026 que muestra cómo la falta de fiabilidad web realista provoca caídas significativas en el éxito de las tareas de los agentes de navegación en los benchmarks existentes.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — The Art of Building Verifiers for Computer Use Agents\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Trabajo de 2026 sobre la evaluación de procesos frente a resultados, fallos controlables frente a incontrolables y verificación fiable de trayectorias.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — WeaveBench\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Benchmark de horizonte largo de 2026 que combina flujos de trabajo de GUI, CLI y código, mostrando una brecha sustancial entre los agentes actuales y la finalización fiable en el mundo real.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Benchmark de 2026 centrado en flujos de trabajo realistas de uso de ordenadores de horizonte largo, estado oculto y razonamiento a partir de múltiples fuentes.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — SentinelBench\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Benchmark de 2026 para tareas que evolucionan en el tiempo donde los agentes deben monitorizar entornos y responder a cambios de estado en lugar de actuar de forma continua.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Investigación de ICLR 2026 sobre agentes que continúan persiguiendo objetivos ambiguos, contradictorios o inviables.\u003C\u002Fp>\u003C\u002Fa>",{"time":212,"blocks":213,"version":938},1790353288232,[214,222,228,236,243,250,255,260,265,270,275,305,310,315,344,349,354,359,364,369,374,379,384,389,396,401,406,411,416,421,426,431,436,441,446,451,456,461,466,471,476,481,486,519,524,529,534,543,548,582,587,592,597,638,643,648,653,658,687,692,712,717,725,730,735,740,745,750,755,760,765,770,775,780,785,790,795,825,830,860,865,875,884,893,902,911,920,929],{"id":215,"data":216,"type":220,"tunes":221},"IYG9UPcPY0",{"title":217,"maxLevel":218,"minLevel":219},"Contenidos",3,2,"tableOfContents",{},{"id":223,"data":224,"type":226,"tunes":227},"intro",{"text":225},"Los agentes de uso de computadoras ahora pueden hacer clic, escribir, navegar, editar archivos, operar aplicaciones de escritorio y completar impresionantes tareas de varios pasos. Eso hace que las demostraciones exitosas sean fáciles de entender y fáciles de sobreinterpretar. Un solo flujo de trabajo completado muestra que el agente puede tener éxito bajo esas condiciones. No muestra con qué frecuencia tiene éxito, cómo se comporta cuando el entorno cambia, si verifica el resultado o con qué seguridad actúa cuando el objetivo se vuelve ambiguo.","paragraph",{},{"id":229,"data":230,"type":234,"tunes":235},"direct",{"body":231,"title":232,"variant":233},"\u003Cstrong>Una demostración exitosa de uso de computadora demuestra capacidad, no confiabilidad.\u003C\u002Fstrong> La confiabilidad en producción requiere que el agente tenga éxito repetidamente a través de la variación ambiental, se recupere de fallas transitorias, preserve las restricciones en horizontes largos, detecte estados ocultos o cambiantes, verifique el resultado real y se detenga o pregunte cuando el objetivo se vuelva ambiguo o inseguro. La pregunta correcta en producción no es «¿Puede el agente realizar esta tarea?», sino «¿Bajo qué condiciones podemos confiar en que realice esta tarea repetidamente?»","Respuesta directa","info","callout",{},{"id":237,"data":238,"type":234,"tunes":242},"freshness",{"body":239,"title":240,"variant":241},"Este artículo refleja la investigación sobre agentes de uso de computadoras y las directrices de plataformas disponibles al \u003Cstrong>25 de septiembre de 2026\u003C\u002Fstrong>. Los resultados de los benchmarks no son directamente comparables entre diferentes conjuntos de tareas, entornos, modelos, límites de pasos, evaluadores o entornos de prueba. Evalúe cada cifra de benchmark junto con sus condiciones de evaluación.","Un campo en rápida evolución","warning",{},{"id":244,"data":245,"type":234,"tunes":249},"model-note",{"body":246,"title":247,"variant":248},"La Escala de Confiabilidad para el Uso de Computadoras y la Prueba de Estrés de la Demostración a la Producción que se presentan a continuación son modelos prácticos de evaluación propuestos aquí. No constituyen estándares formales de la industria.","El modelo utilizado en este artículo","note",{},{"id":251,"data":252,"type":42,"tunes":254},"h-demo",{"text":253,"level":219},"Por qué la demostración es la prueba de confiabilidad más sencilla posible",{},{"id":256,"data":257,"type":226,"tunes":259},"p-demo-1",{"text":258},"Una demostración suele mostrar una trayectoria que funcionó. El entorno es conocido, la tarea se selecciona con anticipación, el operador puede reiniciar tras un fallo y la audiencia ve la ruta exitosa. En cambio, los sistemas en producción se enfrentan a una distribución: diferentes páginas, condiciones de red, estados de cuenta, ventanas emergentes, latencia, cambios en la interfaz de usuario, estados ocultos, permisos, interrupciones y usuarios que describen los objetivos de forma imperfecta.",{},{"id":261,"data":262,"type":226,"tunes":264},"p-demo-2",{"text":263},"Esa distinción es importante porque los agentes de uso de computadoras operan a través de interfaces diseñadas para humanos en lugar de APIs deterministas. Su ciclo de acción depende de la percepción, la interpretación del estado, la planificación, la sincronización de las interacciones y la respuesta del entorno. Pequeños cambios pueden alterar la trayectoria incluso cuando el objetivo del usuario no ha cambiado.",{},{"id":266,"data":267,"type":226,"tunes":269},"p-demo-3",{"text":268},"El trabajo WAREX de Microsoft Research hace explícito el problema: los agentes de benchmark que parecen capaces en entornos controlados pierden un éxito sustancial en las tareas cuando se introduce una inestabilidad web realista. El fallo no se debe necesariamente a que «el modelo se volvió menos inteligente». El entorno dejó de ser determinista.",{},{"id":271,"data":272,"type":42,"tunes":274},"h-claims",{"text":273,"level":219},"Capacidad, tasa de éxito, confiabilidad y seguridad son afirmaciones distintas",{},{"id":276,"data":277,"type":303,"tunes":304},"claims-table",{"content":278,"stretched":43,"withHeadings":14},[279,283,287,291,295,299],[280,281,282],"Afirmación","Lo que realmente demuestra","Lo que no demuestra",[284,285,286],"El agente completó la tarea una vez","Capacidad bajo una trayectoria observada","Repetibilidad, robustez, seguridad o generalización",[288,289,290],"El agente obtiene una puntuación alta en un benchmark","Rendimiento bajo las tareas y condiciones de evaluación de ese benchmark","Rendimiento de producción equivalente en diferentes entornos",[292,293,294],"El agente suele alcanzar el objetivo","Frecuencia de éxito en el resultado","Proceso correcto, comportamiento seguro o evidencia de que el resultado fue verificado",[296,297,298],"El agente sigue el proceso previsto","Calidad de la trayectoria según la rúbrica evaluada","Que el entorno externo haya aceptado realmente el resultado final",[300,301,302],"El agente evita acciones inseguras en un conjunto de prueba","Rendimiento en los casos de seguridad representados","Seguridad ante cualquier ambigüedad inédita, inyección o efecto secundario","table",{},{"id":306,"data":307,"type":42,"tunes":309},"h-ladder",{"text":308,"level":219},"La Escala de Confiabilidad para el Uso de Computadoras",{},{"id":311,"data":312,"type":226,"tunes":314},"p-ladder-intro",{"text":313},"Una forma útil de evaluar los sistemas de uso de computadoras es avanzar desde la capacidad puntual hacia propiedades de confiabilidad progresivamente más complejas. Los niveles superiores asumen los inferiores, pero no se derivan automáticamente de ellos.",{},{"id":316,"data":317,"type":342,"tunes":343},"ladder-flow",{"steps":318,"title":340,"orientation":341},[319,322,325,328,331,334,337],{"label":320,"description":321},"1. Capacidad","¿Puede el agente completar la tarea al menos una vez bajo condiciones conocidas?",{"label":323,"description":324},"2. Repetibilidad","¿Puede completar la misma tarea de manera consistente a lo largo de pruebas repetidas?",{"label":326,"description":327},"3. Robustez ambiental","¿Sobrevive a cambios de sincronización, problemas de red, ventanas emergentes, variaciones de la interfaz de usuario y pequeñas perturbaciones del entorno?",{"label":329,"description":330},"4. Control en horizontes largos","¿Puede preservar objetivos, restricciones y progreso a lo largo de muchos pasos, aplicaciones y eventos diferidos?",{"label":332,"description":333},"5. Conciencia del estado","¿Puede detectar cuándo cambió el entorno, cuándo importa un estado oculto o cuándo una suposición ya no es válida?",{"label":335,"description":336},"6. Verificación del resultado","¿Verifica que el resultado previsto realmente haya ocurrido en lugar de confiar en su propia secuencia de acciones?",{"label":338,"description":339},"7. Gestión segura de objetivos","¿Puede detenerse, preguntar, negarse o devolver el control cuando el objetivo es ambiguo, inviable, contradictorio o de alto impacto?","Escala de Confiabilidad para el Uso de Computadoras","auto","processFlow",{},{"id":345,"data":346,"type":42,"tunes":348},"h-capability",{"text":347,"level":218},"Nivel 1 — Capacidad: la pregunta de la demostración",{},{"id":350,"data":351,"type":226,"tunes":353},"p-capability-1",{"text":352},"La capacidad cuestiona si un agente puede realizar la tarea en absoluto. Esto es valioso. Los sistemas de uso de computadoras han avanzado rápidamente, y los agentes modernos pueden completar flujos de trabajo que los sistemas anteriores no podían ejecutar de forma confiable.",{},{"id":355,"data":356,"type":226,"tunes":358},"p-capability-2",{"text":357},"Pero la capacidad es un criterio débil para el despliegue. Una sola ejecución exitosa no indica si el agente tiene éxito el 95% de las veces o el 30% de las veces, si los fallos son inofensivos o destructivos, o si el éxito depende de un estado afortunado de la página.",{},{"id":360,"data":361,"type":42,"tunes":363},"h-repeatability",{"text":362,"level":218},"Nivel 2 — Repetibilidad: ¿se mantiene resuelta la misma tarea?",{},{"id":365,"data":366,"type":226,"tunes":368},"p-repeat-1",{"text":367},"Las trayectorias de uso de la computadora son estocásticas. Las respuestas de los modelos varían, las páginas cargan a diferentes velocidades, los estados visuales cambian y los flujos de trabajo largos generan múltiples ramificaciones. Por lo tanto, una prueba en producción debe ejecutar la misma tarea varias veces en lugar de tratar un único rastro exitoso como representativo.",{},{"id":370,"data":371,"type":226,"tunes":373},"p-repeat-2",{"text":372},"Mida no solo la tasa de éxito promedio, sino también la distribución de los modos de fallo: clic erróneo, finalización prematura, confirmación omitida, campo incorrecto, acción duplicada, bucle de navegación, suposición de estado obsoleto y reporte de falso éxito.",{},{"id":375,"data":376,"type":42,"tunes":378},"h-robustness",{"text":377,"level":218},"Nivel 3 — Robustez ambiental: ¿qué ocurre cuando la web se comporta como la web?",{},{"id":380,"data":381,"type":226,"tunes":383},"p-robust-1",{"text":382},"Los sitios web reales no son entornos de referencia estáticos. Las solicitudes fallan, los elementos tardan en cargar, las sesiones caducan, las páginas cambian, aparecen banners de consentimiento, los servidores devuelven errores y las condiciones de la red fluctúan.",{},{"id":385,"data":386,"type":226,"tunes":388},"p-robust-2",{"text":387},"WAREX evalúa esta brecha inyectando una falta de fiabilidad web realista en los entornos de referencia existentes y reporta caídas significativas en el éxito de las tareas. Esta es una perspectiva crítica para la producción: un benchmark puede medir la competencia en la tarea mientras subestima la recuperación ante la inestabilidad ambiental.",{},{"id":390,"data":391,"type":234,"tunes":395},"robust-tip",{"body":392,"title":393,"variant":394},"Inyecte retrasos, fallos HTTP transitorios, estados de página obsoletos, cuadros de diálogo modales, caducidad de sesiones, respuestas duplicadas y variaciones controladas de la interfaz de usuario. Si el agente solo funciona en el camino ideal, es un sistema apto para demostraciones, no fiable para producción.","Prueba de fiabilidad","tip",{},{"id":397,"data":398,"type":42,"tunes":400},"h-long",{"text":399,"level":218},"Nivel 4 — Control de horizonte largo: el éxito cambia cuando la tarea se convierte en trabajo real",{},{"id":402,"data":403,"type":226,"tunes":405},"p-long-1",{"text":404},"Las tareas cortas ocultan una clase de fallos que solo aparecen tras decenas o cientos de acciones: restricciones olvidadas, trabajo duplicado, finalización prematura, cambios de estado no detectados, inconsistencias entre aplicaciones y pequeños errores acumulados.",{},{"id":407,"data":408,"type":226,"tunes":410},"p-long-2",{"text":409},"OSWorld 2.0 se diseñó específicamente en torno a flujos de trabajo reales de horizonte largo. Sus tareas toman a los usuarios humanos una mediana de aproximadamente 1,6 horas y requieren muchas más llamadas a herramientas que los benchmarks anteriores de uso de computadoras. Bajo su métrica principal de finalización, incluso los sistemas evaluados más avanzados siguen estando lejos de una fiabilidad completa en la tarea.",{},{"id":412,"data":413,"type":226,"tunes":415},"p-long-3",{"text":414},"WeaveBench llega a una conclusión similar desde otra perspectiva. Evalúa flujos de trabajo híbridos de GUI, CLI y código, e informa que la mejor combinación evaluada de modelo y entorno de ejecución supera solo el 41,2 % de las tareas. El resultado importante no es una cifra en una tabla de clasificación; es que la orquestación realista entre interfaces expone fallos ocultos en tareas más simples de una sola interfaz.",{},{"id":417,"data":418,"type":42,"tunes":420},"h-state",{"text":419,"level":218},"Nivel 5 — Conciencia del estado: el entorno puede cambiar por debajo del plan",{},{"id":422,"data":423,"type":226,"tunes":425},"p-state-1",{"text":424},"Las tareas de larga duración a menudo dependen de un estado oculto o cambiante: llega un correo electrónico, se modifica un calendario, se envía un formulario, finaliza un proceso en segundo plano, caduca una sesión del navegador, un usuario modifica un archivo o un sistema externo cambia su disponibilidad.",{},{"id":427,"data":428,"type":226,"tunes":430},"p-state-2",{"text":429},"SentinelBench de Microsoft sostiene que muchas tareas de larga duración no deberían resolverse en absoluto mediante una acción continua. El comportamiento correcto puede ser monitorizar, esperar un evento externo y luego actuar cuando el estado cambie. Esta es una capacidad diferente a hacer clic más rápido o planificar más pasos.",{},{"id":432,"data":433,"type":226,"tunes":435},"p-state-3",{"text":434},"Por lo tanto, un agente de uso de computadoras fiable necesita distinguir entre ejecutable ahora, esperando estado, estado cambiado y suposición invalidada.",{},{"id":437,"data":438,"type":42,"tunes":440},"h-verify",{"text":439,"level":218},"Nivel 6 — Verificación de resultados: ¿realmente funcionó la acción?",{},{"id":442,"data":443,"type":226,"tunes":445},"p-verify-1",{"text":444},"Un agente puede ejecutar una secuencia aparentemente correcta y, aun así, fracasar en la tarea. Es posible que no se registre el clic en un botón. Un formulario puede rechazar una validación oculta. Un archivo puede guardarse en el directorio incorrecto. Una compra puede quedar sin confirmar. Un sitio web puede mostrar una pantalla que aparenta éxito mientras la operación subyacente falló.",{},{"id":447,"data":448,"type":226,"tunes":450},"p-verify-2",{"text":449},"Las directrices actuales de OpenAI sobre el uso de computadoras recomiendan explícitamente acotar y verificar la ejecución en lugar de confiar únicamente en la respuesta final del modelo. El trabajo de Microsoft Research sobre verificadores de uso de computadoras llega a la misma conclusión a partir de la evaluación: el proceso y el resultado deben juzgarse por separado.",{},{"id":452,"data":453,"type":226,"tunes":455},"p-verify-3",{"text":454},"La investigación de Universal Verifier reporta que las configuraciones de verificación anteriores pueden producir altas tasas de falsos positivos, mientras que un diseño de rúbricas más sólido y la separación explícita de proceso, resultado, fallos controlables y fallos incontrolables mejoran sustancialmente la coincidencia con las etiquetas humanas.",{},{"id":457,"data":458,"type":42,"tunes":460},"h-safe-goal",{"text":459,"level":218},"Nivel 7 — Gestión segura de objetivos: el agente debe saber cuándo no continuar",{},{"id":462,"data":463,"type":226,"tunes":465},"p-safe-1",{"text":464},"Los agentes de uso de computadoras están optimizados para cumplir objetivos, pero la persistencia hacia el objetivo puede convertirse en sí misma en un modo de fallo. Una solicitud ambigua, una condición imposible, una instrucción contradictoria, una página web sospechosa o un entorno modificado pueden requerir aclaración o detenerse en lugar de tomar más acciones.",{},{"id":467,"data":468,"type":226,"tunes":470},"p-safe-2",{"text":469},"El benchmark BLIND-ACT estudia este problema como Direccionalidad Ciega hacia el Objetivo (Blind Goal-Directedness). En todos los sistemas evaluados en ese trabajo, los agentes continuaron con frecuencia persiguiendo tareas a pesar de la ambigüedad, la inviabilidad, el contexto conflictivo u otros motivos para reconsiderar. Los autores identifican patrones como el sesgo de ejecución primero (execution-first bias) y la primacía de la solicitud (request primacy).",{},{"id":472,"data":473,"type":226,"tunes":475},"p-safe-3",{"text":474},"Esta clase de fallo es importante porque un agente altamente capaz puede empeorar una mala situación con mayor rapidez. Por lo tanto, la fiabilidad incluye una política sobre cuándo no actuar.",{},{"id":477,"data":478,"type":42,"tunes":480},"h-stress",{"text":479,"level":219},"La prueba de estrés de la demo a producción",{},{"id":482,"data":483,"type":226,"tunes":485},"p-stress-intro",{"text":484},"Antes de implementar un flujo de trabajo de uso de computadora, tome la demo exitosa y elimine sistemáticamente los supuestos que la hicieron sencilla.",{},{"id":487,"data":488,"type":342,"tunes":518},"stress-flow",{"steps":489,"title":517,"orientation":341},[490,493,496,499,502,505,508,511,514],{"label":491,"description":492},"1. Volver a ejecutar la tarea limpia","Establezca la repetibilidad a lo largo de múltiples intentos antes de añadir complejidad.",{"label":494,"description":495},"2. Perturbar el entorno","Añada latencia, reintentos, ventanas emergentes, variaciones de página, sesiones caducadas y fallos temporales.",{"label":497,"description":498},"3. Extender el horizonte","Convierta la demo corta en el flujo de trabajo real completo con estado intermedio, múltiples aplicaciones y pasos diferidos.",{"label":500,"description":501},"4. Cambiar el estado oculto","Modifique la cuenta, el archivo, la tarea o el estado externo después de que el agente haya formulado un plan y compruebe si detecta el cambio.",{"label":503,"description":504},"5. Inyectar ambigüedad","Elimine un supuesto importante y compruebe si el agente pregunta en lugar de adivinar.",{"label":506,"description":507},"6. Inyectar una contradicción controlada","Presente el estado antiguo y el nuevo juntos y verifique que prevalezca el estado actual fidedigno.",{"label":509,"description":510},"7. Requerir prueba del resultado","Haga que la finalización de la tarea dependa de un estado final verificable, no del autoinforme del modelo.",{"label":512,"description":513},"8. Probar los límites con consecuencias","Confirme que las acciones irreversibles o sensibles activen la aprobación, el rechazo o la transferencia esperados.",{"label":515,"description":516},"9. Repetir tras cambios en el harness o en el modelo","Trate las actualizaciones del entorno de ejecución como cambios de fiabilidad que requieren pruebas de regresión.","Prueba de estrés de la demo a producción",{},{"id":520,"data":521,"type":42,"tunes":523},"h-benchmark-boundary",{"text":522,"level":219},"El éxito en los benchmarks tiene un límite de validez",{},{"id":525,"data":526,"type":226,"tunes":528},"p-boundary-1",{"text":527},"Una puntuación de benchmark es una afirmación condicional. Es válida para un modelo, harness, entorno, conjunto de tareas, evaluador, interfaz de herramientas, presupuesto de pasos, política de reintentos, fecha y método de evaluación específicos.",{},{"id":530,"data":531,"type":226,"tunes":533},"p-boundary-2",{"text":532},"El número se vuelve engañoso cuando esas condiciones desaparecen de la afirmación. «El agente X obtiene un 80 %» es más débil que «El agente X obtuvo un 80 % en el benchmark Y bajo el entorno Z con el evaluador J y un presupuesto de pasos N». La segunda afirmación preserva el límite que indica si la cifra es extrapolable a su aplicación.",{},{"id":535,"data":536,"type":541,"tunes":542},"ref-avb",{"url":537,"title":538,"excerpt":539,"ctaLabel":540},"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","El límite de validez de la respuesta: la capa que falta entre la relevancia y las respuestas confiables de IA","Un marco de trabajo para explicitar las condiciones bajo las cuales una afirmación de la IA sigue siendo válida y qué cambios requieren restricción, recálculo o abandono.","Leer El límite de validez de la respuesta","referralArticle",{},{"id":544,"data":545,"type":42,"tunes":547},"h-process-outcome",{"text":546,"level":219},"El éxito del proceso y el éxito del resultado deben puntuarse por separado",{},{"id":549,"data":550,"type":580,"tunes":581},"process-outcome-comparison",{"rows":551,"title":569,"layout":303,"columns":570},[552,557,561,565],{"id":553,"label":554,"values":555},"good-good","Proceso correcto \u002F resultado correcto",[556,556,556],"",{"id":558,"label":559,"values":560},"bad-good","Proceso erróneo \u002F resultado correcto",[556,556,556],{"id":562,"label":563,"values":564},"good-bad","Proceso correcto \u002F resultado erróneo",[556,556,556],{"id":566,"label":567,"values":568},"bad-bad","Proceso erróneo \u002F resultado erróneo",[556,556,556],"Cuatro posibles resultados de una ejecución de uso de computadora",[571,574,577],{"id":572,"label":573},"process","Proceso",{"id":575,"label":576},"outcome","Resultado",{"id":578,"label":579},"interpretation","Interpretación","comparison",{},{"id":583,"data":584,"type":226,"tunes":586},"p-process-1",{"text":585},"WeaveBench informa que la calificación basada únicamente en el resultado puede sobreestimar materialmente el rendimiento en el uso de computadoras, ya que un agente puede producir un artefacto aparentemente exitoso mediante un atajo o evidencia fabricada. El verificador debe inspeccionar la trayectoria y los entregables, no simplemente la afirmación final.",{},{"id":588,"data":589,"type":42,"tunes":591},"h-distribution",{"text":590,"level":219},"La fiabilidad en producción es una distribución, no una única tasa de éxito",{},{"id":593,"data":594,"type":226,"tunes":596},"p-dist-1",{"text":595},"Una evaluación de producción útil muestrea las dimensiones que realmente varían en su entorno. Para un flujo de trabajo en el navegador, esto podría incluir la antigüedad de la cuenta, la configuración regional, el viewport, la versión de la página, la calidad de la red, el estado de autenticación, el estado existente del carrito, las cookies, las ventanas emergentes, los permisos de usuario y si un humano interrumpe la ejecución.",{},{"id":598,"data":599,"type":303,"tunes":637},"distribution-table",{"content":600,"stretched":43,"withHeadings":14},[601,605,609,613,617,621,625,629,633],[602,603,604],"Dimensión","Variación de ejemplo","Por qué es importante",[606,607,608],"Entorno","Red rápida vs. lenta, fallos transitorios, tiempos de carga de página","Prueba la recuperación y el comportamiento de espera",[610,611,612],"Interfaz de usuario (UI)","Diferente viewport, modal, elemento reordenado, rediseño menor","Prueba supuestos visuales y de acción frágiles",[614,615,616],"Estado","Sesión iniciada\u002Fcerrada, carrito vacío\u002Fno vacío, archivo existente, permisos modificados","Prueba el razonamiento sobre el estado oculto",[618,619,620],"Horizonte de la tarea","5 pasos vs. más de 50 pasos, una aplicación vs. varias aplicaciones","Prueba el error acumulado en la trayectoria",[622,623,624],"Ambigüedad","Preferencia faltante o instrucción incompleta del usuario","Prueba si el agente pregunta en lugar de adivinar",[626,627,628],"Consecuencia","Solo lectura vs. comprar\u002Fenviar\u002Feliminar\u002Fmodificar","Prueba los controles de confirmación y autorización",[630,631,632],"Contenido adverso","Inyección de instrucciones (prompt injection) o texto engañoso en la página","Prueba la jerarquía de instrucciones y la contención",[634,635,636],"Versión del modelo \u002F harness","Actualización del entorno de ejecución","Prueba regresiones provocadas por cambios a nivel del sistema",{},{"id":639,"data":640,"type":42,"tunes":642},"h-budget",{"text":641,"level":219},"La fiabilidad necesita un presupuesto de fallos, no la perfección",{},{"id":644,"data":645,"type":226,"tunes":647},"p-budget-1",{"text":646},"Ningún sistema en producción es perfectamente fiable. La pregunta útil de ingeniería es qué fallos son aceptables, detectables y recuperables. Un intento fallido de ordenar una carpeta local no equivale a enviar el correo electrónico equivocado, comprar el producto erróneo o cambiar la configuración de una cuenta.",{},{"id":649,"data":650,"type":226,"tunes":652},"p-budget-2",{"text":651},"Clasifique las acciones según sus consecuencias y reversibilidad. Las acciones reversibles de bajo impacto pueden tolerar una mayor autonomía. Las acciones de alto impacto, visibles externamente o difíciles de revertir requieren una confirmación más sólida, verificación de estado, autorización y comprobaciones posteriores a la acción.",{},{"id":654,"data":655,"type":42,"tunes":657},"h-matrix",{"text":656,"level":219},"Una matriz práctica de fiabilidad para el uso del ordenador",{},{"id":659,"data":660,"type":303,"tunes":686},"control-matrix",{"content":661,"stretched":43,"withHeadings":14},[662,666,670,674,678,682],[663,664,665],"Clase de acción","Ejemplo","Control recomendado",[667,668,669],"Lectura \u002F inspección","Abrir páginas, leer archivos, recopilar información","Delimitar el alcance, registrar fuentes, tolerar errores de navegación recuperables",[671,672,673],"Cambio local reversible","Editar archivo de borrador, reorganizar espacio de trabajo temporal","Punto de control o versión antes del cambio; verificar el resultado",[675,676,677],"Comunicación externa","Enviar correo electrónico, publicar contenido, enviar formulario","Confirmación del usuario o autoridad delegada explícita; verificar el estado aceptado",[679,680,681],"Financiero \u002F transaccional","Compra, proceso de pago, suscripción de pago","Mandato estricto, restricciones de importe\u002Fcomerciante, confirmación final y verificación del recibo",[683,684,685],"Destructivo \u002F cambio de privilegios","Eliminar datos, cambiar permisos, revocar acceso","Autorización limitada, confirmación explícita, vía reversible cuando sea posible, auditoría posterior a la acción",{},{"id":688,"data":689,"type":42,"tunes":691},"h-log",{"text":690,"level":219},"Qué registrar ante un fallo en el uso del ordenador",{},{"id":693,"data":694,"type":710,"tunes":711},"log-list",{"meta":695,"items":696,"style":709},{},[697,698,699,700,701,702,703,704,705,706,707,708],"Objetivo del usuario y restricciones explícitas.","Versión del modelo y del harness.","Versiones del entorno y de las aplicaciones.","Capturas de pantalla u observaciones estructuradas relevantes para el fallo.","Acciones realizadas con marcas de tiempo.","Resultados de herramientas, clics, teclado y navegación.","Transiciones de estado y periodos de espera.","Eventos de aprobación, rechazo o transferencia.","Errores externos y fallos de red.","Estado final observable del entorno.","Resultado reportado por el agente.","Resultado del verificador y si el fallo era controlable por el agente.","unordered","list",{},{"id":713,"data":714,"type":226,"tunes":716},"p-log-1",{"text":715},"La comparación crucial es entre el éxito reportado y el éxito observable. Un sistema que no pueda distinguir entre ambos acumulará con el tiempo falsos positivos en producción.",{},{"id":718,"data":719,"type":541,"tunes":724},"ref-reliability",{"url":720,"title":721,"excerpt":722,"ctaLabel":723},"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Fiabilidad de los agentes de IA: por qué la respuesta final no es suficiente","Un modelo de fiabilidad más amplio para evaluar las trayectorias de los agentes, el uso de herramientas y las decisiones intermedias en lugar de aceptar la respuesta final como prueba de que el sistema funcionó correctamente.","Leer el artículo sobre fiabilidad de agentes",{},{"id":726,"data":727,"type":42,"tunes":729},"h-security",{"text":728,"level":219},"La seguridad es parte de la fiabilidad para los agentes de uso del ordenador",{},{"id":731,"data":732,"type":226,"tunes":734},"p-sec-1",{"text":733},"Los agentes de uso del ordenador no solo leen contenido no confiable; pueden actuar después de leerlo. Esto convierte la inyección de prompts, el contenido malicioso de páginas y el phishing en riesgos en la ruta de ejecución.",{},{"id":736,"data":737,"type":226,"tunes":739},"p-sec-2",{"text":738},"La guía actual de OpenAI para el uso del ordenador recomienda aislar el entorno, crear listas de permitidos para sitios y acciones, tratar el contenido en pantalla como no confiable, confirmar las acciones de impacto, delimitar la ejecución y verificar el resultado real. El agente de ChatGPT utiliza de manera similar confirmaciones, monitorización de inyección de prompts y modos supervisados para contextos sensibles.",{},{"id":741,"data":742,"type":226,"tunes":744},"p-sec-3",{"text":743},"El principio arquitectónico va más allá de cualquier proveedor concreto: no se debe permitir que el contenido observado por el agente redefina la autoridad del usuario. Una página web puede proporcionar datos. No puede otorgar permisos para enviar datos a otro lugar, realizar compras, modificar credenciales o anular los límites de la tarea.",{},{"id":746,"data":747,"type":42,"tunes":749},"h-change",{"text":748,"level":219},"¿Qué cambiaría esta respuesta?",{},{"id":751,"data":752,"type":226,"tunes":754},"p-change-1",{"text":753},"La brecha de fiabilidad se reduciría si los modelos de uso del ordenador se volvieran robustos frente a horizontes largos, estados dinámicos, variaciones en la interfaz de usuario, fallos del entorno y objetivos ambiguos en distribuciones representativas de producción. Unas mejores API de estado nativo, interfaces legibles por máquinas estandarizadas y una infraestructura de verificación más sólida también podrían reducir la cantidad de interacción frágil con la interfaz gráfica requerida.",{},{"id":756,"data":757,"type":226,"tunes":759},"p-change-2",{"text":758},"El umbral de despliegue también cambia según las consecuencias de la tarea. Una tasa de éxito del 70 % puede ser útil para una tarea de investigación supervisada y de bajo riesgo, e inaceptable para un flujo de trabajo financiero o destructivo autónomo. Por tanto, la fiabilidad debe evaluarse en función del coste de cada clase de fallo, no mediante un umbral universal de tasa de aprobación.",{},{"id":761,"data":762,"type":42,"tunes":764},"h-limitations",{"text":763,"level":219},"Limitaciones",{},{"id":766,"data":767,"type":226,"tunes":769},"p-limit-1",{"text":768},"Los benchmarks citados evalúan entornos diferentes y no deberían clasificarse comparándose entre sí como si midieran lo mismo. WAREX pone a prueba la falta de fiabilidad web; WeaveBench se centra en el trabajo híbrido de horizonte largo; OSWorld 2.0 se enfoca en flujos de trabajo largos y realistas; BLIND-ACT se centra en la gestión de objetivos bajo ambigüedad e inviabilidad.",{},{"id":771,"data":772,"type":226,"tunes":774},"p-limit-2",{"text":773},"Los resultados de los benchmarks también envejecen con rapidez. Las mejoras en el modelo, el harness y los verificadores pueden modificar sustancialmente las puntuaciones en cuestión de meses. Por consiguiente, la lección duradera radica en el método de evaluación: variar las condiciones, separar el proceso del resultado, verificar el estado externo y preservar los límites en torno a cada afirmación sobre el rendimiento.",{},{"id":776,"data":777,"type":42,"tunes":779},"h-conclusion",{"text":778,"level":219},"Conclusión",{},{"id":781,"data":782,"type":226,"tunes":784},"p-conclusion-1",{"text":783},"Los agentes con manejo de ordenadores ya son lo suficientemente competentes como para ser útiles. Por esa misma razón, la pregunta de evaluación ha cambiado. El reto ya no es solo si un agente puede completar un flujo de trabajo mediante clics. Consiste en saber si el sistema sigue siendo fiable cuando desaparecen las condiciones ideales de la demo.",{},{"id":786,"data":787,"type":226,"tunes":789},"p-conclusion-2",{"text":788},"Considere una ejecución exitosa como prueba de capacidad. Luego, evalúe la repetibilidad, la robustez ambiental, el control de horizontes largos, la percepción del estado, la verificación de resultados y la gestión segura de objetivos. Un agente con manejo de ordenadores para producción no es aquel capaz de completar la demo, sino aquel cuyos límites de fallo se conocen, se miden y se controlan.",{},{"id":791,"data":792,"type":42,"tunes":794},"h-faq",{"text":793,"level":219},"Preguntas frecuentes",{},{"id":796,"data":797,"type":796,"tunes":824},"faq",{"items":798,"title":823},[799,803,807,811,815,819],{"id":800,"answer":801,"question":802},"faq1","No. Demuestra capacidad bajo una trayectoria observada concreta. La fiabilidad en producción requiere un éxito repetido ante la variación ambiental, tareas de larga duración, cambios de estado, ambigüedad, condiciones de recuperación y acciones con consecuencias relevantes.","¿Demuestra una demo exitosa de un agente con manejo de ordenadores su fiabilidad en producción?",{"id":804,"answer":805,"question":806},"faq2","Los benchmarks pueden utilizar entornos más controlados, tareas más cortas, condiciones de red estables, combinaciones de aplicaciones más sencillas o criterios de resultado que no capturan todos los fallos del proceso. El límite exacto de validez depende de cada benchmark.","¿Por qué los benchmarks de uso de ordenadores pueden parecer mucho mejores que el rendimiento en el mundo real?",{"id":808,"answer":809,"question":810},"faq3","Verificar el resultado externo real. No tome la declaración final del agente o la secuencia de clics prevista como prueba de que el sistema de destino aceptó la operación.","¿Cuál es la comprobación de fiabilidad más importante tras una acción de uso de ordenador?",{"id":812,"answer":813,"question":814},"faq4","Los errores se acumulan a lo largo de muchas acciones, se olvidan restricciones, el estado externo cambia, el trabajo abarca múltiples aplicaciones, el estado oculto importa y el agente debe decidir cuándo esperar, preguntar, verificar o recuperarse en lugar de limitarse a seguir actuando.","¿Por qué las tareas informáticas de horizonte largo siguen siendo difíciles?",{"id":816,"answer":817,"question":818},"faq5","Repita tareas limpias, inyecte fallos ambientales realistas, varíe la interfaz y el estado, amplíe el horizonte del flujo de trabajo, introduzca ambigüedad, exija pruebas de resultados observables, evalúe los controles de acciones de alto impacto y vuelva a ejecutar la suite tras cambios en el modelo o en el entorno de ejecución.","¿Cómo debería probar un agente de navegador o de escritorio antes de su despliegue?",{"id":820,"answer":821,"question":822},"faq6","No para cada acción de bajo riesgo. Los requisitos de confirmación deben ajustarse en función de las consecuencias, la reversibilidad, la autoridad y la incertidumbre. Las acciones de alto impacto, visibles externamente o difíciles de revertir precisan controles más estrictos.","¿Deberían los agentes con manejo de ordenadores requerir siempre confirmación humana?","Fiabilidad de los agentes con manejo de ordenadores",{},{"id":826,"data":827,"type":42,"tunes":829},"h-glossary",{"text":828,"level":219},"Glosario",{},{"id":831,"data":832,"type":831,"tunes":859},"glossary",{"title":833,"entries":834},"Términos clave de fiabilidad",[835,839,843,847,851,855],{"term":836,"anchor":837,"definition":838},"Computer-use agent (Agente con manejo de ordenadores)","computer-use-agent","Un agente de IA que interactúa con interfaces gráficas de usuario o entornos informáticos mediante observaciones y acciones como hacer clic, escribir, desplazarse, operar con archivos o ejecutar flujos de trabajo entre aplicaciones.",{"term":840,"anchor":841,"definition":842},"Repeatability (Repetibilidad)","repeatability","El grado en que un agente puede completar la misma tarea de forma coherente a lo largo de ejecuciones repetidas, en lugar de tener éxito únicamente en trayectorias seleccionadas.",{"term":844,"anchor":845,"definition":846},"Environmental robustness (Robustez ambiental)","environmental-robustness","La capacidad de preservar un comportamiento correcto a pesar de variaciones realistas como la latencia, los errores transitorios, los cambios en la interfaz de usuario, el estado de la sesión y las condiciones inesperadas de las páginas.",{"term":848,"anchor":849,"definition":850},"Outcome verification (Verificación de resultados)","outcome-verification","Comprobar el estado externo real tras una acción para confirmar que se ha producido el resultado previsto, en lugar de fiarse del autoinforme del agente.",{"term":852,"anchor":853,"definition":854},"Blind Goal-Directedness (Orientación ciega a objetivos)","blind-goal-directedness","Un patrón de fallo en el que un agente con manejo de ordenadores continúa persiguiendo un objetivo a pesar de la ambigüedad, la inviabilidad, la presencia de condiciones contradictorias o la existencia de motivos para detenerse y reevaluar.",{"term":856,"anchor":857,"definition":858},"Reliability boundary (Límite de fiabilidad)","reliability-boundary","El conjunto de condiciones bajo las cuales una tasa de éxito observada o una afirmación de capacidad sigue siendo lo suficientemente representativa para una decisión de despliegue específica.",{},{"id":861,"data":862,"type":42,"tunes":864},"h-sources",{"text":863,"level":219},"Fuentes primarias y lecturas complementarias",{},{"id":866,"data":867,"type":873,"tunes":874},"src-openai-computer",{"link":868,"meta":869},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use",{"image":870,"title":871,"description":872},{"url":556},"OpenAI — Computer use","Guía actual para desarrolladores sobre el aislamiento de entornos, el tratamiento del contenido en pantalla como no confiable, la confirmación de acciones con consecuencias relevantes, la limitación de ejecuciones y la verificación de resultados.","linkTool",{},{"id":876,"data":877,"type":873,"tunes":883},"src-openai-safety",{"link":878,"meta":879},"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F",{"image":880,"title":881,"description":882},{"url":556},"OpenAI — Running Codex safely at OpenAI","Guía de producción actual sobre límites técnicos, aprobación humana, telemetría y control para agentes que actúan en sistemas reales.",{},{"id":885,"data":886,"type":873,"tunes":892},"src-ms-warex",{"link":887,"meta":888},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F",{"image":889,"title":890,"description":891},{"url":556},"Microsoft Research — WAREX","Evaluación de 2026 que muestra cómo la falta de fiabilidad web realista provoca caídas significativas en el éxito de las tareas de los agentes de navegación en los benchmarks existentes.",{},{"id":894,"data":895,"type":873,"tunes":901},"src-ms-verifier",{"link":896,"meta":897},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F",{"image":898,"title":899,"description":900},{"url":556},"Microsoft Research — The Art of Building Verifiers for Computer Use Agents","Trabajo de 2026 sobre la evaluación de procesos frente a resultados, fallos controlables frente a incontrolables y verificación fiable de trayectorias.",{},{"id":903,"data":904,"type":873,"tunes":910},"src-ms-weavebench",{"link":905,"meta":906},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F",{"image":907,"title":908,"description":909},{"url":556},"Microsoft Research — WeaveBench","Benchmark de horizonte largo de 2026 que combina flujos de trabajo de GUI, CLI y código, mostrando una brecha sustancial entre los agentes actuales y la finalización fiable en el mundo real.",{},{"id":912,"data":913,"type":873,"tunes":919},"src-osworld2",{"link":914,"meta":915},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537",{"image":916,"title":917,"description":918},{"url":556},"OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","Benchmark de 2026 centrado en flujos de trabajo realistas de uso de ordenadores de horizonte largo, estado oculto y razonamiento a partir de múltiples fuentes.",{},{"id":921,"data":922,"type":873,"tunes":928},"src-ms-sentinel",{"link":923,"meta":924},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F",{"image":925,"title":926,"description":927},{"url":556},"Microsoft Research — SentinelBench","Benchmark de 2026 para tareas que evolucionan en el tiempo donde los agentes deben monitorizar entornos y responder a cambios de estado en lugar de actuar de forma continua.",{},{"id":930,"data":931,"type":873,"tunes":937},"src-ms-blind",{"link":932,"meta":933},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F",{"image":934,"title":935,"description":936},{"url":556},"Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness","Investigación de ICLR 2026 sobre agentes que continúan persiguiendo objetivos ambiguos, contradictorios o inviables.",{},"2.31","Los agentes de uso de computadoras ahora pueden completar impresionantes flujos de trabajo en el navegador y en el escritorio, pero una ejecución exitosa demuestra capacidad—no fiabilidad. Este artículo muestra cómo probar la repetibilidad, la robustez ambiental, el control de horizonte largo, la conciencia del estado, la verificación de resultados y la gestión segura de objetivos.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg","PUBLISHED","2026-09-25T12:13:00.000Z","2026-09-25T16:13:28.344Z","2026-09-25T19:19:11.089Z",{"en":947,"de":948,"sr":949,"es":950,"fr":951,"it":952,"ru":953,"zh":954},"\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fde\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fsr\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fes\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Ffr\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fit\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fru\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fzh\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system",[956,960,964],{"id":957,"name":958,"slug":959},58,"Evaluación y compuertas de calidad","evaluation",{"id":961,"name":962,"slug":963},97,"Verificación en set de prueba","verification",{"id":965,"name":966,"slug":967},73,"Verificación y diff","verification-and-diffing",{"id":969,"login":970,"email":971,"displayName":972},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[974,1566],{"lang":975,"title":976,"content":977,"contentJson":978,"excerpt":1565},"en","Computer-Use Agents: Why a Successful Demo Can Still Be an Unreliable System","{\"time\":1790352872794,\"blocks\":[{\"id\":\"IYG9UPcPY0\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents can now click, type, browse, edit files, operate desktop applications, and complete impressive multi-step tasks. That makes successful demos easy to understand and easy to overinterpret. A single completed workflow shows that the agent can succeed under those conditions. It does not show how often it succeeds, how it behaves when the environment changes, whether it verifies the result, or how safely it acts when the goal becomes ambiguous.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"\u003Cstrong>A successful computer-use demo proves capability, not reliability.\u003C\u002Fstrong> Production reliability requires the agent to succeed repeatedly across environmental variation, recover from transient failures, preserve constraints over long horizons, detect hidden or changing state, verify the actual outcome, and stop or ask when the goal becomes ambiguous or unsafe. The correct production question is not “Can the agent do this task?” but “Under which conditions can we trust it to do this task repeatedly?”\"},\"tunes\":{}},{\"id\":\"freshness\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Fast-moving field\",\"body\":\"This article reflects computer-use agent research and platform guidance available on \u003Cstrong>25 September 2026\u003C\u002Fstrong>. Benchmark results are not directly comparable across different task sets, environments, models, step limits, judges, or harnesses. Treat every benchmark number together with its evaluation conditions.\"},\"tunes\":{}},{\"id\":\"model-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"The model used in this article\",\"body\":\"The Computer-Use Reliability Ladder and Demo-to-Production Stress Test below are practical evaluation models proposed here. They are not formal industry standards.\"},\"tunes\":{}},{\"id\":\"h-demo\",\"type\":\"header\",\"data\":{\"text\":\"Why the demo is the easiest possible reliability test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-demo-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A demo normally shows one trajectory that worked. The environment is known, the task is selected in advance, the operator can restart after a failure, and the audience sees the successful path. Production systems face a distribution instead: different pages, network conditions, account states, pop-ups, latency, UI changes, hidden state, permissions, interruptions, and users who describe goals imperfectly.\"},\"tunes\":{}},{\"id\":\"p-demo-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That distinction matters because computer-use agents operate through interfaces designed for humans rather than deterministic APIs. Their action loop depends on perception, state interpretation, planning, interaction timing, and environment response. Small changes can alter the trajectory even when the user goal is unchanged.\"},\"tunes\":{}},{\"id\":\"p-demo-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Microsoft Research's WAREX work makes the problem explicit: benchmark agents that look capable in controlled settings lose substantial task success when realistic web instability is introduced. The failure is not necessarily “the model became less intelligent.” The environment stopped being deterministic.\"},\"tunes\":{}},{\"id\":\"h-claims\",\"type\":\"header\",\"data\":{\"text\":\"Capability, success rate, reliability, and safety are different claims\",\"level\":2},\"tunes\":{}},{\"id\":\"claims-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Claim\",\"What it actually establishes\",\"What it does not establish\"],[\"The agent completed the task once\",\"Capability under one observed trajectory\",\"Repeatability, robustness, safety, or generalization\"],[\"The agent scores highly on a benchmark\",\"Performance under that benchmark's task and evaluation conditions\",\"Equivalent production performance on different environments\"],[\"The agent usually reaches the goal\",\"Outcome success frequency\",\"Correct process, safe behaviour, or evidence that the result was verified\"],[\"The agent follows the intended process\",\"Trajectory quality under the evaluated rubric\",\"That the external environment actually accepted the final outcome\"],[\"The agent avoids unsafe actions in a test set\",\"Performance on represented safety cases\",\"Safety under every novel ambiguity, injection, or side effect\"]]},\"tunes\":{}},{\"id\":\"h-ladder\",\"type\":\"header\",\"data\":{\"text\":\"The Computer-Use Reliability Ladder\",\"level\":2},\"tunes\":{}},{\"id\":\"p-ladder-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A useful way to evaluate computer-use systems is to move from one-off capability toward progressively harder reliability properties. Higher levels assume the lower levels but do not follow automatically from them.\"},\"tunes\":{}},{\"id\":\"ladder-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Computer-Use Reliability Ladder\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Capability\",\"description\":\"Can the agent complete the task at least once under known conditions?\"},{\"label\":\"2. Repeatability\",\"description\":\"Can it complete the same task consistently across repeated trials?\"},{\"label\":\"3. Environmental robustness\",\"description\":\"Does it survive timing changes, network issues, pop-ups, UI variation, and small environmental perturbations?\"},{\"label\":\"4. Long-horizon control\",\"description\":\"Can it preserve goals, constraints, and progress across many steps, applications, and delayed events?\"},{\"label\":\"5. State awareness\",\"description\":\"Can it detect when the environment changed, when hidden state matters, or when an assumption is no longer valid?\"},{\"label\":\"6. Outcome verification\",\"description\":\"Does it verify that the intended result actually happened instead of trusting its own action sequence?\"},{\"label\":\"7. Safe goal handling\",\"description\":\"Can it stop, ask, refuse, or hand control back when the goal is ambiguous, infeasible, contradictory, or high impact?\"}]},\"tunes\":{}},{\"id\":\"h-capability\",\"type\":\"header\",\"data\":{\"text\":\"Level 1 — Capability: the demo question\",\"level\":3},\"tunes\":{}},{\"id\":\"p-capability-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Capability asks whether an agent can perform the task at all. This is valuable. Computer-use systems have advanced rapidly, and modern agents can complete workflows that older systems could not execute reliably.\"},\"tunes\":{}},{\"id\":\"p-capability-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"But capability is a weak deployment criterion. One successful run does not tell you whether the agent succeeds 95% of the time or 30% of the time, whether failures are harmless or destructive, or whether success depends on a lucky page state.\"},\"tunes\":{}},{\"id\":\"h-repeatability\",\"type\":\"header\",\"data\":{\"text\":\"Level 2 — Repeatability: does the same task stay solved?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-repeat-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use trajectories are stochastic. Model outputs vary, pages load at different speeds, visual states change, and long workflows create many branching opportunities. A production test should therefore run the same task multiple times rather than treating one passing trace as representative.\"},\"tunes\":{}},{\"id\":\"p-repeat-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Measure not only the average success rate but also the distribution of failure modes: wrong click, premature termination, missed confirmation, incorrect field, duplicate action, navigation loop, stale-state assumption, and false success report.\"},\"tunes\":{}},{\"id\":\"h-robustness\",\"type\":\"header\",\"data\":{\"text\":\"Level 3 — Environmental robustness: what happens when the web behaves like the web?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-robust-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Real websites are not benchmark fixtures. Requests fail, elements load late, sessions expire, pages change, consent banners appear, servers return errors, and network conditions fluctuate.\"},\"tunes\":{}},{\"id\":\"p-robust-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"WAREX evaluates this gap by injecting realistic web unreliability into existing benchmark environments and reports significant drops in task success. This is a critical production insight: a benchmark can measure task competence while under-measuring recovery from environmental instability.\"},\"tunes\":{}},{\"id\":\"robust-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"Reliability test\",\"body\":\"Inject delays, transient HTTP failures, stale page state, modal dialogs, session expiration, duplicate responses, and controlled UI variation. If the agent only works on the clean path, it is a demo-capable system, not a production-reliable one.\"},\"tunes\":{}},{\"id\":\"h-long\",\"type\":\"header\",\"data\":{\"text\":\"Level 4 — Long-horizon control: success changes when the task becomes real work\",\"level\":3},\"tunes\":{}},{\"id\":\"p-long-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Short tasks hide a class of failures that appear only after dozens or hundreds of actions: forgotten constraints, duplicated work, premature completion, missed state changes, cross-application inconsistencies, and accumulated small errors.\"},\"tunes\":{}},{\"id\":\"p-long-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OSWorld 2.0 was designed specifically around long-horizon real-world workflows. Its tasks take human users a median of roughly 1.6 hours and require many more tool calls than earlier computer-use benchmarks. Under its primary completion metric, even the strongest evaluated systems remain far from complete task reliability.\"},\"tunes\":{}},{\"id\":\"p-long-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"WeaveBench reaches a similar conclusion from another angle. It evaluates hybrid GUI, CLI and code workflows and reports that the best evaluated model-runtime pairing passes only 41.2% of tasks. The important result is not one leaderboard number; it is that realistic cross-interface orchestration exposes failures hidden by simpler single-interface tasks.\"},\"tunes\":{}},{\"id\":\"h-state\",\"type\":\"header\",\"data\":{\"text\":\"Level 5 — State awareness: the environment can change underneath the plan\",\"level\":3},\"tunes\":{}},{\"id\":\"p-state-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running tasks often depend on hidden or changing state: an email arrives, a calendar changes, a form is submitted, a background process finishes, a browser session expires, a user modifies a file, or an external system changes availability.\"},\"tunes\":{}},{\"id\":\"p-state-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Microsoft's SentinelBench argues that many long-running tasks should not be solved through continuous action at all. The correct behaviour may be to monitor, wait for an external event, then act when the state changes. This is a different capability from clicking faster or planning more steps.\"},\"tunes\":{}},{\"id\":\"p-state-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"A reliable computer-use agent therefore needs to distinguish actionable now, waiting for state, state changed, and assumption invalidated.\"},\"tunes\":{}},{\"id\":\"h-verify\",\"type\":\"header\",\"data\":{\"text\":\"Level 6 — Outcome verification: did the action actually work?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-verify-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An agent can execute an apparently correct sequence and still fail the task. A button click may not register. A form may reject hidden validation. A file may save to the wrong directory. A purchase may remain unconfirmed. A site may display a success-looking screen while the underlying operation failed.\"},\"tunes\":{}},{\"id\":\"p-verify-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current computer-use guidance explicitly recommends bounding and verifying the run instead of relying only on the model's final answer. Microsoft Research's work on computer-use verifiers reaches the same conclusion from evaluation: process and outcome need to be judged separately.\"},\"tunes\":{}},{\"id\":\"p-verify-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The Universal Verifier research reports that earlier verifier setups can produce high false-positive rates, while stronger rubric design and explicit separation of process, outcome, controllable failures, and uncontrollable failures substantially improve agreement with human labels.\"},\"tunes\":{}},{\"id\":\"h-safe-goal\",\"type\":\"header\",\"data\":{\"text\":\"Level 7 — Safe goal handling: the agent must know when not to continue\",\"level\":3},\"tunes\":{}},{\"id\":\"p-safe-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents are optimized to complete goals, but goal persistence can itself become a failure mode. An ambiguous request, impossible condition, contradictory instruction, suspicious webpage, or changed environment may require clarification or stopping rather than more action.\"},\"tunes\":{}},{\"id\":\"p-safe-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The BLIND-ACT benchmark studies this problem as Blind Goal-Directedness. Across the systems evaluated in that work, agents frequently continued pursuing tasks despite ambiguity, infeasibility, conflicting context, or other reasons to reconsider. The authors identify patterns such as execution-first bias and request primacy.\"},\"tunes\":{}},{\"id\":\"p-safe-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"This failure class matters because a highly capable agent can make a bad situation worse faster. Reliability therefore includes a policy for when not to act.\"},\"tunes\":{}},{\"id\":\"h-stress\",\"type\":\"header\",\"data\":{\"text\":\"The Demo-to-Production Stress Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-stress-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Before deploying a computer-use workflow, take the successful demo and systematically remove the assumptions that made it easy.\"},\"tunes\":{}},{\"id\":\"stress-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Demo-to-Production Stress Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Re-run the clean task\",\"description\":\"Establish repeatability over multiple trials before adding complexity.\"},{\"label\":\"2. Perturb the environment\",\"description\":\"Add latency, retries, pop-ups, page variation, stale sessions and temporary failures.\"},{\"label\":\"3. Extend the horizon\",\"description\":\"Turn the short demo into the full real workflow with intermediate state, multiple applications and delayed steps.\"},{\"label\":\"4. Change hidden state\",\"description\":\"Modify account, file, task or external state after the agent has formed a plan and test whether it detects the change.\"},{\"label\":\"5. Inject ambiguity\",\"description\":\"Remove one important assumption and test whether the agent asks instead of guessing.\"},{\"label\":\"6. Inject a controlled contradiction\",\"description\":\"Present old and new state together and verify that authoritative current state wins.\"},{\"label\":\"7. Require outcome proof\",\"description\":\"Make task completion depend on verifiable final state, not the model's self-report.\"},{\"label\":\"8. Test consequential boundaries\",\"description\":\"Confirm that irreversible or sensitive actions trigger the expected approval, refusal or handoff.\"},{\"label\":\"9. Repeat after harness or model changes\",\"description\":\"Treat runtime upgrades as reliability changes that need regression testing.\"}]},\"tunes\":{}},{\"id\":\"h-benchmark-boundary\",\"type\":\"header\",\"data\":{\"text\":\"Benchmark success has a validity boundary\",\"level\":2},\"tunes\":{}},{\"id\":\"p-boundary-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A benchmark score is a conditional statement. It is valid for a particular model, harness, environment, task set, judge, tool interface, step budget, retry policy, date and evaluation method.\"},\"tunes\":{}},{\"id\":\"p-boundary-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The number becomes misleading when those conditions disappear from the claim. “Agent X scores 80%” is weaker than “Agent X scored 80% on benchmark Y under environment Z with judge J and step budget N.” The second statement preserves the boundary that tells you whether the number transfers to your application.\"},\"tunes\":{}},{\"id\":\"ref-avb\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\",\"title\":\"The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers\",\"excerpt\":\"A framework for making explicit the conditions under which an AI claim remains valid and what changes require restriction, recalculation, or abandonment.\",\"ctaLabel\":\"Read the Answer Validity Boundary\"},\"tunes\":{}},{\"id\":\"h-process-outcome\",\"type\":\"header\",\"data\":{\"text\":\"Process success and outcome success must be scored separately\",\"level\":2},\"tunes\":{}},{\"id\":\"process-outcome-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Four possible outcomes of one computer-use run\",\"layout\":\"table\",\"columns\":[{\"id\":\"process\",\"label\":\"Process\"},{\"id\":\"outcome\",\"label\":\"Outcome\"},{\"id\":\"interpretation\",\"label\":\"Interpretation\"}],\"rows\":[{\"id\":\"good-good\",\"label\":\"Correct process \u002F correct outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"bad-good\",\"label\":\"Wrong process \u002F correct outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"good-bad\",\"label\":\"Correct process \u002F wrong outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"bad-bad\",\"label\":\"Wrong process \u002F wrong outcome\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"p-process-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"WeaveBench reports that outcome-only grading can materially overestimate computer-use performance because an agent may produce an apparently successful artifact through a shortcut or fabricated evidence. The verifier must inspect the trajectory and deliverables, not merely the final claim.\"},\"tunes\":{}},{\"id\":\"h-distribution\",\"type\":\"header\",\"data\":{\"text\":\"Production reliability is a distribution, not a single pass rate\",\"level\":2},\"tunes\":{}},{\"id\":\"p-dist-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A useful production evaluation samples the dimensions that actually vary in your environment. For a browser workflow, that might include account age, locale, viewport, page version, network quality, authentication state, existing cart state, cookies, pop-ups, user permissions and whether a human interrupts the run.\"},\"tunes\":{}},{\"id\":\"distribution-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Dimension\",\"Example variation\",\"Why it matters\"],[\"Environment\",\"Fast vs slow network, transient failures, page timing\",\"Tests recovery and waiting behaviour\"],[\"UI\",\"Different viewport, modal, reordered element, minor redesign\",\"Tests brittle visual\u002Faction assumptions\"],[\"State\",\"Logged in\u002Fout, empty\u002Fnon-empty cart, existing file, changed permissions\",\"Tests hidden-state reasoning\"],[\"Task horizon\",\"5 steps vs 50+ steps, one app vs several apps\",\"Tests accumulated trajectory error\"],[\"Ambiguity\",\"Missing preference or incomplete user instruction\",\"Tests whether the agent asks instead of guesses\"],[\"Consequence\",\"Read-only vs purchase\u002Fsend\u002Fdelete\u002Fchange\",\"Tests confirmation and authorization controls\"],[\"Adversarial content\",\"Prompt injection or misleading page text\",\"Tests instruction hierarchy and containment\"],[\"Model \u002F harness version\",\"Runtime upgrade\",\"Tests regression from system-level changes\"]]},\"tunes\":{}},{\"id\":\"h-budget\",\"type\":\"header\",\"data\":{\"text\":\"Reliability needs a failure budget, not perfection\",\"level\":2},\"tunes\":{}},{\"id\":\"p-budget-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"No production system is perfectly reliable. The useful engineering question is which failures are acceptable, detectable and recoverable. A failed attempt to sort a local folder is not equivalent to sending the wrong email, purchasing the wrong product or changing an account setting.\"},\"tunes\":{}},{\"id\":\"p-budget-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Classify actions by consequence and reversibility. Low-impact reversible actions can tolerate more autonomy. High-impact, externally visible or hard-to-reverse actions need stronger confirmation, state verification, authorization and post-action checks.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A practical computer-use reliability matrix\",\"level\":2},\"tunes\":{}},{\"id\":\"control-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Action class\",\"Example\",\"Recommended control\"],[\"Read \u002F inspect\",\"Open pages, read files, gather information\",\"Bound scope, log sources, tolerate recoverable navigation errors\"],[\"Reversible local change\",\"Edit draft file, reorganize temporary workspace\",\"Checkpoint or version before change; verify result\"],[\"External communication\",\"Send email, publish content, submit form\",\"User confirmation or explicit delegated authority; verify accepted state\"],[\"Financial \u002F transactional\",\"Purchase, checkout, paid subscription\",\"Strict mandate, amount\u002Fmerchant constraints, final confirmation and receipt verification\"],[\"Destructive \u002F privilege-changing\",\"Delete data, change permissions, revoke access\",\"Narrow authorization, explicit confirmation, reversible path where possible, post-action audit\"]]},\"tunes\":{}},{\"id\":\"h-log\",\"type\":\"header\",\"data\":{\"text\":\"What to log for a computer-use failure\",\"level\":2},\"tunes\":{}},{\"id\":\"log-list\",\"type\":\"list\",\"data\":{\"style\":\"unordered\",\"meta\":{},\"items\":[\"User goal and explicit constraints.\",\"Model and harness version.\",\"Environment and application versions.\",\"Screenshots or structured observations relevant to the failure.\",\"Actions taken with timestamps.\",\"Tool, click, keyboard and navigation results.\",\"State transitions and waiting periods.\",\"Approval, refusal or handoff events.\",\"External errors and network failures.\",\"Final observable environment state.\",\"The agent's reported outcome.\",\"Verifier result and whether the failure was controllable by the agent.\"]},\"tunes\":{}},{\"id\":\"p-log-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The crucial comparison is between reported success and observable success. A system that cannot distinguish those two will eventually accumulate false positives in production.\"},\"tunes\":{}},{\"id\":\"ref-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"A broader reliability model for evaluating agent trajectories, tool use and intermediate decisions instead of accepting the final answer as proof that the system worked correctly.\",\"ctaLabel\":\"Read the agent reliability article\"},\"tunes\":{}},{\"id\":\"h-security\",\"type\":\"header\",\"data\":{\"text\":\"Security is part of reliability for computer-use agents\",\"level\":2},\"tunes\":{}},{\"id\":\"p-sec-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents do not merely read untrusted content; they can act after reading it. That turns prompt injection, malicious page content and phishing into execution-path risks.\"},\"tunes\":{}},{\"id\":\"p-sec-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current computer-use guidance recommends isolating the environment, allow-listing sites and actions, treating screen content as untrusted, confirming consequential actions, bounding the run and verifying the actual outcome. ChatGPT agent similarly uses confirmations, prompt-injection monitoring and supervised modes for sensitive contexts.\"},\"tunes\":{}},{\"id\":\"p-sec-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The architecture principle is broader than any one provider: content observed by the agent must not be allowed to redefine the user's authority. A webpage can provide data. It cannot grant permission to send data elsewhere, purchase something, change credentials or override the task boundary.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The reliability gap would narrow if computer-use models became robust to long horizons, dynamic state, UI variation, environmental failures and ambiguous goals across representative production distributions. Better native state APIs, standardized machine-readable interfaces and stronger verifier infrastructure could also reduce the amount of fragile GUI interaction required.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The deployment threshold also changes with task consequence. A 70% success rate can be useful for a supervised low-risk research task and unacceptable for an autonomous financial or destructive workflow. Reliability must therefore be evaluated against the cost of each failure class, not one universal pass-rate threshold.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The cited benchmarks evaluate different environments and should not be ranked against one another as if they measured the same thing. WAREX stresses web unreliability; WeaveBench targets hybrid long-horizon work; OSWorld 2.0 targets realistic long workflows; BLIND-ACT focuses on goal handling under ambiguity and infeasibility.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Benchmark results also age quickly. Model, harness and verifier improvements can materially change scores within months. The durable lesson is therefore the evaluation method: vary conditions, separate process from outcome, verify external state, and preserve the boundary around each performance claim.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents are already capable enough to be useful. That is exactly why the evaluation question has changed. The challenge is no longer only whether an agent can click through a workflow. It is whether the system remains dependable when the clean demo conditions disappear.\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Treat one successful run as evidence of capability. Then test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification and safe goal handling. A production computer-use agent is not the one that can complete the demo. It is the one whose failure boundaries are known, measured and controlled.\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Computer-use agent reliability\",\"items\":[{\"id\":\"faq1\",\"question\":\"Does a successful computer-use agent demo prove production reliability?\",\"answer\":\"No. It proves capability under one observed trajectory. Production reliability requires repeated success across environmental variation, long-running tasks, changing state, ambiguity, recovery conditions and consequential actions.\"},{\"id\":\"faq2\",\"question\":\"Why can computer-use benchmarks look much better than real-world performance?\",\"answer\":\"Benchmarks can use more controlled environments, shorter tasks, stable network conditions, simpler application combinations or outcome criteria that do not capture all process failures. The exact validity boundary depends on each benchmark.\"},{\"id\":\"faq3\",\"question\":\"What is the most important reliability check after a computer-use action?\",\"answer\":\"Verify the actual external outcome. Do not treat the agent's final statement or intended click sequence as proof that the target system accepted the operation.\"},{\"id\":\"faq4\",\"question\":\"Why do long-horizon computer tasks remain difficult?\",\"answer\":\"Errors accumulate across many actions, constraints are forgotten, external state changes, work spans multiple applications, hidden state matters, and the agent must decide when to wait, ask, verify or recover rather than simply continue acting.\"},{\"id\":\"faq5\",\"question\":\"How should I test a browser or desktop agent before deployment?\",\"answer\":\"Repeat clean tasks, inject realistic environmental failures, vary UI and state, extend the workflow horizon, introduce ambiguity, require observable outcome proof, test high-impact action controls and rerun the suite after model or harness changes.\"},{\"id\":\"faq6\",\"question\":\"Should computer-use agents always require human confirmation?\",\"answer\":\"Not for every low-risk action. Confirmation requirements should scale with consequence, reversibility, authority and uncertainty. High-impact, externally visible or difficult-to-reverse actions need stronger controls.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key reliability terms\",\"entries\":[{\"term\":\"Computer-use agent\",\"definition\":\"An AI agent that interacts with graphical user interfaces or computer environments through observations and actions such as clicking, typing, scrolling, file operations or cross-application workflows.\",\"anchor\":\"computer-use-agent\"},{\"term\":\"Repeatability\",\"definition\":\"The degree to which an agent can complete the same task consistently across repeated runs rather than succeeding only on selected trajectories.\",\"anchor\":\"repeatability\"},{\"term\":\"Environmental robustness\",\"definition\":\"The ability to preserve correct behaviour despite realistic variation such as latency, transient errors, UI changes, session state and unexpected page conditions.\",\"anchor\":\"environmental-robustness\"},{\"term\":\"Outcome verification\",\"definition\":\"Checking the actual external state after an action to confirm that the intended result occurred instead of relying on the agent's self-report.\",\"anchor\":\"outcome-verification\"},{\"term\":\"Blind Goal-Directedness\",\"definition\":\"A failure pattern in which a computer-use agent continues pursuing a goal despite ambiguity, infeasibility, contradictory conditions or reasons to stop and reassess.\",\"anchor\":\"blind-goal-directedness\"},{\"term\":\"Reliability boundary\",\"definition\":\"The set of conditions under which an observed success rate or capability claim remains representative enough for a specific deployment decision.\",\"anchor\":\"reliability-boundary\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-computer\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use\",\"meta\":{\"title\":\"OpenAI — Computer use\",\"description\":\"Current developer guidance on isolating environments, treating screen content as untrusted, confirming consequential actions, bounding runs and verifying outcomes.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-openai-safety\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F\",\"meta\":{\"title\":\"OpenAI — Running Codex safely at OpenAI\",\"description\":\"Current production guidance on technical boundaries, human approval, telemetry and control for agents that act on real systems.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-warex\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F\",\"meta\":{\"title\":\"Microsoft Research — WAREX\",\"description\":\"2026 evaluation showing that realistic web unreliability causes significant drops in browser-agent task success on existing benchmarks.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-verifier\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F\",\"meta\":{\"title\":\"Microsoft Research — The Art of Building Verifiers for Computer Use Agents\",\"description\":\"2026 work on process versus outcome evaluation, controllable versus uncontrollable failures and reliable trajectory verification.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-weavebench\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F\",\"meta\":{\"title\":\"Microsoft Research — WeaveBench\",\"description\":\"2026 long-horizon benchmark combining GUI, CLI and code workflows and showing a substantial gap between current agents and reliable real-world completion.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-osworld2\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537\",\"meta\":{\"title\":\"OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks\",\"description\":\"2026 benchmark focused on realistic long-horizon computer-use workflows, hidden state and cross-source reasoning.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-sentinel\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F\",\"meta\":{\"title\":\"Microsoft Research — SentinelBench\",\"description\":\"2026 benchmark for time-evolving tasks where agents must monitor environments and respond to state changes rather than continuously act.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-blind\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F\",\"meta\":{\"title\":\"Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness\",\"description\":\"ICLR 2026 research on agents continuing to pursue ambiguous, contradictory or infeasible goals.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":979,"blocks":980,"version":1564},1790352872794,[981,985,989,994,999,1004,1008,1012,1016,1020,1024,1052,1056,1060,1086,1090,1094,1098,1102,1106,1110,1114,1118,1122,1127,1131,1135,1139,1143,1147,1151,1155,1159,1163,1167,1171,1175,1179,1183,1187,1191,1195,1199,1231,1235,1239,1243,1250,1254,1278,1282,1286,1290,1330,1334,1338,1342,1346,1374,1378,1395,1399,1406,1410,1414,1418,1422,1426,1430,1434,1438,1442,1446,1450,1454,1458,1462,1485,1489,1512,1516,1522,1528,1534,1540,1546,1552,1558],{"id":215,"data":982,"type":220,"tunes":984},{"title":983,"maxLevel":218,"minLevel":219},"Contents",{},{"id":223,"data":986,"type":226,"tunes":988},{"text":987},"Computer-use agents can now click, type, browse, edit files, operate desktop applications, and complete impressive multi-step tasks. That makes successful demos easy to understand and easy to overinterpret. A single completed workflow shows that the agent can succeed under those conditions. It does not show how often it succeeds, how it behaves when the environment changes, whether it verifies the result, or how safely it acts when the goal becomes ambiguous.",{},{"id":229,"data":990,"type":234,"tunes":993},{"body":991,"title":992,"variant":233},"\u003Cstrong>A successful computer-use demo proves capability, not reliability.\u003C\u002Fstrong> Production reliability requires the agent to succeed repeatedly across environmental variation, recover from transient failures, preserve constraints over long horizons, detect hidden or changing state, verify the actual outcome, and stop or ask when the goal becomes ambiguous or unsafe. The correct production question is not “Can the agent do this task?” but “Under which conditions can we trust it to do this task repeatedly?”","Direct answer",{},{"id":237,"data":995,"type":234,"tunes":998},{"body":996,"title":997,"variant":241},"This article reflects computer-use agent research and platform guidance available on \u003Cstrong>25 September 2026\u003C\u002Fstrong>. Benchmark results are not directly comparable across different task sets, environments, models, step limits, judges, or harnesses. Treat every benchmark number together with its evaluation conditions.","Fast-moving field",{},{"id":244,"data":1000,"type":234,"tunes":1003},{"body":1001,"title":1002,"variant":248},"The Computer-Use Reliability Ladder and Demo-to-Production Stress Test below are practical evaluation models proposed here. They are not formal industry standards.","The model used in this article",{},{"id":251,"data":1005,"type":42,"tunes":1007},{"text":1006,"level":219},"Why the demo is the easiest possible reliability test",{},{"id":256,"data":1009,"type":226,"tunes":1011},{"text":1010},"A demo normally shows one trajectory that worked. The environment is known, the task is selected in advance, the operator can restart after a failure, and the audience sees the successful path. Production systems face a distribution instead: different pages, network conditions, account states, pop-ups, latency, UI changes, hidden state, permissions, interruptions, and users who describe goals imperfectly.",{},{"id":261,"data":1013,"type":226,"tunes":1015},{"text":1014},"That distinction matters because computer-use agents operate through interfaces designed for humans rather than deterministic APIs. Their action loop depends on perception, state interpretation, planning, interaction timing, and environment response. Small changes can alter the trajectory even when the user goal is unchanged.",{},{"id":266,"data":1017,"type":226,"tunes":1019},{"text":1018},"Microsoft Research's WAREX work makes the problem explicit: benchmark agents that look capable in controlled settings lose substantial task success when realistic web instability is introduced. The failure is not necessarily “the model became less intelligent.” The environment stopped being deterministic.",{},{"id":271,"data":1021,"type":42,"tunes":1023},{"text":1022,"level":219},"Capability, success rate, reliability, and safety are different claims",{},{"id":276,"data":1025,"type":303,"tunes":1051},{"content":1026,"stretched":43,"withHeadings":14},[1027,1031,1035,1039,1043,1047],[1028,1029,1030],"Claim","What it actually establishes","What it does not establish",[1032,1033,1034],"The agent completed the task once","Capability under one observed trajectory","Repeatability, robustness, safety, or generalization",[1036,1037,1038],"The agent scores highly on a benchmark","Performance under that benchmark's task and evaluation conditions","Equivalent production performance on different environments",[1040,1041,1042],"The agent usually reaches the goal","Outcome success frequency","Correct process, safe behaviour, or evidence that the result was verified",[1044,1045,1046],"The agent follows the intended process","Trajectory quality under the evaluated rubric","That the external environment actually accepted the final outcome",[1048,1049,1050],"The agent avoids unsafe actions in a test set","Performance on represented safety cases","Safety under every novel ambiguity, injection, or side effect",{},{"id":306,"data":1053,"type":42,"tunes":1055},{"text":1054,"level":219},"The Computer-Use Reliability Ladder",{},{"id":311,"data":1057,"type":226,"tunes":1059},{"text":1058},"A useful way to evaluate computer-use systems is to move from one-off capability toward progressively harder reliability properties. Higher levels assume the lower levels but do not follow automatically from them.",{},{"id":316,"data":1061,"type":342,"tunes":1085},{"steps":1062,"title":1084,"orientation":341},[1063,1066,1069,1072,1075,1078,1081],{"label":1064,"description":1065},"1. Capability","Can the agent complete the task at least once under known conditions?",{"label":1067,"description":1068},"2. Repeatability","Can it complete the same task consistently across repeated trials?",{"label":1070,"description":1071},"3. Environmental robustness","Does it survive timing changes, network issues, pop-ups, UI variation, and small environmental perturbations?",{"label":1073,"description":1074},"4. Long-horizon control","Can it preserve goals, constraints, and progress across many steps, applications, and delayed events?",{"label":1076,"description":1077},"5. State awareness","Can it detect when the environment changed, when hidden state matters, or when an assumption is no longer valid?",{"label":1079,"description":1080},"6. Outcome verification","Does it verify that the intended result actually happened instead of trusting its own action sequence?",{"label":1082,"description":1083},"7. Safe goal handling","Can it stop, ask, refuse, or hand control back when the goal is ambiguous, infeasible, contradictory, or high impact?","Computer-Use Reliability Ladder",{},{"id":345,"data":1087,"type":42,"tunes":1089},{"text":1088,"level":218},"Level 1 — Capability: the demo question",{},{"id":350,"data":1091,"type":226,"tunes":1093},{"text":1092},"Capability asks whether an agent can perform the task at all. This is valuable. Computer-use systems have advanced rapidly, and modern agents can complete workflows that older systems could not execute reliably.",{},{"id":355,"data":1095,"type":226,"tunes":1097},{"text":1096},"But capability is a weak deployment criterion. One successful run does not tell you whether the agent succeeds 95% of the time or 30% of the time, whether failures are harmless or destructive, or whether success depends on a lucky page state.",{},{"id":360,"data":1099,"type":42,"tunes":1101},{"text":1100,"level":218},"Level 2 — Repeatability: does the same task stay solved?",{},{"id":365,"data":1103,"type":226,"tunes":1105},{"text":1104},"Computer-use trajectories are stochastic. Model outputs vary, pages load at different speeds, visual states change, and long workflows create many branching opportunities. A production test should therefore run the same task multiple times rather than treating one passing trace as representative.",{},{"id":370,"data":1107,"type":226,"tunes":1109},{"text":1108},"Measure not only the average success rate but also the distribution of failure modes: wrong click, premature termination, missed confirmation, incorrect field, duplicate action, navigation loop, stale-state assumption, and false success report.",{},{"id":375,"data":1111,"type":42,"tunes":1113},{"text":1112,"level":218},"Level 3 — Environmental robustness: what happens when the web behaves like the web?",{},{"id":380,"data":1115,"type":226,"tunes":1117},{"text":1116},"Real websites are not benchmark fixtures. Requests fail, elements load late, sessions expire, pages change, consent banners appear, servers return errors, and network conditions fluctuate.",{},{"id":385,"data":1119,"type":226,"tunes":1121},{"text":1120},"WAREX evaluates this gap by injecting realistic web unreliability into existing benchmark environments and reports significant drops in task success. This is a critical production insight: a benchmark can measure task competence while under-measuring recovery from environmental instability.",{},{"id":390,"data":1123,"type":234,"tunes":1126},{"body":1124,"title":1125,"variant":394},"Inject delays, transient HTTP failures, stale page state, modal dialogs, session expiration, duplicate responses, and controlled UI variation. If the agent only works on the clean path, it is a demo-capable system, not a production-reliable one.","Reliability test",{},{"id":397,"data":1128,"type":42,"tunes":1130},{"text":1129,"level":218},"Level 4 — Long-horizon control: success changes when the task becomes real work",{},{"id":402,"data":1132,"type":226,"tunes":1134},{"text":1133},"Short tasks hide a class of failures that appear only after dozens or hundreds of actions: forgotten constraints, duplicated work, premature completion, missed state changes, cross-application inconsistencies, and accumulated small errors.",{},{"id":407,"data":1136,"type":226,"tunes":1138},{"text":1137},"OSWorld 2.0 was designed specifically around long-horizon real-world workflows. Its tasks take human users a median of roughly 1.6 hours and require many more tool calls than earlier computer-use benchmarks. Under its primary completion metric, even the strongest evaluated systems remain far from complete task reliability.",{},{"id":412,"data":1140,"type":226,"tunes":1142},{"text":1141},"WeaveBench reaches a similar conclusion from another angle. It evaluates hybrid GUI, CLI and code workflows and reports that the best evaluated model-runtime pairing passes only 41.2% of tasks. The important result is not one leaderboard number; it is that realistic cross-interface orchestration exposes failures hidden by simpler single-interface tasks.",{},{"id":417,"data":1144,"type":42,"tunes":1146},{"text":1145,"level":218},"Level 5 — State awareness: the environment can change underneath the plan",{},{"id":422,"data":1148,"type":226,"tunes":1150},{"text":1149},"Long-running tasks often depend on hidden or changing state: an email arrives, a calendar changes, a form is submitted, a background process finishes, a browser session expires, a user modifies a file, or an external system changes availability.",{},{"id":427,"data":1152,"type":226,"tunes":1154},{"text":1153},"Microsoft's SentinelBench argues that many long-running tasks should not be solved through continuous action at all. The correct behaviour may be to monitor, wait for an external event, then act when the state changes. This is a different capability from clicking faster or planning more steps.",{},{"id":432,"data":1156,"type":226,"tunes":1158},{"text":1157},"A reliable computer-use agent therefore needs to distinguish actionable now, waiting for state, state changed, and assumption invalidated.",{},{"id":437,"data":1160,"type":42,"tunes":1162},{"text":1161,"level":218},"Level 6 — Outcome verification: did the action actually work?",{},{"id":442,"data":1164,"type":226,"tunes":1166},{"text":1165},"An agent can execute an apparently correct sequence and still fail the task. A button click may not register. A form may reject hidden validation. A file may save to the wrong directory. A purchase may remain unconfirmed. A site may display a success-looking screen while the underlying operation failed.",{},{"id":447,"data":1168,"type":226,"tunes":1170},{"text":1169},"OpenAI's current computer-use guidance explicitly recommends bounding and verifying the run instead of relying only on the model's final answer. Microsoft Research's work on computer-use verifiers reaches the same conclusion from evaluation: process and outcome need to be judged separately.",{},{"id":452,"data":1172,"type":226,"tunes":1174},{"text":1173},"The Universal Verifier research reports that earlier verifier setups can produce high false-positive rates, while stronger rubric design and explicit separation of process, outcome, controllable failures, and uncontrollable failures substantially improve agreement with human labels.",{},{"id":457,"data":1176,"type":42,"tunes":1178},{"text":1177,"level":218},"Level 7 — Safe goal handling: the agent must know when not to continue",{},{"id":462,"data":1180,"type":226,"tunes":1182},{"text":1181},"Computer-use agents are optimized to complete goals, but goal persistence can itself become a failure mode. An ambiguous request, impossible condition, contradictory instruction, suspicious webpage, or changed environment may require clarification or stopping rather than more action.",{},{"id":467,"data":1184,"type":226,"tunes":1186},{"text":1185},"The BLIND-ACT benchmark studies this problem as Blind Goal-Directedness. Across the systems evaluated in that work, agents frequently continued pursuing tasks despite ambiguity, infeasibility, conflicting context, or other reasons to reconsider. The authors identify patterns such as execution-first bias and request primacy.",{},{"id":472,"data":1188,"type":226,"tunes":1190},{"text":1189},"This failure class matters because a highly capable agent can make a bad situation worse faster. Reliability therefore includes a policy for when not to act.",{},{"id":477,"data":1192,"type":42,"tunes":1194},{"text":1193,"level":219},"The Demo-to-Production Stress Test",{},{"id":482,"data":1196,"type":226,"tunes":1198},{"text":1197},"Before deploying a computer-use workflow, take the successful demo and systematically remove the assumptions that made it easy.",{},{"id":487,"data":1200,"type":342,"tunes":1230},{"steps":1201,"title":1229,"orientation":341},[1202,1205,1208,1211,1214,1217,1220,1223,1226],{"label":1203,"description":1204},"1. Re-run the clean task","Establish repeatability over multiple trials before adding complexity.",{"label":1206,"description":1207},"2. Perturb the environment","Add latency, retries, pop-ups, page variation, stale sessions and temporary failures.",{"label":1209,"description":1210},"3. Extend the horizon","Turn the short demo into the full real workflow with intermediate state, multiple applications and delayed steps.",{"label":1212,"description":1213},"4. Change hidden state","Modify account, file, task or external state after the agent has formed a plan and test whether it detects the change.",{"label":1215,"description":1216},"5. Inject ambiguity","Remove one important assumption and test whether the agent asks instead of guessing.",{"label":1218,"description":1219},"6. Inject a controlled contradiction","Present old and new state together and verify that authoritative current state wins.",{"label":1221,"description":1222},"7. Require outcome proof","Make task completion depend on verifiable final state, not the model's self-report.",{"label":1224,"description":1225},"8. Test consequential boundaries","Confirm that irreversible or sensitive actions trigger the expected approval, refusal or handoff.",{"label":1227,"description":1228},"9. Repeat after harness or model changes","Treat runtime upgrades as reliability changes that need regression testing.","Demo-to-Production Stress Test",{},{"id":520,"data":1232,"type":42,"tunes":1234},{"text":1233,"level":219},"Benchmark success has a validity boundary",{},{"id":525,"data":1236,"type":226,"tunes":1238},{"text":1237},"A benchmark score is a conditional statement. It is valid for a particular model, harness, environment, task set, judge, tool interface, step budget, retry policy, date and evaluation method.",{},{"id":530,"data":1240,"type":226,"tunes":1242},{"text":1241},"The number becomes misleading when those conditions disappear from the claim. “Agent X scores 80%” is weaker than “Agent X scored 80% on benchmark Y under environment Z with judge J and step budget N.” The second statement preserves the boundary that tells you whether the number transfers to your application.",{},{"id":535,"data":1244,"type":541,"tunes":1249},{"url":1245,"title":1246,"excerpt":1247,"ctaLabel":1248},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers","A framework for making explicit the conditions under which an AI claim remains valid and what changes require restriction, recalculation, or abandonment.","Read the Answer Validity Boundary",{},{"id":544,"data":1251,"type":42,"tunes":1253},{"text":1252,"level":219},"Process success and outcome success must be scored separately",{},{"id":549,"data":1255,"type":580,"tunes":1277},{"rows":1256,"title":1269,"layout":303,"columns":1270},[1257,1260,1263,1266],{"id":553,"label":1258,"values":1259},"Correct process \u002F correct outcome",[556,556,556],{"id":558,"label":1261,"values":1262},"Wrong process \u002F correct outcome",[556,556,556],{"id":562,"label":1264,"values":1265},"Correct process \u002F wrong outcome",[556,556,556],{"id":566,"label":1267,"values":1268},"Wrong process \u002F wrong outcome",[556,556,556],"Four possible outcomes of one computer-use run",[1271,1273,1275],{"id":572,"label":1272},"Process",{"id":575,"label":1274},"Outcome",{"id":578,"label":1276},"Interpretation",{},{"id":583,"data":1279,"type":226,"tunes":1281},{"text":1280},"WeaveBench reports that outcome-only grading can materially overestimate computer-use performance because an agent may produce an apparently successful artifact through a shortcut or fabricated evidence. The verifier must inspect the trajectory and deliverables, not merely the final claim.",{},{"id":588,"data":1283,"type":42,"tunes":1285},{"text":1284,"level":219},"Production reliability is a distribution, not a single pass rate",{},{"id":593,"data":1287,"type":226,"tunes":1289},{"text":1288},"A useful production evaluation samples the dimensions that actually vary in your environment. For a browser workflow, that might include account age, locale, viewport, page version, network quality, authentication state, existing cart state, cookies, pop-ups, user permissions and whether a human interrupts the run.",{},{"id":598,"data":1291,"type":303,"tunes":1329},{"content":1292,"stretched":43,"withHeadings":14},[1293,1297,1301,1305,1309,1313,1317,1321,1325],[1294,1295,1296],"Dimension","Example variation","Why it matters",[1298,1299,1300],"Environment","Fast vs slow network, transient failures, page timing","Tests recovery and waiting behaviour",[1302,1303,1304],"UI","Different viewport, modal, reordered element, minor redesign","Tests brittle visual\u002Faction assumptions",[1306,1307,1308],"State","Logged in\u002Fout, empty\u002Fnon-empty cart, existing file, changed permissions","Tests hidden-state reasoning",[1310,1311,1312],"Task horizon","5 steps vs 50+ steps, one app vs several apps","Tests accumulated trajectory error",[1314,1315,1316],"Ambiguity","Missing preference or incomplete user instruction","Tests whether the agent asks instead of guesses",[1318,1319,1320],"Consequence","Read-only vs purchase\u002Fsend\u002Fdelete\u002Fchange","Tests confirmation and authorization controls",[1322,1323,1324],"Adversarial content","Prompt injection or misleading page text","Tests instruction hierarchy and containment",[1326,1327,1328],"Model \u002F harness version","Runtime upgrade","Tests regression from system-level changes",{},{"id":639,"data":1331,"type":42,"tunes":1333},{"text":1332,"level":219},"Reliability needs a failure budget, not perfection",{},{"id":644,"data":1335,"type":226,"tunes":1337},{"text":1336},"No production system is perfectly reliable. The useful engineering question is which failures are acceptable, detectable and recoverable. A failed attempt to sort a local folder is not equivalent to sending the wrong email, purchasing the wrong product or changing an account setting.",{},{"id":649,"data":1339,"type":226,"tunes":1341},{"text":1340},"Classify actions by consequence and reversibility. Low-impact reversible actions can tolerate more autonomy. High-impact, externally visible or hard-to-reverse actions need stronger confirmation, state verification, authorization and post-action checks.",{},{"id":654,"data":1343,"type":42,"tunes":1345},{"text":1344,"level":219},"A practical computer-use reliability matrix",{},{"id":659,"data":1347,"type":303,"tunes":1373},{"content":1348,"stretched":43,"withHeadings":14},[1349,1353,1357,1361,1365,1369],[1350,1351,1352],"Action class","Example","Recommended control",[1354,1355,1356],"Read \u002F inspect","Open pages, read files, gather information","Bound scope, log sources, tolerate recoverable navigation errors",[1358,1359,1360],"Reversible local change","Edit draft file, reorganize temporary workspace","Checkpoint or version before change; verify result",[1362,1363,1364],"External communication","Send email, publish content, submit form","User confirmation or explicit delegated authority; verify accepted state",[1366,1367,1368],"Financial \u002F transactional","Purchase, checkout, paid subscription","Strict mandate, amount\u002Fmerchant constraints, final confirmation and receipt verification",[1370,1371,1372],"Destructive \u002F privilege-changing","Delete data, change permissions, revoke access","Narrow authorization, explicit confirmation, reversible path where possible, post-action audit",{},{"id":688,"data":1375,"type":42,"tunes":1377},{"text":1376,"level":219},"What to log for a computer-use failure",{},{"id":693,"data":1379,"type":710,"tunes":1394},{"meta":1380,"items":1381,"style":709},{},[1382,1383,1384,1385,1386,1387,1388,1389,1390,1391,1392,1393],"User goal and explicit constraints.","Model and harness version.","Environment and application versions.","Screenshots or structured observations relevant to the failure.","Actions taken with timestamps.","Tool, click, keyboard and navigation results.","State transitions and waiting periods.","Approval, refusal or handoff events.","External errors and network failures.","Final observable environment state.","The agent's reported outcome.","Verifier result and whether the failure was controllable by the agent.",{},{"id":713,"data":1396,"type":226,"tunes":1398},{"text":1397},"The crucial comparison is between reported success and observable success. A system that cannot distinguish those two will eventually accumulate false positives in production.",{},{"id":718,"data":1400,"type":541,"tunes":1405},{"url":1401,"title":1402,"excerpt":1403,"ctaLabel":1404},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","A broader reliability model for evaluating agent trajectories, tool use and intermediate decisions instead of accepting the final answer as proof that the system worked correctly.","Read the agent reliability article",{},{"id":726,"data":1407,"type":42,"tunes":1409},{"text":1408,"level":219},"Security is part of reliability for computer-use agents",{},{"id":731,"data":1411,"type":226,"tunes":1413},{"text":1412},"Computer-use agents do not merely read untrusted content; they can act after reading it. That turns prompt injection, malicious page content and phishing into execution-path risks.",{},{"id":736,"data":1415,"type":226,"tunes":1417},{"text":1416},"OpenAI's current computer-use guidance recommends isolating the environment, allow-listing sites and actions, treating screen content as untrusted, confirming consequential actions, bounding the run and verifying the actual outcome. ChatGPT agent similarly uses confirmations, prompt-injection monitoring and supervised modes for sensitive contexts.",{},{"id":741,"data":1419,"type":226,"tunes":1421},{"text":1420},"The architecture principle is broader than any one provider: content observed by the agent must not be allowed to redefine the user's authority. A webpage can provide data. It cannot grant permission to send data elsewhere, purchase something, change credentials or override the task boundary.",{},{"id":746,"data":1423,"type":42,"tunes":1425},{"text":1424,"level":219},"What would change this answer?",{},{"id":751,"data":1427,"type":226,"tunes":1429},{"text":1428},"The reliability gap would narrow if computer-use models became robust to long horizons, dynamic state, UI variation, environmental failures and ambiguous goals across representative production distributions. Better native state APIs, standardized machine-readable interfaces and stronger verifier infrastructure could also reduce the amount of fragile GUI interaction required.",{},{"id":756,"data":1431,"type":226,"tunes":1433},{"text":1432},"The deployment threshold also changes with task consequence. A 70% success rate can be useful for a supervised low-risk research task and unacceptable for an autonomous financial or destructive workflow. Reliability must therefore be evaluated against the cost of each failure class, not one universal pass-rate threshold.",{},{"id":761,"data":1435,"type":42,"tunes":1437},{"text":1436,"level":219},"Limitations",{},{"id":766,"data":1439,"type":226,"tunes":1441},{"text":1440},"The cited benchmarks evaluate different environments and should not be ranked against one another as if they measured the same thing. WAREX stresses web unreliability; WeaveBench targets hybrid long-horizon work; OSWorld 2.0 targets realistic long workflows; BLIND-ACT focuses on goal handling under ambiguity and infeasibility.",{},{"id":771,"data":1443,"type":226,"tunes":1445},{"text":1444},"Benchmark results also age quickly. Model, harness and verifier improvements can materially change scores within months. The durable lesson is therefore the evaluation method: vary conditions, separate process from outcome, verify external state, and preserve the boundary around each performance claim.",{},{"id":776,"data":1447,"type":42,"tunes":1449},{"text":1448,"level":219},"Conclusion",{},{"id":781,"data":1451,"type":226,"tunes":1453},{"text":1452},"Computer-use agents are already capable enough to be useful. That is exactly why the evaluation question has changed. The challenge is no longer only whether an agent can click through a workflow. It is whether the system remains dependable when the clean demo conditions disappear.",{},{"id":786,"data":1455,"type":226,"tunes":1457},{"text":1456},"Treat one successful run as evidence of capability. Then test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification and safe goal handling. A production computer-use agent is not the one that can complete the demo. It is the one whose failure boundaries are known, measured and controlled.",{},{"id":791,"data":1459,"type":42,"tunes":1461},{"text":1460,"level":219},"FAQ",{},{"id":796,"data":1463,"type":796,"tunes":1484},{"items":1464,"title":1483},[1465,1468,1471,1474,1477,1480],{"id":800,"answer":1466,"question":1467},"No. It proves capability under one observed trajectory. Production reliability requires repeated success across environmental variation, long-running tasks, changing state, ambiguity, recovery conditions and consequential actions.","Does a successful computer-use agent demo prove production reliability?",{"id":804,"answer":1469,"question":1470},"Benchmarks can use more controlled environments, shorter tasks, stable network conditions, simpler application combinations or outcome criteria that do not capture all process failures. The exact validity boundary depends on each benchmark.","Why can computer-use benchmarks look much better than real-world performance?",{"id":808,"answer":1472,"question":1473},"Verify the actual external outcome. Do not treat the agent's final statement or intended click sequence as proof that the target system accepted the operation.","What is the most important reliability check after a computer-use action?",{"id":812,"answer":1475,"question":1476},"Errors accumulate across many actions, constraints are forgotten, external state changes, work spans multiple applications, hidden state matters, and the agent must decide when to wait, ask, verify or recover rather than simply continue acting.","Why do long-horizon computer tasks remain difficult?",{"id":816,"answer":1478,"question":1479},"Repeat clean tasks, inject realistic environmental failures, vary UI and state, extend the workflow horizon, introduce ambiguity, require observable outcome proof, test high-impact action controls and rerun the suite after model or harness changes.","How should I test a browser or desktop agent before deployment?",{"id":820,"answer":1481,"question":1482},"Not for every low-risk action. Confirmation requirements should scale with consequence, reversibility, authority and uncertainty. High-impact, externally visible or difficult-to-reverse actions need stronger controls.","Should computer-use agents always require human confirmation?","Computer-use agent reliability",{},{"id":826,"data":1486,"type":42,"tunes":1488},{"text":1487,"level":219},"Glossary",{},{"id":831,"data":1490,"type":831,"tunes":1511},{"title":1491,"entries":1492},"Key reliability terms",[1493,1496,1499,1502,1505,1508],{"term":1494,"anchor":837,"definition":1495},"Computer-use agent","An AI agent that interacts with graphical user interfaces or computer environments through observations and actions such as clicking, typing, scrolling, file operations or cross-application workflows.",{"term":1497,"anchor":841,"definition":1498},"Repeatability","The degree to which an agent can complete the same task consistently across repeated runs rather than succeeding only on selected trajectories.",{"term":1500,"anchor":845,"definition":1501},"Environmental robustness","The ability to preserve correct behaviour despite realistic variation such as latency, transient errors, UI changes, session state and unexpected page conditions.",{"term":1503,"anchor":849,"definition":1504},"Outcome verification","Checking the actual external state after an action to confirm that the intended result occurred instead of relying on the agent's self-report.",{"term":1506,"anchor":853,"definition":1507},"Blind Goal-Directedness","A failure pattern in which a computer-use agent continues pursuing a goal despite ambiguity, infeasibility, contradictory conditions or reasons to stop and reassess.",{"term":1509,"anchor":857,"definition":1510},"Reliability boundary","The set of conditions under which an observed success rate or capability claim remains representative enough for a specific deployment decision.",{},{"id":861,"data":1513,"type":42,"tunes":1515},{"text":1514,"level":219},"Primary sources and further reading",{},{"id":866,"data":1517,"type":873,"tunes":1521},{"link":868,"meta":1518},{"image":1519,"title":871,"description":1520},{"url":556},"Current developer guidance on isolating environments, treating screen content as untrusted, confirming consequential actions, bounding runs and verifying outcomes.",{},{"id":876,"data":1523,"type":873,"tunes":1527},{"link":878,"meta":1524},{"image":1525,"title":881,"description":1526},{"url":556},"Current production guidance on technical boundaries, human approval, telemetry and control for agents that act on real systems.",{},{"id":885,"data":1529,"type":873,"tunes":1533},{"link":887,"meta":1530},{"image":1531,"title":890,"description":1532},{"url":556},"2026 evaluation showing that realistic web unreliability causes significant drops in browser-agent task success on existing benchmarks.",{},{"id":894,"data":1535,"type":873,"tunes":1539},{"link":896,"meta":1536},{"image":1537,"title":899,"description":1538},{"url":556},"2026 work on process versus outcome evaluation, controllable versus uncontrollable failures and reliable trajectory verification.",{},{"id":903,"data":1541,"type":873,"tunes":1545},{"link":905,"meta":1542},{"image":1543,"title":908,"description":1544},{"url":556},"2026 long-horizon benchmark combining GUI, CLI and code workflows and showing a substantial gap between current agents and reliable real-world completion.",{},{"id":912,"data":1547,"type":873,"tunes":1551},{"link":914,"meta":1548},{"image":1549,"title":917,"description":1550},{"url":556},"2026 benchmark focused on realistic long-horizon computer-use workflows, hidden state and cross-source reasoning.",{},{"id":921,"data":1553,"type":873,"tunes":1557},{"link":923,"meta":1554},{"image":1555,"title":926,"description":1556},{"url":556},"2026 benchmark for time-evolving tasks where agents must monitor environments and respond to state changes rather than continuously act.",{},{"id":930,"data":1559,"type":873,"tunes":1563},{"link":932,"meta":1560},{"image":1561,"title":935,"description":1562},{"url":556},"ICLR 2026 research on agents continuing to pursue ambiguous, contradictory or infeasible goals.",{},"2.31.6","Computer-use agents can now complete impressive browser and desktop workflows, but one successful run proves capability—not reliability. This article shows how to test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification, and safe goal handling.",{"lang":7,"title":208,"content":210,"contentJson":1567,"excerpt":939},{"time":212,"blocks":1568,"version":938},[1569,1572,1575,1578,1581,1584,1587,1590,1593,1596,1599,1609,1612,1615,1626,1629,1632,1635,1638,1641,1644,1647,1650,1653,1656,1659,1662,1665,1668,1671,1674,1677,1680,1683,1686,1689,1692,1695,1698,1701,1704,1707,1710,1723,1726,1729,1732,1735,1738,1754,1757,1760,1763,1776,1779,1782,1785,1788,1798,1801,1806,1809,1812,1815,1818,1821,1824,1827,1830,1833,1836,1839,1842,1845,1848,1851,1854,1864,1867,1877,1880,1885,1890,1895,1900,1905,1910,1915],{"id":215,"data":1570,"type":220,"tunes":1571},{"title":217,"maxLevel":218,"minLevel":219},{},{"id":223,"data":1573,"type":226,"tunes":1574},{"text":225},{},{"id":229,"data":1576,"type":234,"tunes":1577},{"body":231,"title":232,"variant":233},{},{"id":237,"data":1579,"type":234,"tunes":1580},{"body":239,"title":240,"variant":241},{},{"id":244,"data":1582,"type":234,"tunes":1583},{"body":246,"title":247,"variant":248},{},{"id":251,"data":1585,"type":42,"tunes":1586},{"text":253,"level":219},{},{"id":256,"data":1588,"type":226,"tunes":1589},{"text":258},{},{"id":261,"data":1591,"type":226,"tunes":1592},{"text":263},{},{"id":266,"data":1594,"type":226,"tunes":1595},{"text":268},{},{"id":271,"data":1597,"type":42,"tunes":1598},{"text":273,"level":219},{},{"id":276,"data":1600,"type":303,"tunes":1608},{"content":1601,"stretched":43,"withHeadings":14},[1602,1603,1604,1605,1606,1607],[280,281,282],[284,285,286],[288,289,290],[292,293,294],[296,297,298],[300,301,302],{},{"id":306,"data":1610,"type":42,"tunes":1611},{"text":308,"level":219},{},{"id":311,"data":1613,"type":226,"tunes":1614},{"text":313},{},{"id":316,"data":1616,"type":342,"tunes":1625},{"steps":1617,"title":340,"orientation":341},[1618,1619,1620,1621,1622,1623,1624],{"label":320,"description":321},{"label":323,"description":324},{"label":326,"description":327},{"label":329,"description":330},{"label":332,"description":333},{"label":335,"description":336},{"label":338,"description":339},{},{"id":345,"data":1627,"type":42,"tunes":1628},{"text":347,"level":218},{},{"id":350,"data":1630,"type":226,"tunes":1631},{"text":352},{},{"id":355,"data":1633,"type":226,"tunes":1634},{"text":357},{},{"id":360,"data":1636,"type":42,"tunes":1637},{"text":362,"level":218},{},{"id":365,"data":1639,"type":226,"tunes":1640},{"text":367},{},{"id":370,"data":1642,"type":226,"tunes":1643},{"text":372},{},{"id":375,"data":1645,"type":42,"tunes":1646},{"text":377,"level":218},{},{"id":380,"data":1648,"type":226,"tunes":1649},{"text":382},{},{"id":385,"data":1651,"type":226,"tunes":1652},{"text":387},{},{"id":390,"data":1654,"type":234,"tunes":1655},{"body":392,"title":393,"variant":394},{},{"id":397,"data":1657,"type":42,"tunes":1658},{"text":399,"level":218},{},{"id":402,"data":1660,"type":226,"tunes":1661},{"text":404},{},{"id":407,"data":1663,"type":226,"tunes":1664},{"text":409},{},{"id":412,"data":1666,"type":226,"tunes":1667},{"text":414},{},{"id":417,"data":1669,"type":42,"tunes":1670},{"text":419,"level":218},{},{"id":422,"data":1672,"type":226,"tunes":1673},{"text":424},{},{"id":427,"data":1675,"type":226,"tunes":1676},{"text":429},{},{"id":432,"data":1678,"type":226,"tunes":1679},{"text":434},{},{"id":437,"data":1681,"type":42,"tunes":1682},{"text":439,"level":218},{},{"id":442,"data":1684,"type":226,"tunes":1685},{"text":444},{},{"id":447,"data":1687,"type":226,"tunes":1688},{"text":449},{},{"id":452,"data":1690,"type":226,"tunes":1691},{"text":454},{},{"id":457,"data":1693,"type":42,"tunes":1694},{"text":459,"level":218},{},{"id":462,"data":1696,"type":226,"tunes":1697},{"text":464},{},{"id":467,"data":1699,"type":226,"tunes":1700},{"text":469},{},{"id":472,"data":1702,"type":226,"tunes":1703},{"text":474},{},{"id":477,"data":1705,"type":42,"tunes":1706},{"text":479,"level":219},{},{"id":482,"data":1708,"type":226,"tunes":1709},{"text":484},{},{"id":487,"data":1711,"type":342,"tunes":1722},{"steps":1712,"title":517,"orientation":341},[1713,1714,1715,1716,1717,1718,1719,1720,1721],{"label":491,"description":492},{"label":494,"description":495},{"label":497,"description":498},{"label":500,"description":501},{"label":503,"description":504},{"label":506,"description":507},{"label":509,"description":510},{"label":512,"description":513},{"label":515,"description":516},{},{"id":520,"data":1724,"type":42,"tunes":1725},{"text":522,"level":219},{},{"id":525,"data":1727,"type":226,"tunes":1728},{"text":527},{},{"id":530,"data":1730,"type":226,"tunes":1731},{"text":532},{},{"id":535,"data":1733,"type":541,"tunes":1734},{"url":537,"title":538,"excerpt":539,"ctaLabel":540},{},{"id":544,"data":1736,"type":42,"tunes":1737},{"text":546,"level":219},{},{"id":549,"data":1739,"type":580,"tunes":1753},{"rows":1740,"title":569,"layout":303,"columns":1749},[1741,1743,1745,1747],{"id":553,"label":554,"values":1742},[556,556,556],{"id":558,"label":559,"values":1744},[556,556,556],{"id":562,"label":563,"values":1746},[556,556,556],{"id":566,"label":567,"values":1748},[556,556,556],[1750,1751,1752],{"id":572,"label":573},{"id":575,"label":576},{"id":578,"label":579},{},{"id":583,"data":1755,"type":226,"tunes":1756},{"text":585},{},{"id":588,"data":1758,"type":42,"tunes":1759},{"text":590,"level":219},{},{"id":593,"data":1761,"type":226,"tunes":1762},{"text":595},{},{"id":598,"data":1764,"type":303,"tunes":1775},{"content":1765,"stretched":43,"withHeadings":14},[1766,1767,1768,1769,1770,1771,1772,1773,1774],[602,603,604],[606,607,608],[610,611,612],[614,615,616],[618,619,620],[622,623,624],[626,627,628],[630,631,632],[634,635,636],{},{"id":639,"data":1777,"type":42,"tunes":1778},{"text":641,"level":219},{},{"id":644,"data":1780,"type":226,"tunes":1781},{"text":646},{},{"id":649,"data":1783,"type":226,"tunes":1784},{"text":651},{},{"id":654,"data":1786,"type":42,"tunes":1787},{"text":656,"level":219},{},{"id":659,"data":1789,"type":303,"tunes":1797},{"content":1790,"stretched":43,"withHeadings":14},[1791,1792,1793,1794,1795,1796],[663,664,665],[667,668,669],[671,672,673],[675,676,677],[679,680,681],[683,684,685],{},{"id":688,"data":1799,"type":42,"tunes":1800},{"text":690,"level":219},{},{"id":693,"data":1802,"type":710,"tunes":1805},{"meta":1803,"items":1804,"style":709},{},[697,698,699,700,701,702,703,704,705,706,707,708],{},{"id":713,"data":1807,"type":226,"tunes":1808},{"text":715},{},{"id":718,"data":1810,"type":541,"tunes":1811},{"url":720,"title":721,"excerpt":722,"ctaLabel":723},{},{"id":726,"data":1813,"type":42,"tunes":1814},{"text":728,"level":219},{},{"id":731,"data":1816,"type":226,"tunes":1817},{"text":733},{},{"id":736,"data":1819,"type":226,"tunes":1820},{"text":738},{},{"id":741,"data":1822,"type":226,"tunes":1823},{"text":743},{},{"id":746,"data":1825,"type":42,"tunes":1826},{"text":748,"level":219},{},{"id":751,"data":1828,"type":226,"tunes":1829},{"text":753},{},{"id":756,"data":1831,"type":226,"tunes":1832},{"text":758},{},{"id":761,"data":1834,"type":42,"tunes":1835},{"text":763,"level":219},{},{"id":766,"data":1837,"type":226,"tunes":1838},{"text":768},{},{"id":771,"data":1840,"type":226,"tunes":1841},{"text":773},{},{"id":776,"data":1843,"type":42,"tunes":1844},{"text":778,"level":219},{},{"id":781,"data":1846,"type":226,"tunes":1847},{"text":783},{},{"id":786,"data":1849,"type":226,"tunes":1850},{"text":788},{},{"id":791,"data":1852,"type":42,"tunes":1853},{"text":793,"level":219},{},{"id":796,"data":1855,"type":796,"tunes":1863},{"items":1856,"title":823},[1857,1858,1859,1860,1861,1862],{"id":800,"answer":801,"question":802},{"id":804,"answer":805,"question":806},{"id":808,"answer":809,"question":810},{"id":812,"answer":813,"question":814},{"id":816,"answer":817,"question":818},{"id":820,"answer":821,"question":822},{},{"id":826,"data":1865,"type":42,"tunes":1866},{"text":828,"level":219},{},{"id":831,"data":1868,"type":831,"tunes":1876},{"title":833,"entries":1869},[1870,1871,1872,1873,1874,1875],{"term":836,"anchor":837,"definition":838},{"term":840,"anchor":841,"definition":842},{"term":844,"anchor":845,"definition":846},{"term":848,"anchor":849,"definition":850},{"term":852,"anchor":853,"definition":854},{"term":856,"anchor":857,"definition":858},{},{"id":861,"data":1878,"type":42,"tunes":1879},{"text":863,"level":219},{},{"id":866,"data":1881,"type":873,"tunes":1884},{"link":868,"meta":1882},{"image":1883,"title":871,"description":872},{"url":556},{},{"id":876,"data":1886,"type":873,"tunes":1889},{"link":878,"meta":1887},{"image":1888,"title":881,"description":882},{"url":556},{},{"id":885,"data":1891,"type":873,"tunes":1894},{"link":887,"meta":1892},{"image":1893,"title":890,"description":891},{"url":556},{},{"id":894,"data":1896,"type":873,"tunes":1899},{"link":896,"meta":1897},{"image":1898,"title":899,"description":900},{"url":556},{},{"id":903,"data":1901,"type":873,"tunes":1904},{"link":905,"meta":1902},{"image":1903,"title":908,"description":909},{"url":556},{},{"id":912,"data":1906,"type":873,"tunes":1909},{"link":914,"meta":1907},{"image":1908,"title":917,"description":918},{"url":556},{},{"id":921,"data":1911,"type":873,"tunes":1914},{"link":923,"meta":1912},{"image":1913,"title":926,"description":927},{"url":556},{},{"id":930,"data":1916,"type":873,"tunes":1919},{"link":932,"meta":1917},{"image":1918,"title":935,"description":936},{"url":556},{},"Post erfolgreich abgerufen",{"items":1922,"source":1986,"manualIds":1987,"manualMatchedIds":1988},[1923,1930,1937,1944,1951,1958,1965,1972,1979],{"id":1924,"slug":1925,"title":1926,"excerpt":1927,"featuredImage":1928,"publishedAt":1929},"364","tipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung","Dominando el flujo de trabajo SEO: Estrategias de optimización esenciales para el crecimiento orgánico","Un flujo de trabajo SEO estructurado es crucial para un crecimiento orgánico sostenible. Aprende las diez estrategias fundamentales, desde la investigación de palabras clave y la optimización técnica hasta la calidad del contenido y el análisis de rendimiento.","\u002Fuploads\u002F2026\u002F03\u002Ftipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung-1774866098131-hwkzrg.webp","2024-01-26T06:35:00.000Z",{"id":1931,"slug":1932,"title":1933,"excerpt":1934,"featuredImage":1935,"publishedAt":1936},"472","why-more-context-can-make-ai-answers-worse","Por qué más contexto puede empeorar las respuestas de la IA","Una ventana de contexto más grande no garantiza una mejor respuesta. Este artículo explica cómo la dilución de la señal, la evidencia contradictoria, el estado obsoleto, la sensibilidad a la posición y la compresión con pérdidas pueden reducir la fiabilidad de la IA—e introduce una práctica Prueba de Presión de Contexto.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z",{"id":1938,"slug":1939,"title":1940,"excerpt":1941,"featuredImage":1942,"publishedAt":1943},"478","what-is-rag-the-simplest-explanation-of-how-it-works","¿Qué es RAG? La explicación más sencilla de cómo funciona","RAG suena complicado, pero la idea es simple: antes de que una IA responda, primero busca información útil de una fuente de conocimiento y le da esa información al modelo de lenguaje. Esta guía explica RAG, los LLM, el estado, la memoria y las herramientas usando un modelo mental simple.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":1945,"slug":1946,"title":1947,"excerpt":1948,"featuredImage":1949,"publishedAt":1950},"460","ai-agent-reliability-why-the-final-answer-is-not-enough","Fiabilidad de los Agentes de IA: Por Qué la Respuesta Final No es Suficiente","Una salida correcta no demuestra un razonamiento correcto, una ejecución segura ni un sistema confiable.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-reliability-why-the-final-answer-is-not-enough-1788955466306-pl0qhz.webp","2026-09-09T04:01:00.000Z",{"id":1952,"slug":1953,"title":1954,"excerpt":1955,"featuredImage":1956,"publishedAt":1957},"457","should-you-buy-5g-openwrt-router-old-firmware","¿Deberías Comprar un Router OpenWrt 5G con Firmware Antiguo? El ZBT Z8102AX como Ejemplo Práctico","Comprar un router 5G OpenWrt con firmware antiguo puede tener sentido, pero solo bajo las condiciones adecuadas. El ZBT Z8102AX muestra claramente ambos lados: el hardware es útil, el módem funciona y el router se mantuvo estable en las pruebas, pero OpenWrt 21.02, el embalaje débil y las rutas de actualización poco claras requieren una decisión de compra cuidadosa.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1959,"slug":1960,"title":1961,"excerpt":1962,"featuredImage":1963,"publishedAt":1964},"474","migrating-from-openai-agents-sdk-to-the-agents-api-what-actually-changes-architecturally","Migrar del SDK de Agentes de OpenAI a la API de Agentes: ¿Qué cambia realmente a nivel arquitectónico?","Migrar del SDK de OpenAI Agents a la nueva API de Agents no es un simple cambio de nombre de importación. El límite del entorno de ejecución cambia: el bucle del agente, la sesión duradera, la orquestación, la compactación de contexto y la recuperación se trasladan hacia un harness gestionado. Esta guía muestra qué debería migrarse, qué debería permanecer en tu aplicación y cómo demostrar la migración antes del cambio definitivo.","\u002Fuploads\u002F2026\u002F09\u002Fmigrating-from-openai-agents-sdk-to-the-agents-api-what-actually-changes-architecturally-1790352171968-ienxr9.webp","2026-09-25T12:01:00.000Z",{"id":1966,"slug":1967,"title":1968,"excerpt":1969,"featuredImage":1970,"publishedAt":1971},"459","ollama-is-not-the-product-building-production-ready-open-llm-applications","Ollama no es el producto: Construcción de aplicaciones de LLM abiertos listas para producción","Ejecutar un modelo local con Ollama es fácil. Construir una aplicación Open-LLM lista para producción es más difícil: requiere RAG, control de acceso, abstracción de proveedores, evaluación, registro, disciplina de despliegue y una capa de aplicación controlada alrededor del modelo.","\u002Fuploads\u002F2026\u002F06\u002Follama-is-not-the-product-building-production-ready-open-llm-applications-1782679361640-h0usqf.webp","2026-06-28T16:39:00.000Z",{"id":1973,"slug":1974,"title":1975,"excerpt":1976,"featuredImage":1977,"publishedAt":1978},"471","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","Cómo saber si un agente de IA realmente utilizó la evidencia correcta","Un agente de IA puede citar fuentes y aun así usar la evidencia incorrecta. Este artículo presenta un método práctico para verificar el respaldo de las afirmaciones, la autoridad de la fuente, la aplicabilidad, la procedencia y si la evidencia realmente influyó en la respuesta.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","2026-09-25T11:47:00.000Z",{"id":1980,"slug":1981,"title":1982,"excerpt":1983,"featuredImage":1984,"publishedAt":1985},"469","rag-failed-but-which-layer-actually-failed-a-diagnostic-method","RAG falló — ¿Pero qué capa falló realmente? Un método de diagnóstico","Cuando una respuesta RAG es incorrecta, culpar a la recuperación o al modelo es demasiado vago. Este método de diagnóstico aísla la cobertura de fuentes, la construcción de consultas, la recuperación, el ranking, el ensamblaje del contexto, la generación, la atribución de evidencia y la actualidad, de modo que el fallo real puede reproducirse y corregirse.","\u002Fuploads\u002F2026\u002F09\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method-1790350847177-pior4c.webp","2026-09-24T19:39:00.000Z","fallback",[],[]]