[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:ru":3,"public-menus:all":38,"post:computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system:ru":205,"related:post:computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system:ru:1":1923},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","ru","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1922},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":937,"featuredImage":938,"featuredImageAlt":939,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":940,"publishedAt":941,"createdAt":942,"updatedAt":943,"seoLocalePaths":944,"categories":953,"author":966,"translations":971},"477","Агенты для управления компьютером: почему успешная демонстрация всё ещё может быть ненадёжной системой","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Содержание\">\u003Cstrong class=\"editorjs-toc__title\">Содержание\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-6\" class=\"editorjs-toc__link\">Почему демо — это простейший из возможных тестов на надежность\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">Возможность, доля успеха, надежность и безопасность — это разные утверждения\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-12\" class=\"editorjs-toc__link\">Лестница надежности управления компьютером\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-15\" class=\"editorjs-toc__link\">Уровень 1 — Возможность выполнения: вопрос уровня демо\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-18\" class=\"editorjs-toc__link\">Уровень 2 — Повторяемость: остается ли та же задача решенной?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-21\" class=\"editorjs-toc__link\">Уровень 3 — Устойчивость к среде: что происходит, когда веб ведет себя как реальный веб?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-25\" class=\"editorjs-toc__link\">Уровень 4 — Долгосрочное управление: результаты меняются, когда задача превращается в реальную работу\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-29\" class=\"editorjs-toc__link\">Уровень 5 — Отслеживание состояния: среда может измениться прямо во время выполнения плана\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">Уровень 6 — Проверка результата: сработало ли действие на самом деле?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-37\" class=\"editorjs-toc__link\">Уровень 7 — Безопасная обработка целей: агент должен знать, когда не продолжать\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-41\" class=\"editorjs-toc__link\">Стресс-тест перехода от демо к продакшену\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-44\" class=\"editorjs-toc__link\">Успех в бенчмарке имеет границу валидности\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-48\" class=\"editorjs-toc__link\">Успех процесса и успех результата должны оцениваться отдельно\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-51\" class=\"editorjs-toc__link\">Надёжность в продакшене — это распределение, а не единичная доля успеха\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-54\" class=\"editorjs-toc__link\">Надёжности нужен бюджет отказов, а не совершенство\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-57\" class=\"editorjs-toc__link\">Практическая матрица надежности для сценариев управления компьютером\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-59\" class=\"editorjs-toc__link\">Что логировать при сбоях сценариев управления компьютером\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-63\" class=\"editorjs-toc__link\">Безопасность — неотъемлемая часть надежности агентов управления компьютером\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-67\" class=\"editorjs-toc__link\">Что могло бы изменить эти выводы?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-70\" class=\"editorjs-toc__link\">Ограничения\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-73\" class=\"editorjs-toc__link\">Заключение\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-76\" class=\"editorjs-toc__link\">Часто задаваемые вопросы\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-78\" class=\"editorjs-toc__link\">Глоссарий\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-80\" class=\"editorjs-toc__link\">Первоисточники и литература для дальнейшего чтения\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>Агенты для управления компьютером (computer-use agents) теперь умеют кликать мышью, вводить текст, просматривать веб-страницы, редактировать файлы, работать с десктопными приложениями и выполнять впечатляющие многошаговые задачи. Поэтому успешные демоверсии легко воспринимаются и легко переоцениваются. Однократное выполнение рабочего процесса лишь доказывает, что агент способен добиться успеха в этих конкретных условиях. Это не показывает, как часто он достигает цели, как ведет себя при изменении среды, проверяет ли результат и насколько безопасно действует в ситуациях с неоднозначными целями.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Прямой ответ\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">&lt;strong&gt;Успешное демо управления компьютером доказывает возможность выполнения задачи, но не надежность.&lt;\u002Fstrong&gt; Надежность в продакшене требует от агента стабильного успеха при изменчивости среды, восстановления после временных сбоев, соблюдения ограничений на длинных горизонтах, обнаружения скрытых или меняющихся состояний, проверки фактического результата, а также своевременной остановки или уточнения, если цель становится неоднозначной или небезопасной. Правильный вопрос для внедрения в продакшен звучит не «Может ли агент выполнить эту задачу?», а «При каких условиях мы можем доверить ему регулярное выполнение этой задачи?»\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Быстро развивающаяся область\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Эта статья отражает исследования в области агентов для управления компьютером и рекомендации платформ, актуальные на &lt;strong&gt;25 сентября 2026 года&lt;\u002Fstrong&gt;. Результаты бенчмарков нельзя напрямую сравнивать при различиях в наборах задач, средах, моделях, лимитах шагов, судьях или инфраструктуре тестирования. Оценивайте любой показатель бенчмарка исключительно в контексте условий его тестирования.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Модель, используемая в этой статье\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Приведенные ниже «Лестница надежности управления компьютером» и «Стресс-тест перехода от демо к продакшену» представляют собой практические оценочные модели, предложенные авторами. Они не являются официальными отраслевыми стандартами.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-6\">Почему демо — это простейший из возможных тестов на надежность\u003C\u002Fh2>\n\u003Cp>Демо обычно показывает одну успешную траекторию. Окружение известно заранее, задача подобрана заблаговременно, оператор может перезапустить процесс в случае сбоя, а аудитория видит лишь удачный путь. Системы в продакшене сталкиваются с распределением вероятностей: различные страницы, состояние сети, статус учетной записи, всплывающие окна, задержки, изменения интерфейса, скрытое состояние, права доступа, прерывания и пользователи, которые неидеально формулируют цели.\u003C\u002Fp>\n\u003Cp>Это различие критически важно, поскольку агенты для управления компьютером работают через интерфейсы, созданные для людей, а не через детерминированные API. Цикл их действий зависит от восприятия, интерпретации состояния, планирования, тайминга взаимодействия и отклика среды. Небольшие изменения могут сбить траекторию, даже если цель пользователя осталась прежней.\u003C\u002Fp>\n\u003Cp>Исследование WAREX от Microsoft Research наглядно демонстрирует эту проблему: агенты из бенчмарков, выглядящие способными в контролируемых условиях, существенно теряют в успешности задач при возникновении реалистичной нестабильности веба. Причина сбоя не обязательно в том, что «модель поглупела». Дело в том, что среда перестала быть детерминированной.\u003C\u002Fp>\n\u003Ch2 id=\"section-10\">Возможность, доля успеха, надежность и безопасность — это разные утверждения\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Утверждение\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Что оно доказывает на самом деле\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Чего оно не доказывает\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Агент выполнил задачу один раз\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Возможность решения в рамках одной зафиксированной траектории\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Повторяемость, устойчивость, безопасность или способность к обобщению\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Агент набрал высокий балл в бенчмарке\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Эффективность в рамках задач и условий тестирования этого бенчмарка\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Эквивалентную производительность в продакшене в других условиях окружения\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Агент обычно достигает цели\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Частоту успешного исхода\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Корректность процесса, безопасное поведение или факт проверки результата\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Агент следует намеченному процессу\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Качество траектории в соответствии с оцениваемым регламентом\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">То, что внешняя среда действительно приняла конечный результат\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Агент избегает небезопасных действий в тестовой выборке\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Эффективность на представленных сценариях безопасности\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Безопасность при любой новой неоднозначности, инъекции или побочном эффекте\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-12\">Лестница надежности управления компьютером\u003C\u002Fh2>\n\u003Cp>Удобный способ оценки систем управления компьютером — переход от разовой способности выполнить действие к все более строгим критериям надежности. Более высокие уровни предполагают наличие более низких, но не вытекают из них автоматически.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Лестница надежности управления компьютером\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Возможность выполнения\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Способен ли агент выполнить задачу хотя бы один раз в известных условиях?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Повторяемость\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Способен ли он стабильно выполнять одну и ту же задачу в серии повторных попыток?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Устойчивость к среде\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Справляется ли он с задержками, сетевыми сбоями, всплывающими окнами, изменениями интерфейса и небольшими возмущениями среды?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Контроль на длинном горизонте\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Способен ли он удерживать цели, ограничения и прогресс на протяжении множества шагов, приложений и отложенных событий?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Осведомленность о состоянии\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Способен ли он обнаружить, что среда изменилась, что скрытое состояние имеет значение или что исходное предположение больше неверно?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Верификация результата\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Проверяет ли он, что запланированный результат действительно достигнут, вместо того чтобы слепо доверять собственной последовательности действий?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Безопасная обработка целей\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Способен ли он остановиться, переспросить, отказаться или вернуть управление, если цель неоднозначна, недостижима, противоречива или сопряжена с высокими рисками?\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch3 id=\"section-15\">Уровень 1 — Возможность выполнения: вопрос уровня демо\u003C\u002Fh3>\n\u003Cp>Возможность выполнения определяет, способен ли агент в принципе решить задачу. Это ценно. Системы управления компьютером развиваются стремительно, и современные агенты могут выполнять рабочие процессы, которые прежние системы не могли реализовать надежно.\u003C\u002Fp>\n\u003Cp>Однако сама по себе возможность выполнения — слабый критерий для развертывания в продакшене. Один успешный запуск не дает ответа на вопрос, успешен ли агент в 95% или в 30% случаев, являются ли сбои безвредными или разрушительными и не зависел ли успех от случайного удачного состояния страницы.\u003C\u002Fp>\n\u003Ch3 id=\"section-18\">Уровень 2 — Повторяемость: остается ли та же задача решенной?\u003C\u002Fh3>\n\u003Cp>Траектории использования компьютера стохастичны. Ответы модели варьируются, страницы загружаются с разной скоростью, визуальные состояния меняются, а длинные рабочие процессы создают множество точек ветвления. Поэтому в продакшене тест должен выполнять одну и ту же задачу несколько раз, а не считать единственный успешный прогон репрезентативным.\u003C\u002Fp>\n\u003Cp>Оценивайте не только среднюю долю успешных попыток, но и распределение типов сбоев: неверный клик, преждевременное завершение, пропущенное подтверждение, некорректное поле, повторное действие, зацикливание навигации, предположение об устаревшем состоянии и ложный отчет об успехе.\u003C\u002Fp>\n\u003Ch3 id=\"section-21\">Уровень 3 — Устойчивость к среде: что происходит, когда веб ведет себя как реальный веб?\u003C\u002Fh3>\n\u003Cp>Реальные веб-сайты — это не статичные стенды бенчмарков. Запросы завершаются с ошибками, элементы загружаются с задержкой, сессии истекают, страницы меняются, появляются баннеры согласия на обработку файлов cookie, серверы возвращают ошибки, а условия сети постоянно меняются.\u003C\u002Fp>\n\u003Cp>WAREX оценивает этот разрыв, внедряя реалистичную нестабильность веба в существующие среды бенчмарков, и фиксирует значительное падение успешности выполнения задач. Это критически важный вывод для продакшена: бенчмарк может оценивать способность решать задачи, недооценивая при этом устойчивость к восстановлению после сбоев среды.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Тест на надежность\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Внедряйте задержки, кратковременные ошибки HTTP, устаревшее состояние страниц, модальные окна, истечение срока сессий, дублирующиеся ответы и контролируемые изменения интерфейса. Если агент работает только по идеальному сценарию, это система уровня демо, а не надежное продакшен-решение.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-25\">Уровень 4 — Долгосрочное управление: результаты меняются, когда задача превращается в реальную работу\u003C\u002Fh3>\n\u003Cp>Короткие задачи скрывают целый класс сбоев, возникающих только после десятков или сотен действий: забытые ограничения, дублирование работы, преждевременное завершение, пропущенные изменения состояния, несоответствия между приложениями и накопившиеся мелкие ошибки.\u003C\u002Fp>\n\u003Cp>Бенчмарк OSWorld 2.0 был специально разработан для оценки долгосрочных реальных рабочих процессов. У пользователей-людей выполнение его задач занимает в среднем около 1,6 часа и требует значительно больше вызовов инструментов, чем в более ранних бенчмарках взаимодействия с компьютером. Согласно его основной метрике завершения, даже самые мощные из протестированных систем все еще далеки от полной надежности.\u003C\u002Fp>\n\u003Cp>WeaveBench приходит к аналогичному выводу с другой стороны. Он оценивает гибридные рабочие процессы с использованием GUI, CLI и кода и показывает, что лучшая протестированная связка модели и среды выполнения успешно проходит лишь 41,2% задач. Важный результат заключается не в конкретной цифре в таблице лидеров, а в том, что реалистичная координация между интерфейсами выявляет сбои, скрытые более простыми задачами в рамках одного интерфейса.\u003C\u002Fp>\n\u003Ch3 id=\"section-29\">Уровень 5 — Отслеживание состояния: среда может измениться прямо во время выполнения плана\u003C\u002Fh3>\n\u003Cp>Длительные задачи часто зависят от скрытого или меняющегося состояния: пришло письмо, изменился календарь, отправлена форма, завершился фоновый процесс, истекла сессия браузера, пользователь изменил файл или изменилась доступность внешней системы.\u003C\u002Fp>\n\u003Cp>Авторы бенчмарка SentinelBench от Microsoft утверждают, что многие длительные задачи вообще не следует решать с помощью непрерывных действий. Правильным поведением может быть мониторинг, ожидание внешнего события и действие лишь после изменения состояния. Это принципиально иной навык, нежели более быстрые клики или планирование большего числа шагов.\u003C\u002Fp>\n\u003Cp>Поэтому надежный агент для взаимодействия с компьютером должен различать состояния: «можно действовать сейчас», «ожидание изменения состояния», «состояние изменилось» и «предположение не подтвердилось».\u003C\u002Fp>\n\u003Ch3 id=\"section-33\">Уровень 6 — Проверка результата: сработало ли действие на самом деле?\u003C\u002Fh3>\n\u003Cp>Агент может выполнить внешне правильную последовательность действий и все равно провалить задачу. Клик по кнопке может не зарегистрироваться. Форма может отклонить данные на скрытой валидации. Файл может сохраниться не в ту папку. Покупка может остаться неподтвержденной. Сайт может отобразить экран успеха, тогда как сама операция завершилась сбоем.\u003C\u002Fp>\n\u003Cp>Текущие рекомендации OpenAI по использованию компьютера прямо советуют ограничивать рамки выполнения и верифицировать процесс работы, а не полагаться исключительно на итоговый ответ модели. К такому же выводу на основе оценки приходят исследователи Microsoft Research в своей работе о верификаторах компьютерных агентов: процесс и результат необходимо оценивать раздельно.\u003C\u002Fp>\n\u003Cp>В исследовании Universal Verifier отмечается, что более ранние конфигурации верификаторов могут давать высокий уровень ложноположительных срабатываний, в то время как более продуманные критерии оценки и четкое разделение процесса, результата, контролируемых и неконтролируемых сбоев существенно повышают согласованность с оценками людей.\u003C\u002Fp>\n\u003Ch3 id=\"section-37\">Уровень 7 — Безопасная обработка целей: агент должен знать, когда не продолжать\u003C\u002Fh3>\n\u003Cp>Агенты, использующие компьютер, оптимизированы для достижения целей, но настойчивость в достижении цели сама по себе может стать режимом отказа. Неоднозначный запрос, невозможное условие, противоречивая инструкция, подозрительная веб-страница или изменившаяся среда могут потребовать уточнения или остановки, а не дальнейших действий.\u003C\u002Fp>\n\u003Cp>Бенчмарк BLIND-ACT изучает эту проблему как слепую целенаправленность. В системах, оценённых в этой работе, агенты часто продолжали выполнять задачи, несмотря на неоднозначность, невыполнимость, противоречивый контекст или другие причины для пересмотра. Авторы выявляют такие паттерны, как смещение в пользу выполнения и приоритет запроса.\u003C\u002Fp>\n\u003Cp>Этот класс отказов важен, потому что высокоспособный агент может быстрее ухудшить плохую ситуацию. Поэтому надёжность включает политику того, когда не следует действовать.\u003C\u002Fp>\n\u003Ch2 id=\"section-41\">Стресс-тест перехода от демо к продакшену\u003C\u002Fh2>\n\u003Cp>Перед развёртыванием рабочего процесса с использованием компьютера возьмите успешное демо и систематически удалите допущения, которые делали его простым.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Стресс-тест перехода от демо к продакшену\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Повторно запустите чистую задачу\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Установите повторяемость на нескольких испытаниях, прежде чем добавлять сложность.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Возмутите среду\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Добавьте задержку, повторные попытки, всплывающие окна, вариации страниц, устаревшие сессии и временные сбои.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Расширьте горизонт\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Превратите короткое демо в полный реальный рабочий процесс с промежуточным состоянием, несколькими приложениями и отложенными шагами.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Измените скрытое состояние\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Измените состояние аккаунта, файла, задачи или внешнее состояние после того, как агент сформировал план, и проверьте, обнаруживает ли он изменение.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Внедрите неоднозначность\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Удалите одно важное допущение и проверьте, спрашивает ли агент вместо того, чтобы угадывать.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Внедрите контролируемое противоречие\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Представьте старое и новое состояние вместе и убедитесь, что авторитетное текущее состояние побеждает.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Требуйте доказательство результата\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Сделайте завершение задачи зависимым от проверяемого конечного состояния, а не от самоотчёта модели.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Проверьте значимые границы\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Убедитесь, что необратимые или чувствительные действия вызывают ожидаемое одобрение, отказ или передачу.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">9\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">9. Повторяйте после изменений обвязки или модели\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Рассматривайте обновления среды выполнения как изменения надёжности, требующие регрессионного тестирования.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-44\">Успех в бенчмарке имеет границу валидности\u003C\u002Fh2>\n\u003Cp>Оценка бенчмарка — это условное утверждение. Она валидна для конкретной модели, обвязки, среды, набора задач, судьи, интерфейса инструментов, бюджета шагов, политики повторных попыток, даты и метода оценки.\u003C\u002Fp>\n\u003Cp>Число становится вводящим в заблуждение, когда эти условия исчезают из утверждения. «Агент X набирает 80%» слабее, чем «Агент X набрал 80% в бенчмарке Y в среде Z с судьёй J и бюджетом шагов N». Второе утверждение сохраняет границу, которая говорит вам, переносится ли число на ваше приложение.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fru\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Граница валидности ответа: недостающий слой между релевантностью и надёжными ответами ИИ\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Фреймворк для явного указания условий, при которых утверждение ИИ остаётся валидным, и какие изменения требуют ограничения, пересчёта или отказа.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Читать о границе валидности ответа →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-48\">Успех процесса и успех результата должны оцениваться отдельно\u003C\u002Fh2>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Четыре возможных исхода одного запуска с использованием компьютера\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Процесс\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Результат\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Интерпретация\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Правильный процесс \u002F правильный результат\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Неправильный процесс \u002F правильный результат\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Правильный процесс \u002F неправильный результат\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Неправильный процесс \u002F неправильный результат\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>WeaveBench сообщает, что оценка только по результату может существенно завысить производительность при использовании компьютера, поскольку агент может создать внешне успешный артефакт с помощью обходного пути или сфабрикованных доказательств. Верификатор должен проверять траекторию и результаты работы, а не только итоговое утверждение.\u003C\u002Fp>\n\u003Ch2 id=\"section-51\">Надёжность в продакшене — это распределение, а не единичная доля успеха\u003C\u002Fh2>\n\u003Cp>Полезная оценка в продакшене выбирает измерения, которые действительно варьируются в вашей среде. Для рабочего процесса в браузере это может включать возраст аккаунта, локаль, размер области просмотра, версию страницы, качество сети, состояние аутентификации, существующее состояние корзины, cookies, всплывающие окна, права пользователя и то, прерывает ли человек запуск.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Измерение\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Пример вариации\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Почему это важно\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Среда\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Быстрая или медленная сеть, временные сбои, тайминг страницы\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Проверяет восстановление и поведение ожидания\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Интерфейс\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Другой размер области просмотра, модальное окно, переупорядоченный элемент, незначительный редизайн\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Проверяет хрупкие визуальные допущения и допущения о действиях\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Состояние\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Вход выполнен или нет, пустая или непустая корзина, существующий файл, изменённые разрешения\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Проверяет рассуждение о скрытом состоянии\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Горизонт задачи\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">5 шагов против 50+ шагов, одно приложение против нескольких приложений\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Проверяет накопленную ошибку траектории\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Неоднозначность\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Отсутствующее предпочтение или неполная инструкция пользователя\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Проверяет, спрашивает ли агент вместо того, чтобы угадывать\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Последствие\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Только чтение против покупки, отправки, удаления, изменения\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Проверяет элементы управления подтверждением и авторизацией\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Враждебный контент\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Внедрение подсказок или вводящий в заблуждение текст страницы\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Проверяет иерархию инструкций и локализацию\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Версия модели или обвязки\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Обновление среды выполнения\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Проверяет регрессию из-за изменений системного уровня\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-54\">Надёжности нужен бюджет отказов, а не совершенство\u003C\u002Fh2>\n\u003Cp>Ни одна продакшн-система не является абсолютно надежной. Практически значимый инженерный вопрос заключается в том, какие сбои допустимы, обнаруживаемы и устранимы. Неудачная попытка отсортировать локальную папку не равносильна отправке неправильного письма, покупке не того товара или изменению настроек аккаунта.\u003C\u002Fp>\n\u003Cp>Классифицируйте действия по их последствиям и обратимости. Обратимые действия с низким уровнем влияния допускают большую автономность. Действия с серьезными последствиями, внешне заметные или труднообратимые требуют более строгого подтверждения, верификации состояния, авторизации и проверок после выполнения.\u003C\u002Fp>\n\u003Ch2 id=\"section-57\">Практическая матрица надежности для сценариев управления компьютером\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Класс действий\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Пример\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Рекомендуемый контроль\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Чтение \u002F инспекция\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Открытие страниц, чтение файлов, сбор информации\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ограничение области видимости, логирование источников, допустимость восстановимых ошибок навигации\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Обратимое локальное изменение\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Редактирование черновика, реорганизация временного рабочего пространства\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Создание контрольной точки или версии перед изменением; проверка результата\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Внешняя коммуникация\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Отправка email, публикация контента, отправка формы\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Подтверждение пользователем или явное делегирование полномочий; проверка принятого состояния\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Финансовые \u002F транзакционные\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Покупка, оформление заказа, платная подписка\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Строгий мандат, ограничения по сумме\u002Fпродавцу, финальное подтверждение и проверка чека\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Деструктивные \u002F изменяющие права\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Удаление данных, изменение прав доступа, отзыв доступа\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Узкая авторизация, явное подтверждение, возможность отката по возможности, аудит после выполнения\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-59\">Что логировать при сбоях сценариев управления компьютером\u003C\u002Fh2>\n\u003Cul>\u003Cli>Цель пользователя и явные ограничения.\u003C\u002Fli>\u003Cli>Версия модели и тестовой обвязки (harness).\u003C\u002Fli>\u003Cli>Версии окружения и приложений.\u003C\u002Fli>\u003Cli>Скриншоты или структурированные наблюдения, относящиеся к сбою.\u003C\u002Fli>\u003Cli>Выполненные действия с временными метками.\u003C\u002Fli>\u003Cli>Результаты вызова инструментов, кликов, ввода с клавиатуры и навигации.\u003C\u002Fli>\u003Cli>Переходы между состояниями и периоды ожидания.\u003C\u002Fli>\u003Cli>События согласования, отказа или передачи управления человеку.\u003C\u002Fli>\u003Cli>Внешние ошибки и сетевые сбои.\u003C\u002Fli>\u003Cli>Итоговое наблюдаемое состояние окружения.\u003C\u002Fli>\u003Cli>Результат, о котором сообщил агент.\u003C\u002Fli>\u003Cli>Результат верификатора и оценка того, мог ли агент предотвратить сбой.\u003C\u002Fli>\u003C\u002Ful>\n\u003Cp>Ключевое сопоставление — между заявленным успехом и фактически наблюдаемым успехом. Система, не способная различить эти два понятия, со временем неизбежно накопит ложноположительные срабатывания в продакшене.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fru\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Надежность ИИ-агентов: почему финального ответа недостаточно\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Более комплексная модель надежности для оценки траекторий агентов, использования инструментов и промежуточных решений вместо того, чтобы принимать финальный ответ за доказательство корректной работы системы.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Читать статью о надежности агентов →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-63\">Безопасность — неотъемлемая часть надежности агентов управления компьютером\u003C\u002Fh2>\n\u003Cp>Агенты управления компьютером не просто читают ненадежный контент — они могут совершать действия на его основе. Это превращает инъекции промптов, вредоносное содержимое страниц и фишинг в риски на пути выполнения.\u003C\u002Fp>\n\u003Cp>Текущие рекомендации OpenAI по управлению компьютером советуют изолировать окружение, использовать белые списки сайтов и действий, рассматривать содержимое экрана как ненадежное, подтверждать критически важные действия, ограничивать время выполнения и проверять фактический результат. Агент ChatGPT аналогично использует подтверждения, мониторинг инъекций промптов и контролируемые режимы для чувствительных контекстов.\u003C\u002Fp>\n\u003Cp>Архитектурный принцип шире рекомендаций отдельного провайдера: контент, который видит агент, не должен иметь возможности переопределять полномочия пользователя. Веб-страница может предоставлять данные, но она не может давать разрешение отправлять данные в другое место, совершать покупки, изменять учетные данные или выходить за границы задачи.\u003C\u002Fp>\n\u003Ch2 id=\"section-67\">Что могло бы изменить эти выводы?\u003C\u002Fh2>\n\u003Cp>Разрыв в надежности сократился бы, если бы модели управления компьютером стали устойчивыми к длинным цепочкам действий, динамическим состояниям, вариативности интерфейса, сбоям окружения и неоднозначным целям в репрезентативных продакшн-условиях. Более качественные нативные API состояния, стандартизированные машиночитаемые интерфейсы и более надежная инфраструктура верификаторов также могли бы снизить потребность в хрупком взаимодействии через графический интерфейс.\u003C\u002Fp>\n\u003Cp>Порог внедрения также зависит от серьезности последствий задачи. Показатель успешности в 70% может быть приемлем для исследовательской задачи с низким уровнем риска под наблюдением оператора, но абсолютно недопустим для автономного финансового или деструктивного процесса. Следовательно, надежность необходимо оценивать с учетом цены каждого класса сбоев, а не по единому универсальному порогу успешности.\u003C\u002Fp>\n\u003Ch2 id=\"section-70\">Ограничения\u003C\u002Fh2>\n\u003Cp>Приведенные бенчмарки оценивают различные среды, и их не следует ранжировать относительно друг друга так, будто они измеряют одно и то же. WAREX тестирует устойчивость к ненадежности веба; WeaveBench нацелен на гибридную работу с длинным горизонтом; OSWorld 2.0 ориентирован на реалистичные протяженные рабочие процессы; BLIND-ACT фокусируется на обработке целей в условиях неопределенности и невыполнимости.\u003C\u002Fp>\n\u003Cp>Результаты бенчмарков также быстро устаревают. Улучшения моделей, обвязок и верификаторов могут существенно изменить показатели за считанные месяцы. Поэтому долгосрочную ценность представляет методология оценки: варьировать условия, разделять процесс и результат, верифицировать внешнее состояние и четко определять границы применимости каждого заявления о производительности.\u003C\u002Fp>\n\u003Ch2 id=\"section-73\">Заключение\u003C\u002Fh2>\n\u003Cp>Агенты для управления компьютером уже достаточно функциональны, чтобы приносить реальную пользу. Именно поэтому фокус оценки изменился. Главная задача теперь состоит не просто в том, чтобы агент мог пройти по заданному сценарию. Важно то, сохраняет ли система надежность, когда идеальные демонстрационные условия перестают действовать.\u003C\u002Fp>\n\u003Cp>Относитесь к единичному успешному прогону лишь как к доказательству принципиальной возможности. Проверяйте повторяемость, устойчивость к среде, долгосрочное управление, учет состояния, верификацию результатов и безопасную работу с целями. Настоящий production-агент управления компьютером — это не тот, который может завершить демо, а тот, чьи границы отказов известны, измерены и контролируемы.\u003C\u002Fp>\n\u003Ch2 id=\"section-76\">Часто задаваемые вопросы\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Надежность агентов для управления компьютером\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Доказывает ли успешная демонстрация агента его надежность в продакшене?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Нет. Она доказывает работоспособность только в рамках одной конкретной траектории. Надежность в продакшене требует стабильного успеха в условиях вариативности окружения, длительных задач, меняющегося состояния, неоднозначности, восстановления после сбоев и выполнения критически важных действий.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Почему результаты бенчмарков могут выглядеть значительно лучше реальной эффективности?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Бенчмарки часто используют более контролируемые среды, короткие задачи, стабильное сетевое соединение, простые комбинации приложений или критерии оценки, не учитывающие все сбои процесса. Точные границы применимости зависят от каждого конкретного бенчмарка.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Какова самая важная проверка надежности после действия агента?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Проверка фактического внешнего результата. Не следует воспринимать итоговое сообщение агента или последовательность кликов как доказательство того, что целевая система успешно приняла операцию.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Почему долгосрочные компьютерные задачи по-прежнему вызывают сложности?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Ошибки накапливаются на протяжении множества действий, ограничения забываются, внешнее состояние меняется, работа охватывает несколько приложений, скрытое состояние имеет значение, и агенту необходимо определять, когда нужно подождать, уточнить, проверить или восстановиться, а не просто продолжать действовать.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Как следует тестировать браузерного или десктопного агента перед развертыванием?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Многократно повторяйте базовые задачи, вносите реалистичные сбои среды, меняйте интерфейс и состояние, увеличивайте горизонт рабочих процессов, добавляйте неоднозначность, требуйте наблюдаемых доказательств результатов, проверяйте ограничения для критических действий и перезапускайте тесты после изменения моделей или обвязки.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq6\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Должны ли действия агента всегда требовать подтверждения человеком?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Не для каждого действия с низким уровнем риска. Требования к подтверждению должны соотноситься с последствиями, обратимостью, уровнем полномочий и степенью неопределенности. Действия с серьезными последствиями, внешне заметные или труднообратимые требуют более строгого контроля.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-78\">Глоссарий\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Ключевые термины надежности\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"computer-use-agent\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Computer-use agent (Агент для управления компьютером)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">ИИ-агент, который взаимодействует с графическими интерфейсами или компьютерными средами посредством наблюдений и действий, таких как клики, ввод текста, прокрутка, файловые операции или сквозные сценарии между приложениями.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"repeatability\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Repeatability (Повторяемость)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Степень, с которой агент может стабильно выполнять одну и ту же задачу при повторных запусках, а не добиваться успеха лишь на отдельных траекториях.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"environmental-robustness\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Environmental robustness (Устойчивость к среде)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Способность сохранять корректное поведение, несмотря на реалистичные отклонения, такие как задержки сети, временные сбои, изменения интерфейса, состояние сессии и непредвиденные условия на странице.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"outcome-verification\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Outcome verification (Верификация результатов)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Проверка фактического внешнего состояния после выполнения действия для подтверждения достижения намеченного результата вместо опоры на отчет самого агента.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"blind-goal-directedness\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Blind Goal-Directedness (Слепая целеустремленность)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Паттерн сбоя, при котором агент продолжает следовать цели, несмотря на неоднозначность, невыполнимость, противоречивые условия или наличие причин остановиться и пересмотреть действия.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"reliability-boundary\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Reliability boundary (Граница надежности)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Набор условий, при которых наблюдаемый показатель успешности или заявленные возможности остаются достаточно репрезентативными для принятия конкретного решения о внедрении.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-80\">Первоисточники и литература для дальнейшего чтения\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Computer use\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Актуальное руководство для разработчиков по изоляции сред, отношению к содержимому экрана как к ненадежному, подтверждению критических действий, ограничению выполнения и верификации результатов.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Безопасный запуск Codex в OpenAI\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Актуальные практические рекомендации по техническим границам, согласованию с человеком, телеметрии и контролю агентов, работающих с реальными системами.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — WAREX\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Исследование 2026 года, показывающее, что реалистичная нестабильность веб-среды приводит к существенному падению успешности браузерных агентов на существующих бенчмарках.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — Искусство создания верификаторов для агентов управления компьютером\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Работа 2026 года по оценке процесса в сравнении с результатом, контролируемым и неконтролируемым сбоям, а также надежной верификации траекторий.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — WeaveBench\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Бенчмарк 2026 года для долгосрочных задач, объединяющий GUI, CLI и работу с кодом, который демонстрирует существенный разрыв между текущими агентами и надежным выполнением реальных сценариев.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OSWorld 2.0 — Тестирование агентов управления компьютером на долгосрочных реальных задачах\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Бенчмарк 2026 года, ориентированный на реалистичные долгосрочные сценарии взаимодействия с компьютером, скрытые состояния и рассуждения на основе нескольких источников.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — SentinelBench\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Бенчмарк 2026 года для задач, меняющихся со временем, где агенты должны отслеживать окружение и реагировать на изменения состояния, а не действовать непрерывно.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — Just Do It!? Агенты управления компьютером проявляют слепую целеустремленность\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Исследование ICLR 2026 о ситуациях, когда агенты продолжают следовать неоднозначным, противоречивым или заведомо невыполнимым целям.\u003C\u002Fp>\u003C\u002Fa>",{"time":212,"blocks":213,"version":936},1790353587560,[214,222,228,236,243,250,255,260,265,270,275,305,310,315,343,348,353,358,363,368,373,378,383,388,395,400,405,410,415,420,425,430,435,440,445,450,455,460,465,470,475,480,485,517,522,527,532,541,546,580,585,590,595,636,641,646,651,656,685,690,710,715,723,728,733,738,743,748,753,758,763,768,773,778,783,788,793,823,828,858,863,873,882,891,900,909,918,927],{"id":215,"data":216,"type":220,"tunes":221},"IYG9UPcPY0",{"title":217,"maxLevel":218,"minLevel":219},"Содержание",3,2,"tableOfContents",{},{"id":223,"data":224,"type":226,"tunes":227},"intro",{"text":225},"Агенты для управления компьютером (computer-use agents) теперь умеют кликать мышью, вводить текст, просматривать веб-страницы, редактировать файлы, работать с десктопными приложениями и выполнять впечатляющие многошаговые задачи. Поэтому успешные демоверсии легко воспринимаются и легко переоцениваются. Однократное выполнение рабочего процесса лишь доказывает, что агент способен добиться успеха в этих конкретных условиях. Это не показывает, как часто он достигает цели, как ведет себя при изменении среды, проверяет ли результат и насколько безопасно действует в ситуациях с неоднозначными целями.","paragraph",{},{"id":229,"data":230,"type":234,"tunes":235},"direct",{"body":231,"title":232,"variant":233},"\u003Cstrong>Успешное демо управления компьютером доказывает возможность выполнения задачи, но не надежность.\u003C\u002Fstrong> Надежность в продакшене требует от агента стабильного успеха при изменчивости среды, восстановления после временных сбоев, соблюдения ограничений на длинных горизонтах, обнаружения скрытых или меняющихся состояний, проверки фактического результата, а также своевременной остановки или уточнения, если цель становится неоднозначной или небезопасной. Правильный вопрос для внедрения в продакшен звучит не «Может ли агент выполнить эту задачу?», а «При каких условиях мы можем доверить ему регулярное выполнение этой задачи?»","Прямой ответ","info","callout",{},{"id":237,"data":238,"type":234,"tunes":242},"freshness",{"body":239,"title":240,"variant":241},"Эта статья отражает исследования в области агентов для управления компьютером и рекомендации платформ, актуальные на \u003Cstrong>25 сентября 2026 года\u003C\u002Fstrong>. Результаты бенчмарков нельзя напрямую сравнивать при различиях в наборах задач, средах, моделях, лимитах шагов, судьях или инфраструктуре тестирования. Оценивайте любой показатель бенчмарка исключительно в контексте условий его тестирования.","Быстро развивающаяся область","warning",{},{"id":244,"data":245,"type":234,"tunes":249},"model-note",{"body":246,"title":247,"variant":248},"Приведенные ниже «Лестница надежности управления компьютером» и «Стресс-тест перехода от демо к продакшену» представляют собой практические оценочные модели, предложенные авторами. Они не являются официальными отраслевыми стандартами.","Модель, используемая в этой статье","note",{},{"id":251,"data":252,"type":42,"tunes":254},"h-demo",{"text":253,"level":219},"Почему демо — это простейший из возможных тестов на надежность",{},{"id":256,"data":257,"type":226,"tunes":259},"p-demo-1",{"text":258},"Демо обычно показывает одну успешную траекторию. Окружение известно заранее, задача подобрана заблаговременно, оператор может перезапустить процесс в случае сбоя, а аудитория видит лишь удачный путь. Системы в продакшене сталкиваются с распределением вероятностей: различные страницы, состояние сети, статус учетной записи, всплывающие окна, задержки, изменения интерфейса, скрытое состояние, права доступа, прерывания и пользователи, которые неидеально формулируют цели.",{},{"id":261,"data":262,"type":226,"tunes":264},"p-demo-2",{"text":263},"Это различие критически важно, поскольку агенты для управления компьютером работают через интерфейсы, созданные для людей, а не через детерминированные API. Цикл их действий зависит от восприятия, интерпретации состояния, планирования, тайминга взаимодействия и отклика среды. Небольшие изменения могут сбить траекторию, даже если цель пользователя осталась прежней.",{},{"id":266,"data":267,"type":226,"tunes":269},"p-demo-3",{"text":268},"Исследование WAREX от Microsoft Research наглядно демонстрирует эту проблему: агенты из бенчмарков, выглядящие способными в контролируемых условиях, существенно теряют в успешности задач при возникновении реалистичной нестабильности веба. Причина сбоя не обязательно в том, что «модель поглупела». Дело в том, что среда перестала быть детерминированной.",{},{"id":271,"data":272,"type":42,"tunes":274},"h-claims",{"text":273,"level":219},"Возможность, доля успеха, надежность и безопасность — это разные утверждения",{},{"id":276,"data":277,"type":303,"tunes":304},"claims-table",{"content":278,"stretched":43,"withHeadings":14},[279,283,287,291,295,299],[280,281,282],"Утверждение","Что оно доказывает на самом деле","Чего оно не доказывает",[284,285,286],"Агент выполнил задачу один раз","Возможность решения в рамках одной зафиксированной траектории","Повторяемость, устойчивость, безопасность или способность к обобщению",[288,289,290],"Агент набрал высокий балл в бенчмарке","Эффективность в рамках задач и условий тестирования этого бенчмарка","Эквивалентную производительность в продакшене в других условиях окружения",[292,293,294],"Агент обычно достигает цели","Частоту успешного исхода","Корректность процесса, безопасное поведение или факт проверки результата",[296,297,298],"Агент следует намеченному процессу","Качество траектории в соответствии с оцениваемым регламентом","То, что внешняя среда действительно приняла конечный результат",[300,301,302],"Агент избегает небезопасных действий в тестовой выборке","Эффективность на представленных сценариях безопасности","Безопасность при любой новой неоднозначности, инъекции или побочном эффекте","table",{},{"id":306,"data":307,"type":42,"tunes":309},"h-ladder",{"text":308,"level":219},"Лестница надежности управления компьютером",{},{"id":311,"data":312,"type":226,"tunes":314},"p-ladder-intro",{"text":313},"Удобный способ оценки систем управления компьютером — переход от разовой способности выполнить действие к все более строгим критериям надежности. Более высокие уровни предполагают наличие более низких, но не вытекают из них автоматически.",{},{"id":316,"data":317,"type":341,"tunes":342},"ladder-flow",{"steps":318,"title":308,"orientation":340},[319,322,325,328,331,334,337],{"label":320,"description":321},"1. Возможность выполнения","Способен ли агент выполнить задачу хотя бы один раз в известных условиях?",{"label":323,"description":324},"2. Повторяемость","Способен ли он стабильно выполнять одну и ту же задачу в серии повторных попыток?",{"label":326,"description":327},"3. Устойчивость к среде","Справляется ли он с задержками, сетевыми сбоями, всплывающими окнами, изменениями интерфейса и небольшими возмущениями среды?",{"label":329,"description":330},"4. Контроль на длинном горизонте","Способен ли он удерживать цели, ограничения и прогресс на протяжении множества шагов, приложений и отложенных событий?",{"label":332,"description":333},"5. Осведомленность о состоянии","Способен ли он обнаружить, что среда изменилась, что скрытое состояние имеет значение или что исходное предположение больше неверно?",{"label":335,"description":336},"6. Верификация результата","Проверяет ли он, что запланированный результат действительно достигнут, вместо того чтобы слепо доверять собственной последовательности действий?",{"label":338,"description":339},"7. Безопасная обработка целей","Способен ли он остановиться, переспросить, отказаться или вернуть управление, если цель неоднозначна, недостижима, противоречива или сопряжена с высокими рисками?","auto","processFlow",{},{"id":344,"data":345,"type":42,"tunes":347},"h-capability",{"text":346,"level":218},"Уровень 1 — Возможность выполнения: вопрос уровня демо",{},{"id":349,"data":350,"type":226,"tunes":352},"p-capability-1",{"text":351},"Возможность выполнения определяет, способен ли агент в принципе решить задачу. Это ценно. Системы управления компьютером развиваются стремительно, и современные агенты могут выполнять рабочие процессы, которые прежние системы не могли реализовать надежно.",{},{"id":354,"data":355,"type":226,"tunes":357},"p-capability-2",{"text":356},"Однако сама по себе возможность выполнения — слабый критерий для развертывания в продакшене. Один успешный запуск не дает ответа на вопрос, успешен ли агент в 95% или в 30% случаев, являются ли сбои безвредными или разрушительными и не зависел ли успех от случайного удачного состояния страницы.",{},{"id":359,"data":360,"type":42,"tunes":362},"h-repeatability",{"text":361,"level":218},"Уровень 2 — Повторяемость: остается ли та же задача решенной?",{},{"id":364,"data":365,"type":226,"tunes":367},"p-repeat-1",{"text":366},"Траектории использования компьютера стохастичны. Ответы модели варьируются, страницы загружаются с разной скоростью, визуальные состояния меняются, а длинные рабочие процессы создают множество точек ветвления. Поэтому в продакшене тест должен выполнять одну и ту же задачу несколько раз, а не считать единственный успешный прогон репрезентативным.",{},{"id":369,"data":370,"type":226,"tunes":372},"p-repeat-2",{"text":371},"Оценивайте не только среднюю долю успешных попыток, но и распределение типов сбоев: неверный клик, преждевременное завершение, пропущенное подтверждение, некорректное поле, повторное действие, зацикливание навигации, предположение об устаревшем состоянии и ложный отчет об успехе.",{},{"id":374,"data":375,"type":42,"tunes":377},"h-robustness",{"text":376,"level":218},"Уровень 3 — Устойчивость к среде: что происходит, когда веб ведет себя как реальный веб?",{},{"id":379,"data":380,"type":226,"tunes":382},"p-robust-1",{"text":381},"Реальные веб-сайты — это не статичные стенды бенчмарков. Запросы завершаются с ошибками, элементы загружаются с задержкой, сессии истекают, страницы меняются, появляются баннеры согласия на обработку файлов cookie, серверы возвращают ошибки, а условия сети постоянно меняются.",{},{"id":384,"data":385,"type":226,"tunes":387},"p-robust-2",{"text":386},"WAREX оценивает этот разрыв, внедряя реалистичную нестабильность веба в существующие среды бенчмарков, и фиксирует значительное падение успешности выполнения задач. Это критически важный вывод для продакшена: бенчмарк может оценивать способность решать задачи, недооценивая при этом устойчивость к восстановлению после сбоев среды.",{},{"id":389,"data":390,"type":234,"tunes":394},"robust-tip",{"body":391,"title":392,"variant":393},"Внедряйте задержки, кратковременные ошибки HTTP, устаревшее состояние страниц, модальные окна, истечение срока сессий, дублирующиеся ответы и контролируемые изменения интерфейса. Если агент работает только по идеальному сценарию, это система уровня демо, а не надежное продакшен-решение.","Тест на надежность","tip",{},{"id":396,"data":397,"type":42,"tunes":399},"h-long",{"text":398,"level":218},"Уровень 4 — Долгосрочное управление: результаты меняются, когда задача превращается в реальную работу",{},{"id":401,"data":402,"type":226,"tunes":404},"p-long-1",{"text":403},"Короткие задачи скрывают целый класс сбоев, возникающих только после десятков или сотен действий: забытые ограничения, дублирование работы, преждевременное завершение, пропущенные изменения состояния, несоответствия между приложениями и накопившиеся мелкие ошибки.",{},{"id":406,"data":407,"type":226,"tunes":409},"p-long-2",{"text":408},"Бенчмарк OSWorld 2.0 был специально разработан для оценки долгосрочных реальных рабочих процессов. У пользователей-людей выполнение его задач занимает в среднем около 1,6 часа и требует значительно больше вызовов инструментов, чем в более ранних бенчмарках взаимодействия с компьютером. Согласно его основной метрике завершения, даже самые мощные из протестированных систем все еще далеки от полной надежности.",{},{"id":411,"data":412,"type":226,"tunes":414},"p-long-3",{"text":413},"WeaveBench приходит к аналогичному выводу с другой стороны. Он оценивает гибридные рабочие процессы с использованием GUI, CLI и кода и показывает, что лучшая протестированная связка модели и среды выполнения успешно проходит лишь 41,2% задач. Важный результат заключается не в конкретной цифре в таблице лидеров, а в том, что реалистичная координация между интерфейсами выявляет сбои, скрытые более простыми задачами в рамках одного интерфейса.",{},{"id":416,"data":417,"type":42,"tunes":419},"h-state",{"text":418,"level":218},"Уровень 5 — Отслеживание состояния: среда может измениться прямо во время выполнения плана",{},{"id":421,"data":422,"type":226,"tunes":424},"p-state-1",{"text":423},"Длительные задачи часто зависят от скрытого или меняющегося состояния: пришло письмо, изменился календарь, отправлена форма, завершился фоновый процесс, истекла сессия браузера, пользователь изменил файл или изменилась доступность внешней системы.",{},{"id":426,"data":427,"type":226,"tunes":429},"p-state-2",{"text":428},"Авторы бенчмарка SentinelBench от Microsoft утверждают, что многие длительные задачи вообще не следует решать с помощью непрерывных действий. Правильным поведением может быть мониторинг, ожидание внешнего события и действие лишь после изменения состояния. Это принципиально иной навык, нежели более быстрые клики или планирование большего числа шагов.",{},{"id":431,"data":432,"type":226,"tunes":434},"p-state-3",{"text":433},"Поэтому надежный агент для взаимодействия с компьютером должен различать состояния: «можно действовать сейчас», «ожидание изменения состояния», «состояние изменилось» и «предположение не подтвердилось».",{},{"id":436,"data":437,"type":42,"tunes":439},"h-verify",{"text":438,"level":218},"Уровень 6 — Проверка результата: сработало ли действие на самом деле?",{},{"id":441,"data":442,"type":226,"tunes":444},"p-verify-1",{"text":443},"Агент может выполнить внешне правильную последовательность действий и все равно провалить задачу. Клик по кнопке может не зарегистрироваться. Форма может отклонить данные на скрытой валидации. Файл может сохраниться не в ту папку. Покупка может остаться неподтвержденной. Сайт может отобразить экран успеха, тогда как сама операция завершилась сбоем.",{},{"id":446,"data":447,"type":226,"tunes":449},"p-verify-2",{"text":448},"Текущие рекомендации OpenAI по использованию компьютера прямо советуют ограничивать рамки выполнения и верифицировать процесс работы, а не полагаться исключительно на итоговый ответ модели. К такому же выводу на основе оценки приходят исследователи Microsoft Research в своей работе о верификаторах компьютерных агентов: процесс и результат необходимо оценивать раздельно.",{},{"id":451,"data":452,"type":226,"tunes":454},"p-verify-3",{"text":453},"В исследовании Universal Verifier отмечается, что более ранние конфигурации верификаторов могут давать высокий уровень ложноположительных срабатываний, в то время как более продуманные критерии оценки и четкое разделение процесса, результата, контролируемых и неконтролируемых сбоев существенно повышают согласованность с оценками людей.",{},{"id":456,"data":457,"type":42,"tunes":459},"h-safe-goal",{"text":458,"level":218},"Уровень 7 — Безопасная обработка целей: агент должен знать, когда не продолжать",{},{"id":461,"data":462,"type":226,"tunes":464},"p-safe-1",{"text":463},"Агенты, использующие компьютер, оптимизированы для достижения целей, но настойчивость в достижении цели сама по себе может стать режимом отказа. Неоднозначный запрос, невозможное условие, противоречивая инструкция, подозрительная веб-страница или изменившаяся среда могут потребовать уточнения или остановки, а не дальнейших действий.",{},{"id":466,"data":467,"type":226,"tunes":469},"p-safe-2",{"text":468},"Бенчмарк BLIND-ACT изучает эту проблему как слепую целенаправленность. В системах, оценённых в этой работе, агенты часто продолжали выполнять задачи, несмотря на неоднозначность, невыполнимость, противоречивый контекст или другие причины для пересмотра. Авторы выявляют такие паттерны, как смещение в пользу выполнения и приоритет запроса.",{},{"id":471,"data":472,"type":226,"tunes":474},"p-safe-3",{"text":473},"Этот класс отказов важен, потому что высокоспособный агент может быстрее ухудшить плохую ситуацию. Поэтому надёжность включает политику того, когда не следует действовать.",{},{"id":476,"data":477,"type":42,"tunes":479},"h-stress",{"text":478,"level":219},"Стресс-тест перехода от демо к продакшену",{},{"id":481,"data":482,"type":226,"tunes":484},"p-stress-intro",{"text":483},"Перед развёртыванием рабочего процесса с использованием компьютера возьмите успешное демо и систематически удалите допущения, которые делали его простым.",{},{"id":486,"data":487,"type":341,"tunes":516},"stress-flow",{"steps":488,"title":478,"orientation":340},[489,492,495,498,501,504,507,510,513],{"label":490,"description":491},"1. Повторно запустите чистую задачу","Установите повторяемость на нескольких испытаниях, прежде чем добавлять сложность.",{"label":493,"description":494},"2. Возмутите среду","Добавьте задержку, повторные попытки, всплывающие окна, вариации страниц, устаревшие сессии и временные сбои.",{"label":496,"description":497},"3. Расширьте горизонт","Превратите короткое демо в полный реальный рабочий процесс с промежуточным состоянием, несколькими приложениями и отложенными шагами.",{"label":499,"description":500},"4. Измените скрытое состояние","Измените состояние аккаунта, файла, задачи или внешнее состояние после того, как агент сформировал план, и проверьте, обнаруживает ли он изменение.",{"label":502,"description":503},"5. Внедрите неоднозначность","Удалите одно важное допущение и проверьте, спрашивает ли агент вместо того, чтобы угадывать.",{"label":505,"description":506},"6. Внедрите контролируемое противоречие","Представьте старое и новое состояние вместе и убедитесь, что авторитетное текущее состояние побеждает.",{"label":508,"description":509},"7. Требуйте доказательство результата","Сделайте завершение задачи зависимым от проверяемого конечного состояния, а не от самоотчёта модели.",{"label":511,"description":512},"8. Проверьте значимые границы","Убедитесь, что необратимые или чувствительные действия вызывают ожидаемое одобрение, отказ или передачу.",{"label":514,"description":515},"9. Повторяйте после изменений обвязки или модели","Рассматривайте обновления среды выполнения как изменения надёжности, требующие регрессионного тестирования.",{},{"id":518,"data":519,"type":42,"tunes":521},"h-benchmark-boundary",{"text":520,"level":219},"Успех в бенчмарке имеет границу валидности",{},{"id":523,"data":524,"type":226,"tunes":526},"p-boundary-1",{"text":525},"Оценка бенчмарка — это условное утверждение. Она валидна для конкретной модели, обвязки, среды, набора задач, судьи, интерфейса инструментов, бюджета шагов, политики повторных попыток, даты и метода оценки.",{},{"id":528,"data":529,"type":226,"tunes":531},"p-boundary-2",{"text":530},"Число становится вводящим в заблуждение, когда эти условия исчезают из утверждения. «Агент X набирает 80%» слабее, чем «Агент X набрал 80% в бенчмарке Y в среде Z с судьёй J и бюджетом шагов N». Второе утверждение сохраняет границу, которая говорит вам, переносится ли число на ваше приложение.",{},{"id":533,"data":534,"type":539,"tunes":540},"ref-avb",{"url":535,"title":536,"excerpt":537,"ctaLabel":538},"https:\u002F\u002Fstajic.de\u002Fru\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","Граница валидности ответа: недостающий слой между релевантностью и надёжными ответами ИИ","Фреймворк для явного указания условий, при которых утверждение ИИ остаётся валидным, и какие изменения требуют ограничения, пересчёта или отказа.","Читать о границе валидности ответа","referralArticle",{},{"id":542,"data":543,"type":42,"tunes":545},"h-process-outcome",{"text":544,"level":219},"Успех процесса и успех результата должны оцениваться отдельно",{},{"id":547,"data":548,"type":578,"tunes":579},"process-outcome-comparison",{"rows":549,"title":567,"layout":303,"columns":568},[550,555,559,563],{"id":551,"label":552,"values":553},"good-good","Правильный процесс \u002F правильный результат",[554,554,554],"",{"id":556,"label":557,"values":558},"bad-good","Неправильный процесс \u002F правильный результат",[554,554,554],{"id":560,"label":561,"values":562},"good-bad","Правильный процесс \u002F неправильный результат",[554,554,554],{"id":564,"label":565,"values":566},"bad-bad","Неправильный процесс \u002F неправильный результат",[554,554,554],"Четыре возможных исхода одного запуска с использованием компьютера",[569,572,575],{"id":570,"label":571},"process","Процесс",{"id":573,"label":574},"outcome","Результат",{"id":576,"label":577},"interpretation","Интерпретация","comparison",{},{"id":581,"data":582,"type":226,"tunes":584},"p-process-1",{"text":583},"WeaveBench сообщает, что оценка только по результату может существенно завысить производительность при использовании компьютера, поскольку агент может создать внешне успешный артефакт с помощью обходного пути или сфабрикованных доказательств. Верификатор должен проверять траекторию и результаты работы, а не только итоговое утверждение.",{},{"id":586,"data":587,"type":42,"tunes":589},"h-distribution",{"text":588,"level":219},"Надёжность в продакшене — это распределение, а не единичная доля успеха",{},{"id":591,"data":592,"type":226,"tunes":594},"p-dist-1",{"text":593},"Полезная оценка в продакшене выбирает измерения, которые действительно варьируются в вашей среде. Для рабочего процесса в браузере это может включать возраст аккаунта, локаль, размер области просмотра, версию страницы, качество сети, состояние аутентификации, существующее состояние корзины, cookies, всплывающие окна, права пользователя и то, прерывает ли человек запуск.",{},{"id":596,"data":597,"type":303,"tunes":635},"distribution-table",{"content":598,"stretched":43,"withHeadings":14},[599,603,607,611,615,619,623,627,631],[600,601,602],"Измерение","Пример вариации","Почему это важно",[604,605,606],"Среда","Быстрая или медленная сеть, временные сбои, тайминг страницы","Проверяет восстановление и поведение ожидания",[608,609,610],"Интерфейс","Другой размер области просмотра, модальное окно, переупорядоченный элемент, незначительный редизайн","Проверяет хрупкие визуальные допущения и допущения о действиях",[612,613,614],"Состояние","Вход выполнен или нет, пустая или непустая корзина, существующий файл, изменённые разрешения","Проверяет рассуждение о скрытом состоянии",[616,617,618],"Горизонт задачи","5 шагов против 50+ шагов, одно приложение против нескольких приложений","Проверяет накопленную ошибку траектории",[620,621,622],"Неоднозначность","Отсутствующее предпочтение или неполная инструкция пользователя","Проверяет, спрашивает ли агент вместо того, чтобы угадывать",[624,625,626],"Последствие","Только чтение против покупки, отправки, удаления, изменения","Проверяет элементы управления подтверждением и авторизацией",[628,629,630],"Враждебный контент","Внедрение подсказок или вводящий в заблуждение текст страницы","Проверяет иерархию инструкций и локализацию",[632,633,634],"Версия модели или обвязки","Обновление среды выполнения","Проверяет регрессию из-за изменений системного уровня",{},{"id":637,"data":638,"type":42,"tunes":640},"h-budget",{"text":639,"level":219},"Надёжности нужен бюджет отказов, а не совершенство",{},{"id":642,"data":643,"type":226,"tunes":645},"p-budget-1",{"text":644},"Ни одна продакшн-система не является абсолютно надежной. Практически значимый инженерный вопрос заключается в том, какие сбои допустимы, обнаруживаемы и устранимы. Неудачная попытка отсортировать локальную папку не равносильна отправке неправильного письма, покупке не того товара или изменению настроек аккаунта.",{},{"id":647,"data":648,"type":226,"tunes":650},"p-budget-2",{"text":649},"Классифицируйте действия по их последствиям и обратимости. Обратимые действия с низким уровнем влияния допускают большую автономность. Действия с серьезными последствиями, внешне заметные или труднообратимые требуют более строгого подтверждения, верификации состояния, авторизации и проверок после выполнения.",{},{"id":652,"data":653,"type":42,"tunes":655},"h-matrix",{"text":654,"level":219},"Практическая матрица надежности для сценариев управления компьютером",{},{"id":657,"data":658,"type":303,"tunes":684},"control-matrix",{"content":659,"stretched":43,"withHeadings":14},[660,664,668,672,676,680],[661,662,663],"Класс действий","Пример","Рекомендуемый контроль",[665,666,667],"Чтение \u002F инспекция","Открытие страниц, чтение файлов, сбор информации","Ограничение области видимости, логирование источников, допустимость восстановимых ошибок навигации",[669,670,671],"Обратимое локальное изменение","Редактирование черновика, реорганизация временного рабочего пространства","Создание контрольной точки или версии перед изменением; проверка результата",[673,674,675],"Внешняя коммуникация","Отправка email, публикация контента, отправка формы","Подтверждение пользователем или явное делегирование полномочий; проверка принятого состояния",[677,678,679],"Финансовые \u002F транзакционные","Покупка, оформление заказа, платная подписка","Строгий мандат, ограничения по сумме\u002Fпродавцу, финальное подтверждение и проверка чека",[681,682,683],"Деструктивные \u002F изменяющие права","Удаление данных, изменение прав доступа, отзыв доступа","Узкая авторизация, явное подтверждение, возможность отката по возможности, аудит после выполнения",{},{"id":686,"data":687,"type":42,"tunes":689},"h-log",{"text":688,"level":219},"Что логировать при сбоях сценариев управления компьютером",{},{"id":691,"data":692,"type":708,"tunes":709},"log-list",{"meta":693,"items":694,"style":707},{},[695,696,697,698,699,700,701,702,703,704,705,706],"Цель пользователя и явные ограничения.","Версия модели и тестовой обвязки (harness).","Версии окружения и приложений.","Скриншоты или структурированные наблюдения, относящиеся к сбою.","Выполненные действия с временными метками.","Результаты вызова инструментов, кликов, ввода с клавиатуры и навигации.","Переходы между состояниями и периоды ожидания.","События согласования, отказа или передачи управления человеку.","Внешние ошибки и сетевые сбои.","Итоговое наблюдаемое состояние окружения.","Результат, о котором сообщил агент.","Результат верификатора и оценка того, мог ли агент предотвратить сбой.","unordered","list",{},{"id":711,"data":712,"type":226,"tunes":714},"p-log-1",{"text":713},"Ключевое сопоставление — между заявленным успехом и фактически наблюдаемым успехом. Система, не способная различить эти два понятия, со временем неизбежно накопит ложноположительные срабатывания в продакшене.",{},{"id":716,"data":717,"type":539,"tunes":722},"ref-reliability",{"url":718,"title":719,"excerpt":720,"ctaLabel":721},"https:\u002F\u002Fstajic.de\u002Fru\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Надежность ИИ-агентов: почему финального ответа недостаточно","Более комплексная модель надежности для оценки траекторий агентов, использования инструментов и промежуточных решений вместо того, чтобы принимать финальный ответ за доказательство корректной работы системы.","Читать статью о надежности агентов",{},{"id":724,"data":725,"type":42,"tunes":727},"h-security",{"text":726,"level":219},"Безопасность — неотъемлемая часть надежности агентов управления компьютером",{},{"id":729,"data":730,"type":226,"tunes":732},"p-sec-1",{"text":731},"Агенты управления компьютером не просто читают ненадежный контент — они могут совершать действия на его основе. Это превращает инъекции промптов, вредоносное содержимое страниц и фишинг в риски на пути выполнения.",{},{"id":734,"data":735,"type":226,"tunes":737},"p-sec-2",{"text":736},"Текущие рекомендации OpenAI по управлению компьютером советуют изолировать окружение, использовать белые списки сайтов и действий, рассматривать содержимое экрана как ненадежное, подтверждать критически важные действия, ограничивать время выполнения и проверять фактический результат. Агент ChatGPT аналогично использует подтверждения, мониторинг инъекций промптов и контролируемые режимы для чувствительных контекстов.",{},{"id":739,"data":740,"type":226,"tunes":742},"p-sec-3",{"text":741},"Архитектурный принцип шире рекомендаций отдельного провайдера: контент, который видит агент, не должен иметь возможности переопределять полномочия пользователя. Веб-страница может предоставлять данные, но она не может давать разрешение отправлять данные в другое место, совершать покупки, изменять учетные данные или выходить за границы задачи.",{},{"id":744,"data":745,"type":42,"tunes":747},"h-change",{"text":746,"level":219},"Что могло бы изменить эти выводы?",{},{"id":749,"data":750,"type":226,"tunes":752},"p-change-1",{"text":751},"Разрыв в надежности сократился бы, если бы модели управления компьютером стали устойчивыми к длинным цепочкам действий, динамическим состояниям, вариативности интерфейса, сбоям окружения и неоднозначным целям в репрезентативных продакшн-условиях. Более качественные нативные API состояния, стандартизированные машиночитаемые интерфейсы и более надежная инфраструктура верификаторов также могли бы снизить потребность в хрупком взаимодействии через графический интерфейс.",{},{"id":754,"data":755,"type":226,"tunes":757},"p-change-2",{"text":756},"Порог внедрения также зависит от серьезности последствий задачи. Показатель успешности в 70% может быть приемлем для исследовательской задачи с низким уровнем риска под наблюдением оператора, но абсолютно недопустим для автономного финансового или деструктивного процесса. Следовательно, надежность необходимо оценивать с учетом цены каждого класса сбоев, а не по единому универсальному порогу успешности.",{},{"id":759,"data":760,"type":42,"tunes":762},"h-limitations",{"text":761,"level":219},"Ограничения",{},{"id":764,"data":765,"type":226,"tunes":767},"p-limit-1",{"text":766},"Приведенные бенчмарки оценивают различные среды, и их не следует ранжировать относительно друг друга так, будто они измеряют одно и то же. WAREX тестирует устойчивость к ненадежности веба; WeaveBench нацелен на гибридную работу с длинным горизонтом; OSWorld 2.0 ориентирован на реалистичные протяженные рабочие процессы; BLIND-ACT фокусируется на обработке целей в условиях неопределенности и невыполнимости.",{},{"id":769,"data":770,"type":226,"tunes":772},"p-limit-2",{"text":771},"Результаты бенчмарков также быстро устаревают. Улучшения моделей, обвязок и верификаторов могут существенно изменить показатели за считанные месяцы. Поэтому долгосрочную ценность представляет методология оценки: варьировать условия, разделять процесс и результат, верифицировать внешнее состояние и четко определять границы применимости каждого заявления о производительности.",{},{"id":774,"data":775,"type":42,"tunes":777},"h-conclusion",{"text":776,"level":219},"Заключение",{},{"id":779,"data":780,"type":226,"tunes":782},"p-conclusion-1",{"text":781},"Агенты для управления компьютером уже достаточно функциональны, чтобы приносить реальную пользу. Именно поэтому фокус оценки изменился. Главная задача теперь состоит не просто в том, чтобы агент мог пройти по заданному сценарию. Важно то, сохраняет ли система надежность, когда идеальные демонстрационные условия перестают действовать.",{},{"id":784,"data":785,"type":226,"tunes":787},"p-conclusion-2",{"text":786},"Относитесь к единичному успешному прогону лишь как к доказательству принципиальной возможности. Проверяйте повторяемость, устойчивость к среде, долгосрочное управление, учет состояния, верификацию результатов и безопасную работу с целями. Настоящий production-агент управления компьютером — это не тот, который может завершить демо, а тот, чьи границы отказов известны, измерены и контролируемы.",{},{"id":789,"data":790,"type":42,"tunes":792},"h-faq",{"text":791,"level":219},"Часто задаваемые вопросы",{},{"id":794,"data":795,"type":794,"tunes":822},"faq",{"items":796,"title":821},[797,801,805,809,813,817],{"id":798,"answer":799,"question":800},"faq1","Нет. Она доказывает работоспособность только в рамках одной конкретной траектории. Надежность в продакшене требует стабильного успеха в условиях вариативности окружения, длительных задач, меняющегося состояния, неоднозначности, восстановления после сбоев и выполнения критически важных действий.","Доказывает ли успешная демонстрация агента его надежность в продакшене?",{"id":802,"answer":803,"question":804},"faq2","Бенчмарки часто используют более контролируемые среды, короткие задачи, стабильное сетевое соединение, простые комбинации приложений или критерии оценки, не учитывающие все сбои процесса. Точные границы применимости зависят от каждого конкретного бенчмарка.","Почему результаты бенчмарков могут выглядеть значительно лучше реальной эффективности?",{"id":806,"answer":807,"question":808},"faq3","Проверка фактического внешнего результата. Не следует воспринимать итоговое сообщение агента или последовательность кликов как доказательство того, что целевая система успешно приняла операцию.","Какова самая важная проверка надежности после действия агента?",{"id":810,"answer":811,"question":812},"faq4","Ошибки накапливаются на протяжении множества действий, ограничения забываются, внешнее состояние меняется, работа охватывает несколько приложений, скрытое состояние имеет значение, и агенту необходимо определять, когда нужно подождать, уточнить, проверить или восстановиться, а не просто продолжать действовать.","Почему долгосрочные компьютерные задачи по-прежнему вызывают сложности?",{"id":814,"answer":815,"question":816},"faq5","Многократно повторяйте базовые задачи, вносите реалистичные сбои среды, меняйте интерфейс и состояние, увеличивайте горизонт рабочих процессов, добавляйте неоднозначность, требуйте наблюдаемых доказательств результатов, проверяйте ограничения для критических действий и перезапускайте тесты после изменения моделей или обвязки.","Как следует тестировать браузерного или десктопного агента перед развертыванием?",{"id":818,"answer":819,"question":820},"faq6","Не для каждого действия с низким уровнем риска. Требования к подтверждению должны соотноситься с последствиями, обратимостью, уровнем полномочий и степенью неопределенности. Действия с серьезными последствиями, внешне заметные или труднообратимые требуют более строгого контроля.","Должны ли действия агента всегда требовать подтверждения человеком?","Надежность агентов для управления компьютером",{},{"id":824,"data":825,"type":42,"tunes":827},"h-glossary",{"text":826,"level":219},"Глоссарий",{},{"id":829,"data":830,"type":829,"tunes":857},"glossary",{"title":831,"entries":832},"Ключевые термины надежности",[833,837,841,845,849,853],{"term":834,"anchor":835,"definition":836},"Computer-use agent (Агент для управления компьютером)","computer-use-agent","ИИ-агент, который взаимодействует с графическими интерфейсами или компьютерными средами посредством наблюдений и действий, таких как клики, ввод текста, прокрутка, файловые операции или сквозные сценарии между приложениями.",{"term":838,"anchor":839,"definition":840},"Repeatability (Повторяемость)","repeatability","Степень, с которой агент может стабильно выполнять одну и ту же задачу при повторных запусках, а не добиваться успеха лишь на отдельных траекториях.",{"term":842,"anchor":843,"definition":844},"Environmental robustness (Устойчивость к среде)","environmental-robustness","Способность сохранять корректное поведение, несмотря на реалистичные отклонения, такие как задержки сети, временные сбои, изменения интерфейса, состояние сессии и непредвиденные условия на странице.",{"term":846,"anchor":847,"definition":848},"Outcome verification (Верификация результатов)","outcome-verification","Проверка фактического внешнего состояния после выполнения действия для подтверждения достижения намеченного результата вместо опоры на отчет самого агента.",{"term":850,"anchor":851,"definition":852},"Blind Goal-Directedness (Слепая целеустремленность)","blind-goal-directedness","Паттерн сбоя, при котором агент продолжает следовать цели, несмотря на неоднозначность, невыполнимость, противоречивые условия или наличие причин остановиться и пересмотреть действия.",{"term":854,"anchor":855,"definition":856},"Reliability boundary (Граница надежности)","reliability-boundary","Набор условий, при которых наблюдаемый показатель успешности или заявленные возможности остаются достаточно репрезентативными для принятия конкретного решения о внедрении.",{},{"id":859,"data":860,"type":42,"tunes":862},"h-sources",{"text":861,"level":219},"Первоисточники и литература для дальнейшего чтения",{},{"id":864,"data":865,"type":871,"tunes":872},"src-openai-computer",{"link":866,"meta":867},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use",{"image":868,"title":869,"description":870},{"url":554},"OpenAI — Computer use","Актуальное руководство для разработчиков по изоляции сред, отношению к содержимому экрана как к ненадежному, подтверждению критических действий, ограничению выполнения и верификации результатов.","linkTool",{},{"id":874,"data":875,"type":871,"tunes":881},"src-openai-safety",{"link":876,"meta":877},"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F",{"image":878,"title":879,"description":880},{"url":554},"OpenAI — Безопасный запуск Codex в OpenAI","Актуальные практические рекомендации по техническим границам, согласованию с человеком, телеметрии и контролю агентов, работающих с реальными системами.",{},{"id":883,"data":884,"type":871,"tunes":890},"src-ms-warex",{"link":885,"meta":886},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F",{"image":887,"title":888,"description":889},{"url":554},"Microsoft Research — WAREX","Исследование 2026 года, показывающее, что реалистичная нестабильность веб-среды приводит к существенному падению успешности браузерных агентов на существующих бенчмарках.",{},{"id":892,"data":893,"type":871,"tunes":899},"src-ms-verifier",{"link":894,"meta":895},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F",{"image":896,"title":897,"description":898},{"url":554},"Microsoft Research — Искусство создания верификаторов для агентов управления компьютером","Работа 2026 года по оценке процесса в сравнении с результатом, контролируемым и неконтролируемым сбоям, а также надежной верификации траекторий.",{},{"id":901,"data":902,"type":871,"tunes":908},"src-ms-weavebench",{"link":903,"meta":904},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F",{"image":905,"title":906,"description":907},{"url":554},"Microsoft Research — WeaveBench","Бенчмарк 2026 года для долгосрочных задач, объединяющий GUI, CLI и работу с кодом, который демонстрирует существенный разрыв между текущими агентами и надежным выполнением реальных сценариев.",{},{"id":910,"data":911,"type":871,"tunes":917},"src-osworld2",{"link":912,"meta":913},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537",{"image":914,"title":915,"description":916},{"url":554},"OSWorld 2.0 — Тестирование агентов управления компьютером на долгосрочных реальных задачах","Бенчмарк 2026 года, ориентированный на реалистичные долгосрочные сценарии взаимодействия с компьютером, скрытые состояния и рассуждения на основе нескольких источников.",{},{"id":919,"data":920,"type":871,"tunes":926},"src-ms-sentinel",{"link":921,"meta":922},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F",{"image":923,"title":924,"description":925},{"url":554},"Microsoft Research — SentinelBench","Бенчмарк 2026 года для задач, меняющихся со временем, где агенты должны отслеживать окружение и реагировать на изменения состояния, а не действовать непрерывно.",{},{"id":928,"data":929,"type":871,"tunes":935},"src-ms-blind",{"link":930,"meta":931},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F",{"image":932,"title":933,"description":934},{"url":554},"Microsoft Research — Just Do It!? Агенты управления компьютером проявляют слепую целеустремленность","Исследование ICLR 2026 о ситуациях, когда агенты продолжают следовать неоднозначным, противоречивым или заведомо невыполнимым целям.",{},"2.31","Агенты для управления компьютером теперь могут выполнять впечатляющие рабочие процессы в браузере и на рабочем столе, но один успешный запуск доказывает способность—а не надежность. В этой статье показано, как проверять повторяемость, устойчивость к условиям среды, управление на длинном горизонте, осведомленность о состоянии, верификацию результатов и безопасную обработку целей.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg","PUBLISHED","2026-09-25T12:13:00.000Z","2026-09-25T16:13:28.344Z","2026-09-25T19:19:11.089Z",{"en":945,"de":946,"sr":947,"es":948,"fr":949,"it":950,"ru":951,"zh":952},"\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fde\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fsr\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fes\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Ffr\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fit\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fru\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","\u002Fzh\u002Fblog\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system",[954,958,962],{"id":955,"name":956,"slug":957},58,"Оценка и гейты качества","evaluation",{"id":959,"name":960,"slug":961},97,"Проверка на тест-наборе","verification",{"id":963,"name":964,"slug":965},73,"Проверка и сравнение","verification-and-diffing",{"id":967,"login":968,"email":969,"displayName":970},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[972,1568],{"lang":973,"title":974,"content":975,"contentJson":976,"excerpt":1567},"en","Computer-Use Agents: Why a Successful Demo Can Still Be an Unreliable System","{\"time\":1790352872794,\"blocks\":[{\"id\":\"IYG9UPcPY0\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents can now click, type, browse, edit files, operate desktop applications, and complete impressive multi-step tasks. That makes successful demos easy to understand and easy to overinterpret. A single completed workflow shows that the agent can succeed under those conditions. It does not show how often it succeeds, how it behaves when the environment changes, whether it verifies the result, or how safely it acts when the goal becomes ambiguous.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"\u003Cstrong>A successful computer-use demo proves capability, not reliability.\u003C\u002Fstrong> Production reliability requires the agent to succeed repeatedly across environmental variation, recover from transient failures, preserve constraints over long horizons, detect hidden or changing state, verify the actual outcome, and stop or ask when the goal becomes ambiguous or unsafe. The correct production question is not “Can the agent do this task?” but “Under which conditions can we trust it to do this task repeatedly?”\"},\"tunes\":{}},{\"id\":\"freshness\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Fast-moving field\",\"body\":\"This article reflects computer-use agent research and platform guidance available on \u003Cstrong>25 September 2026\u003C\u002Fstrong>. Benchmark results are not directly comparable across different task sets, environments, models, step limits, judges, or harnesses. Treat every benchmark number together with its evaluation conditions.\"},\"tunes\":{}},{\"id\":\"model-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"The model used in this article\",\"body\":\"The Computer-Use Reliability Ladder and Demo-to-Production Stress Test below are practical evaluation models proposed here. They are not formal industry standards.\"},\"tunes\":{}},{\"id\":\"h-demo\",\"type\":\"header\",\"data\":{\"text\":\"Why the demo is the easiest possible reliability test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-demo-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A demo normally shows one trajectory that worked. The environment is known, the task is selected in advance, the operator can restart after a failure, and the audience sees the successful path. Production systems face a distribution instead: different pages, network conditions, account states, pop-ups, latency, UI changes, hidden state, permissions, interruptions, and users who describe goals imperfectly.\"},\"tunes\":{}},{\"id\":\"p-demo-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That distinction matters because computer-use agents operate through interfaces designed for humans rather than deterministic APIs. Their action loop depends on perception, state interpretation, planning, interaction timing, and environment response. Small changes can alter the trajectory even when the user goal is unchanged.\"},\"tunes\":{}},{\"id\":\"p-demo-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Microsoft Research's WAREX work makes the problem explicit: benchmark agents that look capable in controlled settings lose substantial task success when realistic web instability is introduced. The failure is not necessarily “the model became less intelligent.” The environment stopped being deterministic.\"},\"tunes\":{}},{\"id\":\"h-claims\",\"type\":\"header\",\"data\":{\"text\":\"Capability, success rate, reliability, and safety are different claims\",\"level\":2},\"tunes\":{}},{\"id\":\"claims-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Claim\",\"What it actually establishes\",\"What it does not establish\"],[\"The agent completed the task once\",\"Capability under one observed trajectory\",\"Repeatability, robustness, safety, or generalization\"],[\"The agent scores highly on a benchmark\",\"Performance under that benchmark's task and evaluation conditions\",\"Equivalent production performance on different environments\"],[\"The agent usually reaches the goal\",\"Outcome success frequency\",\"Correct process, safe behaviour, or evidence that the result was verified\"],[\"The agent follows the intended process\",\"Trajectory quality under the evaluated rubric\",\"That the external environment actually accepted the final outcome\"],[\"The agent avoids unsafe actions in a test set\",\"Performance on represented safety cases\",\"Safety under every novel ambiguity, injection, or side effect\"]]},\"tunes\":{}},{\"id\":\"h-ladder\",\"type\":\"header\",\"data\":{\"text\":\"The Computer-Use Reliability Ladder\",\"level\":2},\"tunes\":{}},{\"id\":\"p-ladder-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A useful way to evaluate computer-use systems is to move from one-off capability toward progressively harder reliability properties. Higher levels assume the lower levels but do not follow automatically from them.\"},\"tunes\":{}},{\"id\":\"ladder-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Computer-Use Reliability Ladder\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Capability\",\"description\":\"Can the agent complete the task at least once under known conditions?\"},{\"label\":\"2. Repeatability\",\"description\":\"Can it complete the same task consistently across repeated trials?\"},{\"label\":\"3. Environmental robustness\",\"description\":\"Does it survive timing changes, network issues, pop-ups, UI variation, and small environmental perturbations?\"},{\"label\":\"4. Long-horizon control\",\"description\":\"Can it preserve goals, constraints, and progress across many steps, applications, and delayed events?\"},{\"label\":\"5. State awareness\",\"description\":\"Can it detect when the environment changed, when hidden state matters, or when an assumption is no longer valid?\"},{\"label\":\"6. Outcome verification\",\"description\":\"Does it verify that the intended result actually happened instead of trusting its own action sequence?\"},{\"label\":\"7. Safe goal handling\",\"description\":\"Can it stop, ask, refuse, or hand control back when the goal is ambiguous, infeasible, contradictory, or high impact?\"}]},\"tunes\":{}},{\"id\":\"h-capability\",\"type\":\"header\",\"data\":{\"text\":\"Level 1 — Capability: the demo question\",\"level\":3},\"tunes\":{}},{\"id\":\"p-capability-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Capability asks whether an agent can perform the task at all. This is valuable. Computer-use systems have advanced rapidly, and modern agents can complete workflows that older systems could not execute reliably.\"},\"tunes\":{}},{\"id\":\"p-capability-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"But capability is a weak deployment criterion. One successful run does not tell you whether the agent succeeds 95% of the time or 30% of the time, whether failures are harmless or destructive, or whether success depends on a lucky page state.\"},\"tunes\":{}},{\"id\":\"h-repeatability\",\"type\":\"header\",\"data\":{\"text\":\"Level 2 — Repeatability: does the same task stay solved?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-repeat-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use trajectories are stochastic. Model outputs vary, pages load at different speeds, visual states change, and long workflows create many branching opportunities. A production test should therefore run the same task multiple times rather than treating one passing trace as representative.\"},\"tunes\":{}},{\"id\":\"p-repeat-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Measure not only the average success rate but also the distribution of failure modes: wrong click, premature termination, missed confirmation, incorrect field, duplicate action, navigation loop, stale-state assumption, and false success report.\"},\"tunes\":{}},{\"id\":\"h-robustness\",\"type\":\"header\",\"data\":{\"text\":\"Level 3 — Environmental robustness: what happens when the web behaves like the web?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-robust-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Real websites are not benchmark fixtures. Requests fail, elements load late, sessions expire, pages change, consent banners appear, servers return errors, and network conditions fluctuate.\"},\"tunes\":{}},{\"id\":\"p-robust-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"WAREX evaluates this gap by injecting realistic web unreliability into existing benchmark environments and reports significant drops in task success. This is a critical production insight: a benchmark can measure task competence while under-measuring recovery from environmental instability.\"},\"tunes\":{}},{\"id\":\"robust-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"Reliability test\",\"body\":\"Inject delays, transient HTTP failures, stale page state, modal dialogs, session expiration, duplicate responses, and controlled UI variation. If the agent only works on the clean path, it is a demo-capable system, not a production-reliable one.\"},\"tunes\":{}},{\"id\":\"h-long\",\"type\":\"header\",\"data\":{\"text\":\"Level 4 — Long-horizon control: success changes when the task becomes real work\",\"level\":3},\"tunes\":{}},{\"id\":\"p-long-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Short tasks hide a class of failures that appear only after dozens or hundreds of actions: forgotten constraints, duplicated work, premature completion, missed state changes, cross-application inconsistencies, and accumulated small errors.\"},\"tunes\":{}},{\"id\":\"p-long-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OSWorld 2.0 was designed specifically around long-horizon real-world workflows. Its tasks take human users a median of roughly 1.6 hours and require many more tool calls than earlier computer-use benchmarks. Under its primary completion metric, even the strongest evaluated systems remain far from complete task reliability.\"},\"tunes\":{}},{\"id\":\"p-long-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"WeaveBench reaches a similar conclusion from another angle. It evaluates hybrid GUI, CLI and code workflows and reports that the best evaluated model-runtime pairing passes only 41.2% of tasks. The important result is not one leaderboard number; it is that realistic cross-interface orchestration exposes failures hidden by simpler single-interface tasks.\"},\"tunes\":{}},{\"id\":\"h-state\",\"type\":\"header\",\"data\":{\"text\":\"Level 5 — State awareness: the environment can change underneath the plan\",\"level\":3},\"tunes\":{}},{\"id\":\"p-state-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running tasks often depend on hidden or changing state: an email arrives, a calendar changes, a form is submitted, a background process finishes, a browser session expires, a user modifies a file, or an external system changes availability.\"},\"tunes\":{}},{\"id\":\"p-state-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Microsoft's SentinelBench argues that many long-running tasks should not be solved through continuous action at all. The correct behaviour may be to monitor, wait for an external event, then act when the state changes. This is a different capability from clicking faster or planning more steps.\"},\"tunes\":{}},{\"id\":\"p-state-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"A reliable computer-use agent therefore needs to distinguish actionable now, waiting for state, state changed, and assumption invalidated.\"},\"tunes\":{}},{\"id\":\"h-verify\",\"type\":\"header\",\"data\":{\"text\":\"Level 6 — Outcome verification: did the action actually work?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-verify-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An agent can execute an apparently correct sequence and still fail the task. A button click may not register. A form may reject hidden validation. A file may save to the wrong directory. A purchase may remain unconfirmed. A site may display a success-looking screen while the underlying operation failed.\"},\"tunes\":{}},{\"id\":\"p-verify-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current computer-use guidance explicitly recommends bounding and verifying the run instead of relying only on the model's final answer. Microsoft Research's work on computer-use verifiers reaches the same conclusion from evaluation: process and outcome need to be judged separately.\"},\"tunes\":{}},{\"id\":\"p-verify-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The Universal Verifier research reports that earlier verifier setups can produce high false-positive rates, while stronger rubric design and explicit separation of process, outcome, controllable failures, and uncontrollable failures substantially improve agreement with human labels.\"},\"tunes\":{}},{\"id\":\"h-safe-goal\",\"type\":\"header\",\"data\":{\"text\":\"Level 7 — Safe goal handling: the agent must know when not to continue\",\"level\":3},\"tunes\":{}},{\"id\":\"p-safe-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents are optimized to complete goals, but goal persistence can itself become a failure mode. An ambiguous request, impossible condition, contradictory instruction, suspicious webpage, or changed environment may require clarification or stopping rather than more action.\"},\"tunes\":{}},{\"id\":\"p-safe-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The BLIND-ACT benchmark studies this problem as Blind Goal-Directedness. Across the systems evaluated in that work, agents frequently continued pursuing tasks despite ambiguity, infeasibility, conflicting context, or other reasons to reconsider. The authors identify patterns such as execution-first bias and request primacy.\"},\"tunes\":{}},{\"id\":\"p-safe-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"This failure class matters because a highly capable agent can make a bad situation worse faster. Reliability therefore includes a policy for when not to act.\"},\"tunes\":{}},{\"id\":\"h-stress\",\"type\":\"header\",\"data\":{\"text\":\"The Demo-to-Production Stress Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-stress-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Before deploying a computer-use workflow, take the successful demo and systematically remove the assumptions that made it easy.\"},\"tunes\":{}},{\"id\":\"stress-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Demo-to-Production Stress Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Re-run the clean task\",\"description\":\"Establish repeatability over multiple trials before adding complexity.\"},{\"label\":\"2. Perturb the environment\",\"description\":\"Add latency, retries, pop-ups, page variation, stale sessions and temporary failures.\"},{\"label\":\"3. Extend the horizon\",\"description\":\"Turn the short demo into the full real workflow with intermediate state, multiple applications and delayed steps.\"},{\"label\":\"4. Change hidden state\",\"description\":\"Modify account, file, task or external state after the agent has formed a plan and test whether it detects the change.\"},{\"label\":\"5. Inject ambiguity\",\"description\":\"Remove one important assumption and test whether the agent asks instead of guessing.\"},{\"label\":\"6. Inject a controlled contradiction\",\"description\":\"Present old and new state together and verify that authoritative current state wins.\"},{\"label\":\"7. Require outcome proof\",\"description\":\"Make task completion depend on verifiable final state, not the model's self-report.\"},{\"label\":\"8. Test consequential boundaries\",\"description\":\"Confirm that irreversible or sensitive actions trigger the expected approval, refusal or handoff.\"},{\"label\":\"9. Repeat after harness or model changes\",\"description\":\"Treat runtime upgrades as reliability changes that need regression testing.\"}]},\"tunes\":{}},{\"id\":\"h-benchmark-boundary\",\"type\":\"header\",\"data\":{\"text\":\"Benchmark success has a validity boundary\",\"level\":2},\"tunes\":{}},{\"id\":\"p-boundary-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A benchmark score is a conditional statement. It is valid for a particular model, harness, environment, task set, judge, tool interface, step budget, retry policy, date and evaluation method.\"},\"tunes\":{}},{\"id\":\"p-boundary-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The number becomes misleading when those conditions disappear from the claim. “Agent X scores 80%” is weaker than “Agent X scored 80% on benchmark Y under environment Z with judge J and step budget N.” The second statement preserves the boundary that tells you whether the number transfers to your application.\"},\"tunes\":{}},{\"id\":\"ref-avb\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\",\"title\":\"The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers\",\"excerpt\":\"A framework for making explicit the conditions under which an AI claim remains valid and what changes require restriction, recalculation, or abandonment.\",\"ctaLabel\":\"Read the Answer Validity Boundary\"},\"tunes\":{}},{\"id\":\"h-process-outcome\",\"type\":\"header\",\"data\":{\"text\":\"Process success and outcome success must be scored separately\",\"level\":2},\"tunes\":{}},{\"id\":\"process-outcome-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Four possible outcomes of one computer-use run\",\"layout\":\"table\",\"columns\":[{\"id\":\"process\",\"label\":\"Process\"},{\"id\":\"outcome\",\"label\":\"Outcome\"},{\"id\":\"interpretation\",\"label\":\"Interpretation\"}],\"rows\":[{\"id\":\"good-good\",\"label\":\"Correct process \u002F correct outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"bad-good\",\"label\":\"Wrong process \u002F correct outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"good-bad\",\"label\":\"Correct process \u002F wrong outcome\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"bad-bad\",\"label\":\"Wrong process \u002F wrong outcome\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"p-process-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"WeaveBench reports that outcome-only grading can materially overestimate computer-use performance because an agent may produce an apparently successful artifact through a shortcut or fabricated evidence. The verifier must inspect the trajectory and deliverables, not merely the final claim.\"},\"tunes\":{}},{\"id\":\"h-distribution\",\"type\":\"header\",\"data\":{\"text\":\"Production reliability is a distribution, not a single pass rate\",\"level\":2},\"tunes\":{}},{\"id\":\"p-dist-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A useful production evaluation samples the dimensions that actually vary in your environment. For a browser workflow, that might include account age, locale, viewport, page version, network quality, authentication state, existing cart state, cookies, pop-ups, user permissions and whether a human interrupts the run.\"},\"tunes\":{}},{\"id\":\"distribution-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Dimension\",\"Example variation\",\"Why it matters\"],[\"Environment\",\"Fast vs slow network, transient failures, page timing\",\"Tests recovery and waiting behaviour\"],[\"UI\",\"Different viewport, modal, reordered element, minor redesign\",\"Tests brittle visual\u002Faction assumptions\"],[\"State\",\"Logged in\u002Fout, empty\u002Fnon-empty cart, existing file, changed permissions\",\"Tests hidden-state reasoning\"],[\"Task horizon\",\"5 steps vs 50+ steps, one app vs several apps\",\"Tests accumulated trajectory error\"],[\"Ambiguity\",\"Missing preference or incomplete user instruction\",\"Tests whether the agent asks instead of guesses\"],[\"Consequence\",\"Read-only vs purchase\u002Fsend\u002Fdelete\u002Fchange\",\"Tests confirmation and authorization controls\"],[\"Adversarial content\",\"Prompt injection or misleading page text\",\"Tests instruction hierarchy and containment\"],[\"Model \u002F harness version\",\"Runtime upgrade\",\"Tests regression from system-level changes\"]]},\"tunes\":{}},{\"id\":\"h-budget\",\"type\":\"header\",\"data\":{\"text\":\"Reliability needs a failure budget, not perfection\",\"level\":2},\"tunes\":{}},{\"id\":\"p-budget-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"No production system is perfectly reliable. The useful engineering question is which failures are acceptable, detectable and recoverable. A failed attempt to sort a local folder is not equivalent to sending the wrong email, purchasing the wrong product or changing an account setting.\"},\"tunes\":{}},{\"id\":\"p-budget-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Classify actions by consequence and reversibility. Low-impact reversible actions can tolerate more autonomy. High-impact, externally visible or hard-to-reverse actions need stronger confirmation, state verification, authorization and post-action checks.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A practical computer-use reliability matrix\",\"level\":2},\"tunes\":{}},{\"id\":\"control-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Action class\",\"Example\",\"Recommended control\"],[\"Read \u002F inspect\",\"Open pages, read files, gather information\",\"Bound scope, log sources, tolerate recoverable navigation errors\"],[\"Reversible local change\",\"Edit draft file, reorganize temporary workspace\",\"Checkpoint or version before change; verify result\"],[\"External communication\",\"Send email, publish content, submit form\",\"User confirmation or explicit delegated authority; verify accepted state\"],[\"Financial \u002F transactional\",\"Purchase, checkout, paid subscription\",\"Strict mandate, amount\u002Fmerchant constraints, final confirmation and receipt verification\"],[\"Destructive \u002F privilege-changing\",\"Delete data, change permissions, revoke access\",\"Narrow authorization, explicit confirmation, reversible path where possible, post-action audit\"]]},\"tunes\":{}},{\"id\":\"h-log\",\"type\":\"header\",\"data\":{\"text\":\"What to log for a computer-use failure\",\"level\":2},\"tunes\":{}},{\"id\":\"log-list\",\"type\":\"list\",\"data\":{\"style\":\"unordered\",\"meta\":{},\"items\":[\"User goal and explicit constraints.\",\"Model and harness version.\",\"Environment and application versions.\",\"Screenshots or structured observations relevant to the failure.\",\"Actions taken with timestamps.\",\"Tool, click, keyboard and navigation results.\",\"State transitions and waiting periods.\",\"Approval, refusal or handoff events.\",\"External errors and network failures.\",\"Final observable environment state.\",\"The agent's reported outcome.\",\"Verifier result and whether the failure was controllable by the agent.\"]},\"tunes\":{}},{\"id\":\"p-log-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The crucial comparison is between reported success and observable success. A system that cannot distinguish those two will eventually accumulate false positives in production.\"},\"tunes\":{}},{\"id\":\"ref-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"A broader reliability model for evaluating agent trajectories, tool use and intermediate decisions instead of accepting the final answer as proof that the system worked correctly.\",\"ctaLabel\":\"Read the agent reliability article\"},\"tunes\":{}},{\"id\":\"h-security\",\"type\":\"header\",\"data\":{\"text\":\"Security is part of reliability for computer-use agents\",\"level\":2},\"tunes\":{}},{\"id\":\"p-sec-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents do not merely read untrusted content; they can act after reading it. That turns prompt injection, malicious page content and phishing into execution-path risks.\"},\"tunes\":{}},{\"id\":\"p-sec-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current computer-use guidance recommends isolating the environment, allow-listing sites and actions, treating screen content as untrusted, confirming consequential actions, bounding the run and verifying the actual outcome. ChatGPT agent similarly uses confirmations, prompt-injection monitoring and supervised modes for sensitive contexts.\"},\"tunes\":{}},{\"id\":\"p-sec-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The architecture principle is broader than any one provider: content observed by the agent must not be allowed to redefine the user's authority. A webpage can provide data. It cannot grant permission to send data elsewhere, purchase something, change credentials or override the task boundary.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The reliability gap would narrow if computer-use models became robust to long horizons, dynamic state, UI variation, environmental failures and ambiguous goals across representative production distributions. Better native state APIs, standardized machine-readable interfaces and stronger verifier infrastructure could also reduce the amount of fragile GUI interaction required.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The deployment threshold also changes with task consequence. A 70% success rate can be useful for a supervised low-risk research task and unacceptable for an autonomous financial or destructive workflow. Reliability must therefore be evaluated against the cost of each failure class, not one universal pass-rate threshold.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The cited benchmarks evaluate different environments and should not be ranked against one another as if they measured the same thing. WAREX stresses web unreliability; WeaveBench targets hybrid long-horizon work; OSWorld 2.0 targets realistic long workflows; BLIND-ACT focuses on goal handling under ambiguity and infeasibility.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Benchmark results also age quickly. Model, harness and verifier improvements can materially change scores within months. The durable lesson is therefore the evaluation method: vary conditions, separate process from outcome, verify external state, and preserve the boundary around each performance claim.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Computer-use agents are already capable enough to be useful. That is exactly why the evaluation question has changed. The challenge is no longer only whether an agent can click through a workflow. It is whether the system remains dependable when the clean demo conditions disappear.\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Treat one successful run as evidence of capability. Then test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification and safe goal handling. A production computer-use agent is not the one that can complete the demo. It is the one whose failure boundaries are known, measured and controlled.\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Computer-use agent reliability\",\"items\":[{\"id\":\"faq1\",\"question\":\"Does a successful computer-use agent demo prove production reliability?\",\"answer\":\"No. It proves capability under one observed trajectory. Production reliability requires repeated success across environmental variation, long-running tasks, changing state, ambiguity, recovery conditions and consequential actions.\"},{\"id\":\"faq2\",\"question\":\"Why can computer-use benchmarks look much better than real-world performance?\",\"answer\":\"Benchmarks can use more controlled environments, shorter tasks, stable network conditions, simpler application combinations or outcome criteria that do not capture all process failures. The exact validity boundary depends on each benchmark.\"},{\"id\":\"faq3\",\"question\":\"What is the most important reliability check after a computer-use action?\",\"answer\":\"Verify the actual external outcome. Do not treat the agent's final statement or intended click sequence as proof that the target system accepted the operation.\"},{\"id\":\"faq4\",\"question\":\"Why do long-horizon computer tasks remain difficult?\",\"answer\":\"Errors accumulate across many actions, constraints are forgotten, external state changes, work spans multiple applications, hidden state matters, and the agent must decide when to wait, ask, verify or recover rather than simply continue acting.\"},{\"id\":\"faq5\",\"question\":\"How should I test a browser or desktop agent before deployment?\",\"answer\":\"Repeat clean tasks, inject realistic environmental failures, vary UI and state, extend the workflow horizon, introduce ambiguity, require observable outcome proof, test high-impact action controls and rerun the suite after model or harness changes.\"},{\"id\":\"faq6\",\"question\":\"Should computer-use agents always require human confirmation?\",\"answer\":\"Not for every low-risk action. Confirmation requirements should scale with consequence, reversibility, authority and uncertainty. High-impact, externally visible or difficult-to-reverse actions need stronger controls.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key reliability terms\",\"entries\":[{\"term\":\"Computer-use agent\",\"definition\":\"An AI agent that interacts with graphical user interfaces or computer environments through observations and actions such as clicking, typing, scrolling, file operations or cross-application workflows.\",\"anchor\":\"computer-use-agent\"},{\"term\":\"Repeatability\",\"definition\":\"The degree to which an agent can complete the same task consistently across repeated runs rather than succeeding only on selected trajectories.\",\"anchor\":\"repeatability\"},{\"term\":\"Environmental robustness\",\"definition\":\"The ability to preserve correct behaviour despite realistic variation such as latency, transient errors, UI changes, session state and unexpected page conditions.\",\"anchor\":\"environmental-robustness\"},{\"term\":\"Outcome verification\",\"definition\":\"Checking the actual external state after an action to confirm that the intended result occurred instead of relying on the agent's self-report.\",\"anchor\":\"outcome-verification\"},{\"term\":\"Blind Goal-Directedness\",\"definition\":\"A failure pattern in which a computer-use agent continues pursuing a goal despite ambiguity, infeasibility, contradictory conditions or reasons to stop and reassess.\",\"anchor\":\"blind-goal-directedness\"},{\"term\":\"Reliability boundary\",\"definition\":\"The set of conditions under which an observed success rate or capability claim remains representative enough for a specific deployment decision.\",\"anchor\":\"reliability-boundary\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-computer\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-computer-use\",\"meta\":{\"title\":\"OpenAI — Computer use\",\"description\":\"Current developer guidance on isolating environments, treating screen content as untrusted, confirming consequential actions, bounding runs and verifying outcomes.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-openai-safety\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fopenai.com\u002Findex\u002Frunning-codex-safely\u002F\",\"meta\":{\"title\":\"OpenAI — Running Codex safely at OpenAI\",\"description\":\"Current production guidance on technical boundaries, human approval, telemetry and control for agents that act on real systems.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-warex\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fwarex-web-agent-reliability-evaluation-on-existing-benchmarks\u002F\",\"meta\":{\"title\":\"Microsoft Research — WAREX\",\"description\":\"2026 evaluation showing that realistic web unreliability causes significant drops in browser-agent task success on existing benchmarks.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-verifier\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Farticles\u002Fthe-art-of-building-verifiers-for-computer-use-agents\u002F\",\"meta\":{\"title\":\"Microsoft Research — The Art of Building Verifiers for Computer Use Agents\",\"description\":\"2026 work on process versus outcome evaluation, controllable versus uncontrollable failures and reliable trajectory verification.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-weavebench\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fweavebench-a-long-horizon-real-world-benchmark-for-computer-use-agents-with-hybrid-interfaces\u002F\",\"meta\":{\"title\":\"Microsoft Research — WeaveBench\",\"description\":\"2026 long-horizon benchmark combining GUI, CLI and code workflows and showing a substantial gap between current agents and reliable real-world completion.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-osworld2\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.29537\",\"meta\":{\"title\":\"OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks\",\"description\":\"2026 benchmark focused on realistic long-horizon computer-use workflows, hidden state and cross-source reasoning.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-sentinel\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fsentinelbench-a-benchmark-for-long-running-monitoring-agents\u002F\",\"meta\":{\"title\":\"Microsoft Research — SentinelBench\",\"description\":\"2026 benchmark for time-evolving tasks where agents must monitor environments and respond to state changes rather than continuously act.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}},{\"id\":\"src-ms-blind\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fjust-do-it-computer-use-agents-exhibit-blind-goal-directedness\u002F\",\"meta\":{\"title\":\"Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness\",\"description\":\"ICLR 2026 research on agents continuing to pursue ambiguous, contradictory or infeasible goals.\",\"image\":{\"url\":\"\"}}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":977,"blocks":978,"version":1566},1790352872794,[979,983,987,992,997,1002,1006,1010,1014,1018,1022,1050,1054,1058,1084,1088,1092,1096,1100,1104,1108,1112,1116,1120,1125,1129,1133,1137,1141,1145,1149,1153,1157,1161,1165,1169,1173,1177,1181,1185,1189,1193,1197,1229,1233,1237,1241,1248,1252,1276,1280,1284,1288,1328,1332,1336,1340,1344,1372,1376,1393,1397,1404,1408,1412,1416,1420,1424,1428,1432,1436,1440,1444,1448,1452,1456,1460,1483,1487,1510,1514,1520,1527,1533,1540,1546,1553,1559],{"id":215,"data":980,"type":220,"tunes":982},{"title":981,"maxLevel":218,"minLevel":219},"Contents",{},{"id":223,"data":984,"type":226,"tunes":986},{"text":985},"Computer-use agents can now click, type, browse, edit files, operate desktop applications, and complete impressive multi-step tasks. That makes successful demos easy to understand and easy to overinterpret. A single completed workflow shows that the agent can succeed under those conditions. It does not show how often it succeeds, how it behaves when the environment changes, whether it verifies the result, or how safely it acts when the goal becomes ambiguous.",{},{"id":229,"data":988,"type":234,"tunes":991},{"body":989,"title":990,"variant":233},"\u003Cstrong>A successful computer-use demo proves capability, not reliability.\u003C\u002Fstrong> Production reliability requires the agent to succeed repeatedly across environmental variation, recover from transient failures, preserve constraints over long horizons, detect hidden or changing state, verify the actual outcome, and stop or ask when the goal becomes ambiguous or unsafe. The correct production question is not “Can the agent do this task?” but “Under which conditions can we trust it to do this task repeatedly?”","Direct answer",{},{"id":237,"data":993,"type":234,"tunes":996},{"body":994,"title":995,"variant":241},"This article reflects computer-use agent research and platform guidance available on \u003Cstrong>25 September 2026\u003C\u002Fstrong>. Benchmark results are not directly comparable across different task sets, environments, models, step limits, judges, or harnesses. Treat every benchmark number together with its evaluation conditions.","Fast-moving field",{},{"id":244,"data":998,"type":234,"tunes":1001},{"body":999,"title":1000,"variant":248},"The Computer-Use Reliability Ladder and Demo-to-Production Stress Test below are practical evaluation models proposed here. They are not formal industry standards.","The model used in this article",{},{"id":251,"data":1003,"type":42,"tunes":1005},{"text":1004,"level":219},"Why the demo is the easiest possible reliability test",{},{"id":256,"data":1007,"type":226,"tunes":1009},{"text":1008},"A demo normally shows one trajectory that worked. The environment is known, the task is selected in advance, the operator can restart after a failure, and the audience sees the successful path. Production systems face a distribution instead: different pages, network conditions, account states, pop-ups, latency, UI changes, hidden state, permissions, interruptions, and users who describe goals imperfectly.",{},{"id":261,"data":1011,"type":226,"tunes":1013},{"text":1012},"That distinction matters because computer-use agents operate through interfaces designed for humans rather than deterministic APIs. Their action loop depends on perception, state interpretation, planning, interaction timing, and environment response. Small changes can alter the trajectory even when the user goal is unchanged.",{},{"id":266,"data":1015,"type":226,"tunes":1017},{"text":1016},"Microsoft Research's WAREX work makes the problem explicit: benchmark agents that look capable in controlled settings lose substantial task success when realistic web instability is introduced. The failure is not necessarily “the model became less intelligent.” The environment stopped being deterministic.",{},{"id":271,"data":1019,"type":42,"tunes":1021},{"text":1020,"level":219},"Capability, success rate, reliability, and safety are different claims",{},{"id":276,"data":1023,"type":303,"tunes":1049},{"content":1024,"stretched":43,"withHeadings":14},[1025,1029,1033,1037,1041,1045],[1026,1027,1028],"Claim","What it actually establishes","What it does not establish",[1030,1031,1032],"The agent completed the task once","Capability under one observed trajectory","Repeatability, robustness, safety, or generalization",[1034,1035,1036],"The agent scores highly on a benchmark","Performance under that benchmark's task and evaluation conditions","Equivalent production performance on different environments",[1038,1039,1040],"The agent usually reaches the goal","Outcome success frequency","Correct process, safe behaviour, or evidence that the result was verified",[1042,1043,1044],"The agent follows the intended process","Trajectory quality under the evaluated rubric","That the external environment actually accepted the final outcome",[1046,1047,1048],"The agent avoids unsafe actions in a test set","Performance on represented safety cases","Safety under every novel ambiguity, injection, or side effect",{},{"id":306,"data":1051,"type":42,"tunes":1053},{"text":1052,"level":219},"The Computer-Use Reliability Ladder",{},{"id":311,"data":1055,"type":226,"tunes":1057},{"text":1056},"A useful way to evaluate computer-use systems is to move from one-off capability toward progressively harder reliability properties. Higher levels assume the lower levels but do not follow automatically from them.",{},{"id":316,"data":1059,"type":341,"tunes":1083},{"steps":1060,"title":1082,"orientation":340},[1061,1064,1067,1070,1073,1076,1079],{"label":1062,"description":1063},"1. Capability","Can the agent complete the task at least once under known conditions?",{"label":1065,"description":1066},"2. Repeatability","Can it complete the same task consistently across repeated trials?",{"label":1068,"description":1069},"3. Environmental robustness","Does it survive timing changes, network issues, pop-ups, UI variation, and small environmental perturbations?",{"label":1071,"description":1072},"4. Long-horizon control","Can it preserve goals, constraints, and progress across many steps, applications, and delayed events?",{"label":1074,"description":1075},"5. State awareness","Can it detect when the environment changed, when hidden state matters, or when an assumption is no longer valid?",{"label":1077,"description":1078},"6. Outcome verification","Does it verify that the intended result actually happened instead of trusting its own action sequence?",{"label":1080,"description":1081},"7. Safe goal handling","Can it stop, ask, refuse, or hand control back when the goal is ambiguous, infeasible, contradictory, or high impact?","Computer-Use Reliability Ladder",{},{"id":344,"data":1085,"type":42,"tunes":1087},{"text":1086,"level":218},"Level 1 — Capability: the demo question",{},{"id":349,"data":1089,"type":226,"tunes":1091},{"text":1090},"Capability asks whether an agent can perform the task at all. This is valuable. Computer-use systems have advanced rapidly, and modern agents can complete workflows that older systems could not execute reliably.",{},{"id":354,"data":1093,"type":226,"tunes":1095},{"text":1094},"But capability is a weak deployment criterion. One successful run does not tell you whether the agent succeeds 95% of the time or 30% of the time, whether failures are harmless or destructive, or whether success depends on a lucky page state.",{},{"id":359,"data":1097,"type":42,"tunes":1099},{"text":1098,"level":218},"Level 2 — Repeatability: does the same task stay solved?",{},{"id":364,"data":1101,"type":226,"tunes":1103},{"text":1102},"Computer-use trajectories are stochastic. Model outputs vary, pages load at different speeds, visual states change, and long workflows create many branching opportunities. A production test should therefore run the same task multiple times rather than treating one passing trace as representative.",{},{"id":369,"data":1105,"type":226,"tunes":1107},{"text":1106},"Measure not only the average success rate but also the distribution of failure modes: wrong click, premature termination, missed confirmation, incorrect field, duplicate action, navigation loop, stale-state assumption, and false success report.",{},{"id":374,"data":1109,"type":42,"tunes":1111},{"text":1110,"level":218},"Level 3 — Environmental robustness: what happens when the web behaves like the web?",{},{"id":379,"data":1113,"type":226,"tunes":1115},{"text":1114},"Real websites are not benchmark fixtures. Requests fail, elements load late, sessions expire, pages change, consent banners appear, servers return errors, and network conditions fluctuate.",{},{"id":384,"data":1117,"type":226,"tunes":1119},{"text":1118},"WAREX evaluates this gap by injecting realistic web unreliability into existing benchmark environments and reports significant drops in task success. This is a critical production insight: a benchmark can measure task competence while under-measuring recovery from environmental instability.",{},{"id":389,"data":1121,"type":234,"tunes":1124},{"body":1122,"title":1123,"variant":393},"Inject delays, transient HTTP failures, stale page state, modal dialogs, session expiration, duplicate responses, and controlled UI variation. If the agent only works on the clean path, it is a demo-capable system, not a production-reliable one.","Reliability test",{},{"id":396,"data":1126,"type":42,"tunes":1128},{"text":1127,"level":218},"Level 4 — Long-horizon control: success changes when the task becomes real work",{},{"id":401,"data":1130,"type":226,"tunes":1132},{"text":1131},"Short tasks hide a class of failures that appear only after dozens or hundreds of actions: forgotten constraints, duplicated work, premature completion, missed state changes, cross-application inconsistencies, and accumulated small errors.",{},{"id":406,"data":1134,"type":226,"tunes":1136},{"text":1135},"OSWorld 2.0 was designed specifically around long-horizon real-world workflows. Its tasks take human users a median of roughly 1.6 hours and require many more tool calls than earlier computer-use benchmarks. Under its primary completion metric, even the strongest evaluated systems remain far from complete task reliability.",{},{"id":411,"data":1138,"type":226,"tunes":1140},{"text":1139},"WeaveBench reaches a similar conclusion from another angle. It evaluates hybrid GUI, CLI and code workflows and reports that the best evaluated model-runtime pairing passes only 41.2% of tasks. The important result is not one leaderboard number; it is that realistic cross-interface orchestration exposes failures hidden by simpler single-interface tasks.",{},{"id":416,"data":1142,"type":42,"tunes":1144},{"text":1143,"level":218},"Level 5 — State awareness: the environment can change underneath the plan",{},{"id":421,"data":1146,"type":226,"tunes":1148},{"text":1147},"Long-running tasks often depend on hidden or changing state: an email arrives, a calendar changes, a form is submitted, a background process finishes, a browser session expires, a user modifies a file, or an external system changes availability.",{},{"id":426,"data":1150,"type":226,"tunes":1152},{"text":1151},"Microsoft's SentinelBench argues that many long-running tasks should not be solved through continuous action at all. The correct behaviour may be to monitor, wait for an external event, then act when the state changes. This is a different capability from clicking faster or planning more steps.",{},{"id":431,"data":1154,"type":226,"tunes":1156},{"text":1155},"A reliable computer-use agent therefore needs to distinguish actionable now, waiting for state, state changed, and assumption invalidated.",{},{"id":436,"data":1158,"type":42,"tunes":1160},{"text":1159,"level":218},"Level 6 — Outcome verification: did the action actually work?",{},{"id":441,"data":1162,"type":226,"tunes":1164},{"text":1163},"An agent can execute an apparently correct sequence and still fail the task. A button click may not register. A form may reject hidden validation. A file may save to the wrong directory. A purchase may remain unconfirmed. A site may display a success-looking screen while the underlying operation failed.",{},{"id":446,"data":1166,"type":226,"tunes":1168},{"text":1167},"OpenAI's current computer-use guidance explicitly recommends bounding and verifying the run instead of relying only on the model's final answer. Microsoft Research's work on computer-use verifiers reaches the same conclusion from evaluation: process and outcome need to be judged separately.",{},{"id":451,"data":1170,"type":226,"tunes":1172},{"text":1171},"The Universal Verifier research reports that earlier verifier setups can produce high false-positive rates, while stronger rubric design and explicit separation of process, outcome, controllable failures, and uncontrollable failures substantially improve agreement with human labels.",{},{"id":456,"data":1174,"type":42,"tunes":1176},{"text":1175,"level":218},"Level 7 — Safe goal handling: the agent must know when not to continue",{},{"id":461,"data":1178,"type":226,"tunes":1180},{"text":1179},"Computer-use agents are optimized to complete goals, but goal persistence can itself become a failure mode. An ambiguous request, impossible condition, contradictory instruction, suspicious webpage, or changed environment may require clarification or stopping rather than more action.",{},{"id":466,"data":1182,"type":226,"tunes":1184},{"text":1183},"The BLIND-ACT benchmark studies this problem as Blind Goal-Directedness. Across the systems evaluated in that work, agents frequently continued pursuing tasks despite ambiguity, infeasibility, conflicting context, or other reasons to reconsider. The authors identify patterns such as execution-first bias and request primacy.",{},{"id":471,"data":1186,"type":226,"tunes":1188},{"text":1187},"This failure class matters because a highly capable agent can make a bad situation worse faster. Reliability therefore includes a policy for when not to act.",{},{"id":476,"data":1190,"type":42,"tunes":1192},{"text":1191,"level":219},"The Demo-to-Production Stress Test",{},{"id":481,"data":1194,"type":226,"tunes":1196},{"text":1195},"Before deploying a computer-use workflow, take the successful demo and systematically remove the assumptions that made it easy.",{},{"id":486,"data":1198,"type":341,"tunes":1228},{"steps":1199,"title":1227,"orientation":340},[1200,1203,1206,1209,1212,1215,1218,1221,1224],{"label":1201,"description":1202},"1. Re-run the clean task","Establish repeatability over multiple trials before adding complexity.",{"label":1204,"description":1205},"2. Perturb the environment","Add latency, retries, pop-ups, page variation, stale sessions and temporary failures.",{"label":1207,"description":1208},"3. Extend the horizon","Turn the short demo into the full real workflow with intermediate state, multiple applications and delayed steps.",{"label":1210,"description":1211},"4. Change hidden state","Modify account, file, task or external state after the agent has formed a plan and test whether it detects the change.",{"label":1213,"description":1214},"5. Inject ambiguity","Remove one important assumption and test whether the agent asks instead of guessing.",{"label":1216,"description":1217},"6. Inject a controlled contradiction","Present old and new state together and verify that authoritative current state wins.",{"label":1219,"description":1220},"7. Require outcome proof","Make task completion depend on verifiable final state, not the model's self-report.",{"label":1222,"description":1223},"8. Test consequential boundaries","Confirm that irreversible or sensitive actions trigger the expected approval, refusal or handoff.",{"label":1225,"description":1226},"9. Repeat after harness or model changes","Treat runtime upgrades as reliability changes that need regression testing.","Demo-to-Production Stress Test",{},{"id":518,"data":1230,"type":42,"tunes":1232},{"text":1231,"level":219},"Benchmark success has a validity boundary",{},{"id":523,"data":1234,"type":226,"tunes":1236},{"text":1235},"A benchmark score is a conditional statement. It is valid for a particular model, harness, environment, task set, judge, tool interface, step budget, retry policy, date and evaluation method.",{},{"id":528,"data":1238,"type":226,"tunes":1240},{"text":1239},"The number becomes misleading when those conditions disappear from the claim. “Agent X scores 80%” is weaker than “Agent X scored 80% on benchmark Y under environment Z with judge J and step budget N.” The second statement preserves the boundary that tells you whether the number transfers to your application.",{},{"id":533,"data":1242,"type":539,"tunes":1247},{"url":1243,"title":1244,"excerpt":1245,"ctaLabel":1246},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers","A framework for making explicit the conditions under which an AI claim remains valid and what changes require restriction, recalculation, or abandonment.","Read the Answer Validity Boundary",{},{"id":542,"data":1249,"type":42,"tunes":1251},{"text":1250,"level":219},"Process success and outcome success must be scored separately",{},{"id":547,"data":1253,"type":578,"tunes":1275},{"rows":1254,"title":1267,"layout":303,"columns":1268},[1255,1258,1261,1264],{"id":551,"label":1256,"values":1257},"Correct process \u002F correct outcome",[554,554,554],{"id":556,"label":1259,"values":1260},"Wrong process \u002F correct outcome",[554,554,554],{"id":560,"label":1262,"values":1263},"Correct process \u002F wrong outcome",[554,554,554],{"id":564,"label":1265,"values":1266},"Wrong process \u002F wrong outcome",[554,554,554],"Four possible outcomes of one computer-use run",[1269,1271,1273],{"id":570,"label":1270},"Process",{"id":573,"label":1272},"Outcome",{"id":576,"label":1274},"Interpretation",{},{"id":581,"data":1277,"type":226,"tunes":1279},{"text":1278},"WeaveBench reports that outcome-only grading can materially overestimate computer-use performance because an agent may produce an apparently successful artifact through a shortcut or fabricated evidence. The verifier must inspect the trajectory and deliverables, not merely the final claim.",{},{"id":586,"data":1281,"type":42,"tunes":1283},{"text":1282,"level":219},"Production reliability is a distribution, not a single pass rate",{},{"id":591,"data":1285,"type":226,"tunes":1287},{"text":1286},"A useful production evaluation samples the dimensions that actually vary in your environment. For a browser workflow, that might include account age, locale, viewport, page version, network quality, authentication state, existing cart state, cookies, pop-ups, user permissions and whether a human interrupts the run.",{},{"id":596,"data":1289,"type":303,"tunes":1327},{"content":1290,"stretched":43,"withHeadings":14},[1291,1295,1299,1303,1307,1311,1315,1319,1323],[1292,1293,1294],"Dimension","Example variation","Why it matters",[1296,1297,1298],"Environment","Fast vs slow network, transient failures, page timing","Tests recovery and waiting behaviour",[1300,1301,1302],"UI","Different viewport, modal, reordered element, minor redesign","Tests brittle visual\u002Faction assumptions",[1304,1305,1306],"State","Logged in\u002Fout, empty\u002Fnon-empty cart, existing file, changed permissions","Tests hidden-state reasoning",[1308,1309,1310],"Task horizon","5 steps vs 50+ steps, one app vs several apps","Tests accumulated trajectory error",[1312,1313,1314],"Ambiguity","Missing preference or incomplete user instruction","Tests whether the agent asks instead of guesses",[1316,1317,1318],"Consequence","Read-only vs purchase\u002Fsend\u002Fdelete\u002Fchange","Tests confirmation and authorization controls",[1320,1321,1322],"Adversarial content","Prompt injection or misleading page text","Tests instruction hierarchy and containment",[1324,1325,1326],"Model \u002F harness version","Runtime upgrade","Tests regression from system-level changes",{},{"id":637,"data":1329,"type":42,"tunes":1331},{"text":1330,"level":219},"Reliability needs a failure budget, not perfection",{},{"id":642,"data":1333,"type":226,"tunes":1335},{"text":1334},"No production system is perfectly reliable. The useful engineering question is which failures are acceptable, detectable and recoverable. A failed attempt to sort a local folder is not equivalent to sending the wrong email, purchasing the wrong product or changing an account setting.",{},{"id":647,"data":1337,"type":226,"tunes":1339},{"text":1338},"Classify actions by consequence and reversibility. Low-impact reversible actions can tolerate more autonomy. High-impact, externally visible or hard-to-reverse actions need stronger confirmation, state verification, authorization and post-action checks.",{},{"id":652,"data":1341,"type":42,"tunes":1343},{"text":1342,"level":219},"A practical computer-use reliability matrix",{},{"id":657,"data":1345,"type":303,"tunes":1371},{"content":1346,"stretched":43,"withHeadings":14},[1347,1351,1355,1359,1363,1367],[1348,1349,1350],"Action class","Example","Recommended control",[1352,1353,1354],"Read \u002F inspect","Open pages, read files, gather information","Bound scope, log sources, tolerate recoverable navigation errors",[1356,1357,1358],"Reversible local change","Edit draft file, reorganize temporary workspace","Checkpoint or version before change; verify result",[1360,1361,1362],"External communication","Send email, publish content, submit form","User confirmation or explicit delegated authority; verify accepted state",[1364,1365,1366],"Financial \u002F transactional","Purchase, checkout, paid subscription","Strict mandate, amount\u002Fmerchant constraints, final confirmation and receipt verification",[1368,1369,1370],"Destructive \u002F privilege-changing","Delete data, change permissions, revoke access","Narrow authorization, explicit confirmation, reversible path where possible, post-action audit",{},{"id":686,"data":1373,"type":42,"tunes":1375},{"text":1374,"level":219},"What to log for a computer-use failure",{},{"id":691,"data":1377,"type":708,"tunes":1392},{"meta":1378,"items":1379,"style":707},{},[1380,1381,1382,1383,1384,1385,1386,1387,1388,1389,1390,1391],"User goal and explicit constraints.","Model and harness version.","Environment and application versions.","Screenshots or structured observations relevant to the failure.","Actions taken with timestamps.","Tool, click, keyboard and navigation results.","State transitions and waiting periods.","Approval, refusal or handoff events.","External errors and network failures.","Final observable environment state.","The agent's reported outcome.","Verifier result and whether the failure was controllable by the agent.",{},{"id":711,"data":1394,"type":226,"tunes":1396},{"text":1395},"The crucial comparison is between reported success and observable success. A system that cannot distinguish those two will eventually accumulate false positives in production.",{},{"id":716,"data":1398,"type":539,"tunes":1403},{"url":1399,"title":1400,"excerpt":1401,"ctaLabel":1402},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","A broader reliability model for evaluating agent trajectories, tool use and intermediate decisions instead of accepting the final answer as proof that the system worked correctly.","Read the agent reliability article",{},{"id":724,"data":1405,"type":42,"tunes":1407},{"text":1406,"level":219},"Security is part of reliability for computer-use agents",{},{"id":729,"data":1409,"type":226,"tunes":1411},{"text":1410},"Computer-use agents do not merely read untrusted content; they can act after reading it. That turns prompt injection, malicious page content and phishing into execution-path risks.",{},{"id":734,"data":1413,"type":226,"tunes":1415},{"text":1414},"OpenAI's current computer-use guidance recommends isolating the environment, allow-listing sites and actions, treating screen content as untrusted, confirming consequential actions, bounding the run and verifying the actual outcome. ChatGPT agent similarly uses confirmations, prompt-injection monitoring and supervised modes for sensitive contexts.",{},{"id":739,"data":1417,"type":226,"tunes":1419},{"text":1418},"The architecture principle is broader than any one provider: content observed by the agent must not be allowed to redefine the user's authority. A webpage can provide data. It cannot grant permission to send data elsewhere, purchase something, change credentials or override the task boundary.",{},{"id":744,"data":1421,"type":42,"tunes":1423},{"text":1422,"level":219},"What would change this answer?",{},{"id":749,"data":1425,"type":226,"tunes":1427},{"text":1426},"The reliability gap would narrow if computer-use models became robust to long horizons, dynamic state, UI variation, environmental failures and ambiguous goals across representative production distributions. Better native state APIs, standardized machine-readable interfaces and stronger verifier infrastructure could also reduce the amount of fragile GUI interaction required.",{},{"id":754,"data":1429,"type":226,"tunes":1431},{"text":1430},"The deployment threshold also changes with task consequence. A 70% success rate can be useful for a supervised low-risk research task and unacceptable for an autonomous financial or destructive workflow. Reliability must therefore be evaluated against the cost of each failure class, not one universal pass-rate threshold.",{},{"id":759,"data":1433,"type":42,"tunes":1435},{"text":1434,"level":219},"Limitations",{},{"id":764,"data":1437,"type":226,"tunes":1439},{"text":1438},"The cited benchmarks evaluate different environments and should not be ranked against one another as if they measured the same thing. WAREX stresses web unreliability; WeaveBench targets hybrid long-horizon work; OSWorld 2.0 targets realistic long workflows; BLIND-ACT focuses on goal handling under ambiguity and infeasibility.",{},{"id":769,"data":1441,"type":226,"tunes":1443},{"text":1442},"Benchmark results also age quickly. Model, harness and verifier improvements can materially change scores within months. The durable lesson is therefore the evaluation method: vary conditions, separate process from outcome, verify external state, and preserve the boundary around each performance claim.",{},{"id":774,"data":1445,"type":42,"tunes":1447},{"text":1446,"level":219},"Conclusion",{},{"id":779,"data":1449,"type":226,"tunes":1451},{"text":1450},"Computer-use agents are already capable enough to be useful. That is exactly why the evaluation question has changed. The challenge is no longer only whether an agent can click through a workflow. It is whether the system remains dependable when the clean demo conditions disappear.",{},{"id":784,"data":1453,"type":226,"tunes":1455},{"text":1454},"Treat one successful run as evidence of capability. Then test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification and safe goal handling. A production computer-use agent is not the one that can complete the demo. It is the one whose failure boundaries are known, measured and controlled.",{},{"id":789,"data":1457,"type":42,"tunes":1459},{"text":1458,"level":219},"FAQ",{},{"id":794,"data":1461,"type":794,"tunes":1482},{"items":1462,"title":1481},[1463,1466,1469,1472,1475,1478],{"id":798,"answer":1464,"question":1465},"No. It proves capability under one observed trajectory. Production reliability requires repeated success across environmental variation, long-running tasks, changing state, ambiguity, recovery conditions and consequential actions.","Does a successful computer-use agent demo prove production reliability?",{"id":802,"answer":1467,"question":1468},"Benchmarks can use more controlled environments, shorter tasks, stable network conditions, simpler application combinations or outcome criteria that do not capture all process failures. The exact validity boundary depends on each benchmark.","Why can computer-use benchmarks look much better than real-world performance?",{"id":806,"answer":1470,"question":1471},"Verify the actual external outcome. Do not treat the agent's final statement or intended click sequence as proof that the target system accepted the operation.","What is the most important reliability check after a computer-use action?",{"id":810,"answer":1473,"question":1474},"Errors accumulate across many actions, constraints are forgotten, external state changes, work spans multiple applications, hidden state matters, and the agent must decide when to wait, ask, verify or recover rather than simply continue acting.","Why do long-horizon computer tasks remain difficult?",{"id":814,"answer":1476,"question":1477},"Repeat clean tasks, inject realistic environmental failures, vary UI and state, extend the workflow horizon, introduce ambiguity, require observable outcome proof, test high-impact action controls and rerun the suite after model or harness changes.","How should I test a browser or desktop agent before deployment?",{"id":818,"answer":1479,"question":1480},"Not for every low-risk action. Confirmation requirements should scale with consequence, reversibility, authority and uncertainty. High-impact, externally visible or difficult-to-reverse actions need stronger controls.","Should computer-use agents always require human confirmation?","Computer-use agent reliability",{},{"id":824,"data":1484,"type":42,"tunes":1486},{"text":1485,"level":219},"Glossary",{},{"id":829,"data":1488,"type":829,"tunes":1509},{"title":1489,"entries":1490},"Key reliability terms",[1491,1494,1497,1500,1503,1506],{"term":1492,"anchor":835,"definition":1493},"Computer-use agent","An AI agent that interacts with graphical user interfaces or computer environments through observations and actions such as clicking, typing, scrolling, file operations or cross-application workflows.",{"term":1495,"anchor":839,"definition":1496},"Repeatability","The degree to which an agent can complete the same task consistently across repeated runs rather than succeeding only on selected trajectories.",{"term":1498,"anchor":843,"definition":1499},"Environmental robustness","The ability to preserve correct behaviour despite realistic variation such as latency, transient errors, UI changes, session state and unexpected page conditions.",{"term":1501,"anchor":847,"definition":1502},"Outcome verification","Checking the actual external state after an action to confirm that the intended result occurred instead of relying on the agent's self-report.",{"term":1504,"anchor":851,"definition":1505},"Blind Goal-Directedness","A failure pattern in which a computer-use agent continues pursuing a goal despite ambiguity, infeasibility, contradictory conditions or reasons to stop and reassess.",{"term":1507,"anchor":855,"definition":1508},"Reliability boundary","The set of conditions under which an observed success rate or capability claim remains representative enough for a specific deployment decision.",{},{"id":859,"data":1511,"type":42,"tunes":1513},{"text":1512,"level":219},"Primary sources and further reading",{},{"id":864,"data":1515,"type":871,"tunes":1519},{"link":866,"meta":1516},{"image":1517,"title":869,"description":1518},{"url":554},"Current developer guidance on isolating environments, treating screen content as untrusted, confirming consequential actions, bounding runs and verifying outcomes.",{},{"id":874,"data":1521,"type":871,"tunes":1526},{"link":876,"meta":1522},{"image":1523,"title":1524,"description":1525},{"url":554},"OpenAI — Running Codex safely at OpenAI","Current production guidance on technical boundaries, human approval, telemetry and control for agents that act on real systems.",{},{"id":883,"data":1528,"type":871,"tunes":1532},{"link":885,"meta":1529},{"image":1530,"title":888,"description":1531},{"url":554},"2026 evaluation showing that realistic web unreliability causes significant drops in browser-agent task success on existing benchmarks.",{},{"id":892,"data":1534,"type":871,"tunes":1539},{"link":894,"meta":1535},{"image":1536,"title":1537,"description":1538},{"url":554},"Microsoft Research — The Art of Building Verifiers for Computer Use Agents","2026 work on process versus outcome evaluation, controllable versus uncontrollable failures and reliable trajectory verification.",{},{"id":901,"data":1541,"type":871,"tunes":1545},{"link":903,"meta":1542},{"image":1543,"title":906,"description":1544},{"url":554},"2026 long-horizon benchmark combining GUI, CLI and code workflows and showing a substantial gap between current agents and reliable real-world completion.",{},{"id":910,"data":1547,"type":871,"tunes":1552},{"link":912,"meta":1548},{"image":1549,"title":1550,"description":1551},{"url":554},"OSWorld 2.0 — Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","2026 benchmark focused on realistic long-horizon computer-use workflows, hidden state and cross-source reasoning.",{},{"id":919,"data":1554,"type":871,"tunes":1558},{"link":921,"meta":1555},{"image":1556,"title":924,"description":1557},{"url":554},"2026 benchmark for time-evolving tasks where agents must monitor environments and respond to state changes rather than continuously act.",{},{"id":928,"data":1560,"type":871,"tunes":1565},{"link":930,"meta":1561},{"image":1562,"title":1563,"description":1564},{"url":554},"Microsoft Research — Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness","ICLR 2026 research on agents continuing to pursue ambiguous, contradictory or infeasible goals.",{},"2.31.6","Computer-use agents can now complete impressive browser and desktop workflows, but one successful run proves capability—not reliability. This article shows how to test repeatability, environmental robustness, long-horizon control, state awareness, outcome verification, and safe goal handling.",{"lang":7,"title":208,"content":210,"contentJson":1569,"excerpt":937},{"time":212,"blocks":1570,"version":936},[1571,1574,1577,1580,1583,1586,1589,1592,1595,1598,1601,1611,1614,1617,1628,1631,1634,1637,1640,1643,1646,1649,1652,1655,1658,1661,1664,1667,1670,1673,1676,1679,1682,1685,1688,1691,1694,1697,1700,1703,1706,1709,1712,1725,1728,1731,1734,1737,1740,1756,1759,1762,1765,1778,1781,1784,1787,1790,1800,1803,1808,1811,1814,1817,1820,1823,1826,1829,1832,1835,1838,1841,1844,1847,1850,1853,1856,1866,1869,1879,1882,1887,1892,1897,1902,1907,1912,1917],{"id":215,"data":1572,"type":220,"tunes":1573},{"title":217,"maxLevel":218,"minLevel":219},{},{"id":223,"data":1575,"type":226,"tunes":1576},{"text":225},{},{"id":229,"data":1578,"type":234,"tunes":1579},{"body":231,"title":232,"variant":233},{},{"id":237,"data":1581,"type":234,"tunes":1582},{"body":239,"title":240,"variant":241},{},{"id":244,"data":1584,"type":234,"tunes":1585},{"body":246,"title":247,"variant":248},{},{"id":251,"data":1587,"type":42,"tunes":1588},{"text":253,"level":219},{},{"id":256,"data":1590,"type":226,"tunes":1591},{"text":258},{},{"id":261,"data":1593,"type":226,"tunes":1594},{"text":263},{},{"id":266,"data":1596,"type":226,"tunes":1597},{"text":268},{},{"id":271,"data":1599,"type":42,"tunes":1600},{"text":273,"level":219},{},{"id":276,"data":1602,"type":303,"tunes":1610},{"content":1603,"stretched":43,"withHeadings":14},[1604,1605,1606,1607,1608,1609],[280,281,282],[284,285,286],[288,289,290],[292,293,294],[296,297,298],[300,301,302],{},{"id":306,"data":1612,"type":42,"tunes":1613},{"text":308,"level":219},{},{"id":311,"data":1615,"type":226,"tunes":1616},{"text":313},{},{"id":316,"data":1618,"type":341,"tunes":1627},{"steps":1619,"title":308,"orientation":340},[1620,1621,1622,1623,1624,1625,1626],{"label":320,"description":321},{"label":323,"description":324},{"label":326,"description":327},{"label":329,"description":330},{"label":332,"description":333},{"label":335,"description":336},{"label":338,"description":339},{},{"id":344,"data":1629,"type":42,"tunes":1630},{"text":346,"level":218},{},{"id":349,"data":1632,"type":226,"tunes":1633},{"text":351},{},{"id":354,"data":1635,"type":226,"tunes":1636},{"text":356},{},{"id":359,"data":1638,"type":42,"tunes":1639},{"text":361,"level":218},{},{"id":364,"data":1641,"type":226,"tunes":1642},{"text":366},{},{"id":369,"data":1644,"type":226,"tunes":1645},{"text":371},{},{"id":374,"data":1647,"type":42,"tunes":1648},{"text":376,"level":218},{},{"id":379,"data":1650,"type":226,"tunes":1651},{"text":381},{},{"id":384,"data":1653,"type":226,"tunes":1654},{"text":386},{},{"id":389,"data":1656,"type":234,"tunes":1657},{"body":391,"title":392,"variant":393},{},{"id":396,"data":1659,"type":42,"tunes":1660},{"text":398,"level":218},{},{"id":401,"data":1662,"type":226,"tunes":1663},{"text":403},{},{"id":406,"data":1665,"type":226,"tunes":1666},{"text":408},{},{"id":411,"data":1668,"type":226,"tunes":1669},{"text":413},{},{"id":416,"data":1671,"type":42,"tunes":1672},{"text":418,"level":218},{},{"id":421,"data":1674,"type":226,"tunes":1675},{"text":423},{},{"id":426,"data":1677,"type":226,"tunes":1678},{"text":428},{},{"id":431,"data":1680,"type":226,"tunes":1681},{"text":433},{},{"id":436,"data":1683,"type":42,"tunes":1684},{"text":438,"level":218},{},{"id":441,"data":1686,"type":226,"tunes":1687},{"text":443},{},{"id":446,"data":1689,"type":226,"tunes":1690},{"text":448},{},{"id":451,"data":1692,"type":226,"tunes":1693},{"text":453},{},{"id":456,"data":1695,"type":42,"tunes":1696},{"text":458,"level":218},{},{"id":461,"data":1698,"type":226,"tunes":1699},{"text":463},{},{"id":466,"data":1701,"type":226,"tunes":1702},{"text":468},{},{"id":471,"data":1704,"type":226,"tunes":1705},{"text":473},{},{"id":476,"data":1707,"type":42,"tunes":1708},{"text":478,"level":219},{},{"id":481,"data":1710,"type":226,"tunes":1711},{"text":483},{},{"id":486,"data":1713,"type":341,"tunes":1724},{"steps":1714,"title":478,"orientation":340},[1715,1716,1717,1718,1719,1720,1721,1722,1723],{"label":490,"description":491},{"label":493,"description":494},{"label":496,"description":497},{"label":499,"description":500},{"label":502,"description":503},{"label":505,"description":506},{"label":508,"description":509},{"label":511,"description":512},{"label":514,"description":515},{},{"id":518,"data":1726,"type":42,"tunes":1727},{"text":520,"level":219},{},{"id":523,"data":1729,"type":226,"tunes":1730},{"text":525},{},{"id":528,"data":1732,"type":226,"tunes":1733},{"text":530},{},{"id":533,"data":1735,"type":539,"tunes":1736},{"url":535,"title":536,"excerpt":537,"ctaLabel":538},{},{"id":542,"data":1738,"type":42,"tunes":1739},{"text":544,"level":219},{},{"id":547,"data":1741,"type":578,"tunes":1755},{"rows":1742,"title":567,"layout":303,"columns":1751},[1743,1745,1747,1749],{"id":551,"label":552,"values":1744},[554,554,554],{"id":556,"label":557,"values":1746},[554,554,554],{"id":560,"label":561,"values":1748},[554,554,554],{"id":564,"label":565,"values":1750},[554,554,554],[1752,1753,1754],{"id":570,"label":571},{"id":573,"label":574},{"id":576,"label":577},{},{"id":581,"data":1757,"type":226,"tunes":1758},{"text":583},{},{"id":586,"data":1760,"type":42,"tunes":1761},{"text":588,"level":219},{},{"id":591,"data":1763,"type":226,"tunes":1764},{"text":593},{},{"id":596,"data":1766,"type":303,"tunes":1777},{"content":1767,"stretched":43,"withHeadings":14},[1768,1769,1770,1771,1772,1773,1774,1775,1776],[600,601,602],[604,605,606],[608,609,610],[612,613,614],[616,617,618],[620,621,622],[624,625,626],[628,629,630],[632,633,634],{},{"id":637,"data":1779,"type":42,"tunes":1780},{"text":639,"level":219},{},{"id":642,"data":1782,"type":226,"tunes":1783},{"text":644},{},{"id":647,"data":1785,"type":226,"tunes":1786},{"text":649},{},{"id":652,"data":1788,"type":42,"tunes":1789},{"text":654,"level":219},{},{"id":657,"data":1791,"type":303,"tunes":1799},{"content":1792,"stretched":43,"withHeadings":14},[1793,1794,1795,1796,1797,1798],[661,662,663],[665,666,667],[669,670,671],[673,674,675],[677,678,679],[681,682,683],{},{"id":686,"data":1801,"type":42,"tunes":1802},{"text":688,"level":219},{},{"id":691,"data":1804,"type":708,"tunes":1807},{"meta":1805,"items":1806,"style":707},{},[695,696,697,698,699,700,701,702,703,704,705,706],{},{"id":711,"data":1809,"type":226,"tunes":1810},{"text":713},{},{"id":716,"data":1812,"type":539,"tunes":1813},{"url":718,"title":719,"excerpt":720,"ctaLabel":721},{},{"id":724,"data":1815,"type":42,"tunes":1816},{"text":726,"level":219},{},{"id":729,"data":1818,"type":226,"tunes":1819},{"text":731},{},{"id":734,"data":1821,"type":226,"tunes":1822},{"text":736},{},{"id":739,"data":1824,"type":226,"tunes":1825},{"text":741},{},{"id":744,"data":1827,"type":42,"tunes":1828},{"text":746,"level":219},{},{"id":749,"data":1830,"type":226,"tunes":1831},{"text":751},{},{"id":754,"data":1833,"type":226,"tunes":1834},{"text":756},{},{"id":759,"data":1836,"type":42,"tunes":1837},{"text":761,"level":219},{},{"id":764,"data":1839,"type":226,"tunes":1840},{"text":766},{},{"id":769,"data":1842,"type":226,"tunes":1843},{"text":771},{},{"id":774,"data":1845,"type":42,"tunes":1846},{"text":776,"level":219},{},{"id":779,"data":1848,"type":226,"tunes":1849},{"text":781},{},{"id":784,"data":1851,"type":226,"tunes":1852},{"text":786},{},{"id":789,"data":1854,"type":42,"tunes":1855},{"text":791,"level":219},{},{"id":794,"data":1857,"type":794,"tunes":1865},{"items":1858,"title":821},[1859,1860,1861,1862,1863,1864],{"id":798,"answer":799,"question":800},{"id":802,"answer":803,"question":804},{"id":806,"answer":807,"question":808},{"id":810,"answer":811,"question":812},{"id":814,"answer":815,"question":816},{"id":818,"answer":819,"question":820},{},{"id":824,"data":1867,"type":42,"tunes":1868},{"text":826,"level":219},{},{"id":829,"data":1870,"type":829,"tunes":1878},{"title":831,"entries":1871},[1872,1873,1874,1875,1876,1877],{"term":834,"anchor":835,"definition":836},{"term":838,"anchor":839,"definition":840},{"term":842,"anchor":843,"definition":844},{"term":846,"anchor":847,"definition":848},{"term":850,"anchor":851,"definition":852},{"term":854,"anchor":855,"definition":856},{},{"id":859,"data":1880,"type":42,"tunes":1881},{"text":861,"level":219},{},{"id":864,"data":1883,"type":871,"tunes":1886},{"link":866,"meta":1884},{"image":1885,"title":869,"description":870},{"url":554},{},{"id":874,"data":1888,"type":871,"tunes":1891},{"link":876,"meta":1889},{"image":1890,"title":879,"description":880},{"url":554},{},{"id":883,"data":1893,"type":871,"tunes":1896},{"link":885,"meta":1894},{"image":1895,"title":888,"description":889},{"url":554},{},{"id":892,"data":1898,"type":871,"tunes":1901},{"link":894,"meta":1899},{"image":1900,"title":897,"description":898},{"url":554},{},{"id":901,"data":1903,"type":871,"tunes":1906},{"link":903,"meta":1904},{"image":1905,"title":906,"description":907},{"url":554},{},{"id":910,"data":1908,"type":871,"tunes":1911},{"link":912,"meta":1909},{"image":1910,"title":915,"description":916},{"url":554},{},{"id":919,"data":1913,"type":871,"tunes":1916},{"link":921,"meta":1914},{"image":1915,"title":924,"description":925},{"url":554},{},{"id":928,"data":1918,"type":871,"tunes":1921},{"link":930,"meta":1919},{"image":1920,"title":933,"description":934},{"url":554},{},"Post erfolgreich abgerufen",{"items":1924,"source":1988,"manualIds":1989,"manualMatchedIds":1990},[1925,1932,1939,1946,1953,1960,1967,1974,1981],{"id":1926,"slug":1927,"title":1928,"excerpt":1929,"featuredImage":1930,"publishedAt":1931},"478","what-is-rag-the-simplest-explanation-of-how-it-works","Что такое RAG? Самое простое объяснение того, как это работает","RAG звучит сложно, но идея проста: прежде чем ИИ ответит, он сначала находит полезную информацию из источника знаний и передаёт эту информацию языковой модели. В этом руководстве объясняются RAG, LLM, состояние, память и инструменты с помощью одной простой ментальной модели.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":1933,"slug":1934,"title":1935,"excerpt":1936,"featuredImage":1937,"publishedAt":1938},"457","should-you-buy-5g-openwrt-router-old-firmware","Стоит ли покупать 5G OpenWrt-роутер со старой прошивкой? ZBT Z8102AX как практический пример","Покупка 5G-роутера с OpenWrt на старой прошивке может иметь смысл, но только при определённых условиях. ZBT Z8102AX наглядно демонстрирует обе стороны: железо полезное, модем работает, а роутер оставался стабильным в ходе тестов, однако OpenWrt 21.02, слабая упаковка и неясные пути обновления требуют взвешенного решения о покупке.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1940,"slug":1941,"title":1942,"excerpt":1943,"featuredImage":1944,"publishedAt":1945},"472","why-more-context-can-make-ai-answers-worse","Почему больше контекста может ухудшить ответы ИИ","Большее контекстное окно не гарантирует более качественного ответа. В этой статье объясняется, как размывание сигнала, противоречивые данные, устаревшее состояние, чувствительность к позиции и сжатие с потерями могут снизить надежность ИИ — и предлагается практический стресс-тест контекста.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z",{"id":1947,"slug":1948,"title":1949,"excerpt":1950,"featuredImage":1951,"publishedAt":1952},"471","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","Как узнать, действительно ли ИИ-агент использовал правильные доказательства","ИИ-агент может ссылаться на источники и при этом использовать неверные доказательства. В этой статье представлен практический метод проверки обоснованности утверждений, авторитетности источников, применимости, происхождения и того, действительно ли доказательства повлияли на ответ.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","2026-09-25T11:47:00.000Z",{"id":1954,"slug":1955,"title":1956,"excerpt":1957,"featuredImage":1958,"publishedAt":1959},"459","ollama-is-not-the-product-building-production-ready-open-llm-applications","Ollama — это не продукт: создание готовых к продакшену приложений на базе открытых LLM","Запустить локальную модель с Ollama просто. Создать готовое к продакшену Open-LLM-приложение сложнее: для этого требуются RAG, контроль доступа, абстракция провайдеров, оценка, логирование, дисциплина развертывания и контролируемый уровень приложения вокруг модели.","\u002Fuploads\u002F2026\u002F06\u002Follama-is-not-the-product-building-production-ready-open-llm-applications-1782679361640-h0usqf.webp","2026-06-28T16:39:00.000Z",{"id":1961,"slug":1962,"title":1963,"excerpt":1964,"featuredImage":1965,"publishedAt":1966},"460","ai-agent-reliability-why-the-final-answer-is-not-enough","Надёжность ИИ-агентов: почему финального ответа недостаточно","Правильный вывод не доказывает правильность рассуждений, безопасность выполнения или надежность системы.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-reliability-why-the-final-answer-is-not-enough-1788955466306-pl0qhz.webp","2026-09-09T04:01:00.000Z",{"id":1968,"slug":1969,"title":1970,"excerpt":1971,"featuredImage":1972,"publishedAt":1973},"474","migrating-from-openai-agents-sdk-to-the-agents-api-what-actually-changes-architecturally","Миграция с OpenAI Agents SDK на Agents API: что на самом деле меняется архитектурно?","Переход с OpenAI Agents SDK на новый Agents API — это не просто переименование импорта. Меняется граница среды выполнения: цикл агента, долговечная сессия, оркестрация, сжатие контекста и восстановление смещаются в сторону управляемой обвязки. Это руководство показывает, что следует перенести, что должно остаться в вашем приложении и как подтвердить миграцию до переключения.","\u002Fuploads\u002F2026\u002F09\u002Fmigrating-from-openai-agents-sdk-to-the-agents-api-what-actually-changes-architecturally-1790352171968-ienxr9.webp","2026-09-25T12:01:00.000Z",{"id":1975,"slug":1976,"title":1977,"excerpt":1978,"featuredImage":1979,"publishedAt":1980},"364","tipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung","Освоение рабочего процесса SEO: Основные стратегии оптимизации для органического роста","Структурированный рабочий процесс SEO крайне важен для устойчивого органического роста. Изучите десять основополагающих стратегий, от исследования ключевых слов и технической оптимизации до качества контента и анализа производительности.","\u002Fuploads\u002F2026\u002F03\u002Ftipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung-1774866098131-hwkzrg.webp","2024-01-26T06:35:00.000Z",{"id":1982,"slug":1983,"title":1984,"excerpt":1985,"featuredImage":1986,"publishedAt":1987},"469","rag-failed-but-which-layer-actually-failed-a-diagnostic-method","RAG не сработал — но какой именно слой на самом деле отказал? Метод диагностики","Когда ответ RAG неверен, обвинять поиск или модель — слишком расплывчато. Этот диагностический метод изолирует покрытие источников, построение запроса, поиск, ранжирование, сборку контекста, генерацию, атрибуцию доказательств и актуальность — так что фактический сбой можно воспроизвести и исправить.","\u002Fuploads\u002F2026\u002F09\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method-1790350847177-pior4c.webp","2026-09-24T19:39:00.000Z","fallback",[],[]]