[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:es":3,"public-menus:all":38,"post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:es":205,"related:post:how-to-know-whether-an-ai-agent-actually-used-the-right-evidence:es:1":1715},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","es","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1714},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":852,"featuredImage":853,"featuredImageAlt":854,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":855,"publishedAt":856,"createdAt":857,"updatedAt":858,"seoLocalePaths":859,"categories":868,"author":881,"translations":886},"471","Cómo saber si un agente de IA realmente utilizó la evidencia correcta","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Contenido\">\u003Cstrong class=\"editorjs-toc__title\">Contenido\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-5\" class=\"editorjs-toc__link\">Por qué las citas no son suficientes\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-8\" class=\"editorjs-toc__link\">Las cuatro preguntas que toda afirmación relevante debe superar\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">1. Respaldo de la afirmación: ¿fundamenta la fuente lo que afirma el agente?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-13\" class=\"editorjs-toc__link\">2. Autoridad de la evidencia: ¿es el tipo de fuente adecuado?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-16\" class=\"editorjs-toc__link\">3. Aplicabilidad: evidencia correcta, condiciones incorrectas\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-20\" class=\"editorjs-toc__link\">4. Uso de la evidencia: ¿realmente se basó el agente en la evidencia?\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-23\" class=\"editorjs-toc__link\">La prueba de utilización de la evidencia\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-27\" class=\"editorjs-toc__link\">Una matriz de afirmación-evidencia es más útil que una lista de fuentes\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-30\" class=\"editorjs-toc__link\">Separar la calidad de la recuperación de la calidad de la evidencia\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">Evaluar la calidad de la fuente como una rúbrica, no como una lista blanca de dominios\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-36\" class=\"editorjs-toc__link\">Cobertura de la evidencia: cada afirmación importante necesita respaldo, no cada oración\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-39\" class=\"editorjs-toc__link\">La procedencia de la evidencia debe sobrevivir a la síntesis y a la memoria\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-42\" class=\"editorjs-toc__link\">Un registro práctico de evidencia\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-44\" class=\"editorjs-toc__link\">Modos de fallo que parecen fundamentados pero no lo están\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-46\" class=\"editorjs-toc__link\">Cómo evaluar al agente en producción\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-49\" class=\"editorjs-toc__link\">No permita que un juez LLM sea el único evaluador de evidencia\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-52\" class=\"editorjs-toc__link\">¿Qué cambiaría esta respuesta?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-56\" class=\"editorjs-toc__link\">Limitaciones\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-59\" class=\"editorjs-toc__link\">Conclusión\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-64\" class=\"editorjs-toc__link\">Preguntas frecuentes\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-66\" class=\"editorjs-toc__link\">Glosario\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-68\" class=\"editorjs-toc__link\">Fuentes primarias y lecturas adicionales\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>Un agente de IA puede citar fuentes, recuperar documentos y, aun así, utilizar la evidencia equivocada. Una fuente puede ser fidedigna pero irrelevante para la afirmación exacta. Un fragmento recuperado puede respaldar solo una parte de la respuesta. Una fuente correcta puede estar obsoleta, desactualizada o ser válida para una jurisdicción, versión de producto, usuario o estado del sistema incorrectos. Esto genera un problema de evaluación más complejo que la simple verificación de citas: ¿utilizó realmente el agente la evidencia adecuada para la afirmación realizada?\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Respuesta directa\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Para saber si un agente de IA utilizó la evidencia adecuada, evalúe la cadena &lt;strong&gt;Afirmación → Evidencia → Aplicabilidad → Uso&lt;\u002Fstrong&gt;. Para cada afirmación relevante, verifique que la evidencia la respalde directamente, provenga de una autoridad apropiada, se aplique a las condiciones actuales y haya estado realmente disponible para el agente antes de generar la afirmación. Una cita por sí sola no demuestra ninguna de estas cosas.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Acerca del método\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">El modelo Afirmación–Evidencia–Aplicabilidad–Uso y la Prueba de utilización de evidencia descritos en este artículo son métodos de evaluación prácticos, no estándares formales de la industria. Se basan en conceptos consolidados como fundamentación (groundedness), calidad de las fuentes, cobertura de citas, evaluación de trazas y evaluaciones específicas de la tarea.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-5\">Por qué las citas no son suficientes\u003C\u002Fh2>\n\u003Cp>Una cita responde únicamente a una pregunta acotada: si el sistema asoció una afirmación o respuesta con una fuente. No determina automáticamente que la fuente respalde la afirmación específica, que sea lo suficientemente fidedigna para la tarea, que el pasaje citado contenga la condición o excepción necesaria, o que el modelo se haya basado en esa evidencia en lugar de generar la respuesta a partir de su conocimiento previo.\u003C\u002Fp>\n\u003Cp>La guía de Anthropic para la evaluación de agentes de investigación separa explícitamente la fundamentación, la cobertura y la calidad de las fuentes. De manera similar, la guía de evaluación de agentes de OpenAI enfatiza las trazas porque el resultado final no revela si el agente seleccionó las herramientas adecuadas o siguió el flujo de trabajo previsto. Estas ideas apuntan a una conclusión más amplia: la calidad de la evidencia es una propiedad de la ruta de ejecución, no solo del texto final.\u003C\u002Fp>\n\u003Ch2 id=\"section-8\">Las cuatro preguntas que toda afirmación relevante debe superar\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Dimensión\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Pregunta\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Fallo típico\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Respaldo de la afirmación\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">¿La evidencia respalda directamente esta afirmación exacta?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La fuente está relacionada temáticamente, pero no fundamenta la afirmación\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autoridad de la evidencia\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">¿Es esta una fuente apropiada para este tipo de afirmación?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Se utiliza un resumen secundario donde se requiere una fuente primaria o un sistema en vivo\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Aplicabilidad\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">¿Se aplica la evidencia a este momento, versión, jurisdicción, usuario, estado o población?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Se aplica una afirmación verdadera fuera de sus condiciones válidas\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Uso de la evidencia\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">¿Estuvo esta evidencia realmente disponible y se utilizó en la ruta de ejecución del agente?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La respuesta final es correcta, pero la evidencia recuperada era irrelevante o no se utilizó\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch3 id=\"section-10\">1. Respaldo de la afirmación: ¿fundamenta la fuente lo que afirma el agente?\u003C\u002Fh3>\n\u003Cp>La evidencia debe evaluarse a nivel de afirmación. Un documento puede ser relevante para el tema y, aun así, no respaldar una declaración específica. Si una fuente señala que una función está disponible en regiones seleccionadas, la respuesta «la función está disponible a nivel global» carece de respaldo, aunque la cita parezca verosímil.\u003C\u002Fp>\n\u003Cp>Aquí es donde las valoraciones generales de «fundamentado \u002F no fundamentado» suelen ser demasiado imprecisas. Divida la respuesta en afirmaciones relevantes, asocie cada afirmación con el fragmento de evidencia más pequeño que la respalde y clasifique la relación: respaldo directo, respaldo parcial, contradicción o sin respaldo.\u003C\u002Fp>\n\u003Ch3 id=\"section-13\">2. Autoridad de la evidencia: ¿es el tipo de fuente adecuado?\u003C\u002Fh3>\n\u003Cp>La selección correcta de la evidencia no consiste únicamente en la relevancia semántica. La fuente debe ser adecuada para la decisión. El estado actual de una cuenta debe provenir del sistema de cuentas, no de un correo electrónico antiguo. Una afirmación sobre el comportamiento de una API debería contrastarse preferiblemente con la documentación actual del proveedor o con un comportamiento reproducible. Un requisito legal puede requerir la ley aplicable, el organismo regulador o directrices oficiales en lugar de una publicación genérica de un blog.\u003C\u002Fp>\n\u003Cp>La autoridad de la fuente depende de la tarea específica. Un informe de la comunidad puede ser la mejor evidencia para un error real que la documentación del proveedor no reconoce. Un comunicado del proveedor puede ser fidedigno respecto a lo que este afirma, pero constituir una evidencia débil sobre el rendimiento independiente. Por lo tanto, el evaluador necesita una jerarquía de fuentes explícita para la tarea en lugar de una puntuación de autoridad universal.\u003C\u002Fp>\n\u003Ch3 id=\"section-16\">3. Aplicabilidad: evidencia correcta, condiciones incorrectas\u003C\u002Fh3>\n\u003Cp>Los errores de evidencia más peligrosos a menudo no provienen de fuentes inventadas, sino de fuentes válidas utilizadas fuera de sus límites. Una recomendación puede cambiar según la versión del software, la fecha, la jurisdicción, la revisión del hardware, los permisos del usuario, la disponibilidad del producto, el estado actual del juego, la configuración del inquilino (tenant) u otras variables del entorno.\u003C\u002Fp>\n\u003Cp>Para cada fuente relevante, conserve las condiciones que determinan si aún resulta aplicable. Esto es especialmente importante tras una síntesis: una memoria comprimida o una cita puede preservar la conclusión al tiempo que omite la excepción, la fecha o el requisito previo que validaba dicha conclusión.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">La evidencia puede ser auténtica y aun así ser incorrecta para la respuesta\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Una fuente real, citada con precisión, aún puede producir una respuesta incorrecta cuando su temporalidad, versión, población, jurisdicción o estado no coinciden con la pregunta actual.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-20\">4. Uso de la evidencia: ¿realmente se basó el agente en la evidencia?\u003C\u002Fh3>\n\u003Cp>Una respuesta puede ser correcta incluso cuando la recuperación falló. El modelo ya puede conocer la respuesta, inferirla de un contexto no relacionado o simplemente acertar por casualidad. Si la evaluación comprueba únicamente la corrección final, el sistema puede parecer bien fundamentado mientras que la ruta de la evidencia está rota.\u003C\u002Fp>\n\u003Cp>Para evaluar el uso de la evidencia, inspeccione la traza. Confirme qué fuentes se recuperaron, qué pasajes llegaron al contexto del modelo, cuándo estuvieron disponibles y si la afirmación final puede explicarse mediante esas entradas. Las herramientas actuales de evaluación de agentes de OpenAI enfatizan la calificación de trazas precisamente porque el comportamiento a nivel de flujo de trabajo no se puede reconstruir de manera confiable solo a partir de la respuesta final.\u003C\u002Fp>\n\u003Ch2 id=\"section-23\">La prueba de utilización de la evidencia\u003C\u002Fh2>\n\u003Cp>Se puede construir una evaluación práctica como un contrafáctico controlado. En lugar de preguntar únicamente si la respuesta es correcta, cambie la evidencia y observe si la afirmación cambia en la dirección esperada.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Prueba de utilización de la evidencia\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Seleccionar una afirmación relevante\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Elija una afirmación cuya exactitud sea importante y defina la respuesta esperada con precisión.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Identificar la evidencia de referencia\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Proporcione el conjunto de evidencia autorizada más pequeño que sea suficiente para respaldar la afirmación.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Ejecutar con la evidencia de referencia\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Verifique que el agente produzca la respuesta respaldada cuando la evidencia correcta esté disponible.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Eliminar la evidencia decisiva\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Ejecute la misma tarea sin el pasaje de respaldo clave mientras mantiene estables las demás entradas.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Reemplazarla con evidencia contradictoria o sustitutiva\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Siempre que sea seguro, proporcione evidencia controlada que cambie la conclusión correcta.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Comparar las afirmaciones\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Compruebe si la respuesta sigue el cambio de evidencia o permanece anclada al conocimiento previo del modelo.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Inspeccionar la traza\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Confirme qué se recuperó, qué llegó al contexto y qué fuente o resultado de herramienta precedió a la afirmación.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">La señal clave\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Si la evidencia decisiva cambia pero la afirmación del agente no, usted tiene pruebas de que el sistema podría no estar usando la recuperación según lo previsto, incluso cuando la respuesta original haya sido correcta.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-27\">Una matriz de afirmación-evidencia es más útil que una lista de fuentes\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Afirmación\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Evidencia\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Respaldo\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Autoridad\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Aplicabilidad\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Utilizado en la traza\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La función X está disponible\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Documentación del proveedor\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Directo\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Alta para afirmaciones de disponibilidad\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La versión actual y la región deben coincidir\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sí \u002F No\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La configuración Y es más rápida\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Benchmark del proveedor\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Parcial\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Alta para la prueba del proveedor, no para rendimiento independiente\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">El hardware y la carga de trabajo deben coincidir\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sí \u002F No\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La política se aplica a este usuario\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Política actual + estado de la cuenta\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Directo solo cuando se combinan\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Alta\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La jurisdicción, fecha, rol y estado de la cuenta deben coincidir\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sí \u002F No\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Un producto está en stock\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">API de inventario en tiempo real\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Directo\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autorizada para el stock actual\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Caduca rápidamente\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sí \u002F No\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Esta matriz plantea varias preguntas que la verificación convencional de citas oculta. Una afirmación puede requerir múltiples fuentes. Una fuente puede respaldar solo una parte de una afirmación. Una fuente autorizada puede tener una ventana de validez corta. Y una fuente perfectamente válida puede ser irrelevante si nunca ingresó a la ruta de ejecución.\u003C\u002Fp>\n\u003Ch2 id=\"section-30\">Separar la calidad de la recuperación de la calidad de la evidencia\u003C\u002Fh2>\n\u003Cp>Las métricas de recuperación evalúan si se encontró y clasificó el material relevante. La evaluación de la evidencia analiza si ese material justifica las afirmaciones resultantes. Ambas están relacionadas pero no son idénticas.\u003C\u002Fp>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">El éxito en la recuperación no es el éxito en la evidencia\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Situación\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Recuperación\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Calidad de la evidencia\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Documento correcto, afirmación incorrecta\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Dato correcto, fuente desactualizada\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Fuente débil, respuesta correcta\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Múltiples fuentes requeridas\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-33\">Evaluar la calidad de la fuente como una rúbrica, no como una lista blanca de dominios\u003C\u002Fh2>\n\u003Cp>Las listas fijas de \"dominios de confianza\" son tentadoras pero a menudo frágiles. En cambio, la calidad de la fuente debe reflejar el tipo de afirmación. Las dimensiones útiles incluyen el estatus primario o secundario, la actualidad, la inmediatez, la reproducibilidad, la independencia, la experiencia en el dominio, la procedencia de los datos, la cadencia de actualización y si la fuente tiene incentivos para exagerar la afirmación.\u003C\u002Fp>\n\u003Cp>La guía de evaluación de agentes de investigación de Anthropic señala explícitamente las comprobaciones de calidad de la fuente junto con la fundamentación y la cobertura. Por lo tanto, la implementación práctica debe calificar tanto lo que dice la fuente como si dicha fuente es apropiada para este tipo de declaración.\u003C\u002Fp>\n\u003Ch2 id=\"section-36\">Cobertura de la evidencia: cada afirmación importante necesita respaldo, no cada oración\u003C\u002Fh2>\n\u003Cp>No todas las oraciones necesitan una cita. El lenguaje de transición, la aritmética derivada de forma transparente a partir de valores citados o una interpretación claramente señalada pueden no requerir una fuente independiente. Sin embargo, cada afirmación relevante y verificable externamente debe contar con el respaldo suficiente para que un evaluador pueda reconstruir por qué se le permitió al agente expresarla.\u003C\u002Fp>\n\u003Cp>Por lo tanto, la cobertura debe ponderarse según la importancia de la afirmación. La falta de respaldo para un detalle decorativo no equivale a la falta de respaldo para un precio, una decisión de elegibilidad, una instrucción de seguridad, un requisito legal, una declaración de compatibilidad técnica o un hecho que fundamente una recomendación.\u003C\u002Fp>\n\u003Ch2 id=\"section-39\">La procedencia de la evidencia debe sobrevivir a la síntesis y a la memoria\u003C\u002Fh2>\n\u003Cp>Los agentes de ejecución prolongada a menudo resumen el trabajo previo o registran memorias duraderas. Si la procedencia de la evidencia se elimina durante esa transformación, los agentes futuros pueden recuperar una conclusión clara sin saber si provino de una declaración del usuario, una API en tiempo real, un documento antiguo, una inferencia del modelo o un resultado web no verificado.\u003C\u002Fp>\n\u003Cp>Para hechos importantes, conserve al menos la identidad de la fuente, la hora de recuperación u observación, el tipo de evidencia, la versión o estado relevante, y si el texto almacenado está citado, resumido, inferido o derivado. La procedencia es lo que permite que un agente posterior decida si se debe confiar en la evidencia, actualizarla, restringirla o descartarla.\u003C\u002Fp>\n\u003Ch2 id=\"section-42\">Un registro práctico de evidencia\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Campo\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Propósito\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">claim_id\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Identifica la afirmación relevante que se está respaldando\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_id \u002F source_url \u002F system\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Identifica de dónde provino la evidencia\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">evidence_span\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Conserva el fragmento, registro o resultado de herramienta más pequeño que respalda la afirmación\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">retrieved_at \u002F observed_at\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Permite verificar la actualidad y la cronología\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">source_version \u002F object_version\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Permite comprobar la sustitución y la reproducibilidad\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">authority_role\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Explica por qué esta fuente es adecuada para esta afirmación\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">applicability\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Almacena la fecha relevante, jurisdicción, versión del producto, usuario, inquilino, estado u otras condiciones\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">transformation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Indica si la evidencia es sin procesar, citada, resumida, normalizada o derivada\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">trace_step\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Muestra cuándo estuvo disponible la evidencia para el agente\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">support_status\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Directo, parcial, contradictorio, no respaldado o incierto\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-44\">Modos de fallo que parecen fundamentados pero no lo están\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Modo de fallo\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Por qué engaña a los evaluadores\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Qué evaluar\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Decoración de citas\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La respuesta contiene fuentes, por lo que parece investigada\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Mapear cada afirmación relevante a un fragmento de respaldo exacto\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Discrepancia de autoridad\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La fuente es confiable pero no tiene autoridad para el hecho específico\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Definir una jerarquía de fuentes específica para la afirmación\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Discrepancia temporal\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La fuente era correcta en el momento de su publicación\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Verificar la fecha de recuperación, la fecha de la fuente y la evidencia que la sustituye\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eliminación de condiciones\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Un resumen conserva la conclusión pero omite las excepciones\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Comparar la afirmación generada con el contexto local completo de la fuente\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Cita a posteriori\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Se adjunta una fuente plausible después de generar la respuesta\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Inspeccionar el orden de la traza y verificar si la evidencia precedió a la afirmación\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Anulación paramétrica\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">El modelo ignora la evidencia recuperada y responde a partir de su conocimiento previo\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ejecutar pruebas contrafácticas de utilización de evidencia\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Blanqueo de evidencia\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La inferencia del modelo se resume y luego se almacena como si fuera un hecho de la fuente\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Preservar el tipo de transformación y la procedencia a través de las escrituras en la memoria\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Falacia de la mayoría de fuentes\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Varias páginas secundarias repiten la misma afirmación sin respaldo\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Rastrear las afirmaciones hasta la evidencia primaria o independiente\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-46\">Cómo evaluar al agente en producción\u003C\u002Fh2>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Canalización de evaluación de evidencia\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Definir afirmaciones relevantes\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identificar los hechos, recomendaciones o decisiones cuya exactitud es crucial para la tarea.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Crear evidencia de referencia\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Establecer evidencia de referencia y expectativas de calidad de las fuentes para casos representativos.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Capturar trazas\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Registrar consultas de recuperación, llamadas a herramientas, evidencia devuelta, construcción del contexto, respuestas del modelo y citas.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Calificar el respaldo\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Comprobar si cada afirmación relevante está respaldada de forma directa, parcial, contradictoria o si carece de respaldo.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Calificar autoridad y aplicabilidad\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Evaluar si la fuente es apropiada y si sus condiciones coinciden con la tarea actual.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Ejecutar contrafácticos\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Eliminar, reemplazar o sustituir evidencia decisiva y verificar si la respuesta se adapta al cambio.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Revisar fallos de alto impacto\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Recurrir a la revisión humana o de expertos en el dominio cuando la calificación automatizada no sea lo suficientemente confiable.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Convertir fallos en casos de evaluación\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Incorporar fallos de producción y casos límite a un conjunto de datos de regresión reproducible.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>La guía de evaluación actual de OpenAI recomienda evaluaciones específicas para cada tarea, evaluación continua, conjuntos de datos derivados de producción y trazas para depurar el comportamiento de los agentes. Del mismo modo, Anthropic aconseja combinar tipos de evaluadores para agentes de investigación, dado que la corrección, la calidad de las fuentes, la cobertura y la fundamentación son dimensiones independientes. La evaluación de la evidencia debe seguir el mismo patrón: varios evaluadores específicos resultan más diagnósticos que una única puntuación de \"calidad\" opaca.\u003C\u002Fp>\n\u003Ch2 id=\"section-49\">No permita que un juez LLM sea el único evaluador de evidencia\u003C\u002Fh2>\n\u003Cp>Los evaluadores basados en LLM son útiles para la clasificación escalable de afirmaciones, verificaciones de relevancia y comparaciones por pares, pero pueden compartir los mismos puntos ciegos que el sistema que evalúan. Un evaluador puede aceptar una afirmación plausible pero no respaldada, pasar por alto un límite sutil entre versiones o sobrevalorar una fuente bien redactada.\u003C\u002Fp>\n\u003Cp>La guía de evaluación de OpenAI recomienda calibrar los evaluadores automatizados con el juicio humano y utilizar criterios claros y delimitados. En sistemas que hacen un uso intensivo de evidencia, deben aplicarse comprobaciones deterministas siempre que sea posible: marcas de tiempo, versiones de objetos, alcance de permisos, identificadores de fuente exactos, orden de recuperación, hashes de documentos y si la evidencia estaba presente antes de que el modelo generara la afirmación.\u003C\u002Fp>\n\u003Ch2 id=\"section-52\">¿Qué cambiaría esta respuesta?\u003C\u002Fh2>\n\u003Cp>La evaluación puede ser más sencilla cuando el agente opera sobre un corpus pequeño, inmutable y fidedigno, y cada respuesta es estrictamente extractiva. En ese entorno, la autoridad y la aplicabilidad de las fuentes son en su mayoría fijas, y el respaldo de la afirmación mediante fragmentos de texto puede ser suficiente.\u003C\u002Fp>\n\u003Cp>La evaluación debe volverse más rigurosa cuando el agente combina búsquedas web, memoria a largo plazo, herramientas en tiempo real, múltiples jurisdicciones, información que cambia con rapidez, estados específicos del usuario o acciones autónomas. En esos sistemas, la validez de la evidencia no solo depende del texto de origen, sino también de cuándo y cómo se obtuvo dicha evidencia.\u003C\u002Fp>\n\u003Cp>Los modelos futuros pueden volverse mejores rastreando internamente la procedencia y la incertidumbre, pero eso no eliminaría la necesidad de registros de evidencia externos en sistemas que requieren auditabilidad. Un sistema no debería depender del autoinforme del modelo sobre qué influyó en él cuando las trazas y los metadatos de las fuentes pueden proporcionar evidencia más sólida.\u003C\u002Fp>\n\u003Ch2 id=\"section-56\">Limitaciones\u003C\u002Fh2>\n\u003Cp>No siempre es posible demostrar el uso causal de la evidencia solo a partir de las trazas. Una fuente puede estar presente en el contexto sin influir en la respuesta, y un modelo puede conocer de forma independiente el mismo hecho. Las pruebas contrafácticas refuerzan la inferencia, pero pueden alterar por sí mismas la distribución de la tarea.\u003C\u002Fp>\n\u003Cp>La autoridad de las fuentes también puede ser discutible o depender del dominio. Algunas preguntas no tienen una única fuente autorizada y los expertos pueden estar en desacuerdo sobre qué evidencia merece mayor peso. En esos casos, el evaluador debe preservar el desacuerdo y puntuar la transparencia, la cobertura y el razonamiento frente a una rúbrica explícita en lugar de pretender que existe una única fuente de verdad incuestionable.\u003C\u002Fp>\n\u003Ch2 id=\"section-59\">Conclusión\u003C\u002Fh2>\n\u003Cp>La pregunta “¿citó una fuente el agente?” es demasiado débil para la IA en producción. La pregunta más sólida es: ¿provino cada afirmación importante de evidencia que realmente la respalda, tiene la autoridad adecuada, sigue siendo aplicable a las condiciones actuales y estuvo disponible en la ruta de ejecución antes de que se formulara la afirmación?\u003C\u002Fp>\n\u003Cp>Eso convierte la evidencia de un mero adorno en una propiedad evaluable del sistema. Capture la traza. Asocie las afirmaciones con la evidencia. Compruebe la autoridad y la aplicabilidad. Ejecute pruebas de evidencia contrafácticas. Preserve la procedencia a través de resúmenes y memoria. Así, una respuesta correcta no solo es plausible: cuenta con una ruta de evidencia que se puede inspeccionar.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Fiabilidad de los agentes de IA: por qué la respuesta final no es suficiente\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">La corrección del resultado por sí sola no puede demostrar que la ruta de ejecución de un agente haya sido segura o fiable. Este artículo relacionado explica por qué las trayectorias, las herramientas y las decisiones intermedias importan.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Leer el artículo relacionado →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Del protocolo de investigación a un marco general de razonamiento en IA\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Un método práctico de razonamiento para separar la evidencia, las suposiciones, las hipótesis contrapuestas y la validación específica del dominio.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Leer el marco de razonamiento →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-64\">Preguntas frecuentes\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Evaluación del uso de evidencia en agentes de IA\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">¿Una cita demuestra que una respuesta de IA está fundamentada?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">No. Una cita puede ser relevante para el tema sin respaldar la afirmación exacta, puede provenir de una autoridad inadecuada, puede haber dejado de ser aplicable o puede haberse adjuntado sin influir materialmente en la respuesta generada.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">¿Cómo puedo comprobar si un agente de IA realmente utilizó la evidencia recuperada?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Utilice una prueba contrafáctica de utilización de evidencia: ejecute la tarea con evidencia que se sabe correcta y, a continuación, elimine o reemplace la evidencia decisiva manteniendo estables las demás entradas. Si la respuesta no reacciona al cambio de evidencia, inspeccione si el modelo se está basando en conocimientos previos o en otra fuente.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">¿Cuál es la diferencia entre fundamentación y calidad de la fuente?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">La fundamentación examina si las afirmaciones están respaldadas por la evidencia proporcionada. La calidad de la fuente evalúa si la evidencia en sí misma es adecuada y lo suficientemente autorizada para el tipo de afirmación formulada.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">¿Por qué una fuente real aún puede producir una respuesta incorrecta de la IA?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">La fuente puede estar desactualizada, haber sido sustituida, ser válida para otra versión, jurisdicción, usuario, población o estado del sistema, o puede contener condiciones que se perdieron durante la recuperación o el resumen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">¿Qué debería registrar para la evaluación de la evidencia?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Registre la consulta de recuperación, las fuentes obtenidas, los fragmentos exactos de evidencia, las marcas de tiempo y versiones, los filtros, el contexto final, la salida del modelo, las citas y el orden cronológico de la traza para que los evaluadores puedan reconstruir qué evidencia estaba disponible antes de cada afirmación sustancial.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-66\">Glosario\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Términos clave en la evaluación de evidencia\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"claim-support\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Respaldo de la afirmación\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">El grado en que un fragmento de evidencia específico fundamenta directamente una afirmación generada.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-authority\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Autoridad de la evidencia\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">La idoneidad de una fuente para respaldar un tipo concreto de afirmación, en función de su rol, procedencia y relación con el hecho subyacente.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"applicability\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Aplicabilidad\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Las condiciones bajo las cuales la evidencia sigue siendo válida para una afirmación, incluidos el tiempo, la versión, la jurisdicción, el usuario, la población, el estado del sistema u otros límites.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"evidence-utilization\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Utilización de evidencia\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Si el resultado generado por el agente responde realmente y depende de la evidencia facilitada en su ruta de ejecución.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"counterfactual-evidence-test\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Prueba contrafáctica de evidencia\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Una evaluación que elimina, sustituye o modifica evidencia decisiva para comprobar si la afirmación del agente cambia de forma coherente.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"provenance\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Procedencia\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Metadatos que registran de dónde provino la evidencia, cuándo se obtuvo, cómo se transformó y qué versión o estado representaba.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-68\">Fuentes primarias y lecturas adicionales\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Evaluate Agent Workflows\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Orientación sobre la calificación de trazas, evaluación a nivel de flujo de trabajo, conjuntos de datos y ejecuciones de evaluación reproducibles para agentes.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Evaluation Best Practices\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Orientación sobre evaluaciones específicas para tareas, conjuntos de datos derivados de producción, métricas acotadas, evaluación continua y calibración de calificadores.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Anthropic — Demystifying Evals for AI Agents\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Guía de evaluación de agentes que incluye comprobaciones de fundamentación, cobertura y calidad de fuentes para agentes de investigación.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Guía de evaluación que subraya que el rendimiento de los agentes modernos depende del flujo de trabajo y del entorno, no solo del resultado final del modelo.\u003C\u002Fp>\u003C\u002Fa>",{"time":212,"blocks":213,"version":851},1790368201237,[214,222,228,236,243,248,253,258,263,289,294,299,304,309,314,319,324,329,334,341,346,351,356,361,366,395,402,407,442,447,452,457,491,496,501,506,511,516,521,526,531,536,541,579,584,625,630,660,665,670,675,680,685,690,695,700,705,710,715,720,725,730,739,747,752,778,783,809,814,824,833,842],{"id":215,"data":216,"type":220,"tunes":221},"0hk9UtwqZf",{"title":217,"maxLevel":218,"minLevel":219},"Contenido",3,2,"tableOfContents",{},{"id":223,"data":224,"type":226,"tunes":227},"intro",{"text":225},"Un agente de IA puede citar fuentes, recuperar documentos y, aun así, utilizar la evidencia equivocada. Una fuente puede ser fidedigna pero irrelevante para la afirmación exacta. Un fragmento recuperado puede respaldar solo una parte de la respuesta. Una fuente correcta puede estar obsoleta, desactualizada o ser válida para una jurisdicción, versión de producto, usuario o estado del sistema incorrectos. Esto genera un problema de evaluación más complejo que la simple verificación de citas: ¿utilizó realmente el agente la evidencia adecuada para la afirmación realizada?","paragraph",{},{"id":229,"data":230,"type":234,"tunes":235},"direct",{"body":231,"title":232,"variant":233},"Para saber si un agente de IA utilizó la evidencia adecuada, evalúe la cadena \u003Cstrong>Afirmación → Evidencia → Aplicabilidad → Uso\u003C\u002Fstrong>. Para cada afirmación relevante, verifique que la evidencia la respalde directamente, provenga de una autoridad apropiada, se aplique a las condiciones actuales y haya estado realmente disponible para el agente antes de generar la afirmación. Una cita por sí sola no demuestra ninguna de estas cosas.","Respuesta directa","info","callout",{},{"id":237,"data":238,"type":234,"tunes":242},"method-note",{"body":239,"title":240,"variant":241},"El modelo Afirmación–Evidencia–Aplicabilidad–Uso y la Prueba de utilización de evidencia descritos en este artículo son métodos de evaluación prácticos, no estándares formales de la industria. Se basan en conceptos consolidados como fundamentación (groundedness), calidad de las fuentes, cobertura de citas, evaluación de trazas y evaluaciones específicas de la tarea.","Acerca del método","note",{},{"id":244,"data":245,"type":42,"tunes":247},"h-citations",{"text":246,"level":219},"Por qué las citas no son suficientes",{},{"id":249,"data":250,"type":226,"tunes":252},"p-citations-1",{"text":251},"Una cita responde únicamente a una pregunta acotada: si el sistema asoció una afirmación o respuesta con una fuente. No determina automáticamente que la fuente respalde la afirmación específica, que sea lo suficientemente fidedigna para la tarea, que el pasaje citado contenga la condición o excepción necesaria, o que el modelo se haya basado en esa evidencia en lugar de generar la respuesta a partir de su conocimiento previo.",{},{"id":254,"data":255,"type":226,"tunes":257},"p-citations-2",{"text":256},"La guía de Anthropic para la evaluación de agentes de investigación separa explícitamente la fundamentación, la cobertura y la calidad de las fuentes. De manera similar, la guía de evaluación de agentes de OpenAI enfatiza las trazas porque el resultado final no revela si el agente seleccionó las herramientas adecuadas o siguió el flujo de trabajo previsto. Estas ideas apuntan a una conclusión más amplia: la calidad de la evidencia es una propiedad de la ruta de ejecución, no solo del texto final.",{},{"id":259,"data":260,"type":42,"tunes":262},"h-four",{"text":261,"level":219},"Las cuatro preguntas que toda afirmación relevante debe superar",{},{"id":264,"data":265,"type":287,"tunes":288},"table-four",{"content":266,"stretched":43,"withHeadings":14},[267,271,275,279,283],[268,269,270],"Dimensión","Pregunta","Fallo típico",[272,273,274],"Respaldo de la afirmación","¿La evidencia respalda directamente esta afirmación exacta?","La fuente está relacionada temáticamente, pero no fundamenta la afirmación",[276,277,278],"Autoridad de la evidencia","¿Es esta una fuente apropiada para este tipo de afirmación?","Se utiliza un resumen secundario donde se requiere una fuente primaria o un sistema en vivo",[280,281,282],"Aplicabilidad","¿Se aplica la evidencia a este momento, versión, jurisdicción, usuario, estado o población?","Se aplica una afirmación verdadera fuera de sus condiciones válidas",[284,285,286],"Uso de la evidencia","¿Estuvo esta evidencia realmente disponible y se utilizó en la ruta de ejecución del agente?","La respuesta final es correcta, pero la evidencia recuperada era irrelevante o no se utilizó","table",{},{"id":290,"data":291,"type":42,"tunes":293},"h-support",{"text":292,"level":218},"1. Respaldo de la afirmación: ¿fundamenta la fuente lo que afirma el agente?",{},{"id":295,"data":296,"type":226,"tunes":298},"p-support-1",{"text":297},"La evidencia debe evaluarse a nivel de afirmación. Un documento puede ser relevante para el tema y, aun así, no respaldar una declaración específica. Si una fuente señala que una función está disponible en regiones seleccionadas, la respuesta «la función está disponible a nivel global» carece de respaldo, aunque la cita parezca verosímil.",{},{"id":300,"data":301,"type":226,"tunes":303},"p-support-2",{"text":302},"Aquí es donde las valoraciones generales de «fundamentado \u002F no fundamentado» suelen ser demasiado imprecisas. Divida la respuesta en afirmaciones relevantes, asocie cada afirmación con el fragmento de evidencia más pequeño que la respalde y clasifique la relación: respaldo directo, respaldo parcial, contradicción o sin respaldo.",{},{"id":305,"data":306,"type":42,"tunes":308},"h-authority",{"text":307,"level":218},"2. Autoridad de la evidencia: ¿es el tipo de fuente adecuado?",{},{"id":310,"data":311,"type":226,"tunes":313},"p-authority-1",{"text":312},"La selección correcta de la evidencia no consiste únicamente en la relevancia semántica. La fuente debe ser adecuada para la decisión. El estado actual de una cuenta debe provenir del sistema de cuentas, no de un correo electrónico antiguo. Una afirmación sobre el comportamiento de una API debería contrastarse preferiblemente con la documentación actual del proveedor o con un comportamiento reproducible. Un requisito legal puede requerir la ley aplicable, el organismo regulador o directrices oficiales en lugar de una publicación genérica de un blog.",{},{"id":315,"data":316,"type":226,"tunes":318},"p-authority-2",{"text":317},"La autoridad de la fuente depende de la tarea específica. Un informe de la comunidad puede ser la mejor evidencia para un error real que la documentación del proveedor no reconoce. Un comunicado del proveedor puede ser fidedigno respecto a lo que este afirma, pero constituir una evidencia débil sobre el rendimiento independiente. Por lo tanto, el evaluador necesita una jerarquía de fuentes explícita para la tarea en lugar de una puntuación de autoridad universal.",{},{"id":320,"data":321,"type":42,"tunes":323},"h-applicability",{"text":322,"level":218},"3. Aplicabilidad: evidencia correcta, condiciones incorrectas",{},{"id":325,"data":326,"type":226,"tunes":328},"p-apply-1",{"text":327},"Los errores de evidencia más peligrosos a menudo no provienen de fuentes inventadas, sino de fuentes válidas utilizadas fuera de sus límites. Una recomendación puede cambiar según la versión del software, la fecha, la jurisdicción, la revisión del hardware, los permisos del usuario, la disponibilidad del producto, el estado actual del juego, la configuración del inquilino (tenant) u otras variables del entorno.",{},{"id":330,"data":331,"type":226,"tunes":333},"p-apply-2",{"text":332},"Para cada fuente relevante, conserve las condiciones que determinan si aún resulta aplicable. Esto es especialmente importante tras una síntesis: una memoria comprimida o una cita puede preservar la conclusión al tiempo que omite la excepción, la fecha o el requisito previo que validaba dicha conclusión.",{},{"id":335,"data":336,"type":234,"tunes":340},"apply-warning",{"body":337,"title":338,"variant":339},"Una fuente real, citada con precisión, aún puede producir una respuesta incorrecta cuando su temporalidad, versión, población, jurisdicción o estado no coinciden con la pregunta actual.","La evidencia puede ser auténtica y aun así ser incorrecta para la respuesta","warning",{},{"id":342,"data":343,"type":42,"tunes":345},"h-use",{"text":344,"level":218},"4. Uso de la evidencia: ¿realmente se basó el agente en la evidencia?",{},{"id":347,"data":348,"type":226,"tunes":350},"p-use-1",{"text":349},"Una respuesta puede ser correcta incluso cuando la recuperación falló. El modelo ya puede conocer la respuesta, inferirla de un contexto no relacionado o simplemente acertar por casualidad. Si la evaluación comprueba únicamente la corrección final, el sistema puede parecer bien fundamentado mientras que la ruta de la evidencia está rota.",{},{"id":352,"data":353,"type":226,"tunes":355},"p-use-2",{"text":354},"Para evaluar el uso de la evidencia, inspeccione la traza. Confirme qué fuentes se recuperaron, qué pasajes llegaron al contexto del modelo, cuándo estuvieron disponibles y si la afirmación final puede explicarse mediante esas entradas. Las herramientas actuales de evaluación de agentes de OpenAI enfatizan la calificación de trazas precisamente porque el comportamiento a nivel de flujo de trabajo no se puede reconstruir de manera confiable solo a partir de la respuesta final.",{},{"id":357,"data":358,"type":42,"tunes":360},"h-eut",{"text":359,"level":219},"La prueba de utilización de la evidencia",{},{"id":362,"data":363,"type":226,"tunes":365},"p-eut-intro",{"text":364},"Se puede construir una evaluación práctica como un contrafáctico controlado. En lugar de preguntar únicamente si la respuesta es correcta, cambie la evidencia y observe si la afirmación cambia en la dirección esperada.",{},{"id":367,"data":368,"type":393,"tunes":394},"eut-flow",{"steps":369,"title":391,"orientation":392},[370,373,376,379,382,385,388],{"label":371,"description":372},"1. Seleccionar una afirmación relevante","Elija una afirmación cuya exactitud sea importante y defina la respuesta esperada con precisión.",{"label":374,"description":375},"2. Identificar la evidencia de referencia","Proporcione el conjunto de evidencia autorizada más pequeño que sea suficiente para respaldar la afirmación.",{"label":377,"description":378},"3. Ejecutar con la evidencia de referencia","Verifique que el agente produzca la respuesta respaldada cuando la evidencia correcta esté disponible.",{"label":380,"description":381},"4. Eliminar la evidencia decisiva","Ejecute la misma tarea sin el pasaje de respaldo clave mientras mantiene estables las demás entradas.",{"label":383,"description":384},"5. Reemplazarla con evidencia contradictoria o sustitutiva","Siempre que sea seguro, proporcione evidencia controlada que cambie la conclusión correcta.",{"label":386,"description":387},"6. Comparar las afirmaciones","Compruebe si la respuesta sigue el cambio de evidencia o permanece anclada al conocimiento previo del modelo.",{"label":389,"description":390},"7. Inspeccionar la traza","Confirme qué se recuperó, qué llegó al contexto y qué fuente o resultado de herramienta precedió a la afirmación.","Prueba de utilización de la evidencia","auto","processFlow",{},{"id":396,"data":397,"type":234,"tunes":401},"eut-tip",{"body":398,"title":399,"variant":400},"Si la evidencia decisiva cambia pero la afirmación del agente no, usted tiene pruebas de que el sistema podría no estar usando la recuperación según lo previsto, incluso cuando la respuesta original haya sido correcta.","La señal clave","tip",{},{"id":403,"data":404,"type":42,"tunes":406},"h-matrix",{"text":405,"level":219},"Una matriz de afirmación-evidencia es más útil que una lista de fuentes",{},{"id":408,"data":409,"type":287,"tunes":441},"claim-matrix",{"content":410,"stretched":43,"withHeadings":14},[411,417,424,430,436],[412,413,414,415,280,416],"Afirmación","Evidencia","Respaldo","Autoridad","Utilizado en la traza",[418,419,420,421,422,423],"La función X está disponible","Documentación del proveedor","Directo","Alta para afirmaciones de disponibilidad","La versión actual y la región deben coincidir","Sí \u002F No",[425,426,427,428,429,423],"La configuración Y es más rápida","Benchmark del proveedor","Parcial","Alta para la prueba del proveedor, no para rendimiento independiente","El hardware y la carga de trabajo deben coincidir",[431,432,433,434,435,423],"La política se aplica a este usuario","Política actual + estado de la cuenta","Directo solo cuando se combinan","Alta","La jurisdicción, fecha, rol y estado de la cuenta deben coincidir",[437,438,420,439,440,423],"Un producto está en stock","API de inventario en tiempo real","Autorizada para el stock actual","Caduca rápidamente",{},{"id":443,"data":444,"type":226,"tunes":446},"p-matrix-1",{"text":445},"Esta matriz plantea varias preguntas que la verificación convencional de citas oculta. Una afirmación puede requerir múltiples fuentes. Una fuente puede respaldar solo una parte de una afirmación. Una fuente autorizada puede tener una ventana de validez corta. Y una fuente perfectamente válida puede ser irrelevante si nunca ingresó a la ruta de ejecución.",{},{"id":448,"data":449,"type":42,"tunes":451},"h-retrieval-evidence",{"text":450,"level":219},"Separar la calidad de la recuperación de la calidad de la evidencia",{},{"id":453,"data":454,"type":226,"tunes":456},"p-re-1",{"text":455},"Las métricas de recuperación evalúan si se encontró y clasificó el material relevante. La evaluación de la evidencia analiza si ese material justifica las afirmaciones resultantes. Ambas están relacionadas pero no son idénticas.",{},{"id":458,"data":459,"type":489,"tunes":490},"retrieval-comparison",{"rows":460,"title":478,"layout":287,"columns":479},[461,466,470,474],{"id":462,"label":463,"values":464},"a","Documento correcto, afirmación incorrecta",[465,465,465],"",{"id":467,"label":468,"values":469},"b","Dato correcto, fuente desactualizada",[465,465,465],{"id":471,"label":472,"values":473},"c","Fuente débil, respuesta correcta",[465,465,465],{"id":475,"label":476,"values":477},"d","Múltiples fuentes requeridas",[465,465,465],"El éxito en la recuperación no es el éxito en la evidencia",[480,483,486],{"id":481,"label":482},"situation","Situación",{"id":484,"label":485},"retrieval","Recuperación",{"id":487,"label":488},"evidence","Calidad de la evidencia","comparison",{},{"id":492,"data":493,"type":42,"tunes":495},"h-source-quality",{"text":494,"level":219},"Evaluar la calidad de la fuente como una rúbrica, no como una lista blanca de dominios",{},{"id":497,"data":498,"type":226,"tunes":500},"p-source-quality-1",{"text":499},"Las listas fijas de \"dominios de confianza\" son tentadoras pero a menudo frágiles. En cambio, la calidad de la fuente debe reflejar el tipo de afirmación. Las dimensiones útiles incluyen el estatus primario o secundario, la actualidad, la inmediatez, la reproducibilidad, la independencia, la experiencia en el dominio, la procedencia de los datos, la cadencia de actualización y si la fuente tiene incentivos para exagerar la afirmación.",{},{"id":502,"data":503,"type":226,"tunes":505},"p-source-quality-2",{"text":504},"La guía de evaluación de agentes de investigación de Anthropic señala explícitamente las comprobaciones de calidad de la fuente junto con la fundamentación y la cobertura. Por lo tanto, la implementación práctica debe calificar tanto lo que dice la fuente como si dicha fuente es apropiada para este tipo de declaración.",{},{"id":507,"data":508,"type":42,"tunes":510},"h-coverage",{"text":509,"level":219},"Cobertura de la evidencia: cada afirmación importante necesita respaldo, no cada oración",{},{"id":512,"data":513,"type":226,"tunes":515},"p-coverage-1",{"text":514},"No todas las oraciones necesitan una cita. El lenguaje de transición, la aritmética derivada de forma transparente a partir de valores citados o una interpretación claramente señalada pueden no requerir una fuente independiente. Sin embargo, cada afirmación relevante y verificable externamente debe contar con el respaldo suficiente para que un evaluador pueda reconstruir por qué se le permitió al agente expresarla.",{},{"id":517,"data":518,"type":226,"tunes":520},"p-coverage-2",{"text":519},"Por lo tanto, la cobertura debe ponderarse según la importancia de la afirmación. La falta de respaldo para un detalle decorativo no equivale a la falta de respaldo para un precio, una decisión de elegibilidad, una instrucción de seguridad, un requisito legal, una declaración de compatibilidad técnica o un hecho que fundamente una recomendación.",{},{"id":522,"data":523,"type":42,"tunes":525},"h-provenance",{"text":524,"level":219},"La procedencia de la evidencia debe sobrevivir a la síntesis y a la memoria",{},{"id":527,"data":528,"type":226,"tunes":530},"p-prov-1",{"text":529},"Los agentes de ejecución prolongada a menudo resumen el trabajo previo o registran memorias duraderas. Si la procedencia de la evidencia se elimina durante esa transformación, los agentes futuros pueden recuperar una conclusión clara sin saber si provino de una declaración del usuario, una API en tiempo real, un documento antiguo, una inferencia del modelo o un resultado web no verificado.",{},{"id":532,"data":533,"type":226,"tunes":535},"p-prov-2",{"text":534},"Para hechos importantes, conserve al menos la identidad de la fuente, la hora de recuperación u observación, el tipo de evidencia, la versión o estado relevante, y si el texto almacenado está citado, resumido, inferido o derivado. La procedencia es lo que permite que un agente posterior decida si se debe confiar en la evidencia, actualizarla, restringirla o descartarla.",{},{"id":537,"data":538,"type":42,"tunes":540},"h-record",{"text":539,"level":219},"Un registro práctico de evidencia",{},{"id":542,"data":543,"type":287,"tunes":578},"evidence-record",{"content":544,"stretched":43,"withHeadings":14},[545,548,551,554,557,560,563,566,569,572,575],[546,547],"Campo","Propósito",[549,550],"claim_id","Identifica la afirmación relevante que se está respaldando",[552,553],"source_id \u002F source_url \u002F system","Identifica de dónde provino la evidencia",[555,556],"evidence_span","Conserva el fragmento, registro o resultado de herramienta más pequeño que respalda la afirmación",[558,559],"retrieved_at \u002F observed_at","Permite verificar la actualidad y la cronología",[561,562],"source_version \u002F object_version","Permite comprobar la sustitución y la reproducibilidad",[564,565],"authority_role","Explica por qué esta fuente es adecuada para esta afirmación",[567,568],"applicability","Almacena la fecha relevante, jurisdicción, versión del producto, usuario, inquilino, estado u otras condiciones",[570,571],"transformation","Indica si la evidencia es sin procesar, citada, resumida, normalizada o derivada",[573,574],"trace_step","Muestra cuándo estuvo disponible la evidencia para el agente",[576,577],"support_status","Directo, parcial, contradictorio, no respaldado o incierto",{},{"id":580,"data":581,"type":42,"tunes":583},"h-failures",{"text":582,"level":219},"Modos de fallo que parecen fundamentados pero no lo están",{},{"id":585,"data":586,"type":287,"tunes":624},"failure-table",{"content":587,"stretched":43,"withHeadings":14},[588,592,596,600,604,608,612,616,620],[589,590,591],"Modo de fallo","Por qué engaña a los evaluadores","Qué evaluar",[593,594,595],"Decoración de citas","La respuesta contiene fuentes, por lo que parece investigada","Mapear cada afirmación relevante a un fragmento de respaldo exacto",[597,598,599],"Discrepancia de autoridad","La fuente es confiable pero no tiene autoridad para el hecho específico","Definir una jerarquía de fuentes específica para la afirmación",[601,602,603],"Discrepancia temporal","La fuente era correcta en el momento de su publicación","Verificar la fecha de recuperación, la fecha de la fuente y la evidencia que la sustituye",[605,606,607],"Eliminación de condiciones","Un resumen conserva la conclusión pero omite las excepciones","Comparar la afirmación generada con el contexto local completo de la fuente",[609,610,611],"Cita a posteriori","Se adjunta una fuente plausible después de generar la respuesta","Inspeccionar el orden de la traza y verificar si la evidencia precedió a la afirmación",[613,614,615],"Anulación paramétrica","El modelo ignora la evidencia recuperada y responde a partir de su conocimiento previo","Ejecutar pruebas contrafácticas de utilización de evidencia",[617,618,619],"Blanqueo de evidencia","La inferencia del modelo se resume y luego se almacena como si fuera un hecho de la fuente","Preservar el tipo de transformación y la procedencia a través de las escrituras en la memoria",[621,622,623],"Falacia de la mayoría de fuentes","Varias páginas secundarias repiten la misma afirmación sin respaldo","Rastrear las afirmaciones hasta la evidencia primaria o independiente",{},{"id":626,"data":627,"type":42,"tunes":629},"h-production",{"text":628,"level":219},"Cómo evaluar al agente en producción",{},{"id":631,"data":632,"type":393,"tunes":659},"production-flow",{"steps":633,"title":658,"orientation":392},[634,637,640,643,646,649,652,655],{"label":635,"description":636},"1. Definir afirmaciones relevantes","Identificar los hechos, recomendaciones o decisiones cuya exactitud es crucial para la tarea.",{"label":638,"description":639},"2. Crear evidencia de referencia","Establecer evidencia de referencia y expectativas de calidad de las fuentes para casos representativos.",{"label":641,"description":642},"3. Capturar trazas","Registrar consultas de recuperación, llamadas a herramientas, evidencia devuelta, construcción del contexto, respuestas del modelo y citas.",{"label":644,"description":645},"4. Calificar el respaldo","Comprobar si cada afirmación relevante está respaldada de forma directa, parcial, contradictoria o si carece de respaldo.",{"label":647,"description":648},"5. Calificar autoridad y aplicabilidad","Evaluar si la fuente es apropiada y si sus condiciones coinciden con la tarea actual.",{"label":650,"description":651},"6. Ejecutar contrafácticos","Eliminar, reemplazar o sustituir evidencia decisiva y verificar si la respuesta se adapta al cambio.",{"label":653,"description":654},"7. Revisar fallos de alto impacto","Recurrir a la revisión humana o de expertos en el dominio cuando la calificación automatizada no sea lo suficientemente confiable.",{"label":656,"description":657},"8. Convertir fallos en casos de evaluación","Incorporar fallos de producción y casos límite a un conjunto de datos de regresión reproducible.","Canalización de evaluación de evidencia",{},{"id":661,"data":662,"type":226,"tunes":664},"p-production-1",{"text":663},"La guía de evaluación actual de OpenAI recomienda evaluaciones específicas para cada tarea, evaluación continua, conjuntos de datos derivados de producción y trazas para depurar el comportamiento de los agentes. Del mismo modo, Anthropic aconseja combinar tipos de evaluadores para agentes de investigación, dado que la corrección, la calidad de las fuentes, la cobertura y la fundamentación son dimensiones independientes. La evaluación de la evidencia debe seguir el mismo patrón: varios evaluadores específicos resultan más diagnósticos que una única puntuación de \"calidad\" opaca.",{},{"id":666,"data":667,"type":42,"tunes":669},"h-judge",{"text":668,"level":219},"No permita que un juez LLM sea el único evaluador de evidencia",{},{"id":671,"data":672,"type":226,"tunes":674},"p-judge-1",{"text":673},"Los evaluadores basados en LLM son útiles para la clasificación escalable de afirmaciones, verificaciones de relevancia y comparaciones por pares, pero pueden compartir los mismos puntos ciegos que el sistema que evalúan. Un evaluador puede aceptar una afirmación plausible pero no respaldada, pasar por alto un límite sutil entre versiones o sobrevalorar una fuente bien redactada.",{},{"id":676,"data":677,"type":226,"tunes":679},"p-judge-2",{"text":678},"La guía de evaluación de OpenAI recomienda calibrar los evaluadores automatizados con el juicio humano y utilizar criterios claros y delimitados. En sistemas que hacen un uso intensivo de evidencia, deben aplicarse comprobaciones deterministas siempre que sea posible: marcas de tiempo, versiones de objetos, alcance de permisos, identificadores de fuente exactos, orden de recuperación, hashes de documentos y si la evidencia estaba presente antes de que el modelo generara la afirmación.",{},{"id":681,"data":682,"type":42,"tunes":684},"h-change",{"text":683,"level":219},"¿Qué cambiaría esta respuesta?",{},{"id":686,"data":687,"type":226,"tunes":689},"p-change-1",{"text":688},"La evaluación puede ser más sencilla cuando el agente opera sobre un corpus pequeño, inmutable y fidedigno, y cada respuesta es estrictamente extractiva. En ese entorno, la autoridad y la aplicabilidad de las fuentes son en su mayoría fijas, y el respaldo de la afirmación mediante fragmentos de texto puede ser suficiente.",{},{"id":691,"data":692,"type":226,"tunes":694},"p-change-2",{"text":693},"La evaluación debe volverse más rigurosa cuando el agente combina búsquedas web, memoria a largo plazo, herramientas en tiempo real, múltiples jurisdicciones, información que cambia con rapidez, estados específicos del usuario o acciones autónomas. En esos sistemas, la validez de la evidencia no solo depende del texto de origen, sino también de cuándo y cómo se obtuvo dicha evidencia.",{},{"id":696,"data":697,"type":226,"tunes":699},"p-change-3",{"text":698},"Los modelos futuros pueden volverse mejores rastreando internamente la procedencia y la incertidumbre, pero eso no eliminaría la necesidad de registros de evidencia externos en sistemas que requieren auditabilidad. Un sistema no debería depender del autoinforme del modelo sobre qué influyó en él cuando las trazas y los metadatos de las fuentes pueden proporcionar evidencia más sólida.",{},{"id":701,"data":702,"type":42,"tunes":704},"h-limitations",{"text":703,"level":219},"Limitaciones",{},{"id":706,"data":707,"type":226,"tunes":709},"p-limit-1",{"text":708},"No siempre es posible demostrar el uso causal de la evidencia solo a partir de las trazas. Una fuente puede estar presente en el contexto sin influir en la respuesta, y un modelo puede conocer de forma independiente el mismo hecho. Las pruebas contrafácticas refuerzan la inferencia, pero pueden alterar por sí mismas la distribución de la tarea.",{},{"id":711,"data":712,"type":226,"tunes":714},"p-limit-2",{"text":713},"La autoridad de las fuentes también puede ser discutible o depender del dominio. Algunas preguntas no tienen una única fuente autorizada y los expertos pueden estar en desacuerdo sobre qué evidencia merece mayor peso. En esos casos, el evaluador debe preservar el desacuerdo y puntuar la transparencia, la cobertura y el razonamiento frente a una rúbrica explícita en lugar de pretender que existe una única fuente de verdad incuestionable.",{},{"id":716,"data":717,"type":42,"tunes":719},"h-conclusion",{"text":718,"level":219},"Conclusión",{},{"id":721,"data":722,"type":226,"tunes":724},"p-conclusion-1",{"text":723},"La pregunta “¿citó una fuente el agente?” es demasiado débil para la IA en producción. La pregunta más sólida es: ¿provino cada afirmación importante de evidencia que realmente la respalda, tiene la autoridad adecuada, sigue siendo aplicable a las condiciones actuales y estuvo disponible en la ruta de ejecución antes de que se formulara la afirmación?",{},{"id":726,"data":727,"type":226,"tunes":729},"p-conclusion-2",{"text":728},"Eso convierte la evidencia de un mero adorno en una propiedad evaluable del sistema. Capture la traza. Asocie las afirmaciones con la evidencia. Compruebe la autoridad y la aplicabilidad. Ejecute pruebas de evidencia contrafácticas. Preserve la procedencia a través de resúmenes y memoria. Así, una respuesta correcta no solo es plausible: cuenta con una ruta de evidencia que se puede inspeccionar.",{},{"id":731,"data":732,"type":737,"tunes":738},"internal-reliability",{"url":733,"title":734,"excerpt":735,"ctaLabel":736},"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Fiabilidad de los agentes de IA: por qué la respuesta final no es suficiente","La corrección del resultado por sí sola no puede demostrar que la ruta de ejecución de un agente haya sido segura o fiable. Este artículo relacionado explica por qué las trayectorias, las herramientas y las decisiones intermedias importan.","Leer el artículo relacionado","referralArticle",{},{"id":740,"data":741,"type":737,"tunes":746},"internal-reasoning",{"url":742,"title":743,"excerpt":744,"ctaLabel":745},"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","Del protocolo de investigación a un marco general de razonamiento en IA","Un método práctico de razonamiento para separar la evidencia, las suposiciones, las hipótesis contrapuestas y la validación específica del dominio.","Leer el marco de razonamiento",{},{"id":748,"data":749,"type":42,"tunes":751},"h-faq",{"text":750,"level":219},"Preguntas frecuentes",{},{"id":753,"data":754,"type":753,"tunes":777},"faq",{"items":755,"title":776},[756,760,764,768,772],{"id":757,"answer":758,"question":759},"faq1","No. Una cita puede ser relevante para el tema sin respaldar la afirmación exacta, puede provenir de una autoridad inadecuada, puede haber dejado de ser aplicable o puede haberse adjuntado sin influir materialmente en la respuesta generada.","¿Una cita demuestra que una respuesta de IA está fundamentada?",{"id":761,"answer":762,"question":763},"faq2","Utilice una prueba contrafáctica de utilización de evidencia: ejecute la tarea con evidencia que se sabe correcta y, a continuación, elimine o reemplace la evidencia decisiva manteniendo estables las demás entradas. Si la respuesta no reacciona al cambio de evidencia, inspeccione si el modelo se está basando en conocimientos previos o en otra fuente.","¿Cómo puedo comprobar si un agente de IA realmente utilizó la evidencia recuperada?",{"id":765,"answer":766,"question":767},"faq3","La fundamentación examina si las afirmaciones están respaldadas por la evidencia proporcionada. La calidad de la fuente evalúa si la evidencia en sí misma es adecuada y lo suficientemente autorizada para el tipo de afirmación formulada.","¿Cuál es la diferencia entre fundamentación y calidad de la fuente?",{"id":769,"answer":770,"question":771},"faq4","La fuente puede estar desactualizada, haber sido sustituida, ser válida para otra versión, jurisdicción, usuario, población o estado del sistema, o puede contener condiciones que se perdieron durante la recuperación o el resumen.","¿Por qué una fuente real aún puede producir una respuesta incorrecta de la IA?",{"id":773,"answer":774,"question":775},"faq5","Registre la consulta de recuperación, las fuentes obtenidas, los fragmentos exactos de evidencia, las marcas de tiempo y versiones, los filtros, el contexto final, la salida del modelo, las citas y el orden cronológico de la traza para que los evaluadores puedan reconstruir qué evidencia estaba disponible antes de cada afirmación sustancial.","¿Qué debería registrar para la evaluación de la evidencia?","Evaluación del uso de evidencia en agentes de IA",{},{"id":779,"data":780,"type":42,"tunes":782},"h-glossary",{"text":781,"level":219},"Glosario",{},{"id":784,"data":785,"type":784,"tunes":808},"glossary",{"title":786,"entries":787},"Términos clave en la evaluación de evidencia",[788,791,794,796,800,804],{"term":272,"anchor":789,"definition":790},"claim-support","El grado en que un fragmento de evidencia específico fundamenta directamente una afirmación generada.",{"term":276,"anchor":792,"definition":793},"evidence-authority","La idoneidad de una fuente para respaldar un tipo concreto de afirmación, en función de su rol, procedencia y relación con el hecho subyacente.",{"term":280,"anchor":567,"definition":795},"Las condiciones bajo las cuales la evidencia sigue siendo válida para una afirmación, incluidos el tiempo, la versión, la jurisdicción, el usuario, la población, el estado del sistema u otros límites.",{"term":797,"anchor":798,"definition":799},"Utilización de evidencia","evidence-utilization","Si el resultado generado por el agente responde realmente y depende de la evidencia facilitada en su ruta de ejecución.",{"term":801,"anchor":802,"definition":803},"Prueba contrafáctica de evidencia","counterfactual-evidence-test","Una evaluación que elimina, sustituye o modifica evidencia decisiva para comprobar si la afirmación del agente cambia de forma coherente.",{"term":805,"anchor":806,"definition":807},"Procedencia","provenance","Metadatos que registran de dónde provino la evidencia, cuándo se obtuvo, cómo se transformó y qué versión o estado representaba.",{},{"id":810,"data":811,"type":42,"tunes":813},"h-sources",{"text":812,"level":219},"Fuentes primarias y lecturas adicionales",{},{"id":815,"data":816,"type":822,"tunes":823},"src-openai-agent-evals",{"link":817,"meta":818},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals",{"image":819,"title":820,"description":821},{"url":465},"OpenAI — Evaluate Agent Workflows","Orientación sobre la calificación de trazas, evaluación a nivel de flujo de trabajo, conjuntos de datos y ejecuciones de evaluación reproducibles para agentes.","linkTool",{},{"id":825,"data":826,"type":822,"tunes":832},"src-openai-eval-best",{"link":827,"meta":828},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices",{"image":829,"title":830,"description":831},{"url":465},"OpenAI — Evaluation Best Practices","Orientación sobre evaluaciones específicas para tareas, conjuntos de datos derivados de producción, métricas acotadas, evaluación continua y calibración de calificadores.",{},{"id":834,"data":835,"type":822,"tunes":841},"src-anthropic-evals",{"link":836,"meta":837},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"image":838,"title":839,"description":840},{"url":465},"Anthropic — Demystifying Evals for AI Agents","Guía de evaluación de agentes que incluye comprobaciones de fundamentación, cobertura y calidad de fuentes para agentes de investigación.",{},{"id":843,"data":844,"type":822,"tunes":850},"src-openai-thirdparty",{"link":845,"meta":846},"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F",{"image":847,"title":848,"description":849},{"url":465},"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations","Guía de evaluación que subraya que el rendimiento de los agentes modernos depende del flujo de trabajo y del entorno, no solo del resultado final del modelo.",{},"2.31","Un agente de IA puede citar fuentes y aun así usar la evidencia incorrecta. Este artículo presenta un método práctico para verificar el respaldo de las afirmaciones, la autoridad de la fuente, la aplicabilidad, la procedencia y si la evidencia realmente influyó en la respuesta.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve","PUBLISHED","2026-09-25T11:47:00.000Z","2026-09-25T15:47:02.186Z","2026-09-25T20:33:01.720Z",{"en":860,"de":861,"sr":862,"es":863,"fr":864,"it":865,"ru":866,"zh":867},"\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fde\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fsr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fes\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Ffr\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fit\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fru\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence","\u002Fzh\u002Fblog\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence",[869,873,877],{"id":870,"name":871,"slug":872},84,"Política y límites de datos","policy-and-data",{"id":874,"name":875,"slug":876},97,"Verificación en set de prueba","verification",{"id":878,"name":879,"slug":880},66,"Operaciones de contenido","content-ops",{"id":882,"login":883,"email":884,"displayName":885},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[887,1410],{"lang":888,"title":889,"content":890,"contentJson":891,"excerpt":1409},"en","How to Know Whether an AI Agent Actually Used the Right Evidence","{\"time\":1790351390243,\"blocks\":[{\"id\":\"0hk9UtwqZf\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.\"},\"tunes\":{}},{\"id\":\"method-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"About the method\",\"body\":\"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.\"},\"tunes\":{}},{\"id\":\"h-citations\",\"type\":\"header\",\"data\":{\"text\":\"Why citations are not enough\",\"level\":2},\"tunes\":{}},{\"id\":\"p-citations-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.\"},\"tunes\":{}},{\"id\":\"p-citations-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.\"},\"tunes\":{}},{\"id\":\"h-four\",\"type\":\"header\",\"data\":{\"text\":\"The four questions every material claim should pass\",\"level\":2},\"tunes\":{}},{\"id\":\"table-four\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Dimension\",\"Question\",\"Typical failure\"],[\"Claim support\",\"Does the evidence directly support this exact claim?\",\"The source is topically related but does not establish the statement\"],[\"Evidence authority\",\"Is this an appropriate source for this kind of claim?\",\"A secondary summary is used where a primary source or live system is required\"],[\"Applicability\",\"Does the evidence apply to this time, version, jurisdiction, user, state, or population?\",\"A true statement is applied outside its valid conditions\"],[\"Evidence use\",\"Was this evidence actually available and used in the agent's execution path?\",\"The final answer is correct, but the retrieved evidence was irrelevant or unused\"]]},\"tunes\":{}},{\"id\":\"h-support\",\"type\":\"header\",\"data\":{\"text\":\"1. Claim support: does the source establish what the agent says?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-support-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.\"},\"tunes\":{}},{\"id\":\"p-support-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.\"},\"tunes\":{}},{\"id\":\"h-authority\",\"type\":\"header\",\"data\":{\"text\":\"2. Evidence authority: is this the right kind of source?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-authority-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.\"},\"tunes\":{}},{\"id\":\"p-authority-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.\"},\"tunes\":{}},{\"id\":\"h-applicability\",\"type\":\"header\",\"data\":{\"text\":\"3. Applicability: right evidence, wrong conditions\",\"level\":3},\"tunes\":{}},{\"id\":\"p-apply-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.\"},\"tunes\":{}},{\"id\":\"p-apply-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.\"},\"tunes\":{}},{\"id\":\"apply-warning\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Evidence can be authentic and still be wrong for the answer\",\"body\":\"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.\"},\"tunes\":{}},{\"id\":\"h-use\",\"type\":\"header\",\"data\":{\"text\":\"4. Evidence use: did the agent actually rely on the evidence?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-use-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.\"},\"tunes\":{}},{\"id\":\"p-use-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.\"},\"tunes\":{}},{\"id\":\"h-eut\",\"type\":\"header\",\"data\":{\"text\":\"The Evidence Utilization Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-eut-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.\"},\"tunes\":{}},{\"id\":\"eut-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence Utilization Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Select one material claim\",\"description\":\"Choose a claim whose correctness matters and define the expected answer precisely.\"},{\"label\":\"2. Identify gold evidence\",\"description\":\"Provide the smallest authoritative evidence set sufficient to support the claim.\"},{\"label\":\"3. Run with gold evidence\",\"description\":\"Verify that the agent produces the supported answer when the correct evidence is available.\"},{\"label\":\"4. Remove the decisive evidence\",\"description\":\"Run the same task without the key supporting passage while keeping other inputs stable.\"},{\"label\":\"5. Replace it with contradictory or superseding evidence\",\"description\":\"Where safe, provide controlled evidence that changes the correct conclusion.\"},{\"label\":\"6. Compare the claims\",\"description\":\"Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.\"},{\"label\":\"7. Inspect the trace\",\"description\":\"Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.\"}]},\"tunes\":{}},{\"id\":\"eut-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"The key signal\",\"body\":\"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A claim–evidence matrix is more useful than a source list\",\"level\":2},\"tunes\":{}},{\"id\":\"claim-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Claim\",\"Evidence\",\"Support\",\"Authority\",\"Applicability\",\"Used in trace\"],[\"Feature X is available\",\"Vendor documentation\",\"Direct\",\"High for availability claim\",\"Current version and region must match\",\"Yes \u002F No\"],[\"Configuration Y is faster\",\"Vendor benchmark\",\"Partial\",\"High for vendor's test, not independent performance\",\"Hardware and workload must match\",\"Yes \u002F No\"],[\"Policy applies to this user\",\"Current policy + account state\",\"Direct only when combined\",\"High\",\"Jurisdiction, date, role and account state must match\",\"Yes \u002F No\"],[\"A product is in stock\",\"Live inventory API\",\"Direct\",\"Authoritative for current stock\",\"Expires quickly\",\"Yes \u002F No\"]]},\"tunes\":{}},{\"id\":\"p-matrix-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.\"},\"tunes\":{}},{\"id\":\"h-retrieval-evidence\",\"type\":\"header\",\"data\":{\"text\":\"Separate retrieval quality from evidence quality\",\"level\":2},\"tunes\":{}},{\"id\":\"p-re-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.\"},\"tunes\":{}},{\"id\":\"retrieval-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Retrieval success is not evidence success\",\"layout\":\"table\",\"columns\":[{\"id\":\"situation\",\"label\":\"Situation\"},{\"id\":\"retrieval\",\"label\":\"Retrieval\"},{\"id\":\"evidence\",\"label\":\"Evidence quality\"}],\"rows\":[{\"id\":\"a\",\"label\":\"Right document, wrong claim\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"b\",\"label\":\"Right fact, stale source\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"c\",\"label\":\"Weak source, correct answer\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"d\",\"label\":\"Multiple sources required\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-source-quality\",\"type\":\"header\",\"data\":{\"text\":\"Evaluate source quality as a rubric, not a domain whitelist\",\"level\":2},\"tunes\":{}},{\"id\":\"p-source-quality-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.\"},\"tunes\":{}},{\"id\":\"p-source-quality-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.\"},\"tunes\":{}},{\"id\":\"h-coverage\",\"type\":\"header\",\"data\":{\"text\":\"Evidence coverage: every important claim needs support, not every sentence\",\"level\":2},\"tunes\":{}},{\"id\":\"p-coverage-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.\"},\"tunes\":{}},{\"id\":\"p-coverage-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.\"},\"tunes\":{}},{\"id\":\"h-provenance\",\"type\":\"header\",\"data\":{\"text\":\"Evidence provenance must survive summarization and memory\",\"level\":2},\"tunes\":{}},{\"id\":\"p-prov-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.\"},\"tunes\":{}},{\"id\":\"p-prov-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.\"},\"tunes\":{}},{\"id\":\"h-record\",\"type\":\"header\",\"data\":{\"text\":\"A practical evidence record\",\"level\":2},\"tunes\":{}},{\"id\":\"evidence-record\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Field\",\"Purpose\"],[\"claim_id\",\"Identifies the material claim being supported\"],[\"source_id \u002F source_url \u002F system\",\"Identifies where the evidence came from\"],[\"evidence_span\",\"Preserves the smallest passage, record, or tool result that supports the claim\"],[\"retrieved_at \u002F observed_at\",\"Allows freshness and timeline checks\"],[\"source_version \u002F object_version\",\"Allows supersession and reproducibility checks\"],[\"authority_role\",\"Explains why this source is suitable for this claim\"],[\"applicability\",\"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions\"],[\"transformation\",\"Marks whether evidence is raw, quoted, summarized, normalized, or derived\"],[\"trace_step\",\"Shows when the evidence became available to the agent\"],[\"support_status\",\"Direct, partial, contradictory, unsupported, or uncertain\"]]},\"tunes\":{}},{\"id\":\"h-failures\",\"type\":\"header\",\"data\":{\"text\":\"Failure modes that look grounded but are not\",\"level\":2},\"tunes\":{}},{\"id\":\"failure-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Failure mode\",\"Why it fools evaluators\",\"What to test\"],[\"Citation decoration\",\"The answer contains sources, so it looks researched\",\"Map each material claim to an exact supporting span\"],[\"Authority mismatch\",\"The source is reputable but not authoritative for the specific fact\",\"Define claim-specific source hierarchy\"],[\"Temporal mismatch\",\"The source was correct when published\",\"Check retrieval time, source date, and superseding evidence\"],[\"Condition stripping\",\"A summary keeps the conclusion but drops exceptions\",\"Compare generated claim with full local source context\"],[\"Post-hoc citation\",\"A plausible source is attached after the answer is generated\",\"Inspect trace ordering and whether evidence preceded the claim\"],[\"Parametric override\",\"The model ignores retrieved evidence and answers from prior knowledge\",\"Run counterfactual evidence-utilization tests\"],[\"Evidence laundering\",\"Model inference is summarized and later stored as if it were a source fact\",\"Preserve transformation type and provenance across memory writes\"],[\"Source majority fallacy\",\"Several secondary pages repeat the same unsupported statement\",\"Trace claims back to independent or primary evidence\"]]},\"tunes\":{}},{\"id\":\"h-production\",\"type\":\"header\",\"data\":{\"text\":\"How to evaluate the agent in production\",\"level\":2},\"tunes\":{}},{\"id\":\"production-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Evidence evaluation pipeline\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Define material claims\",\"description\":\"Identify the facts, recommendations, or decisions whose correctness matters to the task.\"},{\"label\":\"2. Build gold evidence\",\"description\":\"Create reference evidence and source-quality expectations for representative cases.\"},{\"label\":\"3. Capture traces\",\"description\":\"Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.\"},{\"label\":\"4. Grade support\",\"description\":\"Check whether each material claim is directly, partially, contradictorily, or not supported.\"},{\"label\":\"5. Grade authority and applicability\",\"description\":\"Evaluate whether the source is appropriate and whether its conditions match the current task.\"},{\"label\":\"6. Run counterfactuals\",\"description\":\"Remove, replace, or supersede decisive evidence and test whether the answer follows the change.\"},{\"label\":\"7. Review high-impact failures\",\"description\":\"Use human or domain-expert review where automated grading is not reliable enough.\"},{\"label\":\"8. Convert failures into eval cases\",\"description\":\"Add production failures and edge cases to a repeatable regression dataset.\"}]},\"tunes\":{}},{\"id\":\"p-production-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.\"},\"tunes\":{}},{\"id\":\"h-judge\",\"type\":\"header\",\"data\":{\"text\":\"Do not let an LLM judge become the only evidence judge\",\"level\":2},\"tunes\":{}},{\"id\":\"p-judge-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.\"},\"tunes\":{}},{\"id\":\"p-judge-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.\"},\"tunes\":{}},{\"id\":\"p-change-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.\"},\"tunes\":{}},{\"id\":\"internal-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.\",\"ctaLabel\":\"Read the related article\"},\"tunes\":{}},{\"id\":\"internal-reasoning\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\",\"title\":\"From Research Protocol to a General AI Reasoning Framework\",\"excerpt\":\"A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.\",\"ctaLabel\":\"Read the reasoning framework\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Evaluating evidence use in AI agents\",\"items\":[{\"id\":\"faq1\",\"question\":\"Does a citation prove that an AI answer is grounded?\",\"answer\":\"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.\"},{\"id\":\"faq2\",\"question\":\"How can I test whether an AI agent actually used retrieved evidence?\",\"answer\":\"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.\"},{\"id\":\"faq3\",\"question\":\"What is the difference between groundedness and source quality?\",\"answer\":\"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.\"},{\"id\":\"faq4\",\"question\":\"Why can a real source still produce a wrong AI answer?\",\"answer\":\"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.\"},{\"id\":\"faq5\",\"question\":\"What should I log for evidence evaluation?\",\"answer\":\"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key evidence-evaluation terms\",\"entries\":[{\"term\":\"Claim support\",\"definition\":\"The degree to which a specific evidence span directly establishes a generated claim.\",\"anchor\":\"claim-support\"},{\"term\":\"Evidence authority\",\"definition\":\"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.\",\"anchor\":\"evidence-authority\"},{\"term\":\"Applicability\",\"definition\":\"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.\",\"anchor\":\"applicability\"},{\"term\":\"Evidence utilization\",\"definition\":\"Whether the agent's output actually responds to and depends on the evidence made available in its execution path.\",\"anchor\":\"evidence-utilization\"},{\"term\":\"Counterfactual evidence test\",\"definition\":\"An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.\",\"anchor\":\"counterfactual-evidence-test\"},{\"term\":\"Provenance\",\"definition\":\"Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.\",\"anchor\":\"provenance\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-agent-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagent-evals\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluate Agent Workflows\",\"description\":\"Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-eval-best\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluation Best Practices\",\"description\":\"Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.\"}},\"tunes\":{}},{\"id\":\"src-anthropic-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Demystifying Evals for AI Agents\",\"description\":\"Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.\"}},\"tunes\":{}},{\"id\":\"src-openai-thirdparty\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fopenai.com\u002Findex\u002Ftrustworthy-third-party-evaluations-foundations\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — A Shared Playbook for Trustworthy Third-Party Evaluations\",\"description\":\"Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":892,"blocks":893,"version":1408},1790351390243,[894,898,902,907,912,916,920,924,928,952,956,960,964,968,972,976,980,984,988,993,997,1001,1005,1009,1013,1039,1044,1048,1082,1086,1090,1094,1118,1122,1126,1130,1134,1138,1142,1146,1150,1154,1158,1185,1189,1229,1233,1262,1266,1270,1274,1278,1282,1286,1290,1294,1298,1302,1306,1310,1314,1318,1325,1332,1336,1356,1360,1380,1384,1390,1396,1402],{"id":215,"data":895,"type":220,"tunes":897},{"title":896,"maxLevel":218,"minLevel":219},"Contents",{},{"id":223,"data":899,"type":226,"tunes":901},{"text":900},"An AI agent can cite sources, retrieve documents, and still use the wrong evidence. A source may be authoritative but irrelevant to the exact claim. A retrieved passage may support only part of an answer. A correct source can be stale, superseded, or valid for the wrong jurisdiction, product version, user, or system state. This creates a harder evaluation problem than simple citation checking: did the agent actually use the right evidence for the claim it made?",{},{"id":229,"data":903,"type":234,"tunes":906},{"body":904,"title":905,"variant":233},"To know whether an AI agent used the right evidence, evaluate the chain \u003Cstrong>Claim → Evidence → Applicability → Use\u003C\u002Fstrong>. For each material claim, verify that the evidence directly supports it, comes from an appropriate authority, applies to the current conditions, and was actually available to the agent before the claim was produced. A citation alone proves none of those things.","Direct answer",{},{"id":237,"data":908,"type":234,"tunes":911},{"body":909,"title":910,"variant":241},"The Claim–Evidence–Applicability–Use model and Evidence Utilization Test in this article are practical evaluation methods, not formal industry standards. They build on established ideas such as groundedness, source quality, citation coverage, trace evaluation, and task-specific evals.","About the method",{},{"id":244,"data":913,"type":42,"tunes":915},{"text":914,"level":219},"Why citations are not enough",{},{"id":249,"data":917,"type":226,"tunes":919},{"text":918},"A citation answers only a narrow question: the system associated a claim or response with a source. It does not automatically establish that the source supports the specific claim, that the source is authoritative enough for the task, that the cited passage contains the necessary condition or exception, or that the model relied on that evidence rather than producing the answer from prior model knowledge.",{},{"id":254,"data":921,"type":226,"tunes":923},{"text":922},"Anthropic's guidance for research-agent evaluation explicitly separates groundedness, coverage, and source quality. OpenAI's agent-evaluation guidance similarly emphasizes traces because a final output does not reveal whether the agent selected the right tools or followed the intended workflow. Those ideas point to a broader conclusion: evidence quality is a property of the execution path, not just the final prose.",{},{"id":259,"data":925,"type":42,"tunes":927},{"text":926,"level":219},"The four questions every material claim should pass",{},{"id":264,"data":929,"type":287,"tunes":951},{"content":930,"stretched":43,"withHeadings":14},[931,935,939,943,947],[932,933,934],"Dimension","Question","Typical failure",[936,937,938],"Claim support","Does the evidence directly support this exact claim?","The source is topically related but does not establish the statement",[940,941,942],"Evidence authority","Is this an appropriate source for this kind of claim?","A secondary summary is used where a primary source or live system is required",[944,945,946],"Applicability","Does the evidence apply to this time, version, jurisdiction, user, state, or population?","A true statement is applied outside its valid conditions",[948,949,950],"Evidence use","Was this evidence actually available and used in the agent's execution path?","The final answer is correct, but the retrieved evidence was irrelevant or unused",{},{"id":290,"data":953,"type":42,"tunes":955},{"text":954,"level":218},"1. Claim support: does the source establish what the agent says?",{},{"id":295,"data":957,"type":226,"tunes":959},{"text":958},"Evidence should be evaluated at claim level. A document can be relevant to the subject and still fail to support a specific statement. If a source says that a feature is available in selected regions, the answer “the feature is available globally” is unsupported even though the citation looks plausible.",{},{"id":300,"data":961,"type":226,"tunes":963},{"text":962},"This is where broad “grounded \u002F not grounded” judgments are often too coarse. Split the response into material claims, map each claim to the smallest evidence span that supports it, and classify the relationship: direct support, partial support, contradiction, or no support.",{},{"id":305,"data":965,"type":42,"tunes":967},{"text":966,"level":218},"2. Evidence authority: is this the right kind of source?",{},{"id":310,"data":969,"type":226,"tunes":971},{"text":970},"Correct evidence selection is not only semantic relevance. The source must be suitable for the decision. Current account status should come from the account system, not an old email. An API behaviour claim should preferably be checked against current vendor documentation or reproducible behaviour. A legal requirement may need the applicable law, regulator, or authoritative guidance rather than a generic blog post.",{},{"id":315,"data":973,"type":226,"tunes":975},{"text":974},"Source authority is task-specific. A community report can be the best evidence for a real-world bug that vendor documentation does not acknowledge. A vendor announcement can be authoritative for what the vendor claims but weak evidence for independent performance. The evaluator therefore needs an explicit source hierarchy for the task rather than one universal authority score.",{},{"id":320,"data":977,"type":42,"tunes":979},{"text":978,"level":218},"3. Applicability: right evidence, wrong conditions",{},{"id":325,"data":981,"type":226,"tunes":983},{"text":982},"The most dangerous evidence errors are often not fabricated sources but valid sources used outside their boundary. A recommendation can change with software version, date, jurisdiction, hardware revision, user permissions, product availability, current game state, tenant configuration, or other environmental variables.",{},{"id":330,"data":985,"type":226,"tunes":987},{"text":986},"For each material source, preserve the conditions that determine whether it still applies. This is especially important after summarization: a compressed memory or citation may preserve the conclusion while dropping the exception, date, or prerequisite that made the conclusion valid.",{},{"id":335,"data":989,"type":234,"tunes":992},{"body":990,"title":991,"variant":339},"A real source, quoted accurately, can still produce a wrong answer when its time, version, population, jurisdiction, or state does not match the current question.","Evidence can be authentic and still be wrong for the answer",{},{"id":342,"data":994,"type":42,"tunes":996},{"text":995,"level":218},"4. Evidence use: did the agent actually rely on the evidence?",{},{"id":347,"data":998,"type":226,"tunes":1000},{"text":999},"An answer can be correct even when retrieval failed. The model may already know the answer, infer it from unrelated context, or simply guess correctly. If the evaluation checks only final correctness, the system may appear well-grounded while the evidence path is broken.",{},{"id":352,"data":1002,"type":226,"tunes":1004},{"text":1003},"To evaluate evidence use, inspect the trace. Confirm which sources were retrieved, which passages reached the model context, when they became available, and whether the final claim can be explained by those inputs. OpenAI's current agent-evaluation tooling emphasizes trace grading precisely because workflow-level behaviour cannot be reconstructed reliably from the final answer alone.",{},{"id":357,"data":1006,"type":42,"tunes":1008},{"text":1007,"level":219},"The Evidence Utilization Test",{},{"id":362,"data":1010,"type":226,"tunes":1012},{"text":1011},"A practical evaluation can be built as a controlled counterfactual. Instead of asking only whether the answer is correct, change the evidence and observe whether the claim changes in the expected direction.",{},{"id":367,"data":1014,"type":393,"tunes":1038},{"steps":1015,"title":1037,"orientation":392},[1016,1019,1022,1025,1028,1031,1034],{"label":1017,"description":1018},"1. Select one material claim","Choose a claim whose correctness matters and define the expected answer precisely.",{"label":1020,"description":1021},"2. Identify gold evidence","Provide the smallest authoritative evidence set sufficient to support the claim.",{"label":1023,"description":1024},"3. Run with gold evidence","Verify that the agent produces the supported answer when the correct evidence is available.",{"label":1026,"description":1027},"4. Remove the decisive evidence","Run the same task without the key supporting passage while keeping other inputs stable.",{"label":1029,"description":1030},"5. Replace it with contradictory or superseding evidence","Where safe, provide controlled evidence that changes the correct conclusion.",{"label":1032,"description":1033},"6. Compare the claims","Check whether the answer tracks the evidence change or remains anchored to prior model knowledge.",{"label":1035,"description":1036},"7. Inspect the trace","Confirm what was retrieved, what reached context, and what source or tool result preceded the claim.","Evidence Utilization Test",{},{"id":396,"data":1040,"type":234,"tunes":1043},{"body":1041,"title":1042,"variant":400},"If the decisive evidence changes but the agent's claim does not, you have evidence that the system may not be using retrieval as intended — even when the original answer happened to be correct.","The key signal",{},{"id":403,"data":1045,"type":42,"tunes":1047},{"text":1046,"level":219},"A claim–evidence matrix is more useful than a source list",{},{"id":408,"data":1049,"type":287,"tunes":1081},{"content":1050,"stretched":43,"withHeadings":14},[1051,1057,1064,1070,1076],[1052,1053,1054,1055,944,1056],"Claim","Evidence","Support","Authority","Used in trace",[1058,1059,1060,1061,1062,1063],"Feature X is available","Vendor documentation","Direct","High for availability claim","Current version and region must match","Yes \u002F No",[1065,1066,1067,1068,1069,1063],"Configuration Y is faster","Vendor benchmark","Partial","High for vendor's test, not independent performance","Hardware and workload must match",[1071,1072,1073,1074,1075,1063],"Policy applies to this user","Current policy + account state","Direct only when combined","High","Jurisdiction, date, role and account state must match",[1077,1078,1060,1079,1080,1063],"A product is in stock","Live inventory API","Authoritative for current stock","Expires quickly",{},{"id":443,"data":1083,"type":226,"tunes":1085},{"text":1084},"This matrix forces several questions that conventional citation checking hides. One claim can require multiple sources. One source can support only part of a claim. An authoritative source can have a short validity window. And a perfectly good source can be irrelevant if it never entered the execution path.",{},{"id":448,"data":1087,"type":42,"tunes":1089},{"text":1088,"level":219},"Separate retrieval quality from evidence quality",{},{"id":453,"data":1091,"type":226,"tunes":1093},{"text":1092},"Retrieval metrics ask whether relevant material was found and ranked. Evidence evaluation asks whether that material justifies the resulting claims. The two are related but not identical.",{},{"id":458,"data":1095,"type":489,"tunes":1117},{"rows":1096,"title":1109,"layout":287,"columns":1110},[1097,1100,1103,1106],{"id":462,"label":1098,"values":1099},"Right document, wrong claim",[465,465,465],{"id":467,"label":1101,"values":1102},"Right fact, stale source",[465,465,465],{"id":471,"label":1104,"values":1105},"Weak source, correct answer",[465,465,465],{"id":475,"label":1107,"values":1108},"Multiple sources required",[465,465,465],"Retrieval success is not evidence success",[1111,1113,1115],{"id":481,"label":1112},"Situation",{"id":484,"label":1114},"Retrieval",{"id":487,"label":1116},"Evidence quality",{},{"id":492,"data":1119,"type":42,"tunes":1121},{"text":1120,"level":219},"Evaluate source quality as a rubric, not a domain whitelist",{},{"id":497,"data":1123,"type":226,"tunes":1125},{"text":1124},"Hard-coded lists of “trusted domains” are tempting but often brittle. Source quality should instead reflect the claim type. Useful dimensions include primary versus secondary status, recency, directness, reproducibility, independence, domain expertise, data provenance, update cadence, and whether the source has an incentive to overstate the claim.",{},{"id":502,"data":1127,"type":226,"tunes":1129},{"text":1128},"Anthropic's research-agent evaluation guidance explicitly calls out source-quality checks alongside groundedness and coverage. The practical implementation should therefore grade both what the source says and whether this source is appropriate for this kind of statement.",{},{"id":507,"data":1131,"type":42,"tunes":1133},{"text":1132,"level":219},"Evidence coverage: every important claim needs support, not every sentence",{},{"id":512,"data":1135,"type":226,"tunes":1137},{"text":1136},"Not every sentence needs a citation. Transitional language, arithmetic derived transparently from cited values, or clearly marked interpretation may not require a separate source. But every material externally verifiable claim should have enough support that an evaluator can reconstruct why the agent was allowed to say it.",{},{"id":517,"data":1139,"type":226,"tunes":1141},{"text":1140},"Coverage should therefore be weighted by claim importance. Missing support for a decorative detail is not equivalent to missing support for a price, eligibility decision, safety instruction, legal requirement, technical compatibility statement, or recommendation-driving fact.",{},{"id":522,"data":1143,"type":42,"tunes":1145},{"text":1144,"level":219},"Evidence provenance must survive summarization and memory",{},{"id":527,"data":1147,"type":226,"tunes":1149},{"text":1148},"Long-running agents often summarize previous work or write durable memories. If evidence provenance is stripped during that transformation, future agents may retrieve a clean conclusion without knowing whether it came from a user statement, a live API, an old document, a model inference, or an unverified web result.",{},{"id":532,"data":1151,"type":226,"tunes":1153},{"text":1152},"For important facts, preserve at least the source identity, retrieval or observation time, evidence type, relevant version or state, and whether the stored text is quoted, summarized, inferred, or derived. Provenance is what allows a later agent to decide whether the evidence should be trusted, refreshed, restricted, or discarded.",{},{"id":537,"data":1155,"type":42,"tunes":1157},{"text":1156,"level":219},"A practical evidence record",{},{"id":542,"data":1159,"type":287,"tunes":1184},{"content":1160,"stretched":43,"withHeadings":14},[1161,1164,1166,1168,1170,1172,1174,1176,1178,1180,1182],[1162,1163],"Field","Purpose",[549,1165],"Identifies the material claim being supported",[552,1167],"Identifies where the evidence came from",[555,1169],"Preserves the smallest passage, record, or tool result that supports the claim",[558,1171],"Allows freshness and timeline checks",[561,1173],"Allows supersession and reproducibility checks",[564,1175],"Explains why this source is suitable for this claim",[567,1177],"Stores relevant date, jurisdiction, product version, user, tenant, state, or other conditions",[570,1179],"Marks whether evidence is raw, quoted, summarized, normalized, or derived",[573,1181],"Shows when the evidence became available to the agent",[576,1183],"Direct, partial, contradictory, unsupported, or uncertain",{},{"id":580,"data":1186,"type":42,"tunes":1188},{"text":1187,"level":219},"Failure modes that look grounded but are not",{},{"id":585,"data":1190,"type":287,"tunes":1228},{"content":1191,"stretched":43,"withHeadings":14},[1192,1196,1200,1204,1208,1212,1216,1220,1224],[1193,1194,1195],"Failure mode","Why it fools evaluators","What to test",[1197,1198,1199],"Citation decoration","The answer contains sources, so it looks researched","Map each material claim to an exact supporting span",[1201,1202,1203],"Authority mismatch","The source is reputable but not authoritative for the specific fact","Define claim-specific source hierarchy",[1205,1206,1207],"Temporal mismatch","The source was correct when published","Check retrieval time, source date, and superseding evidence",[1209,1210,1211],"Condition stripping","A summary keeps the conclusion but drops exceptions","Compare generated claim with full local source context",[1213,1214,1215],"Post-hoc citation","A plausible source is attached after the answer is generated","Inspect trace ordering and whether evidence preceded the claim",[1217,1218,1219],"Parametric override","The model ignores retrieved evidence and answers from prior knowledge","Run counterfactual evidence-utilization tests",[1221,1222,1223],"Evidence laundering","Model inference is summarized and later stored as if it were a source fact","Preserve transformation type and provenance across memory writes",[1225,1226,1227],"Source majority fallacy","Several secondary pages repeat the same unsupported statement","Trace claims back to independent or primary evidence",{},{"id":626,"data":1230,"type":42,"tunes":1232},{"text":1231,"level":219},"How to evaluate the agent in production",{},{"id":631,"data":1234,"type":393,"tunes":1261},{"steps":1235,"title":1260,"orientation":392},[1236,1239,1242,1245,1248,1251,1254,1257],{"label":1237,"description":1238},"1. Define material claims","Identify the facts, recommendations, or decisions whose correctness matters to the task.",{"label":1240,"description":1241},"2. Build gold evidence","Create reference evidence and source-quality expectations for representative cases.",{"label":1243,"description":1244},"3. Capture traces","Log retrieval queries, tool calls, returned evidence, context construction, model output, and citations.",{"label":1246,"description":1247},"4. Grade support","Check whether each material claim is directly, partially, contradictorily, or not supported.",{"label":1249,"description":1250},"5. Grade authority and applicability","Evaluate whether the source is appropriate and whether its conditions match the current task.",{"label":1252,"description":1253},"6. Run counterfactuals","Remove, replace, or supersede decisive evidence and test whether the answer follows the change.",{"label":1255,"description":1256},"7. Review high-impact failures","Use human or domain-expert review where automated grading is not reliable enough.",{"label":1258,"description":1259},"8. Convert failures into eval cases","Add production failures and edge cases to a repeatable regression dataset.","Evidence evaluation pipeline",{},{"id":661,"data":1263,"type":226,"tunes":1265},{"text":1264},"OpenAI's current evaluation guidance recommends task-specific evals, continuous evaluation, production-derived datasets, and traces for debugging agent behaviour. Anthropic likewise recommends combining grader types for research agents because correctness, source quality, coverage, and groundedness are separate dimensions. Evidence evaluation should follow the same pattern: several narrow graders are more diagnostic than one opaque “quality” score.",{},{"id":666,"data":1267,"type":42,"tunes":1269},{"text":1268,"level":219},"Do not let an LLM judge become the only evidence judge",{},{"id":671,"data":1271,"type":226,"tunes":1273},{"text":1272},"LLM graders are useful for scalable claim classification, relevance checks, and pairwise comparisons, but they can share the same blind spots as the system they evaluate. A grader may accept a plausible but unsupported claim, miss a subtle version boundary, or overrate a polished source.",{},{"id":676,"data":1275,"type":226,"tunes":1277},{"text":1276},"OpenAI's evaluation guidance recommends calibrating automated graders against human judgment and using clear, scoped criteria. For evidence-heavy systems, deterministic checks should be used wherever possible: timestamps, object versions, permission scope, exact source IDs, retrieval order, document hashes, and whether the evidence was present before the model generated the claim.",{},{"id":681,"data":1279,"type":42,"tunes":1281},{"text":1280,"level":219},"What would change this answer?",{},{"id":686,"data":1283,"type":226,"tunes":1285},{"text":1284},"The evaluation can be simpler when the agent operates over a small, immutable, authoritative corpus and every answer is strictly extractive. In that environment, source authority and applicability are mostly fixed, and claim-to-span support may be enough.",{},{"id":691,"data":1287,"type":226,"tunes":1289},{"text":1288},"The evaluation must become stricter when the agent mixes web search, long-term memory, live tools, multiple jurisdictions, rapidly changing information, user-specific state, or autonomous actions. In those systems, evidence validity depends not only on the source text but also on when and how the evidence was obtained.",{},{"id":696,"data":1291,"type":226,"tunes":1293},{"text":1292},"Future models may become better at internally tracking provenance and uncertainty, but that would not remove the need for external evidence records in systems that require auditability. A system should not depend on the model's self-report of what influenced it when traces and source metadata can provide stronger evidence.",{},{"id":701,"data":1295,"type":42,"tunes":1297},{"text":1296,"level":219},"Limitations",{},{"id":706,"data":1299,"type":226,"tunes":1301},{"text":1300},"It is not always possible to prove causal evidence use from traces alone. A source can be present in context without influencing the answer, and a model may independently know the same fact. Counterfactual tests strengthen the inference but can themselves change the task distribution.",{},{"id":711,"data":1303,"type":226,"tunes":1305},{"text":1304},"Source authority can also be contested or domain-dependent. Some questions have no single authoritative source, and experts may disagree about which evidence deserves more weight. In those cases the evaluator should preserve disagreement and score transparency, coverage, and reasoning against an explicit rubric rather than pretending there is one unquestioned source of truth.",{},{"id":716,"data":1307,"type":42,"tunes":1309},{"text":1308,"level":219},"Conclusion",{},{"id":721,"data":1311,"type":226,"tunes":1313},{"text":1312},"The question “Did the agent cite a source?” is too weak for production AI. The stronger question is: Did each important claim come from evidence that actually supports it, has the right authority, still applies to the current conditions, and was available in the execution path before the claim was made?",{},{"id":726,"data":1315,"type":226,"tunes":1317},{"text":1316},"That turns evidence from decoration into an evaluable system property. Capture the trace. Map claims to evidence. Check authority and applicability. Run counterfactual evidence tests. Preserve provenance through summaries and memory. Then a correct answer is not only plausible — it has an evidence path you can inspect.",{},{"id":731,"data":1319,"type":737,"tunes":1324},{"url":1320,"title":1321,"excerpt":1322,"ctaLabel":1323},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","Outcome correctness alone cannot prove that an agent's execution path was safe or reliable. This related article explains why trajectories, tools and intermediate decisions matter.","Read the related article",{},{"id":740,"data":1326,"type":737,"tunes":1331},{"url":1327,"title":1328,"excerpt":1329,"ctaLabel":1330},"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","From Research Protocol to a General AI Reasoning Framework","A practical reasoning method for separating evidence, assumptions, competing hypotheses and domain-specific validation.","Read the reasoning framework",{},{"id":748,"data":1333,"type":42,"tunes":1335},{"text":1334,"level":219},"FAQ",{},{"id":753,"data":1337,"type":753,"tunes":1355},{"items":1338,"title":1354},[1339,1342,1345,1348,1351],{"id":757,"answer":1340,"question":1341},"No. A citation may be relevant to the topic without supporting the exact claim, may come from the wrong authority, may no longer apply, or may have been attached without materially influencing the generated answer.","Does a citation prove that an AI answer is grounded?",{"id":761,"answer":1343,"question":1344},"Use a counterfactual evidence-utilization test: run the task with known-correct evidence, then remove or replace the decisive evidence while keeping other inputs stable. If the answer does not respond to the evidence change, inspect whether the model is relying on prior knowledge or another source.","How can I test whether an AI agent actually used retrieved evidence?",{"id":765,"answer":1346,"question":1347},"Groundedness asks whether claims are supported by the supplied evidence. Source quality asks whether the evidence itself is appropriate and authoritative enough for the type of claim being made.","What is the difference between groundedness and source quality?",{"id":769,"answer":1349,"question":1350},"The source may be stale, superseded, valid for another version, jurisdiction, user, population, or system state, or may contain conditions that were lost during retrieval or summarization.","Why can a real source still produce a wrong AI answer?",{"id":773,"answer":1352,"question":1353},"Log the retrieval query, returned sources, exact evidence spans, timestamps and versions, filters, final context, model output, citations, and trace ordering so evaluators can reconstruct what evidence was available before each material claim.","What should I log for evidence evaluation?","Evaluating evidence use in AI agents",{},{"id":779,"data":1357,"type":42,"tunes":1359},{"text":1358,"level":219},"Glossary",{},{"id":784,"data":1361,"type":784,"tunes":1379},{"title":1362,"entries":1363},"Key evidence-evaluation terms",[1364,1366,1368,1370,1373,1376],{"term":936,"anchor":789,"definition":1365},"The degree to which a specific evidence span directly establishes a generated claim.",{"term":940,"anchor":792,"definition":1367},"How appropriate a source is for establishing a particular type of claim, given its role, provenance and relationship to the underlying fact.",{"term":944,"anchor":567,"definition":1369},"The conditions under which evidence remains valid for a claim, including time, version, jurisdiction, user, population, system state or other boundaries.",{"term":1371,"anchor":798,"definition":1372},"Evidence utilization","Whether the agent's output actually responds to and depends on the evidence made available in its execution path.",{"term":1374,"anchor":802,"definition":1375},"Counterfactual evidence test","An evaluation that removes, replaces or changes decisive evidence to test whether the agent's claim changes appropriately.",{"term":1377,"anchor":806,"definition":1378},"Provenance","Metadata that records where evidence came from, when it was obtained, how it was transformed and what version or state it represented.",{},{"id":810,"data":1381,"type":42,"tunes":1383},{"text":1382,"level":219},"Primary sources and further reading",{},{"id":815,"data":1385,"type":822,"tunes":1389},{"link":817,"meta":1386},{"image":1387,"title":820,"description":1388},{"url":465},"Guidance on trace grading, workflow-level evaluation, datasets and repeatable eval runs for agents.",{},{"id":825,"data":1391,"type":822,"tunes":1395},{"link":827,"meta":1392},{"image":1393,"title":830,"description":1394},{"url":465},"Guidance on task-specific evals, production-derived datasets, scoped metrics, continuous evaluation and grader calibration.",{},{"id":834,"data":1397,"type":822,"tunes":1401},{"link":836,"meta":1398},{"image":1399,"title":839,"description":1400},{"url":465},"Agent-evaluation guidance including groundedness, coverage and source-quality checks for research agents.",{},{"id":843,"data":1403,"type":822,"tunes":1407},{"link":845,"meta":1404},{"image":1405,"title":848,"description":1406},{"url":465},"Evaluation guidance emphasizing that modern agent performance depends on workflow and environment, not only final model output.",{},"2.31.6","An AI agent can cite sources and still use the wrong evidence. This article introduces a practical method for checking claim support, source authority, applicability, provenance, and whether the evidence actually influenced the answer.",{"lang":7,"title":208,"content":210,"contentJson":1411,"excerpt":852},{"time":212,"blocks":1412,"version":851},[1413,1416,1419,1422,1425,1428,1431,1434,1437,1446,1449,1452,1455,1458,1461,1464,1467,1470,1473,1476,1479,1482,1485,1488,1491,1502,1505,1508,1517,1520,1523,1526,1542,1545,1548,1551,1554,1557,1560,1563,1566,1569,1572,1587,1590,1603,1606,1618,1621,1624,1627,1630,1633,1636,1639,1642,1645,1648,1651,1654,1657,1660,1663,1666,1669,1678,1681,1691,1694,1699,1704,1709],{"id":215,"data":1414,"type":220,"tunes":1415},{"title":217,"maxLevel":218,"minLevel":219},{},{"id":223,"data":1417,"type":226,"tunes":1418},{"text":225},{},{"id":229,"data":1420,"type":234,"tunes":1421},{"body":231,"title":232,"variant":233},{},{"id":237,"data":1423,"type":234,"tunes":1424},{"body":239,"title":240,"variant":241},{},{"id":244,"data":1426,"type":42,"tunes":1427},{"text":246,"level":219},{},{"id":249,"data":1429,"type":226,"tunes":1430},{"text":251},{},{"id":254,"data":1432,"type":226,"tunes":1433},{"text":256},{},{"id":259,"data":1435,"type":42,"tunes":1436},{"text":261,"level":219},{},{"id":264,"data":1438,"type":287,"tunes":1445},{"content":1439,"stretched":43,"withHeadings":14},[1440,1441,1442,1443,1444],[268,269,270],[272,273,274],[276,277,278],[280,281,282],[284,285,286],{},{"id":290,"data":1447,"type":42,"tunes":1448},{"text":292,"level":218},{},{"id":295,"data":1450,"type":226,"tunes":1451},{"text":297},{},{"id":300,"data":1453,"type":226,"tunes":1454},{"text":302},{},{"id":305,"data":1456,"type":42,"tunes":1457},{"text":307,"level":218},{},{"id":310,"data":1459,"type":226,"tunes":1460},{"text":312},{},{"id":315,"data":1462,"type":226,"tunes":1463},{"text":317},{},{"id":320,"data":1465,"type":42,"tunes":1466},{"text":322,"level":218},{},{"id":325,"data":1468,"type":226,"tunes":1469},{"text":327},{},{"id":330,"data":1471,"type":226,"tunes":1472},{"text":332},{},{"id":335,"data":1474,"type":234,"tunes":1475},{"body":337,"title":338,"variant":339},{},{"id":342,"data":1477,"type":42,"tunes":1478},{"text":344,"level":218},{},{"id":347,"data":1480,"type":226,"tunes":1481},{"text":349},{},{"id":352,"data":1483,"type":226,"tunes":1484},{"text":354},{},{"id":357,"data":1486,"type":42,"tunes":1487},{"text":359,"level":219},{},{"id":362,"data":1489,"type":226,"tunes":1490},{"text":364},{},{"id":367,"data":1492,"type":393,"tunes":1501},{"steps":1493,"title":391,"orientation":392},[1494,1495,1496,1497,1498,1499,1500],{"label":371,"description":372},{"label":374,"description":375},{"label":377,"description":378},{"label":380,"description":381},{"label":383,"description":384},{"label":386,"description":387},{"label":389,"description":390},{},{"id":396,"data":1503,"type":234,"tunes":1504},{"body":398,"title":399,"variant":400},{},{"id":403,"data":1506,"type":42,"tunes":1507},{"text":405,"level":219},{},{"id":408,"data":1509,"type":287,"tunes":1516},{"content":1510,"stretched":43,"withHeadings":14},[1511,1512,1513,1514,1515],[412,413,414,415,280,416],[418,419,420,421,422,423],[425,426,427,428,429,423],[431,432,433,434,435,423],[437,438,420,439,440,423],{},{"id":443,"data":1518,"type":226,"tunes":1519},{"text":445},{},{"id":448,"data":1521,"type":42,"tunes":1522},{"text":450,"level":219},{},{"id":453,"data":1524,"type":226,"tunes":1525},{"text":455},{},{"id":458,"data":1527,"type":489,"tunes":1541},{"rows":1528,"title":478,"layout":287,"columns":1537},[1529,1531,1533,1535],{"id":462,"label":463,"values":1530},[465,465,465],{"id":467,"label":468,"values":1532},[465,465,465],{"id":471,"label":472,"values":1534},[465,465,465],{"id":475,"label":476,"values":1536},[465,465,465],[1538,1539,1540],{"id":481,"label":482},{"id":484,"label":485},{"id":487,"label":488},{},{"id":492,"data":1543,"type":42,"tunes":1544},{"text":494,"level":219},{},{"id":497,"data":1546,"type":226,"tunes":1547},{"text":499},{},{"id":502,"data":1549,"type":226,"tunes":1550},{"text":504},{},{"id":507,"data":1552,"type":42,"tunes":1553},{"text":509,"level":219},{},{"id":512,"data":1555,"type":226,"tunes":1556},{"text":514},{},{"id":517,"data":1558,"type":226,"tunes":1559},{"text":519},{},{"id":522,"data":1561,"type":42,"tunes":1562},{"text":524,"level":219},{},{"id":527,"data":1564,"type":226,"tunes":1565},{"text":529},{},{"id":532,"data":1567,"type":226,"tunes":1568},{"text":534},{},{"id":537,"data":1570,"type":42,"tunes":1571},{"text":539,"level":219},{},{"id":542,"data":1573,"type":287,"tunes":1586},{"content":1574,"stretched":43,"withHeadings":14},[1575,1576,1577,1578,1579,1580,1581,1582,1583,1584,1585],[546,547],[549,550],[552,553],[555,556],[558,559],[561,562],[564,565],[567,568],[570,571],[573,574],[576,577],{},{"id":580,"data":1588,"type":42,"tunes":1589},{"text":582,"level":219},{},{"id":585,"data":1591,"type":287,"tunes":1602},{"content":1592,"stretched":43,"withHeadings":14},[1593,1594,1595,1596,1597,1598,1599,1600,1601],[589,590,591],[593,594,595],[597,598,599],[601,602,603],[605,606,607],[609,610,611],[613,614,615],[617,618,619],[621,622,623],{},{"id":626,"data":1604,"type":42,"tunes":1605},{"text":628,"level":219},{},{"id":631,"data":1607,"type":393,"tunes":1617},{"steps":1608,"title":658,"orientation":392},[1609,1610,1611,1612,1613,1614,1615,1616],{"label":635,"description":636},{"label":638,"description":639},{"label":641,"description":642},{"label":644,"description":645},{"label":647,"description":648},{"label":650,"description":651},{"label":653,"description":654},{"label":656,"description":657},{},{"id":661,"data":1619,"type":226,"tunes":1620},{"text":663},{},{"id":666,"data":1622,"type":42,"tunes":1623},{"text":668,"level":219},{},{"id":671,"data":1625,"type":226,"tunes":1626},{"text":673},{},{"id":676,"data":1628,"type":226,"tunes":1629},{"text":678},{},{"id":681,"data":1631,"type":42,"tunes":1632},{"text":683,"level":219},{},{"id":686,"data":1634,"type":226,"tunes":1635},{"text":688},{},{"id":691,"data":1637,"type":226,"tunes":1638},{"text":693},{},{"id":696,"data":1640,"type":226,"tunes":1641},{"text":698},{},{"id":701,"data":1643,"type":42,"tunes":1644},{"text":703,"level":219},{},{"id":706,"data":1646,"type":226,"tunes":1647},{"text":708},{},{"id":711,"data":1649,"type":226,"tunes":1650},{"text":713},{},{"id":716,"data":1652,"type":42,"tunes":1653},{"text":718,"level":219},{},{"id":721,"data":1655,"type":226,"tunes":1656},{"text":723},{},{"id":726,"data":1658,"type":226,"tunes":1659},{"text":728},{},{"id":731,"data":1661,"type":737,"tunes":1662},{"url":733,"title":734,"excerpt":735,"ctaLabel":736},{},{"id":740,"data":1664,"type":737,"tunes":1665},{"url":742,"title":743,"excerpt":744,"ctaLabel":745},{},{"id":748,"data":1667,"type":42,"tunes":1668},{"text":750,"level":219},{},{"id":753,"data":1670,"type":753,"tunes":1677},{"items":1671,"title":776},[1672,1673,1674,1675,1676],{"id":757,"answer":758,"question":759},{"id":761,"answer":762,"question":763},{"id":765,"answer":766,"question":767},{"id":769,"answer":770,"question":771},{"id":773,"answer":774,"question":775},{},{"id":779,"data":1679,"type":42,"tunes":1680},{"text":781,"level":219},{},{"id":784,"data":1682,"type":784,"tunes":1690},{"title":786,"entries":1683},[1684,1685,1686,1687,1688,1689],{"term":272,"anchor":789,"definition":790},{"term":276,"anchor":792,"definition":793},{"term":280,"anchor":567,"definition":795},{"term":797,"anchor":798,"definition":799},{"term":801,"anchor":802,"definition":803},{"term":805,"anchor":806,"definition":807},{},{"id":810,"data":1692,"type":42,"tunes":1693},{"text":812,"level":219},{},{"id":815,"data":1695,"type":822,"tunes":1698},{"link":817,"meta":1696},{"image":1697,"title":820,"description":821},{"url":465},{},{"id":825,"data":1700,"type":822,"tunes":1703},{"link":827,"meta":1701},{"image":1702,"title":830,"description":831},{"url":465},{},{"id":834,"data":1705,"type":822,"tunes":1708},{"link":836,"meta":1706},{"image":1707,"title":839,"description":840},{"url":465},{},{"id":843,"data":1710,"type":822,"tunes":1713},{"link":845,"meta":1711},{"image":1712,"title":848,"description":849},{"url":465},{},"Post erfolgreich abgerufen",{"items":1716,"source":1780,"manualIds":1781,"manualMatchedIds":1782},[1717,1724,1731,1738,1745,1752,1759,1766,1773],{"id":1718,"slug":1719,"title":1720,"excerpt":1721,"featuredImage":1722,"publishedAt":1723},"456","zbt-z8102ax-hardware-packaging-review","Reseña de hardware y embalaje del ZBT Z8102AX: Router fuerte, caja débil","El ZBT Z8102AX causa una primera impresión sólida como un delgado router OpenWrt 5G de metal negro con múltiples conectores de antena, ranuras para doble SIM, puertos USB, LAN\u002FWAN y un práctico juego de accesorios. El hardware se siente útil y serio, pero el embalaje es claramente el punto débil.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-02-1781620590938-y33j4b.webp","2026-06-16T04:40:00.000Z",{"id":1725,"slug":1726,"title":1727,"excerpt":1728,"featuredImage":1729,"publishedAt":1730},"477","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","Agentes de uso de computadoras: por qué una demostración exitosa aún puede ser un sistema poco confiable","Los agentes de uso de computadoras ahora pueden completar impresionantes flujos de trabajo en el navegador y en el escritorio, pero una ejecución exitosa demuestra capacidad—no fiabilidad. Este artículo muestra cómo probar la repetibilidad, la robustez ambiental, el control de horizonte largo, la conciencia del estado, la verificación de resultados y la gestión segura de objetivos.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","2026-09-25T12:13:00.000Z",{"id":1732,"slug":1733,"title":1734,"excerpt":1735,"featuredImage":1736,"publishedAt":1737},"467","the-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","El límite de validez de la respuesta: la capa faltante entre la relevancia y las respuestas fiables de la IA","Una fuente puede ser relevante, autorizada y aun así ser incorrecta para la pregunta que se plantea. La capa que falta es la aplicabilidad: las condiciones bajo las cuales una respuesta es válida y los cambios que obligan a reconsiderarla. Este artículo presenta el Límite de Validez de la Respuesta como un patrón de diseño de fuentes para personas, sistemas de búsqueda con IA y sistemas RAG.","\u002Fuploads\u002F2026\u002F09\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers-1790272901306-1g5jly.webp","2026-09-24T11:59:00.000Z",{"id":1739,"slug":1740,"title":1741,"excerpt":1742,"featuredImage":1743,"publishedAt":1744},"470","what-should-an-ai-agent-remember-forget-recompute-or-retrieve-again","¿Qué debería recordar, olvidar, recalcular o volver a recuperar un agente de IA?","Los agentes de larga duración no deberían recordarlo todo. Este artículo proporciona un modelo práctico de ciclo de vida para decidir qué pertenece a la memoria duradera, qué se debería recuperar de nuevo, qué es más seguro recalcular y qué debería expirar o ser sustituido.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-should-an-ai-agent-remember-forget-recompute-or-retrieve-again-1790351131087-iehz28.webp","2026-09-25T09:43:00.000Z",{"id":1746,"slug":1747,"title":1748,"excerpt":1749,"featuredImage":1750,"publishedAt":1751},"383","canonical-architecture-url-design-resolver-logic-api-scalability-specification","Arquitectura Canónica, Diseño de URL, Lógica del Resolvedor, Especificación de API y Escalabilidad","Arquitectura de descubrimiento geobasada para portales multi-inquilino. Define URL canónicas, lógica de resolución, estrategia de caché y un modelo de lectura geográfico sin acoplamiento con CMS ni refactorización de base de datos. Diseñada para la estabilidad SEO, la escalabilidad y futuras extensiones como reservas y mapas.","\u002Fuploads\u002F2026\u002F01\u002Fcanonical-architecture-url-design-resolver-logic-api-scalability-specification-1769890763607-7rghbp.webp","2026-01-31T06:12:00.000Z",{"id":1753,"slug":1754,"title":1755,"excerpt":1756,"featuredImage":1757,"publishedAt":1758},"472","why-more-context-can-make-ai-answers-worse","Por qué más contexto puede empeorar las respuestas de la IA","Una ventana de contexto más grande no garantiza una mejor respuesta. Este artículo explica cómo la dilución de la señal, la evidencia contradictoria, el estado obsoleto, la sensibilidad a la posición y la compresión con pérdidas pueden reducir la fiabilidad de la IA—e introduce una práctica Prueba de Presión de Contexto.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z",{"id":1760,"slug":1761,"title":1762,"excerpt":1763,"featuredImage":1764,"publishedAt":1765},"457","should-you-buy-5g-openwrt-router-old-firmware","¿Deberías Comprar un Router OpenWrt 5G con Firmware Antiguo? El ZBT Z8102AX como Ejemplo Práctico","Comprar un router 5G OpenWrt con firmware antiguo puede tener sentido, pero solo bajo las condiciones adecuadas. El ZBT Z8102AX muestra claramente ambos lados: el hardware es útil, el módem funciona y el router se mantuvo estable en las pruebas, pero OpenWrt 21.02, el embalaje débil y las rutas de actualización poco claras requieren una decisión de compra cuidadosa.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1767,"slug":1768,"title":1769,"excerpt":1770,"featuredImage":1771,"publishedAt":1772},"476","mcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained","MCP vs A2A vs UCP vs AP2 vs A2UI: La pila de protocolos de agentes explicada","MCP, A2A, UCP, AP2 y A2UI a menudo se presentan como estándares de agentes competidores. En su mayoría, resuelven diferentes problemas de interoperabilidad. Esta guía mapea cada protocolo con el límite que realmente estandariza—y muestra cómo pueden funcionar juntos en un sistema de producción.","\u002Fuploads\u002F2026\u002F09\u002Fmcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained-1790352625869-2ezle0.webp","2026-09-25T12:09:00.000Z",{"id":1774,"slug":1775,"title":1776,"excerpt":1777,"featuredImage":1778,"publishedAt":1779},"454","zbt-z8102ax-rm500u-ea-5g-modem-test","Quectel RM500U-EA en el ZBT Z8102AX: Bandas 5G, o2 Alemania y comportamiento de la señal en el mundo real","El ZBT Z8102AX utiliza un módem Quectel RM500U-EA para conectividad 4G y 5G. En la primera prueba práctica, el router se conectó con éxito a o2 Alemania con LTE Banda 3 y NR n28. El módem funciona, pero diagnósticos más profundos como RSRP, RSRQ, SINR, bloqueo de bandas y comportamiento de la celda aún necesitan pruebas adecuadas.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-06-1781620597879-qay2sx.webp","2026-06-16T08:39:00.000Z","fallback",[],[]]