[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:es":3,"public-menus:all":38,"post:rag-failed-but-which-layer-actually-failed-a-diagnostic-method:es":205,"related:post:rag-failed-but-which-layer-actually-failed-a-diagnostic-method:es:1":1685},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","es","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1684},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":834,"featuredImage":835,"featuredImageAlt":836,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":837,"publishedAt":838,"createdAt":839,"updatedAt":840,"seoLocalePaths":841,"categories":850,"author":863,"translations":868},"469","RAG falló — ¿Pero qué capa falló realmente? Un método de diagnóstico","rag-failed-but-which-layer-actually-failed-a-diagnostic-method","{\"time\":1790369130929,\"blocks\":[{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Un sistema RAG devuelve una respuesta débil, incorrecta, incompleta o sin respaldo. El diagnóstico habitual es \\\"falló la recuperación\\\" o \\\"el modelo alucinó\\\". Ambas etiquetas son demasiado amplias para ser útiles. Un pipeline RAG en producción puede fallar antes de la recuperación, durante la recuperación, durante el ranking, durante el ensamblaje del contexto, durante la generación o después de la generación, cuando se verifican la evidencia y la validez.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Respuesta directa\",\"body\":\"\u003Cstrong>No depures RAG como un solo componente.\u003C\u002Fstrong> Diagnostícalo como una cadena de capas comprobables de forma independiente. Primero determina si la evidencia requerida existe en una fuente autorizada. Luego prueba la construcción de la consulta, la recuperación de candidatos, el ranking, el ensamblaje del contexto, la generación, la atribución de evidencia y la vigencia. La técnica de aislamiento más rápida es una \u003Cstrong>prueba de contexto oráculo\u003C\u002Fstrong>: proporciona manualmente la evidencia correcta al generador. Si la respuesta se vuelve correcta, el fallo dominante está aguas arriba de la generación. Si sigue siendo incorrecta, la recuperación no es el problema principal.\"},\"tunes\":{}},{\"id\":\"model-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"Sobre el modelo de diagnóstico\",\"body\":\"La Pila de Fallos de RAG en este artículo es un modelo de diagnóstico práctico, no un estándar formal de la industria. Las plataformas existentes ya separan las métricas de solo recuperación de las métricas de recuperación y generación; este modelo extiende esa separación a un método de depuración de producción paso a paso.\"},\"tunes\":{}},{\"id\":\"toc\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contenido\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"h-not-diagnosis\",\"type\":\"header\",\"data\":{\"text\":\"Por qué \\\"RAG falló\\\" no es un diagnóstico\",\"level\":2},\"tunes\":{}},{\"id\":\"p-not-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"La generación aumentada por recuperación combina varios mecanismos: se interpreta una solicitud del usuario, se construyen una o más búsquedas, se recupera material candidato, se filtran o reordenan los resultados, se inserta la evidencia seleccionada en un contexto del modelo y un modelo genera una respuesta. Los sistemas en producción pueden añadir permisos, filtros de metadatos, reglas de vigencia, citas, reescritura de consultas, búsqueda híbrida, llamadas a herramientas, memoria y estado externo.\"},\"tunes\":{}},{\"id\":\"p-not-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Por lo tanto, una respuesta final incorrecta no te dice qué componente falló. El modelo puede haber recibido la evidencia incorrecta. Puede haber recibido la evidencia correcta mezclada con demasiado ruido. La evidencia puede ser correcta pero estar desactualizada. La fuente puede que nunca haya contenido la respuesta. O el modelo puede haber ignorado un contexto perfectamente adecuado.\"},\"tunes\":{}},{\"id\":\"p-not-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"La guía de RAG de OpenAI ya establece una distinción fundamental entre fallo de recuperación y fallo del modelo: un sistema puede proporcionar el contexto incorrecto, o puede proporcionar el contexto correcto y aun así generar la respuesta incorrecta. AWS de manera similar separa la evaluación de solo recuperación de la evaluación de recuperación y generación. Para el diagnóstico en producción, esa distinción debería llevarse más lejos.\"},\"tunes\":{}},{\"id\":\"h-stack\",\"type\":\"header\",\"data\":{\"text\":\"La pila de fallos de RAG\",\"level\":2},\"tunes\":{}},{\"id\":\"table-stack\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Capa\",\"Pregunta\",\"Fallo típico\"],[\"1. Cobertura de fuentes\",\"¿Existe la evidencia requerida en una fuente autorizada permitida?\",\"El corpus no puede responder la pregunta en absoluto\"],[\"2. Construcción de la consulta\",\"¿Buscó el sistema lo correcto?\",\"Se pierden la intención, las entidades, los filtros, el idioma o las restricciones temporales\"],[\"3. Recuperación de candidatos\",\"¿Entró la evidencia relevante en el conjunto de candidatos?\",\"Baja exhaustividad; el fragmento correcto nunca se recupera\"],[\"4. Ranking y filtrado\",\"¿Sobrevivió la evidencia correcta y quedó clasificada lo suficientemente alto?\",\"La evidencia relevante queda enterrada, filtrada o superada por texto superficialmente similar\"],[\"5. Ensamblaje del contexto\",\"¿Recibió el modelo evidencia utilizable?\",\"Truncamiento, límites de fragmentos deficientes, duplicados, pasajes contradictorios o sobrecarga de contexto\"],[\"6. Generación\",\"¿Usó el modelo correctamente la evidencia proporcionada?\",\"Inferencia sin respaldo, fallo de instrucciones, error de razonamiento o desajuste de rechazo\"],[\"7. Atribución de evidencia\",\"¿Se puede rastrear la respuesta hasta la evidencia que afirma usar?\",\"Citas faltantes, débiles o incorrectas; las afirmaciones exceden el respaldo recuperado\"],[\"8. Validez y vigencia\",\"¿Sigue siendo válida la evidencia para esta pregunta ahora?\",\"Evidencia histórica correcta se reutiliza fuera de su tiempo, versión, jurisdicción o estado válidos\"]]},\"tunes\":{}},{\"id\":\"h-source\",\"type\":\"header\",\"data\":{\"text\":\"Capa 1 — Cobertura de fuentes: ¿puede el sistema responder esto en absoluto?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-source-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Antes de ajustar embeddings, rerankers o prompts, verifica que la respuesta exista en el espacio de conocimiento que el sistema tiene permitido usar. Esto suena obvio, pero muchos fallos de RAG son en realidad fallos del corpus. El hecho solicitado puede estar ausente, oculto en un archivo adjunto no indexado, disponible solo en un documento más reciente, almacenado en un sistema fuera del corpus de RAG o bloqueado por permisos.\"},\"tunes\":{}},{\"id\":\"p-source-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Una métrica de recuperación no puede recuperar información que nunca fue indexada. Un top-k más grande no puede recuperar un documento que el pipeline no contiene. Si la prueba de cobertura de fuentes falla, la solución correcta es la ingesta, la selección de fuentes, los permisos o un comportamiento explícito de \\\"no se puede responder con la evidencia disponible\\\".\"},\"tunes\":{}},{\"id\":\"source-warning\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Patrón de fallo\",\"body\":\"Los equipos a menudo ajustan la recuperación con preguntas que el corpus en realidad no puede responder. Esto puede hacer que el recuperador sea mejor encontrando texto relacionado mientras deja intacta la brecha de información subyacente.\"},\"tunes\":{}},{\"id\":\"h-query\",\"type\":\"header\",\"data\":{\"text\":\"Capa 2 — Construcción de la consulta: ¿le preguntó el sistema al corpus la pregunta correcta?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-query-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"La consulta del usuario no siempre es la consulta de recuperación. Los sistemas en producción reescriben preguntas, resuelven pronombres, extraen entidades, traducen idiomas, añaden restricciones de metadatos, dividen preguntas complejas o generan múltiples búsquedas. Cada transformación puede mejorar la recuperación, pero cada transformación también puede destruir información.\"},\"tunes\":{}},{\"id\":\"p-query-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Una solicitud como \\\"¿Sigue aplicándose la política a los contratistas en Alemania después de la actualización de septiembre?\\\" contiene al menos una entidad, una población, una jurisdicción y un límite temporal. Una consulta reescrita que se convierte en \\\"política de contratistas\\\" puede recuperar texto semánticamente relacionado mientras pierde las variables que deciden si la respuesta es válida.\"},\"tunes\":{}},{\"id\":\"h-retrieval\",\"type\":\"header\",\"data\":{\"text\":\"Capa 3 — Recuperación de candidatos: ¿entró el conjunto la evidencia relevante?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-ret-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"La recuperación de candidatos es principalmente un problema de exhaustividad. La pregunta de diagnóstico aún no es si el mejor resultado quedó en primer lugar; es si apareció evidencia relevante en algún lugar del conjunto de candidatos. Si la fuente correcta conocida no aparece, investiga la indexación, la fragmentación, las incrustaciones, la coincidencia léxica, los metadatos, la búsqueda híbrida, el manejo del idioma, los sinónimos y la expansión de consultas.\"},\"tunes\":{}},{\"id\":\"p-ret-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Aquí es donde la evaluación solo de recuperación es valiosa. AWS expone la relevancia del contexto y la cobertura del contexto para la evaluación de RAG solo de recuperación. El hábito de producción importante es evaluar la recuperación antes de la generación para que una respuesta final pulida no pueda ocultar un conjunto de candidatos débil.\"},\"tunes\":{}},{\"id\":\"h-ranking\",\"type\":\"header\",\"data\":{\"text\":\"Capa 4 — Clasificación y filtrado: ¿se descartó o enterró la evidencia correcta?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-rank-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Un sistema puede tener buena exhaustividad y aun así fallar porque la evidencia relevante se clasifica por debajo de material ruidoso pero semánticamente similar. Los reranqueadores, los impulsos de recencia, los pesos de autoridad, las preferencias de idioma, los filtros de inquilinos, los controles de acceso, los filtros de estado del producto y la deduplicación cambian lo que sobrevive hasta el contexto final.\"},\"tunes\":{}},{\"id\":\"p-rank-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Por lo tanto, la depuración debe preservar la lista completa de candidatos, no solo el top-k final. Si la evidencia dorada se recuperó en el puesto 18 y un reranqueador la eliminó, la solución no es la misma que la de un fallo de recuperación.\"},\"tunes\":{}},{\"id\":\"h-context\",\"type\":\"header\",\"data\":{\"text\":\"Capa 5 — Ensamblaje del contexto: ¿se convirtió la evidencia útil en contexto utilizable?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-ctx-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"El éxito de la recuperación no garantiza el éxito del contexto. Los fragmentos relevantes pueden truncarse, separarse de sus calificadores, duplicarse hasta dominar el prompt, mezclarse con versiones contradictorias o rodearse de suficiente texto irrelevante como para que el pasaje decisivo pierda prominencia.\"},\"tunes\":{}},{\"id\":\"p-ctx-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Los límites de los fragmentos son especialmente importantes. Una oración puede contener la regla mientras que la siguiente contiene la excepción. Si se indexan por separado y solo se recupera la primera, el recuperador puede parecer relevante mientras que el contexto ensamblado se vuelve engañoso.\"},\"tunes\":{}},{\"id\":\"h-generation\",\"type\":\"header\",\"data\":{\"text\":\"Capa 6 — Generación: ¿puede el modelo usar correctamente la evidencia correcta?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-gen-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Una vez que el sistema ha suministrado de manera demostrable evidencia suficiente, la generación se vuelve comprobable de forma independiente. El modelo puede generalizar en exceso, combinar pasajes incompatibles, ignorar una declaración negativa, no seguir el formato de respuesta solicitado, inventar un puente entre hechos o responder desde la memoria paramétrica en lugar de la evidencia recuperada.\"},\"tunes\":{}},{\"id\":\"p-gen-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Por eso la corrección de extremo a extremo por sí sola es insuficiente para el diagnóstico. OpenAI recomienda la evaluación como una forma estructurada de comprender el comportamiento de la aplicación, mientras que la guía de evaluación de agentes de Anthropic enfatiza múltiples ensayos, evaluadores, rastros y casos de fallo realistas. Para RAG, el generador debe probarse tanto con recuperación normal como con contexto dorado controlado.\"},\"tunes\":{}},{\"id\":\"h-evidence\",\"type\":\"header\",\"data\":{\"text\":\"Capa 7 — Atribución de evidencia: ¿está realmente respaldada la respuesta?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-evidence-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Una respuesta plausible con citas aún puede estar débilmente fundamentada. El documento citado puede ser relevante para el tema pero no respaldar la afirmación específica. Una oración puede estar respaldada mientras que otra se infiere. Una cita puede apuntar a una fuente que contradice la respuesta una vez que se leen sus condiciones.\"},\"tunes\":{}},{\"id\":\"p-evidence-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Por lo tanto, la evaluación de citas pertenece después de la generación. AWS distingue la precisión de las citas de la cobertura de las citas: si los pasajes citados están citados correctamente y si la respuesta está suficientemente respaldada por citas. En producción, el respaldo a nivel de afirmación es más útil que tratar la presencia de cualquier cita como calidad de evidencia.\"},\"tunes\":{}},{\"id\":\"h-validity\",\"type\":\"header\",\"data\":{\"text\":\"Capa 8 — Validez y actualidad: ¿era la evidencia correcta para esta versión de la realidad?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-valid-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"RAG puede recuperar una fuente perfectamente auténtica, altamente relevante y fielmente citada y aun así producir una respuesta incorrecta si la fuente ya no es válida para la pregunta actual. Las políticas cambian. Las API se deprecan. Los precios se mueven. El comportamiento del software cambia entre versiones. El inventario de productos cambia. Los permisos cambian. Los parches de juegos cambian la mecánica.\"},\"tunes\":{}},{\"id\":\"p-valid-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Esta es una clase de fallo separada de la alucinación. La evidencia es real; su aplicabilidad es incorrecta. Por lo tanto, un sistema robusto necesita marcas de tiempo, metadatos de versión o jurisdicción cuando sea relevante, autoridad de la fuente, reglas de sustitución y un mecanismo explícito para decidir cuándo debe restringirse o abandonarse la evidencia más antigua.\"},\"tunes\":{}},{\"id\":\"h-oracle\",\"type\":\"header\",\"data\":{\"text\":\"El método de aislamiento más rápido: la prueba de contexto oráculo\",\"level\":2},\"tunes\":{}},{\"id\":\"p-oracle-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"La primera división más útil es simple: proporciona manualmente al generador un pequeño conjunto de evidencia que sabes que es suficiente para responder la pregunta. Mantén la tarea y la respuesta esperada sin cambios.\"},\"tunes\":{}},{\"id\":\"oracle-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Prueba de contexto oráculo\",\"layout\":\"table\",\"columns\":[{\"id\":\"result\",\"label\":\"Resultado\"},{\"id\":\"meaning\",\"label\":\"Interpretación probable\"},{\"id\":\"next\",\"label\":\"Siguiente paso de diagnóstico\"}],\"rows\":[{\"id\":\"oracle-pass\",\"label\":\"La respuesta se vuelve correcta\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"oracle-fail\",\"label\":\"La respuesta sigue siendo incorrecta\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"oracle-partial\",\"label\":\"La respuesta mejora pero sigue siendo incompleta\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"oracle-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"Por qué esta prueba es poderosa\",\"body\":\"La prueba de contexto oráculo elimina la mayor parte del pipeline de recuperación del experimento. No prueba que la generación sea perfecta, pero te da un contrafactual rápido: \u003Cstrong>¿qué haría el modelo si la recuperación ya hubiera tenido éxito?\u003C\u002Fstrong>\"},\"tunes\":{}},{\"id\":\"h-sequence\",\"type\":\"header\",\"data\":{\"text\":\"Una secuencia de diagnóstico en producción\",\"level\":2},\"tunes\":{}},{\"id\":\"diag-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Diagnostica el fallo desde la evidencia hasta la respuesta\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Define la afirmación esperada\",\"description\":\"Escribe la respuesta esperada, la incertidumbre permitida y la evidencia que la justificaría.\"},{\"label\":\"2. Verifica la cobertura de fuentes\",\"description\":\"Confirma que existe evidencia autorizada y permitida en el conjunto de fuentes indexadas o accesibles.\"},{\"label\":\"3. Ejecuta la prueba de contexto oráculo\",\"description\":\"Proporciona evidencia gold suficiente directamente al generador y observa si la respuesta se vuelve correcta.\"},{\"label\":\"4. Inspecciona la consulta de recuperación\",\"description\":\"Revisa reescrituras, entidades, filtros, idioma, restricciones temporales, descomposición y suposiciones ocultas.\"},{\"label\":\"5. Inspecciona los candidatos antes del reranking\",\"description\":\"Determina si la evidencia relevante se recuperó en absoluto y registra su rango.\"},{\"label\":\"6. Inspecciona el ranking y el ensamblaje del contexto\",\"description\":\"Revisa el reranking, los filtros de metadatos, el truncamiento, los límites de los fragmentos, los duplicados, los conflictos y la composición del top-k.\"},{\"label\":\"7. Evalúa la generación y las citas por separado\",\"description\":\"Mide la corrección de la respuesta, la completitud, la fidelidad y el respaldo de evidencia a nivel de afirmación.\"},{\"label\":\"8. Prueba los límites de validez\",\"description\":\"Comprueba si la versión, la fecha, el estado, la jurisdicción, los permisos o la evidencia que reemplaza cambian la respuesta.\"}]},\"tunes\":{}},{\"id\":\"h-one-change\",\"type\":\"header\",\"data\":{\"text\":\"No cambies tres capas a la vez\",\"level\":2},\"tunes\":{}},{\"id\":\"p-one-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Un error común de depuración es cambiar los embeddings, los tamaños de fragmento, el top-k, los prompts y el modelo en una sola iteración. Si la puntuación mejora, no sabes por qué. Si empeora, no sabes qué cambio causó la regresión.\"},\"tunes\":{}},{\"id\":\"p-one-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Trata la depuración de RAG como un diagnóstico experimental: mantén la mayor parte del pipeline constante y reemplaza un componente incierto con una entrada controlada. Los documentos gold aíslan la recuperación. Los fragmentos gold aíslan la selección de fragmentos. Un contexto fijo aísla la generación. Un modelo fijo aísla los cambios de recuperación. Un corpus fijo aísla los cambios de ingesta e indexación.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"Una matriz de fallos para síntomas comunes de RAG\",\"level\":2},\"tunes\":{}},{\"id\":\"symptom-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Síntoma\",\"Capas más probables de probar primero\",\"Prueba discriminante\"],[\"No aparece ninguna fuente relevante\",\"Cobertura de fuentes → Consulta → Recuperación de candidatos\",\"Busca manualmente en el corpus, luego inspecciona la consulta reescrita y los candidatos sin filtrar\"],[\"Aparece una fuente relevante pero la respuesta es incorrecta\",\"Ensamblaje del contexto → Generación\",\"Prueba de contexto oráculo con la misma fuente reducida a pasajes decisivos\"],[\"La respuesta es correcta a veces, incorrecta otras\",\"Ranking → Ensamblaje del contexto → Variabilidad de la generación\",\"Repite ensayos registrando el conjunto recuperado, el rango, el contexto del prompt y la salida del modelo\"],[\"La respuesta cita el documento correcto pero lo exagera\",\"Generación → Atribución de evidencia → Validez\",\"Evalúa cada afirmación contra el pasaje citado exacto\"],[\"La información antigua sigue ganando\",\"Ranking → Validez\u002Factualidad\",\"Compara con reglas de recencia\u002Freemplazo e inspecciona los metadatos\"],[\"La respuesta omite una excepción\",\"Fragmentación → Ensamblaje del contexto\",\"Comprueba si la regla y la excepción se dividieron o truncaron\"],[\"Añadir más top-k empeora la calidad\",\"Ranking → Sobrecarga de contexto\",\"Elimina fragmentos de bajo valor y compara con un conjunto de evidencia mínimo\"],[\"Cambiar el modelo corrige la respuesta\",\"Generación, pero no necesariamente la recuperación\",\"Repite con contexto recuperado idéntico en todos los modelos\"],[\"Cambiar los embeddings corrige la respuesta\",\"Recuperación\u002Franking\",\"Mantén el generador y la plantilla de contexto constantes mientras comparas el recall de candidatos\"]]},\"tunes\":{}},{\"id\":\"h-metrics\",\"type\":\"header\",\"data\":{\"text\":\"Mide cada capa con la métrica que realmente puede influir\",\"level\":2},\"tunes\":{}},{\"id\":\"metrics-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Capa\",\"Mediciones útiles\",\"Qué no inferir\"],[\"Cobertura de fuentes\",\"Tasa de preguntas respondibles, cobertura del corpus, completitud de la ingesta\",\"No culpes a los embeddings por material de origen faltante\"],[\"Recuperación de candidatos\",\"Recall@k, tasa de aciertos, cobertura del contexto\",\"Un recall alto no prueba la calidad del ranking\"],[\"Ranking\",\"MRR, NDCG, rango gold, precision@k\",\"Un buen ranking no prueba que el generador usó la evidencia\"],[\"Ensamblaje del contexto\",\"Retención de evidencia, duplicación, tasa de contradicción, utilización de tokens\",\"Un contexto grande no significa un contexto útil\"],[\"Generación\",\"Corrección, completitud, éxito de la tarea, fidelidad\",\"La corrección por sí sola no prueba el anclaje\"],[\"Atribución de evidencia\",\"Precisión de citas, cobertura de citas, respaldo de afirmaciones\",\"Un recuento de citas no es calidad de evidencia\"],[\"Validez\",\"Actualidad, precisión de reemplazo, coincidencia de versión\u002Fjurisdicción\",\"La evidencia relevante no es automáticamente evidencia aplicable\"]]},\"tunes\":{}},{\"id\":\"h-correct-answer\",\"type\":\"header\",\"data\":{\"text\":\"Una respuesta correcta aún puede ocultar un defecto de RAG\",\"level\":2},\"tunes\":{}},{\"id\":\"p-correct-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"El problema inverso también importa. Un sistema RAG puede producir la respuesta correcta mientras la recuperación está rota. El modelo puede ya conocer la respuesta por entrenamiento, inferirla de evidencia débil o adivinar correctamente. Si la evaluación solo mira la respuesta final, el sistema puede parecer saludable hasta que la pregunta alcanza información que existe solo en el corpus privado.\"},\"tunes\":{}},{\"id\":\"p-correct-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Este es el mismo problema de fiabilidad que aparece en sistemas de agentes de forma más amplia: la corrección del resultado no es suficiente para probar que la ruta de ejecución fue fiable. Para RAG, los rastros deben preservar al menos la consulta de recuperación, el conjunto de candidatos, el ranking, el contexto final, la respuesta, las citas, la versión del modelo, la versión del corpus\u002Fíndice y los filtros relevantes.\"},\"tunes\":{}},{\"id\":\"internal-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"Fiabilidad de agentes de IA: por qué la respuesta final no es suficiente\",\"excerpt\":\"Una salida correcta no prueba un razonamiento correcto, una ejecución segura ni un sistema confiable. Este artículo extiende ese principio desde el diagnóstico de RAG hasta las trayectorias de agentes y el aseguramiento operativo.\",\"ctaLabel\":\"Leer el artículo relacionado\"},\"tunes\":{}},{\"id\":\"h-hypotheses\",\"type\":\"header\",\"data\":{\"text\":\"Usa hipótesis competidoras, no una explicación favorita\",\"level\":2},\"tunes\":{}},{\"id\":\"p-hyp-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Si una respuesta incorrecta se convierte inmediatamente en “un problema de embeddings”, la investigación ya está sesgada. Un método de depuración más sólido consiste en anotar hipótesis competidoras antes de modificar el sistema: fuente faltante, reescritura de consulta deficiente, bajo recall de recuperación, reranking deficiente, truncamiento de contexto, versiones en conflicto, fallo de generación, fallo de citación o evidencia obsoleta.\"},\"tunes\":{}},{\"id\":\"p-hyp-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Luego elige una prueba que permita separar esas hipótesis. Esto es más eficiente que recopilar más ejemplos que respalden la primera explicación. El mismo principio se aplica al razonamiento técnico asistido por IA en general: un diagnóstico útil es el que sobrevive a pruebas discriminatorias, no el que simplemente suena plausible.\"},\"tunes\":{}},{\"id\":\"internal-reasoning\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\",\"title\":\"Del protocolo de investigación a un marco general de razonamiento con IA\",\"excerpt\":\"Un método de razonamiento independiente del dominio para separar evidencia de supuestos, probar hipótesis competidoras y usar validadores específicos del dominio.\",\"ctaLabel\":\"Leer el marco de razonamiento\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"¿Qué cambiaría esta respuesta?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Las capas de diagnóstico exactas cambian según la arquitectura. Una aplicación RAG simple de un solo documento puede no tener reescritura de consulta, reranker ni capa de citación. Un sistema de recuperación agéntico puede añadir planificación, múltiples búsquedas, selección de herramientas, memoria, permisos y recopilación iterativa de evidencia. Una consulta a una base de datos estructurada puede no usar chunks ni embeddings en absoluto.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"El método central sigue siendo válido: identificar los componentes que pueden cambiar el resultado de forma independiente, construir pruebas controladas que reemplacen componentes inciertos por entradas de calidad conocida y medir cada componente con evidencia adecuada para esa capa.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitaciones\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Los fallos reales suelen estar acoplados. Una consulta débil puede reducir el recall, lo que cambia el reranking, lo que cambia el contexto, lo que aumenta la varianza de generación. La prueba de contexto oráculo es un atajo de diagnóstico, no una prueba de que un componente sea el único responsable. Los conjuntos de datos de evaluación también pueden no ser representativos, y los evaluadores basados en modelos pueden introducir sus propios errores.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Por lo tanto, la pila propuesta se usa mejor como una estructura de investigación: registrar el pipeline, aislar variables, reproducir fallos, probar explicaciones competidoras y mantener la evaluación de extremo a extremo después de las correcciones a nivel de capa.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusión\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"“RAG falló” debería ser el comienzo de la investigación, no la conclusión. Un diagnóstico útil identifica si al sistema le faltaba la evidencia, buscó incorrectamente, no logró recuperarla, la clasificó mal, ensambló un contexto inutilizable, generó incorrectamente, atribuyó mal las afirmaciones o aplicó evidencia fuera de su límite de validez.\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"La regla práctica es simple: reemplazar la incertidumbre con evidencia controlada capa por capa. Comienza con la prueba de contexto oráculo. Separa la evaluación solo de recuperación de la evaluación de generación. Conserva el rastro completo. Luego corrige el componente que realmente falló en lugar de ajustar toda la pila RAG por intuición.\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"Preguntas frecuentes\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Diagnóstico de fallos en RAG\",\"items\":[{\"id\":\"faq1\",\"question\":\"¿Cómo puedo saber si falló la recuperación de RAG o el LLM?\",\"answer\":\"Proporciona al modelo manualmente un pequeño conjunto de evidencia que se sabe correcta. Si la respuesta se vuelve correcta, investiga la cobertura de fuentes, la construcción de la consulta, la recuperación, el ranking y el ensamblaje del contexto. Si el modelo sigue fallando con evidencia suficiente, la recuperación no es el problema principal.\"},{\"id\":\"faq2\",\"question\":\"¿Puede fallar RAG incluso cuando se recuperó el documento correcto?\",\"answer\":\"Sí. El pasaje relevante puede quedar clasificado demasiado abajo, truncado, separado de una excepción, mezclado con evidencia contradictoria, abrumado por contexto irrelevante o usado incorrectamente por el generador.\"},{\"id\":\"faq3\",\"question\":\"¿Basta la corrección de la respuesta para evaluar un sistema RAG?\",\"answer\":\"No. Un modelo puede producir una respuesta correcta a pesar de una recuperación débil apoyándose en conocimiento previo del modelo o en la casualidad. Evalúa la recuperación y el respaldo de la evidencia por separado de la corrección de la respuesta final.\"},{\"id\":\"faq4\",\"question\":\"¿Qué debo registrar al depurar RAG?\",\"answer\":\"Como mínimo, registra la solicitud del usuario, la consulta de recuperación transformada, los filtros, los documentos candidatos y sus rangos, el contexto final seleccionado, la versión del modelo y del prompt, la respuesta, las citas, la versión del corpus\u002Fíndice y los metadatos de tiempo o versión relevantes para la vigencia.\"},{\"id\":\"faq5\",\"question\":\"¿Aumentar top-k suele solucionar RAG?\",\"answer\":\"No de forma fiable. Un conjunto mayor de candidatos o de contexto puede mejorar el recall, pero también puede añadir ruido, contradicciones, duplicados y sobrecarga de contexto. Comprueba si falta la evidencia relevante antes de aumentar top-k.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glosario\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Términos clave de diagnóstico\",\"entries\":[{\"term\":\"Prueba de contexto oráculo\",\"definition\":\"Una prueba controlada en la que se proporciona directamente al generador evidencia de suficiencia conocida para determinar si el fallo dominante está aguas arriba de la generación.\",\"anchor\":\"oracle-context-test\"},{\"term\":\"Recuperación de candidatos\",\"definition\":\"La etapa que selecciona un conjunto inicial de documentos, chunks, registros o pasajes potencialmente relevantes antes del ranking final o del ensamblaje del contexto.\",\"anchor\":\"candidate-retrieval\"},{\"term\":\"Ensamblaje del contexto\",\"definition\":\"El proceso de convertir la evidencia recuperada en la entrada real del modelo, incluidas las decisiones de ordenación, truncamiento, deduplicación, formato y presupuesto de tokens.\",\"anchor\":\"context-assembly\"},{\"term\":\"Fidelidad\",\"definition\":\"El grado en que las afirmaciones generadas siguen respaldadas por la evidencia recuperada o proporcionada en lugar de introducir contenido no respaldado.\",\"anchor\":\"faithfulness\"},{\"term\":\"Cobertura del contexto\",\"definition\":\"Una medida orientada a la recuperación de si la evidencia seleccionada cubre la información necesaria para responder a la pregunta.\",\"anchor\":\"context-coverage\"},{\"term\":\"Límite de validez\",\"definition\":\"Las condiciones bajo las cuales una afirmación o respuesta sigue siendo aplicable, como tiempo, versión, jurisdicción, estado, población, permisos o supuestos de la fuente.\",\"anchor\":\"validity-boundary\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Fuentes primarias y lecturas adicionales\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-rag\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Foptimizing-llm-accuracy\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Optimización de la precisión de LLM\",\"description\":\"Guía de OpenAI que separa los fallos de recuperación de los fallos del LLM en aplicaciones RAG.\"}},\"tunes\":{}},{\"id\":\"src-openai-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Mejores prácticas de evaluación\",\"description\":\"Orientación sobre la evaluación estructurada para sistemas de IA variables y el diseño de pruebas orientado a la producción.\"}},\"tunes\":{}},{\"id\":\"src-aws-rag\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdocs.aws.amazon.com\u002Fbedrock\u002Flatest\u002Fuserguide\u002Fknowledge-base-evaluation-metrics.html\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Amazon Bedrock — Métricas de evaluación de RAG\",\"description\":\"Documentación que separa las métricas de solo recuperación de las métricas de recuperación y generación, incluyendo la relevancia del contexto, la cobertura, la fidelidad y las medidas de citación.\"}},\"tunes\":{}},{\"id\":\"src-anthropic-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Desmitificando las evaluaciones para agentes de IA\",\"description\":\"Orientación práctica sobre evaluación de tareas, ensayos, evaluadores, trazas, regresiones y comportamiento en producción.\"}},\"tunes\":{}},{\"id\":\"src-google-rag\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fcloud.google.com\u002Fuse-cases\u002Fretrieval-augmented-generation\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Google Cloud — Generación aumentada por recuperación\",\"description\":\"Descripción general de la arquitectura RAG y la importancia de la recuperación relevante y la generación fundamentada.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":212,"blocks":213,"version":833},1790369130929,[214,220,228,235,243,248,253,258,263,268,310,315,320,325,332,337,342,347,352,357,362,367,372,377,382,387,392,397,402,407,412,417,422,427,432,437,442,447,477,484,489,521,526,531,536,541,586,591,627,632,637,642,651,656,661,666,674,679,684,689,694,699,704,709,714,719,724,750,755,782,787,797,806,815,824],{"id":215,"data":216,"type":218,"tunes":219},"intro",{"text":217},"Un sistema RAG devuelve una respuesta débil, incorrecta, incompleta o sin respaldo. El diagnóstico habitual es \"falló la recuperación\" o \"el modelo alucinó\". Ambas etiquetas son demasiado amplias para ser útiles. Un pipeline RAG en producción puede fallar antes de la recuperación, durante la recuperación, durante el ranking, durante el ensamblaje del contexto, durante la generación o después de la generación, cuando se verifican la evidencia y la validez.","paragraph",{},{"id":221,"data":222,"type":226,"tunes":227},"direct",{"body":223,"title":224,"variant":225},"\u003Cstrong>No depures RAG como un solo componente.\u003C\u002Fstrong> Diagnostícalo como una cadena de capas comprobables de forma independiente. Primero determina si la evidencia requerida existe en una fuente autorizada. Luego prueba la construcción de la consulta, la recuperación de candidatos, el ranking, el ensamblaje del contexto, la generación, la atribución de evidencia y la vigencia. La técnica de aislamiento más rápida es una \u003Cstrong>prueba de contexto oráculo\u003C\u002Fstrong>: proporciona manualmente la evidencia correcta al generador. Si la respuesta se vuelve correcta, el fallo dominante está aguas arriba de la generación. Si sigue siendo incorrecta, la recuperación no es el problema principal.","Respuesta directa","info","callout",{},{"id":229,"data":230,"type":226,"tunes":234},"model-note",{"body":231,"title":232,"variant":233},"La Pila de Fallos de RAG en este artículo es un modelo de diagnóstico práctico, no un estándar formal de la industria. Las plataformas existentes ya separan las métricas de solo recuperación de las métricas de recuperación y generación; este modelo extiende esa separación a un método de depuración de producción paso a paso.","Sobre el modelo de diagnóstico","note",{},{"id":236,"data":237,"type":241,"tunes":242},"toc",{"title":238,"maxLevel":239,"minLevel":240},"Contenido",3,2,"tableOfContents",{},{"id":244,"data":245,"type":42,"tunes":247},"h-not-diagnosis",{"text":246,"level":240},"Por qué \"RAG falló\" no es un diagnóstico",{},{"id":249,"data":250,"type":218,"tunes":252},"p-not-1",{"text":251},"La generación aumentada por recuperación combina varios mecanismos: se interpreta una solicitud del usuario, se construyen una o más búsquedas, se recupera material candidato, se filtran o reordenan los resultados, se inserta la evidencia seleccionada en un contexto del modelo y un modelo genera una respuesta. Los sistemas en producción pueden añadir permisos, filtros de metadatos, reglas de vigencia, citas, reescritura de consultas, búsqueda híbrida, llamadas a herramientas, memoria y estado externo.",{},{"id":254,"data":255,"type":218,"tunes":257},"p-not-2",{"text":256},"Por lo tanto, una respuesta final incorrecta no te dice qué componente falló. El modelo puede haber recibido la evidencia incorrecta. Puede haber recibido la evidencia correcta mezclada con demasiado ruido. La evidencia puede ser correcta pero estar desactualizada. La fuente puede que nunca haya contenido la respuesta. O el modelo puede haber ignorado un contexto perfectamente adecuado.",{},{"id":259,"data":260,"type":218,"tunes":262},"p-not-3",{"text":261},"La guía de RAG de OpenAI ya establece una distinción fundamental entre fallo de recuperación y fallo del modelo: un sistema puede proporcionar el contexto incorrecto, o puede proporcionar el contexto correcto y aun así generar la respuesta incorrecta. AWS de manera similar separa la evaluación de solo recuperación de la evaluación de recuperación y generación. Para el diagnóstico en producción, esa distinción debería llevarse más lejos.",{},{"id":264,"data":265,"type":42,"tunes":267},"h-stack",{"text":266,"level":240},"La pila de fallos de RAG",{},{"id":269,"data":270,"type":308,"tunes":309},"table-stack",{"content":271,"stretched":43,"withHeadings":14},[272,276,280,284,288,292,296,300,304],[273,274,275],"Capa","Pregunta","Fallo típico",[277,278,279],"1. Cobertura de fuentes","¿Existe la evidencia requerida en una fuente autorizada permitida?","El corpus no puede responder la pregunta en absoluto",[281,282,283],"2. Construcción de la consulta","¿Buscó el sistema lo correcto?","Se pierden la intención, las entidades, los filtros, el idioma o las restricciones temporales",[285,286,287],"3. Recuperación de candidatos","¿Entró la evidencia relevante en el conjunto de candidatos?","Baja exhaustividad; el fragmento correcto nunca se recupera",[289,290,291],"4. Ranking y filtrado","¿Sobrevivió la evidencia correcta y quedó clasificada lo suficientemente alto?","La evidencia relevante queda enterrada, filtrada o superada por texto superficialmente similar",[293,294,295],"5. Ensamblaje del contexto","¿Recibió el modelo evidencia utilizable?","Truncamiento, límites de fragmentos deficientes, duplicados, pasajes contradictorios o sobrecarga de contexto",[297,298,299],"6. Generación","¿Usó el modelo correctamente la evidencia proporcionada?","Inferencia sin respaldo, fallo de instrucciones, error de razonamiento o desajuste de rechazo",[301,302,303],"7. Atribución de evidencia","¿Se puede rastrear la respuesta hasta la evidencia que afirma usar?","Citas faltantes, débiles o incorrectas; las afirmaciones exceden el respaldo recuperado",[305,306,307],"8. Validez y vigencia","¿Sigue siendo válida la evidencia para esta pregunta ahora?","Evidencia histórica correcta se reutiliza fuera de su tiempo, versión, jurisdicción o estado válidos","table",{},{"id":311,"data":312,"type":42,"tunes":314},"h-source",{"text":313,"level":239},"Capa 1 — Cobertura de fuentes: ¿puede el sistema responder esto en absoluto?",{},{"id":316,"data":317,"type":218,"tunes":319},"p-source-1",{"text":318},"Antes de ajustar embeddings, rerankers o prompts, verifica que la respuesta exista en el espacio de conocimiento que el sistema tiene permitido usar. Esto suena obvio, pero muchos fallos de RAG son en realidad fallos del corpus. El hecho solicitado puede estar ausente, oculto en un archivo adjunto no indexado, disponible solo en un documento más reciente, almacenado en un sistema fuera del corpus de RAG o bloqueado por permisos.",{},{"id":321,"data":322,"type":218,"tunes":324},"p-source-2",{"text":323},"Una métrica de recuperación no puede recuperar información que nunca fue indexada. Un top-k más grande no puede recuperar un documento que el pipeline no contiene. Si la prueba de cobertura de fuentes falla, la solución correcta es la ingesta, la selección de fuentes, los permisos o un comportamiento explícito de \"no se puede responder con la evidencia disponible\".",{},{"id":326,"data":327,"type":226,"tunes":331},"source-warning",{"body":328,"title":329,"variant":330},"Los equipos a menudo ajustan la recuperación con preguntas que el corpus en realidad no puede responder. Esto puede hacer que el recuperador sea mejor encontrando texto relacionado mientras deja intacta la brecha de información subyacente.","Patrón de fallo","warning",{},{"id":333,"data":334,"type":42,"tunes":336},"h-query",{"text":335,"level":239},"Capa 2 — Construcción de la consulta: ¿le preguntó el sistema al corpus la pregunta correcta?",{},{"id":338,"data":339,"type":218,"tunes":341},"p-query-1",{"text":340},"La consulta del usuario no siempre es la consulta de recuperación. Los sistemas en producción reescriben preguntas, resuelven pronombres, extraen entidades, traducen idiomas, añaden restricciones de metadatos, dividen preguntas complejas o generan múltiples búsquedas. Cada transformación puede mejorar la recuperación, pero cada transformación también puede destruir información.",{},{"id":343,"data":344,"type":218,"tunes":346},"p-query-2",{"text":345},"Una solicitud como \"¿Sigue aplicándose la política a los contratistas en Alemania después de la actualización de septiembre?\" contiene al menos una entidad, una población, una jurisdicción y un límite temporal. Una consulta reescrita que se convierte en \"política de contratistas\" puede recuperar texto semánticamente relacionado mientras pierde las variables que deciden si la respuesta es válida.",{},{"id":348,"data":349,"type":42,"tunes":351},"h-retrieval",{"text":350,"level":239},"Capa 3 — Recuperación de candidatos: ¿entró el conjunto la evidencia relevante?",{},{"id":353,"data":354,"type":218,"tunes":356},"p-ret-1",{"text":355},"La recuperación de candidatos es principalmente un problema de exhaustividad. La pregunta de diagnóstico aún no es si el mejor resultado quedó en primer lugar; es si apareció evidencia relevante en algún lugar del conjunto de candidatos. Si la fuente correcta conocida no aparece, investiga la indexación, la fragmentación, las incrustaciones, la coincidencia léxica, los metadatos, la búsqueda híbrida, el manejo del idioma, los sinónimos y la expansión de consultas.",{},{"id":358,"data":359,"type":218,"tunes":361},"p-ret-2",{"text":360},"Aquí es donde la evaluación solo de recuperación es valiosa. AWS expone la relevancia del contexto y la cobertura del contexto para la evaluación de RAG solo de recuperación. El hábito de producción importante es evaluar la recuperación antes de la generación para que una respuesta final pulida no pueda ocultar un conjunto de candidatos débil.",{},{"id":363,"data":364,"type":42,"tunes":366},"h-ranking",{"text":365,"level":239},"Capa 4 — Clasificación y filtrado: ¿se descartó o enterró la evidencia correcta?",{},{"id":368,"data":369,"type":218,"tunes":371},"p-rank-1",{"text":370},"Un sistema puede tener buena exhaustividad y aun así fallar porque la evidencia relevante se clasifica por debajo de material ruidoso pero semánticamente similar. Los reranqueadores, los impulsos de recencia, los pesos de autoridad, las preferencias de idioma, los filtros de inquilinos, los controles de acceso, los filtros de estado del producto y la deduplicación cambian lo que sobrevive hasta el contexto final.",{},{"id":373,"data":374,"type":218,"tunes":376},"p-rank-2",{"text":375},"Por lo tanto, la depuración debe preservar la lista completa de candidatos, no solo el top-k final. Si la evidencia dorada se recuperó en el puesto 18 y un reranqueador la eliminó, la solución no es la misma que la de un fallo de recuperación.",{},{"id":378,"data":379,"type":42,"tunes":381},"h-context",{"text":380,"level":239},"Capa 5 — Ensamblaje del contexto: ¿se convirtió la evidencia útil en contexto utilizable?",{},{"id":383,"data":384,"type":218,"tunes":386},"p-ctx-1",{"text":385},"El éxito de la recuperación no garantiza el éxito del contexto. Los fragmentos relevantes pueden truncarse, separarse de sus calificadores, duplicarse hasta dominar el prompt, mezclarse con versiones contradictorias o rodearse de suficiente texto irrelevante como para que el pasaje decisivo pierda prominencia.",{},{"id":388,"data":389,"type":218,"tunes":391},"p-ctx-2",{"text":390},"Los límites de los fragmentos son especialmente importantes. Una oración puede contener la regla mientras que la siguiente contiene la excepción. Si se indexan por separado y solo se recupera la primera, el recuperador puede parecer relevante mientras que el contexto ensamblado se vuelve engañoso.",{},{"id":393,"data":394,"type":42,"tunes":396},"h-generation",{"text":395,"level":239},"Capa 6 — Generación: ¿puede el modelo usar correctamente la evidencia correcta?",{},{"id":398,"data":399,"type":218,"tunes":401},"p-gen-1",{"text":400},"Una vez que el sistema ha suministrado de manera demostrable evidencia suficiente, la generación se vuelve comprobable de forma independiente. El modelo puede generalizar en exceso, combinar pasajes incompatibles, ignorar una declaración negativa, no seguir el formato de respuesta solicitado, inventar un puente entre hechos o responder desde la memoria paramétrica en lugar de la evidencia recuperada.",{},{"id":403,"data":404,"type":218,"tunes":406},"p-gen-2",{"text":405},"Por eso la corrección de extremo a extremo por sí sola es insuficiente para el diagnóstico. OpenAI recomienda la evaluación como una forma estructurada de comprender el comportamiento de la aplicación, mientras que la guía de evaluación de agentes de Anthropic enfatiza múltiples ensayos, evaluadores, rastros y casos de fallo realistas. Para RAG, el generador debe probarse tanto con recuperación normal como con contexto dorado controlado.",{},{"id":408,"data":409,"type":42,"tunes":411},"h-evidence",{"text":410,"level":239},"Capa 7 — Atribución de evidencia: ¿está realmente respaldada la respuesta?",{},{"id":413,"data":414,"type":218,"tunes":416},"p-evidence-1",{"text":415},"Una respuesta plausible con citas aún puede estar débilmente fundamentada. El documento citado puede ser relevante para el tema pero no respaldar la afirmación específica. Una oración puede estar respaldada mientras que otra se infiere. Una cita puede apuntar a una fuente que contradice la respuesta una vez que se leen sus condiciones.",{},{"id":418,"data":419,"type":218,"tunes":421},"p-evidence-2",{"text":420},"Por lo tanto, la evaluación de citas pertenece después de la generación. AWS distingue la precisión de las citas de la cobertura de las citas: si los pasajes citados están citados correctamente y si la respuesta está suficientemente respaldada por citas. En producción, el respaldo a nivel de afirmación es más útil que tratar la presencia de cualquier cita como calidad de evidencia.",{},{"id":423,"data":424,"type":42,"tunes":426},"h-validity",{"text":425,"level":239},"Capa 8 — Validez y actualidad: ¿era la evidencia correcta para esta versión de la realidad?",{},{"id":428,"data":429,"type":218,"tunes":431},"p-valid-1",{"text":430},"RAG puede recuperar una fuente perfectamente auténtica, altamente relevante y fielmente citada y aun así producir una respuesta incorrecta si la fuente ya no es válida para la pregunta actual. Las políticas cambian. Las API se deprecan. Los precios se mueven. El comportamiento del software cambia entre versiones. El inventario de productos cambia. Los permisos cambian. Los parches de juegos cambian la mecánica.",{},{"id":433,"data":434,"type":218,"tunes":436},"p-valid-2",{"text":435},"Esta es una clase de fallo separada de la alucinación. La evidencia es real; su aplicabilidad es incorrecta. Por lo tanto, un sistema robusto necesita marcas de tiempo, metadatos de versión o jurisdicción cuando sea relevante, autoridad de la fuente, reglas de sustitución y un mecanismo explícito para decidir cuándo debe restringirse o abandonarse la evidencia más antigua.",{},{"id":438,"data":439,"type":42,"tunes":441},"h-oracle",{"text":440,"level":240},"El método de aislamiento más rápido: la prueba de contexto oráculo",{},{"id":443,"data":444,"type":218,"tunes":446},"p-oracle-1",{"text":445},"La primera división más útil es simple: proporciona manualmente al generador un pequeño conjunto de evidencia que sabes que es suficiente para responder la pregunta. Mantén la tarea y la respuesta esperada sin cambios.",{},{"id":448,"data":449,"type":475,"tunes":476},"oracle-comparison",{"rows":450,"title":464,"layout":308,"columns":465},[451,456,460],{"id":452,"label":453,"values":454},"oracle-pass","La respuesta se vuelve correcta",[455,455,455],"",{"id":457,"label":458,"values":459},"oracle-fail","La respuesta sigue siendo incorrecta",[455,455,455],{"id":461,"label":462,"values":463},"oracle-partial","La respuesta mejora pero sigue siendo incompleta",[455,455,455],"Prueba de contexto oráculo",[466,469,472],{"id":467,"label":468},"result","Resultado",{"id":470,"label":471},"meaning","Interpretación probable",{"id":473,"label":474},"next","Siguiente paso de diagnóstico","comparison",{},{"id":478,"data":479,"type":226,"tunes":483},"oracle-tip",{"body":480,"title":481,"variant":482},"La prueba de contexto oráculo elimina la mayor parte del pipeline de recuperación del experimento. No prueba que la generación sea perfecta, pero te da un contrafactual rápido: \u003Cstrong>¿qué haría el modelo si la recuperación ya hubiera tenido éxito?\u003C\u002Fstrong>","Por qué esta prueba es poderosa","tip",{},{"id":485,"data":486,"type":42,"tunes":488},"h-sequence",{"text":487,"level":240},"Una secuencia de diagnóstico en producción",{},{"id":490,"data":491,"type":519,"tunes":520},"diag-flow",{"steps":492,"title":517,"orientation":518},[493,496,499,502,505,508,511,514],{"label":494,"description":495},"1. Define la afirmación esperada","Escribe la respuesta esperada, la incertidumbre permitida y la evidencia que la justificaría.",{"label":497,"description":498},"2. Verifica la cobertura de fuentes","Confirma que existe evidencia autorizada y permitida en el conjunto de fuentes indexadas o accesibles.",{"label":500,"description":501},"3. Ejecuta la prueba de contexto oráculo","Proporciona evidencia gold suficiente directamente al generador y observa si la respuesta se vuelve correcta.",{"label":503,"description":504},"4. Inspecciona la consulta de recuperación","Revisa reescrituras, entidades, filtros, idioma, restricciones temporales, descomposición y suposiciones ocultas.",{"label":506,"description":507},"5. Inspecciona los candidatos antes del reranking","Determina si la evidencia relevante se recuperó en absoluto y registra su rango.",{"label":509,"description":510},"6. Inspecciona el ranking y el ensamblaje del contexto","Revisa el reranking, los filtros de metadatos, el truncamiento, los límites de los fragmentos, los duplicados, los conflictos y la composición del top-k.",{"label":512,"description":513},"7. Evalúa la generación y las citas por separado","Mide la corrección de la respuesta, la completitud, la fidelidad y el respaldo de evidencia a nivel de afirmación.",{"label":515,"description":516},"8. Prueba los límites de validez","Comprueba si la versión, la fecha, el estado, la jurisdicción, los permisos o la evidencia que reemplaza cambian la respuesta.","Diagnostica el fallo desde la evidencia hasta la respuesta","auto","processFlow",{},{"id":522,"data":523,"type":42,"tunes":525},"h-one-change",{"text":524,"level":240},"No cambies tres capas a la vez",{},{"id":527,"data":528,"type":218,"tunes":530},"p-one-1",{"text":529},"Un error común de depuración es cambiar los embeddings, los tamaños de fragmento, el top-k, los prompts y el modelo en una sola iteración. Si la puntuación mejora, no sabes por qué. Si empeora, no sabes qué cambio causó la regresión.",{},{"id":532,"data":533,"type":218,"tunes":535},"p-one-2",{"text":534},"Trata la depuración de RAG como un diagnóstico experimental: mantén la mayor parte del pipeline constante y reemplaza un componente incierto con una entrada controlada. Los documentos gold aíslan la recuperación. Los fragmentos gold aíslan la selección de fragmentos. Un contexto fijo aísla la generación. Un modelo fijo aísla los cambios de recuperación. Un corpus fijo aísla los cambios de ingesta e indexación.",{},{"id":537,"data":538,"type":42,"tunes":540},"h-matrix",{"text":539,"level":240},"Una matriz de fallos para síntomas comunes de RAG",{},{"id":542,"data":543,"type":308,"tunes":585},"symptom-matrix",{"content":544,"stretched":43,"withHeadings":14},[545,549,553,557,561,565,569,573,577,581],[546,547,548],"Síntoma","Capas más probables de probar primero","Prueba discriminante",[550,551,552],"No aparece ninguna fuente relevante","Cobertura de fuentes → Consulta → Recuperación de candidatos","Busca manualmente en el corpus, luego inspecciona la consulta reescrita y los candidatos sin filtrar",[554,555,556],"Aparece una fuente relevante pero la respuesta es incorrecta","Ensamblaje del contexto → Generación","Prueba de contexto oráculo con la misma fuente reducida a pasajes decisivos",[558,559,560],"La respuesta es correcta a veces, incorrecta otras","Ranking → Ensamblaje del contexto → Variabilidad de la generación","Repite ensayos registrando el conjunto recuperado, el rango, el contexto del prompt y la salida del modelo",[562,563,564],"La respuesta cita el documento correcto pero lo exagera","Generación → Atribución de evidencia → Validez","Evalúa cada afirmación contra el pasaje citado exacto",[566,567,568],"La información antigua sigue ganando","Ranking → Validez\u002Factualidad","Compara con reglas de recencia\u002Freemplazo e inspecciona los metadatos",[570,571,572],"La respuesta omite una excepción","Fragmentación → Ensamblaje del contexto","Comprueba si la regla y la excepción se dividieron o truncaron",[574,575,576],"Añadir más top-k empeora la calidad","Ranking → Sobrecarga de contexto","Elimina fragmentos de bajo valor y compara con un conjunto de evidencia mínimo",[578,579,580],"Cambiar el modelo corrige la respuesta","Generación, pero no necesariamente la recuperación","Repite con contexto recuperado idéntico en todos los modelos",[582,583,584],"Cambiar los embeddings corrige la respuesta","Recuperación\u002Franking","Mantén el generador y la plantilla de contexto constantes mientras comparas el recall de candidatos",{},{"id":587,"data":588,"type":42,"tunes":590},"h-metrics",{"text":589,"level":240},"Mide cada capa con la métrica que realmente puede influir",{},{"id":592,"data":593,"type":308,"tunes":626},"metrics-table",{"content":594,"stretched":43,"withHeadings":14},[595,598,602,606,610,614,618,622],[273,596,597],"Mediciones útiles","Qué no inferir",[599,600,601],"Cobertura de fuentes","Tasa de preguntas respondibles, cobertura del corpus, completitud de la ingesta","No culpes a los embeddings por material de origen faltante",[603,604,605],"Recuperación de candidatos","Recall@k, tasa de aciertos, cobertura del contexto","Un recall alto no prueba la calidad del ranking",[607,608,609],"Ranking","MRR, NDCG, rango gold, precision@k","Un buen ranking no prueba que el generador usó la evidencia",[611,612,613],"Ensamblaje del contexto","Retención de evidencia, duplicación, tasa de contradicción, utilización de tokens","Un contexto grande no significa un contexto útil",[615,616,617],"Generación","Corrección, completitud, éxito de la tarea, fidelidad","La corrección por sí sola no prueba el anclaje",[619,620,621],"Atribución de evidencia","Precisión de citas, cobertura de citas, respaldo de afirmaciones","Un recuento de citas no es calidad de evidencia",[623,624,625],"Validez","Actualidad, precisión de reemplazo, coincidencia de versión\u002Fjurisdicción","La evidencia relevante no es automáticamente evidencia aplicable",{},{"id":628,"data":629,"type":42,"tunes":631},"h-correct-answer",{"text":630,"level":240},"Una respuesta correcta aún puede ocultar un defecto de RAG",{},{"id":633,"data":634,"type":218,"tunes":636},"p-correct-1",{"text":635},"El problema inverso también importa. Un sistema RAG puede producir la respuesta correcta mientras la recuperación está rota. El modelo puede ya conocer la respuesta por entrenamiento, inferirla de evidencia débil o adivinar correctamente. Si la evaluación solo mira la respuesta final, el sistema puede parecer saludable hasta que la pregunta alcanza información que existe solo en el corpus privado.",{},{"id":638,"data":639,"type":218,"tunes":641},"p-correct-2",{"text":640},"Este es el mismo problema de fiabilidad que aparece en sistemas de agentes de forma más amplia: la corrección del resultado no es suficiente para probar que la ruta de ejecución fue fiable. Para RAG, los rastros deben preservar al menos la consulta de recuperación, el conjunto de candidatos, el ranking, el contexto final, la respuesta, las citas, la versión del modelo, la versión del corpus\u002Fíndice y los filtros relevantes.",{},{"id":643,"data":644,"type":649,"tunes":650},"internal-reliability",{"url":645,"title":646,"excerpt":647,"ctaLabel":648},"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","Fiabilidad de agentes de IA: por qué la respuesta final no es suficiente","Una salida correcta no prueba un razonamiento correcto, una ejecución segura ni un sistema confiable. Este artículo extiende ese principio desde el diagnóstico de RAG hasta las trayectorias de agentes y el aseguramiento operativo.","Leer el artículo relacionado","referralArticle",{},{"id":652,"data":653,"type":42,"tunes":655},"h-hypotheses",{"text":654,"level":240},"Usa hipótesis competidoras, no una explicación favorita",{},{"id":657,"data":658,"type":218,"tunes":660},"p-hyp-1",{"text":659},"Si una respuesta incorrecta se convierte inmediatamente en “un problema de embeddings”, la investigación ya está sesgada. Un método de depuración más sólido consiste en anotar hipótesis competidoras antes de modificar el sistema: fuente faltante, reescritura de consulta deficiente, bajo recall de recuperación, reranking deficiente, truncamiento de contexto, versiones en conflicto, fallo de generación, fallo de citación o evidencia obsoleta.",{},{"id":662,"data":663,"type":218,"tunes":665},"p-hyp-2",{"text":664},"Luego elige una prueba que permita separar esas hipótesis. Esto es más eficiente que recopilar más ejemplos que respalden la primera explicación. El mismo principio se aplica al razonamiento técnico asistido por IA en general: un diagnóstico útil es el que sobrevive a pruebas discriminatorias, no el que simplemente suena plausible.",{},{"id":667,"data":668,"type":649,"tunes":673},"internal-reasoning",{"url":669,"title":670,"excerpt":671,"ctaLabel":672},"https:\u002F\u002Fstajic.de\u002Fes\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","Del protocolo de investigación a un marco general de razonamiento con IA","Un método de razonamiento independiente del dominio para separar evidencia de supuestos, probar hipótesis competidoras y usar validadores específicos del dominio.","Leer el marco de razonamiento",{},{"id":675,"data":676,"type":42,"tunes":678},"h-change",{"text":677,"level":240},"¿Qué cambiaría esta respuesta?",{},{"id":680,"data":681,"type":218,"tunes":683},"p-change-1",{"text":682},"Las capas de diagnóstico exactas cambian según la arquitectura. Una aplicación RAG simple de un solo documento puede no tener reescritura de consulta, reranker ni capa de citación. Un sistema de recuperación agéntico puede añadir planificación, múltiples búsquedas, selección de herramientas, memoria, permisos y recopilación iterativa de evidencia. Una consulta a una base de datos estructurada puede no usar chunks ni embeddings en absoluto.",{},{"id":685,"data":686,"type":218,"tunes":688},"p-change-2",{"text":687},"El método central sigue siendo válido: identificar los componentes que pueden cambiar el resultado de forma independiente, construir pruebas controladas que reemplacen componentes inciertos por entradas de calidad conocida y medir cada componente con evidencia adecuada para esa capa.",{},{"id":690,"data":691,"type":42,"tunes":693},"h-limitations",{"text":692,"level":240},"Limitaciones",{},{"id":695,"data":696,"type":218,"tunes":698},"p-limit-1",{"text":697},"Los fallos reales suelen estar acoplados. Una consulta débil puede reducir el recall, lo que cambia el reranking, lo que cambia el contexto, lo que aumenta la varianza de generación. La prueba de contexto oráculo es un atajo de diagnóstico, no una prueba de que un componente sea el único responsable. Los conjuntos de datos de evaluación también pueden no ser representativos, y los evaluadores basados en modelos pueden introducir sus propios errores.",{},{"id":700,"data":701,"type":218,"tunes":703},"p-limit-2",{"text":702},"Por lo tanto, la pila propuesta se usa mejor como una estructura de investigación: registrar el pipeline, aislar variables, reproducir fallos, probar explicaciones competidoras y mantener la evaluación de extremo a extremo después de las correcciones a nivel de capa.",{},{"id":705,"data":706,"type":42,"tunes":708},"h-conclusion",{"text":707,"level":240},"Conclusión",{},{"id":710,"data":711,"type":218,"tunes":713},"p-conclusion-1",{"text":712},"“RAG falló” debería ser el comienzo de la investigación, no la conclusión. Un diagnóstico útil identifica si al sistema le faltaba la evidencia, buscó incorrectamente, no logró recuperarla, la clasificó mal, ensambló un contexto inutilizable, generó incorrectamente, atribuyó mal las afirmaciones o aplicó evidencia fuera de su límite de validez.",{},{"id":715,"data":716,"type":218,"tunes":718},"p-conclusion-2",{"text":717},"La regla práctica es simple: reemplazar la incertidumbre con evidencia controlada capa por capa. Comienza con la prueba de contexto oráculo. Separa la evaluación solo de recuperación de la evaluación de generación. Conserva el rastro completo. Luego corrige el componente que realmente falló en lugar de ajustar toda la pila RAG por intuición.",{},{"id":720,"data":721,"type":42,"tunes":723},"h-faq",{"text":722,"level":240},"Preguntas frecuentes",{},{"id":725,"data":726,"type":725,"tunes":749},"faq",{"items":727,"title":748},[728,732,736,740,744],{"id":729,"answer":730,"question":731},"faq1","Proporciona al modelo manualmente un pequeño conjunto de evidencia que se sabe correcta. Si la respuesta se vuelve correcta, investiga la cobertura de fuentes, la construcción de la consulta, la recuperación, el ranking y el ensamblaje del contexto. Si el modelo sigue fallando con evidencia suficiente, la recuperación no es el problema principal.","¿Cómo puedo saber si falló la recuperación de RAG o el LLM?",{"id":733,"answer":734,"question":735},"faq2","Sí. El pasaje relevante puede quedar clasificado demasiado abajo, truncado, separado de una excepción, mezclado con evidencia contradictoria, abrumado por contexto irrelevante o usado incorrectamente por el generador.","¿Puede fallar RAG incluso cuando se recuperó el documento correcto?",{"id":737,"answer":738,"question":739},"faq3","No. Un modelo puede producir una respuesta correcta a pesar de una recuperación débil apoyándose en conocimiento previo del modelo o en la casualidad. Evalúa la recuperación y el respaldo de la evidencia por separado de la corrección de la respuesta final.","¿Basta la corrección de la respuesta para evaluar un sistema RAG?",{"id":741,"answer":742,"question":743},"faq4","Como mínimo, registra la solicitud del usuario, la consulta de recuperación transformada, los filtros, los documentos candidatos y sus rangos, el contexto final seleccionado, la versión del modelo y del prompt, la respuesta, las citas, la versión del corpus\u002Fíndice y los metadatos de tiempo o versión relevantes para la vigencia.","¿Qué debo registrar al depurar RAG?",{"id":745,"answer":746,"question":747},"faq5","No de forma fiable. Un conjunto mayor de candidatos o de contexto puede mejorar el recall, pero también puede añadir ruido, contradicciones, duplicados y sobrecarga de contexto. Comprueba si falta la evidencia relevante antes de aumentar top-k.","¿Aumentar top-k suele solucionar RAG?","Diagnóstico de fallos en RAG",{},{"id":751,"data":752,"type":42,"tunes":754},"h-glossary",{"text":753,"level":240},"Glosario",{},{"id":756,"data":757,"type":756,"tunes":781},"glossary",{"title":758,"entries":759},"Términos clave de diagnóstico",[760,763,766,769,773,777],{"term":464,"anchor":761,"definition":762},"oracle-context-test","Una prueba controlada en la que se proporciona directamente al generador evidencia de suficiencia conocida para determinar si el fallo dominante está aguas arriba de la generación.",{"term":603,"anchor":764,"definition":765},"candidate-retrieval","La etapa que selecciona un conjunto inicial de documentos, chunks, registros o pasajes potencialmente relevantes antes del ranking final o del ensamblaje del contexto.",{"term":611,"anchor":767,"definition":768},"context-assembly","El proceso de convertir la evidencia recuperada en la entrada real del modelo, incluidas las decisiones de ordenación, truncamiento, deduplicación, formato y presupuesto de tokens.",{"term":770,"anchor":771,"definition":772},"Fidelidad","faithfulness","El grado en que las afirmaciones generadas siguen respaldadas por la evidencia recuperada o proporcionada en lugar de introducir contenido no respaldado.",{"term":774,"anchor":775,"definition":776},"Cobertura del contexto","context-coverage","Una medida orientada a la recuperación de si la evidencia seleccionada cubre la información necesaria para responder a la pregunta.",{"term":778,"anchor":779,"definition":780},"Límite de validez","validity-boundary","Las condiciones bajo las cuales una afirmación o respuesta sigue siendo aplicable, como tiempo, versión, jurisdicción, estado, población, permisos o supuestos de la fuente.",{},{"id":783,"data":784,"type":42,"tunes":786},"h-sources",{"text":785,"level":240},"Fuentes primarias y lecturas adicionales",{},{"id":788,"data":789,"type":795,"tunes":796},"src-openai-rag",{"link":790,"meta":791},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Foptimizing-llm-accuracy",{"image":792,"title":793,"description":794},{"url":455},"OpenAI — Optimización de la precisión de LLM","Guía de OpenAI que separa los fallos de recuperación de los fallos del LLM en aplicaciones RAG.","linkTool",{},{"id":798,"data":799,"type":795,"tunes":805},"src-openai-evals",{"link":800,"meta":801},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices",{"image":802,"title":803,"description":804},{"url":455},"OpenAI — Mejores prácticas de evaluación","Orientación sobre la evaluación estructurada para sistemas de IA variables y el diseño de pruebas orientado a la producción.",{},{"id":807,"data":808,"type":795,"tunes":814},"src-aws-rag",{"link":809,"meta":810},"https:\u002F\u002Fdocs.aws.amazon.com\u002Fbedrock\u002Flatest\u002Fuserguide\u002Fknowledge-base-evaluation-metrics.html",{"image":811,"title":812,"description":813},{"url":455},"Amazon Bedrock — Métricas de evaluación de RAG","Documentación que separa las métricas de solo recuperación de las métricas de recuperación y generación, incluyendo la relevancia del contexto, la cobertura, la fidelidad y las medidas de citación.",{},{"id":816,"data":817,"type":795,"tunes":823},"src-anthropic-evals",{"link":818,"meta":819},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"image":820,"title":821,"description":822},{"url":455},"Anthropic — Desmitificando las evaluaciones para agentes de IA","Orientación práctica sobre evaluación de tareas, ensayos, evaluadores, trazas, regresiones y comportamiento en producción.",{},{"id":825,"data":826,"type":795,"tunes":832},"src-google-rag",{"link":827,"meta":828},"https:\u002F\u002Fcloud.google.com\u002Fuse-cases\u002Fretrieval-augmented-generation",{"image":829,"title":830,"description":831},{"url":455},"Google Cloud — Generación aumentada por recuperación","Descripción general de la arquitectura RAG y la importancia de la recuperación relevante y la generación fundamentada.",{},"2.31.6","Cuando una respuesta RAG es incorrecta, culpar a la recuperación o al modelo es demasiado vago. Este método de diagnóstico aísla la cobertura de fuentes, la construcción de consultas, la recuperación, el ranking, el ensamblaje del contexto, la generación, la atribución de evidencia y la actualidad, de modo que el fallo real puede reproducirse y corregirse.","\u002Fuploads\u002F2026\u002F09\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method-1790350847177-pior4c.webp","rag-failed-but-which-layer-actually-failed-a-diagnostic-method-1790350847177-pior4c","PUBLISHED","2026-09-24T19:39:00.000Z","2026-09-25T15:39:19.132Z","2026-09-25T20:46:25.690Z",{"en":842,"de":843,"sr":844,"es":845,"fr":846,"it":847,"ru":848,"zh":849},"\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method","\u002Fde\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method","\u002Fsr\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method","\u002Fes\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method","\u002Ffr\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method","\u002Fit\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method","\u002Fru\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method","\u002Fzh\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method",[851,855,859],{"id":852,"name":853,"slug":854},58,"Evaluación y compuertas de calidad","evaluation",{"id":856,"name":857,"slug":858},89,"Arnés de evaluación","evaluation-harness",{"id":860,"name":861,"slug":862},85,"Compuertas de calidad","quality-gates",{"id":864,"login":865,"email":866,"displayName":867},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[869,1383],{"lang":870,"title":871,"content":872,"contentJson":873,"excerpt":1382},"en","RAG Failed — But Which Layer Actually Failed? A Diagnostic Method","{\"time\":1790369097340,\"blocks\":[{\"id\":\"8zyFXn5HD5\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A RAG system returns a weak, wrong, incomplete, or unsupported answer. The usual diagnosis is “retrieval failed” or “the model hallucinated.” Both labels are too broad to be useful. A production RAG pipeline can fail before retrieval, during retrieval, while ranking, while assembling context, during generation, or after generation when evidence and validity are checked.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"\u003Cstrong>Do not debug RAG as one component.\u003C\u002Fstrong> Diagnose it as a chain of independently testable layers. First determine whether the required evidence exists in an authoritative source. Then test query construction, candidate retrieval, ranking, context assembly, generation, evidence attribution, and freshness. The fastest isolation technique is an \u003Cstrong>oracle-context test\u003C\u002Fstrong>: give the generator the correct evidence manually. If the answer becomes correct, the dominant failure is upstream of generation. If it remains wrong, retrieval is not the primary problem.\"},\"tunes\":{}},{\"id\":\"model-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"About the diagnostic model\",\"body\":\"The RAG Failure Stack in this article is a practical diagnostic model, not a formal industry standard. Existing platforms already separate retrieval-only metrics from retrieve-and-generate metrics; this model extends that separation into a step-by-step production debugging method.\"},\"tunes\":{}},{\"id\":\"h-not-diagnosis\",\"type\":\"header\",\"data\":{\"text\":\"Why “RAG failed” is not a diagnosis\",\"level\":2},\"tunes\":{}},{\"id\":\"p-not-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval-augmented generation combines several mechanisms: a user request is interpreted, one or more searches are constructed, candidate material is retrieved, results are filtered or reranked, selected evidence is inserted into a model context, and a model generates an answer. Production systems may add permissions, metadata filters, freshness rules, citations, query rewriting, hybrid search, tool calls, memory, and external state.\"},\"tunes\":{}},{\"id\":\"p-not-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"A wrong final answer therefore does not tell you which component failed. The model may have received the wrong evidence. It may have received the right evidence mixed with too much noise. The evidence may be correct but stale. The source may never have contained the answer. Or the model may have ignored perfectly adequate context.\"},\"tunes\":{}},{\"id\":\"p-not-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's RAG guidance already makes a fundamental distinction between retrieval failure and model failure: a system can supply the wrong context, or it can supply the right context and still generate the wrong answer. AWS similarly separates retrieve-only evaluation from retrieve-and-generate evaluation. For production diagnosis, that distinction should be taken further.\"},\"tunes\":{}},{\"id\":\"h-stack\",\"type\":\"header\",\"data\":{\"text\":\"The RAG Failure Stack\",\"level\":2},\"tunes\":{}},{\"id\":\"table-stack\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Layer\",\"Question\",\"Typical failure\"],[\"1. Source coverage\",\"Does the required evidence exist in an allowed authoritative source?\",\"The corpus cannot answer the question at all\"],[\"2. Query construction\",\"Did the system search for the right thing?\",\"Intent, entities, filters, language, or time constraints are lost\"],[\"3. Candidate retrieval\",\"Did the relevant evidence enter the candidate set?\",\"Low recall; the right chunk is never retrieved\"],[\"4. Ranking &amp; filtering\",\"Did the right evidence survive and rank high enough?\",\"Relevant evidence is buried, filtered out, or outranked by superficially similar text\"],[\"5. Context assembly\",\"Did the model receive usable evidence?\",\"Truncation, bad chunk boundaries, duplicates, conflicting passages, or context overload\"],[\"6. Generation\",\"Did the model use the supplied evidence correctly?\",\"Unsupported inference, instruction failure, reasoning error, or refusal mismatch\"],[\"7. Evidence attribution\",\"Can the answer be traced to the evidence it claims to use?\",\"Missing, weak, or incorrect citations; claims exceed retrieved support\"],[\"8. Validity &amp; freshness\",\"Is the evidence still valid for this question now?\",\"Correct historical evidence is reused outside its valid time, version, jurisdiction, or state\"]]},\"tunes\":{}},{\"id\":\"h-source\",\"type\":\"header\",\"data\":{\"text\":\"Layer 1 — Source coverage: can the system answer this at all?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-source-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Before tuning embeddings, rerankers, or prompts, verify that the answer exists in the knowledge space the system is allowed to use. This sounds obvious, but many RAG failures are actually corpus failures. The requested fact may be absent, hidden in an unindexed attachment, available only in a newer document, stored in a system outside the RAG corpus, or blocked by permissions.\"},\"tunes\":{}},{\"id\":\"p-source-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"A retrieval metric cannot recover information that was never indexed. A larger top-k cannot retrieve a document the pipeline does not contain. If the source coverage test fails, the correct fix is ingestion, source selection, permissions, or an explicit “not answerable from available evidence” behaviour.\"},\"tunes\":{}},{\"id\":\"source-warning\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Failure pattern\",\"body\":\"Teams often tune retrieval against questions that the corpus cannot actually answer. This can make the retriever better at finding related text while leaving the underlying information gap untouched.\"},\"tunes\":{}},{\"id\":\"h-query\",\"type\":\"header\",\"data\":{\"text\":\"Layer 2 — Query construction: did the system ask the corpus the right question?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-query-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The user query is not always the retrieval query. Production systems rewrite questions, resolve pronouns, extract entities, translate languages, add metadata constraints, split complex questions, or generate multiple searches. Every transformation can improve retrieval, but every transformation can also destroy information.\"},\"tunes\":{}},{\"id\":\"p-query-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"A request such as “Does the policy still apply to contractors in Germany after the September update?” contains at least an entity, a population, a jurisdiction, and a time boundary. A rewritten query that becomes “contractor policy” may retrieve semantically related text while losing the variables that decide whether the answer is valid.\"},\"tunes\":{}},{\"id\":\"h-retrieval\",\"type\":\"header\",\"data\":{\"text\":\"Layer 3 — Candidate retrieval: did the relevant evidence enter the set?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-ret-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Candidate retrieval is primarily a recall problem. The diagnostic question is not yet whether the best result ranked first; it is whether relevant evidence appeared anywhere in the candidate pool. If the known correct source does not appear, investigate indexing, chunking, embeddings, lexical matching, metadata, hybrid search, language handling, synonyms, and query expansion.\"},\"tunes\":{}},{\"id\":\"p-ret-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is where retrieval-only evaluation is valuable. AWS exposes context relevance and context coverage for retrieve-only RAG evaluation. The important production habit is to evaluate retrieval before generation so that a polished final answer cannot hide a weak candidate set.\"},\"tunes\":{}},{\"id\":\"h-ranking\",\"type\":\"header\",\"data\":{\"text\":\"Layer 4 — Ranking and filtering: was the right evidence discarded or buried?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-rank-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A system can have good recall and still fail because the relevant evidence ranks below noisy but semantically similar material. Rerankers, recency boosts, authority weights, language preferences, tenant filters, access controls, product status filters, and deduplication all change what survives into the final context.\"},\"tunes\":{}},{\"id\":\"p-rank-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Debugging should therefore preserve the full candidate list, not only the final top-k. If the gold evidence was retrieved at rank 18 and a reranker removed it, the fix is not the same as a retrieval miss.\"},\"tunes\":{}},{\"id\":\"h-context\",\"type\":\"header\",\"data\":{\"text\":\"Layer 5 — Context assembly: did useful evidence become usable context?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-ctx-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval success does not guarantee context success. Relevant chunks can be truncated, separated from their qualifiers, duplicated until they dominate the prompt, mixed with contradictory versions, or surrounded by enough irrelevant text that the decisive passage loses salience.\"},\"tunes\":{}},{\"id\":\"p-ctx-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Chunk boundaries are especially important. A sentence may contain the rule while the following sentence contains the exception. If they are indexed separately and only the first is retrieved, the retriever can appear relevant while the assembled context becomes misleading.\"},\"tunes\":{}},{\"id\":\"h-generation\",\"type\":\"header\",\"data\":{\"text\":\"Layer 6 — Generation: can the model use correct evidence correctly?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-gen-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Once the system has demonstrably supplied sufficient evidence, generation becomes independently testable. The model may overgeneralize, combine incompatible passages, ignore a negative statement, fail to follow the requested answer format, invent a bridge between facts, or answer from parametric memory instead of the retrieved evidence.\"},\"tunes\":{}},{\"id\":\"p-gen-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is why end-to-end correctness alone is insufficient for diagnosis. OpenAI recommends evaluation as a structured way to understand application behaviour, while Anthropic's agent-evaluation guidance emphasizes multiple trials, graders, traces, and realistic failure cases. For RAG, the generator should be tested both with normal retrieval and with controlled gold context.\"},\"tunes\":{}},{\"id\":\"h-evidence\",\"type\":\"header\",\"data\":{\"text\":\"Layer 7 — Evidence attribution: is the answer actually supported?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-evidence-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A plausible answer with citations can still be weakly grounded. The cited document may be relevant to the topic but not support the specific claim. One sentence may be supported while another is inferred. A citation may point to a source that contradicts the answer once its conditions are read.\"},\"tunes\":{}},{\"id\":\"p-evidence-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Citation evaluation therefore belongs after generation. AWS distinguishes citation precision from citation coverage: whether cited passages are correctly cited and whether the answer is sufficiently supported by citations. In production, claim-level support is more useful than treating the presence of any citation as evidence quality.\"},\"tunes\":{}},{\"id\":\"h-validity\",\"type\":\"header\",\"data\":{\"text\":\"Layer 8 — Validity and freshness: was the evidence correct for this version of reality?\",\"level\":3},\"tunes\":{}},{\"id\":\"p-valid-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"RAG can retrieve a perfectly authentic, highly relevant, faithfully quoted source and still produce a wrong answer if the source is no longer valid for the current question. Policies change. APIs are deprecated. prices move. software behaviour changes between versions. product inventory changes. permissions change. game patches change mechanics.\"},\"tunes\":{}},{\"id\":\"p-valid-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is a separate failure class from hallucination. The evidence is real; its applicability is wrong. A robust system therefore needs timestamps, version or jurisdiction metadata where relevant, source authority, supersession rules, and an explicit mechanism for deciding when older evidence must be restricted or abandoned.\"},\"tunes\":{}},{\"id\":\"h-oracle\",\"type\":\"header\",\"data\":{\"text\":\"The fastest isolation method: the oracle-context test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-oracle-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The most useful first split is simple: manually provide the generator with a small set of evidence that you know is sufficient to answer the question. Keep the task and expected answer unchanged.\"},\"tunes\":{}},{\"id\":\"oracle-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Oracle-context test\",\"layout\":\"table\",\"columns\":[{\"id\":\"result\",\"label\":\"Result\"},{\"id\":\"meaning\",\"label\":\"Likely interpretation\"},{\"id\":\"next\",\"label\":\"Next diagnostic step\"}],\"rows\":[{\"id\":\"oracle-pass\",\"label\":\"Answer becomes correct\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"oracle-fail\",\"label\":\"Answer remains wrong\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"oracle-partial\",\"label\":\"Answer improves but remains incomplete\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"oracle-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"Why this test is powerful\",\"body\":\"The oracle-context test removes most of the retrieval pipeline from the experiment. It does not prove that generation is perfect, but it gives you a fast counterfactual: \u003Cstrong>what would the model do if retrieval had already succeeded?\u003C\u002Fstrong>\"},\"tunes\":{}},{\"id\":\"h-sequence\",\"type\":\"header\",\"data\":{\"text\":\"A production diagnostic sequence\",\"level\":2},\"tunes\":{}},{\"id\":\"diag-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Diagnose the failure from evidence to answer\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Define the expected claim\",\"description\":\"Write the expected answer, allowed uncertainty, and the evidence that would justify it.\"},{\"label\":\"2. Verify source coverage\",\"description\":\"Confirm that authoritative and permitted evidence exists in the indexed or reachable source set.\"},{\"label\":\"3. Run the oracle-context test\",\"description\":\"Supply sufficient gold evidence directly to the generator and observe whether the answer becomes correct.\"},{\"label\":\"4. Inspect the retrieval query\",\"description\":\"Check rewrites, entities, filters, language, time constraints, decomposition, and hidden assumptions.\"},{\"label\":\"5. Inspect candidates before reranking\",\"description\":\"Determine whether relevant evidence was retrieved at all and record its rank.\"},{\"label\":\"6. Inspect ranking and context assembly\",\"description\":\"Check reranking, metadata filters, truncation, chunk boundaries, duplicates, conflicts, and top-k composition.\"},{\"label\":\"7. Grade generation and citations separately\",\"description\":\"Measure answer correctness, completeness, faithfulness, and claim-level evidence support.\"},{\"label\":\"8. Test validity boundaries\",\"description\":\"Check whether version, date, state, jurisdiction, permissions, or superseding evidence changes the answer.\"}]},\"tunes\":{}},{\"id\":\"h-one-change\",\"type\":\"header\",\"data\":{\"text\":\"Do not change three layers at once\",\"level\":2},\"tunes\":{}},{\"id\":\"p-one-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A common debugging mistake is to change embeddings, chunk sizes, top-k, prompts, and the model in one iteration. If the score improves, you do not know why. If it gets worse, you do not know which change caused the regression.\"},\"tunes\":{}},{\"id\":\"p-one-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Treat RAG debugging like experimental diagnosis: hold as much of the pipeline constant as possible and replace one uncertain component with a controlled input. Gold documents isolate retrieval. Gold chunks isolate chunk selection. Fixed context isolates generation. A fixed model isolates retrieval changes. A fixed corpus isolates ingestion and indexing changes.\"},\"tunes\":{}},{\"id\":\"h-matrix\",\"type\":\"header\",\"data\":{\"text\":\"A failure matrix for common RAG symptoms\",\"level\":2},\"tunes\":{}},{\"id\":\"symptom-matrix\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Symptom\",\"Most likely layers to test first\",\"Discriminating test\"],[\"No relevant source appears\",\"Source coverage → Query → Candidate retrieval\",\"Search the corpus manually, then inspect rewritten query and unfiltered candidates\"],[\"Relevant source appears but answer is wrong\",\"Context assembly → Generation\",\"Oracle-context test with the same source reduced to decisive passages\"],[\"Answer is correct sometimes, wrong other times\",\"Ranking → Context assembly → Generation variability\",\"Repeat trials while logging retrieved set, rank, prompt context, and model output\"],[\"Answer cites the right document but overstates it\",\"Generation → Evidence attribution → Validity\",\"Grade each claim against the exact cited passage\"],[\"Old information keeps winning\",\"Ranking → Validity\u002Ffreshness\",\"Compare with recency\u002Fsupersession rules and inspect metadata\"],[\"Answer misses an exception\",\"Chunking → Context assembly\",\"Check whether rule and exception were split or truncated\"],[\"Adding more top-k makes quality worse\",\"Ranking → Context overload\",\"Ablate low-value chunks and compare with a minimal evidence set\"],[\"Changing the model fixes the answer\",\"Generation, but not necessarily retrieval\",\"Repeat with identical retrieved context across models\"],[\"Changing embeddings fixes the answer\",\"Retrieval\u002Franking\",\"Keep generator and context template constant while comparing candidate recall\"]]},\"tunes\":{}},{\"id\":\"h-metrics\",\"type\":\"header\",\"data\":{\"text\":\"Measure each layer with the metric it can actually influence\",\"level\":2},\"tunes\":{}},{\"id\":\"metrics-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Layer\",\"Useful measurements\",\"What not to infer\"],[\"Source coverage\",\"Answerable-question rate, corpus coverage, ingestion completeness\",\"Do not blame embeddings for missing source material\"],[\"Candidate retrieval\",\"Recall@k, hit rate, context coverage\",\"High recall does not prove ranking quality\"],[\"Ranking\",\"MRR, NDCG, gold rank, precision@k\",\"Good ranking does not prove the generator used the evidence\"],[\"Context assembly\",\"Evidence retention, duplication, contradiction rate, token utilization\",\"Large context does not mean useful context\"],[\"Generation\",\"Correctness, completeness, task success, faithfulness\",\"Correctness alone does not prove grounding\"],[\"Evidence attribution\",\"Citation precision, citation coverage, claim support\",\"A citation count is not evidence quality\"],[\"Validity\",\"Freshness, supersession accuracy, version\u002Fjurisdiction match\",\"Relevant evidence is not automatically applicable evidence\"]]},\"tunes\":{}},{\"id\":\"h-correct-answer\",\"type\":\"header\",\"data\":{\"text\":\"A correct answer can still hide a RAG defect\",\"level\":2},\"tunes\":{}},{\"id\":\"p-correct-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The reverse problem also matters. A RAG system can produce the correct answer while retrieval is broken. The model may already know the answer from training, infer it from weak evidence, or guess correctly. If evaluation looks only at the final answer, the system can appear healthy until the question reaches information that exists only in the private corpus.\"},\"tunes\":{}},{\"id\":\"p-correct-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is the same reliability problem that appears in agent systems more broadly: outcome correctness is not enough to prove that the execution path was reliable. For RAG, traces should preserve at least the retrieval query, candidate set, ranking, final context, answer, citations, model version, corpus\u002Findex version, and relevant filters.\"},\"tunes\":{}},{\"id\":\"internal-reliability\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough\",\"title\":\"AI Agent Reliability: Why the Final Answer Is Not Enough\",\"excerpt\":\"Correct output does not prove correct reasoning, safe execution, or a trustworthy system. This article extends that principle from RAG diagnosis to agent trajectories and operational assurance.\",\"ctaLabel\":\"Read the related article\"},\"tunes\":{}},{\"id\":\"h-hypotheses\",\"type\":\"header\",\"data\":{\"text\":\"Use competing hypotheses, not a favourite explanation\",\"level\":2},\"tunes\":{}},{\"id\":\"p-hyp-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"If a bad answer immediately becomes “an embedding problem,” the investigation is already biased. A stronger debugging method writes down competing hypotheses before changing the system: missing source, bad query rewrite, low retrieval recall, bad reranking, context truncation, conflicting versions, generation failure, citation failure, or stale evidence.\"},\"tunes\":{}},{\"id\":\"p-hyp-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Then choose a test that would separate those hypotheses. This is more efficient than collecting more examples that support the first explanation. The same principle applies to AI-assisted technical reasoning in general: a useful diagnosis is one that survives discriminating tests, not one that merely sounds plausible.\"},\"tunes\":{}},{\"id\":\"internal-reasoning\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework\",\"title\":\"From Research Protocol to a General AI Reasoning Framework\",\"excerpt\":\"A domain-independent reasoning method for separating evidence from assumptions, testing competing hypotheses and using domain-specific validators.\",\"ctaLabel\":\"Read the reasoning framework\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The exact diagnostic layers change with architecture. A simple single-document RAG application may have no query rewriting, reranker, or citation layer. An agentic retrieval system may add planning, multiple searches, tool selection, memory, permissions, and iterative evidence gathering. A structured database lookup may not use chunks or embeddings at all.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The core method still holds: identify the components that can independently change the result, construct controlled tests that replace uncertain components with known-good inputs, and measure each component using evidence appropriate to that layer.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Real failures are often coupled. A weak query can reduce recall, which changes reranking, which changes context, which increases generation variance. The oracle-context test is a diagnostic shortcut, not proof that one component is solely responsible. Evaluation datasets can also be unrepresentative, and model-based graders can introduce their own errors.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The proposed stack is therefore best used as an investigation structure: log the pipeline, isolate variables, reproduce failures, test competing explanations, and keep end-to-end evaluation after layer-level fixes.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"“RAG failed” should be the beginning of the investigation, not the conclusion. A useful diagnosis identifies whether the system lacked the evidence, searched incorrectly, failed to retrieve it, ranked it badly, assembled unusable context, generated incorrectly, attributed claims poorly, or applied evidence outside its validity boundary.\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The practical rule is simple: replace uncertainty with controlled evidence one layer at a time. Start with the oracle-context test. Separate retrieval-only evaluation from generation evaluation. Preserve the full trace. Then fix the component that actually failed instead of tuning the entire RAG stack by intuition.\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"RAG failure diagnosis\",\"items\":[{\"id\":\"faq1\",\"question\":\"How can I tell whether RAG retrieval or the LLM failed?\",\"answer\":\"Give the model a small set of known-correct evidence manually. If the answer becomes correct, investigate source coverage, query construction, retrieval, ranking, and context assembly. If the model still fails with sufficient evidence, retrieval is not the primary problem.\"},{\"id\":\"faq2\",\"question\":\"Can RAG fail even when the correct document was retrieved?\",\"answer\":\"Yes. The relevant passage can be ranked too low, truncated, separated from an exception, mixed with conflicting evidence, overwhelmed by irrelevant context, or used incorrectly by the generator.\"},{\"id\":\"faq3\",\"question\":\"Is answer correctness enough to evaluate a RAG system?\",\"answer\":\"No. A model can produce a correct answer despite weak retrieval by relying on prior model knowledge or chance. Evaluate retrieval and evidence support separately from final-answer correctness.\"},{\"id\":\"faq4\",\"question\":\"What should I log when debugging RAG?\",\"answer\":\"At minimum log the user request, transformed retrieval query, filters, candidate documents and ranks, final selected context, model and prompt version, answer, citations, corpus\u002Findex version, and timing or version metadata relevant to freshness.\"},{\"id\":\"faq5\",\"question\":\"Does increasing top-k usually fix RAG?\",\"answer\":\"Not reliably. A larger candidate or context set may improve recall, but it can also add noise, contradictions, duplicates, and context overload. Test whether the relevant evidence is missing before increasing top-k.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key diagnostic terms\",\"entries\":[{\"term\":\"Oracle-context test\",\"definition\":\"A controlled test in which the generator is given known-sufficient evidence directly to determine whether the dominant failure is upstream of generation.\",\"anchor\":\"oracle-context-test\"},{\"term\":\"Candidate retrieval\",\"definition\":\"The stage that selects an initial set of potentially relevant documents, chunks, records, or passages before final ranking or context assembly.\",\"anchor\":\"candidate-retrieval\"},{\"term\":\"Context assembly\",\"definition\":\"The process of converting retrieved evidence into the actual model input, including ordering, truncation, deduplication, formatting, and token-budget decisions.\",\"anchor\":\"context-assembly\"},{\"term\":\"Faithfulness\",\"definition\":\"The degree to which generated claims remain supported by the retrieved or supplied evidence rather than introducing unsupported content.\",\"anchor\":\"faithfulness\"},{\"term\":\"Context coverage\",\"definition\":\"A retrieval-oriented measure of whether selected evidence covers the information needed to answer the question.\",\"anchor\":\"context-coverage\"},{\"term\":\"Validity boundary\",\"definition\":\"The conditions under which a claim or answer remains applicable, such as time, version, jurisdiction, state, population, permissions, or source assumptions.\",\"anchor\":\"validity-boundary\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-rag\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Foptimizing-llm-accuracy\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Optimizing LLM Accuracy\",\"description\":\"OpenAI guidance separating retrieval failures from LLM failures in RAG applications.\"}},\"tunes\":{}},{\"id\":\"src-openai-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluation Best Practices\",\"description\":\"Guidance on structured evaluation for variable AI systems and production-oriented test design.\"}},\"tunes\":{}},{\"id\":\"src-aws-rag\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdocs.aws.amazon.com\u002Fbedrock\u002Flatest\u002Fuserguide\u002Fknowledge-base-evaluation-metrics.html\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Amazon Bedrock — RAG Evaluation Metrics\",\"description\":\"Documentation separating retrieve-only metrics from retrieve-and-generate metrics, including context relevance, coverage, faithfulness and citation measures.\"}},\"tunes\":{}},{\"id\":\"src-anthropic-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Demystifying Evals for AI Agents\",\"description\":\"Practical evaluation guidance on tasks, trials, graders, traces, regressions and production behaviour.\"}},\"tunes\":{}},{\"id\":\"src-google-rag\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fcloud.google.com\u002Fuse-cases\u002Fretrieval-augmented-generation\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Google Cloud — Retrieval-Augmented Generation\",\"description\":\"Overview of RAG architecture and the importance of relevant retrieval and grounded generation.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":874,"blocks":875,"version":833},1790369097340,[876,881,885,890,895,899,903,907,911,915,955,959,963,967,972,976,980,984,988,992,996,1000,1004,1008,1012,1016,1020,1024,1028,1032,1036,1040,1044,1048,1052,1056,1060,1064,1085,1090,1094,1123,1127,1131,1135,1139,1183,1187,1221,1225,1229,1233,1240,1244,1248,1252,1259,1263,1267,1271,1275,1279,1283,1287,1291,1295,1299,1319,1323,1343,1347,1354,1361,1368,1375],{"id":877,"data":878,"type":241,"tunes":880},"8zyFXn5HD5",{"title":879,"maxLevel":239,"minLevel":240},"Contents",{},{"id":215,"data":882,"type":218,"tunes":884},{"text":883},"A RAG system returns a weak, wrong, incomplete, or unsupported answer. The usual diagnosis is “retrieval failed” or “the model hallucinated.” Both labels are too broad to be useful. A production RAG pipeline can fail before retrieval, during retrieval, while ranking, while assembling context, during generation, or after generation when evidence and validity are checked.",{},{"id":221,"data":886,"type":226,"tunes":889},{"body":887,"title":888,"variant":225},"\u003Cstrong>Do not debug RAG as one component.\u003C\u002Fstrong> Diagnose it as a chain of independently testable layers. First determine whether the required evidence exists in an authoritative source. Then test query construction, candidate retrieval, ranking, context assembly, generation, evidence attribution, and freshness. The fastest isolation technique is an \u003Cstrong>oracle-context test\u003C\u002Fstrong>: give the generator the correct evidence manually. If the answer becomes correct, the dominant failure is upstream of generation. If it remains wrong, retrieval is not the primary problem.","Direct answer",{},{"id":229,"data":891,"type":226,"tunes":894},{"body":892,"title":893,"variant":233},"The RAG Failure Stack in this article is a practical diagnostic model, not a formal industry standard. Existing platforms already separate retrieval-only metrics from retrieve-and-generate metrics; this model extends that separation into a step-by-step production debugging method.","About the diagnostic model",{},{"id":244,"data":896,"type":42,"tunes":898},{"text":897,"level":240},"Why “RAG failed” is not a diagnosis",{},{"id":249,"data":900,"type":218,"tunes":902},{"text":901},"Retrieval-augmented generation combines several mechanisms: a user request is interpreted, one or more searches are constructed, candidate material is retrieved, results are filtered or reranked, selected evidence is inserted into a model context, and a model generates an answer. Production systems may add permissions, metadata filters, freshness rules, citations, query rewriting, hybrid search, tool calls, memory, and external state.",{},{"id":254,"data":904,"type":218,"tunes":906},{"text":905},"A wrong final answer therefore does not tell you which component failed. The model may have received the wrong evidence. It may have received the right evidence mixed with too much noise. The evidence may be correct but stale. The source may never have contained the answer. Or the model may have ignored perfectly adequate context.",{},{"id":259,"data":908,"type":218,"tunes":910},{"text":909},"OpenAI's RAG guidance already makes a fundamental distinction between retrieval failure and model failure: a system can supply the wrong context, or it can supply the right context and still generate the wrong answer. AWS similarly separates retrieve-only evaluation from retrieve-and-generate evaluation. For production diagnosis, that distinction should be taken further.",{},{"id":264,"data":912,"type":42,"tunes":914},{"text":913,"level":240},"The RAG Failure Stack",{},{"id":269,"data":916,"type":308,"tunes":954},{"content":917,"stretched":43,"withHeadings":14},[918,922,926,930,934,938,942,946,950],[919,920,921],"Layer","Question","Typical failure",[923,924,925],"1. Source coverage","Does the required evidence exist in an allowed authoritative source?","The corpus cannot answer the question at all",[927,928,929],"2. Query construction","Did the system search for the right thing?","Intent, entities, filters, language, or time constraints are lost",[931,932,933],"3. Candidate retrieval","Did the relevant evidence enter the candidate set?","Low recall; the right chunk is never retrieved",[935,936,937],"4. Ranking &amp; filtering","Did the right evidence survive and rank high enough?","Relevant evidence is buried, filtered out, or outranked by superficially similar text",[939,940,941],"5. Context assembly","Did the model receive usable evidence?","Truncation, bad chunk boundaries, duplicates, conflicting passages, or context overload",[943,944,945],"6. Generation","Did the model use the supplied evidence correctly?","Unsupported inference, instruction failure, reasoning error, or refusal mismatch",[947,948,949],"7. Evidence attribution","Can the answer be traced to the evidence it claims to use?","Missing, weak, or incorrect citations; claims exceed retrieved support",[951,952,953],"8. Validity &amp; freshness","Is the evidence still valid for this question now?","Correct historical evidence is reused outside its valid time, version, jurisdiction, or state",{},{"id":311,"data":956,"type":42,"tunes":958},{"text":957,"level":239},"Layer 1 — Source coverage: can the system answer this at all?",{},{"id":316,"data":960,"type":218,"tunes":962},{"text":961},"Before tuning embeddings, rerankers, or prompts, verify that the answer exists in the knowledge space the system is allowed to use. This sounds obvious, but many RAG failures are actually corpus failures. The requested fact may be absent, hidden in an unindexed attachment, available only in a newer document, stored in a system outside the RAG corpus, or blocked by permissions.",{},{"id":321,"data":964,"type":218,"tunes":966},{"text":965},"A retrieval metric cannot recover information that was never indexed. A larger top-k cannot retrieve a document the pipeline does not contain. If the source coverage test fails, the correct fix is ingestion, source selection, permissions, or an explicit “not answerable from available evidence” behaviour.",{},{"id":326,"data":968,"type":226,"tunes":971},{"body":969,"title":970,"variant":330},"Teams often tune retrieval against questions that the corpus cannot actually answer. This can make the retriever better at finding related text while leaving the underlying information gap untouched.","Failure pattern",{},{"id":333,"data":973,"type":42,"tunes":975},{"text":974,"level":239},"Layer 2 — Query construction: did the system ask the corpus the right question?",{},{"id":338,"data":977,"type":218,"tunes":979},{"text":978},"The user query is not always the retrieval query. Production systems rewrite questions, resolve pronouns, extract entities, translate languages, add metadata constraints, split complex questions, or generate multiple searches. Every transformation can improve retrieval, but every transformation can also destroy information.",{},{"id":343,"data":981,"type":218,"tunes":983},{"text":982},"A request such as “Does the policy still apply to contractors in Germany after the September update?” contains at least an entity, a population, a jurisdiction, and a time boundary. A rewritten query that becomes “contractor policy” may retrieve semantically related text while losing the variables that decide whether the answer is valid.",{},{"id":348,"data":985,"type":42,"tunes":987},{"text":986,"level":239},"Layer 3 — Candidate retrieval: did the relevant evidence enter the set?",{},{"id":353,"data":989,"type":218,"tunes":991},{"text":990},"Candidate retrieval is primarily a recall problem. The diagnostic question is not yet whether the best result ranked first; it is whether relevant evidence appeared anywhere in the candidate pool. If the known correct source does not appear, investigate indexing, chunking, embeddings, lexical matching, metadata, hybrid search, language handling, synonyms, and query expansion.",{},{"id":358,"data":993,"type":218,"tunes":995},{"text":994},"This is where retrieval-only evaluation is valuable. AWS exposes context relevance and context coverage for retrieve-only RAG evaluation. The important production habit is to evaluate retrieval before generation so that a polished final answer cannot hide a weak candidate set.",{},{"id":363,"data":997,"type":42,"tunes":999},{"text":998,"level":239},"Layer 4 — Ranking and filtering: was the right evidence discarded or buried?",{},{"id":368,"data":1001,"type":218,"tunes":1003},{"text":1002},"A system can have good recall and still fail because the relevant evidence ranks below noisy but semantically similar material. Rerankers, recency boosts, authority weights, language preferences, tenant filters, access controls, product status filters, and deduplication all change what survives into the final context.",{},{"id":373,"data":1005,"type":218,"tunes":1007},{"text":1006},"Debugging should therefore preserve the full candidate list, not only the final top-k. If the gold evidence was retrieved at rank 18 and a reranker removed it, the fix is not the same as a retrieval miss.",{},{"id":378,"data":1009,"type":42,"tunes":1011},{"text":1010,"level":239},"Layer 5 — Context assembly: did useful evidence become usable context?",{},{"id":383,"data":1013,"type":218,"tunes":1015},{"text":1014},"Retrieval success does not guarantee context success. Relevant chunks can be truncated, separated from their qualifiers, duplicated until they dominate the prompt, mixed with contradictory versions, or surrounded by enough irrelevant text that the decisive passage loses salience.",{},{"id":388,"data":1017,"type":218,"tunes":1019},{"text":1018},"Chunk boundaries are especially important. A sentence may contain the rule while the following sentence contains the exception. If they are indexed separately and only the first is retrieved, the retriever can appear relevant while the assembled context becomes misleading.",{},{"id":393,"data":1021,"type":42,"tunes":1023},{"text":1022,"level":239},"Layer 6 — Generation: can the model use correct evidence correctly?",{},{"id":398,"data":1025,"type":218,"tunes":1027},{"text":1026},"Once the system has demonstrably supplied sufficient evidence, generation becomes independently testable. The model may overgeneralize, combine incompatible passages, ignore a negative statement, fail to follow the requested answer format, invent a bridge between facts, or answer from parametric memory instead of the retrieved evidence.",{},{"id":403,"data":1029,"type":218,"tunes":1031},{"text":1030},"This is why end-to-end correctness alone is insufficient for diagnosis. OpenAI recommends evaluation as a structured way to understand application behaviour, while Anthropic's agent-evaluation guidance emphasizes multiple trials, graders, traces, and realistic failure cases. For RAG, the generator should be tested both with normal retrieval and with controlled gold context.",{},{"id":408,"data":1033,"type":42,"tunes":1035},{"text":1034,"level":239},"Layer 7 — Evidence attribution: is the answer actually supported?",{},{"id":413,"data":1037,"type":218,"tunes":1039},{"text":1038},"A plausible answer with citations can still be weakly grounded. The cited document may be relevant to the topic but not support the specific claim. One sentence may be supported while another is inferred. A citation may point to a source that contradicts the answer once its conditions are read.",{},{"id":418,"data":1041,"type":218,"tunes":1043},{"text":1042},"Citation evaluation therefore belongs after generation. AWS distinguishes citation precision from citation coverage: whether cited passages are correctly cited and whether the answer is sufficiently supported by citations. In production, claim-level support is more useful than treating the presence of any citation as evidence quality.",{},{"id":423,"data":1045,"type":42,"tunes":1047},{"text":1046,"level":239},"Layer 8 — Validity and freshness: was the evidence correct for this version of reality?",{},{"id":428,"data":1049,"type":218,"tunes":1051},{"text":1050},"RAG can retrieve a perfectly authentic, highly relevant, faithfully quoted source and still produce a wrong answer if the source is no longer valid for the current question. Policies change. APIs are deprecated. prices move. software behaviour changes between versions. product inventory changes. permissions change. game patches change mechanics.",{},{"id":433,"data":1053,"type":218,"tunes":1055},{"text":1054},"This is a separate failure class from hallucination. The evidence is real; its applicability is wrong. A robust system therefore needs timestamps, version or jurisdiction metadata where relevant, source authority, supersession rules, and an explicit mechanism for deciding when older evidence must be restricted or abandoned.",{},{"id":438,"data":1057,"type":42,"tunes":1059},{"text":1058,"level":240},"The fastest isolation method: the oracle-context test",{},{"id":443,"data":1061,"type":218,"tunes":1063},{"text":1062},"The most useful first split is simple: manually provide the generator with a small set of evidence that you know is sufficient to answer the question. Keep the task and expected answer unchanged.",{},{"id":448,"data":1065,"type":475,"tunes":1084},{"rows":1066,"title":1076,"layout":308,"columns":1077},[1067,1070,1073],{"id":452,"label":1068,"values":1069},"Answer becomes correct",[455,455,455],{"id":457,"label":1071,"values":1072},"Answer remains wrong",[455,455,455],{"id":461,"label":1074,"values":1075},"Answer improves but remains incomplete",[455,455,455],"Oracle-context test",[1078,1080,1082],{"id":467,"label":1079},"Result",{"id":470,"label":1081},"Likely interpretation",{"id":473,"label":1083},"Next diagnostic step",{},{"id":478,"data":1086,"type":226,"tunes":1089},{"body":1087,"title":1088,"variant":482},"The oracle-context test removes most of the retrieval pipeline from the experiment. It does not prove that generation is perfect, but it gives you a fast counterfactual: \u003Cstrong>what would the model do if retrieval had already succeeded?\u003C\u002Fstrong>","Why this test is powerful",{},{"id":485,"data":1091,"type":42,"tunes":1093},{"text":1092,"level":240},"A production diagnostic sequence",{},{"id":490,"data":1095,"type":519,"tunes":1122},{"steps":1096,"title":1121,"orientation":518},[1097,1100,1103,1106,1109,1112,1115,1118],{"label":1098,"description":1099},"1. Define the expected claim","Write the expected answer, allowed uncertainty, and the evidence that would justify it.",{"label":1101,"description":1102},"2. Verify source coverage","Confirm that authoritative and permitted evidence exists in the indexed or reachable source set.",{"label":1104,"description":1105},"3. Run the oracle-context test","Supply sufficient gold evidence directly to the generator and observe whether the answer becomes correct.",{"label":1107,"description":1108},"4. Inspect the retrieval query","Check rewrites, entities, filters, language, time constraints, decomposition, and hidden assumptions.",{"label":1110,"description":1111},"5. Inspect candidates before reranking","Determine whether relevant evidence was retrieved at all and record its rank.",{"label":1113,"description":1114},"6. Inspect ranking and context assembly","Check reranking, metadata filters, truncation, chunk boundaries, duplicates, conflicts, and top-k composition.",{"label":1116,"description":1117},"7. Grade generation and citations separately","Measure answer correctness, completeness, faithfulness, and claim-level evidence support.",{"label":1119,"description":1120},"8. Test validity boundaries","Check whether version, date, state, jurisdiction, permissions, or superseding evidence changes the answer.","Diagnose the failure from evidence to answer",{},{"id":522,"data":1124,"type":42,"tunes":1126},{"text":1125,"level":240},"Do not change three layers at once",{},{"id":527,"data":1128,"type":218,"tunes":1130},{"text":1129},"A common debugging mistake is to change embeddings, chunk sizes, top-k, prompts, and the model in one iteration. If the score improves, you do not know why. If it gets worse, you do not know which change caused the regression.",{},{"id":532,"data":1132,"type":218,"tunes":1134},{"text":1133},"Treat RAG debugging like experimental diagnosis: hold as much of the pipeline constant as possible and replace one uncertain component with a controlled input. Gold documents isolate retrieval. Gold chunks isolate chunk selection. Fixed context isolates generation. A fixed model isolates retrieval changes. A fixed corpus isolates ingestion and indexing changes.",{},{"id":537,"data":1136,"type":42,"tunes":1138},{"text":1137,"level":240},"A failure matrix for common RAG symptoms",{},{"id":542,"data":1140,"type":308,"tunes":1182},{"content":1141,"stretched":43,"withHeadings":14},[1142,1146,1150,1154,1158,1162,1166,1170,1174,1178],[1143,1144,1145],"Symptom","Most likely layers to test first","Discriminating test",[1147,1148,1149],"No relevant source appears","Source coverage → Query → Candidate retrieval","Search the corpus manually, then inspect rewritten query and unfiltered candidates",[1151,1152,1153],"Relevant source appears but answer is wrong","Context assembly → Generation","Oracle-context test with the same source reduced to decisive passages",[1155,1156,1157],"Answer is correct sometimes, wrong other times","Ranking → Context assembly → Generation variability","Repeat trials while logging retrieved set, rank, prompt context, and model output",[1159,1160,1161],"Answer cites the right document but overstates it","Generation → Evidence attribution → Validity","Grade each claim against the exact cited passage",[1163,1164,1165],"Old information keeps winning","Ranking → Validity\u002Ffreshness","Compare with recency\u002Fsupersession rules and inspect metadata",[1167,1168,1169],"Answer misses an exception","Chunking → Context assembly","Check whether rule and exception were split or truncated",[1171,1172,1173],"Adding more top-k makes quality worse","Ranking → Context overload","Ablate low-value chunks and compare with a minimal evidence set",[1175,1176,1177],"Changing the model fixes the answer","Generation, but not necessarily retrieval","Repeat with identical retrieved context across models",[1179,1180,1181],"Changing embeddings fixes the answer","Retrieval\u002Franking","Keep generator and context template constant while comparing candidate recall",{},{"id":587,"data":1184,"type":42,"tunes":1186},{"text":1185,"level":240},"Measure each layer with the metric it can actually influence",{},{"id":592,"data":1188,"type":308,"tunes":1220},{"content":1189,"stretched":43,"withHeadings":14},[1190,1193,1197,1201,1204,1208,1212,1216],[919,1191,1192],"Useful measurements","What not to infer",[1194,1195,1196],"Source coverage","Answerable-question rate, corpus coverage, ingestion completeness","Do not blame embeddings for missing source material",[1198,1199,1200],"Candidate retrieval","Recall@k, hit rate, context coverage","High recall does not prove ranking quality",[607,1202,1203],"MRR, NDCG, gold rank, precision@k","Good ranking does not prove the generator used the evidence",[1205,1206,1207],"Context assembly","Evidence retention, duplication, contradiction rate, token utilization","Large context does not mean useful context",[1209,1210,1211],"Generation","Correctness, completeness, task success, faithfulness","Correctness alone does not prove grounding",[1213,1214,1215],"Evidence attribution","Citation precision, citation coverage, claim support","A citation count is not evidence quality",[1217,1218,1219],"Validity","Freshness, supersession accuracy, version\u002Fjurisdiction match","Relevant evidence is not automatically applicable evidence",{},{"id":628,"data":1222,"type":42,"tunes":1224},{"text":1223,"level":240},"A correct answer can still hide a RAG defect",{},{"id":633,"data":1226,"type":218,"tunes":1228},{"text":1227},"The reverse problem also matters. A RAG system can produce the correct answer while retrieval is broken. The model may already know the answer from training, infer it from weak evidence, or guess correctly. If evaluation looks only at the final answer, the system can appear healthy until the question reaches information that exists only in the private corpus.",{},{"id":638,"data":1230,"type":218,"tunes":1232},{"text":1231},"This is the same reliability problem that appears in agent systems more broadly: outcome correctness is not enough to prove that the execution path was reliable. For RAG, traces should preserve at least the retrieval query, candidate set, ranking, final context, answer, citations, model version, corpus\u002Findex version, and relevant filters.",{},{"id":643,"data":1234,"type":649,"tunes":1239},{"url":1235,"title":1236,"excerpt":1237,"ctaLabel":1238},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-reliability-why-the-final-answer-is-not-enough","AI Agent Reliability: Why the Final Answer Is Not Enough","Correct output does not prove correct reasoning, safe execution, or a trustworthy system. This article extends that principle from RAG diagnosis to agent trajectories and operational assurance.","Read the related article",{},{"id":652,"data":1241,"type":42,"tunes":1243},{"text":1242,"level":240},"Use competing hypotheses, not a favourite explanation",{},{"id":657,"data":1245,"type":218,"tunes":1247},{"text":1246},"If a bad answer immediately becomes “an embedding problem,” the investigation is already biased. A stronger debugging method writes down competing hypotheses before changing the system: missing source, bad query rewrite, low retrieval recall, bad reranking, context truncation, conflicting versions, generation failure, citation failure, or stale evidence.",{},{"id":662,"data":1249,"type":218,"tunes":1251},{"text":1250},"Then choose a test that would separate those hypotheses. This is more efficient than collecting more examples that support the first explanation. The same principle applies to AI-assisted technical reasoning in general: a useful diagnosis is one that survives discriminating tests, not one that merely sounds plausible.",{},{"id":667,"data":1253,"type":649,"tunes":1258},{"url":1254,"title":1255,"excerpt":1256,"ctaLabel":1257},"https:\u002F\u002Fstajic.de\u002Fblog\u002Ffrom-research-protocol-to-a-general-ai-reasoning-framework","From Research Protocol to a General AI Reasoning Framework","A domain-independent reasoning method for separating evidence from assumptions, testing competing hypotheses and using domain-specific validators.","Read the reasoning framework",{},{"id":675,"data":1260,"type":42,"tunes":1262},{"text":1261,"level":240},"What would change this answer?",{},{"id":680,"data":1264,"type":218,"tunes":1266},{"text":1265},"The exact diagnostic layers change with architecture. A simple single-document RAG application may have no query rewriting, reranker, or citation layer. An agentic retrieval system may add planning, multiple searches, tool selection, memory, permissions, and iterative evidence gathering. A structured database lookup may not use chunks or embeddings at all.",{},{"id":685,"data":1268,"type":218,"tunes":1270},{"text":1269},"The core method still holds: identify the components that can independently change the result, construct controlled tests that replace uncertain components with known-good inputs, and measure each component using evidence appropriate to that layer.",{},{"id":690,"data":1272,"type":42,"tunes":1274},{"text":1273,"level":240},"Limitations",{},{"id":695,"data":1276,"type":218,"tunes":1278},{"text":1277},"Real failures are often coupled. A weak query can reduce recall, which changes reranking, which changes context, which increases generation variance. The oracle-context test is a diagnostic shortcut, not proof that one component is solely responsible. Evaluation datasets can also be unrepresentative, and model-based graders can introduce their own errors.",{},{"id":700,"data":1280,"type":218,"tunes":1282},{"text":1281},"The proposed stack is therefore best used as an investigation structure: log the pipeline, isolate variables, reproduce failures, test competing explanations, and keep end-to-end evaluation after layer-level fixes.",{},{"id":705,"data":1284,"type":42,"tunes":1286},{"text":1285,"level":240},"Conclusion",{},{"id":710,"data":1288,"type":218,"tunes":1290},{"text":1289},"“RAG failed” should be the beginning of the investigation, not the conclusion. A useful diagnosis identifies whether the system lacked the evidence, searched incorrectly, failed to retrieve it, ranked it badly, assembled unusable context, generated incorrectly, attributed claims poorly, or applied evidence outside its validity boundary.",{},{"id":715,"data":1292,"type":218,"tunes":1294},{"text":1293},"The practical rule is simple: replace uncertainty with controlled evidence one layer at a time. Start with the oracle-context test. Separate retrieval-only evaluation from generation evaluation. Preserve the full trace. Then fix the component that actually failed instead of tuning the entire RAG stack by intuition.",{},{"id":720,"data":1296,"type":42,"tunes":1298},{"text":1297,"level":240},"FAQ",{},{"id":725,"data":1300,"type":725,"tunes":1318},{"items":1301,"title":1317},[1302,1305,1308,1311,1314],{"id":729,"answer":1303,"question":1304},"Give the model a small set of known-correct evidence manually. If the answer becomes correct, investigate source coverage, query construction, retrieval, ranking, and context assembly. If the model still fails with sufficient evidence, retrieval is not the primary problem.","How can I tell whether RAG retrieval or the LLM failed?",{"id":733,"answer":1306,"question":1307},"Yes. The relevant passage can be ranked too low, truncated, separated from an exception, mixed with conflicting evidence, overwhelmed by irrelevant context, or used incorrectly by the generator.","Can RAG fail even when the correct document was retrieved?",{"id":737,"answer":1309,"question":1310},"No. A model can produce a correct answer despite weak retrieval by relying on prior model knowledge or chance. Evaluate retrieval and evidence support separately from final-answer correctness.","Is answer correctness enough to evaluate a RAG system?",{"id":741,"answer":1312,"question":1313},"At minimum log the user request, transformed retrieval query, filters, candidate documents and ranks, final selected context, model and prompt version, answer, citations, corpus\u002Findex version, and timing or version metadata relevant to freshness.","What should I log when debugging RAG?",{"id":745,"answer":1315,"question":1316},"Not reliably. A larger candidate or context set may improve recall, but it can also add noise, contradictions, duplicates, and context overload. Test whether the relevant evidence is missing before increasing top-k.","Does increasing top-k usually fix RAG?","RAG failure diagnosis",{},{"id":751,"data":1320,"type":42,"tunes":1322},{"text":1321,"level":240},"Glossary",{},{"id":756,"data":1324,"type":756,"tunes":1342},{"title":1325,"entries":1326},"Key diagnostic terms",[1327,1329,1331,1333,1336,1339],{"term":1076,"anchor":761,"definition":1328},"A controlled test in which the generator is given known-sufficient evidence directly to determine whether the dominant failure is upstream of generation.",{"term":1198,"anchor":764,"definition":1330},"The stage that selects an initial set of potentially relevant documents, chunks, records, or passages before final ranking or context assembly.",{"term":1205,"anchor":767,"definition":1332},"The process of converting retrieved evidence into the actual model input, including ordering, truncation, deduplication, formatting, and token-budget decisions.",{"term":1334,"anchor":771,"definition":1335},"Faithfulness","The degree to which generated claims remain supported by the retrieved or supplied evidence rather than introducing unsupported content.",{"term":1337,"anchor":775,"definition":1338},"Context coverage","A retrieval-oriented measure of whether selected evidence covers the information needed to answer the question.",{"term":1340,"anchor":779,"definition":1341},"Validity boundary","The conditions under which a claim or answer remains applicable, such as time, version, jurisdiction, state, population, permissions, or source assumptions.",{},{"id":783,"data":1344,"type":42,"tunes":1346},{"text":1345,"level":240},"Primary sources and further reading",{},{"id":788,"data":1348,"type":795,"tunes":1353},{"link":790,"meta":1349},{"image":1350,"title":1351,"description":1352},{"url":455},"OpenAI — Optimizing LLM Accuracy","OpenAI guidance separating retrieval failures from LLM failures in RAG applications.",{},{"id":798,"data":1355,"type":795,"tunes":1360},{"link":800,"meta":1356},{"image":1357,"title":1358,"description":1359},{"url":455},"OpenAI — Evaluation Best Practices","Guidance on structured evaluation for variable AI systems and production-oriented test design.",{},{"id":807,"data":1362,"type":795,"tunes":1367},{"link":809,"meta":1363},{"image":1364,"title":1365,"description":1366},{"url":455},"Amazon Bedrock — RAG Evaluation Metrics","Documentation separating retrieve-only metrics from retrieve-and-generate metrics, including context relevance, coverage, faithfulness and citation measures.",{},{"id":816,"data":1369,"type":795,"tunes":1374},{"link":818,"meta":1370},{"image":1371,"title":1372,"description":1373},{"url":455},"Anthropic — Demystifying Evals for AI Agents","Practical evaluation guidance on tasks, trials, graders, traces, regressions and production behaviour.",{},{"id":825,"data":1376,"type":795,"tunes":1381},{"link":827,"meta":1377},{"image":1378,"title":1379,"description":1380},{"url":455},"Google Cloud — Retrieval-Augmented Generation","Overview of RAG architecture and the importance of relevant retrieval and grounded generation.",{},"When a RAG answer is wrong, blaming retrieval or the model is too vague. This diagnostic method isolates source coverage, query construction, retrieval, ranking, context assembly, generation, evidence attribution, and freshness—so the actual failure can be reproduced and fixed.",{"lang":7,"title":208,"content":210,"contentJson":1384,"excerpt":834},{"time":212,"blocks":1385,"version":833},[1386,1389,1392,1395,1398,1401,1404,1407,1410,1413,1426,1429,1432,1435,1438,1441,1444,1447,1450,1453,1456,1459,1462,1465,1468,1471,1474,1477,1480,1483,1486,1489,1492,1495,1498,1501,1504,1507,1521,1524,1527,1539,1542,1545,1548,1551,1565,1568,1580,1583,1586,1589,1592,1595,1598,1601,1604,1607,1610,1613,1616,1619,1622,1625,1628,1631,1634,1643,1646,1656,1659,1664,1669,1674,1679],{"id":215,"data":1387,"type":218,"tunes":1388},{"text":217},{},{"id":221,"data":1390,"type":226,"tunes":1391},{"body":223,"title":224,"variant":225},{},{"id":229,"data":1393,"type":226,"tunes":1394},{"body":231,"title":232,"variant":233},{},{"id":236,"data":1396,"type":241,"tunes":1397},{"title":238,"maxLevel":239,"minLevel":240},{},{"id":244,"data":1399,"type":42,"tunes":1400},{"text":246,"level":240},{},{"id":249,"data":1402,"type":218,"tunes":1403},{"text":251},{},{"id":254,"data":1405,"type":218,"tunes":1406},{"text":256},{},{"id":259,"data":1408,"type":218,"tunes":1409},{"text":261},{},{"id":264,"data":1411,"type":42,"tunes":1412},{"text":266,"level":240},{},{"id":269,"data":1414,"type":308,"tunes":1425},{"content":1415,"stretched":43,"withHeadings":14},[1416,1417,1418,1419,1420,1421,1422,1423,1424],[273,274,275],[277,278,279],[281,282,283],[285,286,287],[289,290,291],[293,294,295],[297,298,299],[301,302,303],[305,306,307],{},{"id":311,"data":1427,"type":42,"tunes":1428},{"text":313,"level":239},{},{"id":316,"data":1430,"type":218,"tunes":1431},{"text":318},{},{"id":321,"data":1433,"type":218,"tunes":1434},{"text":323},{},{"id":326,"data":1436,"type":226,"tunes":1437},{"body":328,"title":329,"variant":330},{},{"id":333,"data":1439,"type":42,"tunes":1440},{"text":335,"level":239},{},{"id":338,"data":1442,"type":218,"tunes":1443},{"text":340},{},{"id":343,"data":1445,"type":218,"tunes":1446},{"text":345},{},{"id":348,"data":1448,"type":42,"tunes":1449},{"text":350,"level":239},{},{"id":353,"data":1451,"type":218,"tunes":1452},{"text":355},{},{"id":358,"data":1454,"type":218,"tunes":1455},{"text":360},{},{"id":363,"data":1457,"type":42,"tunes":1458},{"text":365,"level":239},{},{"id":368,"data":1460,"type":218,"tunes":1461},{"text":370},{},{"id":373,"data":1463,"type":218,"tunes":1464},{"text":375},{},{"id":378,"data":1466,"type":42,"tunes":1467},{"text":380,"level":239},{},{"id":383,"data":1469,"type":218,"tunes":1470},{"text":385},{},{"id":388,"data":1472,"type":218,"tunes":1473},{"text":390},{},{"id":393,"data":1475,"type":42,"tunes":1476},{"text":395,"level":239},{},{"id":398,"data":1478,"type":218,"tunes":1479},{"text":400},{},{"id":403,"data":1481,"type":218,"tunes":1482},{"text":405},{},{"id":408,"data":1484,"type":42,"tunes":1485},{"text":410,"level":239},{},{"id":413,"data":1487,"type":218,"tunes":1488},{"text":415},{},{"id":418,"data":1490,"type":218,"tunes":1491},{"text":420},{},{"id":423,"data":1493,"type":42,"tunes":1494},{"text":425,"level":239},{},{"id":428,"data":1496,"type":218,"tunes":1497},{"text":430},{},{"id":433,"data":1499,"type":218,"tunes":1500},{"text":435},{},{"id":438,"data":1502,"type":42,"tunes":1503},{"text":440,"level":240},{},{"id":443,"data":1505,"type":218,"tunes":1506},{"text":445},{},{"id":448,"data":1508,"type":475,"tunes":1520},{"rows":1509,"title":464,"layout":308,"columns":1516},[1510,1512,1514],{"id":452,"label":453,"values":1511},[455,455,455],{"id":457,"label":458,"values":1513},[455,455,455],{"id":461,"label":462,"values":1515},[455,455,455],[1517,1518,1519],{"id":467,"label":468},{"id":470,"label":471},{"id":473,"label":474},{},{"id":478,"data":1522,"type":226,"tunes":1523},{"body":480,"title":481,"variant":482},{},{"id":485,"data":1525,"type":42,"tunes":1526},{"text":487,"level":240},{},{"id":490,"data":1528,"type":519,"tunes":1538},{"steps":1529,"title":517,"orientation":518},[1530,1531,1532,1533,1534,1535,1536,1537],{"label":494,"description":495},{"label":497,"description":498},{"label":500,"description":501},{"label":503,"description":504},{"label":506,"description":507},{"label":509,"description":510},{"label":512,"description":513},{"label":515,"description":516},{},{"id":522,"data":1540,"type":42,"tunes":1541},{"text":524,"level":240},{},{"id":527,"data":1543,"type":218,"tunes":1544},{"text":529},{},{"id":532,"data":1546,"type":218,"tunes":1547},{"text":534},{},{"id":537,"data":1549,"type":42,"tunes":1550},{"text":539,"level":240},{},{"id":542,"data":1552,"type":308,"tunes":1564},{"content":1553,"stretched":43,"withHeadings":14},[1554,1555,1556,1557,1558,1559,1560,1561,1562,1563],[546,547,548],[550,551,552],[554,555,556],[558,559,560],[562,563,564],[566,567,568],[570,571,572],[574,575,576],[578,579,580],[582,583,584],{},{"id":587,"data":1566,"type":42,"tunes":1567},{"text":589,"level":240},{},{"id":592,"data":1569,"type":308,"tunes":1579},{"content":1570,"stretched":43,"withHeadings":14},[1571,1572,1573,1574,1575,1576,1577,1578],[273,596,597],[599,600,601],[603,604,605],[607,608,609],[611,612,613],[615,616,617],[619,620,621],[623,624,625],{},{"id":628,"data":1581,"type":42,"tunes":1582},{"text":630,"level":240},{},{"id":633,"data":1584,"type":218,"tunes":1585},{"text":635},{},{"id":638,"data":1587,"type":218,"tunes":1588},{"text":640},{},{"id":643,"data":1590,"type":649,"tunes":1591},{"url":645,"title":646,"excerpt":647,"ctaLabel":648},{},{"id":652,"data":1593,"type":42,"tunes":1594},{"text":654,"level":240},{},{"id":657,"data":1596,"type":218,"tunes":1597},{"text":659},{},{"id":662,"data":1599,"type":218,"tunes":1600},{"text":664},{},{"id":667,"data":1602,"type":649,"tunes":1603},{"url":669,"title":670,"excerpt":671,"ctaLabel":672},{},{"id":675,"data":1605,"type":42,"tunes":1606},{"text":677,"level":240},{},{"id":680,"data":1608,"type":218,"tunes":1609},{"text":682},{},{"id":685,"data":1611,"type":218,"tunes":1612},{"text":687},{},{"id":690,"data":1614,"type":42,"tunes":1615},{"text":692,"level":240},{},{"id":695,"data":1617,"type":218,"tunes":1618},{"text":697},{},{"id":700,"data":1620,"type":218,"tunes":1621},{"text":702},{},{"id":705,"data":1623,"type":42,"tunes":1624},{"text":707,"level":240},{},{"id":710,"data":1626,"type":218,"tunes":1627},{"text":712},{},{"id":715,"data":1629,"type":218,"tunes":1630},{"text":717},{},{"id":720,"data":1632,"type":42,"tunes":1633},{"text":722,"level":240},{},{"id":725,"data":1635,"type":725,"tunes":1642},{"items":1636,"title":748},[1637,1638,1639,1640,1641],{"id":729,"answer":730,"question":731},{"id":733,"answer":734,"question":735},{"id":737,"answer":738,"question":739},{"id":741,"answer":742,"question":743},{"id":745,"answer":746,"question":747},{},{"id":751,"data":1644,"type":42,"tunes":1645},{"text":753,"level":240},{},{"id":756,"data":1647,"type":756,"tunes":1655},{"title":758,"entries":1648},[1649,1650,1651,1652,1653,1654],{"term":464,"anchor":761,"definition":762},{"term":603,"anchor":764,"definition":765},{"term":611,"anchor":767,"definition":768},{"term":770,"anchor":771,"definition":772},{"term":774,"anchor":775,"definition":776},{"term":778,"anchor":779,"definition":780},{},{"id":783,"data":1657,"type":42,"tunes":1658},{"text":785,"level":240},{},{"id":788,"data":1660,"type":795,"tunes":1663},{"link":790,"meta":1661},{"image":1662,"title":793,"description":794},{"url":455},{},{"id":798,"data":1665,"type":795,"tunes":1668},{"link":800,"meta":1666},{"image":1667,"title":803,"description":804},{"url":455},{},{"id":807,"data":1670,"type":795,"tunes":1673},{"link":809,"meta":1671},{"image":1672,"title":812,"description":813},{"url":455},{},{"id":816,"data":1675,"type":795,"tunes":1678},{"link":818,"meta":1676},{"image":1677,"title":821,"description":822},{"url":455},{},{"id":825,"data":1680,"type":795,"tunes":1683},{"link":827,"meta":1681},{"image":1682,"title":830,"description":831},{"url":455},{},"Post erfolgreich abgerufen",{"items":1686,"source":1742,"manualIds":1743,"manualMatchedIds":1744},[1687,1694,1701,1708,1715,1721,1728,1735],{"id":1688,"slug":1689,"title":1690,"excerpt":1691,"featuredImage":1692,"publishedAt":1693},"364","tipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung","Dominando el flujo de trabajo SEO: Estrategias de optimización esenciales para el crecimiento orgánico","Un flujo de trabajo SEO estructurado es crucial para un crecimiento orgánico sostenible. Aprende las diez estrategias fundamentales, desde la investigación de palabras clave y la optimización técnica hasta la calidad del contenido y el análisis de rendimiento.","\u002Fuploads\u002F2026\u002F03\u002Ftipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung-1774866098131-hwkzrg.webp","2024-01-26T06:35:00.000Z",{"id":1695,"slug":1696,"title":1697,"excerpt":1698,"featuredImage":1699,"publishedAt":1700},"468","ai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","La memoria del agente de IA no es RAG: cómo separar memoria, recuperación, estado y contexto","La memoria del agente, RAG, el estado y el contexto a menudo se usan como si fueran intercambiables. No lo son. Este modelo práctico de arquitectura separa las cuatro capas, muestra dónde pertenece cada una y explica qué se rompe cuando los sistemas las colapsan en una sola.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context-1790350560308-np0xy6.webp","2026-09-25T11:34:00.000Z",{"id":1702,"slug":1703,"title":1704,"excerpt":1705,"featuredImage":1706,"publishedAt":1707},"477","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","Agentes de uso de computadoras: por qué una demostración exitosa aún puede ser un sistema poco confiable","Los agentes de uso de computadoras ahora pueden completar impresionantes flujos de trabajo en el navegador y en el escritorio, pero una ejecución exitosa demuestra capacidad—no fiabilidad. Este artículo muestra cómo probar la repetibilidad, la robustez ambiental, el control de horizonte largo, la conciencia del estado, la verificación de resultados y la gestión segura de objetivos.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","2026-09-25T12:13:00.000Z",{"id":1709,"slug":1710,"title":1711,"excerpt":1712,"featuredImage":1713,"publishedAt":1714},"459","ollama-is-not-the-product-building-production-ready-open-llm-applications","Ollama no es el producto: Construcción de aplicaciones de LLM abiertos listas para producción","Ejecutar un modelo local con Ollama es fácil. Construir una aplicación Open-LLM lista para producción es más difícil: requiere RAG, control de acceso, abstracción de proveedores, evaluación, registro, disciplina de despliegue y una capa de aplicación controlada alrededor del modelo.","\u002Fuploads\u002F2026\u002F06\u002Follama-is-not-the-product-building-production-ready-open-llm-applications-1782679361640-h0usqf.webp","2026-06-28T16:39:00.000Z",{"id":1716,"slug":858,"title":1717,"excerpt":1718,"featuredImage":1719,"publishedAt":1720},"434","Guía completa de Evaluation Harness: Dominando la evaluación del rendimiento de LLM","Esta guía proporciona un recorrido detallado de Evaluation Harness, un marco de trabajo esencial para evaluar rigurosamente las capacidades de los modelos de lenguaje extensos (LLM) en los pipelines de LLMOps empresariales. Conozca la configuración, las mejores prácticas y las técnicas avanzadas para garantizar una evaluación comparativa y optimización de modelos confiables.","\u002Fuploads\u002F2026\u002F04\u002Fevaluation-harness-1775466944495-4s0xv2.webp","2026-03-01T17:50:00.000Z",{"id":1722,"slug":1723,"title":1724,"excerpt":1725,"featuredImage":1726,"publishedAt":1727},"478","what-is-rag-the-simplest-explanation-of-how-it-works","¿Qué es RAG? La explicación más sencilla de cómo funciona","RAG suena complicado, pero la idea es simple: antes de que una IA responda, primero busca información útil de una fuente de conocimiento y le da esa información al modelo de lenguaje. Esta guía explica RAG, los LLM, el estado, la memoria y las herramientas usando un modelo mental simple.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":1729,"slug":1730,"title":1731,"excerpt":1732,"featuredImage":1733,"publishedAt":1734},"475","managed-agent-harness-vs-self-hosted-agent-loop-what-you-gain-what-you-lose","Harness de agente gestionado vs. bucle de agente autohospedado: lo que ganas, lo que pierdes","“Agente autoalojado” puede significar arquitecturas muy diferentes. Esta guía separa el arnés gestionado, el entorno de ejecución autoalojado y el bucle de agente totalmente autooperado—y muestra qué límite de control necesitan realmente los equipos.","\u002Fuploads\u002F2026\u002F09\u002Fmanaged-agent-harness-vs-self-hosted-agent-loop-what-you-gain-what-you-lose-1790352403475-kj10jh.webp","2026-09-25T12:05:00.000Z",{"id":1736,"slug":1737,"title":1738,"excerpt":1739,"featuredImage":1740,"publishedAt":1741},"460","ai-agent-reliability-why-the-final-answer-is-not-enough","Fiabilidad de los Agentes de IA: Por Qué la Respuesta Final No es Suficiente","Una salida correcta no demuestra un razonamiento correcto, una ejecución segura ni un sistema confiable.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-reliability-why-the-final-answer-is-not-enough-1788955466306-pl0qhz.webp","2026-09-09T04:01:00.000Z","fallback",[],[]]