[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:fr":3,"public-menus:all":38,"post:why-more-context-can-make-ai-answers-worse:fr":205,"related:post:why-more-context-can-make-ai-answers-worse:fr:1":1591},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","fr","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":1590},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":798,"featuredImage":799,"featuredImageAlt":800,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":801,"publishedAt":802,"createdAt":803,"updatedAt":804,"seoLocalePaths":805,"categories":814,"author":827,"translations":832},"472","Pourquoi plus de contexte peut rendre les réponses de l'IA pires","why-more-context-can-make-ai-answers-worse","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Sommaire\">\u003Cstrong class=\"editorjs-toc__title\">Sommaire\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-5\" class=\"editorjs-toc__link\">Capacité de contexte n&#39;est pas exploitabilité de contexte\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-9\" class=\"editorjs-toc__link\">Cinq manières dont le contexte supplémentaire peut dégrader la qualité des réponses\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-11\" class=\"editorjs-toc__link\">1. Dilution du signal : les preuves pertinentes entrent en compétition avec tout le reste\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-15\" class=\"editorjs-toc__link\">2. Conflit de preuves : plus de sources peuvent signifier plus de versions de la réalité\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-19\" class=\"editorjs-toc__link\">3. Sensibilité à la position : l&#39;emplacement des preuves peut modifier le résultat\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-22\" class=\"editorjs-toc__link\">4. Persistance d&#39;un contexte obsolète : le modèle voit la vérité et l&#39;historique ensemble\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-25\" class=\"editorjs-toc__link\">5. Perte à la compression : un contexte plus réduit peut aussi devenir un contexte dégradé\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-28\" class=\"editorjs-toc__link\">Le modèle de qualité du contexte\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-32\" class=\"editorjs-toc__link\">Le test de pression du contexte\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-35\" class=\"editorjs-toc__link\">Ce qu&#39;il faut mesurer au lieu du nombre de tokens\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-37\" class=\"editorjs-toc__link\">RAG : pourquoi augmenter le top-k peut nuire\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-41\" class=\"editorjs-toc__link\">Agents à longue durée d&#39;exécution : la continuité n&#39;est pas l&#39;accumulation\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-45\" class=\"editorjs-toc__link\">L&#39;ordre du contexte doit être intentionnel\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-48\" class=\"editorjs-toc__link\">Préserver les limites de décision lors du compactage\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-52\" class=\"editorjs-toc__link\">Une politique pratique de construction du contexte\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-54\" class=\"editorjs-toc__link\">Qu&#39;est-ce qui changerait cette réponse ?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-58\" class=\"editorjs-toc__link\">Limites\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-61\" class=\"editorjs-toc__link\">Conclusion\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-64\" class=\"editorjs-toc__link\">FAQ\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-66\" class=\"editorjs-toc__link\">Glossaire\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-68\" class=\"editorjs-toc__link\">Sources principales et lectures complémentaires\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>Une fenêtre de contexte plus large offre plus de capacité à un système d'IA. Elle ne garantit pas pour autant que le modèle utilisera bien cette capacité. Dans les longues conversations, les pipelines RAG, les agents de recherche et les flux de travail utilisant de nombreux outils, ajouter plus d'historique, plus de documents, plus de sorties d'outils ou plus de mémoire peut rendre une réponse moins fiable plutôt que mieux informée.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Réponse directe\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">&lt;strong&gt;Un contexte plus large peut dégrader la réponse d&#39;une IA lorsque les informations supplémentaires réduisent le rapport signal\u002Fbruit, introduisent des conflits, dissimulent des preuves décisives, conservent un état obsolète ou éliminent par compression des conditions importantes.&lt;\u002Fstrong&gt; L&#39;objectif d&#39;ingénierie pertinent n&#39;est donc pas le contexte maximal. Il s&#39;agit du &lt;strong&gt;contexte suffisant minimal avec préservation des preuves et des frontières décisionnelles&lt;\u002Fstrong&gt;.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">À propos du modèle utilisé dans cet article\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Le modèle de qualité du contexte (Context Quality model) et le test de pression du contexte (Context Pressure Test) présentés ci-dessous sont des méthodes d&#39;architecture pratiques proposées dans cet article, et non des normes formelles de l&#39;industrie. Ils synthétisent des résultats établis sur les effets de position dans les contextes longs, la pollution de contexte, le compactage, la recherche documentaire et l&#39;ingénierie de contexte.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-5\">Capacité de contexte n'est pas exploitabilité de contexte\u003C\u002Fh2>\n\u003Cp>La fenêtre de contexte annoncée pour un modèle décrit la quantité de données en entrée qu'il peut accepter. Elle n'implique pas que chaque jeton au sein de cette fenêtre reçoive une attention égale ou contribue de manière égale à la réponse finale. La distinction est importante, car les systèmes en production remplissent de plus en plus le contexte avec l'historique de conversation, des documents récupérés, des résultats d'outils, de la mémoire, des états structurés, des instructions et des artefacts intermédiaires.\u003C\u002Fp>\n\u003Cp>L'étude classique « Lost in the Middle » a montré que les modèles à long contexte peuvent être moins performants lorsque les éléments de preuve pertinents apparaissent au milieu d'un long texte d'entrée plutôt qu'au début ou à la fin. La leçon d'ingénierie plus large n'est pas qu'un long contexte est néfaste. Elle est que la disponibilité au sein du contexte n'équivaut pas à une utilisation fiable.\u003C\u002Fp>\n\u003Cp>Les recommandations d'OpenAI en matière de gestion du contexte aboutissent à la même conclusion opérationnelle sous un autre angle : même de très grandes fenêtres de contexte peuvent être submergées par un historique non trié, des sorties d'outils redondantes et une recherche documentaire bruitée. Anthropic traite de même le contexte comme une ressource finie qui exige une ingénierie active plutôt qu'une accumulation passive.\u003C\u002Fp>\n\u003Ch2 id=\"section-9\">Cinq manières dont le contexte supplémentaire peut dégrader la qualité des réponses\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Mode de défaillance\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Ce qui change avec l'ajout de contexte\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Symptôme typique\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Dilution du signal\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Les preuves pertinentes représentent une fraction plus faible de l'entrée totale\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le modèle produit une réponse générique ou passe à côté du passage décisif\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Conflit de preuves\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Différents documents, versions ou mémoires sont en désaccord\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La réponse mélange des affirmations incompatibles ou choisit la mauvaise version\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sensibilité à la position\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'information décisive glisse dans une zone du contexte exploitée de manière moins fiable\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La même preuve fonctionne dans un certain ordre mais échoue dans un autre\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Persistance d'un contexte obsolète\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Un état ancien ou des conclusions antérieures persistent après un changement de situation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le modèle continue de répéter une réponse autrefois correcte\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Perte à la compression\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le compactage ou le résumé supprime les nuances, les exceptions, la provenance ou les incertitudes non résolues\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le résumé est cohérent mais la réponse qui en résulte devient trop péremptoire ou surgénéralisée\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch3 id=\"section-11\">1. Dilution du signal : les preuves pertinentes entrent en compétition avec tout le reste\u003C\u002Fh3>\n\u003Cp>Supposons qu'une question puisse être résolue à partir de deux courts passages. Un système RAG extrait ces passages ainsi que dix-huit autres de pertinence lointaine « par sécurité ». Le rappel de recherche documentaire peut s'améliorer, mais le générateur doit désormais distinguer les preuves décisives des informations d'arrière-plan. Si des formulations similaires apparaissent dans plusieurs documents, le contexte supplémentaire peut rendre la réponse moins précise.\u003C\u002Fp>\n\u003Cp>Cela crée une distinction essentielle entre le rappel de recherche documentaire et l'utilité du contexte. Un volume plus important de contenu extrait peut accroître la probabilité que la réponse se trouve quelque part dans le contexte, tout en réduisant simultanément la probabilité que le modèle accorde un poids suffisant aux bonnes preuves.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Règle d&#39;ingénierie\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">N&#39;optimisez pas le top-k de manière isolée. Mesurez si l&#39;ajout de documents améliore l&#39;affirmation finale, préserve l&#39;attribution des preuves et résiste à des essais répétés.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch3 id=\"section-15\">2. Conflit de preuves : plus de sources peuvent signifier plus de versions de la réalité\u003C\u002Fh3>\n\u003Cp>Les contextes longs contiennent souvent des informations mutuellement contradictoires : ancienne et nouvelle documentation d'API, deux versions d'une politique, préférences utilisateur antérieures et actuelles, sources web concurrentes, état en cache, ou résumé généré par un modèle qui ne correspond plus à la source.\u003C\u002Fp>\n\u003Cp>La défaillance ne relève pas nécessairement de l'hallucination. Le modèle peut combiner fidèlement des preuves contradictoires. L'architecture a donc besoin de règles de priorité : autorité de la source, version, horodatage, juridiction, locataire (tenant), révision du produit, état de l'utilisateur ou métadonnées explicites de remplacement.\u003C\u002Fp>\n\u003Cp>Sans ces règles, augmenter le contexte peut accroître les contradictions plus vite que cela n'accroît les connaissances.\u003C\u002Fp>\n\u003Ch3 id=\"section-19\">3. Sensibilité à la position : l'emplacement des preuves peut modifier le résultat\u003C\u002Fh3>\n\u003Cp>Les résultats de « Lost in the Middle » ont démontré que la simple modification de l'emplacement d'une information pertinente peut altérer sensiblement les performances du modèle. Ce constat est particulièrement important pour les systèmes qui concatènent de nombreux passages récupérés ou de longs historiques dans un ordre fixe.\u003C\u002Fp>\n\u003Cp>Un test en production devrait donc faire varier l'ordre des documents, et non se contenter de tester un unique prompt canonique. Si le système ne répond correctement que lorsque la preuve décisive se trouve au début ou à la fin, l'application est plus fragile que ce qu'indique un simple score de référence.\u003C\u002Fp>\n\u003Ch3 id=\"section-22\">4. Persistance d'un contexte obsolète : le modèle voit la vérité et l'historique ensemble\u003C\u002Fh3>\n\u003Cp>Les agents à longue durée d'exécution reconduisent fréquemment leurs conclusions antérieures. Cette continuité est utile jusqu'à ce qu'un fait change. Si le résultat d'un outil d'hier indique qu'un déploiement est sain et qu'un résultat actuel indique qu'il est dégradé, les deux peuvent coexister dans le contexte, à moins que le système ne remplace ou ne délimite explicitement l'état ancien.\u003C\u002Fp>\n\u003Cp>C'est pourquoi l'état opérationnel actuel devrait normalement provenir d'une source faisant autorité, tandis que la mémoire conserve le contexte durable tel que les décisions, les préférences ou les procédures. Un historique de conversation plus fourni ne remplace pas une relecture du présent.\u003C\u002Fp>\n\u003Ch3 id=\"section-25\">5. Perte à la compression : un contexte plus réduit peut aussi devenir un contexte dégradé\u003C\u002Fh3>\n\u003Cp>L'intervention inverse — compresser le contexte — comporte également ses modes de défaillance. Les résumés peuvent omettre des exceptions, des questions non résolues, la provenance, des identifiants précis, des preuves négatives ou les conditions dans lesquelles une conclusion était valide.\u003C\u002Fp>\n\u003Cp>Les travaux de Microsoft Research sur l'Agentic Context Engineering décrivent un problème similaire sous les termes de biais de brièveté et d'effondrement de contexte : les réécritures itératives peuvent éliminer des détails métier pourtant utiles. L'objectif n'est donc pas de « compresser autant que possible ». Il consiste à réduire le contexte tout en préservant les informations qui influent sur les décisions.\u003C\u002Fp>\n\u003Ch2 id=\"section-28\">Le modèle de qualité du contexte\u003C\u002Fh2>\n\u003Cp>Un contexte utile peut être évalué selon six dimensions. Aucune d'entre elles ne se résume au simple nombre de tokens.\u003C\u002Fp>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Six dimensions de la qualité du contexte\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Dimension\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Question\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Si faible\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Pertinence\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Autorité\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Fraîcheur\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Cohérence\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Exhaustivité décisionnelle\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Traçabilité\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Caside class=\"editorjs-callout editorjs-callout--success my-6 rounded-xl border p-5 border-emerald-300 bg-emerald-50 dark:border-emerald-900 dark:bg-emerald-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">État cible\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Le meilleur contexte n&#39;est pas le plus vaste. C&#39;est le &lt;strong&gt;plus petit contexte qui conserve encore les preuves, contraintes, états, exceptions et la provenance nécessaires à une réponse ou à une action fiable&lt;\u002Fstrong&gt;.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-32\">Le test de pression du contexte\u003C\u002Fh2>\n\u003Cp>Pour déterminer si une application tire profit d'un contexte plus étendu, testez la taille du contexte comme une variable expérimentale au lieu de présumer que plus grand équivaut à meilleur.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Test de pression du contexte\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Définir un cas de référence\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Choisissez une tâche dont la réponse est connue, accompagnée d'un ensemble minimal de preuves bien identifié.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Exécuter avec le contexte minimal suffisant\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Fournissez uniquement les instructions, l'état actuel et les preuves nécessaires à la réponse.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Ajouter du contexte pertinent\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Ajoutez un contexte utile mais non décisif et mesurez si la qualité s'améliore, reste stable ou diminue.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Ajouter du bruit réaliste\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Intégrez un historique vaguement connexe, des sorties d'outils ou des passages récupérés qu'un système en production pourrait inclure.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Ajouter des conflits contrôlés\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Introduisez des preuves obsolètes ou contradictoires dotées de métadonnées de version claires et vérifiez que la source correcte l'emporte toujours.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Réorganiser les preuves décisives\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Placez les informations clés vers le début, le milieu et la fin pour évaluer la sensibilité à la position.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Tester le compactage\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Remplacez le contexte plus ancien par un résumé et vérifiez que les nuances, la provenance, les problèmes non résolus et les limites décisionnelles sont préservés.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Comparer la courbe de qualité\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Mesurez l'exactitude, l'exploitation des preuves, la cohérence, la latence, le coût et la variance à mesure que le contexte évolue.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-35\">Ce qu'il faut mesurer au lieu du nombre de tokens\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Métrique\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Ce qu'elle révèle\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Exactitude de la réponse\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Si le résultat final est correct\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Appui des affirmations sur les preuves\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Si les affirmations matérielles restent étayées lorsque le contexte change\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Utilisation des preuves\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Si la réponse s'appuie sur les preuves décisives plutôt que sur les connaissances préalables du modèle\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Précision de la résolution des conflits\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Si les preuves actuelles \u002F faisant autorité l'emportent sur les sources obsolètes ou plus faibles\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Robustesse à la position\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Si la réorganisation des preuves modifie l'exactitude\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Rétention après compactage\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Si les résumés conservent les contraintes, les exceptions, les identifiants, la provenance et l'état non résolu\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Variance des résultats entre les essais\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Si l'ajout de contexte rend le système moins stable\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Latence et coût en tokens\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Si les informations ajoutées apportent un gain de qualité suffisant pour justifier leur coût opérationnel\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-37\">RAG : pourquoi augmenter le top-k peut nuire\u003C\u002Fh2>\n\u003Cp>Un schéma d'ajustement courant du RAG consiste à augmenter le top-k lorsque le système manque une réponse. Cela peut améliorer le rappel des candidats, mais aussi augmenter le contexte non pertinent, les preuves en double, les passages obsolètes et les documents contradictoires.\u003C\u002Fp>\n\u003Cp>La vraie question est de savoir si la preuve décisive manque à la récupération ou si elle perd simplement de son influence après l'assemblage du contexte. Si le bon passage figure déjà dans l'ensemble des candidats, augmenter le top-k revient peut-être à résoudre le mauvais problème.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Échec du RAG — Mais quelle couche a réellement échoué ? Une méthode de diagnostic\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Une méthode couche par couche pour isoler les défaillances de couverture des sources, de récupération, de classement, d'assemblage du contexte, de génération, d'attribution des preuves et de fraîcheur.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Lire la méthode de diagnostic du RAG →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-41\">Agents à longue durée d'exécution : la continuité n'est pas l'accumulation\u003C\u002Fh2>\n\u003Cp>Un agent a besoin de continuité entre les étapes, mais la continuité n'exige pas de rejouer chaque token antérieur. OpenAI démontre l'élagage et la compression pour le contexte de sessions à longue durée d'exécution. Anthropic recommande le compactage, la prise de notes structurée et d'autres techniques pour préserver les informations utiles tout en limitant la pollution du contexte.\u003C\u002Fp>\n\u003Cp>Une architecture robuste pour les agents à longue durée d'exécution sépare généralement la mémoire durable, l'état actuel, les artefacts externes, la récupération et le contexte présenté au modèle. Cela permet au système de préserver l'essentiel sans injecter de force chaque détail historique dans chaque inférence.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">La mémoire des agents IA n'est pas du RAG : comment séparer mémoire, récupération, état et contexte\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Une architecture pratique en quatre couches pour distinguer ce qui persiste, ce qui fait autorité actuellement, ce qui est récupéré et ce que le modèle reçoit réellement.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Lire l'article sur l'architecture de la mémoire →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-45\">L'ordre du contexte doit être intentionnel\u003C\u002Fh2>\n\u003Cp>La construction du contexte relève de l'architecture de l'information. Les instructions critiques, l'état actuel, les preuves décisives et les contraintes spécifiques à la tâche ne doivent pas être placés arbitrairement. Lorsque les systèmes concatènent mécaniquement les sources, ils délèguent implicitement la priorisation aux effets de position et à l'attention du modèle.\u003C\u002Fp>\n\u003Cp>Il n'existe pas d'ordre universel optimal pour tous les modèles et toutes les tâches ; l'ordonnancement doit donc être évalué empiriquement. Une suite de tests pertinente randomise ou fait varier systématiquement la position des documents et mesure si la même affirmation reste stable.\u003C\u002Fp>\n\u003Ch2 id=\"section-48\">Préserver les limites de décision lors du compactage\u003C\u002Fh2>\n\u003Cp>Un résumé qui indique « utiliser l'approche X » est plus faible qu'un résumé qui conserve la raison pour laquelle X a été choisi et ce qui invaliderait cette décision. Le compactage de contexte doit conserver les variables susceptibles de modifier la réponse : version, date, hypothèses, état, autorité, désaccord non résolu et provenance des preuves.\u003C\u002Fp>\n\u003Cp>Cela relie directement l'ingénierie de contexte à la validité des réponses. Si le compactage préserve une conclusion mais supprime ses limites de validité, les réponses futures peuvent demeurer cohérentes en interne tout en devenant factuellement erronées.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">La limite de validité des réponses : la couche manquante entre pertinence et réponses fiables de l'IA\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Un cadre pour expliciter les conditions dans lesquelles une affirmation de l'IA s'applique et quels changements nécessitent une restriction, un recalcul ou un abandon.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Lire l'article sur la limite de validité des réponses →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-52\">Une politique pratique de construction du contexte\u003C\u002Fh2>\n\u003Cul>\u003Cli>Partir de la tâche en cours, et non de tout ce que le système sait.\u003C\u002Fli>\u003Cli>Relire l'état volatile auprès des systèmes de référence avant de prendre des décisions conséquentes.\u003C\u002Fli>\u003Cli>Récupérer des preuves pour la question en cours plutôt que de véhiculer de volumineux corpus statiques.\u003C\u002Fli>\u003Cli>Supprimer les sorties d'outils redondantes ou à faible valeur ajoutée.\u003C\u002Fli>\u003Cli>Conserver la version source, l'horodatage, l'autorité et la provenance avec les preuves importantes.\u003C\u002Fli>\u003Cli>Rendre la priorité explicite en cas de conflit entre informations actuelles et historiques.\u003C\u002Fli>\u003Cli>Préserver les règles avec leurs exceptions et leurs prérequis.\u003C\u002Fli>\u003Cli>Stocker les décisions pérennes et les procédures réutilisables en dehors du contexte immédiat lorsqu'elles ne nécessitent pas de reproduction intégrale.\u003C\u002Fli>\u003Cli>Ne compacter l'historique qu'avec des tests de rétention des contraintes, identifiants, exceptions et provenances.\u003C\u002Fli>\u003Cli>Évaluer la taille, l'ordre et le bruit du contexte par des essais répétés plutôt qu'avec un prompt unique.\u003C\u002Fli>\u003C\u002Ful>\n\u003Ch2 id=\"section-54\">Qu'est-ce qui changerait cette réponse ?\u003C\u002Fh2>\n\u003Cp>Le compromis évolue en fonction de l'architecture du modèle, de son entraînement, du type de tâche et de la longueur du contexte. Les futurs modèles pourraient devenir nettement plus robustes face à la position, au bruit et aux informations contradictoires. Une tâche s'appuyant sur un corpus restreint et propre peut également tirer profit de la simple fourniture de la source complète plutôt que de l'élaboration d'un pipeline de récupération complexe.\u003C\u002Fp>\n\u003Cp>La recommandation change également lorsque l'omission est plus préjudiciable que le bruit. Dans les tâches de recherche ou d'exploration à haut rappel, un contexte de candidats plus étendu peut être justifié avant une étape ultérieure de filtrage ou de synthèse. Dans les systèmes de production sensibles à la latence, une sélection de contexte plus stricte est souvent préférable.\u003C\u002Fp>\n\u003Cp>Le principe fondamental ne changerait que si les modèles devenaient systématiquement insensibles aux informations non pertinentes, à la position, aux contradictions et aux données obsolètes. D'ici là, le contexte doit être traité comme une ressource d'exécution minutieusement organisée plutôt que comme un stockage passif.\u003C\u002Fp>\n\u003Ch2 id=\"section-58\">Limites\u003C\u002Fh2>\n\u003Cp>Le comportement en contexte long varie considérablement selon les modèles et les charges de travail. Les expériences initiales de « Lost in the Middle » ont utilisé des générations antérieures de modèles ; l'ampleur exacte de leurs effets ne doit donc pas être présumée représentative des systèmes actuels. Cette observation demeure utile en tant que schéma de défaillance à tester, et non comme une courbe de performance fixe et universelle.\u003C\u002Fp>\n\u003Cp>De même, réduire le contexte peut éliminer des éléments de preuve essentiels. Le compactage introduit un risque lié au résumé, et un filtrage agressif lors de la récupération peut faire baisser le rappel. L'objectif n'est pas d'atteindre un nombre minimal de jetons à tout prix, mais de fournir un contexte suffisant, à jour et traçable pour éclairer la décision à prendre.\u003C\u002Fp>\n\u003Ch2 id=\"section-61\">Conclusion\u003C\u002Fh2>\n\u003Cp>La question « Quelle quantité de contexte le modèle peut-il accepter ? » est moins pertinente que « Dans quelle mesure ce contexte améliore-t-il la décision ? ». Davantage de jetons peuvent apporter des preuves supplémentaires, mais ils peuvent aussi introduire de la distraction, des contradictions, des états obsolètes, une fragilité positionnelle et une dette de compression.\u003C\u002Fp>\n\u003Cp>Envisagez le contexte comme un ensemble de travail soigneusement conçu. Commencez avec le minimum de preuves suffisantes. N'ajoutez des informations que lorsqu'elles améliorent les performances mesurées. Évaluez explicitement le bruit, les conflits, l'agencement et le compactage. Une grande fenêtre de contexte relève de la capacité ; la qualité du contexte relève de l'architecture.\u003C\u002Fp>\n\u003Ch2 id=\"section-64\">FAQ\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Contexte long et qualité des réponses de l&#39;IA\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Fournir davantage de contexte à un modèle d&#39;IA peut-il dégrader sa réponse ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Oui. Un contexte supplémentaire peut diluer les preuves pertinentes, introduire des informations contradictoires ou obsolètes, reléguer des éléments décisifs à des positions moins robustes et accroître le risque que le modèle s&#39;appuie sur des signaux faibles plutôt que déterminants.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Une fenêtre de contexte plus large élimine-t-elle le besoin de RAG ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Pas de manière générale. Une fenêtre de contexte plus large augmente la capacité, mais la récupération reste utile pour sélectionner des informations actuelles et pertinentes, maîtriser les coûts, préserver les délimitations des sources et éviter d&#39;inclure de grandes quantités de données superflues dans chaque requête.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Qu&#39;est-ce que le problème du « Lost in the Middle » ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Il désigne les situations observées où les modèles de langage exploitent de manière moins fiable une information pertinente lorsque celle-ci se trouve au milieu d&#39;un contexte long que lorsqu&#39;elle figure au début ou à la fin. L&#39;effet exact varie selon le modèle et la tâche, et doit être testé sur les systèmes actuels.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Dois-je toujours réduire le top-k du RAG ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Non. Si des preuves pertinentes sont absentes de l&#39;ensemble de candidats, un top-k plus élevé peut améliorer le rappel. Si les preuves sont déjà présentes mais se trouvent diluées par du contenu superflu, augmenter le top-k peut dégrader le contexte. Diagnostiquez la récupération et l&#39;assemblage du contexte de manière distincte.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Que doit préserver le résumé d&#39;un contexte ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Il doit préserver les décisions pérennes, les objectifs actuels, les questions en suspens, les identifiants, les contraintes, les exceptions, la provenance des preuves ainsi que les conditions susceptibles de modifier une conclusion préalable.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-66\">Glossaire\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Termes clés de l'ingénierie de contexte\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"context-window\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Fenêtre de contexte\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">La quantité d'informations en jetons d'entrée et de sortie qu'un modèle peut prendre en compte au cours d'une même séquence d'inférence.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"context-pollution\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Pollution de contexte\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Dégradation causée par des informations non pertinentes, obsolètes, redondantes, contradictoires ou de faible valeur qui encombrent le contexte du modèle.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"signal-dilution\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Dilution du signal\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Diminution de l'importance relative d'une preuve déterminante suite à l'ajout d'informations secondaires ou concurrentes.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"context-compaction\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Compactage de contexte\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Réduction d'un contexte accumulé par le résumé, la restructuration, l'externalisation ou la préservation des informations essentielles sous une forme de travail plus restreinte.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"position-robustness\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Robustesse positionnelle\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Le degré de stabilité des performances du modèle lorsque les informations pertinentes figurent à différents emplacements au sein du contexte.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"minimum-sufficient-context\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Contexte minimal suffisant\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Le plus petit contexte de travail opérationnel préservant les preuves, l'état, les contraintes, les exceptions et la provenance indispensables à une exécution fiable.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-68\">Sources principales et lectures complémentaires\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fcookbook\u002Fexamples\u002Fagents_sdk\u002Fsession_memory\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Context Engineering: Short-Term Memory Management with Sessions\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Recommandations sur l&#39;élagage et la compression, abordant la distraction, l&#39;inefficacité, le contexte obsolète, la récupération bruitée et les sessions de longue durée.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Anthropic — Effective Context Engineering for AI Agents\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Conseils d&#39;ingénierie portant sur la pollution de contexte, le compactage, la prise de notes structurée et la gestion du contexte pour agents sur des horizons longs.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Faclanthology.org\u002F2024.tacl-1.9\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Liu et al. — Lost in the Middle: How Language Models Use Long Contexts\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Article du TACL mettant en évidence la sensibilité à la position des informations pertinentes dans les contextes longs et incitant à tester explicitement la robustesse des contextes étendus.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fagentic-context-engineering-evolving-contexts-for-self-improving-language-models\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — Agentic Context Engineering (ACE)\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Recherche sur l&#39;évolution des contextes structurés face au biais de concision et à l&#39;effondrement du contexte.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Bonnes pratiques d&#39;évaluation\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Conseils sur le test des cas limites, y compris les contextes longs et les conversations de longue durée, à l&#39;aide d&#39;évaluations explicites et reproductibles.\u003C\u002Fp>\u003C\u002Fa>",{"time":212,"blocks":213,"version":797},1790366818631,[214,222,228,236,243,248,253,258,263,268,298,303,308,313,320,325,330,335,340,345,350,355,360,365,370,375,380,385,390,395,437,444,449,454,486,491,523,528,533,538,547,552,557,562,570,575,580,585,590,595,600,608,613,631,636,641,646,651,656,661,666,671,676,681,686,712,717,746,751,761,770,779,788],{"id":215,"data":216,"type":220,"tunes":221},"Qfxj3iD3g1",{"title":217,"maxLevel":218,"minLevel":219},"Sommaire",3,2,"tableOfContents",{},{"id":223,"data":224,"type":226,"tunes":227},"intro",{"text":225},"Une fenêtre de contexte plus large offre plus de capacité à un système d'IA. Elle ne garantit pas pour autant que le modèle utilisera bien cette capacité. Dans les longues conversations, les pipelines RAG, les agents de recherche et les flux de travail utilisant de nombreux outils, ajouter plus d'historique, plus de documents, plus de sorties d'outils ou plus de mémoire peut rendre une réponse moins fiable plutôt que mieux informée.","paragraph",{},{"id":229,"data":230,"type":234,"tunes":235},"direct",{"body":231,"title":232,"variant":233},"\u003Cstrong>Un contexte plus large peut dégrader la réponse d'une IA lorsque les informations supplémentaires réduisent le rapport signal\u002Fbruit, introduisent des conflits, dissimulent des preuves décisives, conservent un état obsolète ou éliminent par compression des conditions importantes.\u003C\u002Fstrong> L'objectif d'ingénierie pertinent n'est donc pas le contexte maximal. Il s'agit du \u003Cstrong>contexte suffisant minimal avec préservation des preuves et des frontières décisionnelles\u003C\u002Fstrong>.","Réponse directe","info","callout",{},{"id":237,"data":238,"type":234,"tunes":242},"model-note",{"body":239,"title":240,"variant":241},"Le modèle de qualité du contexte (Context Quality model) et le test de pression du contexte (Context Pressure Test) présentés ci-dessous sont des méthodes d'architecture pratiques proposées dans cet article, et non des normes formelles de l'industrie. Ils synthétisent des résultats établis sur les effets de position dans les contextes longs, la pollution de contexte, le compactage, la recherche documentaire et l'ingénierie de contexte.","À propos du modèle utilisé dans cet article","note",{},{"id":244,"data":245,"type":42,"tunes":247},"h-capacity",{"text":246,"level":219},"Capacité de contexte n'est pas exploitabilité de contexte",{},{"id":249,"data":250,"type":226,"tunes":252},"p-capacity-1",{"text":251},"La fenêtre de contexte annoncée pour un modèle décrit la quantité de données en entrée qu'il peut accepter. Elle n'implique pas que chaque jeton au sein de cette fenêtre reçoive une attention égale ou contribue de manière égale à la réponse finale. La distinction est importante, car les systèmes en production remplissent de plus en plus le contexte avec l'historique de conversation, des documents récupérés, des résultats d'outils, de la mémoire, des états structurés, des instructions et des artefacts intermédiaires.",{},{"id":254,"data":255,"type":226,"tunes":257},"p-capacity-2",{"text":256},"L'étude classique « Lost in the Middle » a montré que les modèles à long contexte peuvent être moins performants lorsque les éléments de preuve pertinents apparaissent au milieu d'un long texte d'entrée plutôt qu'au début ou à la fin. La leçon d'ingénierie plus large n'est pas qu'un long contexte est néfaste. Elle est que la disponibilité au sein du contexte n'équivaut pas à une utilisation fiable.",{},{"id":259,"data":260,"type":226,"tunes":262},"p-capacity-3",{"text":261},"Les recommandations d'OpenAI en matière de gestion du contexte aboutissent à la même conclusion opérationnelle sous un autre angle : même de très grandes fenêtres de contexte peuvent être submergées par un historique non trié, des sorties d'outils redondantes et une recherche documentaire bruitée. Anthropic traite de même le contexte comme une ressource finie qui exige une ingénierie active plutôt qu'une accumulation passive.",{},{"id":264,"data":265,"type":42,"tunes":267},"h-five",{"text":266,"level":219},"Cinq manières dont le contexte supplémentaire peut dégrader la qualité des réponses",{},{"id":269,"data":270,"type":296,"tunes":297},"five-table",{"content":271,"stretched":43,"withHeadings":14},[272,276,280,284,288,292],[273,274,275],"Mode de défaillance","Ce qui change avec l'ajout de contexte","Symptôme typique",[277,278,279],"Dilution du signal","Les preuves pertinentes représentent une fraction plus faible de l'entrée totale","Le modèle produit une réponse générique ou passe à côté du passage décisif",[281,282,283],"Conflit de preuves","Différents documents, versions ou mémoires sont en désaccord","La réponse mélange des affirmations incompatibles ou choisit la mauvaise version",[285,286,287],"Sensibilité à la position","L'information décisive glisse dans une zone du contexte exploitée de manière moins fiable","La même preuve fonctionne dans un certain ordre mais échoue dans un autre",[289,290,291],"Persistance d'un contexte obsolète","Un état ancien ou des conclusions antérieures persistent après un changement de situation","Le modèle continue de répéter une réponse autrefois correcte",[293,294,295],"Perte à la compression","Le compactage ou le résumé supprime les nuances, les exceptions, la provenance ou les incertitudes non résolues","Le résumé est cohérent mais la réponse qui en résulte devient trop péremptoire ou surgénéralisée","table",{},{"id":299,"data":300,"type":42,"tunes":302},"h-dilution",{"text":301,"level":218},"1. Dilution du signal : les preuves pertinentes entrent en compétition avec tout le reste",{},{"id":304,"data":305,"type":226,"tunes":307},"p-dilution-1",{"text":306},"Supposons qu'une question puisse être résolue à partir de deux courts passages. Un système RAG extrait ces passages ainsi que dix-huit autres de pertinence lointaine « par sécurité ». Le rappel de recherche documentaire peut s'améliorer, mais le générateur doit désormais distinguer les preuves décisives des informations d'arrière-plan. Si des formulations similaires apparaissent dans plusieurs documents, le contexte supplémentaire peut rendre la réponse moins précise.",{},{"id":309,"data":310,"type":226,"tunes":312},"p-dilution-2",{"text":311},"Cela crée une distinction essentielle entre le rappel de recherche documentaire et l'utilité du contexte. Un volume plus important de contenu extrait peut accroître la probabilité que la réponse se trouve quelque part dans le contexte, tout en réduisant simultanément la probabilité que le modèle accorde un poids suffisant aux bonnes preuves.",{},{"id":314,"data":315,"type":234,"tunes":319},"dilution-tip",{"body":316,"title":317,"variant":318},"N'optimisez pas le top-k de manière isolée. Mesurez si l'ajout de documents améliore l'affirmation finale, préserve l'attribution des preuves et résiste à des essais répétés.","Règle d'ingénierie","tip",{},{"id":321,"data":322,"type":42,"tunes":324},"h-conflict",{"text":323,"level":218},"2. Conflit de preuves : plus de sources peuvent signifier plus de versions de la réalité",{},{"id":326,"data":327,"type":226,"tunes":329},"p-conflict-1",{"text":328},"Les contextes longs contiennent souvent des informations mutuellement contradictoires : ancienne et nouvelle documentation d'API, deux versions d'une politique, préférences utilisateur antérieures et actuelles, sources web concurrentes, état en cache, ou résumé généré par un modèle qui ne correspond plus à la source.",{},{"id":331,"data":332,"type":226,"tunes":334},"p-conflict-2",{"text":333},"La défaillance ne relève pas nécessairement de l'hallucination. Le modèle peut combiner fidèlement des preuves contradictoires. L'architecture a donc besoin de règles de priorité : autorité de la source, version, horodatage, juridiction, locataire (tenant), révision du produit, état de l'utilisateur ou métadonnées explicites de remplacement.",{},{"id":336,"data":337,"type":226,"tunes":339},"p-conflict-3",{"text":338},"Sans ces règles, augmenter le contexte peut accroître les contradictions plus vite que cela n'accroît les connaissances.",{},{"id":341,"data":342,"type":42,"tunes":344},"h-position",{"text":343,"level":218},"3. Sensibilité à la position : l'emplacement des preuves peut modifier le résultat",{},{"id":346,"data":347,"type":226,"tunes":349},"p-position-1",{"text":348},"Les résultats de « Lost in the Middle » ont démontré que la simple modification de l'emplacement d'une information pertinente peut altérer sensiblement les performances du modèle. Ce constat est particulièrement important pour les systèmes qui concatènent de nombreux passages récupérés ou de longs historiques dans un ordre fixe.",{},{"id":351,"data":352,"type":226,"tunes":354},"p-position-2",{"text":353},"Un test en production devrait donc faire varier l'ordre des documents, et non se contenter de tester un unique prompt canonique. Si le système ne répond correctement que lorsque la preuve décisive se trouve au début ou à la fin, l'application est plus fragile que ce qu'indique un simple score de référence.",{},{"id":356,"data":357,"type":42,"tunes":359},"h-stale",{"text":358,"level":218},"4. Persistance d'un contexte obsolète : le modèle voit la vérité et l'historique ensemble",{},{"id":361,"data":362,"type":226,"tunes":364},"p-stale-1",{"text":363},"Les agents à longue durée d'exécution reconduisent fréquemment leurs conclusions antérieures. Cette continuité est utile jusqu'à ce qu'un fait change. Si le résultat d'un outil d'hier indique qu'un déploiement est sain et qu'un résultat actuel indique qu'il est dégradé, les deux peuvent coexister dans le contexte, à moins que le système ne remplace ou ne délimite explicitement l'état ancien.",{},{"id":366,"data":367,"type":226,"tunes":369},"p-stale-2",{"text":368},"C'est pourquoi l'état opérationnel actuel devrait normalement provenir d'une source faisant autorité, tandis que la mémoire conserve le contexte durable tel que les décisions, les préférences ou les procédures. Un historique de conversation plus fourni ne remplace pas une relecture du présent.",{},{"id":371,"data":372,"type":42,"tunes":374},"h-compression",{"text":373,"level":218},"5. Perte à la compression : un contexte plus réduit peut aussi devenir un contexte dégradé",{},{"id":376,"data":377,"type":226,"tunes":379},"p-compression-1",{"text":378},"L'intervention inverse — compresser le contexte — comporte également ses modes de défaillance. Les résumés peuvent omettre des exceptions, des questions non résolues, la provenance, des identifiants précis, des preuves négatives ou les conditions dans lesquelles une conclusion était valide.",{},{"id":381,"data":382,"type":226,"tunes":384},"p-compression-2",{"text":383},"Les travaux de Microsoft Research sur l'Agentic Context Engineering décrivent un problème similaire sous les termes de biais de brièveté et d'effondrement de contexte : les réécritures itératives peuvent éliminer des détails métier pourtant utiles. L'objectif n'est donc pas de « compresser autant que possible ». Il consiste à réduire le contexte tout en préservant les informations qui influent sur les décisions.",{},{"id":386,"data":387,"type":42,"tunes":389},"h-quality",{"text":388,"level":219},"Le modèle de qualité du contexte",{},{"id":391,"data":392,"type":226,"tunes":394},"p-quality-intro",{"text":393},"Un contexte utile peut être évalué selon six dimensions. Aucune d'entre elles ne se résume au simple nombre de tokens.",{},{"id":396,"data":397,"type":435,"tunes":436},"quality-comparison",{"rows":398,"title":424,"layout":296,"columns":425},[399,404,408,412,416,420],{"id":400,"label":401,"values":402},"relevance","Pertinence",[403,403,403],"",{"id":405,"label":406,"values":407},"authority","Autorité",[403,403,403],{"id":409,"label":410,"values":411},"freshness","Fraîcheur",[403,403,403],{"id":413,"label":414,"values":415},"consistency","Cohérence",[403,403,403],{"id":417,"label":418,"values":419},"completeness","Exhaustivité décisionnelle",[403,403,403],{"id":421,"label":422,"values":423},"traceability","Traçabilité",[403,403,403],"Six dimensions de la qualité du contexte",[426,429,432],{"id":427,"label":428},"dimension","Dimension",{"id":430,"label":431},"question","Question",{"id":433,"label":434},"failure","Si faible","comparison",{},{"id":438,"data":439,"type":234,"tunes":443},"target-state",{"body":440,"title":441,"variant":442},"Le meilleur contexte n'est pas le plus vaste. C'est le \u003Cstrong>plus petit contexte qui conserve encore les preuves, contraintes, états, exceptions et la provenance nécessaires à une réponse ou à une action fiable\u003C\u002Fstrong>.","État cible","success",{},{"id":445,"data":446,"type":42,"tunes":448},"h-pressure",{"text":447,"level":219},"Le test de pression du contexte",{},{"id":450,"data":451,"type":226,"tunes":453},"p-pressure-intro",{"text":452},"Pour déterminer si une application tire profit d'un contexte plus étendu, testez la taille du contexte comme une variable expérimentale au lieu de présumer que plus grand équivaut à meilleur.",{},{"id":455,"data":456,"type":484,"tunes":485},"pressure-flow",{"steps":457,"title":482,"orientation":483},[458,461,464,467,470,473,476,479],{"label":459,"description":460},"1. Définir un cas de référence","Choisissez une tâche dont la réponse est connue, accompagnée d'un ensemble minimal de preuves bien identifié.",{"label":462,"description":463},"2. Exécuter avec le contexte minimal suffisant","Fournissez uniquement les instructions, l'état actuel et les preuves nécessaires à la réponse.",{"label":465,"description":466},"3. Ajouter du contexte pertinent","Ajoutez un contexte utile mais non décisif et mesurez si la qualité s'améliore, reste stable ou diminue.",{"label":468,"description":469},"4. Ajouter du bruit réaliste","Intégrez un historique vaguement connexe, des sorties d'outils ou des passages récupérés qu'un système en production pourrait inclure.",{"label":471,"description":472},"5. Ajouter des conflits contrôlés","Introduisez des preuves obsolètes ou contradictoires dotées de métadonnées de version claires et vérifiez que la source correcte l'emporte toujours.",{"label":474,"description":475},"6. Réorganiser les preuves décisives","Placez les informations clés vers le début, le milieu et la fin pour évaluer la sensibilité à la position.",{"label":477,"description":478},"7. Tester le compactage","Remplacez le contexte plus ancien par un résumé et vérifiez que les nuances, la provenance, les problèmes non résolus et les limites décisionnelles sont préservés.",{"label":480,"description":481},"8. Comparer la courbe de qualité","Mesurez l'exactitude, l'exploitation des preuves, la cohérence, la latence, le coût et la variance à mesure que le contexte évolue.","Test de pression du contexte","auto","processFlow",{},{"id":487,"data":488,"type":42,"tunes":490},"h-measure",{"text":489,"level":219},"Ce qu'il faut mesurer au lieu du nombre de tokens",{},{"id":492,"data":493,"type":296,"tunes":522},"measure-table",{"content":494,"stretched":43,"withHeadings":14},[495,498,501,504,507,510,513,516,519],[496,497],"Métrique","Ce qu'elle révèle",[499,500],"Exactitude de la réponse","Si le résultat final est correct",[502,503],"Appui des affirmations sur les preuves","Si les affirmations matérielles restent étayées lorsque le contexte change",[505,506],"Utilisation des preuves","Si la réponse s'appuie sur les preuves décisives plutôt que sur les connaissances préalables du modèle",[508,509],"Précision de la résolution des conflits","Si les preuves actuelles \u002F faisant autorité l'emportent sur les sources obsolètes ou plus faibles",[511,512],"Robustesse à la position","Si la réorganisation des preuves modifie l'exactitude",[514,515],"Rétention après compactage","Si les résumés conservent les contraintes, les exceptions, les identifiants, la provenance et l'état non résolu",[517,518],"Variance des résultats entre les essais","Si l'ajout de contexte rend le système moins stable",[520,521],"Latence et coût en tokens","Si les informations ajoutées apportent un gain de qualité suffisant pour justifier leur coût opérationnel",{},{"id":524,"data":525,"type":42,"tunes":527},"h-topk",{"text":526,"level":219},"RAG : pourquoi augmenter le top-k peut nuire",{},{"id":529,"data":530,"type":226,"tunes":532},"p-topk-1",{"text":531},"Un schéma d'ajustement courant du RAG consiste à augmenter le top-k lorsque le système manque une réponse. Cela peut améliorer le rappel des candidats, mais aussi augmenter le contexte non pertinent, les preuves en double, les passages obsolètes et les documents contradictoires.",{},{"id":534,"data":535,"type":226,"tunes":537},"p-topk-2",{"text":536},"La vraie question est de savoir si la preuve décisive manque à la récupération ou si elle perd simplement de son influence après l'assemblage du contexte. Si le bon passage figure déjà dans l'ensemble des candidats, augmenter le top-k revient peut-être à résoudre le mauvais problème.",{},{"id":539,"data":540,"type":545,"tunes":546},"internal-rag",{"url":541,"title":542,"excerpt":543,"ctaLabel":544},"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method","Échec du RAG — Mais quelle couche a réellement échoué ? Une méthode de diagnostic","Une méthode couche par couche pour isoler les défaillances de couverture des sources, de récupération, de classement, d'assemblage du contexte, de génération, d'attribution des preuves et de fraîcheur.","Lire la méthode de diagnostic du RAG","referralArticle",{},{"id":548,"data":549,"type":42,"tunes":551},"h-agents",{"text":550,"level":219},"Agents à longue durée d'exécution : la continuité n'est pas l'accumulation",{},{"id":553,"data":554,"type":226,"tunes":556},"p-agents-1",{"text":555},"Un agent a besoin de continuité entre les étapes, mais la continuité n'exige pas de rejouer chaque token antérieur. OpenAI démontre l'élagage et la compression pour le contexte de sessions à longue durée d'exécution. Anthropic recommande le compactage, la prise de notes structurée et d'autres techniques pour préserver les informations utiles tout en limitant la pollution du contexte.",{},{"id":558,"data":559,"type":226,"tunes":561},"p-agents-2",{"text":560},"Une architecture robuste pour les agents à longue durée d'exécution sépare généralement la mémoire durable, l'état actuel, les artefacts externes, la récupération et le contexte présenté au modèle. Cela permet au système de préserver l'essentiel sans injecter de force chaque détail historique dans chaque inférence.",{},{"id":563,"data":564,"type":545,"tunes":569},"internal-memory",{"url":565,"title":566,"excerpt":567,"ctaLabel":568},"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","La mémoire des agents IA n'est pas du RAG : comment séparer mémoire, récupération, état et contexte","Une architecture pratique en quatre couches pour distinguer ce qui persiste, ce qui fait autorité actuellement, ce qui est récupéré et ce que le modèle reçoit réellement.","Lire l'article sur l'architecture de la mémoire",{},{"id":571,"data":572,"type":42,"tunes":574},"h-order",{"text":573,"level":219},"L'ordre du contexte doit être intentionnel",{},{"id":576,"data":577,"type":226,"tunes":579},"p-order-1",{"text":578},"La construction du contexte relève de l'architecture de l'information. Les instructions critiques, l'état actuel, les preuves décisives et les contraintes spécifiques à la tâche ne doivent pas être placés arbitrairement. Lorsque les systèmes concatènent mécaniquement les sources, ils délèguent implicitement la priorisation aux effets de position et à l'attention du modèle.",{},{"id":581,"data":582,"type":226,"tunes":584},"p-order-2",{"text":583},"Il n'existe pas d'ordre universel optimal pour tous les modèles et toutes les tâches ; l'ordonnancement doit donc être évalué empiriquement. Une suite de tests pertinente randomise ou fait varier systématiquement la position des documents et mesure si la même affirmation reste stable.",{},{"id":586,"data":587,"type":42,"tunes":589},"h-boundaries",{"text":588,"level":219},"Préserver les limites de décision lors du compactage",{},{"id":591,"data":592,"type":226,"tunes":594},"p-bound-1",{"text":593},"Un résumé qui indique « utiliser l'approche X » est plus faible qu'un résumé qui conserve la raison pour laquelle X a été choisi et ce qui invaliderait cette décision. Le compactage de contexte doit conserver les variables susceptibles de modifier la réponse : version, date, hypothèses, état, autorité, désaccord non résolu et provenance des preuves.",{},{"id":596,"data":597,"type":226,"tunes":599},"p-bound-2",{"text":598},"Cela relie directement l'ingénierie de contexte à la validité des réponses. Si le compactage préserve une conclusion mais supprime ses limites de validité, les réponses futures peuvent demeurer cohérentes en interne tout en devenant factuellement erronées.",{},{"id":601,"data":602,"type":545,"tunes":607},"internal-avb",{"url":603,"title":604,"excerpt":605,"ctaLabel":606},"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","La limite de validité des réponses : la couche manquante entre pertinence et réponses fiables de l'IA","Un cadre pour expliciter les conditions dans lesquelles une affirmation de l'IA s'applique et quels changements nécessitent une restriction, un recalcul ou un abandon.","Lire l'article sur la limite de validité des réponses",{},{"id":609,"data":610,"type":42,"tunes":612},"h-policy",{"text":611,"level":219},"Une politique pratique de construction du contexte",{},{"id":614,"data":615,"type":629,"tunes":630},"policy-list",{"meta":616,"items":617,"style":628},{},[618,619,620,621,622,623,624,625,626,627],"Partir de la tâche en cours, et non de tout ce que le système sait.","Relire l'état volatile auprès des systèmes de référence avant de prendre des décisions conséquentes.","Récupérer des preuves pour la question en cours plutôt que de véhiculer de volumineux corpus statiques.","Supprimer les sorties d'outils redondantes ou à faible valeur ajoutée.","Conserver la version source, l'horodatage, l'autorité et la provenance avec les preuves importantes.","Rendre la priorité explicite en cas de conflit entre informations actuelles et historiques.","Préserver les règles avec leurs exceptions et leurs prérequis.","Stocker les décisions pérennes et les procédures réutilisables en dehors du contexte immédiat lorsqu'elles ne nécessitent pas de reproduction intégrale.","Ne compacter l'historique qu'avec des tests de rétention des contraintes, identifiants, exceptions et provenances.","Évaluer la taille, l'ordre et le bruit du contexte par des essais répétés plutôt qu'avec un prompt unique.","unordered","list",{},{"id":632,"data":633,"type":42,"tunes":635},"h-change",{"text":634,"level":219},"Qu'est-ce qui changerait cette réponse ?",{},{"id":637,"data":638,"type":226,"tunes":640},"p-change-1",{"text":639},"Le compromis évolue en fonction de l'architecture du modèle, de son entraînement, du type de tâche et de la longueur du contexte. Les futurs modèles pourraient devenir nettement plus robustes face à la position, au bruit et aux informations contradictoires. Une tâche s'appuyant sur un corpus restreint et propre peut également tirer profit de la simple fourniture de la source complète plutôt que de l'élaboration d'un pipeline de récupération complexe.",{},{"id":642,"data":643,"type":226,"tunes":645},"p-change-2",{"text":644},"La recommandation change également lorsque l'omission est plus préjudiciable que le bruit. Dans les tâches de recherche ou d'exploration à haut rappel, un contexte de candidats plus étendu peut être justifié avant une étape ultérieure de filtrage ou de synthèse. Dans les systèmes de production sensibles à la latence, une sélection de contexte plus stricte est souvent préférable.",{},{"id":647,"data":648,"type":226,"tunes":650},"p-change-3",{"text":649},"Le principe fondamental ne changerait que si les modèles devenaient systématiquement insensibles aux informations non pertinentes, à la position, aux contradictions et aux données obsolètes. D'ici là, le contexte doit être traité comme une ressource d'exécution minutieusement organisée plutôt que comme un stockage passif.",{},{"id":652,"data":653,"type":42,"tunes":655},"h-limitations",{"text":654,"level":219},"Limites",{},{"id":657,"data":658,"type":226,"tunes":660},"p-limit-1",{"text":659},"Le comportement en contexte long varie considérablement selon les modèles et les charges de travail. Les expériences initiales de « Lost in the Middle » ont utilisé des générations antérieures de modèles ; l'ampleur exacte de leurs effets ne doit donc pas être présumée représentative des systèmes actuels. Cette observation demeure utile en tant que schéma de défaillance à tester, et non comme une courbe de performance fixe et universelle.",{},{"id":662,"data":663,"type":226,"tunes":665},"p-limit-2",{"text":664},"De même, réduire le contexte peut éliminer des éléments de preuve essentiels. Le compactage introduit un risque lié au résumé, et un filtrage agressif lors de la récupération peut faire baisser le rappel. L'objectif n'est pas d'atteindre un nombre minimal de jetons à tout prix, mais de fournir un contexte suffisant, à jour et traçable pour éclairer la décision à prendre.",{},{"id":667,"data":668,"type":42,"tunes":670},"h-conclusion",{"text":669,"level":219},"Conclusion",{},{"id":672,"data":673,"type":226,"tunes":675},"p-conclusion-1",{"text":674},"La question « Quelle quantité de contexte le modèle peut-il accepter ? » est moins pertinente que « Dans quelle mesure ce contexte améliore-t-il la décision ? ». Davantage de jetons peuvent apporter des preuves supplémentaires, mais ils peuvent aussi introduire de la distraction, des contradictions, des états obsolètes, une fragilité positionnelle et une dette de compression.",{},{"id":677,"data":678,"type":226,"tunes":680},"p-conclusion-2",{"text":679},"Envisagez le contexte comme un ensemble de travail soigneusement conçu. Commencez avec le minimum de preuves suffisantes. N'ajoutez des informations que lorsqu'elles améliorent les performances mesurées. Évaluez explicitement le bruit, les conflits, l'agencement et le compactage. Une grande fenêtre de contexte relève de la capacité ; la qualité du contexte relève de l'architecture.",{},{"id":682,"data":683,"type":42,"tunes":685},"h-faq",{"text":684,"level":219},"FAQ",{},{"id":687,"data":688,"type":687,"tunes":711},"faq",{"items":689,"title":710},[690,694,698,702,706],{"id":691,"answer":692,"question":693},"faq1","Oui. Un contexte supplémentaire peut diluer les preuves pertinentes, introduire des informations contradictoires ou obsolètes, reléguer des éléments décisifs à des positions moins robustes et accroître le risque que le modèle s'appuie sur des signaux faibles plutôt que déterminants.","Fournir davantage de contexte à un modèle d'IA peut-il dégrader sa réponse ?",{"id":695,"answer":696,"question":697},"faq2","Pas de manière générale. Une fenêtre de contexte plus large augmente la capacité, mais la récupération reste utile pour sélectionner des informations actuelles et pertinentes, maîtriser les coûts, préserver les délimitations des sources et éviter d'inclure de grandes quantités de données superflues dans chaque requête.","Une fenêtre de contexte plus large élimine-t-elle le besoin de RAG ?",{"id":699,"answer":700,"question":701},"faq3","Il désigne les situations observées où les modèles de langage exploitent de manière moins fiable une information pertinente lorsque celle-ci se trouve au milieu d'un contexte long que lorsqu'elle figure au début ou à la fin. L'effet exact varie selon le modèle et la tâche, et doit être testé sur les systèmes actuels.","Qu'est-ce que le problème du « Lost in the Middle » ?",{"id":703,"answer":704,"question":705},"faq4","Non. Si des preuves pertinentes sont absentes de l'ensemble de candidats, un top-k plus élevé peut améliorer le rappel. Si les preuves sont déjà présentes mais se trouvent diluées par du contenu superflu, augmenter le top-k peut dégrader le contexte. Diagnostiquez la récupération et l'assemblage du contexte de manière distincte.","Dois-je toujours réduire le top-k du RAG ?",{"id":707,"answer":708,"question":709},"faq5","Il doit préserver les décisions pérennes, les objectifs actuels, les questions en suspens, les identifiants, les contraintes, les exceptions, la provenance des preuves ainsi que les conditions susceptibles de modifier une conclusion préalable.","Que doit préserver le résumé d'un contexte ?","Contexte long et qualité des réponses de l'IA",{},{"id":713,"data":714,"type":42,"tunes":716},"h-glossary",{"text":715,"level":219},"Glossaire",{},{"id":718,"data":719,"type":718,"tunes":745},"glossary",{"title":720,"entries":721},"Termes clés de l'ingénierie de contexte",[722,726,730,733,737,741],{"term":723,"anchor":724,"definition":725},"Fenêtre de contexte","context-window","La quantité d'informations en jetons d'entrée et de sortie qu'un modèle peut prendre en compte au cours d'une même séquence d'inférence.",{"term":727,"anchor":728,"definition":729},"Pollution de contexte","context-pollution","Dégradation causée par des informations non pertinentes, obsolètes, redondantes, contradictoires ou de faible valeur qui encombrent le contexte du modèle.",{"term":277,"anchor":731,"definition":732},"signal-dilution","Diminution de l'importance relative d'une preuve déterminante suite à l'ajout d'informations secondaires ou concurrentes.",{"term":734,"anchor":735,"definition":736},"Compactage de contexte","context-compaction","Réduction d'un contexte accumulé par le résumé, la restructuration, l'externalisation ou la préservation des informations essentielles sous une forme de travail plus restreinte.",{"term":738,"anchor":739,"definition":740},"Robustesse positionnelle","position-robustness","Le degré de stabilité des performances du modèle lorsque les informations pertinentes figurent à différents emplacements au sein du contexte.",{"term":742,"anchor":743,"definition":744},"Contexte minimal suffisant","minimum-sufficient-context","Le plus petit contexte de travail opérationnel préservant les preuves, l'état, les contraintes, les exceptions et la provenance indispensables à une exécution fiable.",{},{"id":747,"data":748,"type":42,"tunes":750},"h-sources",{"text":749,"level":219},"Sources principales et lectures complémentaires",{},{"id":752,"data":753,"type":759,"tunes":760},"src-openai-session",{"link":754,"meta":755},"https:\u002F\u002Fdevelopers.openai.com\u002Fcookbook\u002Fexamples\u002Fagents_sdk\u002Fsession_memory",{"image":756,"title":757,"description":758},{"url":403},"OpenAI — Context Engineering: Short-Term Memory Management with Sessions","Recommandations sur l'élagage et la compression, abordant la distraction, l'inefficacité, le contexte obsolète, la récupération bruitée et les sessions de longue durée.","linkTool",{},{"id":762,"data":763,"type":759,"tunes":769},"src-anthropic-context",{"link":764,"meta":765},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents",{"image":766,"title":767,"description":768},{"url":403},"Anthropic — Effective Context Engineering for AI Agents","Conseils d'ingénierie portant sur la pollution de contexte, le compactage, la prise de notes structurée et la gestion du contexte pour agents sur des horizons longs.",{},{"id":771,"data":772,"type":759,"tunes":778},"src-lost-middle",{"link":773,"meta":774},"https:\u002F\u002Faclanthology.org\u002F2024.tacl-1.9\u002F",{"image":775,"title":776,"description":777},{"url":403},"Liu et al. — Lost in the Middle: How Language Models Use Long Contexts","Article du TACL mettant en évidence la sensibilité à la position des informations pertinentes dans les contextes longs et incitant à tester explicitement la robustesse des contextes étendus.",{},{"id":780,"data":781,"type":759,"tunes":787},"src-ms-ace",{"link":782,"meta":783},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fagentic-context-engineering-evolving-contexts-for-self-improving-language-models\u002F",{"image":784,"title":785,"description":786},{"url":403},"Microsoft Research — Agentic Context Engineering (ACE)","Recherche sur l'évolution des contextes structurés face au biais de concision et à l'effondrement du contexte.",{},{"id":789,"data":790,"type":759,"tunes":796},"src-openai-evals",{"link":791,"meta":792},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices",{"image":793,"title":794,"description":795},{"url":403},"OpenAI — Bonnes pratiques d'évaluation","Conseils sur le test des cas limites, y compris les contextes longs et les conversations de longue durée, à l'aide d'évaluations explicites et reproductibles.",{},"2.31","Une fenêtre de contexte plus grande ne garantit pas une meilleure réponse. Cet article explique comment la dilution du signal, les preuves contradictoires, l'état obsolète, la sensibilité à la position et la compression avec perte peuvent réduire la fiabilité de l'IA — et présente un test pratique de pression de contexte.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","why-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v","PUBLISHED","2026-09-25T11:51:00.000Z","2026-09-25T15:51:57.195Z","2026-09-25T20:09:28.015Z",{"en":806,"de":807,"sr":808,"es":809,"fr":810,"it":811,"ru":812,"zh":813},"\u002Fblog\u002Fwhy-more-context-can-make-ai-answers-worse","\u002Fde\u002Fblog\u002Fwhy-more-context-can-make-ai-answers-worse","\u002Fsr\u002Fblog\u002Fwhy-more-context-can-make-ai-answers-worse","\u002Fes\u002Fblog\u002Fwhy-more-context-can-make-ai-answers-worse","\u002Ffr\u002Fblog\u002Fwhy-more-context-can-make-ai-answers-worse","\u002Fit\u002Fblog\u002Fwhy-more-context-can-make-ai-answers-worse","\u002Fru\u002Fblog\u002Fwhy-more-context-can-make-ai-answers-worse","\u002Fzh\u002Fblog\u002Fwhy-more-context-can-make-ai-answers-worse",[815,819,823],{"id":816,"name":817,"slug":818},64,"Architecture de l’information","information-architecture",{"id":820,"name":821,"slug":822},60,"Contrôles de coût et latence","cost-and-latency",{"id":824,"name":825,"slug":826},97,"Vérification sur jeu de test","verification",{"id":828,"login":829,"email":830,"displayName":831},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[833,1300],{"lang":834,"title":835,"content":836,"contentJson":837,"excerpt":1299},"en","Why More Context Can Make AI Answers Worse","{\"time\":1790351629251,\"blocks\":[{\"id\":\"Qfxj3iD3g1\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A larger context window gives an AI system more capacity. It does not guarantee that the model will use that capacity well. In long conversations, RAG pipelines, research agents, and tool-heavy workflows, adding more history, more documents, more tool output, or more memory can make a response less reliable rather than more informed.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"\u003Cstrong>More context can make an AI answer worse when the additional information lowers the signal-to-noise ratio, introduces conflicts, hides decisive evidence, preserves stale state, or compresses away important conditions.\u003C\u002Fstrong> The relevant engineering objective is therefore not maximum context. It is \u003Cstrong>minimum sufficient context with preserved evidence and decision boundaries\u003C\u002Fstrong>.\"},\"tunes\":{}},{\"id\":\"model-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"About the model used in this article\",\"body\":\"The Context Quality model and Context Pressure Test below are practical architecture methods proposed in this article, not formal industry standards. They synthesize established findings on long-context position effects, context pollution, compaction, retrieval, and context engineering.\"},\"tunes\":{}},{\"id\":\"h-capacity\",\"type\":\"header\",\"data\":{\"text\":\"Context capacity is not context usability\",\"level\":2},\"tunes\":{}},{\"id\":\"p-capacity-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A model's advertised context window describes how much input it can accept. It does not imply that every token inside that window receives equal attention or contributes equally to the final answer. The distinction matters because production systems increasingly fill context with conversation history, retrieved documents, tool results, memory, structured state, instructions, and intermediate artifacts.\"},\"tunes\":{}},{\"id\":\"p-capacity-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The classic “Lost in the Middle” study showed that long-context models can perform worse when relevant evidence appears in the middle of a long input than when it appears near the beginning or end. The broader engineering lesson is not that long context is bad. It is that availability inside the context is not equivalent to reliable use.\"},\"tunes\":{}},{\"id\":\"p-capacity-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's context-management guidance reaches the same operational conclusion from another direction: even very large context windows can be overwhelmed by uncurated history, redundant tool output, and noisy retrieval. Anthropic likewise treats context as a finite resource that requires active engineering rather than passive accumulation.\"},\"tunes\":{}},{\"id\":\"h-five\",\"type\":\"header\",\"data\":{\"text\":\"Five ways additional context can reduce answer quality\",\"level\":2},\"tunes\":{}},{\"id\":\"five-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Failure mode\",\"What changes when more context is added\",\"Typical symptom\"],[\"Signal dilution\",\"Relevant evidence becomes a smaller fraction of the total input\",\"The model gives a generic answer or misses the decisive passage\"],[\"Evidence conflict\",\"Different documents, versions, or memories disagree\",\"The answer blends incompatible claims or chooses the wrong version\"],[\"Position sensitivity\",\"Decisive information moves into a less reliably used part of the context\",\"The same evidence works in one ordering but fails in another\"],[\"Stale-context persistence\",\"Old state or prior conclusions remain present after reality changes\",\"The model keeps repeating a formerly correct answer\"],[\"Compression loss\",\"Compaction or summarization removes qualifiers, exceptions, provenance, or unresolved uncertainty\",\"The summary is coherent but the resulting answer becomes overconfident or overgeneralized\"]]},\"tunes\":{}},{\"id\":\"h-dilution\",\"type\":\"header\",\"data\":{\"text\":\"1. Signal dilution: relevant evidence competes with everything else\",\"level\":3},\"tunes\":{}},{\"id\":\"p-dilution-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Suppose a question can be answered from two short passages. A RAG system retrieves those passages plus eighteen loosely related ones “for safety.” Retrieval recall may improve, but the generator must now distinguish decisive evidence from background material. If similar phrases appear across several documents, the additional context can make the answer less precise.\"},\"tunes\":{}},{\"id\":\"p-dilution-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This creates an important distinction between retrieval recall and context utility. More retrieved material can increase the probability that the answer exists somewhere in the context while simultaneously reducing the probability that the model gives the right evidence enough weight.\"},\"tunes\":{}},{\"id\":\"dilution-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"Engineering rule\",\"body\":\"Do not optimize top-k in isolation. Measure whether adding documents improves the final claim, preserves evidence attribution, and survives repeated trials.\"},\"tunes\":{}},{\"id\":\"h-conflict\",\"type\":\"header\",\"data\":{\"text\":\"2. Evidence conflict: more sources can mean more versions of reality\",\"level\":3},\"tunes\":{}},{\"id\":\"p-conflict-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long contexts often contain mutually inconsistent information: old and new API documentation, two policy versions, previous and current user preferences, competing web sources, cached state, or a model-generated summary that no longer matches the source.\"},\"tunes\":{}},{\"id\":\"p-conflict-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The failure is not necessarily hallucination. The model may be faithfully combining contradictory evidence. The architecture therefore needs precedence rules: source authority, version, timestamp, jurisdiction, tenant, product revision, user state, or explicit supersession metadata.\"},\"tunes\":{}},{\"id\":\"p-conflict-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Without those rules, increasing context can increase contradiction faster than it increases knowledge.\"},\"tunes\":{}},{\"id\":\"h-position\",\"type\":\"header\",\"data\":{\"text\":\"3. Position sensitivity: where evidence appears can change the result\",\"level\":3},\"tunes\":{}},{\"id\":\"p-position-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The “Lost in the Middle” results demonstrated that changing only the position of relevant information can materially change model performance. That finding is especially important for systems that concatenate many retrieved passages or long histories in a fixed order.\"},\"tunes\":{}},{\"id\":\"p-position-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"A production test should therefore vary document order, not merely test one canonical prompt. If the system answers correctly only when the decisive evidence is first or last, the application is more fragile than a single benchmark score suggests.\"},\"tunes\":{}},{\"id\":\"h-stale\",\"type\":\"header\",\"data\":{\"text\":\"4. Stale-context persistence: the model sees truth and history together\",\"level\":3},\"tunes\":{}},{\"id\":\"p-stale-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-running agents frequently carry earlier conclusions forward. That continuity is useful until a fact changes. If a tool result from yesterday says a deployment is healthy and a current tool result says it is degraded, both may remain in context unless the system explicitly replaces or scopes old state.\"},\"tunes\":{}},{\"id\":\"p-stale-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is why current operational state should normally come from an authoritative source, while memory preserves durable context such as decisions, preferences, or procedures. More conversation history is not a substitute for re-reading the present.\"},\"tunes\":{}},{\"id\":\"h-compression\",\"type\":\"header\",\"data\":{\"text\":\"5. Compression loss: smaller context can also become worse context\",\"level\":3},\"tunes\":{}},{\"id\":\"p-compression-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The opposite intervention — compressing context — also has failure modes. Summaries can drop exceptions, unresolved questions, provenance, precise identifiers, negative evidence, or the conditions under which a conclusion was valid.\"},\"tunes\":{}},{\"id\":\"p-compression-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Microsoft Research's Agentic Context Engineering work describes a related problem as brevity bias and context collapse: iterative rewriting can remove useful domain detail. The objective is therefore not “compress as much as possible.” It is to reduce context while preserving the information that changes decisions.\"},\"tunes\":{}},{\"id\":\"h-quality\",\"type\":\"header\",\"data\":{\"text\":\"The Context Quality model\",\"level\":2},\"tunes\":{}},{\"id\":\"p-quality-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"A useful context can be evaluated across six dimensions. None of them is simply token count.\"},\"tunes\":{}},{\"id\":\"quality-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Six dimensions of context quality\",\"layout\":\"table\",\"columns\":[{\"id\":\"dimension\",\"label\":\"Dimension\"},{\"id\":\"question\",\"label\":\"Question\"},{\"id\":\"failure\",\"label\":\"If weak\"}],\"rows\":[{\"id\":\"relevance\",\"label\":\"Relevance\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"authority\",\"label\":\"Authority\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"freshness\",\"label\":\"Freshness\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"consistency\",\"label\":\"Consistency\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"completeness\",\"label\":\"Decision completeness\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"traceability\",\"label\":\"Traceability\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"target-state\",\"type\":\"callout\",\"data\":{\"variant\":\"success\",\"title\":\"Target state\",\"body\":\"The best context is not the largest context. It is the \u003Cstrong>smallest context that still preserves the evidence, constraints, state, exceptions, and provenance required for a reliable answer or action\u003C\u002Fstrong>.\"},\"tunes\":{}},{\"id\":\"h-pressure\",\"type\":\"header\",\"data\":{\"text\":\"The Context Pressure Test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-pressure-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"To determine whether an application benefits from more context, test context size as an experimental variable instead of assuming that larger is better.\"},\"tunes\":{}},{\"id\":\"pressure-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Context Pressure Test\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Define a gold case\",\"description\":\"Choose a task with a known answer and a known minimal evidence set.\"},{\"label\":\"2. Run minimal sufficient context\",\"description\":\"Provide only the instructions, current state, and evidence necessary for the answer.\"},{\"label\":\"3. Add relevant background\",\"description\":\"Add useful but non-decisive context and measure whether quality improves, stays stable, or falls.\"},{\"label\":\"4. Add realistic noise\",\"description\":\"Add loosely related history, tool output, or retrieved passages that a production system might include.\"},{\"label\":\"5. Add controlled conflicts\",\"description\":\"Introduce stale or contradictory evidence with clear version metadata and verify that the correct source still wins.\"},{\"label\":\"6. Reorder decisive evidence\",\"description\":\"Place the key information near the beginning, middle, and end to test position sensitivity.\"},{\"label\":\"7. Test compaction\",\"description\":\"Replace older context with a summary and verify that qualifiers, provenance, unresolved issues, and decision boundaries survive.\"},{\"label\":\"8. Compare the quality curve\",\"description\":\"Measure correctness, evidence use, consistency, latency, cost, and variance as context changes.\"}]},\"tunes\":{}},{\"id\":\"h-measure\",\"type\":\"header\",\"data\":{\"text\":\"What to measure instead of token count\",\"level\":2},\"tunes\":{}},{\"id\":\"measure-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Metric\",\"What it reveals\"],[\"Answer correctness\",\"Whether the final result is right\"],[\"Claim-level evidence support\",\"Whether material claims remain grounded as context changes\"],[\"Evidence utilization\",\"Whether the answer follows the decisive evidence instead of prior model knowledge\"],[\"Conflict resolution accuracy\",\"Whether current \u002F authoritative evidence wins over stale or weaker sources\"],[\"Position robustness\",\"Whether reordering evidence changes correctness\"],[\"Compaction retention\",\"Whether summaries preserve constraints, exceptions, identifiers, provenance, and unresolved state\"],[\"Output variance across trials\",\"Whether additional context makes the system less stable\"],[\"Latency and token cost\",\"Whether the added information produces enough quality to justify its operational cost\"]]},\"tunes\":{}},{\"id\":\"h-topk\",\"type\":\"header\",\"data\":{\"text\":\"RAG: why increasing top-k can hurt\",\"level\":2},\"tunes\":{}},{\"id\":\"p-topk-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A common RAG tuning pattern is to increase top-k when the system misses an answer. This can improve candidate recall but also increase irrelevant context, duplicate evidence, outdated passages, and conflicting documents.\"},\"tunes\":{}},{\"id\":\"p-topk-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The better question is whether the decisive evidence is missing from retrieval or merely losing influence after context assembly. If the correct passage already appears in the candidate set, increasing top-k may solve the wrong problem.\"},\"tunes\":{}},{\"id\":\"internal-rag\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method\",\"title\":\"RAG Failed — But Which Layer Actually Failed? A Diagnostic Method\",\"excerpt\":\"A layer-by-layer method for isolating source coverage, retrieval, ranking, context assembly, generation, evidence attribution, and freshness failures.\",\"ctaLabel\":\"Read the RAG diagnostic method\"},\"tunes\":{}},{\"id\":\"h-agents\",\"type\":\"header\",\"data\":{\"text\":\"Long-running agents: continuity is not accumulation\",\"level\":2},\"tunes\":{}},{\"id\":\"p-agents-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An agent needs continuity across steps, but continuity does not require replaying every prior token. OpenAI demonstrates trimming and compression for long-running session context. Anthropic recommends compaction, structured note-taking, and other techniques to preserve useful information while controlling context pollution.\"},\"tunes\":{}},{\"id\":\"p-agents-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"A strong long-running architecture usually separates durable memory, current state, external artifacts, retrieval, and model-facing context. That allows the system to preserve what matters without forcing every historical detail into every inference.\"},\"tunes\":{}},{\"id\":\"internal-memory\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context\",\"title\":\"AI Agent Memory Is Not RAG: How to Separate Memory, Retrieval, State and Context\",\"excerpt\":\"A practical four-layer architecture for separating what persists, what is authoritative now, what is retrieved, and what the model actually receives.\",\"ctaLabel\":\"Read the memory architecture article\"},\"tunes\":{}},{\"id\":\"h-order\",\"type\":\"header\",\"data\":{\"text\":\"Context order should be intentional\",\"level\":2},\"tunes\":{}},{\"id\":\"p-order-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Context construction is an information architecture problem. Critical instructions, current state, decisive evidence, and task-specific constraints should not be placed arbitrarily. When systems concatenate sources mechanically, they implicitly delegate prioritization to positional effects and model attention.\"},\"tunes\":{}},{\"id\":\"p-order-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"There is no universal best ordering for every model and task, so ordering should be evaluated empirically. A useful test suite randomizes or systematically varies document position and measures whether the same claim remains stable.\"},\"tunes\":{}},{\"id\":\"h-boundaries\",\"type\":\"header\",\"data\":{\"text\":\"Preserve decision boundaries during compaction\",\"level\":2},\"tunes\":{}},{\"id\":\"p-bound-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A summary that says “use approach X” is weaker than a summary that preserves why X was chosen and what would invalidate the decision. Context compaction should retain the variables that can change the answer: version, date, assumptions, state, authority, unresolved disagreement, and evidence provenance.\"},\"tunes\":{}},{\"id\":\"p-bound-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This connects context engineering directly to answer validity. If compaction preserves a conclusion but removes its validity boundary, future responses can remain internally consistent while becoming externally wrong.\"},\"tunes\":{}},{\"id\":\"internal-avb\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers\",\"title\":\"The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers\",\"excerpt\":\"A framework for making explicit the conditions under which an AI claim applies and what changes require restriction, recalculation, or abandonment.\",\"ctaLabel\":\"Read the Answer Validity Boundary\"},\"tunes\":{}},{\"id\":\"h-policy\",\"type\":\"header\",\"data\":{\"text\":\"A practical context construction policy\",\"level\":2},\"tunes\":{}},{\"id\":\"policy-list\",\"type\":\"list\",\"data\":{\"style\":\"unordered\",\"meta\":{},\"items\":[\"Start from the current task, not from everything the system knows.\",\"Re-read volatile state from authoritative systems before consequential decisions.\",\"Retrieve evidence for the current question instead of carrying large static corpora forward.\",\"Remove duplicate or low-value tool output.\",\"Keep source version, timestamp, authority, and provenance with important evidence.\",\"Make precedence explicit when current and historical information conflict.\",\"Preserve rules together with their exceptions and prerequisites.\",\"Store durable decisions and reusable procedures outside the immediate context when they do not need verbatim replay.\",\"Compact history only with tests for constraint, identifier, exception, and provenance retention.\",\"Evaluate context size, ordering, and noise with repeated trials rather than a single prompt.\"]},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The trade-off changes with model architecture, training, task type, and context length. Future models may become substantially more robust to position, noise, and conflicting information. A task with a small clean corpus can also benefit from simply providing the complete source rather than building an elaborate retrieval pipeline.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The recommendation also changes when omission is more dangerous than noise. In high-recall research or discovery tasks, a larger candidate context may be justified before a later filtering or synthesis stage. In latency-sensitive production systems, stricter context selection may be preferable.\"},\"tunes\":{}},{\"id\":\"p-change-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The core principle would change only if models became reliably invariant to irrelevant information, position, contradiction, and stale evidence. Until then, context should be treated as a curated execution resource rather than passive storage.\"},\"tunes\":{}},{\"id\":\"h-limitations\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Long-context behaviour varies considerably across models and workloads. The original “Lost in the Middle” experiments used earlier generations of models, so their exact effect sizes should not be assumed to represent current systems. The finding remains useful as a failure pattern to test, not as a universal fixed performance curve.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Likewise, reducing context can remove necessary evidence. Compaction introduces summarization risk, and aggressive retrieval filtering can reduce recall. The objective is not minimal tokens at any cost; it is sufficient, current, traceable context for the decision being made.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The question “How much context can the model accept?” is less useful than “How much of this context improves the decision?” More tokens can add evidence, but they can also add distraction, contradiction, stale state, positional fragility, and compression debt.\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Treat context as an engineered working set. Start with minimum sufficient evidence. Add information only when it improves measured performance. Test noise, conflict, ordering, and compaction explicitly. A large context window is capacity; context quality is architecture.\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Long context and AI answer quality\",\"items\":[{\"id\":\"faq1\",\"question\":\"Can giving an AI model more context make its answer worse?\",\"answer\":\"Yes. Additional context can dilute relevant evidence, introduce contradictory or stale information, move decisive evidence into less robust positions, and increase the chance that the model uses weak rather than decisive signals.\"},{\"id\":\"faq2\",\"question\":\"Does a larger context window eliminate the need for RAG?\",\"answer\":\"Not generally. A larger context window increases capacity, but retrieval still helps select current and relevant information, control cost, preserve source boundaries, and avoid sending large amounts of unrelated data into every request.\"},{\"id\":\"faq3\",\"question\":\"What is the Lost in the Middle problem?\",\"answer\":\"It describes observed cases where language models use relevant information less reliably when that information is located in the middle of a long context than when it appears near the beginning or end. The exact effect varies by model and task and should be tested on current systems.\"},{\"id\":\"faq4\",\"question\":\"Should I always reduce RAG top-k?\",\"answer\":\"No. If relevant evidence is missing from the candidate set, a larger top-k may improve recall. If the evidence is already present but gets diluted by additional material, increasing top-k can make the context worse. Diagnose retrieval and context assembly separately.\"},{\"id\":\"faq5\",\"question\":\"What should a context summary preserve?\",\"answer\":\"Preserve durable decisions, current goals, unresolved issues, identifiers, constraints, exceptions, evidence provenance, and the conditions that would change an earlier conclusion.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key context-engineering terms\",\"entries\":[{\"term\":\"Context window\",\"definition\":\"The amount of input and output token information a model can attend to within one inference sequence.\",\"anchor\":\"context-window\"},{\"term\":\"Context pollution\",\"definition\":\"Degradation caused by irrelevant, stale, redundant, conflicting, or otherwise low-value information occupying model context.\",\"anchor\":\"context-pollution\"},{\"term\":\"Signal dilution\",\"definition\":\"A reduction in the relative prominence of decisive evidence as additional low-value or competing information is added.\",\"anchor\":\"signal-dilution\"},{\"term\":\"Context compaction\",\"definition\":\"Reducing an accumulated context by summarizing, restructuring, externalizing, or otherwise preserving essential information in a smaller working representation.\",\"anchor\":\"context-compaction\"},{\"term\":\"Position robustness\",\"definition\":\"The degree to which model performance remains stable when relevant information appears in different positions inside the context.\",\"anchor\":\"position-robustness\"},{\"term\":\"Minimum sufficient context\",\"definition\":\"The smallest practical working context that still preserves the evidence, state, constraints, exceptions, and provenance required for reliable execution.\",\"anchor\":\"minimum-sufficient-context\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"src-openai-session\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fcookbook\u002Fexamples\u002Fagents_sdk\u002Fsession_memory\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Context Engineering: Short-Term Memory Management with Sessions\",\"description\":\"Guidance on trimming and compression, with discussion of distraction, inefficiency, stale context, noisy retrieval, and long-running sessions.\"}},\"tunes\":{}},{\"id\":\"src-anthropic-context\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Effective Context Engineering for AI Agents\",\"description\":\"Engineering guidance on context pollution, compaction, structured note-taking, and long-horizon agent context management.\"}},\"tunes\":{}},{\"id\":\"src-lost-middle\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Faclanthology.org\u002F2024.tacl-1.9\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Liu et al. — Lost in the Middle: How Language Models Use Long Contexts\",\"description\":\"TACL paper showing position-sensitive use of relevant information in long contexts and motivating explicit long-context robustness tests.\"}},\"tunes\":{}},{\"id\":\"src-ms-ace\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fagentic-context-engineering-evolving-contexts-for-self-improving-language-models\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Microsoft Research — Agentic Context Engineering (ACE)\",\"description\":\"Research on evolving structured contexts while addressing brevity bias and context collapse.\"}},\"tunes\":{}},{\"id\":\"src-openai-evals\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fevaluation-best-practices\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Evaluation Best Practices\",\"description\":\"Guidance on testing edge cases including long context and long-running conversations using explicit, repeatable evals.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":838,"blocks":839,"version":1298},1790351629251,[840,844,848,853,858,862,866,870,874,878,906,910,914,918,923,927,931,935,939,943,947,951,955,959,963,967,971,975,979,983,1011,1016,1020,1024,1053,1057,1088,1092,1096,1100,1107,1111,1115,1119,1126,1130,1134,1138,1142,1146,1150,1157,1161,1176,1180,1184,1188,1192,1196,1200,1204,1207,1211,1215,1218,1238,1242,1263,1267,1273,1279,1285,1291],{"id":215,"data":841,"type":220,"tunes":843},{"title":842,"maxLevel":218,"minLevel":219},"Contents",{},{"id":223,"data":845,"type":226,"tunes":847},{"text":846},"A larger context window gives an AI system more capacity. It does not guarantee that the model will use that capacity well. In long conversations, RAG pipelines, research agents, and tool-heavy workflows, adding more history, more documents, more tool output, or more memory can make a response less reliable rather than more informed.",{},{"id":229,"data":849,"type":234,"tunes":852},{"body":850,"title":851,"variant":233},"\u003Cstrong>More context can make an AI answer worse when the additional information lowers the signal-to-noise ratio, introduces conflicts, hides decisive evidence, preserves stale state, or compresses away important conditions.\u003C\u002Fstrong> The relevant engineering objective is therefore not maximum context. It is \u003Cstrong>minimum sufficient context with preserved evidence and decision boundaries\u003C\u002Fstrong>.","Direct answer",{},{"id":237,"data":854,"type":234,"tunes":857},{"body":855,"title":856,"variant":241},"The Context Quality model and Context Pressure Test below are practical architecture methods proposed in this article, not formal industry standards. They synthesize established findings on long-context position effects, context pollution, compaction, retrieval, and context engineering.","About the model used in this article",{},{"id":244,"data":859,"type":42,"tunes":861},{"text":860,"level":219},"Context capacity is not context usability",{},{"id":249,"data":863,"type":226,"tunes":865},{"text":864},"A model's advertised context window describes how much input it can accept. It does not imply that every token inside that window receives equal attention or contributes equally to the final answer. The distinction matters because production systems increasingly fill context with conversation history, retrieved documents, tool results, memory, structured state, instructions, and intermediate artifacts.",{},{"id":254,"data":867,"type":226,"tunes":869},{"text":868},"The classic “Lost in the Middle” study showed that long-context models can perform worse when relevant evidence appears in the middle of a long input than when it appears near the beginning or end. The broader engineering lesson is not that long context is bad. It is that availability inside the context is not equivalent to reliable use.",{},{"id":259,"data":871,"type":226,"tunes":873},{"text":872},"OpenAI's context-management guidance reaches the same operational conclusion from another direction: even very large context windows can be overwhelmed by uncurated history, redundant tool output, and noisy retrieval. Anthropic likewise treats context as a finite resource that requires active engineering rather than passive accumulation.",{},{"id":264,"data":875,"type":42,"tunes":877},{"text":876,"level":219},"Five ways additional context can reduce answer quality",{},{"id":269,"data":879,"type":296,"tunes":905},{"content":880,"stretched":43,"withHeadings":14},[881,885,889,893,897,901],[882,883,884],"Failure mode","What changes when more context is added","Typical symptom",[886,887,888],"Signal dilution","Relevant evidence becomes a smaller fraction of the total input","The model gives a generic answer or misses the decisive passage",[890,891,892],"Evidence conflict","Different documents, versions, or memories disagree","The answer blends incompatible claims or chooses the wrong version",[894,895,896],"Position sensitivity","Decisive information moves into a less reliably used part of the context","The same evidence works in one ordering but fails in another",[898,899,900],"Stale-context persistence","Old state or prior conclusions remain present after reality changes","The model keeps repeating a formerly correct answer",[902,903,904],"Compression loss","Compaction or summarization removes qualifiers, exceptions, provenance, or unresolved uncertainty","The summary is coherent but the resulting answer becomes overconfident or overgeneralized",{},{"id":299,"data":907,"type":42,"tunes":909},{"text":908,"level":218},"1. Signal dilution: relevant evidence competes with everything else",{},{"id":304,"data":911,"type":226,"tunes":913},{"text":912},"Suppose a question can be answered from two short passages. A RAG system retrieves those passages plus eighteen loosely related ones “for safety.” Retrieval recall may improve, but the generator must now distinguish decisive evidence from background material. If similar phrases appear across several documents, the additional context can make the answer less precise.",{},{"id":309,"data":915,"type":226,"tunes":917},{"text":916},"This creates an important distinction between retrieval recall and context utility. More retrieved material can increase the probability that the answer exists somewhere in the context while simultaneously reducing the probability that the model gives the right evidence enough weight.",{},{"id":314,"data":919,"type":234,"tunes":922},{"body":920,"title":921,"variant":318},"Do not optimize top-k in isolation. Measure whether adding documents improves the final claim, preserves evidence attribution, and survives repeated trials.","Engineering rule",{},{"id":321,"data":924,"type":42,"tunes":926},{"text":925,"level":218},"2. Evidence conflict: more sources can mean more versions of reality",{},{"id":326,"data":928,"type":226,"tunes":930},{"text":929},"Long contexts often contain mutually inconsistent information: old and new API documentation, two policy versions, previous and current user preferences, competing web sources, cached state, or a model-generated summary that no longer matches the source.",{},{"id":331,"data":932,"type":226,"tunes":934},{"text":933},"The failure is not necessarily hallucination. The model may be faithfully combining contradictory evidence. The architecture therefore needs precedence rules: source authority, version, timestamp, jurisdiction, tenant, product revision, user state, or explicit supersession metadata.",{},{"id":336,"data":936,"type":226,"tunes":938},{"text":937},"Without those rules, increasing context can increase contradiction faster than it increases knowledge.",{},{"id":341,"data":940,"type":42,"tunes":942},{"text":941,"level":218},"3. Position sensitivity: where evidence appears can change the result",{},{"id":346,"data":944,"type":226,"tunes":946},{"text":945},"The “Lost in the Middle” results demonstrated that changing only the position of relevant information can materially change model performance. That finding is especially important for systems that concatenate many retrieved passages or long histories in a fixed order.",{},{"id":351,"data":948,"type":226,"tunes":950},{"text":949},"A production test should therefore vary document order, not merely test one canonical prompt. If the system answers correctly only when the decisive evidence is first or last, the application is more fragile than a single benchmark score suggests.",{},{"id":356,"data":952,"type":42,"tunes":954},{"text":953,"level":218},"4. Stale-context persistence: the model sees truth and history together",{},{"id":361,"data":956,"type":226,"tunes":958},{"text":957},"Long-running agents frequently carry earlier conclusions forward. That continuity is useful until a fact changes. If a tool result from yesterday says a deployment is healthy and a current tool result says it is degraded, both may remain in context unless the system explicitly replaces or scopes old state.",{},{"id":366,"data":960,"type":226,"tunes":962},{"text":961},"This is why current operational state should normally come from an authoritative source, while memory preserves durable context such as decisions, preferences, or procedures. More conversation history is not a substitute for re-reading the present.",{},{"id":371,"data":964,"type":42,"tunes":966},{"text":965,"level":218},"5. Compression loss: smaller context can also become worse context",{},{"id":376,"data":968,"type":226,"tunes":970},{"text":969},"The opposite intervention — compressing context — also has failure modes. Summaries can drop exceptions, unresolved questions, provenance, precise identifiers, negative evidence, or the conditions under which a conclusion was valid.",{},{"id":381,"data":972,"type":226,"tunes":974},{"text":973},"Microsoft Research's Agentic Context Engineering work describes a related problem as brevity bias and context collapse: iterative rewriting can remove useful domain detail. The objective is therefore not “compress as much as possible.” It is to reduce context while preserving the information that changes decisions.",{},{"id":386,"data":976,"type":42,"tunes":978},{"text":977,"level":219},"The Context Quality model",{},{"id":391,"data":980,"type":226,"tunes":982},{"text":981},"A useful context can be evaluated across six dimensions. None of them is simply token count.",{},{"id":396,"data":984,"type":435,"tunes":1010},{"rows":985,"title":1004,"layout":296,"columns":1005},[986,989,992,995,998,1001],{"id":400,"label":987,"values":988},"Relevance",[403,403,403],{"id":405,"label":990,"values":991},"Authority",[403,403,403],{"id":409,"label":993,"values":994},"Freshness",[403,403,403],{"id":413,"label":996,"values":997},"Consistency",[403,403,403],{"id":417,"label":999,"values":1000},"Decision completeness",[403,403,403],{"id":421,"label":1002,"values":1003},"Traceability",[403,403,403],"Six dimensions of context quality",[1006,1007,1008],{"id":427,"label":428},{"id":430,"label":431},{"id":433,"label":1009},"If weak",{},{"id":438,"data":1012,"type":234,"tunes":1015},{"body":1013,"title":1014,"variant":442},"The best context is not the largest context. It is the \u003Cstrong>smallest context that still preserves the evidence, constraints, state, exceptions, and provenance required for a reliable answer or action\u003C\u002Fstrong>.","Target state",{},{"id":445,"data":1017,"type":42,"tunes":1019},{"text":1018,"level":219},"The Context Pressure Test",{},{"id":450,"data":1021,"type":226,"tunes":1023},{"text":1022},"To determine whether an application benefits from more context, test context size as an experimental variable instead of assuming that larger is better.",{},{"id":455,"data":1025,"type":484,"tunes":1052},{"steps":1026,"title":1051,"orientation":483},[1027,1030,1033,1036,1039,1042,1045,1048],{"label":1028,"description":1029},"1. Define a gold case","Choose a task with a known answer and a known minimal evidence set.",{"label":1031,"description":1032},"2. Run minimal sufficient context","Provide only the instructions, current state, and evidence necessary for the answer.",{"label":1034,"description":1035},"3. Add relevant background","Add useful but non-decisive context and measure whether quality improves, stays stable, or falls.",{"label":1037,"description":1038},"4. Add realistic noise","Add loosely related history, tool output, or retrieved passages that a production system might include.",{"label":1040,"description":1041},"5. Add controlled conflicts","Introduce stale or contradictory evidence with clear version metadata and verify that the correct source still wins.",{"label":1043,"description":1044},"6. Reorder decisive evidence","Place the key information near the beginning, middle, and end to test position sensitivity.",{"label":1046,"description":1047},"7. Test compaction","Replace older context with a summary and verify that qualifiers, provenance, unresolved issues, and decision boundaries survive.",{"label":1049,"description":1050},"8. Compare the quality curve","Measure correctness, evidence use, consistency, latency, cost, and variance as context changes.","Context Pressure Test",{},{"id":487,"data":1054,"type":42,"tunes":1056},{"text":1055,"level":219},"What to measure instead of token count",{},{"id":492,"data":1058,"type":296,"tunes":1087},{"content":1059,"stretched":43,"withHeadings":14},[1060,1063,1066,1069,1072,1075,1078,1081,1084],[1061,1062],"Metric","What it reveals",[1064,1065],"Answer correctness","Whether the final result is right",[1067,1068],"Claim-level evidence support","Whether material claims remain grounded as context changes",[1070,1071],"Evidence utilization","Whether the answer follows the decisive evidence instead of prior model knowledge",[1073,1074],"Conflict resolution accuracy","Whether current \u002F authoritative evidence wins over stale or weaker sources",[1076,1077],"Position robustness","Whether reordering evidence changes correctness",[1079,1080],"Compaction retention","Whether summaries preserve constraints, exceptions, identifiers, provenance, and unresolved state",[1082,1083],"Output variance across trials","Whether additional context makes the system less stable",[1085,1086],"Latency and token cost","Whether the added information produces enough quality to justify its operational cost",{},{"id":524,"data":1089,"type":42,"tunes":1091},{"text":1090,"level":219},"RAG: why increasing top-k can hurt",{},{"id":529,"data":1093,"type":226,"tunes":1095},{"text":1094},"A common RAG tuning pattern is to increase top-k when the system misses an answer. This can improve candidate recall but also increase irrelevant context, duplicate evidence, outdated passages, and conflicting documents.",{},{"id":534,"data":1097,"type":226,"tunes":1099},{"text":1098},"The better question is whether the decisive evidence is missing from retrieval or merely losing influence after context assembly. If the correct passage already appears in the candidate set, increasing top-k may solve the wrong problem.",{},{"id":539,"data":1101,"type":545,"tunes":1106},{"url":1102,"title":1103,"excerpt":1104,"ctaLabel":1105},"https:\u002F\u002Fstajic.de\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method","RAG Failed — But Which Layer Actually Failed? A Diagnostic Method","A layer-by-layer method for isolating source coverage, retrieval, ranking, context assembly, generation, evidence attribution, and freshness failures.","Read the RAG diagnostic method",{},{"id":548,"data":1108,"type":42,"tunes":1110},{"text":1109,"level":219},"Long-running agents: continuity is not accumulation",{},{"id":553,"data":1112,"type":226,"tunes":1114},{"text":1113},"An agent needs continuity across steps, but continuity does not require replaying every prior token. OpenAI demonstrates trimming and compression for long-running session context. Anthropic recommends compaction, structured note-taking, and other techniques to preserve useful information while controlling context pollution.",{},{"id":558,"data":1116,"type":226,"tunes":1118},{"text":1117},"A strong long-running architecture usually separates durable memory, current state, external artifacts, retrieval, and model-facing context. That allows the system to preserve what matters without forcing every historical detail into every inference.",{},{"id":563,"data":1120,"type":545,"tunes":1125},{"url":1121,"title":1122,"excerpt":1123,"ctaLabel":1124},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","AI Agent Memory Is Not RAG: How to Separate Memory, Retrieval, State and Context","A practical four-layer architecture for separating what persists, what is authoritative now, what is retrieved, and what the model actually receives.","Read the memory architecture article",{},{"id":571,"data":1127,"type":42,"tunes":1129},{"text":1128,"level":219},"Context order should be intentional",{},{"id":576,"data":1131,"type":226,"tunes":1133},{"text":1132},"Context construction is an information architecture problem. Critical instructions, current state, decisive evidence, and task-specific constraints should not be placed arbitrarily. When systems concatenate sources mechanically, they implicitly delegate prioritization to positional effects and model attention.",{},{"id":581,"data":1135,"type":226,"tunes":1137},{"text":1136},"There is no universal best ordering for every model and task, so ordering should be evaluated empirically. A useful test suite randomizes or systematically varies document position and measures whether the same claim remains stable.",{},{"id":586,"data":1139,"type":42,"tunes":1141},{"text":1140,"level":219},"Preserve decision boundaries during compaction",{},{"id":591,"data":1143,"type":226,"tunes":1145},{"text":1144},"A summary that says “use approach X” is weaker than a summary that preserves why X was chosen and what would invalidate the decision. Context compaction should retain the variables that can change the answer: version, date, assumptions, state, authority, unresolved disagreement, and evidence provenance.",{},{"id":596,"data":1147,"type":226,"tunes":1149},{"text":1148},"This connects context engineering directly to answer validity. If compaction preserves a conclusion but removes its validity boundary, future responses can remain internally consistent while becoming externally wrong.",{},{"id":601,"data":1151,"type":545,"tunes":1156},{"url":1152,"title":1153,"excerpt":1154,"ctaLabel":1155},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","The Answer Validity Boundary: The Missing Layer Between Relevance and Reliable AI Answers","A framework for making explicit the conditions under which an AI claim applies and what changes require restriction, recalculation, or abandonment.","Read the Answer Validity Boundary",{},{"id":609,"data":1158,"type":42,"tunes":1160},{"text":1159,"level":219},"A practical context construction policy",{},{"id":614,"data":1162,"type":629,"tunes":1175},{"meta":1163,"items":1164,"style":628},{},[1165,1166,1167,1168,1169,1170,1171,1172,1173,1174],"Start from the current task, not from everything the system knows.","Re-read volatile state from authoritative systems before consequential decisions.","Retrieve evidence for the current question instead of carrying large static corpora forward.","Remove duplicate or low-value tool output.","Keep source version, timestamp, authority, and provenance with important evidence.","Make precedence explicit when current and historical information conflict.","Preserve rules together with their exceptions and prerequisites.","Store durable decisions and reusable procedures outside the immediate context when they do not need verbatim replay.","Compact history only with tests for constraint, identifier, exception, and provenance retention.","Evaluate context size, ordering, and noise with repeated trials rather than a single prompt.",{},{"id":632,"data":1177,"type":42,"tunes":1179},{"text":1178,"level":219},"What would change this answer?",{},{"id":637,"data":1181,"type":226,"tunes":1183},{"text":1182},"The trade-off changes with model architecture, training, task type, and context length. Future models may become substantially more robust to position, noise, and conflicting information. A task with a small clean corpus can also benefit from simply providing the complete source rather than building an elaborate retrieval pipeline.",{},{"id":642,"data":1185,"type":226,"tunes":1187},{"text":1186},"The recommendation also changes when omission is more dangerous than noise. In high-recall research or discovery tasks, a larger candidate context may be justified before a later filtering or synthesis stage. In latency-sensitive production systems, stricter context selection may be preferable.",{},{"id":647,"data":1189,"type":226,"tunes":1191},{"text":1190},"The core principle would change only if models became reliably invariant to irrelevant information, position, contradiction, and stale evidence. Until then, context should be treated as a curated execution resource rather than passive storage.",{},{"id":652,"data":1193,"type":42,"tunes":1195},{"text":1194,"level":219},"Limitations",{},{"id":657,"data":1197,"type":226,"tunes":1199},{"text":1198},"Long-context behaviour varies considerably across models and workloads. The original “Lost in the Middle” experiments used earlier generations of models, so their exact effect sizes should not be assumed to represent current systems. The finding remains useful as a failure pattern to test, not as a universal fixed performance curve.",{},{"id":662,"data":1201,"type":226,"tunes":1203},{"text":1202},"Likewise, reducing context can remove necessary evidence. Compaction introduces summarization risk, and aggressive retrieval filtering can reduce recall. The objective is not minimal tokens at any cost; it is sufficient, current, traceable context for the decision being made.",{},{"id":667,"data":1205,"type":42,"tunes":1206},{"text":669,"level":219},{},{"id":672,"data":1208,"type":226,"tunes":1210},{"text":1209},"The question “How much context can the model accept?” is less useful than “How much of this context improves the decision?” More tokens can add evidence, but they can also add distraction, contradiction, stale state, positional fragility, and compression debt.",{},{"id":677,"data":1212,"type":226,"tunes":1214},{"text":1213},"Treat context as an engineered working set. Start with minimum sufficient evidence. Add information only when it improves measured performance. Test noise, conflict, ordering, and compaction explicitly. A large context window is capacity; context quality is architecture.",{},{"id":682,"data":1216,"type":42,"tunes":1217},{"text":684,"level":219},{},{"id":687,"data":1219,"type":687,"tunes":1237},{"items":1220,"title":1236},[1221,1224,1227,1230,1233],{"id":691,"answer":1222,"question":1223},"Yes. Additional context can dilute relevant evidence, introduce contradictory or stale information, move decisive evidence into less robust positions, and increase the chance that the model uses weak rather than decisive signals.","Can giving an AI model more context make its answer worse?",{"id":695,"answer":1225,"question":1226},"Not generally. A larger context window increases capacity, but retrieval still helps select current and relevant information, control cost, preserve source boundaries, and avoid sending large amounts of unrelated data into every request.","Does a larger context window eliminate the need for RAG?",{"id":699,"answer":1228,"question":1229},"It describes observed cases where language models use relevant information less reliably when that information is located in the middle of a long context than when it appears near the beginning or end. The exact effect varies by model and task and should be tested on current systems.","What is the Lost in the Middle problem?",{"id":703,"answer":1231,"question":1232},"No. If relevant evidence is missing from the candidate set, a larger top-k may improve recall. If the evidence is already present but gets diluted by additional material, increasing top-k can make the context worse. Diagnose retrieval and context assembly separately.","Should I always reduce RAG top-k?",{"id":707,"answer":1234,"question":1235},"Preserve durable decisions, current goals, unresolved issues, identifiers, constraints, exceptions, evidence provenance, and the conditions that would change an earlier conclusion.","What should a context summary preserve?","Long context and AI answer quality",{},{"id":713,"data":1239,"type":42,"tunes":1241},{"text":1240,"level":219},"Glossary",{},{"id":718,"data":1243,"type":718,"tunes":1262},{"title":1244,"entries":1245},"Key context-engineering terms",[1246,1249,1252,1254,1257,1259],{"term":1247,"anchor":724,"definition":1248},"Context window","The amount of input and output token information a model can attend to within one inference sequence.",{"term":1250,"anchor":728,"definition":1251},"Context pollution","Degradation caused by irrelevant, stale, redundant, conflicting, or otherwise low-value information occupying model context.",{"term":886,"anchor":731,"definition":1253},"A reduction in the relative prominence of decisive evidence as additional low-value or competing information is added.",{"term":1255,"anchor":735,"definition":1256},"Context compaction","Reducing an accumulated context by summarizing, restructuring, externalizing, or otherwise preserving essential information in a smaller working representation.",{"term":1076,"anchor":739,"definition":1258},"The degree to which model performance remains stable when relevant information appears in different positions inside the context.",{"term":1260,"anchor":743,"definition":1261},"Minimum sufficient context","The smallest practical working context that still preserves the evidence, state, constraints, exceptions, and provenance required for reliable execution.",{},{"id":747,"data":1264,"type":42,"tunes":1266},{"text":1265,"level":219},"Primary sources and further reading",{},{"id":752,"data":1268,"type":759,"tunes":1272},{"link":754,"meta":1269},{"image":1270,"title":757,"description":1271},{"url":403},"Guidance on trimming and compression, with discussion of distraction, inefficiency, stale context, noisy retrieval, and long-running sessions.",{},{"id":762,"data":1274,"type":759,"tunes":1278},{"link":764,"meta":1275},{"image":1276,"title":767,"description":1277},{"url":403},"Engineering guidance on context pollution, compaction, structured note-taking, and long-horizon agent context management.",{},{"id":771,"data":1280,"type":759,"tunes":1284},{"link":773,"meta":1281},{"image":1282,"title":776,"description":1283},{"url":403},"TACL paper showing position-sensitive use of relevant information in long contexts and motivating explicit long-context robustness tests.",{},{"id":780,"data":1286,"type":759,"tunes":1290},{"link":782,"meta":1287},{"image":1288,"title":785,"description":1289},{"url":403},"Research on evolving structured contexts while addressing brevity bias and context collapse.",{},{"id":789,"data":1292,"type":759,"tunes":1297},{"link":791,"meta":1293},{"image":1294,"title":1295,"description":1296},{"url":403},"OpenAI — Evaluation Best Practices","Guidance on testing edge cases including long context and long-running conversations using explicit, repeatable evals.",{},"2.31.6","A larger context window does not guarantee a better answer. This article explains how signal dilution, conflicting evidence, stale state, position sensitivity, and lossy compression can reduce AI reliability—and introduces a practical Context Pressure Test.",{"lang":7,"title":208,"content":210,"contentJson":1301,"excerpt":798},{"time":212,"blocks":1302,"version":797},[1303,1306,1309,1312,1315,1318,1321,1324,1327,1330,1340,1343,1346,1349,1352,1355,1358,1361,1364,1367,1370,1373,1376,1379,1382,1385,1388,1391,1394,1397,1417,1420,1423,1426,1438,1441,1454,1457,1460,1463,1466,1469,1472,1475,1478,1481,1484,1487,1490,1493,1496,1499,1502,1507,1510,1513,1516,1519,1522,1525,1528,1531,1534,1537,1540,1549,1552,1562,1565,1570,1575,1580,1585],{"id":215,"data":1304,"type":220,"tunes":1305},{"title":217,"maxLevel":218,"minLevel":219},{},{"id":223,"data":1307,"type":226,"tunes":1308},{"text":225},{},{"id":229,"data":1310,"type":234,"tunes":1311},{"body":231,"title":232,"variant":233},{},{"id":237,"data":1313,"type":234,"tunes":1314},{"body":239,"title":240,"variant":241},{},{"id":244,"data":1316,"type":42,"tunes":1317},{"text":246,"level":219},{},{"id":249,"data":1319,"type":226,"tunes":1320},{"text":251},{},{"id":254,"data":1322,"type":226,"tunes":1323},{"text":256},{},{"id":259,"data":1325,"type":226,"tunes":1326},{"text":261},{},{"id":264,"data":1328,"type":42,"tunes":1329},{"text":266,"level":219},{},{"id":269,"data":1331,"type":296,"tunes":1339},{"content":1332,"stretched":43,"withHeadings":14},[1333,1334,1335,1336,1337,1338],[273,274,275],[277,278,279],[281,282,283],[285,286,287],[289,290,291],[293,294,295],{},{"id":299,"data":1341,"type":42,"tunes":1342},{"text":301,"level":218},{},{"id":304,"data":1344,"type":226,"tunes":1345},{"text":306},{},{"id":309,"data":1347,"type":226,"tunes":1348},{"text":311},{},{"id":314,"data":1350,"type":234,"tunes":1351},{"body":316,"title":317,"variant":318},{},{"id":321,"data":1353,"type":42,"tunes":1354},{"text":323,"level":218},{},{"id":326,"data":1356,"type":226,"tunes":1357},{"text":328},{},{"id":331,"data":1359,"type":226,"tunes":1360},{"text":333},{},{"id":336,"data":1362,"type":226,"tunes":1363},{"text":338},{},{"id":341,"data":1365,"type":42,"tunes":1366},{"text":343,"level":218},{},{"id":346,"data":1368,"type":226,"tunes":1369},{"text":348},{},{"id":351,"data":1371,"type":226,"tunes":1372},{"text":353},{},{"id":356,"data":1374,"type":42,"tunes":1375},{"text":358,"level":218},{},{"id":361,"data":1377,"type":226,"tunes":1378},{"text":363},{},{"id":366,"data":1380,"type":226,"tunes":1381},{"text":368},{},{"id":371,"data":1383,"type":42,"tunes":1384},{"text":373,"level":218},{},{"id":376,"data":1386,"type":226,"tunes":1387},{"text":378},{},{"id":381,"data":1389,"type":226,"tunes":1390},{"text":383},{},{"id":386,"data":1392,"type":42,"tunes":1393},{"text":388,"level":219},{},{"id":391,"data":1395,"type":226,"tunes":1396},{"text":393},{},{"id":396,"data":1398,"type":435,"tunes":1416},{"rows":1399,"title":424,"layout":296,"columns":1412},[1400,1402,1404,1406,1408,1410],{"id":400,"label":401,"values":1401},[403,403,403],{"id":405,"label":406,"values":1403},[403,403,403],{"id":409,"label":410,"values":1405},[403,403,403],{"id":413,"label":414,"values":1407},[403,403,403],{"id":417,"label":418,"values":1409},[403,403,403],{"id":421,"label":422,"values":1411},[403,403,403],[1413,1414,1415],{"id":427,"label":428},{"id":430,"label":431},{"id":433,"label":434},{},{"id":438,"data":1418,"type":234,"tunes":1419},{"body":440,"title":441,"variant":442},{},{"id":445,"data":1421,"type":42,"tunes":1422},{"text":447,"level":219},{},{"id":450,"data":1424,"type":226,"tunes":1425},{"text":452},{},{"id":455,"data":1427,"type":484,"tunes":1437},{"steps":1428,"title":482,"orientation":483},[1429,1430,1431,1432,1433,1434,1435,1436],{"label":459,"description":460},{"label":462,"description":463},{"label":465,"description":466},{"label":468,"description":469},{"label":471,"description":472},{"label":474,"description":475},{"label":477,"description":478},{"label":480,"description":481},{},{"id":487,"data":1439,"type":42,"tunes":1440},{"text":489,"level":219},{},{"id":492,"data":1442,"type":296,"tunes":1453},{"content":1443,"stretched":43,"withHeadings":14},[1444,1445,1446,1447,1448,1449,1450,1451,1452],[496,497],[499,500],[502,503],[505,506],[508,509],[511,512],[514,515],[517,518],[520,521],{},{"id":524,"data":1455,"type":42,"tunes":1456},{"text":526,"level":219},{},{"id":529,"data":1458,"type":226,"tunes":1459},{"text":531},{},{"id":534,"data":1461,"type":226,"tunes":1462},{"text":536},{},{"id":539,"data":1464,"type":545,"tunes":1465},{"url":541,"title":542,"excerpt":543,"ctaLabel":544},{},{"id":548,"data":1467,"type":42,"tunes":1468},{"text":550,"level":219},{},{"id":553,"data":1470,"type":226,"tunes":1471},{"text":555},{},{"id":558,"data":1473,"type":226,"tunes":1474},{"text":560},{},{"id":563,"data":1476,"type":545,"tunes":1477},{"url":565,"title":566,"excerpt":567,"ctaLabel":568},{},{"id":571,"data":1479,"type":42,"tunes":1480},{"text":573,"level":219},{},{"id":576,"data":1482,"type":226,"tunes":1483},{"text":578},{},{"id":581,"data":1485,"type":226,"tunes":1486},{"text":583},{},{"id":586,"data":1488,"type":42,"tunes":1489},{"text":588,"level":219},{},{"id":591,"data":1491,"type":226,"tunes":1492},{"text":593},{},{"id":596,"data":1494,"type":226,"tunes":1495},{"text":598},{},{"id":601,"data":1497,"type":545,"tunes":1498},{"url":603,"title":604,"excerpt":605,"ctaLabel":606},{},{"id":609,"data":1500,"type":42,"tunes":1501},{"text":611,"level":219},{},{"id":614,"data":1503,"type":629,"tunes":1506},{"meta":1504,"items":1505,"style":628},{},[618,619,620,621,622,623,624,625,626,627],{},{"id":632,"data":1508,"type":42,"tunes":1509},{"text":634,"level":219},{},{"id":637,"data":1511,"type":226,"tunes":1512},{"text":639},{},{"id":642,"data":1514,"type":226,"tunes":1515},{"text":644},{},{"id":647,"data":1517,"type":226,"tunes":1518},{"text":649},{},{"id":652,"data":1520,"type":42,"tunes":1521},{"text":654,"level":219},{},{"id":657,"data":1523,"type":226,"tunes":1524},{"text":659},{},{"id":662,"data":1526,"type":226,"tunes":1527},{"text":664},{},{"id":667,"data":1529,"type":42,"tunes":1530},{"text":669,"level":219},{},{"id":672,"data":1532,"type":226,"tunes":1533},{"text":674},{},{"id":677,"data":1535,"type":226,"tunes":1536},{"text":679},{},{"id":682,"data":1538,"type":42,"tunes":1539},{"text":684,"level":219},{},{"id":687,"data":1541,"type":687,"tunes":1548},{"items":1542,"title":710},[1543,1544,1545,1546,1547],{"id":691,"answer":692,"question":693},{"id":695,"answer":696,"question":697},{"id":699,"answer":700,"question":701},{"id":703,"answer":704,"question":705},{"id":707,"answer":708,"question":709},{},{"id":713,"data":1550,"type":42,"tunes":1551},{"text":715,"level":219},{},{"id":718,"data":1553,"type":718,"tunes":1561},{"title":720,"entries":1554},[1555,1556,1557,1558,1559,1560],{"term":723,"anchor":724,"definition":725},{"term":727,"anchor":728,"definition":729},{"term":277,"anchor":731,"definition":732},{"term":734,"anchor":735,"definition":736},{"term":738,"anchor":739,"definition":740},{"term":742,"anchor":743,"definition":744},{},{"id":747,"data":1563,"type":42,"tunes":1564},{"text":749,"level":219},{},{"id":752,"data":1566,"type":759,"tunes":1569},{"link":754,"meta":1567},{"image":1568,"title":757,"description":758},{"url":403},{},{"id":762,"data":1571,"type":759,"tunes":1574},{"link":764,"meta":1572},{"image":1573,"title":767,"description":768},{"url":403},{},{"id":771,"data":1576,"type":759,"tunes":1579},{"link":773,"meta":1577},{"image":1578,"title":776,"description":777},{"url":403},{},{"id":780,"data":1581,"type":759,"tunes":1584},{"link":782,"meta":1582},{"image":1583,"title":785,"description":786},{"url":403},{},{"id":789,"data":1586,"type":759,"tunes":1589},{"link":791,"meta":1587},{"image":1588,"title":794,"description":795},{"url":403},{},"Post erfolgreich abgerufen",{"items":1592,"source":1656,"manualIds":1657,"manualMatchedIds":1658},[1593,1600,1607,1614,1621,1628,1635,1642,1649],{"id":1594,"slug":1595,"title":1596,"excerpt":1597,"featuredImage":1598,"publishedAt":1599},"466","the-gpu-is-not-the-product-future-proof-private-ai-architecture","Le GPU n'est pas le produit : architecture d'IA privée pérenne","Une infrastructure d'IA privée ne devrait pas être conçue autour d'un seul GPU ou d'un seul modèle. Une approche plus résiliente combine des GPU d'inférence rapides, des systèmes d'IA riches en mémoire, des nœuds d'IA physique et des modèles cloud de pointe optionnels derrière une couche de routage prenant en compte les capacités.","\u002Fuploads\u002F2026\u002F09\u002Fthe-gpu-is-not-the-product-future-proof-private-ai-architecture-1790140878812-8hsl39.webp","2026-09-23T01:19:00.000Z",{"id":1601,"slug":1602,"title":1603,"excerpt":1604,"featuredImage":1605,"publishedAt":1606},"457","should-you-buy-5g-openwrt-router-old-firmware","Faut-il acheter un routeur 5G OpenWrt avec un ancien firmware ? Le ZBT Z8102AX comme exemple concret","Acheter un routeur 5G OpenWrt avec un ancien firmware peut avoir du sens, mais uniquement dans les bonnes conditions. Le ZBT Z8102AX illustre clairement les deux aspects : le matériel est utile, le modem fonctionne et le routeur est resté stable lors des tests, mais OpenWrt 21.02, un emballage faible et des chemins de mise à niveau peu clairs nécessitent une décision d'achat réfléchie.","\u002Fuploads\u002F2026\u002F06\u002Fopenwrt-router-review-dual-sim-05-1781620596218-5ldld4.webp","2026-06-16T10:41:00.000Z",{"id":1608,"slug":1609,"title":1610,"excerpt":1611,"featuredImage":1612,"publishedAt":1613},"468","ai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","La mémoire des agents IA n'est pas le RAG : comment séparer la mémoire, la récupération, l'état et le contexte","La mémoire des agents, le RAG, l'état et le contexte sont souvent utilisés comme s'ils étaient interchangeables. Ils ne le sont pas. Ce modèle d'architecture pratique sépare les quatre couches, montre où chacune se situe et explique ce qui dysfonctionne lorsque les systèmes les fusionnent en une seule.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context-1790350560308-np0xy6.webp","2026-09-25T11:34:00.000Z",{"id":1615,"slug":1616,"title":1617,"excerpt":1618,"featuredImage":1619,"publishedAt":1620},"478","what-is-rag-the-simplest-explanation-of-how-it-works","Qu'est-ce que le RAG ? L'explication la plus simple de son fonctionnement","Le RAG semble compliqué, mais l'idée est simple : avant qu'une IA ne réponde, elle recherche d'abord des informations utiles dans une source de connaissances et transmet ces informations au modèle de langage. Ce guide explique le RAG, les LLM, l'état, la mémoire et les outils à l'aide d'un modèle mental simple.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":1622,"slug":1623,"title":1624,"excerpt":1625,"featuredImage":1626,"publishedAt":1627},"467","the-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","La frontière de validité des réponses : la couche manquante entre la pertinence et les réponses fiables de l'IA","Une source peut être pertinente, faisant autorité et pourtant être erronée pour la question posée. La couche manquante est l'applicabilité : les conditions dans lesquelles une réponse est valable, et les changements qui obligent à la reconsidérer. Cet article présente la Frontière de Validité de la Réponse comme un modèle de conception de source pour les humains, la recherche par IA et les systèmes RAG.","\u002Fuploads\u002F2026\u002F09\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers-1790272901306-1g5jly.webp","2026-09-24T11:59:00.000Z",{"id":1629,"slug":1630,"title":1631,"excerpt":1632,"featuredImage":1633,"publishedAt":1634},"364","tipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung","Maîtriser le flux de travail SEO : Stratégies d'optimisation essentielles pour la croissance organique","Un flux de travail SEO structuré est crucial pour une croissance organique durable. Découvrez les dix stratégies fondamentales, de la recherche de mots-clés et l'optimisation technique à la qualité du contenu et l'analyse des performances.","\u002Fuploads\u002F2026\u002F03\u002Ftipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung-1774866098131-hwkzrg.webp","2024-01-26T06:35:00.000Z",{"id":1636,"slug":1637,"title":1638,"excerpt":1639,"featuredImage":1640,"publishedAt":1641},"477","computer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system","Agents d'utilisation de l'ordinateur : pourquoi une démonstration réussie peut tout de même être un système peu fiable","Les agents d'utilisation de l'ordinateur peuvent désormais accomplir d'impressionnants flux de travail sur navigateur et sur bureau, mais une seule exécution réussie prouve la capacité—non la fiabilité. Cet article montre comment tester la répétabilité, la robustesse environnementale, le contrôle à long horizon, la conscience de l'état, la vérification des résultats et la gestion sécurisée des objectifs.","\u002Fuploads\u002F2026\u002F09\u002Fcomputer-use-agents-why-a-successful-demo-can-still-be-an-unreliable-system-1790352854690-75qnrg.webp","2026-09-25T12:13:00.000Z",{"id":1643,"slug":1644,"title":1645,"excerpt":1646,"featuredImage":1647,"publishedAt":1648},"363","front-und-backend-entwicklung","Développement front-end et back-end","Le développement front-end et back-end est une partie essentielle du développement web et implique la création d'applications web et de sites web. Le développement front-end se concentre sur l'interface utilisateur, tandis que le développement back-end est responsable de la programmation et de la gestion côté serveur.","\u002Fuploads\u002F2026\u002F03\u002Ffront-und-backend-entwicklung-1774872219531-wyu4i1.webp","2023-04-12T11:11:00.000Z",{"id":1650,"slug":1651,"title":1652,"excerpt":1653,"featuredImage":1654,"publishedAt":1655},"471","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","Comment savoir si un agent IA a réellement utilisé les bonnes preuves","Un agent IA peut citer des sources et tout de même utiliser les mauvais éléments de preuve. Cet article présente une méthode pratique pour vérifier le soutien des affirmations, l'autorité de la source, l'applicabilité, la provenance et si les éléments de preuve ont réellement influencé la réponse.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","2026-09-25T11:47:00.000Z","fallback",[],[]]