[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:fr":3,"public-menus:all":38,"post:generative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing:fr":205,"related:post:generative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing:fr:1":2235},{"statusCode":4,"data":5,"message":37},200,{"tenantId":6,"lang":7,"defaultLang":8,"siteUrl":9,"contactEmail":10,"brandName":11,"logoUrl":12,"siteName":11,"siteDescription":13,"ogImage":10,"robotsIndex":14,"socialLinks":10,"reservedSlugs":10,"seoPolicy":15},"stajic","fr","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":16,"relatedContent":17,"crossDomainLinks":18},{"logoUrl":12},{"enabled":14},[19,22,25,28,31,34],{"url":20,"label":21,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":23,"label":24,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":26,"label":27,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.com","bazify.com",{"url":29,"label":30,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.de","bazify.de",{"url":32,"label":33,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.at","bazify.at",{"url":35,"label":36,"isActive":14,"showInFooter":14,"includeInSameAs":14},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[39,45],{"id":40,"name":41,"location":42,"isActive":14,"isDefault":43,"items":44},1,"main-navigation","header",false,[],{"id":46,"name":47,"location":48,"isActive":14,"isDefault":14,"items":49},4,"main-menu","sidebar",[50,66,79,93,103,118,133],{"id":51,"title":52,"url":60,"target":61,"icon":62,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":64,"portfolioId":10,"children":65},"item-18",{"de":53,"en":54,"es":55,"fr":56,"it":54,"ru":57,"sr":58,"zh":59},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":67,"title":68,"url":75,"target":61,"icon":76,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":77,"portfolioId":10,"children":78},"item-22",{"de":69,"en":69,"es":70,"fr":69,"it":71,"ru":72,"sr":73,"zh":74},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":80,"title":81,"url":89,"target":61,"icon":90,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":91,"portfolioId":10,"children":92},"item-19",{"de":82,"en":83,"es":84,"fr":83,"it":85,"ru":86,"sr":87,"zh":88},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":94,"title":95,"url":99,"target":61,"icon":100,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":101,"portfolioId":10,"children":102},"item-23",{"de":96,"en":96,"es":96,"fr":96,"it":96,"ru":97,"sr":97,"zh":98},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":104,"title":105,"url":114,"target":61,"icon":115,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":116,"portfolioId":10,"children":117},"item-32",{"de":106,"en":107,"es":108,"fr":109,"it":110,"ru":111,"sr":112,"zh":113},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":119,"title":120,"url":129,"target":61,"icon":130,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":131,"portfolioId":10,"children":132},"item-20",{"de":121,"en":122,"es":123,"fr":124,"it":125,"ru":126,"sr":127,"zh":128},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":134,"title":135,"url":144,"target":61,"icon":145,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":147},"item-21",{"de":136,"en":137,"es":138,"fr":139,"it":140,"ru":141,"sr":142,"zh":143},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[148,161,175,181,193],{"id":149,"title":150,"url":144,"target":61,"icon":159,"isActive":14,"type":63,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":146,"portfolioId":10,"children":160},"item-24",{"de":151,"en":152,"es":153,"fr":154,"it":155,"ru":156,"sr":157,"zh":158},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":162,"title":163,"url":171,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":174},"item-29",{"de":164,"en":165,"es":166,"fr":167,"it":168,"ru":169,"sr":170,"zh":143},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":176,"title":177,"url":179,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":180},"item-28",{"de":178,"en":178,"es":178,"fr":178,"it":178,"ru":178,"sr":178,"zh":178},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":182,"title":183,"url":191,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":192},"item-27",{"de":184,"en":185,"es":186,"fr":187,"it":188,"ru":189,"sr":190,"zh":185},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":194,"title":195,"url":203,"target":61,"icon":172,"isActive":14,"type":173,"productId":10,"categoryId":10,"shopCategoryId":10,"articleId":10,"pageId":10,"portfolioId":10,"children":204},"item-31",{"de":196,"en":197,"es":198,"fr":199,"it":200,"ru":201,"sr":202,"zh":197},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":206,"message":2234},{"id":207,"title":208,"slug":209,"content":210,"contentJson":211,"excerpt":1065,"featuredImage":1066,"featuredImageAlt":1067,"featuredImageCaption":10,"featuredImageTitle":10,"featuredImageCopyright":10,"featuredImageAuthor":10,"featuredImageSourceUrl":10,"featuredImageLicense":10,"featuredImageIsAiGenerated":43,"status":1068,"publishedAt":1069,"createdAt":1070,"updatedAt":1071,"seoLocalePaths":1072,"categories":1081,"author":1102,"translations":1107},"481","L'IA générative expliquée : modèles, recherche, outils et applications ne sont pas la même chose","generative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u003Cp>L'IA générative n'est pas un seul composant. Un système d'IA générative en production combine généralement un modèle génératif avec du code applicatif qui fournit des instructions et du contexte, récupère des connaissances externes lorsque nécessaire, expose des outils pour lire ou modifier des systèmes externes, gère l'état d'exécution et les permissions, et transforme le résultat en un produit utilisable. Traiter le modèle, la récupération, les outils, le contexte, le runtime et l'application comme une seule et même chose masque les frontières qui déterminent la fraîcheur, la sécurité, la fiabilité, le coût et le contrôle.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Réponse directe\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">\u003Cstrong>Le modèle génère ; la récupération trouve des preuves externes ; les outils accèdent aux données ou effectuent des actions ; le contexte est ce que le modèle peut voir pour l&#39;inférence en cours ; le runtime coordonne l&#39;exécution ; l&#39;application détient les règles produit, l&#39;état, les permissions, la persistance et l&#39;expérience utilisateur.\u003C\u002Fstrong> Ces couches peuvent être regroupées par un fournisseur, mais leurs responsabilités restent différentes.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Note sur la terminologie et les versions\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Cet article définit des responsabilités architecturales durables plutôt qu&#39;une pile logicielle d&#39;un seul fournisseur. Les exemples d&#39;implémentation actuels ont été revérifiés le \u003Cstrong>8 octobre 2026\u003C\u002Fstrong>. Les API et noms de produits des fournisseurs peuvent changer ; les frontières de responsabilité sont plus stables que n&#39;importe quel SDK ou point de terminaison individuel.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Sommaire\">\u003Cstrong class=\"editorjs-toc__title\">Sommaire\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-5\" class=\"editorjs-toc__link\">Que signifie réellement « IA générative » ?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-9\" class=\"editorjs-toc__link\">Le modèle utile le plus simple d&#39;un système d&#39;IA générative\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-13\" class=\"editorjs-toc__link\">Les six frontières qui comptent\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-15\" class=\"editorjs-toc__link\">1. Le modèle : la génération est sa responsabilité principale\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-19\" class=\"editorjs-toc__link\">2. Récupération : trouver des preuves externes est une opération distincte\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-24\" class=\"editorjs-toc__link\">3. Outils : l&#39;accès et l&#39;action ne sont pas des connaissances du modèle\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-29\" class=\"editorjs-toc__link\">4. Contexte : ce que le modèle peut voir à l&#39;instant présent\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">5. Environnement d&#39;exécution et orchestration : coordonner la boucle\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-37\" class=\"editorjs-toc__link\">6. L&#39;application : là où l&#39;IA devient un produit\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-41\" class=\"editorjs-toc__link\">Comment les parties fonctionnent ensemble dans une requête réelle\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-45\" class=\"editorjs-toc__link\">Différents produits d&#39;IA utilisent différentes combinaisons\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-48\" class=\"editorjs-toc__link\">Preuves de mise en œuvre : Aaasaasa AI Client\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-55\" class=\"editorjs-toc__link\">Erreurs de catégorie courantes\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-57\" class=\"editorjs-toc__link\">Modes de défaillance lorsque les frontières s&#39;effondrent\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-60\" class=\"editorjs-toc__link\">Qu&#39;est-ce qui est stable et qu&#39;est-ce qui dépend de la version ?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-64\" class=\"editorjs-toc__link\">Le test des frontières des composants IA\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-67\" class=\"editorjs-toc__link\">Ce que l&#39;IA générative n&#39;est pas\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-71\" class=\"editorjs-toc__link\">Où aller ensuite dans le graphe de connaissances\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-75\" class=\"editorjs-toc__link\">Limites\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-79\" class=\"editorjs-toc__link\">Qu&#39;est-ce qui changerait cette réponse ?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-82\" class=\"editorjs-toc__link\">Conclusion\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-86\" class=\"editorjs-toc__link\">FAQ\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-88\" class=\"editorjs-toc__link\">Glossaire\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-90\" class=\"editorjs-toc__link\">Sources primaires et preuves d&#39;implémentation\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Ch2 id=\"section-5\">Que signifie réellement « IA générative » ?\u003C\u002Fh2>\n\u003Cp>Au niveau du modèle, l'IA générative désigne les modèles d'IA qui génèrent du contenu synthétique dérivé tel que du texte, des images, de l'audio, de la vidéo, du code ou d'autres sorties numériques. NIST AI 600-1 utilise cette signification orientée modèle et traite séparément des risques aux niveaux du modèle, du système, de l'application et du cas d'usage.\u003C\u002Fp>\n\u003Cp>Cette distinction est importante car un modèle d'IA n'est pas la même chose que le système d'IA complet. Le glossaire actuel du NIST définit un modèle d'IA comme un composant qui produit des sorties à partir d'entrées en utilisant des techniques computationnelles, statistiques ou d'apprentissage automatique, tandis qu'un système d'IA peut inclure des logiciels, du matériel, des applications, des outils ou des utilitaires qui fonctionnent à l'aide de l'IA.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--success my-6 rounded-xl border p-5 border-emerald-300 bg-emerald-50 dark:border-emerald-900 dark:bg-emerald-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Une frontière utile\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">\u003Cstrong>Modèle génératif ≠ application d&#39;IA générative.\u003C\u002Fstrong>\u003Cbr>Un modèle est un composant computationnel. Un produit d&#39;IA utilisable est un système construit autour de ce composant.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-9\">Le modèle utile le plus simple d'un système d'IA générative\u003C\u002Fh2>\n\u003Cp>Pour un premier modèle mental, imaginez un assistant d'entreprise répondant : « Ce client peut-il obtenir un remboursement aujourd'hui ? » Une réponse utile peut nécessiter plusieurs responsabilités différentes. Le modèle de langage peut interpréter la question et rédiger l'explication, mais l'état actuel de la commande peut provenir d'un outil de base de données, la politique de remboursement peut provenir de la récupération de documents, les permissions peuvent être appliquées par l'application, et l'action finale peut nécessiter un appel API contrôlé.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Un chemin d'exécution courant\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Requête utilisateur\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">L'application reçoit une question ou une tâche en langage naturel.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Politique et état de l'application\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">L'identité, le locataire, les permissions, l'état actuel du flux de travail et les règles produit définissent ce que la requête est autorisée à faire.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Récupération ou accès direct aux données\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Le système obtient des preuves externes ou des faits actuels lorsque les connaissances du modèle sont insuffisantes.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Construction du contexte\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Les instructions, l'entrée utilisateur, les preuves sélectionnées, l'état pertinent et les définitions d'outils sont assemblés pour le modèle.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Inférence du modèle\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Le modèle génératif interprète le contexte fourni et produit du texte, une sortie structurée ou une demande d'outil.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Exécution des outils si nécessaire\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Le runtime ou l'application valide et exécute les appels d'outils approuvés en dehors du modèle.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Observation et continuation\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Les résultats des outils peuvent revenir au modèle comme nouveau contexte pour une autre étape d'inférence.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Validation et sortie produit\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">L'application valide le résultat, enregistre l'état requis ou les données d'audit, et présente ou exécute le résultat final.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>Les systèmes réels ne suivent pas toujours exactement cette séquence. La récupération peut avoir lieu avant le premier appel au modèle, les outils peuvent être sélectionnés pendant une boucle d'agent, la logique applicative déterministe peut contourner entièrement le modèle, et la validation peut se produire à plusieurs étapes. L'objectif est de séparer les responsabilités, non d'imposer un flux de travail universel.\u003C\u002Fp>\n\u003Ch2 id=\"section-13\">Les six frontières qui comptent\u003C\u002Fh2>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Six responsabilités au sein d&#39;un produit d&#39;IA\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Tâche principale\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Entrées typiques\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Différent de\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Modèle\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Récupération\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Outils\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Contexte\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Runtime \u002F orchestrateur\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Application\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-15\">1. Le modèle : la génération est sa responsabilité principale\u003C\u002Fh2>\n\u003Cp>Un modèle génératif associe des entrées fournies à des sorties générées. Pour un modèle de langage, cela peut inclure du texte en langage naturel, du JSON structuré, du code, des classifications, des résumés, des plans ou des arguments d'appel d'outils. Les modèles génératifs multimodaux peuvent fonctionner avec des types d'entrée et de sortie supplémentaires.\u003C\u002Fp>\n\u003Cp>Le modèle peut contenir des connaissances apprises substantielles dans ses paramètres, mais les connaissances paramétrées ne sont pas une base de données en direct. Le modèle ne connaît pas automatiquement un document créé il y a cinq minutes, le niveau de stock actuel, un dossier client privé ou l'état d'une application, sauf si cette information est fournie via le chemin d'entrée actuel.\u003C\u002Fp>\n\u003Cp>C'est pourquoi changer le modèle ne résout pas automatiquement des connaissances obsolètes, des permissions manquantes, une récupération défaillante, une propriété d'état incorrecte ou une exécution d'outil dangereuse. Ces défaillances appartiennent souvent à d'autres couches.\u003C\u002Fp>\n\u003Ch2 id=\"section-19\">2. Récupération : trouver des preuves externes est une opération distincte\u003C\u002Fh2>\n\u003Cp>La récupération sélectionne des informations à partir d'une source externe avant ou pendant la génération. Les travaux de 2020 sur la génération augmentée par récupération de Lewis et al. ont rendu cette séparation explicite en combinant un modèle génératif paramétrique avec une mémoire non paramétrique récupérée. Les systèmes de production modernes utilisent de nombreuses variantes de récupération, mais l'idée architecturale reste la même : des preuves utiles peuvent être récupérées au moment de l'inférence au lieu de s'appuyer uniquement sur ce que le modèle a appris pendant l'entraînement.\u003C\u002Fp>\n\u003Cp>La récupération peut utiliser la recherche lexicale, les embeddings, la recherche vectorielle, la recherche hybride, SQL, les graphes de connaissances, les filtres de métadonnées, les API ou d'autres mécanismes de sélection. Une base de données vectorielle est donc un composant de récupération possible, et non la définition du RAG.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">La pertinence n&#39;est pas l&#39;autorité\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Un passage récupéré peut être hautement pertinent et pourtant obsolète, non autorisé, issu de la mauvaise version ou insuffisant pour étayer une affirmation. La qualité de la récupération et la qualité des preuves doivent être évaluées séparément.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Qu'est-ce que le RAG ? L'explication la plus simple de son fonctionnement\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">L'explication canonique en langage clair de la génération augmentée par récupération, y compris la séparation entre le LLM, la connaissance, l'état, la mémoire et les outils.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Lire les fondements du RAG →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-24\">3. Outils : l'accès et l'action ne sont pas des connaissances du modèle\u003C\u002Fh2>\n\u003Cp>Un outil est une interface par laquelle un environnement d'exécution d'IA peut demander des fonctionnalités extérieures au modèle. Un outil peut interroger une base de données, rechercher sur le web, lire un fichier, calculer une valeur, appeler un service interne, créer un ticket, envoyer un message, modifier un enregistrement ou déclencher une autre opération contrôlée.\u003C\u002Fp>\n\u003Cp>La documentation actuelle d'OpenAI sur l'appel de fonctions rend cette frontière explicite : l'appel de fonctions permet aux modèles d'interagir avec des systèmes externes et d'accéder à des données ou à des actions fournies par l'application. Le modèle peut proposer ou sélectionner un appel, mais c'est le système externe qui effectue l'opération réelle.\u003C\u002Fp>\n\u003Cp>L'utilisation d'outils crée donc deux questions distinctes : le modèle peut-il demander cette capacité ? et l'application va-t-elle l'autoriser et l'exécuter ? Un système de production ne doit pas confondre l'intention du modèle avec la permission de provoquer un effet de bord.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--success my-6 rounded-xl border p-5 border-emerald-300 bg-emerald-50 dark:border-emerald-900 dark:bg-emerald-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">L&#39;intention du modèle n&#39;est pas une autorité d&#39;exécution\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Un modèle peut émettre une demande d&#39;outil valide et être néanmoins refusé. L&#39;autorisation, la validation des arguments, les limites de débit, les règles transactionnelles, les exigences d&#39;audit et le retour arrière appartiennent à l&#39;extérieur du modèle.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-29\">4. Contexte : ce que le modèle peut voir à l'instant présent\u003C\u002Fh2>\n\u003Cp>Le contexte est l'information disponible pour le modèle à une étape d'inférence donnée. Les recommandations d'Anthropic sur l'ingénierie du contexte décrivent le contexte comme l'ensemble des tokens inclus lors de l'échantillonnage à partir d'un LLM. En pratique, cet ensemble peut contenir des instructions système, des messages utilisateur, l'historique de conversation, des preuves récupérées, des définitions d'outils, des résultats d'outils, des résumés de mémoire et un état applicatif sélectionné.\u003C\u002Fp>\n\u003Cp>Le contexte n'est donc ni la base de connaissances complète ni la mémoire à long terme. Une entreprise peut stocker dix millions de documents alors que seule une poignée de passages entre dans un appel au modèle. Un environnement d'exécution peut conserver un an d'historique de conversation tout en n'exposant que les éléments nécessaires à la tâche en cours.\u003C\u002Fp>\n\u003Cp>La fenêtre de contexte crée également une contrainte d'ingénierie. Ajouter plus de texte ne garantit pas une meilleure réponse ; des informations non pertinentes, obsolètes, contradictoires ou de faible autorité peuvent diluer les preuves qui comptent réellement.\u003C\u002Fp>\n\u003Ch2 id=\"section-33\">5. Environnement d'exécution et orchestration : coordonner la boucle\u003C\u002Fh2>\n\u003Cp>La couche d'exécution ou d'orchestration coordonne la manière dont le modèle participe à une tâche. Selon l'architecture, elle peut gérer les sessions, les requêtes au modèle, la découverte d'outils, les boucles d'appels d'outils, les nouvelles tentatives, les transferts, les événements en streaming, les délais d'attente, les points de contrôle, la compaction ou les environnements d'exécution.\u003C\u002Fp>\n\u003Cp>Certains environnements d'exécution sont de simples codes applicatifs autour d'une API de modèle. D'autres sont de véritables harnais d'agents. Un environnement d'exécution fourni par un prestataire peut prendre en charge une partie de la boucle tandis que l'application reste responsable de la vérité métier, de l'autorisation, des effets de bord métier et du cycle de vie du produit.\u003C\u002Fp>\n\u003Cp>Cette frontière est importante car l'endroit où s'exécute l'environnement d'exécution et celui où s'exécute l'inférence sont des décisions distinctes. Un client ou un processus d'agent s'exécutant localement peut tout de même appeler un modèle distant, tandis qu'une application distante peut appeler un modèle hébergé sur une infrastructure sous le contrôle de l'organisation.\u003C\u002Fp>\n\u003Ch2 id=\"section-37\">6. L'application : là où l'IA devient un produit\u003C\u002Fh2>\n\u003Cp>L'application est la frontière du produit autour des composants d'IA. Elle est responsable de l'expérience utilisateur, du modèle de domaine, de l'état actuel, de l'identité, de la portée du locataire, des autorisations, de la persistance, des intégrations de services, de la validation, de l'observabilité, de la facturation ou de la logique de quota le cas échéant, et des règles qui déterminent ce que l'IA est autorisée à voir ou à faire.\u003C\u002Fp>\n\u003Cp>C'est la couche qui transforme « un modèle peut produire une sortie utile » en « un système peut fournir une capacité fiable ». Le même modèle peut participer à un assistant de recherche privé, à un flux de travail de support, à un agent de code ou à une application commerciale, car l'application environnante modifie les données, les outils, les politiques, l'état et le contrat d'exécution.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Le modèle est remplaçable ; la frontière du produit ne l&#39;est pas\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">La substitution de fournisseur et de modèle peut être un objectif architectural. L&#39;état faisant autorité de l&#39;application, les autorisations, les règles de domaine, la piste d&#39;audit et le contrat utilisateur ne peuvent pas simplement être délégués au modèle actuellement sélectionné.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-41\">Comment les parties fonctionnent ensemble dans une requête réelle\u003C\u002Fh2>\n\u003Cp>Prenons un assistant de support à qui l'on demande : « Rembourse la commande 4711 si elle est encore éligible, et explique pourquoi. » La requête combine connaissances, état actuel, autorisation, raisonnement et un effet secondaire.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Besoin\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Couche correcte\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Pourquoi\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Politique de remboursement\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Récupération\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le système doit trouver la politique applicable actuelle et préserver sa provenance.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Statut de la commande 4711\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Accès direct aux données\u002Foutils\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'enregistrement actuel de la commande est un état faisant autorité et volatil, et non quelque chose à deviner à partir des connaissances du modèle.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autorité de l'utilisateur pour rembourser\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Application \u002F autorisation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Les autorisations doivent être appliquées indépendamment de ce que le modèle demande.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Interpréter la politique par rapport aux faits de la commande\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modèle + contexte\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le modèle peut raisonner sur les preuves de la politique et l'état actuel de la commande qui lui sont fournis.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Exécuter le remboursement\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Outil + règles de transaction de l'application\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Une opération externe contrôlée modifie l'état réel.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Expliquer le résultat\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modèle\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le modèle peut générer l'explication destinée à l'utilisateur à partir des résultats validés.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Auditer ce qui s'est passé\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Application \u002F runtime\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le système enregistre les preuves, les appels, les décisions, les effets secondaires et les erreurs selon les besoins.\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Si l'assistant ne dispose que du modèle de langage, il peut discuter des remboursements mais ne peut pas savoir de manière fiable si la commande 4711 est actuellement éligible ni effectuer la transaction. S'il ne dispose que de la récupération, il peut trouver la politique mais manque encore de l'état en direct de la commande. S'il dispose d'outils sans autorisation d'application, il peut devenir capable mais dangereux. La fiabilité vient de la composition des couches avec une propriété explicite.\u003C\u002Fp>\n\u003Ch2 id=\"section-45\">Différents produits d'IA utilisent différentes combinaisons\u003C\u002Fh2>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">La présence d&#39;un modèle ne définit pas toute l&#39;architecture\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Récupération\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Outils\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">État faisant autorité\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Capacité typique\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Assistant modèle uniquement\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Assistant ancré par récupération\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Assistant utilisant des outils\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Application agentique\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>Ce sont des modèles d'architecture, et non des classements de maturité. Une fonctionnalité modèle uniquement peut être la conception correcte lorsque la tâche ne nécessite aucun fait ni action externe. L'ajout de récupération, d'outils, de mémoire ou d'une boucle d'agent n'est justifié que lorsque la tâche exige ces capacités.\u003C\u002Fp>\n\u003Ch2 id=\"section-48\">Preuves de mise en œuvre : Aaasaasa AI Client\u003C\u002Fh2>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Preuves de mise en œuvre principales\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">La section suivante décrit une mise en œuvre que j&#39;ai construite et examinée par rapport à la base de code et à la documentation d&#39;architecture d&#39;Aaasaasa AI Client au \u003Cstrong>26 juillet 2026\u003C\u002Fstrong>. Il s&#39;agit d&#39;une preuve de l&#39;utilité de ces frontières, et non d&#39;une affirmation qu&#39;une mise en œuvre est une norme universelle ou un produit d&#39;entreprise déployé commercialement.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Cp>Aaasaasa AI Client est un espace de travail d'IA de bureau local-first construit avec Nuxt 4, Electron et TypeScript. Son AI Hub sépare délibérément l'agent\u002Fclient, le fournisseur, le modèle, l'emplacement d'exécution, les autorisations et le client web au lieu de les traiter comme un seul paramètre « IA ».\u003C\u002Fp>\n\u003Cp>Cette séparation crée un comportement concret. Direct Chat peut parler aux modèles sans outils de système de fichiers ou de shell. Un agent Codex peut utiliser un espace de travail et un profil d'autorisation sélectionnés. Ollama peut fournir une inférence locale directe, tandis que LM Studio et les points de terminaison compatibles OpenAI configurables représentent d'autres chemins de fournisseur. Un processus Codex exécuté localement peut toujours utiliser un modèle cloud, de sorte que l'interface utilisateur et l'architecture n'assimilent pas l'exécution locale à l'inférence locale.\u003C\u002Fp>\n\u003Cp>La mise en œuvre contient également la prise en charge de Qdrant\u002Fvecteurs, des capacités d'extraction de documents et un courtier MCP de répertoire authentifié. Ces composants illustrent une autre frontière : l'infrastructure de récupération et l'accès aux outils peuvent vivre dans le même produit sans devenir des propriétés du modèle lui-même.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Concept A01\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Preuve de mise en œuvre d'Aaasaasa AI Client\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modèle\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Un identifiant de modèle spécifique au fournisseur est sélectionné séparément du fournisseur et du runtime.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Fournisseur\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ollama, LM Studio, les services compatibles OpenAI et d'autres chemins de fournisseur sont représentés séparément.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Runtime\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'emplacement local ou distant de l'agent\u002Fruntime est suivi indépendamment du modèle.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Outils \u002F accès\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direct Chat n'a pas d'outils de système de fichiers ou de shell ; l'accès contrôlé aux répertoires est courtisé séparément.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autorisations\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Les profils d'autorisation de l'espace de travail sont une politique d'application\u002Fsession, et non une capacité du modèle.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Infrastructure de récupération\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La prise en charge des vecteurs et l'extraction de documents existent en tant que capacités de données\u002Frécupération plutôt que de fonctionnalités du modèle.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Application\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le produit Electron\u002FNuxt coordonne l'interface utilisateur, les identifiants, les fournisseurs, la découverte du runtime, les autorisations, les outils et l'interaction avec le modèle.\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Caside class=\"editorjs-callout editorjs-callout--success my-6 rounded-xl border p-5 border-emerald-300 bg-emerald-50 dark:border-emerald-900 dark:bg-emerald-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Leçon de mise en œuvre\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">L&#39;architecture est devenue plus facile à comprendre une fois que \u003Cstrong>modèle, fournisseur, runtime, autorisations, outils, données et client\u003C\u002Fstrong> ont cessé d&#39;être représentés comme un seul choix de configuration. La distinction est opérationnelle : elle détermine ce qui peut s&#39;exécuter localement, ce qui peut accéder aux fichiers, ce qui peut appeler une inférence cloud payante et quelle couche détient l&#39;autorisation.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-55\">Erreurs de catégorie courantes\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Erreur de catégorie\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Ce qui se passe réellement\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">« L'IA connaît nos documents. »\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'application ou la couche de récupération rend le contenu de certains documents sélectionnés disponible au modèle.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">« Le RAG est notre base de données vectorielle. »\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La base de données vectorielle peut être un index ou un stockage utilisé par un pipeline de récupération ; le RAG est le modèle de récupération-plus-génération.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">« Le modèle a appelé notre CRM. »\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le modèle a produit une requête d'outil ; le runtime ou l'application a autorisé et exécuté l'appel externe.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">« C'est de l'IA locale parce que l'agent de bureau s'exécute localement. »\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'emplacement du runtime et l'emplacement de l'inférence sont distincts. Un runtime local peut toujours invoquer un modèle distant.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">« Le modèle a la permission de modifier des fichiers. »\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'application ou le runtime accorde une capacité d'outil selon une politique de permissions ; la permission n'est pas une propriété intrinsèque du modèle.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">« Plus de contexte signifie plus de connaissances. »\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le contexte est l'entrée finie mise à disposition pour une inférence. Un contexte plus large peut contenir plus de bruit, de conflits ou d'informations obsolètes.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">« Le chatbot est l'architecture IA. »\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">L'interface de chat est une interface. Le système peut aussi inclure l'identité, l'état, la récupération, les outils, le runtime, la validation, la persistance et l'observabilité.\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-57\">Modes de défaillance lorsque les frontières s'effondrent\u003C\u002Fh2>\n\u003Cp>Les erreurs de frontière ne sont pas de simples problèmes de terminologie. Elles créent des défaillances de production distinctes qui nécessitent des correctifs différents.\u003C\u002Fp>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Diagnostiquer la couche défaillante avant de remplacer le modèle\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Symptôme\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Problème de frontière probable\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Première vérification architecturale\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Réponse obsolète\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Fait d&#39;entreprise manquant\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Effet de bord dangereux\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Réponse confuse avec beaucoup de texte fourni\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Utilisation inattendue du cloud\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">L&#39;agent bloque ou se répète\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-60\">Qu'est-ce qui est stable et qu'est-ce qui dépend de la version ?\u003C\u002Fh2>\n\u003Cp>Les distinctions architecturales de cet article sont volontairement neutres vis-à-vis des fournisseurs. Les exemples actuels ci-dessous sont des faits d'implémentation qui doivent être revérifiés lorsque les API évoluent.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Domaine\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Idée architecturale stable\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Exemple actuel vérifié le 8 octobre 2026\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modèle IA vs système\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Un modèle est un composant à l'intérieur d'un système plus large\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le glossaire actuel du NIST définit séparément le modèle IA et le système IA.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">RAG\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La génération peut être conditionnée par des informations externes récupérées\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La formulation de Lewis et al. 2020 reste la référence fondamentale ; les méthodes de récupération en production vont désormais bien au-delà d'une conception à index dense unique.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Récupération hébergée\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">La récupération peut être exposée comme un outil géré\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">OpenAI File Search est actuellement un outil de l'API Responses qui recherche dans des bases de connaissances de fichiers téléversés en utilisant la récupération sémantique et par mots-clés.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Appel de fonction\u002Foutil\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Un modèle peut demander des capacités externes définies par l'application\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">OpenAI documente actuellement l'appel de fonction comme une interface vers des systèmes, données et actions externes.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ingénierie du contexte\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Le comportement du modèle dépend des informations finies fournies pour l'inférence en cours\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Les recommandations d'ingénierie actuelles d'Anthropic définissent le contexte comme l'ensemble de tokens inclus lors de l'échantillonnage du LLM et se concentrent sur la curation de cet ensemble.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">API des fournisseurs\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Les SDK, noms d'outils, formes de points de terminaison et fonctionnalités prises en charge changent\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Traitez la documentation des fournisseurs comme sensible à la version même lorsque la frontière de responsabilité reste stable.\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Un article de référence devrait donc préserver les deux niveaux : des concepts stables pour l'architecture, et des preuves datées pour les implémentations actuelles. Mélanger les deux fait vieillir un article inutilement vite.\u003C\u002Fp>\n\u003Ch2 id=\"section-64\">Le test des frontières des composants IA\u003C\u002Fh2>\n\u003Cp>Lors de l'évaluation d'une fonctionnalité IA, posez les questions suivantes dans l'ordre. Les réponses révèlent quels composants le système possède réellement et quelles responsabilités sont encore implicites.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Sept questions pour une conception en production\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Qu'est-ce qui génère la sortie ?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identifiez le modèle exact et les modalités ou sorties structurées qu'il fournit.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Quels faits font autorité en dehors du modèle ?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identifiez les documents, bases de données, API, l'état actuel et les autres sources de vérité.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Comment les informations pertinentes sont-elles sélectionnées ?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Séparez la recherche directe, la recherche, la récupération, le classement et la construction du contexte.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Qu'est-ce qui peut causer de véritables effets de bord ?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Listez les outils et actions externes, puis identifiez qui les valide et les autorise.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Qu'est-ce qui parvient au modèle comme contexte ?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Rendez explicites les instructions, preuves, état, historique, mémoire et définitions d'outils.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Qui possède la boucle ?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identifiez le runtime ou le harnais qui gère les appels, événements, tentatives, boucles d'outils et sessions.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Qu'est-ce qui reste de la responsabilité de l'application ?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Rendez explicites l'identité, les permissions, l'état du domaine, la validation, la persistance, l'observabilité et l'UX.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-67\">Ce que l'IA générative n'est pas\u003C\u002Fh2>\n\u003Cp>L'IA générative n'est pas synonyme de LLM, même si les LLM sont une classe majeure de modèle génératif. Elle n'est pas non plus synonyme de RAG, d'une base de données vectorielle, d'un agent, d'un protocole d'outil, d'une interface de chatbot ou d'une application.\u003C\u002Fp>\n\u003Cp>Ces concepts peuvent être connectés, mais chacun répond à une question architecturale différente. Un LLM demande comment la sortie linguistique est produite. La récupération demande d'où viennent les preuves externes. Les outils demandent comment les capacités externes sont exposées. Le contexte demande ce que le modèle peut voir. Le runtime demande comment l'exécution est coordonnée. L'application demande comment la capacité devient un produit contrôlé.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--success my-6 rounded-xl border p-5 border-emerald-300 bg-emerald-50 dark:border-emerald-900 dark:bg-emerald-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Si vous ne retenez qu&#39;un seul modèle\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">\u003Cstrong>Modèle = générer.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Récupération = trouver des preuves.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Outils = lire ou agir en dehors du modèle.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Contexte = ce que le modèle voit maintenant.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Runtime = coordonner l&#39;exécution.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Application = posséder le produit, l&#39;état, les règles et les permissions.\u003C\u002Fstrong>\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-71\">Où aller ensuite dans le graphe de connaissances\u003C\u002Fh2>\n\u003Cp>Une fois ces frontières claires, les sujets plus profonds deviennent plus faciles à situer. Le RAG appartient à la récupération et à la construction du contexte. Le déclencheur de récupération décide quand des preuves externes sont nécessaires. La mémoire d'agent concerne ce qui persiste dans le temps. L'appel d'outil et MCP appartiennent à l'accès aux capacités. Les harnais d'agent appartiennent à l'orchestration du runtime. RBAC, l'isolation des locataires et l'autorisation de domaine appartiennent à la frontière de sécurité de l'application et de la plateforme.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fwhere-does-an-llm-get-its-data-rag-data-sources-in-python\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">D'où un LLM tire-t-il ses données ? Sources de données RAG en Python\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Une suite pratique montrant comment les fichiers, SQL, les API, la recherche en texte intégral, les embeddings et l'assemblage de contexte relient les données externes à un LLM.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Voir le chemin des données dans le code →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Quand une IA doit-elle cesser de faire confiance à ses propres connaissances ? — Le déclencheur de récupération\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Un modèle de décision pour déterminer quand un système d'IA doit cesser de s'appuyer uniquement sur les connaissances du modèle et obtenir des preuves externes.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Lire le modèle de décision de récupération →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-75\">Limites\u003C\u002Fh2>\n\u003Cp>Le modèle à six couches est une carte des responsabilités, et non une exigence que chaque produit déploie six services distincts. Une petite application peut implémenter la construction de contexte, la récupération et l'orchestration au sein d'un seul processus. Une plateforme managée peut regrouper plusieurs responsabilités derrière une seule API. Le déploiement physique peut être combiné tandis que la propriété sémantique reste distincte.\u003C\u002Fp>\n\u003Cp>La terminologie varie également selon les fournisseurs et la recherche. « Agent », « runtime », « mémoire », « outil », « connecteur » et « contexte » peuvent être définis différemment. Les définitions ici sont choisies pour rendre explicites la propriété opérationnelle et le diagnostic des défaillances, plutôt que pour affirmer que chaque framework utilise un vocabulaire identique.\u003C\u002Fp>\n\u003Cp>La section Aaasaasa AI Client documente un modèle d'implémentation. Elle démontre que des frontières explicites sont pratiques, mais elle ne prouve pas que la même disposition des composants soit optimale pour chaque produit d'IA.\u003C\u002Fp>\n\u003Ch2 id=\"section-79\">Qu'est-ce qui changerait cette réponse ?\u003C\u002Fh2>\n\u003Cp>La carte des responsabilités devrait être révisée si les architectures de modèles elles-mêmes commençaient à posséder un état externe faisant autorité, des permissions, des effets secondaires transactionnels durables et un accès vérifiable aux sources comme des propriétés intrinsèques plutôt que des capacités fournies par un système environnant. Les architectures de production actuelles ne font pas de cela une hypothèse générale sûre.\u003C\u002Fp>\n\u003Cp>Les exemples d'implémentation individuels changeront bien plus tôt. Les outils de récupération hébergés, les API d'agents, les intégrations MCP, les fonctionnalités de gestion de contexte et les capacités des fournisseurs évoluent rapidement. Ces détails devraient être mis à jour sans effondrer les distinctions sous-jacentes entre génération, preuve, accès aux capacités, contexte, exécution et contrôle applicatif.\u003C\u002Fp>\n\u003Ch2 id=\"section-82\">Conclusion\u003C\u002Fh2>\n\u003Cp>L'IA générative devient plus facile à concevoir une fois que « l'IA » cesse d'être traitée comme une seule boîte noire. Le modèle est le composant génératif, pas le produit complet. La récupération fournit des preuves externes. Les outils exposent des capacités. Le contexte transporte les informations sélectionnées vers l'inférence en cours. Le runtime coordonne l'exécution. L'application possède la frontière faisant autorité du produit.\u003C\u002Fp>\n\u003Cp>Cette séparation est utile au-delà de l'explication. Elle indique aux ingénieurs d'où proviennent les faits obsolètes, où se situe l'autorisation, pourquoi un runtime local peut encore utiliser l'inférence cloud, pourquoi le RAG n'équivaut pas à une base de données vectorielle, pourquoi les appels d'outils nécessitent une validation, et pourquoi changer le modèle ne peut pas réparer toutes les défaillances du système.\u003C\u002Fp>\n\u003Cp>La question architecturale durable n'est donc pas « Quel modèle d'IA utilisons-nous ? » Elle est : Quelle responsabilité chaque composant possède-t-il, quelles preuves traversent chaque frontière, et quelle couche est autorisée à modifier l'état réel ?\u003C\u002Fp>\n\u003Ch2 id=\"section-86\">FAQ\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Frontières des systèmes d&#39;IA générative\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">L&#39;IA générative est-elle la même chose qu&#39;un LLM ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Non. Un LLM est un type de modèle génératif. L&#39;IA générative inclut également d&#39;autres modalités, et un système d&#39;IA générative en production peut inclure la récupération, des outils, une logique de runtime, un état applicatif, des permissions, de la persistance et des interfaces utilisateur autour du modèle.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Le RAG fait-il partie du modèle ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Généralement non. Le RAG est un modèle applicatif\u002Fsystème qui récupère des informations externes et fournit des preuves sélectionnées au modèle. Certaines plateformes intègrent étroitement la récupération aux API de modèles, mais la responsabilité reste distincte.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Une base de données vectorielle est-elle nécessaire pour le RAG ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Non. Le RAG peut utiliser la recherche vectorielle, la recherche lexicale, la récupération hybride, SQL, des API, des graphes de connaissances ou d&#39;autres méthodes. La propriété déterminante est la récupération d&#39;informations externes pour la génération, et non une technologie de stockage particulière.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Les outils sont-ils la même chose que le contexte ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Non. Un outil est une capacité externe. Sa définition peut être représentée dans le contexte, et son résultat peut ensuite entrer dans le contexte, mais la capacité réelle s&#39;exécute en dehors du modèle.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Exécuter un client d&#39;IA localement signifie-t-il que le modèle est local ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Non. L&#39;emplacement du runtime et l&#39;emplacement de l&#39;inférence sont distincts. Une application de bureau locale ou un agent peut appeler un modèle distant, tandis qu&#39;une application distante peut appeler un modèle hébergé en interne.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq6\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Qui devrait appliquer les permissions pour les outils d&#39;IA ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">La frontière de sécurité de l&#39;application ou du runtime devrait appliquer l&#39;autorisation. Un modèle peut demander une opération, mais l&#39;intention du modèle ne devrait jamais être considérée comme une autorité d&#39;exécution suffisante.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq7\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Où doit résider l&#39;état actuel de l&#39;application ?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">L&#39;état volatil faisant autorité devrait normalement rester dans l&#39;application ou le système de domaine qui le possède. L&#39;IA peut recevoir l&#39;état pertinent via un contexte contrôlé ou un accès par outil lorsque nécessaire.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-88\">Glossaire\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Termes clés\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"generative-model\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Modèle génératif\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Un modèle d'IA conçu pour générer du contenu synthétique dérivé tel que du texte, des images, de l'audio, de la vidéo, du code ou une sortie structurée.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"retrieval\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Récupération\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Le processus de sélection d'informations pertinentes à partir d'une source ou d'un stockage externe pour la tâche en cours.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"rag\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">RAG\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Retrieval-Augmented Generation : un modèle dans lequel des informations externes récupérées sont fournies à un modèle génératif pour améliorer la sortie en cours.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"tool\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Outil\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Une capacité exposée à un runtime d'IA pour lire des données, calculer, rechercher ou effectuer une action externe.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"context\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Contexte\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Les informations disponibles pour le modèle pour une étape d'inférence particulière.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"runtime-orchestrator\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Runtime \u002F orchestrateur\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">La couche logicielle qui coordonne les appels de modèles, les appels d'outils, les boucles de tâches, les sessions, les tentatives, les événements ou les environnements d'exécution.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"application\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Application\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">La couche produit et domaine qui possède l'interaction utilisateur, l'état faisant autorité, les permissions, la validation, la persistance et le comportement métier.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"provider\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Fournisseur\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Le service ou le runtime qui expose l'accès à un ou plusieurs modèles ; l'identité du fournisseur et l'identité du modèle sont des préoccupations distinctes.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-90\">Sources primaires et preuves d'implémentation\u003C\u002Fh2>\n\u003Cp>Les définitions stables ci-dessous sont ancrées dans des normes et des recherches ; les exemples de mise en œuvre à évolution rapide s'appuient sur la documentation d'ingénierie officielle actuelle. Aaasaasa AI Client constitue une preuve de mise en œuvre originale et a été vérifié par rapport à l'état de sa base de code et de sa documentation daté du 26 juillet 2026.\u003C\u002Fp>\n\u003Ca href=\"https:\u002F\u002Fnvlpubs.nist.gov\u002Fnistpubs\u002Fai\u002FNIST.AI.600-1.pdf\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">NIST AI 600-1 — Profil d&#39;intelligence artificielle générative\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Le profil d&#39;IA générative du NIST, incluant la définition de l&#39;IA générative et la distinction explicite entre les préoccupations au niveau du modèle, du système, de l&#39;application et du cas d&#39;usage.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_model\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">NIST — Modèle d&#39;intelligence artificielle\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Définition actuelle du glossaire du NIST d&#39;un modèle d&#39;IA comme composant d&#39;un système d&#39;information qui produit des sorties à partir d&#39;entrées en utilisant des techniques d&#39;IA.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_system\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">NIST — Système d&#39;intelligence artificielle\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Définition actuelle du glossaire du NIST montrant qu&#39;un système d&#39;IA peut inclure des systèmes de données, des logiciels, du matériel, des applications, des outils ou des utilitaires utilisant l&#39;IA.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2005.11401\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Lewis et al. — Génération augmentée par récupération pour les tâches de traitement du langage naturel à forte intensité de connaissances\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">L&#39;article de 2020 introduisant la formulation RAG qui combine un modèle génératif avec une mémoire non paramétrique récupérée.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-file-search\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Recherche de fichiers\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Documentation officielle actuelle pour la récupération de fichiers hébergés dans l&#39;API Responses à l&#39;aide de bases de connaissances de fichiers téléversés, de la recherche sémantique et de la recherche par mots-clés.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ffunction-calling\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Appel de fonctions\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Documentation officielle actuelle décrivant l&#39;appel d&#39;outils et de fonctions comme interface entre les modèles et les systèmes, données et actions externes.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Anthropic — Ingénierie de contexte efficace pour les agents d&#39;IA\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Conseils d&#39;ingénierie définissant le contexte comme l&#39;ensemble de jetons disponibles lors de l&#39;échantillonnage d&#39;un LLM et expliquant pourquoi la sélection du contexte est un problème de ressources finies.\u003C\u002Fp>\u003C\u002Fa>",{"time":212,"blocks":213,"version":1064},1791475622774,[214,220,228,235,243,248,253,258,265,270,275,307,312,317,360,365,370,375,380,385,390,395,402,411,416,421,426,431,437,442,447,452,457,462,467,472,477,482,487,492,498,503,508,543,548,553,584,589,594,600,605,610,615,642,648,653,682,687,692,732,737,742,775,780,785,790,817,822,827,832,838,843,848,856,864,869,874,879,884,889,894,899,904,909,914,919,924,958,963,990,995,1000,1010,1019,1028,1037,1046,1055],{"id":215,"data":216,"type":218,"tunes":219},"intro",{"text":217},"L'IA générative n'est pas un seul composant. Un système d'IA générative en production combine généralement un modèle génératif avec du code applicatif qui fournit des instructions et du contexte, récupère des connaissances externes lorsque nécessaire, expose des outils pour lire ou modifier des systèmes externes, gère l'état d'exécution et les permissions, et transforme le résultat en un produit utilisable. Traiter le modèle, la récupération, les outils, le contexte, le runtime et l'application comme une seule et même chose masque les frontières qui déterminent la fraîcheur, la sécurité, la fiabilité, le coût et le contrôle.","paragraph",{},{"id":221,"data":222,"type":226,"tunes":227},"direct",{"body":223,"title":224,"variant":225},"\u003Cstrong>Le modèle génère ; la récupération trouve des preuves externes ; les outils accèdent aux données ou effectuent des actions ; le contexte est ce que le modèle peut voir pour l'inférence en cours ; le runtime coordonne l'exécution ; l'application détient les règles produit, l'état, les permissions, la persistance et l'expérience utilisateur.\u003C\u002Fstrong> Ces couches peuvent être regroupées par un fournisseur, mais leurs responsabilités restent différentes.","Réponse directe","info","callout",{},{"id":229,"data":230,"type":226,"tunes":234},"scope-note",{"body":231,"title":232,"variant":233},"Cet article définit des responsabilités architecturales durables plutôt qu'une pile logicielle d'un seul fournisseur. Les exemples d'implémentation actuels ont été revérifiés le \u003Cstrong>8 octobre 2026\u003C\u002Fstrong>. Les API et noms de produits des fournisseurs peuvent changer ; les frontières de responsabilité sont plus stables que n'importe quel SDK ou point de terminaison individuel.","Note sur la terminologie et les versions","note",{},{"id":236,"data":237,"type":241,"tunes":242},"toc",{"title":238,"maxLevel":239,"minLevel":240},"Sommaire",3,2,"tableOfContents",{},{"id":244,"data":245,"type":42,"tunes":247},"h-meaning",{"text":246,"level":240},"Que signifie réellement « IA générative » ?",{},{"id":249,"data":250,"type":218,"tunes":252},"p-meaning-1",{"text":251},"Au niveau du modèle, l'IA générative désigne les modèles d'IA qui génèrent du contenu synthétique dérivé tel que du texte, des images, de l'audio, de la vidéo, du code ou d'autres sorties numériques. NIST AI 600-1 utilise cette signification orientée modèle et traite séparément des risques aux niveaux du modèle, du système, de l'application et du cas d'usage.",{},{"id":254,"data":255,"type":218,"tunes":257},"p-meaning-2",{"text":256},"Cette distinction est importante car un modèle d'IA n'est pas la même chose que le système d'IA complet. Le glossaire actuel du NIST définit un modèle d'IA comme un composant qui produit des sorties à partir d'entrées en utilisant des techniques computationnelles, statistiques ou d'apprentissage automatique, tandis qu'un système d'IA peut inclure des logiciels, du matériel, des applications, des outils ou des utilitaires qui fonctionnent à l'aide de l'IA.",{},{"id":259,"data":260,"type":226,"tunes":264},"model-system-rule",{"body":261,"title":262,"variant":263},"\u003Cstrong>Modèle génératif ≠ application d'IA générative.\u003C\u002Fstrong>\u003Cbr>Un modèle est un composant computationnel. Un produit d'IA utilisable est un système construit autour de ce composant.","Une frontière utile","success",{},{"id":266,"data":267,"type":42,"tunes":269},"h-simple",{"text":268,"level":240},"Le modèle utile le plus simple d'un système d'IA générative",{},{"id":271,"data":272,"type":218,"tunes":274},"p-simple-1",{"text":273},"Pour un premier modèle mental, imaginez un assistant d'entreprise répondant : « Ce client peut-il obtenir un remboursement aujourd'hui ? » Une réponse utile peut nécessiter plusieurs responsabilités différentes. Le modèle de langage peut interpréter la question et rédiger l'explication, mais l'état actuel de la commande peut provenir d'un outil de base de données, la politique de remboursement peut provenir de la récupération de documents, les permissions peuvent être appliquées par l'application, et l'action finale peut nécessiter un appel API contrôlé.",{},{"id":276,"data":277,"type":305,"tunes":306},"simple-flow",{"steps":278,"title":303,"orientation":304},[279,282,285,288,291,294,297,300],{"label":280,"description":281},"1. Requête utilisateur","L'application reçoit une question ou une tâche en langage naturel.",{"label":283,"description":284},"2. Politique et état de l'application","L'identité, le locataire, les permissions, l'état actuel du flux de travail et les règles produit définissent ce que la requête est autorisée à faire.",{"label":286,"description":287},"3. Récupération ou accès direct aux données","Le système obtient des preuves externes ou des faits actuels lorsque les connaissances du modèle sont insuffisantes.",{"label":289,"description":290},"4. Construction du contexte","Les instructions, l'entrée utilisateur, les preuves sélectionnées, l'état pertinent et les définitions d'outils sont assemblés pour le modèle.",{"label":292,"description":293},"5. Inférence du modèle","Le modèle génératif interprète le contexte fourni et produit du texte, une sortie structurée ou une demande d'outil.",{"label":295,"description":296},"6. Exécution des outils si nécessaire","Le runtime ou l'application valide et exécute les appels d'outils approuvés en dehors du modèle.",{"label":298,"description":299},"7. Observation et continuation","Les résultats des outils peuvent revenir au modèle comme nouveau contexte pour une autre étape d'inférence.",{"label":301,"description":302},"8. Validation et sortie produit","L'application valide le résultat, enregistre l'état requis ou les données d'audit, et présente ou exécute le résultat final.","Un chemin d'exécution courant","auto","processFlow",{},{"id":308,"data":309,"type":218,"tunes":311},"p-simple-2",{"text":310},"Les systèmes réels ne suivent pas toujours exactement cette séquence. La récupération peut avoir lieu avant le premier appel au modèle, les outils peuvent être sélectionnés pendant une boucle d'agent, la logique applicative déterministe peut contourner entièrement le modèle, et la validation peut se produire à plusieurs étapes. L'objectif est de séparer les responsabilités, non d'imposer un flux de travail universel.",{},{"id":313,"data":314,"type":42,"tunes":316},"h-boundaries",{"text":315,"level":240},"Les six frontières qui comptent",{},{"id":318,"data":319,"type":358,"tunes":359},"boundary-comparison",{"rows":320,"title":346,"layout":347,"columns":348},[321,326,330,334,338,342],{"id":322,"label":323,"values":324},"model","Modèle",[325,325,325],"",{"id":327,"label":328,"values":329},"retrieval","Récupération",[325,325,325],{"id":331,"label":332,"values":333},"tools","Outils",[325,325,325],{"id":335,"label":336,"values":337},"context","Contexte",[325,325,325],{"id":339,"label":340,"values":341},"runtime","Runtime \u002F orchestrateur",[325,325,325],{"id":343,"label":344,"values":345},"application","Application",[325,325,325],"Six responsabilités au sein d'un produit d'IA","table",[349,352,355],{"id":350,"label":351},"job","Tâche principale",{"id":353,"label":354},"input","Entrées typiques",{"id":356,"label":357},"not","Différent de","comparison",{},{"id":361,"data":362,"type":42,"tunes":364},"h-model",{"text":363,"level":240},"1. Le modèle : la génération est sa responsabilité principale",{},{"id":366,"data":367,"type":218,"tunes":369},"p-model-1",{"text":368},"Un modèle génératif associe des entrées fournies à des sorties générées. Pour un modèle de langage, cela peut inclure du texte en langage naturel, du JSON structuré, du code, des classifications, des résumés, des plans ou des arguments d'appel d'outils. Les modèles génératifs multimodaux peuvent fonctionner avec des types d'entrée et de sortie supplémentaires.",{},{"id":371,"data":372,"type":218,"tunes":374},"p-model-2",{"text":373},"Le modèle peut contenir des connaissances apprises substantielles dans ses paramètres, mais les connaissances paramétrées ne sont pas une base de données en direct. Le modèle ne connaît pas automatiquement un document créé il y a cinq minutes, le niveau de stock actuel, un dossier client privé ou l'état d'une application, sauf si cette information est fournie via le chemin d'entrée actuel.",{},{"id":376,"data":377,"type":218,"tunes":379},"p-model-3",{"text":378},"C'est pourquoi changer le modèle ne résout pas automatiquement des connaissances obsolètes, des permissions manquantes, une récupération défaillante, une propriété d'état incorrecte ou une exécution d'outil dangereuse. Ces défaillances appartiennent souvent à d'autres couches.",{},{"id":381,"data":382,"type":42,"tunes":384},"h-retrieval",{"text":383,"level":240},"2. Récupération : trouver des preuves externes est une opération distincte",{},{"id":386,"data":387,"type":218,"tunes":389},"p-retrieval-1",{"text":388},"La récupération sélectionne des informations à partir d'une source externe avant ou pendant la génération. Les travaux de 2020 sur la génération augmentée par récupération de Lewis et al. ont rendu cette séparation explicite en combinant un modèle génératif paramétrique avec une mémoire non paramétrique récupérée. Les systèmes de production modernes utilisent de nombreuses variantes de récupération, mais l'idée architecturale reste la même : des preuves utiles peuvent être récupérées au moment de l'inférence au lieu de s'appuyer uniquement sur ce que le modèle a appris pendant l'entraînement.",{},{"id":391,"data":392,"type":218,"tunes":394},"p-retrieval-2",{"text":393},"La récupération peut utiliser la recherche lexicale, les embeddings, la recherche vectorielle, la recherche hybride, SQL, les graphes de connaissances, les filtres de métadonnées, les API ou d'autres mécanismes de sélection. Une base de données vectorielle est donc un composant de récupération possible, et non la définition du RAG.",{},{"id":396,"data":397,"type":226,"tunes":401},"retrieval-rule",{"body":398,"title":399,"variant":400},"Un passage récupéré peut être hautement pertinent et pourtant obsolète, non autorisé, issu de la mauvaise version ou insuffisant pour étayer une affirmation. La qualité de la récupération et la qualité des preuves doivent être évaluées séparément.","La pertinence n'est pas l'autorité","warning",{},{"id":403,"data":404,"type":409,"tunes":410},"ref-rag",{"url":405,"title":406,"excerpt":407,"ctaLabel":408},"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works","Qu'est-ce que le RAG ? L'explication la plus simple de son fonctionnement","L'explication canonique en langage clair de la génération augmentée par récupération, y compris la séparation entre le LLM, la connaissance, l'état, la mémoire et les outils.","Lire les fondements du RAG","referralArticle",{},{"id":412,"data":413,"type":42,"tunes":415},"h-tools",{"text":414,"level":240},"3. Outils : l'accès et l'action ne sont pas des connaissances du modèle",{},{"id":417,"data":418,"type":218,"tunes":420},"p-tools-1",{"text":419},"Un outil est une interface par laquelle un environnement d'exécution d'IA peut demander des fonctionnalités extérieures au modèle. Un outil peut interroger une base de données, rechercher sur le web, lire un fichier, calculer une valeur, appeler un service interne, créer un ticket, envoyer un message, modifier un enregistrement ou déclencher une autre opération contrôlée.",{},{"id":422,"data":423,"type":218,"tunes":425},"p-tools-2",{"text":424},"La documentation actuelle d'OpenAI sur l'appel de fonctions rend cette frontière explicite : l'appel de fonctions permet aux modèles d'interagir avec des systèmes externes et d'accéder à des données ou à des actions fournies par l'application. Le modèle peut proposer ou sélectionner un appel, mais c'est le système externe qui effectue l'opération réelle.",{},{"id":427,"data":428,"type":218,"tunes":430},"p-tools-3",{"text":429},"L'utilisation d'outils crée donc deux questions distinctes : le modèle peut-il demander cette capacité ? et l'application va-t-elle l'autoriser et l'exécuter ? Un système de production ne doit pas confondre l'intention du modèle avec la permission de provoquer un effet de bord.",{},{"id":432,"data":433,"type":226,"tunes":436},"tool-rule",{"body":434,"title":435,"variant":263},"Un modèle peut émettre une demande d'outil valide et être néanmoins refusé. L'autorisation, la validation des arguments, les limites de débit, les règles transactionnelles, les exigences d'audit et le retour arrière appartiennent à l'extérieur du modèle.","L'intention du modèle n'est pas une autorité d'exécution",{},{"id":438,"data":439,"type":42,"tunes":441},"h-context",{"text":440,"level":240},"4. Contexte : ce que le modèle peut voir à l'instant présent",{},{"id":443,"data":444,"type":218,"tunes":446},"p-context-1",{"text":445},"Le contexte est l'information disponible pour le modèle à une étape d'inférence donnée. Les recommandations d'Anthropic sur l'ingénierie du contexte décrivent le contexte comme l'ensemble des tokens inclus lors de l'échantillonnage à partir d'un LLM. En pratique, cet ensemble peut contenir des instructions système, des messages utilisateur, l'historique de conversation, des preuves récupérées, des définitions d'outils, des résultats d'outils, des résumés de mémoire et un état applicatif sélectionné.",{},{"id":448,"data":449,"type":218,"tunes":451},"p-context-2",{"text":450},"Le contexte n'est donc ni la base de connaissances complète ni la mémoire à long terme. Une entreprise peut stocker dix millions de documents alors que seule une poignée de passages entre dans un appel au modèle. Un environnement d'exécution peut conserver un an d'historique de conversation tout en n'exposant que les éléments nécessaires à la tâche en cours.",{},{"id":453,"data":454,"type":218,"tunes":456},"p-context-3",{"text":455},"La fenêtre de contexte crée également une contrainte d'ingénierie. Ajouter plus de texte ne garantit pas une meilleure réponse ; des informations non pertinentes, obsolètes, contradictoires ou de faible autorité peuvent diluer les preuves qui comptent réellement.",{},{"id":458,"data":459,"type":42,"tunes":461},"h-runtime",{"text":460,"level":240},"5. Environnement d'exécution et orchestration : coordonner la boucle",{},{"id":463,"data":464,"type":218,"tunes":466},"p-runtime-1",{"text":465},"La couche d'exécution ou d'orchestration coordonne la manière dont le modèle participe à une tâche. Selon l'architecture, elle peut gérer les sessions, les requêtes au modèle, la découverte d'outils, les boucles d'appels d'outils, les nouvelles tentatives, les transferts, les événements en streaming, les délais d'attente, les points de contrôle, la compaction ou les environnements d'exécution.",{},{"id":468,"data":469,"type":218,"tunes":471},"p-runtime-2",{"text":470},"Certains environnements d'exécution sont de simples codes applicatifs autour d'une API de modèle. D'autres sont de véritables harnais d'agents. Un environnement d'exécution fourni par un prestataire peut prendre en charge une partie de la boucle tandis que l'application reste responsable de la vérité métier, de l'autorisation, des effets de bord métier et du cycle de vie du produit.",{},{"id":473,"data":474,"type":218,"tunes":476},"p-runtime-3",{"text":475},"Cette frontière est importante car l'endroit où s'exécute l'environnement d'exécution et celui où s'exécute l'inférence sont des décisions distinctes. Un client ou un processus d'agent s'exécutant localement peut tout de même appeler un modèle distant, tandis qu'une application distante peut appeler un modèle hébergé sur une infrastructure sous le contrôle de l'organisation.",{},{"id":478,"data":479,"type":42,"tunes":481},"h-application",{"text":480,"level":240},"6. L'application : là où l'IA devient un produit",{},{"id":483,"data":484,"type":218,"tunes":486},"p-app-1",{"text":485},"L'application est la frontière du produit autour des composants d'IA. Elle est responsable de l'expérience utilisateur, du modèle de domaine, de l'état actuel, de l'identité, de la portée du locataire, des autorisations, de la persistance, des intégrations de services, de la validation, de l'observabilité, de la facturation ou de la logique de quota le cas échéant, et des règles qui déterminent ce que l'IA est autorisée à voir ou à faire.",{},{"id":488,"data":489,"type":218,"tunes":491},"p-app-2",{"text":490},"C'est la couche qui transforme « un modèle peut produire une sortie utile » en « un système peut fournir une capacité fiable ». Le même modèle peut participer à un assistant de recherche privé, à un flux de travail de support, à un agent de code ou à une application commerciale, car l'application environnante modifie les données, les outils, les politiques, l'état et le contrat d'exécution.",{},{"id":493,"data":494,"type":226,"tunes":497},"app-rule",{"body":495,"title":496,"variant":225},"La substitution de fournisseur et de modèle peut être un objectif architectural. L'état faisant autorité de l'application, les autorisations, les règles de domaine, la piste d'audit et le contrat utilisateur ne peuvent pas simplement être délégués au modèle actuellement sélectionné.","Le modèle est remplaçable ; la frontière du produit ne l'est pas",{},{"id":499,"data":500,"type":42,"tunes":502},"h-work-together",{"text":501,"level":240},"Comment les parties fonctionnent ensemble dans une requête réelle",{},{"id":504,"data":505,"type":218,"tunes":507},"p-together-1",{"text":506},"Prenons un assistant de support à qui l'on demande : « Rembourse la commande 4711 si elle est encore éligible, et explique pourquoi. » La requête combine connaissances, état actuel, autorisation, raisonnement et un effet secondaire.",{},{"id":509,"data":510,"type":347,"tunes":542},"support-table",{"content":511,"stretched":43,"withHeadings":14},[512,516,519,523,527,531,535,538],[513,514,515],"Besoin","Couche correcte","Pourquoi",[517,328,518],"Politique de remboursement","Le système doit trouver la politique applicable actuelle et préserver sa provenance.",[520,521,522],"Statut de la commande 4711","Accès direct aux données\u002Foutils","L'enregistrement actuel de la commande est un état faisant autorité et volatil, et non quelque chose à deviner à partir des connaissances du modèle.",[524,525,526],"Autorité de l'utilisateur pour rembourser","Application \u002F autorisation","Les autorisations doivent être appliquées indépendamment de ce que le modèle demande.",[528,529,530],"Interpréter la politique par rapport aux faits de la commande","Modèle + contexte","Le modèle peut raisonner sur les preuves de la politique et l'état actuel de la commande qui lui sont fournis.",[532,533,534],"Exécuter le remboursement","Outil + règles de transaction de l'application","Une opération externe contrôlée modifie l'état réel.",[536,323,537],"Expliquer le résultat","Le modèle peut générer l'explication destinée à l'utilisateur à partir des résultats validés.",[539,540,541],"Auditer ce qui s'est passé","Application \u002F runtime","Le système enregistre les preuves, les appels, les décisions, les effets secondaires et les erreurs selon les besoins.",{},{"id":544,"data":545,"type":218,"tunes":547},"p-together-2",{"text":546},"Si l'assistant ne dispose que du modèle de langage, il peut discuter des remboursements mais ne peut pas savoir de manière fiable si la commande 4711 est actuellement éligible ni effectuer la transaction. S'il ne dispose que de la récupération, il peut trouver la politique mais manque encore de l'état en direct de la commande. S'il dispose d'outils sans autorisation d'application, il peut devenir capable mais dangereux. La fiabilité vient de la composition des couches avec une propriété explicite.",{},{"id":549,"data":550,"type":42,"tunes":552},"h-configs",{"text":551,"level":240},"Différents produits d'IA utilisent différentes combinaisons",{},{"id":554,"data":555,"type":358,"tunes":583},"config-comparison",{"rows":556,"title":573,"layout":347,"columns":574},[557,561,565,569],{"id":558,"label":559,"values":560},"bare","Assistant modèle uniquement",[325,325,325,325],{"id":562,"label":563,"values":564},"rag","Assistant ancré par récupération",[325,325,325,325],{"id":566,"label":567,"values":568},"tool","Assistant utilisant des outils",[325,325,325,325],{"id":570,"label":571,"values":572},"agent","Application agentique",[325,325,325,325],"La présence d'un modèle ne définit pas toute l'architecture",[575,576,577,580],{"id":327,"label":328},{"id":331,"label":332},{"id":578,"label":579},"state","État faisant autorité",{"id":581,"label":582},"result","Capacité typique",{},{"id":585,"data":586,"type":218,"tunes":588},"p-configs-1",{"text":587},"Ce sont des modèles d'architecture, et non des classements de maturité. Une fonctionnalité modèle uniquement peut être la conception correcte lorsque la tâche ne nécessite aucun fait ni action externe. L'ajout de récupération, d'outils, de mémoire ou d'une boucle d'agent n'est justifié que lorsque la tâche exige ces capacités.",{},{"id":590,"data":591,"type":42,"tunes":593},"h-implementation",{"text":592,"level":240},"Preuves de mise en œuvre : Aaasaasa AI Client",{},{"id":595,"data":596,"type":226,"tunes":599},"implementation-scope",{"body":597,"title":598,"variant":233},"La section suivante décrit une mise en œuvre que j'ai construite et examinée par rapport à la base de code et à la documentation d'architecture d'Aaasaasa AI Client au \u003Cstrong>26 juillet 2026\u003C\u002Fstrong>. Il s'agit d'une preuve de l'utilité de ces frontières, et non d'une affirmation qu'une mise en œuvre est une norme universelle ou un produit d'entreprise déployé commercialement.","Preuves de mise en œuvre principales",{},{"id":601,"data":602,"type":218,"tunes":604},"p-impl-1",{"text":603},"Aaasaasa AI Client est un espace de travail d'IA de bureau local-first construit avec Nuxt 4, Electron et TypeScript. Son AI Hub sépare délibérément l'agent\u002Fclient, le fournisseur, le modèle, l'emplacement d'exécution, les autorisations et le client web au lieu de les traiter comme un seul paramètre « IA ».",{},{"id":606,"data":607,"type":218,"tunes":609},"p-impl-2",{"text":608},"Cette séparation crée un comportement concret. Direct Chat peut parler aux modèles sans outils de système de fichiers ou de shell. Un agent Codex peut utiliser un espace de travail et un profil d'autorisation sélectionnés. Ollama peut fournir une inférence locale directe, tandis que LM Studio et les points de terminaison compatibles OpenAI configurables représentent d'autres chemins de fournisseur. Un processus Codex exécuté localement peut toujours utiliser un modèle cloud, de sorte que l'interface utilisateur et l'architecture n'assimilent pas l'exécution locale à l'inférence locale.",{},{"id":611,"data":612,"type":218,"tunes":614},"p-impl-3",{"text":613},"La mise en œuvre contient également la prise en charge de Qdrant\u002Fvecteurs, des capacités d'extraction de documents et un courtier MCP de répertoire authentifié. Ces composants illustrent une autre frontière : l'infrastructure de récupération et l'accès aux outils peuvent vivre dans le même produit sans devenir des propriétés du modèle lui-même.",{},{"id":616,"data":617,"type":347,"tunes":641},"impl-map",{"content":618,"stretched":43,"withHeadings":14},[619,622,624,627,630,633,636,639],[620,621],"Concept A01","Preuve de mise en œuvre d'Aaasaasa AI Client",[323,623],"Un identifiant de modèle spécifique au fournisseur est sélectionné séparément du fournisseur et du runtime.",[625,626],"Fournisseur","Ollama, LM Studio, les services compatibles OpenAI et d'autres chemins de fournisseur sont représentés séparément.",[628,629],"Runtime","L'emplacement local ou distant de l'agent\u002Fruntime est suivi indépendamment du modèle.",[631,632],"Outils \u002F accès","Direct Chat n'a pas d'outils de système de fichiers ou de shell ; l'accès contrôlé aux répertoires est courtisé séparément.",[634,635],"Autorisations","Les profils d'autorisation de l'espace de travail sont une politique d'application\u002Fsession, et non une capacité du modèle.",[637,638],"Infrastructure de récupération","La prise en charge des vecteurs et l'extraction de documents existent en tant que capacités de données\u002Frécupération plutôt que de fonctionnalités du modèle.",[344,640],"Le produit Electron\u002FNuxt coordonne l'interface utilisateur, les identifiants, les fournisseurs, la découverte du runtime, les autorisations, les outils et l'interaction avec le modèle.",{},{"id":643,"data":644,"type":226,"tunes":647},"impl-lesson",{"body":645,"title":646,"variant":263},"L'architecture est devenue plus facile à comprendre une fois que \u003Cstrong>modèle, fournisseur, runtime, autorisations, outils, données et client\u003C\u002Fstrong> ont cessé d'être représentés comme un seul choix de configuration. La distinction est opérationnelle : elle détermine ce qui peut s'exécuter localement, ce qui peut accéder aux fichiers, ce qui peut appeler une inférence cloud payante et quelle couche détient l'autorisation.","Leçon de mise en œuvre",{},{"id":649,"data":650,"type":42,"tunes":652},"h-errors",{"text":651,"level":240},"Erreurs de catégorie courantes",{},{"id":654,"data":655,"type":347,"tunes":681},"errors-table",{"content":656,"stretched":43,"withHeadings":14},[657,660,663,666,669,672,675,678],[658,659],"Erreur de catégorie","Ce qui se passe réellement",[661,662],"« L'IA connaît nos documents. »","L'application ou la couche de récupération rend le contenu de certains documents sélectionnés disponible au modèle.",[664,665],"« Le RAG est notre base de données vectorielle. »","La base de données vectorielle peut être un index ou un stockage utilisé par un pipeline de récupération ; le RAG est le modèle de récupération-plus-génération.",[667,668],"« Le modèle a appelé notre CRM. »","Le modèle a produit une requête d'outil ; le runtime ou l'application a autorisé et exécuté l'appel externe.",[670,671],"« C'est de l'IA locale parce que l'agent de bureau s'exécute localement. »","L'emplacement du runtime et l'emplacement de l'inférence sont distincts. Un runtime local peut toujours invoquer un modèle distant.",[673,674],"« Le modèle a la permission de modifier des fichiers. »","L'application ou le runtime accorde une capacité d'outil selon une politique de permissions ; la permission n'est pas une propriété intrinsèque du modèle.",[676,677],"« Plus de contexte signifie plus de connaissances. »","Le contexte est l'entrée finie mise à disposition pour une inférence. Un contexte plus large peut contenir plus de bruit, de conflits ou d'informations obsolètes.",[679,680],"« Le chatbot est l'architecture IA. »","L'interface de chat est une interface. Le système peut aussi inclure l'identité, l'état, la récupération, les outils, le runtime, la validation, la persistance et l'observabilité.",{},{"id":683,"data":684,"type":42,"tunes":686},"h-failures",{"text":685,"level":240},"Modes de défaillance lorsque les frontières s'effondrent",{},{"id":688,"data":689,"type":218,"tunes":691},"p-failure-intro",{"text":690},"Les erreurs de frontière ne sont pas de simples problèmes de terminologie. Elles créent des défaillances de production distinctes qui nécessitent des correctifs différents.",{},{"id":693,"data":694,"type":358,"tunes":731},"failure-comparison",{"rows":695,"title":720,"layout":347,"columns":721},[696,700,704,708,712,716],{"id":697,"label":698,"values":699},"stale","Réponse obsolète",[325,325,325],{"id":701,"label":702,"values":703},"missing","Fait d'entreprise manquant",[325,325,325],{"id":705,"label":706,"values":707},"unsafe","Effet de bord dangereux",[325,325,325],{"id":709,"label":710,"values":711},"noise","Réponse confuse avec beaucoup de texte fourni",[325,325,325],{"id":713,"label":714,"values":715},"route","Utilisation inattendue du cloud",[325,325,325],{"id":717,"label":718,"values":719},"loop","L'agent bloque ou se répète",[325,325,325],"Diagnostiquer la couche défaillante avant de remplacer le modèle",[722,725,728],{"id":723,"label":724},"symptom","Symptôme",{"id":726,"label":727},"likely","Problème de frontière probable",{"id":729,"label":730},"fix","Première vérification architecturale",{},{"id":733,"data":734,"type":42,"tunes":736},"h-version",{"text":735,"level":240},"Qu'est-ce qui est stable et qu'est-ce qui dépend de la version ?",{},{"id":738,"data":739,"type":218,"tunes":741},"p-version-1",{"text":740},"Les distinctions architecturales de cet article sont volontairement neutres vis-à-vis des fournisseurs. Les exemples actuels ci-dessous sont des faits d'implémentation qui doivent être revérifiés lorsque les API évoluent.",{},{"id":743,"data":744,"type":347,"tunes":774},"version-table",{"content":745,"stretched":43,"withHeadings":14},[746,750,754,758,762,766,770],[747,748,749],"Domaine","Idée architecturale stable","Exemple actuel vérifié le 8 octobre 2026",[751,752,753],"Modèle IA vs système","Un modèle est un composant à l'intérieur d'un système plus large","Le glossaire actuel du NIST définit séparément le modèle IA et le système IA.",[755,756,757],"RAG","La génération peut être conditionnée par des informations externes récupérées","La formulation de Lewis et al. 2020 reste la référence fondamentale ; les méthodes de récupération en production vont désormais bien au-delà d'une conception à index dense unique.",[759,760,761],"Récupération hébergée","La récupération peut être exposée comme un outil géré","OpenAI File Search est actuellement un outil de l'API Responses qui recherche dans des bases de connaissances de fichiers téléversés en utilisant la récupération sémantique et par mots-clés.",[763,764,765],"Appel de fonction\u002Foutil","Un modèle peut demander des capacités externes définies par l'application","OpenAI documente actuellement l'appel de fonction comme une interface vers des systèmes, données et actions externes.",[767,768,769],"Ingénierie du contexte","Le comportement du modèle dépend des informations finies fournies pour l'inférence en cours","Les recommandations d'ingénierie actuelles d'Anthropic définissent le contexte comme l'ensemble de tokens inclus lors de l'échantillonnage du LLM et se concentrent sur la curation de cet ensemble.",[771,772,773],"API des fournisseurs","Les SDK, noms d'outils, formes de points de terminaison et fonctionnalités prises en charge changent","Traitez la documentation des fournisseurs comme sensible à la version même lorsque la frontière de responsabilité reste stable.",{},{"id":776,"data":777,"type":218,"tunes":779},"p-version-2",{"text":778},"Un article de référence devrait donc préserver les deux niveaux : des concepts stables pour l'architecture, et des preuves datées pour les implémentations actuelles. Mélanger les deux fait vieillir un article inutilement vite.",{},{"id":781,"data":782,"type":42,"tunes":784},"h-test",{"text":783,"level":240},"Le test des frontières des composants IA",{},{"id":786,"data":787,"type":218,"tunes":789},"p-test-1",{"text":788},"Lors de l'évaluation d'une fonctionnalité IA, posez les questions suivantes dans l'ordre. Les réponses révèlent quels composants le système possède réellement et quelles responsabilités sont encore implicites.",{},{"id":791,"data":792,"type":305,"tunes":816},"boundary-test",{"steps":793,"title":815,"orientation":304},[794,797,800,803,806,809,812],{"label":795,"description":796},"1. Qu'est-ce qui génère la sortie ?","Identifiez le modèle exact et les modalités ou sorties structurées qu'il fournit.",{"label":798,"description":799},"2. Quels faits font autorité en dehors du modèle ?","Identifiez les documents, bases de données, API, l'état actuel et les autres sources de vérité.",{"label":801,"description":802},"3. Comment les informations pertinentes sont-elles sélectionnées ?","Séparez la recherche directe, la recherche, la récupération, le classement et la construction du contexte.",{"label":804,"description":805},"4. Qu'est-ce qui peut causer de véritables effets de bord ?","Listez les outils et actions externes, puis identifiez qui les valide et les autorise.",{"label":807,"description":808},"5. Qu'est-ce qui parvient au modèle comme contexte ?","Rendez explicites les instructions, preuves, état, historique, mémoire et définitions d'outils.",{"label":810,"description":811},"6. Qui possède la boucle ?","Identifiez le runtime ou le harnais qui gère les appels, événements, tentatives, boucles d'outils et sessions.",{"label":813,"description":814},"7. Qu'est-ce qui reste de la responsabilité de l'application ?","Rendez explicites l'identité, les permissions, l'état du domaine, la validation, la persistance, l'observabilité et l'UX.","Sept questions pour une conception en production",{},{"id":818,"data":819,"type":42,"tunes":821},"h-not",{"text":820,"level":240},"Ce que l'IA générative n'est pas",{},{"id":823,"data":824,"type":218,"tunes":826},"p-not-1",{"text":825},"L'IA générative n'est pas synonyme de LLM, même si les LLM sont une classe majeure de modèle génératif. Elle n'est pas non plus synonyme de RAG, d'une base de données vectorielle, d'un agent, d'un protocole d'outil, d'une interface de chatbot ou d'une application.",{},{"id":828,"data":829,"type":218,"tunes":831},"p-not-2",{"text":830},"Ces concepts peuvent être connectés, mais chacun répond à une question architecturale différente. Un LLM demande comment la sortie linguistique est produite. La récupération demande d'où viennent les preuves externes. Les outils demandent comment les capacités externes sont exposées. Le contexte demande ce que le modèle peut voir. Le runtime demande comment l'exécution est coordonnée. L'application demande comment la capacité devient un produit contrôlé.",{},{"id":833,"data":834,"type":226,"tunes":837},"remember",{"body":835,"title":836,"variant":263},"\u003Cstrong>Modèle = générer.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Récupération = trouver des preuves.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Outils = lire ou agir en dehors du modèle.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Contexte = ce que le modèle voit maintenant.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Runtime = coordonner l'exécution.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Application = posséder le produit, l'état, les règles et les permissions.\u003C\u002Fstrong>","Si vous ne retenez qu'un seul modèle",{},{"id":839,"data":840,"type":42,"tunes":842},"h-next",{"text":841,"level":240},"Où aller ensuite dans le graphe de connaissances",{},{"id":844,"data":845,"type":218,"tunes":847},"p-next-1",{"text":846},"Une fois ces frontières claires, les sujets plus profonds deviennent plus faciles à situer. Le RAG appartient à la récupération et à la construction du contexte. Le déclencheur de récupération décide quand des preuves externes sont nécessaires. La mémoire d'agent concerne ce qui persiste dans le temps. L'appel d'outil et MCP appartiennent à l'accès aux capacités. Les harnais d'agent appartiennent à l'orchestration du runtime. RBAC, l'isolation des locataires et l'autorisation de domaine appartiennent à la frontière de sécurité de l'application et de la plateforme.",{},{"id":849,"data":850,"type":409,"tunes":855},"ref-data",{"url":851,"title":852,"excerpt":853,"ctaLabel":854},"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fwhere-does-an-llm-get-its-data-rag-data-sources-in-python","D'où un LLM tire-t-il ses données ? Sources de données RAG en Python","Une suite pratique montrant comment les fichiers, SQL, les API, la recherche en texte intégral, les embeddings et l'assemblage de contexte relient les données externes à un LLM.","Voir le chemin des données dans le code",{},{"id":857,"data":858,"type":409,"tunes":863},"ref-trigger",{"url":859,"title":860,"excerpt":861,"ctaLabel":862},"https:\u002F\u002Fstajic.de\u002Ffr\u002Fblog\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger","Quand une IA doit-elle cesser de faire confiance à ses propres connaissances ? — Le déclencheur de récupération","Un modèle de décision pour déterminer quand un système d'IA doit cesser de s'appuyer uniquement sur les connaissances du modèle et obtenir des preuves externes.","Lire le modèle de décision de récupération",{},{"id":865,"data":866,"type":42,"tunes":868},"h-limit",{"text":867,"level":240},"Limites",{},{"id":870,"data":871,"type":218,"tunes":873},"p-limit-1",{"text":872},"Le modèle à six couches est une carte des responsabilités, et non une exigence que chaque produit déploie six services distincts. Une petite application peut implémenter la construction de contexte, la récupération et l'orchestration au sein d'un seul processus. Une plateforme managée peut regrouper plusieurs responsabilités derrière une seule API. Le déploiement physique peut être combiné tandis que la propriété sémantique reste distincte.",{},{"id":875,"data":876,"type":218,"tunes":878},"p-limit-2",{"text":877},"La terminologie varie également selon les fournisseurs et la recherche. « Agent », « runtime », « mémoire », « outil », « connecteur » et « contexte » peuvent être définis différemment. Les définitions ici sont choisies pour rendre explicites la propriété opérationnelle et le diagnostic des défaillances, plutôt que pour affirmer que chaque framework utilise un vocabulaire identique.",{},{"id":880,"data":881,"type":218,"tunes":883},"p-limit-3",{"text":882},"La section Aaasaasa AI Client documente un modèle d'implémentation. Elle démontre que des frontières explicites sont pratiques, mais elle ne prouve pas que la même disposition des composants soit optimale pour chaque produit d'IA.",{},{"id":885,"data":886,"type":42,"tunes":888},"h-change",{"text":887,"level":240},"Qu'est-ce qui changerait cette réponse ?",{},{"id":890,"data":891,"type":218,"tunes":893},"p-change-1",{"text":892},"La carte des responsabilités devrait être révisée si les architectures de modèles elles-mêmes commençaient à posséder un état externe faisant autorité, des permissions, des effets secondaires transactionnels durables et un accès vérifiable aux sources comme des propriétés intrinsèques plutôt que des capacités fournies par un système environnant. Les architectures de production actuelles ne font pas de cela une hypothèse générale sûre.",{},{"id":895,"data":896,"type":218,"tunes":898},"p-change-2",{"text":897},"Les exemples d'implémentation individuels changeront bien plus tôt. Les outils de récupération hébergés, les API d'agents, les intégrations MCP, les fonctionnalités de gestion de contexte et les capacités des fournisseurs évoluent rapidement. Ces détails devraient être mis à jour sans effondrer les distinctions sous-jacentes entre génération, preuve, accès aux capacités, contexte, exécution et contrôle applicatif.",{},{"id":900,"data":901,"type":42,"tunes":903},"h-conclusion",{"text":902,"level":240},"Conclusion",{},{"id":905,"data":906,"type":218,"tunes":908},"p-conclusion-1",{"text":907},"L'IA générative devient plus facile à concevoir une fois que « l'IA » cesse d'être traitée comme une seule boîte noire. Le modèle est le composant génératif, pas le produit complet. La récupération fournit des preuves externes. Les outils exposent des capacités. Le contexte transporte les informations sélectionnées vers l'inférence en cours. Le runtime coordonne l'exécution. L'application possède la frontière faisant autorité du produit.",{},{"id":910,"data":911,"type":218,"tunes":913},"p-conclusion-2",{"text":912},"Cette séparation est utile au-delà de l'explication. Elle indique aux ingénieurs d'où proviennent les faits obsolètes, où se situe l'autorisation, pourquoi un runtime local peut encore utiliser l'inférence cloud, pourquoi le RAG n'équivaut pas à une base de données vectorielle, pourquoi les appels d'outils nécessitent une validation, et pourquoi changer le modèle ne peut pas réparer toutes les défaillances du système.",{},{"id":915,"data":916,"type":218,"tunes":918},"p-conclusion-3",{"text":917},"La question architecturale durable n'est donc pas « Quel modèle d'IA utilisons-nous ? » Elle est : Quelle responsabilité chaque composant possède-t-il, quelles preuves traversent chaque frontière, et quelle couche est autorisée à modifier l'état réel ?",{},{"id":920,"data":921,"type":42,"tunes":923},"h-faq",{"text":922,"level":240},"FAQ",{},{"id":925,"data":926,"type":925,"tunes":957},"faq",{"items":927,"title":956},[928,932,936,940,944,948,952],{"id":929,"answer":930,"question":931},"faq1","Non. Un LLM est un type de modèle génératif. L'IA générative inclut également d'autres modalités, et un système d'IA générative en production peut inclure la récupération, des outils, une logique de runtime, un état applicatif, des permissions, de la persistance et des interfaces utilisateur autour du modèle.","L'IA générative est-elle la même chose qu'un LLM ?",{"id":933,"answer":934,"question":935},"faq2","Généralement non. Le RAG est un modèle applicatif\u002Fsystème qui récupère des informations externes et fournit des preuves sélectionnées au modèle. Certaines plateformes intègrent étroitement la récupération aux API de modèles, mais la responsabilité reste distincte.","Le RAG fait-il partie du modèle ?",{"id":937,"answer":938,"question":939},"faq3","Non. Le RAG peut utiliser la recherche vectorielle, la recherche lexicale, la récupération hybride, SQL, des API, des graphes de connaissances ou d'autres méthodes. La propriété déterminante est la récupération d'informations externes pour la génération, et non une technologie de stockage particulière.","Une base de données vectorielle est-elle nécessaire pour le RAG ?",{"id":941,"answer":942,"question":943},"faq4","Non. Un outil est une capacité externe. Sa définition peut être représentée dans le contexte, et son résultat peut ensuite entrer dans le contexte, mais la capacité réelle s'exécute en dehors du modèle.","Les outils sont-ils la même chose que le contexte ?",{"id":945,"answer":946,"question":947},"faq5","Non. L'emplacement du runtime et l'emplacement de l'inférence sont distincts. Une application de bureau locale ou un agent peut appeler un modèle distant, tandis qu'une application distante peut appeler un modèle hébergé en interne.","Exécuter un client d'IA localement signifie-t-il que le modèle est local ?",{"id":949,"answer":950,"question":951},"faq6","La frontière de sécurité de l'application ou du runtime devrait appliquer l'autorisation. Un modèle peut demander une opération, mais l'intention du modèle ne devrait jamais être considérée comme une autorité d'exécution suffisante.","Qui devrait appliquer les permissions pour les outils d'IA ?",{"id":953,"answer":954,"question":955},"faq7","L'état volatil faisant autorité devrait normalement rester dans l'application ou le système de domaine qui le possède. L'IA peut recevoir l'état pertinent via un contexte contrôlé ou un accès par outil lorsque nécessaire.","Où doit résider l'état actuel de l'application ?","Frontières des systèmes d'IA générative",{},{"id":959,"data":960,"type":42,"tunes":962},"h-glossary",{"text":961,"level":240},"Glossaire",{},{"id":964,"data":965,"type":964,"tunes":989},"glossary",{"title":966,"entries":967},"Termes clés",[968,972,974,976,979,981,984,986],{"term":969,"anchor":970,"definition":971},"Modèle génératif","generative-model","Un modèle d'IA conçu pour générer du contenu synthétique dérivé tel que du texte, des images, de l'audio, de la vidéo, du code ou une sortie structurée.",{"term":328,"anchor":327,"definition":973},"Le processus de sélection d'informations pertinentes à partir d'une source ou d'un stockage externe pour la tâche en cours.",{"term":755,"anchor":562,"definition":975},"Retrieval-Augmented Generation : un modèle dans lequel des informations externes récupérées sont fournies à un modèle génératif pour améliorer la sortie en cours.",{"term":977,"anchor":566,"definition":978},"Outil","Une capacité exposée à un runtime d'IA pour lire des données, calculer, rechercher ou effectuer une action externe.",{"term":336,"anchor":335,"definition":980},"Les informations disponibles pour le modèle pour une étape d'inférence particulière.",{"term":340,"anchor":982,"definition":983},"runtime-orchestrator","La couche logicielle qui coordonne les appels de modèles, les appels d'outils, les boucles de tâches, les sessions, les tentatives, les événements ou les environnements d'exécution.",{"term":344,"anchor":343,"definition":985},"La couche produit et domaine qui possède l'interaction utilisateur, l'état faisant autorité, les permissions, la validation, la persistance et le comportement métier.",{"term":625,"anchor":987,"definition":988},"provider","Le service ou le runtime qui expose l'accès à un ou plusieurs modèles ; l'identité du fournisseur et l'identité du modèle sont des préoccupations distinctes.",{},{"id":991,"data":992,"type":42,"tunes":994},"h-sources",{"text":993,"level":240},"Sources primaires et preuves d'implémentation",{},{"id":996,"data":997,"type":218,"tunes":999},"p-sources-note",{"text":998},"Les définitions stables ci-dessous sont ancrées dans des normes et des recherches ; les exemples de mise en œuvre à évolution rapide s'appuient sur la documentation d'ingénierie officielle actuelle. Aaasaasa AI Client constitue une preuve de mise en œuvre originale et a été vérifié par rapport à l'état de sa base de code et de sa documentation daté du 26 juillet 2026.",{},{"id":1001,"data":1002,"type":1008,"tunes":1009},"src-nist-profile",{"link":1003,"meta":1004},"https:\u002F\u002Fnvlpubs.nist.gov\u002Fnistpubs\u002Fai\u002FNIST.AI.600-1.pdf",{"image":1005,"title":1006,"description":1007},{"url":325},"NIST AI 600-1 — Profil d'intelligence artificielle générative","Le profil d'IA générative du NIST, incluant la définition de l'IA générative et la distinction explicite entre les préoccupations au niveau du modèle, du système, de l'application et du cas d'usage.","linkTool",{},{"id":1011,"data":1012,"type":1008,"tunes":1018},"src-nist-model",{"link":1013,"meta":1014},"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_model",{"image":1015,"title":1016,"description":1017},{"url":325},"NIST — Modèle d'intelligence artificielle","Définition actuelle du glossaire du NIST d'un modèle d'IA comme composant d'un système d'information qui produit des sorties à partir d'entrées en utilisant des techniques d'IA.",{},{"id":1020,"data":1021,"type":1008,"tunes":1027},"src-nist-system",{"link":1022,"meta":1023},"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_system",{"image":1024,"title":1025,"description":1026},{"url":325},"NIST — Système d'intelligence artificielle","Définition actuelle du glossaire du NIST montrant qu'un système d'IA peut inclure des systèmes de données, des logiciels, du matériel, des applications, des outils ou des utilitaires utilisant l'IA.",{},{"id":1029,"data":1030,"type":1008,"tunes":1036},"src-rag-paper",{"link":1031,"meta":1032},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2005.11401",{"image":1033,"title":1034,"description":1035},{"url":325},"Lewis et al. — Génération augmentée par récupération pour les tâches de traitement du langage naturel à forte intensité de connaissances","L'article de 2020 introduisant la formulation RAG qui combine un modèle génératif avec une mémoire non paramétrique récupérée.",{},{"id":1038,"data":1039,"type":1008,"tunes":1045},"src-openai-file-search",{"link":1040,"meta":1041},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-file-search",{"image":1042,"title":1043,"description":1044},{"url":325},"OpenAI — Recherche de fichiers","Documentation officielle actuelle pour la récupération de fichiers hébergés dans l'API Responses à l'aide de bases de connaissances de fichiers téléversés, de la recherche sémantique et de la recherche par mots-clés.",{},{"id":1047,"data":1048,"type":1008,"tunes":1054},"src-openai-functions",{"link":1049,"meta":1050},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ffunction-calling",{"image":1051,"title":1052,"description":1053},{"url":325},"OpenAI — Appel de fonctions","Documentation officielle actuelle décrivant l'appel d'outils et de fonctions comme interface entre les modèles et les systèmes, données et actions externes.",{},{"id":1056,"data":1057,"type":1008,"tunes":1063},"src-anthropic-context",{"link":1058,"meta":1059},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents",{"image":1060,"title":1061,"description":1062},{"url":325},"Anthropic — Ingénierie de contexte efficace pour les agents d'IA","Conseils d'ingénierie définissant le contexte comme l'ensemble de jetons disponibles lors de l'échantillonnage d'un LLM et expliquant pourquoi la sélection du contexte est un problème de ressources finies.",{},"2.31","L'IA générative est plus qu'un modèle. Découvrez comment les modèles, la récupération, les outils, le contexte, les environnements d'exécution et les applications s'articulent dans les systèmes d'IA en production.","\u002Fuploads\u002F2026\u002F10\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing-1791475411822-pp0dvz.webp","generative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing-1791475411822-pp0dvz","PUBLISHED","2026-10-08T12:00:00.000Z","2026-10-08T16:00:39.350Z","2026-10-08T16:10:51.437Z",{"en":1073,"de":1074,"sr":1075,"es":1076,"fr":1077,"it":1078,"ru":1079,"zh":1080},"\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fde\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fsr\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fes\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Ffr\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fit\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fru\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fzh\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing",[1082,1086,1090,1094,1098],{"id":1083,"name":1084,"slug":1085},84,"Politique et limites des données","policy-and-data",{"id":1087,"name":1088,"slug":1089},57,"Limites des données","data-boundaries",{"id":1091,"name":1092,"slug":1093},80,"Accès et identité","access-and-identity",{"id":1095,"name":1096,"slug":1097},68,"Risques, contrôles et preuves","risks-and-controls",{"id":1099,"name":1100,"slug":1101},54,"Modèle de menaces","threat-model",{"id":1103,"login":1104,"email":1105,"displayName":1106},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[1108,1806],{"lang":1109,"title":1110,"content":1111,"contentJson":1112,"excerpt":1805},"en","Generative AI Explained: Models, Retrieval, Tools and Applications Are Not the Same Thing","{\"time\":1791475413504,\"blocks\":[{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Generative AI is not one component. A production generative AI system usually combines a generative model with application code that supplies instructions and context, retrieves external knowledge when needed, exposes tools for reading or changing external systems, manages runtime state and permissions, and turns the result into a usable product. Treating the model, retrieval, tools, context, runtime, and application as the same thing hides the boundaries that determine freshness, security, reliability, cost, and control.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"\u003Cstrong>The model generates; retrieval finds external evidence; tools access data or perform actions; context is what the model can see for the current inference; the runtime coordinates execution; the application owns product rules, state, permissions, persistence, and user experience.\u003C\u002Fstrong> These layers can be packaged together by a vendor, but their responsibilities remain different.\"},\"tunes\":{}},{\"id\":\"scope-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"Terminology and version note\",\"body\":\"This article defines durable architectural responsibilities rather than one vendor stack. Current implementation examples were re-checked on \u003Cstrong>8 October 2026\u003C\u002Fstrong>. Vendor APIs and product names can change; the responsibility boundaries are more stable than any individual SDK or endpoint.\"},\"tunes\":{}},{\"id\":\"toc\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"h-meaning\",\"type\":\"header\",\"data\":{\"text\":\"What does “generative AI” actually mean?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-meaning-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"At the model level, generative AI refers to AI models that generate derived synthetic content such as text, images, audio, video, code, or other digital output. NIST AI 600-1 uses this model-oriented meaning and separately discusses risks at model, system, application, and use-case levels.\"},\"tunes\":{}},{\"id\":\"p-meaning-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That distinction matters because an AI model is not the same thing as the complete AI system. NIST's current glossary defines an AI model as a component that produces outputs from inputs using computational, statistical, or machine-learning techniques, while an AI system can include software, hardware, applications, tools, or utilities that operate using AI.\"},\"tunes\":{}},{\"id\":\"model-system-rule\",\"type\":\"callout\",\"data\":{\"variant\":\"success\",\"title\":\"A useful boundary\",\"body\":\"\u003Cstrong>Generative model ≠ generative AI application.\u003C\u002Fstrong>\u003Cbr>A model is one computational component. A usable AI product is a system built around that component.\"},\"tunes\":{}},{\"id\":\"h-simple\",\"type\":\"header\",\"data\":{\"text\":\"The simplest useful model of a generative AI system\",\"level\":2},\"tunes\":{}},{\"id\":\"p-simple-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"For a first mental model, imagine a company assistant answering: “Can this customer receive a refund today?” A useful answer may require several different responsibilities. The language model can interpret the question and write the explanation, but the current order state may come from a database tool, the refund policy may come from document retrieval, permissions may be enforced by the application, and the final action may require a controlled API call.\"},\"tunes\":{}},{\"id\":\"simple-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"One common execution path\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. User request\",\"description\":\"The application receives a natural-language question or task.\"},{\"label\":\"2. Application policy and state\",\"description\":\"Identity, tenant, permissions, current workflow state, and product rules define what the request is allowed to do.\"},{\"label\":\"3. Retrieval or direct data access\",\"description\":\"The system obtains external evidence or current facts when model knowledge is insufficient.\"},{\"label\":\"4. Context construction\",\"description\":\"Instructions, user input, selected evidence, relevant state, and tool definitions are assembled for the model.\"},{\"label\":\"5. Model inference\",\"description\":\"The generative model interprets the supplied context and produces text, structured output, or a tool request.\"},{\"label\":\"6. Tool execution when needed\",\"description\":\"The runtime or application validates and executes approved tool calls outside the model.\"},{\"label\":\"7. Observation and continuation\",\"description\":\"Tool results can return to the model as new context for another inference step.\"},{\"label\":\"8. Validation and product output\",\"description\":\"The application validates the result, records required state or audit data, and presents or executes the final outcome.\"}]},\"tunes\":{}},{\"id\":\"p-simple-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Real systems do not always follow this sequence exactly. Retrieval can happen before the first model call, tools can be selected during an agent loop, deterministic application logic can bypass the model entirely, and validation can occur at several stages. The point is to separate responsibilities, not to impose one universal workflow.\"},\"tunes\":{}},{\"id\":\"h-boundaries\",\"type\":\"header\",\"data\":{\"text\":\"The six boundaries that matter\",\"level\":2},\"tunes\":{}},{\"id\":\"boundary-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Six responsibilities inside one AI product\",\"layout\":\"table\",\"columns\":[{\"id\":\"job\",\"label\":\"Primary job\"},{\"id\":\"input\",\"label\":\"Typical inputs\"},{\"id\":\"not\",\"label\":\"Not the same as\"}],\"rows\":[{\"id\":\"model\",\"label\":\"Model\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"retrieval\",\"label\":\"Retrieval\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"tools\",\"label\":\"Tools\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"context\",\"label\":\"Context\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"runtime\",\"label\":\"Runtime \u002F orchestrator\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"application\",\"label\":\"Application\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-model\",\"type\":\"header\",\"data\":{\"text\":\"1. The model: generation is its core responsibility\",\"level\":2},\"tunes\":{}},{\"id\":\"p-model-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A generative model maps supplied inputs to generated outputs. For a language model, that can include natural-language text, structured JSON, code, classifications, summaries, plans, or tool-call arguments. Multimodal generative models can work with additional input and output types.\"},\"tunes\":{}},{\"id\":\"p-model-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The model can contain substantial learned knowledge in its parameters, but parameterized knowledge is not a live database. The model does not automatically know a document created five minutes ago, the current stock level, a private customer record, or the state of an application unless that information is supplied through the current input path.\"},\"tunes\":{}},{\"id\":\"p-model-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is why changing the model does not automatically solve stale knowledge, missing permissions, broken retrieval, incorrect state ownership, or unsafe tool execution. Those failures often belong to other layers.\"},\"tunes\":{}},{\"id\":\"h-retrieval\",\"type\":\"header\",\"data\":{\"text\":\"2. Retrieval: finding external evidence is a separate operation\",\"level\":2},\"tunes\":{}},{\"id\":\"p-retrieval-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval selects information from an external source before or during generation. The 2020 Retrieval-Augmented Generation work by Lewis et al. made the separation explicit by combining a parametric generative model with retrieved non-parametric memory. Modern production systems use many retrieval variants, but the architectural idea remains: useful evidence can be fetched at inference time instead of relying only on what the model learned during training.\"},\"tunes\":{}},{\"id\":\"p-retrieval-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval can use lexical search, embeddings, vector search, hybrid search, SQL, knowledge graphs, metadata filters, APIs, or other selection mechanisms. A vector database is therefore one possible retrieval component, not the definition of RAG.\"},\"tunes\":{}},{\"id\":\"retrieval-rule\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Relevance is not authority\",\"body\":\"A retrieved passage can be highly relevant and still be stale, unauthorized, from the wrong version, or insufficient to support a claim. Retrieval quality and evidence quality must be evaluated separately.\"},\"tunes\":{}},{\"id\":\"ref-rag\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works\",\"title\":\"What Is RAG? The Simplest Explanation of How It Works\",\"excerpt\":\"The canonical plain-English explanation of retrieval-augmented generation, including the separation between LLM, knowledge, state, memory and tools.\",\"ctaLabel\":\"Read the RAG foundation\"},\"tunes\":{}},{\"id\":\"h-tools\",\"type\":\"header\",\"data\":{\"text\":\"3. Tools: access and action are not model knowledge\",\"level\":2},\"tunes\":{}},{\"id\":\"p-tools-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A tool is an interface through which an AI runtime can request functionality outside the model. A tool can query a database, search the web, read a file, calculate a value, call an internal service, create a ticket, send a message, modify a record, or trigger another controlled operation.\"},\"tunes\":{}},{\"id\":\"p-tools-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current function-calling documentation makes this boundary explicit: function calling lets models interface with external systems and access data or actions provided by the application. The model can propose or select a call, but the external system performs the real operation.\"},\"tunes\":{}},{\"id\":\"p-tools-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Tool use therefore creates two separate questions: Can the model request this capability? and Will the application authorize and execute it? A production system should not confuse model intent with permission to cause a side effect.\"},\"tunes\":{}},{\"id\":\"tool-rule\",\"type\":\"callout\",\"data\":{\"variant\":\"success\",\"title\":\"Model intent is not execution authority\",\"body\":\"A model can emit a valid tool request and still be denied. Authorization, argument validation, rate limits, transaction rules, audit requirements, and rollback belong outside the model.\"},\"tunes\":{}},{\"id\":\"h-context\",\"type\":\"header\",\"data\":{\"text\":\"4. Context: what the model can see right now\",\"level\":2},\"tunes\":{}},{\"id\":\"p-context-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Context is the information available to the model for a particular inference step. Anthropic's context-engineering guidance describes context as the set of tokens included when sampling from an LLM. In practice, that set can contain system instructions, user messages, conversation history, retrieved evidence, tool definitions, tool results, memory summaries, and selected application state.\"},\"tunes\":{}},{\"id\":\"p-context-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Context is therefore neither the complete knowledge base nor long-term memory. A company may store ten million documents while only a handful of passages enter one model call. A runtime may persist a year of conversation history while exposing only the pieces needed for the current task.\"},\"tunes\":{}},{\"id\":\"p-context-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The context window also creates an engineering constraint. Adding more text does not guarantee a better answer; irrelevant, stale, contradictory, or low-authority information can dilute the evidence that actually matters.\"},\"tunes\":{}},{\"id\":\"h-runtime\",\"type\":\"header\",\"data\":{\"text\":\"5. Runtime and orchestration: coordinating the loop\",\"level\":2},\"tunes\":{}},{\"id\":\"p-runtime-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The runtime or orchestration layer coordinates how the model participates in a task. Depending on the architecture, it can manage sessions, model requests, tool discovery, tool-call loops, retries, handoffs, streaming events, timeouts, checkpoints, compaction, or execution environments.\"},\"tunes\":{}},{\"id\":\"p-runtime-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Some runtimes are thin application code around a model API. Others are full agent harnesses. A managed vendor runtime can own part of the loop while the application still owns domain truth, authorization, business side effects, and product lifecycle.\"},\"tunes\":{}},{\"id\":\"p-runtime-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"This boundary is important because where the runtime runs and where inference runs are separate decisions. A locally running client or agent process can still call a remote model, while a remote application can call a model hosted on infrastructure under the organization's control.\"},\"tunes\":{}},{\"id\":\"h-application\",\"type\":\"header\",\"data\":{\"text\":\"6. The application: where AI becomes a product\",\"level\":2},\"tunes\":{}},{\"id\":\"p-app-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The application is the product boundary around the AI components. It owns the user experience, domain model, current state, identity, tenant scope, permissions, persistence, service integrations, validation, observability, billing or quota logic where relevant, and the rules that determine what the AI is allowed to see or do.\"},\"tunes\":{}},{\"id\":\"p-app-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is the layer that turns “a model can produce useful output” into “a system can deliver a reliable capability.” The same model can participate in a private research assistant, a support workflow, a code agent, or a commerce application because the surrounding application changes the data, tools, policies, state, and execution contract.\"},\"tunes\":{}},{\"id\":\"app-rule\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"The model is replaceable; the product boundary is not\",\"body\":\"Provider and model substitution can be an architectural goal. The application's authoritative state, permissions, domain rules, audit trail, and user contract cannot simply be delegated to whichever model is currently selected.\"},\"tunes\":{}},{\"id\":\"h-work-together\",\"type\":\"header\",\"data\":{\"text\":\"How the parts work together in a real request\",\"level\":2},\"tunes\":{}},{\"id\":\"p-together-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Consider a support assistant asked: “Refund order 4711 if it is still eligible, and explain why.” The request combines knowledge, current state, authorization, reasoning, and a side effect.\"},\"tunes\":{}},{\"id\":\"support-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Need\",\"Correct layer\",\"Why\"],[\"Refund policy\",\"Retrieval\",\"The system must find the current applicable policy and preserve its provenance.\"],[\"Order 4711 status\",\"Direct data\u002Ftool access\",\"The current order record is volatile authoritative state, not something to guess from model knowledge.\"],[\"User's authority to refund\",\"Application \u002F authorization\",\"Permissions must be enforced independently of what the model asks for.\"],[\"Interpret policy against order facts\",\"Model + context\",\"The model can reason over the policy evidence and current order state supplied to it.\"],[\"Execute refund\",\"Tool + application transaction rules\",\"A controlled external operation changes real state.\"],[\"Explain outcome\",\"Model\",\"The model can generate the user-facing explanation from validated results.\"],[\"Audit what happened\",\"Application \u002F runtime\",\"The system records evidence, calls, decisions, side effects, and errors as required.\"]]},\"tunes\":{}},{\"id\":\"p-together-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"If the assistant only has the language model, it can discuss refunds but cannot safely know whether order 4711 is currently eligible or perform the transaction. If it only has retrieval, it may find the policy but still lack live order state. If it has tools without application authorization, it may become capable but unsafe. Reliability comes from composing the layers with explicit ownership.\"},\"tunes\":{}},{\"id\":\"h-configs\",\"type\":\"header\",\"data\":{\"text\":\"Different AI products use different combinations\",\"level\":2},\"tunes\":{}},{\"id\":\"config-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"The presence of a model does not define the whole architecture\",\"layout\":\"table\",\"columns\":[{\"id\":\"retrieval\",\"label\":\"Retrieval\"},{\"id\":\"tools\",\"label\":\"Tools\"},{\"id\":\"state\",\"label\":\"Authoritative state\"},{\"id\":\"result\",\"label\":\"Typical capability\"}],\"rows\":[{\"id\":\"bare\",\"label\":\"Model-only assistant\",\"values\":[\"\",\"\",\"\",\"\"]},{\"id\":\"rag\",\"label\":\"Retrieval-grounded assistant\",\"values\":[\"\",\"\",\"\",\"\"]},{\"id\":\"tool\",\"label\":\"Tool-using assistant\",\"values\":[\"\",\"\",\"\",\"\"]},{\"id\":\"agent\",\"label\":\"Agentic application\",\"values\":[\"\",\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"p-configs-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"These are architecture patterns, not maturity rankings. A model-only feature can be the correct design when the task needs no external facts or actions. Adding retrieval, tools, memory, or an agent loop is justified only when the task requires those capabilities.\"},\"tunes\":{}},{\"id\":\"h-implementation\",\"type\":\"header\",\"data\":{\"text\":\"Implementation evidence: Aaasaasa AI Client\",\"level\":2},\"tunes\":{}},{\"id\":\"implementation-scope\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"Primary implementation evidence\",\"body\":\"The following section describes an implementation I built and reviewed against the Aaasaasa AI Client codebase and architecture documentation as of \u003Cstrong>26 July 2026\u003C\u002Fstrong>. It is evidence for the usefulness of these boundaries, not a claim that one implementation is a universal standard or a commercially deployed enterprise product.\"},\"tunes\":{}},{\"id\":\"p-impl-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Aaasaasa AI Client is a local-first desktop AI workspace built with Nuxt 4, Electron and TypeScript. Its AI Hub deliberately separates agent\u002Fclient, provider, model, runtime location, permissions, and web client instead of treating them as one “AI” setting.\"},\"tunes\":{}},{\"id\":\"p-impl-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That separation creates concrete behavior. Direct Chat can talk to models without filesystem or shell tools. A Codex agent can use a selected workspace and permission profile. Ollama can provide direct local inference, while LM Studio and configurable OpenAI-compatible endpoints represent other provider paths. A locally running Codex process can still use a cloud model, so the UI and architecture do not equate local runtime with local inference.\"},\"tunes\":{}},{\"id\":\"p-impl-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The implementation also contains Qdrant\u002Fvector support, document-extraction capabilities and an authenticated directory MCP broker. Those components illustrate another boundary: retrieval infrastructure and tool access can live in the same product without becoming properties of the model itself.\"},\"tunes\":{}},{\"id\":\"impl-map\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"A01 concept\",\"Aaasaasa AI Client implementation evidence\"],[\"Model\",\"A provider-specific model identifier is selected separately from provider and runtime.\"],[\"Provider\",\"Ollama, LM Studio, OpenAI-compatible services and other provider paths are represented separately.\"],[\"Runtime\",\"Local or remote agent\u002Fruntime location is tracked independently of the model.\"],[\"Tools \u002F access\",\"Direct Chat has no filesystem or shell tools; controlled directory access is brokered separately.\"],[\"Permissions\",\"Workspace permission profiles are application\u002Fsession policy, not model capability.\"],[\"Retrieval infrastructure\",\"Vector support and document extraction exist as data\u002Fretrieval capabilities rather than model features.\"],[\"Application\",\"The Electron\u002FNuxt product coordinates UI, credentials, providers, runtime discovery, permissions, tools and model interaction.\"]]},\"tunes\":{}},{\"id\":\"impl-lesson\",\"type\":\"callout\",\"data\":{\"variant\":\"success\",\"title\":\"Implementation lesson\",\"body\":\"The architecture became easier to reason about once \u003Cstrong>model, provider, runtime, permissions, tools, data and client\u003C\u002Fstrong> stopped being represented as one configuration choice. The distinction is operational: it determines what can run locally, what can access files, what may call paid cloud inference, and which layer owns authorization.\"},\"tunes\":{}},{\"id\":\"h-errors\",\"type\":\"header\",\"data\":{\"text\":\"Common category errors\",\"level\":2},\"tunes\":{}},{\"id\":\"errors-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Category error\",\"What is actually happening\"],[\"“The AI knows our documents.”\",\"The application or retrieval layer makes selected document content available to the model.\"],[\"“RAG is our vector database.”\",\"The vector database can be one index or store used by a retrieval pipeline; RAG is the retrieval-plus-generation pattern.\"],[\"“The model called our CRM.”\",\"The model produced a tool request; the runtime\u002Fapplication authorized and executed the external call.\"],[\"“It is local AI because the desktop agent runs locally.”\",\"Runtime location and inference location are separate. A local runtime can still invoke a remote model.\"],[\"“The model has permission to edit files.”\",\"The application\u002Fruntime grants a tool capability under a permission policy; permission is not an intrinsic model property.\"],[\"“More context means more knowledge.”\",\"Context is the finite input made available for one inference. Larger context can contain more noise, conflict or stale information.\"],[\"“The chatbot is the AI architecture.”\",\"The chat UI is one interface. The system can also include identity, state, retrieval, tools, runtime, validation, persistence and observability.\"]]},\"tunes\":{}},{\"id\":\"h-failures\",\"type\":\"header\",\"data\":{\"text\":\"Failure modes when the boundaries collapse\",\"level\":2},\"tunes\":{}},{\"id\":\"p-failure-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Boundary mistakes are not merely terminology problems. They create distinct production failures that require different fixes.\"},\"tunes\":{}},{\"id\":\"failure-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Diagnose the failing layer before replacing the model\",\"layout\":\"table\",\"columns\":[{\"id\":\"symptom\",\"label\":\"Symptom\"},{\"id\":\"likely\",\"label\":\"Likely boundary problem\"},{\"id\":\"fix\",\"label\":\"First architectural check\"}],\"rows\":[{\"id\":\"stale\",\"label\":\"Stale answer\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"missing\",\"label\":\"Missing company fact\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"unsafe\",\"label\":\"Unsafe side effect\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"noise\",\"label\":\"Confused answer with lots of supplied text\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"route\",\"label\":\"Unexpected cloud use\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"loop\",\"label\":\"Agent stalls or repeats\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-version\",\"type\":\"header\",\"data\":{\"text\":\"What is stable and what is version-sensitive?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-version-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The architectural distinctions in this article are intentionally vendor-neutral. The current examples below are implementation facts that should be re-checked when APIs evolve.\"},\"tunes\":{}},{\"id\":\"version-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Area\",\"Stable architectural idea\",\"Verified current example on 8 Oct 2026\"],[\"AI model vs system\",\"A model is a component inside a broader system\",\"NIST's current glossary separately defines AI model and AI system.\"],[\"RAG\",\"Generation can be conditioned on retrieved external information\",\"The Lewis et al. 2020 formulation remains the foundational reference; production retrieval methods now extend far beyond one dense index design.\"],[\"Hosted retrieval\",\"Retrieval can be exposed as a managed tool\",\"OpenAI File Search is currently a Responses API tool that searches uploaded-file knowledge bases using semantic and keyword retrieval.\"],[\"Function\u002Ftool calling\",\"A model can request application-defined external capabilities\",\"OpenAI currently documents function calling as an interface to external systems, data and actions.\"],[\"Context engineering\",\"Model behavior depends on the finite information supplied for the current inference\",\"Anthropic's current engineering guidance defines context as the token set included when sampling from the LLM and focuses on curating that set.\"],[\"Vendor APIs\",\"SDKs, tool names, endpoint shapes and supported features change\",\"Treat vendor documentation as version-sensitive even when the responsibility boundary remains stable.\"]]},\"tunes\":{}},{\"id\":\"p-version-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"A source-of-truth article should therefore preserve both levels: stable concepts for architecture, and dated evidence for current implementations. Mixing the two makes an article age unnecessarily fast.\"},\"tunes\":{}},{\"id\":\"h-test\",\"type\":\"header\",\"data\":{\"text\":\"The AI component-boundary test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-test-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"When evaluating an AI feature, ask the following questions in order. The answers reveal which components the system actually has and which responsibilities are still implicit.\"},\"tunes\":{}},{\"id\":\"boundary-test\",\"type\":\"processFlow\",\"data\":{\"title\":\"Seven questions for a production design\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. What generates the output?\",\"description\":\"Identify the exact model and the modalities or structured outputs it provides.\"},{\"label\":\"2. What facts are authoritative outside the model?\",\"description\":\"Identify documents, databases, APIs, current state and other sources of truth.\"},{\"label\":\"3. How is relevant information selected?\",\"description\":\"Separate direct lookup, search, retrieval, ranking and context construction.\"},{\"label\":\"4. What can cause real side effects?\",\"description\":\"List tools and external actions, then identify who validates and authorizes them.\"},{\"label\":\"5. What reaches the model as context?\",\"description\":\"Make instructions, evidence, state, history, memory and tool definitions explicit.\"},{\"label\":\"6. Who owns the loop?\",\"description\":\"Identify the runtime or harness that manages calls, events, retries, tool loops and sessions.\"},{\"label\":\"7. What remains the application's responsibility?\",\"description\":\"Make identity, permissions, domain state, validation, persistence, observability and UX explicit.\"}]},\"tunes\":{}},{\"id\":\"h-not\",\"type\":\"header\",\"data\":{\"text\":\"What generative AI is not\",\"level\":2},\"tunes\":{}},{\"id\":\"p-not-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Generative AI is not synonymous with an LLM, even though LLMs are a major class of generative model. It is also not synonymous with RAG, a vector database, an agent, a tool protocol, a chatbot UI, or an application.\"},\"tunes\":{}},{\"id\":\"p-not-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Those concepts can be connected, but each answers a different architectural question. An LLM asks how language output is produced. Retrieval asks where external evidence comes from. Tools ask how external capabilities are exposed. Context asks what the model can see. Runtime asks how execution is coordinated. The application asks how the capability becomes a controlled product.\"},\"tunes\":{}},{\"id\":\"remember\",\"type\":\"callout\",\"data\":{\"variant\":\"success\",\"title\":\"If you remember only one model\",\"body\":\"\u003Cstrong>Model = generate.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Retrieval = find evidence.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Tools = read or act outside the model.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Context = what the model sees now.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Runtime = coordinate execution.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Application = own the product, state, rules and permissions.\u003C\u002Fstrong>\"},\"tunes\":{}},{\"id\":\"h-next\",\"type\":\"header\",\"data\":{\"text\":\"Where to go next in the knowledge graph\",\"level\":2},\"tunes\":{}},{\"id\":\"p-next-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Once these boundaries are clear, deeper topics become easier to place. RAG belongs in retrieval and context construction. Retrieval Trigger decides when external evidence is required. Agent memory concerns what persists across time. Tool calling and MCP belong to capability access. Agent harnesses belong to runtime orchestration. RBAC, tenant isolation and domain authorization belong to the application and platform security boundary.\"},\"tunes\":{}},{\"id\":\"ref-data\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhere-does-an-llm-get-its-data-rag-data-sources-in-python\",\"title\":\"Where Does an LLM Get Its Data? RAG Data Sources in Python\",\"excerpt\":\"A practical continuation showing how files, SQL, APIs, full-text search, embeddings and context assembly connect external data to an LLM.\",\"ctaLabel\":\"See the data path in code\"},\"tunes\":{}},{\"id\":\"ref-trigger\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger\",\"title\":\"When Should an AI Stop Trusting Its Own Knowledge? — The Retrieval Trigger\",\"excerpt\":\"A decision model for when an AI system should stop relying only on model knowledge and obtain external evidence.\",\"ctaLabel\":\"Read the retrieval decision model\"},\"tunes\":{}},{\"id\":\"h-limit\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The six-layer model is a responsibility map, not a requirement that every product deploy six separate services. A small application may implement context construction, retrieval and orchestration inside one process. A managed platform may bundle several responsibilities behind one API. Physical deployment can be combined while semantic ownership remains distinct.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Terminology also varies across vendors and research. “Agent,” “runtime,” “memory,” “tool,” “connector,” and “context” can be defined differently. The definitions here are chosen to make operational ownership and failure diagnosis explicit rather than to claim that every framework uses identical vocabulary.\"},\"tunes\":{}},{\"id\":\"p-limit-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The Aaasaasa AI Client section documents one implementation pattern. It demonstrates that explicit boundaries are practical, but it does not prove that the same component layout is optimal for every AI product.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The responsibility map would need revision if model architectures themselves began to own authoritative external state, permissions, durable transactional side effects, and verifiable source access as intrinsic properties rather than capabilities supplied by a surrounding system. Current production architectures do not make that a safe general assumption.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Individual implementation examples will change much sooner. Hosted retrieval tools, agent APIs, MCP integrations, context-management features and provider capabilities evolve quickly. Those details should be updated without collapsing the underlying distinctions between generation, evidence, capability access, context, execution and application control.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Generative AI becomes easier to design once “the AI” stops being treated as one black box. The model is the generative component, not the complete product. Retrieval provides external evidence. Tools expose capabilities. Context carries selected information into the current inference. The runtime coordinates execution. The application owns the authoritative product boundary.\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That separation is useful for more than explanation. It tells engineers where stale facts originate, where authorization belongs, why a local runtime can still use cloud inference, why RAG does not equal a vector database, why tool calls require validation, and why changing the model cannot repair every system failure.\"},\"tunes\":{}},{\"id\":\"p-conclusion-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The durable architecture question is therefore not “Which AI model are we using?” It is: Which responsibility does each component own, what evidence crosses each boundary, and which layer is allowed to change real state?\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Generative AI system boundaries\",\"items\":[{\"id\":\"faq1\",\"question\":\"Is generative AI the same as an LLM?\",\"answer\":\"No. An LLM is one type of generative model. Generative AI also includes other modalities, and a production generative AI system can include retrieval, tools, runtime logic, application state, permissions, persistence and user interfaces around the model.\"},{\"id\":\"faq2\",\"question\":\"Is RAG part of the model?\",\"answer\":\"Usually no. RAG is an application\u002Fsystem pattern that retrieves external information and supplies selected evidence to the model. Some platforms package retrieval tightly with model APIs, but the responsibility remains distinct.\"},{\"id\":\"faq3\",\"question\":\"Is a vector database required for RAG?\",\"answer\":\"No. RAG can use vector search, lexical search, hybrid retrieval, SQL, APIs, knowledge graphs or other methods. The defining property is retrieval of external information for generation, not one storage technology.\"},{\"id\":\"faq4\",\"question\":\"Are tools the same as context?\",\"answer\":\"No. A tool is an external capability. Its definition may be represented in context, and its result may later enter context, but the actual capability executes outside the model.\"},{\"id\":\"faq5\",\"question\":\"Does running an AI client locally mean the model is local?\",\"answer\":\"No. Runtime location and inference location are separate. A local desktop application or agent can call a remote model, while a remote application can call an internally hosted model.\"},{\"id\":\"faq6\",\"question\":\"Who should enforce permissions for AI tools?\",\"answer\":\"The application or runtime security boundary should enforce authorization. A model can request an operation, but model intent should never be treated as sufficient execution authority.\"},{\"id\":\"faq7\",\"question\":\"Where does current application state belong?\",\"answer\":\"Authoritative volatile state should normally remain in the application or domain system that owns it. The AI can receive the relevant state through controlled context or tool access when needed.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Core terms\",\"entries\":[{\"term\":\"Generative model\",\"definition\":\"An AI model designed to generate derived synthetic content such as text, images, audio, video, code or structured output.\",\"anchor\":\"generative-model\"},{\"term\":\"Retrieval\",\"definition\":\"The process of selecting relevant information from an external source or store for the current task.\",\"anchor\":\"retrieval\"},{\"term\":\"RAG\",\"definition\":\"Retrieval-Augmented Generation: a pattern in which retrieved external information is supplied to a generative model to improve the current output.\",\"anchor\":\"rag\"},{\"term\":\"Tool\",\"definition\":\"A capability exposed to an AI runtime for reading data, calculating, searching, or performing an external action.\",\"anchor\":\"tool\"},{\"term\":\"Context\",\"definition\":\"The information available to the model for a particular inference step.\",\"anchor\":\"context\"},{\"term\":\"Runtime \u002F orchestrator\",\"definition\":\"The software layer that coordinates model calls, tool calls, task loops, sessions, retries, events or execution environments.\",\"anchor\":\"runtime-orchestrator\"},{\"term\":\"Application\",\"definition\":\"The product and domain layer that owns user interaction, authoritative state, permissions, validation, persistence and business behavior.\",\"anchor\":\"application\"},{\"term\":\"Provider\",\"definition\":\"The service or runtime that exposes access to one or more models; provider identity and model identity are separate concerns.\",\"anchor\":\"provider\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and implementation evidence\",\"level\":2},\"tunes\":{}},{\"id\":\"p-sources-note\",\"type\":\"paragraph\",\"data\":{\"text\":\"Stable definitions below are anchored in standards\u002Fresearch; fast-moving implementation examples use current official engineering documentation. Aaasaasa AI Client is original implementation evidence and was checked against its codebase\u002Fdocumentation state dated 26 July 2026.\"},\"tunes\":{}},{\"id\":\"src-nist-profile\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fnvlpubs.nist.gov\u002Fnistpubs\u002Fai\u002FNIST.AI.600-1.pdf\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"NIST AI 600-1 — Generative Artificial Intelligence Profile\",\"description\":\"NIST's Generative AI profile, including the generative-AI definition and explicit distinction between model-, system-, application- and use-case-level concerns.\"}},\"tunes\":{}},{\"id\":\"src-nist-model\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_model\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"NIST — Artificial Intelligence Model\",\"description\":\"Current NIST glossary definition of an AI model as a component of an information system that produces outputs from inputs using AI techniques.\"}},\"tunes\":{}},{\"id\":\"src-nist-system\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_system\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"NIST — Artificial Intelligence System\",\"description\":\"Current NIST glossary definition showing that an AI system can include data systems, software, hardware, applications, tools or utilities using AI.\"}},\"tunes\":{}},{\"id\":\"src-rag-paper\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2005.11401\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Lewis et al. — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks\",\"description\":\"The 2020 paper introducing the RAG formulation that combines a generative model with retrieved non-parametric memory.\"}},\"tunes\":{}},{\"id\":\"src-openai-file-search\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-file-search\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — File Search\",\"description\":\"Current official documentation for hosted file retrieval in the Responses API using uploaded-file knowledge bases, semantic search and keyword search.\"}},\"tunes\":{}},{\"id\":\"src-openai-functions\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ffunction-calling\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Function Calling\",\"description\":\"Current official documentation describing tool\u002Ffunction calling as the interface between models and external systems, data and actions.\"}},\"tunes\":{}},{\"id\":\"src-anthropic-context\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Effective Context Engineering for AI Agents\",\"description\":\"Engineering guidance defining context as the token set available during LLM sampling and explaining why context selection is a finite-resource problem.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":1113,"blocks":1114,"version":1804},1791475413504,[1115,1119,1124,1129,1133,1137,1141,1145,1150,1154,1158,1187,1191,1195,1224,1228,1232,1236,1240,1244,1248,1252,1257,1264,1268,1272,1276,1280,1285,1289,1293,1297,1301,1305,1309,1313,1317,1321,1325,1329,1334,1338,1342,1375,1379,1383,1407,1411,1415,1420,1424,1428,1432,1457,1462,1466,1494,1498,1502,1532,1536,1540,1571,1575,1579,1583,1609,1613,1617,1621,1626,1630,1634,1641,1648,1652,1656,1660,1664,1668,1672,1676,1679,1683,1687,1691,1694,1720,1724,1747,1751,1755,1762,1769,1776,1783,1790,1797],{"id":215,"data":1116,"type":218,"tunes":1118},{"text":1117},"Generative AI is not one component. A production generative AI system usually combines a generative model with application code that supplies instructions and context, retrieves external knowledge when needed, exposes tools for reading or changing external systems, manages runtime state and permissions, and turns the result into a usable product. Treating the model, retrieval, tools, context, runtime, and application as the same thing hides the boundaries that determine freshness, security, reliability, cost, and control.",{},{"id":221,"data":1120,"type":226,"tunes":1123},{"body":1121,"title":1122,"variant":225},"\u003Cstrong>The model generates; retrieval finds external evidence; tools access data or perform actions; context is what the model can see for the current inference; the runtime coordinates execution; the application owns product rules, state, permissions, persistence, and user experience.\u003C\u002Fstrong> These layers can be packaged together by a vendor, but their responsibilities remain different.","Direct answer",{},{"id":229,"data":1125,"type":226,"tunes":1128},{"body":1126,"title":1127,"variant":233},"This article defines durable architectural responsibilities rather than one vendor stack. Current implementation examples were re-checked on \u003Cstrong>8 October 2026\u003C\u002Fstrong>. Vendor APIs and product names can change; the responsibility boundaries are more stable than any individual SDK or endpoint.","Terminology and version note",{},{"id":236,"data":1130,"type":241,"tunes":1132},{"title":1131,"maxLevel":239,"minLevel":240},"Contents",{},{"id":244,"data":1134,"type":42,"tunes":1136},{"text":1135,"level":240},"What does “generative AI” actually mean?",{},{"id":249,"data":1138,"type":218,"tunes":1140},{"text":1139},"At the model level, generative AI refers to AI models that generate derived synthetic content such as text, images, audio, video, code, or other digital output. NIST AI 600-1 uses this model-oriented meaning and separately discusses risks at model, system, application, and use-case levels.",{},{"id":254,"data":1142,"type":218,"tunes":1144},{"text":1143},"That distinction matters because an AI model is not the same thing as the complete AI system. NIST's current glossary defines an AI model as a component that produces outputs from inputs using computational, statistical, or machine-learning techniques, while an AI system can include software, hardware, applications, tools, or utilities that operate using AI.",{},{"id":259,"data":1146,"type":226,"tunes":1149},{"body":1147,"title":1148,"variant":263},"\u003Cstrong>Generative model ≠ generative AI application.\u003C\u002Fstrong>\u003Cbr>A model is one computational component. A usable AI product is a system built around that component.","A useful boundary",{},{"id":266,"data":1151,"type":42,"tunes":1153},{"text":1152,"level":240},"The simplest useful model of a generative AI system",{},{"id":271,"data":1155,"type":218,"tunes":1157},{"text":1156},"For a first mental model, imagine a company assistant answering: “Can this customer receive a refund today?” A useful answer may require several different responsibilities. The language model can interpret the question and write the explanation, but the current order state may come from a database tool, the refund policy may come from document retrieval, permissions may be enforced by the application, and the final action may require a controlled API call.",{},{"id":276,"data":1159,"type":305,"tunes":1186},{"steps":1160,"title":1185,"orientation":304},[1161,1164,1167,1170,1173,1176,1179,1182],{"label":1162,"description":1163},"1. User request","The application receives a natural-language question or task.",{"label":1165,"description":1166},"2. Application policy and state","Identity, tenant, permissions, current workflow state, and product rules define what the request is allowed to do.",{"label":1168,"description":1169},"3. Retrieval or direct data access","The system obtains external evidence or current facts when model knowledge is insufficient.",{"label":1171,"description":1172},"4. Context construction","Instructions, user input, selected evidence, relevant state, and tool definitions are assembled for the model.",{"label":1174,"description":1175},"5. Model inference","The generative model interprets the supplied context and produces text, structured output, or a tool request.",{"label":1177,"description":1178},"6. Tool execution when needed","The runtime or application validates and executes approved tool calls outside the model.",{"label":1180,"description":1181},"7. Observation and continuation","Tool results can return to the model as new context for another inference step.",{"label":1183,"description":1184},"8. Validation and product output","The application validates the result, records required state or audit data, and presents or executes the final outcome.","One common execution path",{},{"id":308,"data":1188,"type":218,"tunes":1190},{"text":1189},"Real systems do not always follow this sequence exactly. Retrieval can happen before the first model call, tools can be selected during an agent loop, deterministic application logic can bypass the model entirely, and validation can occur at several stages. The point is to separate responsibilities, not to impose one universal workflow.",{},{"id":313,"data":1192,"type":42,"tunes":1194},{"text":1193,"level":240},"The six boundaries that matter",{},{"id":318,"data":1196,"type":358,"tunes":1223},{"rows":1197,"title":1215,"layout":347,"columns":1216},[1198,1201,1204,1207,1210,1213],{"id":322,"label":1199,"values":1200},"Model",[325,325,325],{"id":327,"label":1202,"values":1203},"Retrieval",[325,325,325],{"id":331,"label":1205,"values":1206},"Tools",[325,325,325],{"id":335,"label":1208,"values":1209},"Context",[325,325,325],{"id":339,"label":1211,"values":1212},"Runtime \u002F orchestrator",[325,325,325],{"id":343,"label":344,"values":1214},[325,325,325],"Six responsibilities inside one AI product",[1217,1219,1221],{"id":350,"label":1218},"Primary job",{"id":353,"label":1220},"Typical inputs",{"id":356,"label":1222},"Not the same as",{},{"id":361,"data":1225,"type":42,"tunes":1227},{"text":1226,"level":240},"1. The model: generation is its core responsibility",{},{"id":366,"data":1229,"type":218,"tunes":1231},{"text":1230},"A generative model maps supplied inputs to generated outputs. For a language model, that can include natural-language text, structured JSON, code, classifications, summaries, plans, or tool-call arguments. Multimodal generative models can work with additional input and output types.",{},{"id":371,"data":1233,"type":218,"tunes":1235},{"text":1234},"The model can contain substantial learned knowledge in its parameters, but parameterized knowledge is not a live database. The model does not automatically know a document created five minutes ago, the current stock level, a private customer record, or the state of an application unless that information is supplied through the current input path.",{},{"id":376,"data":1237,"type":218,"tunes":1239},{"text":1238},"This is why changing the model does not automatically solve stale knowledge, missing permissions, broken retrieval, incorrect state ownership, or unsafe tool execution. Those failures often belong to other layers.",{},{"id":381,"data":1241,"type":42,"tunes":1243},{"text":1242,"level":240},"2. Retrieval: finding external evidence is a separate operation",{},{"id":386,"data":1245,"type":218,"tunes":1247},{"text":1246},"Retrieval selects information from an external source before or during generation. The 2020 Retrieval-Augmented Generation work by Lewis et al. made the separation explicit by combining a parametric generative model with retrieved non-parametric memory. Modern production systems use many retrieval variants, but the architectural idea remains: useful evidence can be fetched at inference time instead of relying only on what the model learned during training.",{},{"id":391,"data":1249,"type":218,"tunes":1251},{"text":1250},"Retrieval can use lexical search, embeddings, vector search, hybrid search, SQL, knowledge graphs, metadata filters, APIs, or other selection mechanisms. A vector database is therefore one possible retrieval component, not the definition of RAG.",{},{"id":396,"data":1253,"type":226,"tunes":1256},{"body":1254,"title":1255,"variant":400},"A retrieved passage can be highly relevant and still be stale, unauthorized, from the wrong version, or insufficient to support a claim. Retrieval quality and evidence quality must be evaluated separately.","Relevance is not authority",{},{"id":403,"data":1258,"type":409,"tunes":1263},{"url":1259,"title":1260,"excerpt":1261,"ctaLabel":1262},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works","What Is RAG? The Simplest Explanation of How It Works","The canonical plain-English explanation of retrieval-augmented generation, including the separation between LLM, knowledge, state, memory and tools.","Read the RAG foundation",{},{"id":412,"data":1265,"type":42,"tunes":1267},{"text":1266,"level":240},"3. Tools: access and action are not model knowledge",{},{"id":417,"data":1269,"type":218,"tunes":1271},{"text":1270},"A tool is an interface through which an AI runtime can request functionality outside the model. A tool can query a database, search the web, read a file, calculate a value, call an internal service, create a ticket, send a message, modify a record, or trigger another controlled operation.",{},{"id":422,"data":1273,"type":218,"tunes":1275},{"text":1274},"OpenAI's current function-calling documentation makes this boundary explicit: function calling lets models interface with external systems and access data or actions provided by the application. The model can propose or select a call, but the external system performs the real operation.",{},{"id":427,"data":1277,"type":218,"tunes":1279},{"text":1278},"Tool use therefore creates two separate questions: Can the model request this capability? and Will the application authorize and execute it? A production system should not confuse model intent with permission to cause a side effect.",{},{"id":432,"data":1281,"type":226,"tunes":1284},{"body":1282,"title":1283,"variant":263},"A model can emit a valid tool request and still be denied. Authorization, argument validation, rate limits, transaction rules, audit requirements, and rollback belong outside the model.","Model intent is not execution authority",{},{"id":438,"data":1286,"type":42,"tunes":1288},{"text":1287,"level":240},"4. Context: what the model can see right now",{},{"id":443,"data":1290,"type":218,"tunes":1292},{"text":1291},"Context is the information available to the model for a particular inference step. Anthropic's context-engineering guidance describes context as the set of tokens included when sampling from an LLM. In practice, that set can contain system instructions, user messages, conversation history, retrieved evidence, tool definitions, tool results, memory summaries, and selected application state.",{},{"id":448,"data":1294,"type":218,"tunes":1296},{"text":1295},"Context is therefore neither the complete knowledge base nor long-term memory. A company may store ten million documents while only a handful of passages enter one model call. A runtime may persist a year of conversation history while exposing only the pieces needed for the current task.",{},{"id":453,"data":1298,"type":218,"tunes":1300},{"text":1299},"The context window also creates an engineering constraint. Adding more text does not guarantee a better answer; irrelevant, stale, contradictory, or low-authority information can dilute the evidence that actually matters.",{},{"id":458,"data":1302,"type":42,"tunes":1304},{"text":1303,"level":240},"5. Runtime and orchestration: coordinating the loop",{},{"id":463,"data":1306,"type":218,"tunes":1308},{"text":1307},"The runtime or orchestration layer coordinates how the model participates in a task. Depending on the architecture, it can manage sessions, model requests, tool discovery, tool-call loops, retries, handoffs, streaming events, timeouts, checkpoints, compaction, or execution environments.",{},{"id":468,"data":1310,"type":218,"tunes":1312},{"text":1311},"Some runtimes are thin application code around a model API. Others are full agent harnesses. A managed vendor runtime can own part of the loop while the application still owns domain truth, authorization, business side effects, and product lifecycle.",{},{"id":473,"data":1314,"type":218,"tunes":1316},{"text":1315},"This boundary is important because where the runtime runs and where inference runs are separate decisions. A locally running client or agent process can still call a remote model, while a remote application can call a model hosted on infrastructure under the organization's control.",{},{"id":478,"data":1318,"type":42,"tunes":1320},{"text":1319,"level":240},"6. The application: where AI becomes a product",{},{"id":483,"data":1322,"type":218,"tunes":1324},{"text":1323},"The application is the product boundary around the AI components. It owns the user experience, domain model, current state, identity, tenant scope, permissions, persistence, service integrations, validation, observability, billing or quota logic where relevant, and the rules that determine what the AI is allowed to see or do.",{},{"id":488,"data":1326,"type":218,"tunes":1328},{"text":1327},"This is the layer that turns “a model can produce useful output” into “a system can deliver a reliable capability.” The same model can participate in a private research assistant, a support workflow, a code agent, or a commerce application because the surrounding application changes the data, tools, policies, state, and execution contract.",{},{"id":493,"data":1330,"type":226,"tunes":1333},{"body":1331,"title":1332,"variant":225},"Provider and model substitution can be an architectural goal. The application's authoritative state, permissions, domain rules, audit trail, and user contract cannot simply be delegated to whichever model is currently selected.","The model is replaceable; the product boundary is not",{},{"id":499,"data":1335,"type":42,"tunes":1337},{"text":1336,"level":240},"How the parts work together in a real request",{},{"id":504,"data":1339,"type":218,"tunes":1341},{"text":1340},"Consider a support assistant asked: “Refund order 4711 if it is still eligible, and explain why.” The request combines knowledge, current state, authorization, reasoning, and a side effect.",{},{"id":509,"data":1343,"type":347,"tunes":1374},{"content":1344,"stretched":43,"withHeadings":14},[1345,1349,1352,1356,1360,1364,1368,1371],[1346,1347,1348],"Need","Correct layer","Why",[1350,1202,1351],"Refund policy","The system must find the current applicable policy and preserve its provenance.",[1353,1354,1355],"Order 4711 status","Direct data\u002Ftool access","The current order record is volatile authoritative state, not something to guess from model knowledge.",[1357,1358,1359],"User's authority to refund","Application \u002F authorization","Permissions must be enforced independently of what the model asks for.",[1361,1362,1363],"Interpret policy against order facts","Model + context","The model can reason over the policy evidence and current order state supplied to it.",[1365,1366,1367],"Execute refund","Tool + application transaction rules","A controlled external operation changes real state.",[1369,1199,1370],"Explain outcome","The model can generate the user-facing explanation from validated results.",[1372,540,1373],"Audit what happened","The system records evidence, calls, decisions, side effects, and errors as required.",{},{"id":544,"data":1376,"type":218,"tunes":1378},{"text":1377},"If the assistant only has the language model, it can discuss refunds but cannot safely know whether order 4711 is currently eligible or perform the transaction. If it only has retrieval, it may find the policy but still lack live order state. If it has tools without application authorization, it may become capable but unsafe. Reliability comes from composing the layers with explicit ownership.",{},{"id":549,"data":1380,"type":42,"tunes":1382},{"text":1381,"level":240},"Different AI products use different combinations",{},{"id":554,"data":1384,"type":358,"tunes":1406},{"rows":1385,"title":1398,"layout":347,"columns":1399},[1386,1389,1392,1395],{"id":558,"label":1387,"values":1388},"Model-only assistant",[325,325,325,325],{"id":562,"label":1390,"values":1391},"Retrieval-grounded assistant",[325,325,325,325],{"id":566,"label":1393,"values":1394},"Tool-using assistant",[325,325,325,325],{"id":570,"label":1396,"values":1397},"Agentic application",[325,325,325,325],"The presence of a model does not define the whole architecture",[1400,1401,1402,1404],{"id":327,"label":1202},{"id":331,"label":1205},{"id":578,"label":1403},"Authoritative state",{"id":581,"label":1405},"Typical capability",{},{"id":585,"data":1408,"type":218,"tunes":1410},{"text":1409},"These are architecture patterns, not maturity rankings. A model-only feature can be the correct design when the task needs no external facts or actions. Adding retrieval, tools, memory, or an agent loop is justified only when the task requires those capabilities.",{},{"id":590,"data":1412,"type":42,"tunes":1414},{"text":1413,"level":240},"Implementation evidence: Aaasaasa AI Client",{},{"id":595,"data":1416,"type":226,"tunes":1419},{"body":1417,"title":1418,"variant":233},"The following section describes an implementation I built and reviewed against the Aaasaasa AI Client codebase and architecture documentation as of \u003Cstrong>26 July 2026\u003C\u002Fstrong>. It is evidence for the usefulness of these boundaries, not a claim that one implementation is a universal standard or a commercially deployed enterprise product.","Primary implementation evidence",{},{"id":601,"data":1421,"type":218,"tunes":1423},{"text":1422},"Aaasaasa AI Client is a local-first desktop AI workspace built with Nuxt 4, Electron and TypeScript. Its AI Hub deliberately separates agent\u002Fclient, provider, model, runtime location, permissions, and web client instead of treating them as one “AI” setting.",{},{"id":606,"data":1425,"type":218,"tunes":1427},{"text":1426},"That separation creates concrete behavior. Direct Chat can talk to models without filesystem or shell tools. A Codex agent can use a selected workspace and permission profile. Ollama can provide direct local inference, while LM Studio and configurable OpenAI-compatible endpoints represent other provider paths. A locally running Codex process can still use a cloud model, so the UI and architecture do not equate local runtime with local inference.",{},{"id":611,"data":1429,"type":218,"tunes":1431},{"text":1430},"The implementation also contains Qdrant\u002Fvector support, document-extraction capabilities and an authenticated directory MCP broker. Those components illustrate another boundary: retrieval infrastructure and tool access can live in the same product without becoming properties of the model itself.",{},{"id":616,"data":1433,"type":347,"tunes":1456},{"content":1434,"stretched":43,"withHeadings":14},[1435,1438,1440,1443,1445,1448,1451,1454],[1436,1437],"A01 concept","Aaasaasa AI Client implementation evidence",[1199,1439],"A provider-specific model identifier is selected separately from provider and runtime.",[1441,1442],"Provider","Ollama, LM Studio, OpenAI-compatible services and other provider paths are represented separately.",[628,1444],"Local or remote agent\u002Fruntime location is tracked independently of the model.",[1446,1447],"Tools \u002F access","Direct Chat has no filesystem or shell tools; controlled directory access is brokered separately.",[1449,1450],"Permissions","Workspace permission profiles are application\u002Fsession policy, not model capability.",[1452,1453],"Retrieval infrastructure","Vector support and document extraction exist as data\u002Fretrieval capabilities rather than model features.",[344,1455],"The Electron\u002FNuxt product coordinates UI, credentials, providers, runtime discovery, permissions, tools and model interaction.",{},{"id":643,"data":1458,"type":226,"tunes":1461},{"body":1459,"title":1460,"variant":263},"The architecture became easier to reason about once \u003Cstrong>model, provider, runtime, permissions, tools, data and client\u003C\u002Fstrong> stopped being represented as one configuration choice. The distinction is operational: it determines what can run locally, what can access files, what may call paid cloud inference, and which layer owns authorization.","Implementation lesson",{},{"id":649,"data":1463,"type":42,"tunes":1465},{"text":1464,"level":240},"Common category errors",{},{"id":654,"data":1467,"type":347,"tunes":1493},{"content":1468,"stretched":43,"withHeadings":14},[1469,1472,1475,1478,1481,1484,1487,1490],[1470,1471],"Category error","What is actually happening",[1473,1474],"“The AI knows our documents.”","The application or retrieval layer makes selected document content available to the model.",[1476,1477],"“RAG is our vector database.”","The vector database can be one index or store used by a retrieval pipeline; RAG is the retrieval-plus-generation pattern.",[1479,1480],"“The model called our CRM.”","The model produced a tool request; the runtime\u002Fapplication authorized and executed the external call.",[1482,1483],"“It is local AI because the desktop agent runs locally.”","Runtime location and inference location are separate. A local runtime can still invoke a remote model.",[1485,1486],"“The model has permission to edit files.”","The application\u002Fruntime grants a tool capability under a permission policy; permission is not an intrinsic model property.",[1488,1489],"“More context means more knowledge.”","Context is the finite input made available for one inference. Larger context can contain more noise, conflict or stale information.",[1491,1492],"“The chatbot is the AI architecture.”","The chat UI is one interface. The system can also include identity, state, retrieval, tools, runtime, validation, persistence and observability.",{},{"id":683,"data":1495,"type":42,"tunes":1497},{"text":1496,"level":240},"Failure modes when the boundaries collapse",{},{"id":688,"data":1499,"type":218,"tunes":1501},{"text":1500},"Boundary mistakes are not merely terminology problems. They create distinct production failures that require different fixes.",{},{"id":693,"data":1503,"type":358,"tunes":1531},{"rows":1504,"title":1523,"layout":347,"columns":1524},[1505,1508,1511,1514,1517,1520],{"id":697,"label":1506,"values":1507},"Stale answer",[325,325,325],{"id":701,"label":1509,"values":1510},"Missing company fact",[325,325,325],{"id":705,"label":1512,"values":1513},"Unsafe side effect",[325,325,325],{"id":709,"label":1515,"values":1516},"Confused answer with lots of supplied text",[325,325,325],{"id":713,"label":1518,"values":1519},"Unexpected cloud use",[325,325,325],{"id":717,"label":1521,"values":1522},"Agent stalls or repeats",[325,325,325],"Diagnose the failing layer before replacing the model",[1525,1527,1529],{"id":723,"label":1526},"Symptom",{"id":726,"label":1528},"Likely boundary problem",{"id":729,"label":1530},"First architectural check",{},{"id":733,"data":1533,"type":42,"tunes":1535},{"text":1534,"level":240},"What is stable and what is version-sensitive?",{},{"id":738,"data":1537,"type":218,"tunes":1539},{"text":1538},"The architectural distinctions in this article are intentionally vendor-neutral. The current examples below are implementation facts that should be re-checked when APIs evolve.",{},{"id":743,"data":1541,"type":347,"tunes":1570},{"content":1542,"stretched":43,"withHeadings":14},[1543,1547,1551,1554,1558,1562,1566],[1544,1545,1546],"Area","Stable architectural idea","Verified current example on 8 Oct 2026",[1548,1549,1550],"AI model vs system","A model is a component inside a broader system","NIST's current glossary separately defines AI model and AI system.",[755,1552,1553],"Generation can be conditioned on retrieved external information","The Lewis et al. 2020 formulation remains the foundational reference; production retrieval methods now extend far beyond one dense index design.",[1555,1556,1557],"Hosted retrieval","Retrieval can be exposed as a managed tool","OpenAI File Search is currently a Responses API tool that searches uploaded-file knowledge bases using semantic and keyword retrieval.",[1559,1560,1561],"Function\u002Ftool calling","A model can request application-defined external capabilities","OpenAI currently documents function calling as an interface to external systems, data and actions.",[1563,1564,1565],"Context engineering","Model behavior depends on the finite information supplied for the current inference","Anthropic's current engineering guidance defines context as the token set included when sampling from the LLM and focuses on curating that set.",[1567,1568,1569],"Vendor APIs","SDKs, tool names, endpoint shapes and supported features change","Treat vendor documentation as version-sensitive even when the responsibility boundary remains stable.",{},{"id":776,"data":1572,"type":218,"tunes":1574},{"text":1573},"A source-of-truth article should therefore preserve both levels: stable concepts for architecture, and dated evidence for current implementations. Mixing the two makes an article age unnecessarily fast.",{},{"id":781,"data":1576,"type":42,"tunes":1578},{"text":1577,"level":240},"The AI component-boundary test",{},{"id":786,"data":1580,"type":218,"tunes":1582},{"text":1581},"When evaluating an AI feature, ask the following questions in order. The answers reveal which components the system actually has and which responsibilities are still implicit.",{},{"id":791,"data":1584,"type":305,"tunes":1608},{"steps":1585,"title":1607,"orientation":304},[1586,1589,1592,1595,1598,1601,1604],{"label":1587,"description":1588},"1. What generates the output?","Identify the exact model and the modalities or structured outputs it provides.",{"label":1590,"description":1591},"2. What facts are authoritative outside the model?","Identify documents, databases, APIs, current state and other sources of truth.",{"label":1593,"description":1594},"3. How is relevant information selected?","Separate direct lookup, search, retrieval, ranking and context construction.",{"label":1596,"description":1597},"4. What can cause real side effects?","List tools and external actions, then identify who validates and authorizes them.",{"label":1599,"description":1600},"5. What reaches the model as context?","Make instructions, evidence, state, history, memory and tool definitions explicit.",{"label":1602,"description":1603},"6. Who owns the loop?","Identify the runtime or harness that manages calls, events, retries, tool loops and sessions.",{"label":1605,"description":1606},"7. What remains the application's responsibility?","Make identity, permissions, domain state, validation, persistence, observability and UX explicit.","Seven questions for a production design",{},{"id":818,"data":1610,"type":42,"tunes":1612},{"text":1611,"level":240},"What generative AI is not",{},{"id":823,"data":1614,"type":218,"tunes":1616},{"text":1615},"Generative AI is not synonymous with an LLM, even though LLMs are a major class of generative model. It is also not synonymous with RAG, a vector database, an agent, a tool protocol, a chatbot UI, or an application.",{},{"id":828,"data":1618,"type":218,"tunes":1620},{"text":1619},"Those concepts can be connected, but each answers a different architectural question. An LLM asks how language output is produced. Retrieval asks where external evidence comes from. Tools ask how external capabilities are exposed. Context asks what the model can see. Runtime asks how execution is coordinated. The application asks how the capability becomes a controlled product.",{},{"id":833,"data":1622,"type":226,"tunes":1625},{"body":1623,"title":1624,"variant":263},"\u003Cstrong>Model = generate.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Retrieval = find evidence.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Tools = read or act outside the model.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Context = what the model sees now.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Runtime = coordinate execution.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Application = own the product, state, rules and permissions.\u003C\u002Fstrong>","If you remember only one model",{},{"id":839,"data":1627,"type":42,"tunes":1629},{"text":1628,"level":240},"Where to go next in the knowledge graph",{},{"id":844,"data":1631,"type":218,"tunes":1633},{"text":1632},"Once these boundaries are clear, deeper topics become easier to place. RAG belongs in retrieval and context construction. Retrieval Trigger decides when external evidence is required. Agent memory concerns what persists across time. Tool calling and MCP belong to capability access. Agent harnesses belong to runtime orchestration. RBAC, tenant isolation and domain authorization belong to the application and platform security boundary.",{},{"id":849,"data":1635,"type":409,"tunes":1640},{"url":1636,"title":1637,"excerpt":1638,"ctaLabel":1639},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhere-does-an-llm-get-its-data-rag-data-sources-in-python","Where Does an LLM Get Its Data? RAG Data Sources in Python","A practical continuation showing how files, SQL, APIs, full-text search, embeddings and context assembly connect external data to an LLM.","See the data path in code",{},{"id":857,"data":1642,"type":409,"tunes":1647},{"url":1643,"title":1644,"excerpt":1645,"ctaLabel":1646},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger","When Should an AI Stop Trusting Its Own Knowledge? — The Retrieval Trigger","A decision model for when an AI system should stop relying only on model knowledge and obtain external evidence.","Read the retrieval decision model",{},{"id":865,"data":1649,"type":42,"tunes":1651},{"text":1650,"level":240},"Limitations",{},{"id":870,"data":1653,"type":218,"tunes":1655},{"text":1654},"The six-layer model is a responsibility map, not a requirement that every product deploy six separate services. A small application may implement context construction, retrieval and orchestration inside one process. A managed platform may bundle several responsibilities behind one API. Physical deployment can be combined while semantic ownership remains distinct.",{},{"id":875,"data":1657,"type":218,"tunes":1659},{"text":1658},"Terminology also varies across vendors and research. “Agent,” “runtime,” “memory,” “tool,” “connector,” and “context” can be defined differently. The definitions here are chosen to make operational ownership and failure diagnosis explicit rather than to claim that every framework uses identical vocabulary.",{},{"id":880,"data":1661,"type":218,"tunes":1663},{"text":1662},"The Aaasaasa AI Client section documents one implementation pattern. It demonstrates that explicit boundaries are practical, but it does not prove that the same component layout is optimal for every AI product.",{},{"id":885,"data":1665,"type":42,"tunes":1667},{"text":1666,"level":240},"What would change this answer?",{},{"id":890,"data":1669,"type":218,"tunes":1671},{"text":1670},"The responsibility map would need revision if model architectures themselves began to own authoritative external state, permissions, durable transactional side effects, and verifiable source access as intrinsic properties rather than capabilities supplied by a surrounding system. Current production architectures do not make that a safe general assumption.",{},{"id":895,"data":1673,"type":218,"tunes":1675},{"text":1674},"Individual implementation examples will change much sooner. Hosted retrieval tools, agent APIs, MCP integrations, context-management features and provider capabilities evolve quickly. Those details should be updated without collapsing the underlying distinctions between generation, evidence, capability access, context, execution and application control.",{},{"id":900,"data":1677,"type":42,"tunes":1678},{"text":902,"level":240},{},{"id":905,"data":1680,"type":218,"tunes":1682},{"text":1681},"Generative AI becomes easier to design once “the AI” stops being treated as one black box. The model is the generative component, not the complete product. Retrieval provides external evidence. Tools expose capabilities. Context carries selected information into the current inference. The runtime coordinates execution. The application owns the authoritative product boundary.",{},{"id":910,"data":1684,"type":218,"tunes":1686},{"text":1685},"That separation is useful for more than explanation. It tells engineers where stale facts originate, where authorization belongs, why a local runtime can still use cloud inference, why RAG does not equal a vector database, why tool calls require validation, and why changing the model cannot repair every system failure.",{},{"id":915,"data":1688,"type":218,"tunes":1690},{"text":1689},"The durable architecture question is therefore not “Which AI model are we using?” It is: Which responsibility does each component own, what evidence crosses each boundary, and which layer is allowed to change real state?",{},{"id":920,"data":1692,"type":42,"tunes":1693},{"text":922,"level":240},{},{"id":925,"data":1695,"type":925,"tunes":1719},{"items":1696,"title":1718},[1697,1700,1703,1706,1709,1712,1715],{"id":929,"answer":1698,"question":1699},"No. An LLM is one type of generative model. Generative AI also includes other modalities, and a production generative AI system can include retrieval, tools, runtime logic, application state, permissions, persistence and user interfaces around the model.","Is generative AI the same as an LLM?",{"id":933,"answer":1701,"question":1702},"Usually no. RAG is an application\u002Fsystem pattern that retrieves external information and supplies selected evidence to the model. Some platforms package retrieval tightly with model APIs, but the responsibility remains distinct.","Is RAG part of the model?",{"id":937,"answer":1704,"question":1705},"No. RAG can use vector search, lexical search, hybrid retrieval, SQL, APIs, knowledge graphs or other methods. The defining property is retrieval of external information for generation, not one storage technology.","Is a vector database required for RAG?",{"id":941,"answer":1707,"question":1708},"No. A tool is an external capability. Its definition may be represented in context, and its result may later enter context, but the actual capability executes outside the model.","Are tools the same as context?",{"id":945,"answer":1710,"question":1711},"No. Runtime location and inference location are separate. A local desktop application or agent can call a remote model, while a remote application can call an internally hosted model.","Does running an AI client locally mean the model is local?",{"id":949,"answer":1713,"question":1714},"The application or runtime security boundary should enforce authorization. A model can request an operation, but model intent should never be treated as sufficient execution authority.","Who should enforce permissions for AI tools?",{"id":953,"answer":1716,"question":1717},"Authoritative volatile state should normally remain in the application or domain system that owns it. The AI can receive the relevant state through controlled context or tool access when needed.","Where does current application state belong?","Generative AI system boundaries",{},{"id":959,"data":1721,"type":42,"tunes":1723},{"text":1722,"level":240},"Glossary",{},{"id":964,"data":1725,"type":964,"tunes":1746},{"title":1726,"entries":1727},"Core terms",[1728,1731,1733,1735,1738,1740,1742,1744],{"term":1729,"anchor":970,"definition":1730},"Generative model","An AI model designed to generate derived synthetic content such as text, images, audio, video, code or structured output.",{"term":1202,"anchor":327,"definition":1732},"The process of selecting relevant information from an external source or store for the current task.",{"term":755,"anchor":562,"definition":1734},"Retrieval-Augmented Generation: a pattern in which retrieved external information is supplied to a generative model to improve the current output.",{"term":1736,"anchor":566,"definition":1737},"Tool","A capability exposed to an AI runtime for reading data, calculating, searching, or performing an external action.",{"term":1208,"anchor":335,"definition":1739},"The information available to the model for a particular inference step.",{"term":1211,"anchor":982,"definition":1741},"The software layer that coordinates model calls, tool calls, task loops, sessions, retries, events or execution environments.",{"term":344,"anchor":343,"definition":1743},"The product and domain layer that owns user interaction, authoritative state, permissions, validation, persistence and business behavior.",{"term":1441,"anchor":987,"definition":1745},"The service or runtime that exposes access to one or more models; provider identity and model identity are separate concerns.",{},{"id":991,"data":1748,"type":42,"tunes":1750},{"text":1749,"level":240},"Primary sources and implementation evidence",{},{"id":996,"data":1752,"type":218,"tunes":1754},{"text":1753},"Stable definitions below are anchored in standards\u002Fresearch; fast-moving implementation examples use current official engineering documentation. Aaasaasa AI Client is original implementation evidence and was checked against its codebase\u002Fdocumentation state dated 26 July 2026.",{},{"id":1001,"data":1756,"type":1008,"tunes":1761},{"link":1003,"meta":1757},{"image":1758,"title":1759,"description":1760},{"url":325},"NIST AI 600-1 — Generative Artificial Intelligence Profile","NIST's Generative AI profile, including the generative-AI definition and explicit distinction between model-, system-, application- and use-case-level concerns.",{},{"id":1011,"data":1763,"type":1008,"tunes":1768},{"link":1013,"meta":1764},{"image":1765,"title":1766,"description":1767},{"url":325},"NIST — Artificial Intelligence Model","Current NIST glossary definition of an AI model as a component of an information system that produces outputs from inputs using AI techniques.",{},{"id":1020,"data":1770,"type":1008,"tunes":1775},{"link":1022,"meta":1771},{"image":1772,"title":1773,"description":1774},{"url":325},"NIST — Artificial Intelligence System","Current NIST glossary definition showing that an AI system can include data systems, software, hardware, applications, tools or utilities using AI.",{},{"id":1029,"data":1777,"type":1008,"tunes":1782},{"link":1031,"meta":1778},{"image":1779,"title":1780,"description":1781},{"url":325},"Lewis et al. — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","The 2020 paper introducing the RAG formulation that combines a generative model with retrieved non-parametric memory.",{},{"id":1038,"data":1784,"type":1008,"tunes":1789},{"link":1040,"meta":1785},{"image":1786,"title":1787,"description":1788},{"url":325},"OpenAI — File Search","Current official documentation for hosted file retrieval in the Responses API using uploaded-file knowledge bases, semantic search and keyword search.",{},{"id":1047,"data":1791,"type":1008,"tunes":1796},{"link":1049,"meta":1792},{"image":1793,"title":1794,"description":1795},{"url":325},"OpenAI — Function Calling","Current official documentation describing tool\u002Ffunction calling as the interface between models and external systems, data and actions.",{},{"id":1056,"data":1798,"type":1008,"tunes":1803},{"link":1058,"meta":1799},{"image":1800,"title":1801,"description":1802},{"url":325},"Anthropic — Effective Context Engineering for AI Agents","Engineering guidance defining context as the token set available during LLM sampling and explaining why context selection is a finite-resource problem.",{},"2.31.6","Generative AI is more than a model. Learn how models, retrieval, tools, context, runtimes and applications fit together in production AI systems.",{"lang":7,"title":208,"content":210,"contentJson":1807,"excerpt":1065},{"time":212,"blocks":1808,"version":1064},[1809,1812,1815,1818,1821,1824,1827,1830,1833,1836,1839,1851,1854,1857,1877,1880,1883,1886,1889,1892,1895,1898,1901,1904,1907,1910,1913,1916,1919,1922,1925,1928,1931,1934,1937,1940,1943,1946,1949,1952,1955,1958,1961,1973,1976,1979,1996,1999,2002,2005,2008,2011,2014,2026,2029,2032,2044,2047,2050,2070,2073,2076,2087,2090,2093,2096,2107,2110,2113,2116,2119,2122,2125,2128,2131,2134,2137,2140,2143,2146,2149,2152,2155,2158,2161,2164,2167,2178,2181,2193,2196,2199,2204,2209,2214,2219,2224,2229],{"id":215,"data":1810,"type":218,"tunes":1811},{"text":217},{},{"id":221,"data":1813,"type":226,"tunes":1814},{"body":223,"title":224,"variant":225},{},{"id":229,"data":1816,"type":226,"tunes":1817},{"body":231,"title":232,"variant":233},{},{"id":236,"data":1819,"type":241,"tunes":1820},{"title":238,"maxLevel":239,"minLevel":240},{},{"id":244,"data":1822,"type":42,"tunes":1823},{"text":246,"level":240},{},{"id":249,"data":1825,"type":218,"tunes":1826},{"text":251},{},{"id":254,"data":1828,"type":218,"tunes":1829},{"text":256},{},{"id":259,"data":1831,"type":226,"tunes":1832},{"body":261,"title":262,"variant":263},{},{"id":266,"data":1834,"type":42,"tunes":1835},{"text":268,"level":240},{},{"id":271,"data":1837,"type":218,"tunes":1838},{"text":273},{},{"id":276,"data":1840,"type":305,"tunes":1850},{"steps":1841,"title":303,"orientation":304},[1842,1843,1844,1845,1846,1847,1848,1849],{"label":280,"description":281},{"label":283,"description":284},{"label":286,"description":287},{"label":289,"description":290},{"label":292,"description":293},{"label":295,"description":296},{"label":298,"description":299},{"label":301,"description":302},{},{"id":308,"data":1852,"type":218,"tunes":1853},{"text":310},{},{"id":313,"data":1855,"type":42,"tunes":1856},{"text":315,"level":240},{},{"id":318,"data":1858,"type":358,"tunes":1876},{"rows":1859,"title":346,"layout":347,"columns":1872},[1860,1862,1864,1866,1868,1870],{"id":322,"label":323,"values":1861},[325,325,325],{"id":327,"label":328,"values":1863},[325,325,325],{"id":331,"label":332,"values":1865},[325,325,325],{"id":335,"label":336,"values":1867},[325,325,325],{"id":339,"label":340,"values":1869},[325,325,325],{"id":343,"label":344,"values":1871},[325,325,325],[1873,1874,1875],{"id":350,"label":351},{"id":353,"label":354},{"id":356,"label":357},{},{"id":361,"data":1878,"type":42,"tunes":1879},{"text":363,"level":240},{},{"id":366,"data":1881,"type":218,"tunes":1882},{"text":368},{},{"id":371,"data":1884,"type":218,"tunes":1885},{"text":373},{},{"id":376,"data":1887,"type":218,"tunes":1888},{"text":378},{},{"id":381,"data":1890,"type":42,"tunes":1891},{"text":383,"level":240},{},{"id":386,"data":1893,"type":218,"tunes":1894},{"text":388},{},{"id":391,"data":1896,"type":218,"tunes":1897},{"text":393},{},{"id":396,"data":1899,"type":226,"tunes":1900},{"body":398,"title":399,"variant":400},{},{"id":403,"data":1902,"type":409,"tunes":1903},{"url":405,"title":406,"excerpt":407,"ctaLabel":408},{},{"id":412,"data":1905,"type":42,"tunes":1906},{"text":414,"level":240},{},{"id":417,"data":1908,"type":218,"tunes":1909},{"text":419},{},{"id":422,"data":1911,"type":218,"tunes":1912},{"text":424},{},{"id":427,"data":1914,"type":218,"tunes":1915},{"text":429},{},{"id":432,"data":1917,"type":226,"tunes":1918},{"body":434,"title":435,"variant":263},{},{"id":438,"data":1920,"type":42,"tunes":1921},{"text":440,"level":240},{},{"id":443,"data":1923,"type":218,"tunes":1924},{"text":445},{},{"id":448,"data":1926,"type":218,"tunes":1927},{"text":450},{},{"id":453,"data":1929,"type":218,"tunes":1930},{"text":455},{},{"id":458,"data":1932,"type":42,"tunes":1933},{"text":460,"level":240},{},{"id":463,"data":1935,"type":218,"tunes":1936},{"text":465},{},{"id":468,"data":1938,"type":218,"tunes":1939},{"text":470},{},{"id":473,"data":1941,"type":218,"tunes":1942},{"text":475},{},{"id":478,"data":1944,"type":42,"tunes":1945},{"text":480,"level":240},{},{"id":483,"data":1947,"type":218,"tunes":1948},{"text":485},{},{"id":488,"data":1950,"type":218,"tunes":1951},{"text":490},{},{"id":493,"data":1953,"type":226,"tunes":1954},{"body":495,"title":496,"variant":225},{},{"id":499,"data":1956,"type":42,"tunes":1957},{"text":501,"level":240},{},{"id":504,"data":1959,"type":218,"tunes":1960},{"text":506},{},{"id":509,"data":1962,"type":347,"tunes":1972},{"content":1963,"stretched":43,"withHeadings":14},[1964,1965,1966,1967,1968,1969,1970,1971],[513,514,515],[517,328,518],[520,521,522],[524,525,526],[528,529,530],[532,533,534],[536,323,537],[539,540,541],{},{"id":544,"data":1974,"type":218,"tunes":1975},{"text":546},{},{"id":549,"data":1977,"type":42,"tunes":1978},{"text":551,"level":240},{},{"id":554,"data":1980,"type":358,"tunes":1995},{"rows":1981,"title":573,"layout":347,"columns":1990},[1982,1984,1986,1988],{"id":558,"label":559,"values":1983},[325,325,325,325],{"id":562,"label":563,"values":1985},[325,325,325,325],{"id":566,"label":567,"values":1987},[325,325,325,325],{"id":570,"label":571,"values":1989},[325,325,325,325],[1991,1992,1993,1994],{"id":327,"label":328},{"id":331,"label":332},{"id":578,"label":579},{"id":581,"label":582},{},{"id":585,"data":1997,"type":218,"tunes":1998},{"text":587},{},{"id":590,"data":2000,"type":42,"tunes":2001},{"text":592,"level":240},{},{"id":595,"data":2003,"type":226,"tunes":2004},{"body":597,"title":598,"variant":233},{},{"id":601,"data":2006,"type":218,"tunes":2007},{"text":603},{},{"id":606,"data":2009,"type":218,"tunes":2010},{"text":608},{},{"id":611,"data":2012,"type":218,"tunes":2013},{"text":613},{},{"id":616,"data":2015,"type":347,"tunes":2025},{"content":2016,"stretched":43,"withHeadings":14},[2017,2018,2019,2020,2021,2022,2023,2024],[620,621],[323,623],[625,626],[628,629],[631,632],[634,635],[637,638],[344,640],{},{"id":643,"data":2027,"type":226,"tunes":2028},{"body":645,"title":646,"variant":263},{},{"id":649,"data":2030,"type":42,"tunes":2031},{"text":651,"level":240},{},{"id":654,"data":2033,"type":347,"tunes":2043},{"content":2034,"stretched":43,"withHeadings":14},[2035,2036,2037,2038,2039,2040,2041,2042],[658,659],[661,662],[664,665],[667,668],[670,671],[673,674],[676,677],[679,680],{},{"id":683,"data":2045,"type":42,"tunes":2046},{"text":685,"level":240},{},{"id":688,"data":2048,"type":218,"tunes":2049},{"text":690},{},{"id":693,"data":2051,"type":358,"tunes":2069},{"rows":2052,"title":720,"layout":347,"columns":2065},[2053,2055,2057,2059,2061,2063],{"id":697,"label":698,"values":2054},[325,325,325],{"id":701,"label":702,"values":2056},[325,325,325],{"id":705,"label":706,"values":2058},[325,325,325],{"id":709,"label":710,"values":2060},[325,325,325],{"id":713,"label":714,"values":2062},[325,325,325],{"id":717,"label":718,"values":2064},[325,325,325],[2066,2067,2068],{"id":723,"label":724},{"id":726,"label":727},{"id":729,"label":730},{},{"id":733,"data":2071,"type":42,"tunes":2072},{"text":735,"level":240},{},{"id":738,"data":2074,"type":218,"tunes":2075},{"text":740},{},{"id":743,"data":2077,"type":347,"tunes":2086},{"content":2078,"stretched":43,"withHeadings":14},[2079,2080,2081,2082,2083,2084,2085],[747,748,749],[751,752,753],[755,756,757],[759,760,761],[763,764,765],[767,768,769],[771,772,773],{},{"id":776,"data":2088,"type":218,"tunes":2089},{"text":778},{},{"id":781,"data":2091,"type":42,"tunes":2092},{"text":783,"level":240},{},{"id":786,"data":2094,"type":218,"tunes":2095},{"text":788},{},{"id":791,"data":2097,"type":305,"tunes":2106},{"steps":2098,"title":815,"orientation":304},[2099,2100,2101,2102,2103,2104,2105],{"label":795,"description":796},{"label":798,"description":799},{"label":801,"description":802},{"label":804,"description":805},{"label":807,"description":808},{"label":810,"description":811},{"label":813,"description":814},{},{"id":818,"data":2108,"type":42,"tunes":2109},{"text":820,"level":240},{},{"id":823,"data":2111,"type":218,"tunes":2112},{"text":825},{},{"id":828,"data":2114,"type":218,"tunes":2115},{"text":830},{},{"id":833,"data":2117,"type":226,"tunes":2118},{"body":835,"title":836,"variant":263},{},{"id":839,"data":2120,"type":42,"tunes":2121},{"text":841,"level":240},{},{"id":844,"data":2123,"type":218,"tunes":2124},{"text":846},{},{"id":849,"data":2126,"type":409,"tunes":2127},{"url":851,"title":852,"excerpt":853,"ctaLabel":854},{},{"id":857,"data":2129,"type":409,"tunes":2130},{"url":859,"title":860,"excerpt":861,"ctaLabel":862},{},{"id":865,"data":2132,"type":42,"tunes":2133},{"text":867,"level":240},{},{"id":870,"data":2135,"type":218,"tunes":2136},{"text":872},{},{"id":875,"data":2138,"type":218,"tunes":2139},{"text":877},{},{"id":880,"data":2141,"type":218,"tunes":2142},{"text":882},{},{"id":885,"data":2144,"type":42,"tunes":2145},{"text":887,"level":240},{},{"id":890,"data":2147,"type":218,"tunes":2148},{"text":892},{},{"id":895,"data":2150,"type":218,"tunes":2151},{"text":897},{},{"id":900,"data":2153,"type":42,"tunes":2154},{"text":902,"level":240},{},{"id":905,"data":2156,"type":218,"tunes":2157},{"text":907},{},{"id":910,"data":2159,"type":218,"tunes":2160},{"text":912},{},{"id":915,"data":2162,"type":218,"tunes":2163},{"text":917},{},{"id":920,"data":2165,"type":42,"tunes":2166},{"text":922,"level":240},{},{"id":925,"data":2168,"type":925,"tunes":2177},{"items":2169,"title":956},[2170,2171,2172,2173,2174,2175,2176],{"id":929,"answer":930,"question":931},{"id":933,"answer":934,"question":935},{"id":937,"answer":938,"question":939},{"id":941,"answer":942,"question":943},{"id":945,"answer":946,"question":947},{"id":949,"answer":950,"question":951},{"id":953,"answer":954,"question":955},{},{"id":959,"data":2179,"type":42,"tunes":2180},{"text":961,"level":240},{},{"id":964,"data":2182,"type":964,"tunes":2192},{"title":966,"entries":2183},[2184,2185,2186,2187,2188,2189,2190,2191],{"term":969,"anchor":970,"definition":971},{"term":328,"anchor":327,"definition":973},{"term":755,"anchor":562,"definition":975},{"term":977,"anchor":566,"definition":978},{"term":336,"anchor":335,"definition":980},{"term":340,"anchor":982,"definition":983},{"term":344,"anchor":343,"definition":985},{"term":625,"anchor":987,"definition":988},{},{"id":991,"data":2194,"type":42,"tunes":2195},{"text":993,"level":240},{},{"id":996,"data":2197,"type":218,"tunes":2198},{"text":998},{},{"id":1001,"data":2200,"type":1008,"tunes":2203},{"link":1003,"meta":2201},{"image":2202,"title":1006,"description":1007},{"url":325},{},{"id":1011,"data":2205,"type":1008,"tunes":2208},{"link":1013,"meta":2206},{"image":2207,"title":1016,"description":1017},{"url":325},{},{"id":1020,"data":2210,"type":1008,"tunes":2213},{"link":1022,"meta":2211},{"image":2212,"title":1025,"description":1026},{"url":325},{},{"id":1029,"data":2215,"type":1008,"tunes":2218},{"link":1031,"meta":2216},{"image":2217,"title":1034,"description":1035},{"url":325},{},{"id":1038,"data":2220,"type":1008,"tunes":2223},{"link":1040,"meta":2221},{"image":2222,"title":1043,"description":1044},{"url":325},{},{"id":1047,"data":2225,"type":1008,"tunes":2228},{"link":1049,"meta":2226},{"image":2227,"title":1052,"description":1053},{"url":325},{},{"id":1056,"data":2230,"type":1008,"tunes":2233},{"link":1058,"meta":2231},{"image":2232,"title":1061,"description":1062},{"url":325},{},"Post erfolgreich abgerufen",{"items":2236,"source":2320,"manualIds":2321,"manualMatchedIds":2322},[2237,2244,2251,2258,2265,2271,2278,2285,2292,2299,2306,2313],{"id":2238,"slug":2239,"title":2240,"excerpt":2241,"featuredImage":2242,"publishedAt":2243},"485","enterprise-ai-architecture-what-changes-when-ai-enters-a-company","Architecture de l’IA en entreprise : ce qui change lorsque l’IA entre dans une entreprise","L'architecture de l'IA en entreprise explique comment l'IA transforme les systèmes d'entreprise à travers l'autorité des données, l'identité, les autorisations, les fournisseurs, les risques, la gouvernance, l'évaluation, la conformité et les opérations.","\u002Fuploads\u002F2026\u002F10\u002Fenterprise-ai-architecture-what-changes-when-ai-enters-a-company-1791478161363-czrwaq.webp","2026-10-08T10:48:00.000Z",{"id":2245,"slug":2246,"title":2247,"excerpt":2248,"featuredImage":2249,"publishedAt":2250},"480","when-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger","Quand une IA devrait-elle cesser de faire confiance à ses propres connaissances ? — Le déclencheur de récupération","Un modèle d'IA n'a pas besoin de récupération pour chaque question. Le problème important est de savoir quand ses connaissances internes ne suffisent plus. Le Déclencheur de Récupération est une frontière de décision pratique qui détermine quand un système d'IA devrait cesser de se fier uniquement aux connaissances du modèle et obtenir des preuves externes avant de répondre.","\u002Fuploads\u002F2026\u002F09\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger-1790574991244-f4rpyg.webp","2026-09-28T01:49:00.000Z",{"id":2252,"slug":2253,"title":2254,"excerpt":2255,"featuredImage":2256,"publishedAt":2257},"482","adr-vs-nfr-architecture-decisions-and-system-quality-are-not-the-same-thing","ADR vs NFR : les décisions d'architecture et la qualité du système ne sont pas la même chose","ADR vs NFR expliqués : découvrez comment les exigences de qualité système orientent les décisions d'architecture, comment les ADR consignent les compromis et pourquoi la validation reste distincte.","\u002Fuploads\u002F2026\u002F10\u002Fadr-vs-nfr-architecture-decisions-and-system-quality-are-not-the-same-thing-1791475921511-6zgen1.webp","2026-10-08T12:11:00.000Z",{"id":2259,"slug":2260,"title":2261,"excerpt":2262,"featuredImage":2263,"publishedAt":2264},"490","rbac-vs-tenant-isolation-two-different-security-boundaries","RBAC vs isolation des locataires : deux frontières de sécurité différentes","Le RBAC contrôle ce qu’un utilisateur peut faire ; l’isolation des locataires contrôle à quelles ressources de locataire cette action peut accéder. Découvrez pourquoi la sécurité SaaS multi-locataires nécessite ces deux frontières.","\u002Fuploads\u002F2026\u002F10\u002Frbac-vs-tenant-isolation-two-different-security-boundaries-1791485111528-qqtzby.webp","2026-10-08T14:43:00.000Z",{"id":2266,"slug":2267,"title":406,"excerpt":2268,"featuredImage":2269,"publishedAt":2270},"478","what-is-rag-the-simplest-explanation-of-how-it-works","Le RAG semble compliqué, mais l'idée est simple : avant qu'une IA ne réponde, elle recherche d'abord des informations utiles dans une source de connaissances et transmet ces informations au modèle de langage. Ce guide explique le RAG, les LLM, l'état, la mémoire et les outils à l'aide d'un modèle mental simple.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":2272,"slug":2273,"title":2274,"excerpt":2275,"featuredImage":2276,"publishedAt":2277},"381","enterprise-grade-multi-tenant-architecture-for-an-international-platform","Enterprise-Grade Multi-Tenant Architecture for an International Platform","Loving Rocks is an enterprise-grade wedding platform designed with a true multi-tenant architecture, isolated databases per tenant, and built-in internationalization for global scalability, security, and long-term operational stability.","\u002Fuploads\u002F2026\u002F01\u002Fenterprise-grade-multi-tenant-architecture-for-an-international-platform-1769789121298-b6v7ak.webp","2026-01-30T12:04:00.000Z",{"id":2279,"slug":2280,"title":2281,"excerpt":2282,"featuredImage":2283,"publishedAt":2284},"483","what-is-an-ai-solution-architect-system-boundaries-responsibilities-and-trade-offs","Qu'est-ce qu'un architecte de solutions IA ? Limites du système, responsabilités et compromis","Un architecte de solutions d'IA transforme les exigences métier en un système d'IA prêt pour la production, couvrant les données, les modèles, les outils, la sécurité, l'exécution, l'évaluation et les opérations.","\u002Fuploads\u002F2026\u002F10\u002Fwhat-is-an-ai-solution-architect-system-boundaries-responsibilities-and-trade-offs-1791476643267-1st5xz.webp","2026-10-08T12:23:00.000Z",{"id":2286,"slug":2287,"title":2288,"excerpt":2289,"featuredImage":2290,"publishedAt":2291},"494","air-gapped-ai-how-ai-systems-work-without-internet-or-cloud-access","IA en environnement isolé : comment les systèmes d’IA fonctionnent sans accès à Internet ni au cloud","L'IA en environnement isolé exécute des modèles, du RAG et des applications d'IA à l'intérieur d'un domaine de sécurité isolé, sans dépendance à Internet ni au cloud. Découvrez comment les modèles, les données, les mises à jour et les outils fonctionnent hors ligne.","\u002Fuploads\u002F2026\u002F10\u002Fair-gapped-ai-how-ai-systems-work-without-internet-or-cloud-access-1791487983978-e6xqf0.webp","2026-10-08T11:32:00.000Z",{"id":2293,"slug":2294,"title":2295,"excerpt":2296,"featuredImage":2297,"publishedAt":2298},"471","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","Comment savoir si un agent IA a réellement utilisé les bonnes preuves","Un agent IA peut citer des sources et tout de même utiliser les mauvais éléments de preuve. Cet article présente une méthode pratique pour vérifier le soutien des affirmations, l'autorité de la source, l'applicabilité, la provenance et si les éléments de preuve ont réellement influencé la réponse.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","2026-09-25T11:47:00.000Z",{"id":2300,"slug":2301,"title":2302,"excerpt":2303,"featuredImage":2304,"publishedAt":2305},"467","the-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","La frontière de validité des réponses : la couche manquante entre la pertinence et les réponses fiables de l'IA","Une source peut être pertinente, faisant autorité et pourtant être erronée pour la question posée. La couche manquante est l'applicabilité : les conditions dans lesquelles une réponse est valable, et les changements qui obligent à la reconsidérer. Cet article présente la Frontière de Validité de la Réponse comme un modèle de conception de source pour les humains, la recherche par IA et les systèmes RAG.","\u002Fuploads\u002F2026\u002F09\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers-1790272901306-1g5jly.webp","2026-09-24T11:59:00.000Z",{"id":2307,"slug":2308,"title":2309,"excerpt":2310,"featuredImage":2311,"publishedAt":2312},"468","ai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","La mémoire des agents IA n'est pas le RAG : comment séparer la mémoire, la récupération, l'état et le contexte","La mémoire des agents, le RAG, l'état et le contexte sont souvent utilisés comme s'ils étaient interchangeables. Ils ne le sont pas. Ce modèle d'architecture pratique sépare les quatre couches, montre où chacune se situe et explique ce qui dysfonctionne lorsque les systèmes les fusionnent en une seule.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context-1790350560308-np0xy6.webp","2026-09-25T11:34:00.000Z",{"id":2314,"slug":2315,"title":2316,"excerpt":2317,"featuredImage":2318,"publishedAt":2319},"466","the-gpu-is-not-the-product-future-proof-private-ai-architecture","Le GPU n'est pas le produit : architecture d'IA privée pérenne","Une infrastructure d'IA privée ne devrait pas être conçue autour d'un seul GPU ou d'un seul modèle. Une approche plus résiliente combine des GPU d'inférence rapides, des systèmes d'IA riches en mémoire, des nœuds d'IA physique et des modèles cloud de pointe optionnels derrière une couche de routage prenant en compte les capacités.","\u002Fuploads\u002F2026\u002F09\u002Fthe-gpu-is-not-the-product-future-proof-private-ai-architecture-1790140878812-8hsl39.webp","2026-09-23T01:19:00.000Z","fallback",[],[]]