[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:de":3,"public-menus:all":37,"post:generative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing:de":204,"related:post:generative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing:de:1":2229},{"statusCode":4,"data":5,"message":36},200,{"tenantId":6,"lang":7,"defaultLang":7,"siteUrl":8,"contactEmail":9,"brandName":10,"logoUrl":11,"siteName":10,"siteDescription":12,"ogImage":9,"robotsIndex":13,"socialLinks":9,"reservedSlugs":9,"seoPolicy":14},"stajic","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":15,"relatedContent":16,"crossDomainLinks":17},{"logoUrl":11},{"enabled":13},[18,21,24,27,30,33],{"url":19,"label":20,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":22,"label":23,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":25,"label":26,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.com","bazify.com",{"url":28,"label":29,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.de","bazify.de",{"url":31,"label":32,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.at","bazify.at",{"url":34,"label":35,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[38,44],{"id":39,"name":40,"location":41,"isActive":13,"isDefault":42,"items":43},1,"main-navigation","header",false,[],{"id":45,"name":46,"location":47,"isActive":13,"isDefault":13,"items":48},4,"main-menu","sidebar",[49,65,78,92,102,117,132],{"id":50,"title":51,"url":59,"target":60,"icon":61,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":63,"portfolioId":9,"children":64},"item-18",{"de":52,"en":53,"es":54,"fr":55,"it":53,"ru":56,"sr":57,"zh":58},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":66,"title":67,"url":74,"target":60,"icon":75,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":76,"portfolioId":9,"children":77},"item-22",{"de":68,"en":68,"es":69,"fr":68,"it":70,"ru":71,"sr":72,"zh":73},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":79,"title":80,"url":88,"target":60,"icon":89,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":90,"portfolioId":9,"children":91},"item-19",{"de":81,"en":82,"es":83,"fr":82,"it":84,"ru":85,"sr":86,"zh":87},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":93,"title":94,"url":98,"target":60,"icon":99,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":100,"portfolioId":9,"children":101},"item-23",{"de":95,"en":95,"es":95,"fr":95,"it":95,"ru":96,"sr":96,"zh":97},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":103,"title":104,"url":113,"target":60,"icon":114,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":115,"portfolioId":9,"children":116},"item-32",{"de":105,"en":106,"es":107,"fr":108,"it":109,"ru":110,"sr":111,"zh":112},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":118,"title":119,"url":128,"target":60,"icon":129,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":130,"portfolioId":9,"children":131},"item-20",{"de":120,"en":121,"es":122,"fr":123,"it":124,"ru":125,"sr":126,"zh":127},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":133,"title":134,"url":143,"target":60,"icon":144,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":146},"item-21",{"de":135,"en":136,"es":137,"fr":138,"it":139,"ru":140,"sr":141,"zh":142},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[147,160,174,180,192],{"id":148,"title":149,"url":143,"target":60,"icon":158,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":159},"item-24",{"de":150,"en":151,"es":152,"fr":153,"it":154,"ru":155,"sr":156,"zh":157},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":161,"title":162,"url":170,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":173},"item-29",{"de":163,"en":164,"es":165,"fr":166,"it":167,"ru":168,"sr":169,"zh":142},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":175,"title":176,"url":178,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":179},"item-28",{"de":177,"en":177,"es":177,"fr":177,"it":177,"ru":177,"sr":177,"zh":177},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":181,"title":182,"url":190,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":191},"item-27",{"de":183,"en":184,"es":185,"fr":186,"it":187,"ru":188,"sr":189,"zh":184},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":193,"title":194,"url":202,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":203},"item-31",{"de":195,"en":196,"es":197,"fr":198,"it":199,"ru":200,"sr":201,"zh":196},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":205,"message":2228},{"id":206,"title":207,"slug":208,"content":209,"contentJson":210,"excerpt":1065,"featuredImage":1066,"featuredImageAlt":1067,"featuredImageCaption":9,"featuredImageTitle":9,"featuredImageCopyright":9,"featuredImageAuthor":9,"featuredImageSourceUrl":9,"featuredImageLicense":9,"featuredImageIsAiGenerated":42,"status":1068,"publishedAt":1069,"createdAt":1070,"updatedAt":1071,"seoLocalePaths":1072,"categories":1081,"author":1102,"translations":1107},"481","Generative KI erklärt: Modelle, Retrieval, Tools und Anwendungen sind nicht dasselbe","generative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u003Cp>Generative KI ist keine einzelne Komponente. Ein produktives generatives KI-System kombiniert in der Regel ein generatives Modell mit Anwendungscode, der Anweisungen und Kontext bereitstellt, bei Bedarf externes Wissen abruft, Werkzeuge zum Lesen oder Ändern externer Systeme bereitstellt, Laufzeitstatus und Berechtigungen verwaltet und das Ergebnis in ein nutzbares Produkt verwandelt. Modell, Retrieval, Werkzeuge, Kontext, Laufzeit und Anwendung als dasselbe zu behandeln, verdeckt die Grenzen, die Aktualität, Sicherheit, Zuverlässigkeit, Kosten und Kontrolle bestimmen.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Direkte Antwort\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">\u003Cstrong>Das Modell generiert; Retrieval findet externe Belege; Werkzeuge greifen auf Daten zu oder führen Aktionen aus; Kontext ist das, was das Modell für die aktuelle Inferenz sehen kann; die Laufzeit koordiniert die Ausführung; die Anwendung besitzt Produktregeln, Zustand, Berechtigungen, Persistenz und Benutzererfahrung.\u003C\u002Fstrong> Diese Schichten können von einem Anbieter zusammen verpackt werden, aber ihre Verantwortlichkeiten bleiben unterschiedlich.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Hinweis zu Terminologie und Version\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Dieser Artikel definiert dauerhafte architektonische Verantwortlichkeiten statt eines einzelnen Anbieter-Stacks. Aktuelle Implementierungsbeispiele wurden am \u003Cstrong>8. Oktober 2026\u003C\u002Fstrong> erneut überprüft. Anbieter-APIs und Produktnamen können sich ändern; die Verantwortungsgrenzen sind stabiler als jedes einzelne SDK oder jeder Endpunkt.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Inhalt\">\u003Cstrong class=\"editorjs-toc__title\">Inhalt\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-5\" class=\"editorjs-toc__link\">Was bedeutet „generative KI“ eigentlich?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-9\" class=\"editorjs-toc__link\">Das einfachste nützliche Modell eines generativen KI-Systems\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-13\" class=\"editorjs-toc__link\">Die sechs Grenzen, die zählen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-15\" class=\"editorjs-toc__link\">1. Das Modell: Generierung ist seine Kernverantwortung\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-19\" class=\"editorjs-toc__link\">2. Retrieval: Das Auffinden externer Belege ist eine separate Operation\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-24\" class=\"editorjs-toc__link\">3. Werkzeuge: Zugriff und Aktion sind kein Modellwissen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-29\" class=\"editorjs-toc__link\">4. Kontext: Was das Modell gerade jetzt sehen kann\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-33\" class=\"editorjs-toc__link\">5. Laufzeitumgebung und Orchestrierung: Koordination der Schleife\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-37\" class=\"editorjs-toc__link\">6. Die Anwendung: Wo KI zu einem Produkt wird\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-41\" class=\"editorjs-toc__link\">Wie die Teile in einer realen Anfrage zusammenwirken\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-45\" class=\"editorjs-toc__link\">Verschiedene KI-Produkte verwenden unterschiedliche Kombinationen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-48\" class=\"editorjs-toc__link\">Implementierungsnachweis: Aaasaasa AI Client\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-55\" class=\"editorjs-toc__link\">Häufige Kategorienfehler\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-57\" class=\"editorjs-toc__link\">Fehlermodi, wenn die Grenzen zusammenbrechen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-60\" class=\"editorjs-toc__link\">Was ist stabil und was ist versionsabhängig?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-64\" class=\"editorjs-toc__link\">Der KI-Komponentengrenzentest\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-67\" class=\"editorjs-toc__link\">Was generative KI nicht ist\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-71\" class=\"editorjs-toc__link\">Wohin als Nächstes im Wissensgraphen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-75\" class=\"editorjs-toc__link\">Einschränkungen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-79\" class=\"editorjs-toc__link\">Was würde diese Antwort ändern?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-82\" class=\"editorjs-toc__link\">Fazit\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-86\" class=\"editorjs-toc__link\">FAQ\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-88\" class=\"editorjs-toc__link\">Glossar\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-90\" class=\"editorjs-toc__link\">Primärquellen und Implementierungsnachweise\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Ch2 id=\"section-5\">Was bedeutet „generative KI“ eigentlich?\u003C\u002Fh2>\n\u003Cp>Auf Modellebene bezieht sich generative KI auf KI-Modelle, die abgeleitete synthetische Inhalte wie Text, Bilder, Audio, Video, Code oder andere digitale Ausgaben erzeugen. NIST AI 600-1 verwendet diese modellorientierte Bedeutung und diskutiert Risiken separat auf Modell-, System-, Anwendungs- und Anwendungsfall-Ebene.\u003C\u002Fp>\n\u003Cp>Diese Unterscheidung ist wichtig, weil ein KI-Modell nicht dasselbe ist wie das vollständige KI-System. Das aktuelle Glossar von NIST definiert ein KI-Modell als eine Komponente, die mithilfe computergestützter, statistischer oder maschineller Lerntechniken aus Eingaben Ausgaben erzeugt, während ein KI-System Software, Hardware, Anwendungen, Werkzeuge oder Hilfsprogramme umfassen kann, die mithilfe von KI arbeiten.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--success my-6 rounded-xl border p-5 border-emerald-300 bg-emerald-50 dark:border-emerald-900 dark:bg-emerald-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Eine nützliche Grenze\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">\u003Cstrong>Generatives Modell ≠ generative KI-Anwendung.\u003C\u002Fstrong>\u003Cbr>Ein Modell ist eine rechnerische Komponente. Ein nutzbares KI-Produkt ist ein System, das um diese Komponente herum aufgebaut ist.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-9\">Das einfachste nützliche Modell eines generativen KI-Systems\u003C\u002Fh2>\n\u003Cp>Stellen Sie sich als erstes mentales Modell einen Unternehmensassistenten vor, der antwortet: „Kann dieser Kunde heute eine Rückerstattung erhalten?“ Eine nützliche Antwort kann mehrere unterschiedliche Verantwortlichkeiten erfordern. Das Sprachmodell kann die Frage interpretieren und die Erklärung schreiben, aber der aktuelle Bestellstatus kann aus einem Datenbankwerkzeug stammen, die Rückerstattungsrichtlinie kann aus dem Dokumentenabruf kommen, Berechtigungen können von der Anwendung durchgesetzt werden, und die endgültige Aktion kann einen kontrollierten API-Aufruf erfordern.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Ein häufiger Ausführungspfad\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Benutzeranfrage\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Die Anwendung empfängt eine natürlichsprachliche Frage oder Aufgabe.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Anwendungsrichtlinie und Zustand\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identität, Mandant, Berechtigungen, aktueller Workflow-Zustand und Produktregeln definieren, was die Anfrage tun darf.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Retrieval oder direkter Datenzugriff\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Das System beschafft externe Belege oder aktuelle Fakten, wenn das Modellwissen nicht ausreicht.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Kontextaufbau\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Anweisungen, Benutzereingabe, ausgewählte Belege, relevanter Zustand und Werkzeugdefinitionen werden für das Modell zusammengestellt.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Modellinferenz\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Das generative Modell interpretiert den bereitgestellten Kontext und erzeugt Text, strukturierte Ausgabe oder eine Werkzeuganfrage.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Werkzeugausführung bei Bedarf\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Die Laufzeit oder Anwendung validiert und führt genehmigte Werkzeugaufrufe außerhalb des Modells aus.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Beobachtung und Fortsetzung\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Werkzeugergebnisse können als neuer Kontext für einen weiteren Inferenzschritt an das Modell zurückgegeben werden.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Validierung und Produktausgabe\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Die Anwendung validiert das Ergebnis, zeichnet erforderlichen Zustand oder Auditdaten auf und präsentiert oder führt das endgültige Ergebnis aus.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>Reale Systeme folgen nicht immer genau dieser Reihenfolge. Retrieval kann vor dem ersten Modellaufruf stattfinden, Werkzeuge können während einer Agentenschleife ausgewählt werden, deterministische Anwendungslogik kann das Modell vollständig umgehen, und Validierung kann in mehreren Phasen erfolgen. Der Punkt ist, Verantwortlichkeiten zu trennen, nicht einen universellen Workflow vorzuschreiben.\u003C\u002Fp>\n\u003Ch2 id=\"section-13\">Die sechs Grenzen, die zählen\u003C\u002Fh2>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Sechs Verantwortlichkeiten innerhalb eines KI-Produkts\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Hauptaufgabe\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Typische Eingaben\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Nicht dasselbe wie\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Modell\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Retrieval\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Werkzeuge\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Kontext\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Laufzeit \u002F Orchestrator\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Anwendung\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-15\">1. Das Modell: Generierung ist seine Kernverantwortung\u003C\u002Fh2>\n\u003Cp>Ein generatives Modell bildet bereitgestellte Eingaben auf generierte Ausgaben ab. Bei einem Sprachmodell kann das natürlichsprachlichen Text, strukturiertes JSON, Code, Klassifikationen, Zusammenfassungen, Pläne oder Argumente für Werkzeugaufrufe umfassen. Multimodale generative Modelle können mit zusätzlichen Eingabe- und Ausgabetypen arbeiten.\u003C\u002Fp>\n\u003Cp>Das Modell kann umfangreiches erlerntes Wissen in seinen Parametern enthalten, aber parametrisiertes Wissen ist keine Live-Datenbank. Das Modell weiß nicht automatisch von einem vor fünf Minuten erstellten Dokument, dem aktuellen Lagerbestand, einem privaten Kundendatensatz oder dem Zustand einer Anwendung, es sei denn, diese Informationen werden über den aktuellen Eingabepfad bereitgestellt.\u003C\u002Fp>\n\u003Cp>Deshalb löst ein Wechsel des Modells nicht automatisch veraltetes Wissen, fehlende Berechtigungen, fehlerhaftes Retrieval, falsche Zustandsverantwortung oder unsichere Werkzeugausführung. Diese Fehler gehören oft zu anderen Schichten.\u003C\u002Fp>\n\u003Ch2 id=\"section-19\">2. Retrieval: Das Auffinden externer Belege ist eine separate Operation\u003C\u002Fh2>\n\u003Cp>Retrieval wählt Informationen aus einer externen Quelle vor oder während der Generierung aus. Die Arbeit zur Retrieval-Augmented Generation aus dem Jahr 2020 von Lewis et al. machte die Trennung explizit, indem sie ein parametrisches generatives Modell mit abgerufenem nicht-parametrischem Speicher kombinierte. Moderne Produktionssysteme verwenden viele Retrieval-Varianten, aber die architektonische Idee bleibt: Nützliche Belege können zur Inferenzzeit abgerufen werden, anstatt sich nur auf das zu verlassen, was das Modell während des Trainings gelernt hat.\u003C\u002Fp>\n\u003Cp>Retrieval kann lexikalische Suche, Embeddings, Vektorsuche, hybride Suche, SQL, Wissensgraphen, Metadatenfilter, APIs oder andere Auswahlmechanismen verwenden. Eine Vektordatenbank ist daher eine mögliche Retrieval-Komponente, nicht die Definition von RAG.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Relevanz ist keine Autorität\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Eine abgerufene Passage kann hochrelevant und dennoch veraltet, nicht autorisiert, aus der falschen Version stammend oder unzureichend sein, um eine Aussage zu stützen. Retrieval-Qualität und Belegqualität müssen getrennt bewertet werden.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Was ist RAG? Die einfachste Erklärung, wie es funktioniert\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Die kanonische allgemein verständliche Erklärung der Retrieval-Augmented Generation, einschließlich der Trennung zwischen LLM, Wissen, Zustand, Gedächtnis und Werkzeugen.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Die RAG-Grundlage lesen →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-24\">3. Werkzeuge: Zugriff und Aktion sind kein Modellwissen\u003C\u002Fh2>\n\u003Cp>Ein Werkzeug ist eine Schnittstelle, über die eine KI-Laufzeitumgebung Funktionalität außerhalb des Modells anfordern kann. Ein Werkzeug kann eine Datenbank abfragen, das Web durchsuchen, eine Datei lesen, einen Wert berechnen, einen internen Dienst aufrufen, ein Ticket erstellen, eine Nachricht senden, einen Datensatz ändern oder eine andere kontrollierte Operation auslösen.\u003C\u002Fp>\n\u003Cp>Die aktuelle Funktionsaufruf-Dokumentation von OpenAI macht diese Grenze explizit: Funktionsaufrufe ermöglichen es Modellen, mit externen Systemen zu interagieren und auf Daten oder Aktionen zuzugreifen, die von der Anwendung bereitgestellt werden. Das Modell kann einen Aufruf vorschlagen oder auswählen, aber das externe System führt die eigentliche Operation aus.\u003C\u002Fp>\n\u003Cp>Die Werkzeugnutzung wirft daher zwei separate Fragen auf: Kann das Modell diese Fähigkeit anfordern? Und wird die Anwendung sie autorisieren und ausführen? Ein Produktionssystem sollte die Absicht des Modells nicht mit der Berechtigung verwechseln, einen Seiteneffekt zu verursachen.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--success my-6 rounded-xl border p-5 border-emerald-300 bg-emerald-50 dark:border-emerald-900 dark:bg-emerald-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Modellabsicht ist keine Ausführungsbefugnis\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Ein Modell kann eine gültige Werkzeuganfrage ausgeben und dennoch abgelehnt werden. Autorisierung, Argumentvalidierung, Ratenbegrenzungen, Transaktionsregeln, Audit-Anforderungen und Rollback gehören außerhalb des Modells.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-29\">4. Kontext: Was das Modell gerade jetzt sehen kann\u003C\u002Fh2>\n\u003Cp>Kontext sind die Informationen, die dem Modell für einen bestimmten Inferenzschritt zur Verfügung stehen. Die Kontext-Engineering-Richtlinie von Anthropic beschreibt Kontext als die Menge von Tokens, die beim Sampling von einem LLM einbezogen werden. In der Praxis kann diese Menge Systemanweisungen, Benutzernachrichten, Gesprächsverlauf, abgerufene Belege, Werkzeugdefinitionen, Werkzeugergebnisse, Gedächtniszusammenfassungen und ausgewählten Anwendungszustand enthalten.\u003C\u002Fp>\n\u003Cp>Kontext ist daher weder die vollständige Wissensbasis noch das Langzeitgedächtnis. Ein Unternehmen kann zehn Millionen Dokumente speichern, während nur eine Handvoll Passagen in einen Modellaufruf gelangen. Eine Laufzeitumgebung kann ein Jahr Gesprächsverlauf persistieren, während nur die für die aktuelle Aufgabe benötigten Teile offengelegt werden.\u003C\u002Fp>\n\u003Cp>Das Kontextfenster schafft auch eine technische Einschränkung. Mehr Text hinzuzufügen garantiert keine bessere Antwort; irrelevante, veraltete, widersprüchliche oder wenig autoritative Informationen können die Belege verwässern, die tatsächlich wichtig sind.\u003C\u002Fp>\n\u003Ch2 id=\"section-33\">5. Laufzeitumgebung und Orchestrierung: Koordination der Schleife\u003C\u002Fh2>\n\u003Cp>Die Laufzeitumgebung oder Orchestrierungsschicht koordiniert, wie das Modell an einer Aufgabe teilnimmt. Je nach Architektur kann sie Sitzungen, Modellanfragen, Werkzeugerkennung, Werkzeugaufrufschleifen, Wiederholungsversuche, Übergaben, Streaming-Ereignisse, Timeouts, Checkpoints, Kompaktierung oder Ausführungsumgebungen verwalten.\u003C\u002Fp>\n\u003Cp>Einige Laufzeitumgebungen sind dünner Anwendungscode um eine Modell-API. Andere sind vollständige Agent-Harnesse. Eine verwaltete Anbieter-Laufzeitumgebung kann einen Teil der Schleife übernehmen, während die Anwendung weiterhin die Domänenwahrheit, Autorisierung, geschäftliche Seiteneffekte und den Produktlebenszyklus besitzt.\u003C\u002Fp>\n\u003Cp>Diese Grenze ist wichtig, weil wo die Laufzeitumgebung läuft und wo die Inferenz läuft separate Entscheidungen sind. Ein lokal laufender Client- oder Agent-Prozess kann dennoch ein entferntes Modell aufrufen, während eine entfernte Anwendung ein Modell aufrufen kann, das auf Infrastruktur unter der Kontrolle der Organisation gehostet wird.\u003C\u002Fp>\n\u003Ch2 id=\"section-37\">6. Die Anwendung: Wo KI zu einem Produkt wird\u003C\u002Fh2>\n\u003Cp>Die Anwendung ist die Produktgrenze um die KI-Komponenten. Sie verantwortet die Benutzererfahrung, das Domänenmodell, den aktuellen Zustand, die Identität, den Mandantenbereich, Berechtigungen, Persistenz, Dienstintegrationen, Validierung, Observability, Abrechnungs- oder Kontingentlogik, sofern relevant, sowie die Regeln, die bestimmen, was die KI sehen oder tun darf.\u003C\u002Fp>\n\u003Cp>Diese Schicht verwandelt „ein Modell kann nützliche Ausgaben erzeugen“ in „ein System kann eine zuverlässige Fähigkeit bereitstellen“. Dasselbe Modell kann an einem privaten Rechercheassistenten, einem Support-Workflow, einem Code-Agenten oder einer Commerce-Anwendung teilnehmen, weil die umgebende Anwendung die Daten, Werkzeuge, Richtlinien, den Zustand und den Ausführungsvertrag verändert.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Das Modell ist austauschbar; die Produktgrenze nicht\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Anbieter- und Modellaustausch kann ein architektonisches Ziel sein. Der autoritative Zustand, die Berechtigungen, Domänenregeln, der Audit-Trail und der Benutzervertrag der Anwendung können nicht einfach an das gerade ausgewählte Modell delegiert werden.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-41\">Wie die Teile in einer realen Anfrage zusammenwirken\u003C\u002Fh2>\n\u003Cp>Betrachten Sie einen Support-Assistenten, der gefragt wird: „Erstatte Bestellung 4711, wenn sie noch berechtigt ist, und erkläre warum.“ Die Anfrage kombiniert Wissen, aktuellen Zustand, Autorisierung, Schlussfolgerung und einen Seiteneffekt.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Bedarf\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Korrekte Schicht\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Warum\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Erstattungsrichtlinie\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Retrieval\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Das System muss die aktuell geltende Richtlinie finden und ihre Herkunft bewahren.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Status von Bestellung 4711\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direkter Daten-\u002FWerkzeugzugriff\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Der aktuelle Bestelldatensatz ist flüchtiger autoritativer Zustand und nichts, was aus Modellwissen geraten werden sollte.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Berechtigung des Benutzers zur Erstattung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Anwendung \u002F Autorisierung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Berechtigungen müssen unabhängig davon durchgesetzt werden, was das Modell anfragt.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Richtlinie anhand der Bestellfakten auslegen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modell + Kontext\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Das Modell kann über die ihm bereitgestellten Richtlinienbelege und den aktuellen Bestellstatus schlussfolgern.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Erstattung ausführen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Werkzeug + Anwendungstransaktionsregeln\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eine kontrollierte externe Operation verändert realen Zustand.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ergebnis erklären\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modell\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Das Modell kann die benutzergerichtete Erklärung aus validierten Ergebnissen generieren.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Auditieren, was passiert ist\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Anwendung \u002F Laufzeit\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Das System zeichnet Belege, Aufrufe, Entscheidungen, Seiteneffekte und Fehler wie erforderlich auf.\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Wenn der Assistent nur über das Sprachmodell verfügt, kann er über Erstattungen sprechen, aber nicht sicher wissen, ob Bestellung 4711 derzeit berechtigt ist, oder die Transaktion durchführen. Wenn er nur über Retrieval verfügt, kann er die Richtlinie finden, aber es fehlt ihm weiterhin der Live-Bestellstatus. Wenn er über Werkzeuge ohne Anwendungsautorisierung verfügt, kann er leistungsfähig, aber unsicher werden. Zuverlässigkeit entsteht durch die Komposition der Schichten mit expliziter Verantwortlichkeit.\u003C\u002Fp>\n\u003Ch2 id=\"section-45\">Verschiedene KI-Produkte verwenden unterschiedliche Kombinationen\u003C\u002Fh2>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Die Anwesenheit eines Modells definiert nicht die gesamte Architektur\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Retrieval\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Werkzeuge\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Autoritativer Zustand\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Typische Fähigkeit\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Nur-Modell-Assistent\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Retrieval-gestützter Assistent\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Werkzeugnutzender Assistent\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Agentische Anwendung\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Cp>Dies sind Architekturmuster, keine Reifegrad-Rankings. Eine Nur-Modell-Funktion kann das richtige Design sein, wenn die Aufgabe keine externen Fakten oder Aktionen benötigt. Das Hinzufügen von Retrieval, Werkzeugen, Gedächtnis oder einer Agentenschleife ist nur gerechtfertigt, wenn die Aufgabe diese Fähigkeiten erfordert.\u003C\u002Fp>\n\u003Ch2 id=\"section-48\">Implementierungsnachweis: Aaasaasa AI Client\u003C\u002Fh2>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Primärer Implementierungsnachweis\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Der folgende Abschnitt beschreibt eine Implementierung, die ich erstellt und gegen die Codebasis und Architektur dokumentation des Aaasaasa AI Client mit Stand \u003Cstrong>26. Juli 2026\u003C\u002Fstrong> überprüft habe. Sie ist ein Nachweis für die Nützlichkeit dieser Grenzen, nicht die Behauptung, dass eine Implementierung ein universeller Standard oder ein kommerziell eingesetztes Unternehmensprodukt ist.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Cp>Aaasaasa AI Client ist ein lokal-first Desktop-KI-Arbeitsbereich, der mit Nuxt 4, Electron und TypeScript erstellt wurde. Sein AI Hub trennt bewusst Agent\u002FClient, Anbieter, Modell, Laufzeitort, Berechtigungen und Webclient, anstatt sie als eine einzige „KI“-Einstellung zu behandeln.\u003C\u002Fp>\n\u003Cp>Diese Trennung erzeugt konkretes Verhalten. Direct Chat kann mit Modellen sprechen, ohne Dateisystem- oder Shell-Werkzeuge. Ein Codex-Agent kann einen ausgewählten Arbeitsbereich und ein Berechtigungsprofil verwenden. Ollama kann direkte lokale Inferenz bereitstellen, während LM Studio und konfigurierbare OpenAI-kompatible Endpunkte andere Anbieterpfade darstellen. Ein lokal laufender Codex-Prozess kann dennoch ein Cloud-Modell verwenden, sodass UI und Architektur lokale Laufzeit nicht mit lokaler Inferenz gleichsetzen.\u003C\u002Fp>\n\u003Cp>Die Implementierung enthält außerdem Qdrant-\u002FVektor-Unterstützung, Dokumentenextraktionsfähigkeiten und einen authentifizierten Directory-MCP-Broker. Diese Komponenten veranschaulichen eine weitere Grenze: Retrieval-Infrastruktur und Werkzeugzugriff können im selben Produkt leben, ohne zu Eigenschaften des Modells selbst zu werden.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">A01-Konzept\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Implementierungsnachweis im Aaasaasa AI Client\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modell\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eine anbieterspezifische Modellkennung wird getrennt von Anbieter und Laufzeit ausgewählt.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Anbieter\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ollama, LM Studio, OpenAI-kompatible Dienste und andere Anbieterpfade werden getrennt dargestellt.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Laufzeit\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Der lokale oder entfernte Agent-\u002FLaufzeitort wird unabhängig vom Modell verfolgt.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Werkzeuge \u002F Zugriff\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Direct Chat hat keine Dateisystem- oder Shell-Werkzeuge; kontrollierter Verzeichniszugriff wird separat vermittelt.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Berechtigungen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Arbeitsbereichs-Berechtigungsprofile sind Anwendungs-\u002FSitzungsrichtlinie, keine Modellfähigkeit.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Retrieval-Infrastruktur\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Vektor-Unterstützung und Dokumentenextraktion existieren als Daten-\u002FRetrieval-Fähigkeiten statt als Modellfunktionen.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Anwendung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Das Electron\u002FNuxt-Produkt koordiniert UI, Anmeldedaten, Anbieter, Laufzeiterkennung, Berechtigungen, Werkzeuge und Modellinteraktion.\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Caside class=\"editorjs-callout editorjs-callout--success my-6 rounded-xl border p-5 border-emerald-300 bg-emerald-50 dark:border-emerald-900 dark:bg-emerald-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Implementierungslektion\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Die Architektur wurde leichter nachvollziehbar, sobald \u003Cstrong>Modell, Anbieter, Laufzeit, Berechtigungen, Werkzeuge, Daten und Client\u003C\u002Fstrong> nicht mehr als eine Konfigurationsentscheidung dargestellt wurden. Die Unterscheidung ist operativ: Sie bestimmt, was lokal laufen kann, was auf Dateien zugreifen darf, was kostenpflichtige Cloud-Inferenz aufrufen darf und welche Schicht die Autorisierung verantwortet.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-55\">Häufige Kategorienfehler\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Kategorienfehler\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Was tatsächlich passiert\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Die KI kennt unsere Dokumente.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die Anwendung oder die Retrieval-Schicht stellt dem Modell ausgewählte Dokumentinhalte zur Verfügung.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„RAG ist unsere Vektordatenbank.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die Vektordatenbank kann ein Index oder Speicher sein, der von einer Retrieval-Pipeline genutzt wird; RAG ist das Muster aus Retrieval und Generierung.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Das Modell hat unser CRM aufgerufen.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Das Modell hat eine Tool-Anfrage erzeugt; die Laufzeitumgebung bzw. die Anwendung hat den externen Aufruf autorisiert und ausgeführt.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Es ist lokale KI, weil der Desktop-Agent lokal läuft.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ausführungsort und Inferenzort sind getrennt. Eine lokale Laufzeitumgebung kann dennoch ein entferntes Modell aufrufen.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Das Modell hat die Berechtigung, Dateien zu bearbeiten.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die Anwendung bzw. die Laufzeitumgebung gewährt eine Tool-Fähigkeit im Rahmen einer Berechtigungsrichtlinie; eine Berechtigung ist keine intrinsische Eigenschaft des Modells.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Mehr Kontext bedeutet mehr Wissen.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kontext ist die endliche Eingabe, die für eine Inferenz bereitgestellt wird. Größerer Kontext kann mehr Rauschen, Konflikte oder veraltete Informationen enthalten.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Der Chatbot ist die KI-Architektur.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die Chat-Oberfläche ist eine Schnittstelle. Das System kann auch Identität, Zustand, Retrieval, Tools, Laufzeitumgebung, Validierung, Persistenz und Observability umfassen.\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-57\">Fehlermodi, wenn die Grenzen zusammenbrechen\u003C\u002Fh2>\n\u003Cp>Grenzfehler sind nicht nur Terminologieprobleme. Sie erzeugen unterschiedliche Produktionsfehler, die unterschiedliche Korrekturen erfordern.\u003C\u002Fp>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Diagnostizieren Sie die fehlerhafte Schicht, bevor Sie das Modell ersetzen\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Symptom\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Wahrscheinliches Grenzproblem\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Erste architektonische Prüfung\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Veraltete Antwort\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Fehlende Unternehmensinformation\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Unsichere Nebenwirkung\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Verwirrte Antwort bei viel bereitgestelltem Text\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Unerwartete Cloud-Nutzung\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Agent stockt oder wiederholt sich\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-60\">Was ist stabil und was ist versionsabhängig?\u003C\u002Fh2>\n\u003Cp>Die architektonischen Unterscheidungen in diesem Artikel sind bewusst herstellerneutral. Die aktuellen Beispiele unten sind Implementierungsfakten, die bei der Weiterentwicklung von APIs erneut überprüft werden sollten.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Bereich\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Stabile architektonische Idee\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Verifiziertes aktuelles Beispiel am 8. Okt. 2026\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">KI-Modell vs. System\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ein Modell ist eine Komponente innerhalb eines umfassenderen Systems\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Das aktuelle Glossar von NIST definiert KI-Modell und KI-System getrennt.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">RAG\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die Generierung kann auf abgerufene externe Informationen konditioniert werden\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die Formulierung von Lewis et al. 2020 bleibt die grundlegende Referenz; Produktions-Retrieval-Methoden gehen heute weit über ein einzelnes dichtes Indexdesign hinaus.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Gehostetes Retrieval\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Retrieval kann als verwaltetes Tool bereitgestellt werden\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">OpenAI File Search ist derzeit ein Responses-API-Tool, das hochgeladene Dateiwissensbasen mithilfe semantischen und schlüsselwortbasierten Retrievals durchsucht.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Funktions-\u002FTool-Aufruf\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ein Modell kann anwendungsdefinierte externe Fähigkeiten anfordern\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">OpenAI dokumentiert Funktionsaufrufe derzeit als Schnittstelle zu externen Systemen, Daten und Aktionen.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kontext-Engineering\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Das Modellverhalten hängt von den endlichen Informationen ab, die für die aktuelle Inferenz bereitgestellt werden\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die aktuelle Engineering-Anleitung von Anthropic definiert Kontext als die Token-Menge, die beim Sampling aus dem LLM einbezogen wird, und konzentriert sich auf die Kuratierung dieser Menge.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Hersteller-APIs\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">SDKs, Tool-Namen, Endpunktformen und unterstützte Funktionen ändern sich\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Behandeln Sie Herstellerdokumentation als versionsabhängig, auch wenn die Verantwortungsgrenze stabil bleibt.\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Ein Artikel, der als Quelle der Wahrheit dienen soll, sollte daher beide Ebenen bewahren: stabile Konzepte für die Architektur und datierte Belege für aktuelle Implementierungen. Die Vermischung beider lässt einen Artikel unnötig schnell veralten.\u003C\u002Fp>\n\u003Ch2 id=\"section-64\">Der KI-Komponentengrenzentest\u003C\u002Fh2>\n\u003Cp>Wenn Sie eine KI-Funktion bewerten, stellen Sie die folgenden Fragen in dieser Reihenfolge. Die Antworten zeigen, welche Komponenten das System tatsächlich hat und welche Verantwortlichkeiten noch implizit sind.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Sieben Fragen für ein Produktionsdesign\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Was erzeugt die Ausgabe?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identifizieren Sie das genaue Modell und die Modalitäten oder strukturierten Ausgaben, die es bereitstellt.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Welche Fakten sind außerhalb des Modells maßgeblich?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identifizieren Sie Dokumente, Datenbanken, APIs, aktuellen Zustand und andere Wahrheitsquellen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Wie werden relevante Informationen ausgewählt?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Trennen Sie direkte Suche, Suchvorgang, Retrieval, Ranking und Kontextkonstruktion.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Was kann echte Nebenwirkungen verursachen?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Listen Sie Tools und externe Aktionen auf und identifizieren Sie dann, wer sie validiert und autorisiert.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Was erreicht das Modell als Kontext?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Machen Sie Anweisungen, Belege, Zustand, Verlauf, Gedächtnis und Tool-Definitionen explizit.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Wer besitzt die Schleife?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identifizieren Sie die Laufzeitumgebung oder das Harness, das Aufrufe, Ereignisse, Wiederholungen, Tool-Schleifen und Sitzungen verwaltet.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Was bleibt in der Verantwortung der Anwendung?\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Machen Sie Identität, Berechtigungen, Domänenzustand, Validierung, Persistenz, Observability und UX explizit.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-67\">Was generative KI nicht ist\u003C\u002Fh2>\n\u003Cp>Generative KI ist nicht gleichbedeutend mit einem LLM, obwohl LLMs eine bedeutende Klasse generativer Modelle sind. Sie ist auch nicht gleichbedeutend mit RAG, einer Vektordatenbank, einem Agenten, einem Tool-Protokoll, einer Chatbot-Oberfläche oder einer Anwendung.\u003C\u002Fp>\n\u003Cp>Diese Konzepte können verbunden sein, aber jedes beantwortet eine andere architektonische Frage. Ein LLM fragt, wie Sprachausgabe erzeugt wird. Retrieval fragt, woher externe Belege kommen. Tools fragen, wie externe Fähigkeiten bereitgestellt werden. Kontext fragt, was das Modell sehen kann. Laufzeitumgebung fragt, wie die Ausführung koordiniert wird. Die Anwendung fragt, wie die Fähigkeit zu einem kontrollierten Produkt wird.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--success my-6 rounded-xl border p-5 border-emerald-300 bg-emerald-50 dark:border-emerald-900 dark:bg-emerald-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Wenn Sie sich nur ein Modell merken\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">\u003Cstrong>Modell = generieren.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Retrieval = Belege finden.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Tools = außerhalb des Modells lesen oder handeln.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Kontext = was das Modell jetzt sieht.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Laufzeitumgebung = Ausführung koordinieren.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Anwendung = Produkt, Zustand, Regeln und Berechtigungen besitzen.\u003C\u002Fstrong>\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-71\">Wohin als Nächstes im Wissensgraphen\u003C\u002Fh2>\n\u003Cp>Sobald diese Grenzen klar sind, lassen sich tiefergehende Themen leichter einordnen. RAG gehört zu Retrieval und Kontextkonstruktion. Retrieval Trigger entscheidet, wann externe Belege erforderlich sind. Agent Memory betrifft das, was über die Zeit hinweg bestehen bleibt. Tool Calling und MCP gehören zum Fähigkeitszugriff. Agent Harnesses gehören zur Laufzeitorchestrierung. RBAC, Mandantentrennung und Domänenautorisierung gehören zur Anwendungs- und Plattformsicherheitsgrenze.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fwhere-does-an-llm-get-its-data-rag-data-sources-in-python\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Woher bezieht ein LLM seine Daten? RAG-Datenquellen in Python\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Eine praktische Fortsetzung, die zeigt, wie Dateien, SQL, APIs, Volltextsuche, Embeddings und Kontextzusammenstellung externe Daten mit einem LLM verbinden.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Den Datenpfad im Code sehen →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Wann sollte eine KI aufhören, ihrem eigenen Wissen zu vertrauen? — Der Retrieval-Trigger\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Ein Entscheidungsmodell dafür, wann ein KI-System aufhören sollte, sich nur auf Modellwissen zu verlassen, und externe Belege einholen sollte.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Das Retrieval-Entscheidungsmodell lesen →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Ch2 id=\"section-75\">Einschränkungen\u003C\u002Fh2>\n\u003Cp>Das Sechs-Schichten-Modell ist eine Verantwortungskarte, keine Anforderung, dass jedes Produkt sechs separate Dienste bereitstellen muss. Eine kleine Anwendung kann Kontextkonstruktion, Retrieval und Orchestrierung innerhalb eines Prozesses implementieren. Eine verwaltete Plattform kann mehrere Verantwortlichkeiten hinter einer API bündeln. Die physische Bereitstellung kann kombiniert werden, während die semantische Zuständigkeit getrennt bleibt.\u003C\u002Fp>\n\u003Cp>Auch die Terminologie variiert zwischen Anbietern und Forschung. „Agent“, „Runtime“, „Memory“, „Tool“, „Connector“ und „Kontext“ können unterschiedlich definiert werden. Die hier gewählten Definitionen sollen operative Zuständigkeit und Fehlerdiagnose explizit machen, nicht behaupten, dass jedes Framework identische Vokabeln verwendet.\u003C\u002Fp>\n\u003Cp>Der Abschnitt Aaasaasa AI Client dokumentiert ein Implementierungsmuster. Er zeigt, dass explizite Grenzen praktikabel sind, beweist aber nicht, dass dasselbe Komponentenlayout für jedes KI-Produkt optimal ist.\u003C\u002Fp>\n\u003Ch2 id=\"section-79\">Was würde diese Antwort ändern?\u003C\u002Fh2>\n\u003Cp>Die Verantwortungskarte müsste überarbeitet werden, wenn Modellarchitekturen selbst begannen, autoritativen externen Zustand, Berechtigungen, dauerhafte transaktionale Seiteneffekte und verifizierbaren Quellenzugriff als intrinsische Eigenschaften zu besitzen, statt als Fähigkeiten, die von einem umgebenden System bereitgestellt werden. Aktuelle Produktionsarchitekturen machen das nicht zu einer sicheren allgemeinen Annahme.\u003C\u002Fp>\n\u003Cp>Einzelne Implementierungsbeispiele werden sich viel schneller ändern. Gehostete Retrieval-Tools, Agent-APIs, MCP-Integrationen, Kontextmanagement-Funktionen und Anbieterfähigkeiten entwickeln sich schnell. Diese Details sollten aktualisiert werden, ohne die zugrunde liegenden Unterscheidungen zwischen Generierung, Evidenz, Fähigkeitszugriff, Kontext, Ausführung und Anwendungssteuerung aufzulösen.\u003C\u002Fp>\n\u003Ch2 id=\"section-82\">Fazit\u003C\u002Fh2>\n\u003Cp>Generative KI lässt sich leichter entwerfen, sobald „die KI“ nicht mehr als eine Blackbox behandelt wird. Das Modell ist die generative Komponente, nicht das vollständige Produkt. Retrieval liefert externe Evidenz. Tools stellen Fähigkeiten bereit. Kontext trägt ausgewählte Informationen in die aktuelle Inferenz. Die Runtime koordiniert die Ausführung. Die Anwendung besitzt die autoritative Produktgrenze.\u003C\u002Fp>\n\u003Cp>Diese Trennung ist mehr als eine Erklärung. Sie sagt Ingenieuren, wo veraltete Fakten entstehen, wohin Autorisierung gehört, warum eine lokale Runtime dennoch Cloud-Inferenz nutzen kann, warum RAG nicht gleich einer Vektordatenbank ist, warum Tool-Aufrufe Validierung erfordern und warum ein Modellwechsel nicht jeden Systemfehler beheben kann.\u003C\u002Fp>\n\u003Cp>Die dauerhafte Architekturfrage lautet daher nicht „Welches KI-Modell verwenden wir?“ Sie lautet: Welche Verantwortung besitzt jede Komponente, welche Evidenz überschreitet jede Grenze, und welche Schicht darf echten Zustand ändern?\u003C\u002Fp>\n\u003Ch2 id=\"section-86\">FAQ\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Systemgrenzen generativer KI\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Ist generative KI dasselbe wie ein LLM?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nein. Ein LLM ist eine Art generatives Modell. Generative KI umfasst auch andere Modalitäten, und ein produktives generatives KI-System kann Retrieval, Tools, Runtime-Logik, Anwendungszustand, Berechtigungen, Persistenz und Benutzeroberflächen um das Modell herum enthalten.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Ist RAG Teil des Modells?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Normalerweise nein. RAG ist ein Anwendungs-\u002FSystemmuster, das externe Informationen abruft und dem Modell ausgewählte Evidenz bereitstellt. Einige Plattformen bündeln Retrieval eng mit Modell-APIs, aber die Verantwortung bleibt getrennt.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Ist eine Vektordatenbank für RAG erforderlich?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nein. RAG kann Vektorsuche, lexikalische Suche, hybride Suche, SQL, APIs, Wissensgraphen oder andere Methoden verwenden. Die definierende Eigenschaft ist der Abruf externer Informationen für die Generierung, nicht eine einzelne Speichertechnologie.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Sind Tools dasselbe wie Kontext?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nein. Ein Tool ist eine externe Fähigkeit. Seine Definition kann im Kontext dargestellt werden, und sein Ergebnis kann später in den Kontext gelangen, aber die eigentliche Fähigkeit wird außerhalb des Modells ausgeführt.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Bedeutet der lokale Betrieb eines KI-Clients, dass das Modell lokal ist?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nein. Runtime-Standort und Inferenz-Standort sind getrennt. Eine lokale Desktop-Anwendung oder ein Agent kann ein entferntes Modell aufrufen, während eine entfernte Anwendung ein intern gehostetes Modell aufrufen kann.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq6\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Wer sollte Berechtigungen für KI-Tools durchsetzen?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Die Anwendungs- oder Runtime-Sicherheitsgrenze sollte die Autorisierung durchsetzen. Ein Modell kann eine Operation anfordern, aber die Absicht des Modells sollte niemals als ausreichende Ausführungsberechtigung behandelt werden.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq7\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Wohin gehört der aktuelle Anwendungszustand?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Autoritativer flüchtiger Zustand sollte normalerweise in der Anwendung oder im Domänensystem bleiben, dem er gehört. Die KI kann den relevanten Zustand bei Bedarf über kontrollierten Kontext oder Tool-Zugriff erhalten.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-88\">Glossar\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Kernthemen\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"generative-model\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Generatives Modell\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Ein KI-Modell, das darauf ausgelegt ist, abgeleitete synthetische Inhalte wie Text, Bilder, Audio, Video, Code oder strukturierte Ausgaben zu erzeugen.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"retrieval\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Retrieval\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Der Prozess der Auswahl relevanter Informationen aus einer externen Quelle oder einem Speicher für die aktuelle Aufgabe.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"rag\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">RAG\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Retrieval-Augmented Generation: ein Muster, bei dem abgerufene externe Informationen einem generativen Modell bereitgestellt werden, um die aktuelle Ausgabe zu verbessern.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"tool\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Tool\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Eine Fähigkeit, die einer KI-Runtime zum Lesen von Daten, Berechnen, Suchen oder Ausführen einer externen Aktion bereitgestellt wird.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"context\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Kontext\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Die Informationen, die dem Modell für einen bestimmten Inferenzschritt zur Verfügung stehen.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"runtime-orchestrator\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Runtime \u002F Orchestrator\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Die Softwareschicht, die Modellaufrufe, Tool-Aufrufe, Aufgaben-Schleifen, Sitzungen, Wiederholungen, Ereignisse oder Ausführungsumgebungen koordiniert.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"application\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Anwendung\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Die Produkt- und Domänenschicht, die Benutzerinteraktion, autoritativen Zustand, Berechtigungen, Validierung, Persistenz und Geschäftsverhalten besitzt.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"provider\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Anbieter\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Der Dienst oder die Runtime, die Zugriff auf ein oder mehrere Modelle bereitstellt; Anbieteridentität und Modellidentität sind getrennte Angelegenheiten.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-90\">Primärquellen und Implementierungsnachweise\u003C\u002Fh2>\n\u003Cp>Die folgenden stabilen Definitionen sind in Standards\u002FForschung verankert; sich schnell entwickelnde Implementierungsbeispiele verwenden aktuelle offizielle Engineering-Dokumentation. Aaasaasa AI Client ist ein originaler Implementierungsnachweis und wurde gegen seinen Codebase-\u002FDokumentationsstand vom 26. Juli 2026 geprüft.\u003C\u002Fp>\n\u003Ca href=\"https:\u002F\u002Fnvlpubs.nist.gov\u002Fnistpubs\u002Fai\u002FNIST.AI.600-1.pdf\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">NIST AI 600-1 — Generative Artificial Intelligence Profile\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">NISTs Generative-AI-Profil, einschließlich der Definition generativer KI und der ausdrücklichen Unterscheidung zwischen Fragestellungen auf Modell-, System-, Anwendungs- und Anwendungsfall-Ebene.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_model\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">NIST — Artificial Intelligence Model\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Aktuelle NIST-Glossardefinition eines KI-Modells als Komponente eines Informationssystems, das mithilfe von KI-Techniken aus Eingaben Ausgaben erzeugt.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_system\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">NIST — Artificial Intelligence System\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Aktuelle NIST-Glossardefinition, die zeigt, dass ein KI-System Datensysteme, Software, Hardware, Anwendungen, Tools oder Utilities umfassen kann, die KI verwenden.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2005.11401\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Lewis et al. — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Das Paper von 2020, das die RAG-Formulierung einführte, die ein generatives Modell mit abgerufenem nicht-parametrischem Speicher kombiniert.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-file-search\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — File Search\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Aktuelle offizielle Dokumentation für gehosteten Dateiabruf in der Responses API unter Verwendung hochgeladener Dateiwissensbasen, semantischer Suche und Stichwortsuche.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ffunction-calling\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Function Calling\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Aktuelle offizielle Dokumentation, die Tool-\u002FFunktionsaufrufe als Schnittstelle zwischen Modellen und externen Systemen, Daten und Aktionen beschreibt.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Anthropic — Effective Context Engineering for AI Agents\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Engineering-Leitfaden, der Kontext als die während der LLM-Sampling verfügbare Token-Menge definiert und erklärt, warum die Kontextauswahl ein Problem endlicher Ressourcen ist.\u003C\u002Fp>\u003C\u002Fa>",{"time":211,"blocks":212,"version":1064},1791475471576,[213,219,227,234,242,247,252,257,264,269,274,306,311,316,359,364,369,374,379,384,389,394,401,410,415,420,425,430,436,441,446,451,456,461,466,471,476,481,486,491,497,502,507,542,547,552,583,588,593,599,604,609,614,641,647,652,681,686,691,731,736,741,774,779,784,789,816,821,826,831,837,842,847,855,863,868,873,878,883,888,893,898,903,908,913,918,923,957,962,990,995,1000,1010,1019,1028,1037,1046,1055],{"id":214,"data":215,"type":217,"tunes":218},"intro",{"text":216},"Generative KI ist keine einzelne Komponente. Ein produktives generatives KI-System kombiniert in der Regel ein generatives Modell mit Anwendungscode, der Anweisungen und Kontext bereitstellt, bei Bedarf externes Wissen abruft, Werkzeuge zum Lesen oder Ändern externer Systeme bereitstellt, Laufzeitstatus und Berechtigungen verwaltet und das Ergebnis in ein nutzbares Produkt verwandelt. Modell, Retrieval, Werkzeuge, Kontext, Laufzeit und Anwendung als dasselbe zu behandeln, verdeckt die Grenzen, die Aktualität, Sicherheit, Zuverlässigkeit, Kosten und Kontrolle bestimmen.","paragraph",{},{"id":220,"data":221,"type":225,"tunes":226},"direct",{"body":222,"title":223,"variant":224},"\u003Cstrong>Das Modell generiert; Retrieval findet externe Belege; Werkzeuge greifen auf Daten zu oder führen Aktionen aus; Kontext ist das, was das Modell für die aktuelle Inferenz sehen kann; die Laufzeit koordiniert die Ausführung; die Anwendung besitzt Produktregeln, Zustand, Berechtigungen, Persistenz und Benutzererfahrung.\u003C\u002Fstrong> Diese Schichten können von einem Anbieter zusammen verpackt werden, aber ihre Verantwortlichkeiten bleiben unterschiedlich.","Direkte Antwort","info","callout",{},{"id":228,"data":229,"type":225,"tunes":233},"scope-note",{"body":230,"title":231,"variant":232},"Dieser Artikel definiert dauerhafte architektonische Verantwortlichkeiten statt eines einzelnen Anbieter-Stacks. Aktuelle Implementierungsbeispiele wurden am \u003Cstrong>8. Oktober 2026\u003C\u002Fstrong> erneut überprüft. Anbieter-APIs und Produktnamen können sich ändern; die Verantwortungsgrenzen sind stabiler als jedes einzelne SDK oder jeder Endpunkt.","Hinweis zu Terminologie und Version","note",{},{"id":235,"data":236,"type":240,"tunes":241},"toc",{"title":237,"maxLevel":238,"minLevel":239},"Inhalt",3,2,"tableOfContents",{},{"id":243,"data":244,"type":41,"tunes":246},"h-meaning",{"text":245,"level":239},"Was bedeutet „generative KI“ eigentlich?",{},{"id":248,"data":249,"type":217,"tunes":251},"p-meaning-1",{"text":250},"Auf Modellebene bezieht sich generative KI auf KI-Modelle, die abgeleitete synthetische Inhalte wie Text, Bilder, Audio, Video, Code oder andere digitale Ausgaben erzeugen. NIST AI 600-1 verwendet diese modellorientierte Bedeutung und diskutiert Risiken separat auf Modell-, System-, Anwendungs- und Anwendungsfall-Ebene.",{},{"id":253,"data":254,"type":217,"tunes":256},"p-meaning-2",{"text":255},"Diese Unterscheidung ist wichtig, weil ein KI-Modell nicht dasselbe ist wie das vollständige KI-System. Das aktuelle Glossar von NIST definiert ein KI-Modell als eine Komponente, die mithilfe computergestützter, statistischer oder maschineller Lerntechniken aus Eingaben Ausgaben erzeugt, während ein KI-System Software, Hardware, Anwendungen, Werkzeuge oder Hilfsprogramme umfassen kann, die mithilfe von KI arbeiten.",{},{"id":258,"data":259,"type":225,"tunes":263},"model-system-rule",{"body":260,"title":261,"variant":262},"\u003Cstrong>Generatives Modell ≠ generative KI-Anwendung.\u003C\u002Fstrong>\u003Cbr>Ein Modell ist eine rechnerische Komponente. Ein nutzbares KI-Produkt ist ein System, das um diese Komponente herum aufgebaut ist.","Eine nützliche Grenze","success",{},{"id":265,"data":266,"type":41,"tunes":268},"h-simple",{"text":267,"level":239},"Das einfachste nützliche Modell eines generativen KI-Systems",{},{"id":270,"data":271,"type":217,"tunes":273},"p-simple-1",{"text":272},"Stellen Sie sich als erstes mentales Modell einen Unternehmensassistenten vor, der antwortet: „Kann dieser Kunde heute eine Rückerstattung erhalten?“ Eine nützliche Antwort kann mehrere unterschiedliche Verantwortlichkeiten erfordern. Das Sprachmodell kann die Frage interpretieren und die Erklärung schreiben, aber der aktuelle Bestellstatus kann aus einem Datenbankwerkzeug stammen, die Rückerstattungsrichtlinie kann aus dem Dokumentenabruf kommen, Berechtigungen können von der Anwendung durchgesetzt werden, und die endgültige Aktion kann einen kontrollierten API-Aufruf erfordern.",{},{"id":275,"data":276,"type":304,"tunes":305},"simple-flow",{"steps":277,"title":302,"orientation":303},[278,281,284,287,290,293,296,299],{"label":279,"description":280},"1. Benutzeranfrage","Die Anwendung empfängt eine natürlichsprachliche Frage oder Aufgabe.",{"label":282,"description":283},"2. Anwendungsrichtlinie und Zustand","Identität, Mandant, Berechtigungen, aktueller Workflow-Zustand und Produktregeln definieren, was die Anfrage tun darf.",{"label":285,"description":286},"3. Retrieval oder direkter Datenzugriff","Das System beschafft externe Belege oder aktuelle Fakten, wenn das Modellwissen nicht ausreicht.",{"label":288,"description":289},"4. Kontextaufbau","Anweisungen, Benutzereingabe, ausgewählte Belege, relevanter Zustand und Werkzeugdefinitionen werden für das Modell zusammengestellt.",{"label":291,"description":292},"5. Modellinferenz","Das generative Modell interpretiert den bereitgestellten Kontext und erzeugt Text, strukturierte Ausgabe oder eine Werkzeuganfrage.",{"label":294,"description":295},"6. Werkzeugausführung bei Bedarf","Die Laufzeit oder Anwendung validiert und führt genehmigte Werkzeugaufrufe außerhalb des Modells aus.",{"label":297,"description":298},"7. Beobachtung und Fortsetzung","Werkzeugergebnisse können als neuer Kontext für einen weiteren Inferenzschritt an das Modell zurückgegeben werden.",{"label":300,"description":301},"8. Validierung und Produktausgabe","Die Anwendung validiert das Ergebnis, zeichnet erforderlichen Zustand oder Auditdaten auf und präsentiert oder führt das endgültige Ergebnis aus.","Ein häufiger Ausführungspfad","auto","processFlow",{},{"id":307,"data":308,"type":217,"tunes":310},"p-simple-2",{"text":309},"Reale Systeme folgen nicht immer genau dieser Reihenfolge. Retrieval kann vor dem ersten Modellaufruf stattfinden, Werkzeuge können während einer Agentenschleife ausgewählt werden, deterministische Anwendungslogik kann das Modell vollständig umgehen, und Validierung kann in mehreren Phasen erfolgen. Der Punkt ist, Verantwortlichkeiten zu trennen, nicht einen universellen Workflow vorzuschreiben.",{},{"id":312,"data":313,"type":41,"tunes":315},"h-boundaries",{"text":314,"level":239},"Die sechs Grenzen, die zählen",{},{"id":317,"data":318,"type":357,"tunes":358},"boundary-comparison",{"rows":319,"title":345,"layout":346,"columns":347},[320,325,329,333,337,341],{"id":321,"label":322,"values":323},"model","Modell",[324,324,324],"",{"id":326,"label":327,"values":328},"retrieval","Retrieval",[324,324,324],{"id":330,"label":331,"values":332},"tools","Werkzeuge",[324,324,324],{"id":334,"label":335,"values":336},"context","Kontext",[324,324,324],{"id":338,"label":339,"values":340},"runtime","Laufzeit \u002F Orchestrator",[324,324,324],{"id":342,"label":343,"values":344},"application","Anwendung",[324,324,324],"Sechs Verantwortlichkeiten innerhalb eines KI-Produkts","table",[348,351,354],{"id":349,"label":350},"job","Hauptaufgabe",{"id":352,"label":353},"input","Typische Eingaben",{"id":355,"label":356},"not","Nicht dasselbe wie","comparison",{},{"id":360,"data":361,"type":41,"tunes":363},"h-model",{"text":362,"level":239},"1. Das Modell: Generierung ist seine Kernverantwortung",{},{"id":365,"data":366,"type":217,"tunes":368},"p-model-1",{"text":367},"Ein generatives Modell bildet bereitgestellte Eingaben auf generierte Ausgaben ab. Bei einem Sprachmodell kann das natürlichsprachlichen Text, strukturiertes JSON, Code, Klassifikationen, Zusammenfassungen, Pläne oder Argumente für Werkzeugaufrufe umfassen. Multimodale generative Modelle können mit zusätzlichen Eingabe- und Ausgabetypen arbeiten.",{},{"id":370,"data":371,"type":217,"tunes":373},"p-model-2",{"text":372},"Das Modell kann umfangreiches erlerntes Wissen in seinen Parametern enthalten, aber parametrisiertes Wissen ist keine Live-Datenbank. Das Modell weiß nicht automatisch von einem vor fünf Minuten erstellten Dokument, dem aktuellen Lagerbestand, einem privaten Kundendatensatz oder dem Zustand einer Anwendung, es sei denn, diese Informationen werden über den aktuellen Eingabepfad bereitgestellt.",{},{"id":375,"data":376,"type":217,"tunes":378},"p-model-3",{"text":377},"Deshalb löst ein Wechsel des Modells nicht automatisch veraltetes Wissen, fehlende Berechtigungen, fehlerhaftes Retrieval, falsche Zustandsverantwortung oder unsichere Werkzeugausführung. Diese Fehler gehören oft zu anderen Schichten.",{},{"id":380,"data":381,"type":41,"tunes":383},"h-retrieval",{"text":382,"level":239},"2. Retrieval: Das Auffinden externer Belege ist eine separate Operation",{},{"id":385,"data":386,"type":217,"tunes":388},"p-retrieval-1",{"text":387},"Retrieval wählt Informationen aus einer externen Quelle vor oder während der Generierung aus. Die Arbeit zur Retrieval-Augmented Generation aus dem Jahr 2020 von Lewis et al. machte die Trennung explizit, indem sie ein parametrisches generatives Modell mit abgerufenem nicht-parametrischem Speicher kombinierte. Moderne Produktionssysteme verwenden viele Retrieval-Varianten, aber die architektonische Idee bleibt: Nützliche Belege können zur Inferenzzeit abgerufen werden, anstatt sich nur auf das zu verlassen, was das Modell während des Trainings gelernt hat.",{},{"id":390,"data":391,"type":217,"tunes":393},"p-retrieval-2",{"text":392},"Retrieval kann lexikalische Suche, Embeddings, Vektorsuche, hybride Suche, SQL, Wissensgraphen, Metadatenfilter, APIs oder andere Auswahlmechanismen verwenden. Eine Vektordatenbank ist daher eine mögliche Retrieval-Komponente, nicht die Definition von RAG.",{},{"id":395,"data":396,"type":225,"tunes":400},"retrieval-rule",{"body":397,"title":398,"variant":399},"Eine abgerufene Passage kann hochrelevant und dennoch veraltet, nicht autorisiert, aus der falschen Version stammend oder unzureichend sein, um eine Aussage zu stützen. Retrieval-Qualität und Belegqualität müssen getrennt bewertet werden.","Relevanz ist keine Autorität","warning",{},{"id":402,"data":403,"type":408,"tunes":409},"ref-rag",{"url":404,"title":405,"excerpt":406,"ctaLabel":407},"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works","Was ist RAG? Die einfachste Erklärung, wie es funktioniert","Die kanonische allgemein verständliche Erklärung der Retrieval-Augmented Generation, einschließlich der Trennung zwischen LLM, Wissen, Zustand, Gedächtnis und Werkzeugen.","Die RAG-Grundlage lesen","referralArticle",{},{"id":411,"data":412,"type":41,"tunes":414},"h-tools",{"text":413,"level":239},"3. Werkzeuge: Zugriff und Aktion sind kein Modellwissen",{},{"id":416,"data":417,"type":217,"tunes":419},"p-tools-1",{"text":418},"Ein Werkzeug ist eine Schnittstelle, über die eine KI-Laufzeitumgebung Funktionalität außerhalb des Modells anfordern kann. Ein Werkzeug kann eine Datenbank abfragen, das Web durchsuchen, eine Datei lesen, einen Wert berechnen, einen internen Dienst aufrufen, ein Ticket erstellen, eine Nachricht senden, einen Datensatz ändern oder eine andere kontrollierte Operation auslösen.",{},{"id":421,"data":422,"type":217,"tunes":424},"p-tools-2",{"text":423},"Die aktuelle Funktionsaufruf-Dokumentation von OpenAI macht diese Grenze explizit: Funktionsaufrufe ermöglichen es Modellen, mit externen Systemen zu interagieren und auf Daten oder Aktionen zuzugreifen, die von der Anwendung bereitgestellt werden. Das Modell kann einen Aufruf vorschlagen oder auswählen, aber das externe System führt die eigentliche Operation aus.",{},{"id":426,"data":427,"type":217,"tunes":429},"p-tools-3",{"text":428},"Die Werkzeugnutzung wirft daher zwei separate Fragen auf: Kann das Modell diese Fähigkeit anfordern? Und wird die Anwendung sie autorisieren und ausführen? Ein Produktionssystem sollte die Absicht des Modells nicht mit der Berechtigung verwechseln, einen Seiteneffekt zu verursachen.",{},{"id":431,"data":432,"type":225,"tunes":435},"tool-rule",{"body":433,"title":434,"variant":262},"Ein Modell kann eine gültige Werkzeuganfrage ausgeben und dennoch abgelehnt werden. Autorisierung, Argumentvalidierung, Ratenbegrenzungen, Transaktionsregeln, Audit-Anforderungen und Rollback gehören außerhalb des Modells.","Modellabsicht ist keine Ausführungsbefugnis",{},{"id":437,"data":438,"type":41,"tunes":440},"h-context",{"text":439,"level":239},"4. Kontext: Was das Modell gerade jetzt sehen kann",{},{"id":442,"data":443,"type":217,"tunes":445},"p-context-1",{"text":444},"Kontext sind die Informationen, die dem Modell für einen bestimmten Inferenzschritt zur Verfügung stehen. Die Kontext-Engineering-Richtlinie von Anthropic beschreibt Kontext als die Menge von Tokens, die beim Sampling von einem LLM einbezogen werden. In der Praxis kann diese Menge Systemanweisungen, Benutzernachrichten, Gesprächsverlauf, abgerufene Belege, Werkzeugdefinitionen, Werkzeugergebnisse, Gedächtniszusammenfassungen und ausgewählten Anwendungszustand enthalten.",{},{"id":447,"data":448,"type":217,"tunes":450},"p-context-2",{"text":449},"Kontext ist daher weder die vollständige Wissensbasis noch das Langzeitgedächtnis. Ein Unternehmen kann zehn Millionen Dokumente speichern, während nur eine Handvoll Passagen in einen Modellaufruf gelangen. Eine Laufzeitumgebung kann ein Jahr Gesprächsverlauf persistieren, während nur die für die aktuelle Aufgabe benötigten Teile offengelegt werden.",{},{"id":452,"data":453,"type":217,"tunes":455},"p-context-3",{"text":454},"Das Kontextfenster schafft auch eine technische Einschränkung. Mehr Text hinzuzufügen garantiert keine bessere Antwort; irrelevante, veraltete, widersprüchliche oder wenig autoritative Informationen können die Belege verwässern, die tatsächlich wichtig sind.",{},{"id":457,"data":458,"type":41,"tunes":460},"h-runtime",{"text":459,"level":239},"5. Laufzeitumgebung und Orchestrierung: Koordination der Schleife",{},{"id":462,"data":463,"type":217,"tunes":465},"p-runtime-1",{"text":464},"Die Laufzeitumgebung oder Orchestrierungsschicht koordiniert, wie das Modell an einer Aufgabe teilnimmt. Je nach Architektur kann sie Sitzungen, Modellanfragen, Werkzeugerkennung, Werkzeugaufrufschleifen, Wiederholungsversuche, Übergaben, Streaming-Ereignisse, Timeouts, Checkpoints, Kompaktierung oder Ausführungsumgebungen verwalten.",{},{"id":467,"data":468,"type":217,"tunes":470},"p-runtime-2",{"text":469},"Einige Laufzeitumgebungen sind dünner Anwendungscode um eine Modell-API. Andere sind vollständige Agent-Harnesse. Eine verwaltete Anbieter-Laufzeitumgebung kann einen Teil der Schleife übernehmen, während die Anwendung weiterhin die Domänenwahrheit, Autorisierung, geschäftliche Seiteneffekte und den Produktlebenszyklus besitzt.",{},{"id":472,"data":473,"type":217,"tunes":475},"p-runtime-3",{"text":474},"Diese Grenze ist wichtig, weil wo die Laufzeitumgebung läuft und wo die Inferenz läuft separate Entscheidungen sind. Ein lokal laufender Client- oder Agent-Prozess kann dennoch ein entferntes Modell aufrufen, während eine entfernte Anwendung ein Modell aufrufen kann, das auf Infrastruktur unter der Kontrolle der Organisation gehostet wird.",{},{"id":477,"data":478,"type":41,"tunes":480},"h-application",{"text":479,"level":239},"6. Die Anwendung: Wo KI zu einem Produkt wird",{},{"id":482,"data":483,"type":217,"tunes":485},"p-app-1",{"text":484},"Die Anwendung ist die Produktgrenze um die KI-Komponenten. Sie verantwortet die Benutzererfahrung, das Domänenmodell, den aktuellen Zustand, die Identität, den Mandantenbereich, Berechtigungen, Persistenz, Dienstintegrationen, Validierung, Observability, Abrechnungs- oder Kontingentlogik, sofern relevant, sowie die Regeln, die bestimmen, was die KI sehen oder tun darf.",{},{"id":487,"data":488,"type":217,"tunes":490},"p-app-2",{"text":489},"Diese Schicht verwandelt „ein Modell kann nützliche Ausgaben erzeugen“ in „ein System kann eine zuverlässige Fähigkeit bereitstellen“. Dasselbe Modell kann an einem privaten Rechercheassistenten, einem Support-Workflow, einem Code-Agenten oder einer Commerce-Anwendung teilnehmen, weil die umgebende Anwendung die Daten, Werkzeuge, Richtlinien, den Zustand und den Ausführungsvertrag verändert.",{},{"id":492,"data":493,"type":225,"tunes":496},"app-rule",{"body":494,"title":495,"variant":224},"Anbieter- und Modellaustausch kann ein architektonisches Ziel sein. Der autoritative Zustand, die Berechtigungen, Domänenregeln, der Audit-Trail und der Benutzervertrag der Anwendung können nicht einfach an das gerade ausgewählte Modell delegiert werden.","Das Modell ist austauschbar; die Produktgrenze nicht",{},{"id":498,"data":499,"type":41,"tunes":501},"h-work-together",{"text":500,"level":239},"Wie die Teile in einer realen Anfrage zusammenwirken",{},{"id":503,"data":504,"type":217,"tunes":506},"p-together-1",{"text":505},"Betrachten Sie einen Support-Assistenten, der gefragt wird: „Erstatte Bestellung 4711, wenn sie noch berechtigt ist, und erkläre warum.“ Die Anfrage kombiniert Wissen, aktuellen Zustand, Autorisierung, Schlussfolgerung und einen Seiteneffekt.",{},{"id":508,"data":509,"type":346,"tunes":541},"support-table",{"content":510,"stretched":42,"withHeadings":13},[511,515,518,522,526,530,534,537],[512,513,514],"Bedarf","Korrekte Schicht","Warum",[516,327,517],"Erstattungsrichtlinie","Das System muss die aktuell geltende Richtlinie finden und ihre Herkunft bewahren.",[519,520,521],"Status von Bestellung 4711","Direkter Daten-\u002FWerkzeugzugriff","Der aktuelle Bestelldatensatz ist flüchtiger autoritativer Zustand und nichts, was aus Modellwissen geraten werden sollte.",[523,524,525],"Berechtigung des Benutzers zur Erstattung","Anwendung \u002F Autorisierung","Berechtigungen müssen unabhängig davon durchgesetzt werden, was das Modell anfragt.",[527,528,529],"Richtlinie anhand der Bestellfakten auslegen","Modell + Kontext","Das Modell kann über die ihm bereitgestellten Richtlinienbelege und den aktuellen Bestellstatus schlussfolgern.",[531,532,533],"Erstattung ausführen","Werkzeug + Anwendungstransaktionsregeln","Eine kontrollierte externe Operation verändert realen Zustand.",[535,322,536],"Ergebnis erklären","Das Modell kann die benutzergerichtete Erklärung aus validierten Ergebnissen generieren.",[538,539,540],"Auditieren, was passiert ist","Anwendung \u002F Laufzeit","Das System zeichnet Belege, Aufrufe, Entscheidungen, Seiteneffekte und Fehler wie erforderlich auf.",{},{"id":543,"data":544,"type":217,"tunes":546},"p-together-2",{"text":545},"Wenn der Assistent nur über das Sprachmodell verfügt, kann er über Erstattungen sprechen, aber nicht sicher wissen, ob Bestellung 4711 derzeit berechtigt ist, oder die Transaktion durchführen. Wenn er nur über Retrieval verfügt, kann er die Richtlinie finden, aber es fehlt ihm weiterhin der Live-Bestellstatus. Wenn er über Werkzeuge ohne Anwendungsautorisierung verfügt, kann er leistungsfähig, aber unsicher werden. Zuverlässigkeit entsteht durch die Komposition der Schichten mit expliziter Verantwortlichkeit.",{},{"id":548,"data":549,"type":41,"tunes":551},"h-configs",{"text":550,"level":239},"Verschiedene KI-Produkte verwenden unterschiedliche Kombinationen",{},{"id":553,"data":554,"type":357,"tunes":582},"config-comparison",{"rows":555,"title":572,"layout":346,"columns":573},[556,560,564,568],{"id":557,"label":558,"values":559},"bare","Nur-Modell-Assistent",[324,324,324,324],{"id":561,"label":562,"values":563},"rag","Retrieval-gestützter Assistent",[324,324,324,324],{"id":565,"label":566,"values":567},"tool","Werkzeugnutzender Assistent",[324,324,324,324],{"id":569,"label":570,"values":571},"agent","Agentische Anwendung",[324,324,324,324],"Die Anwesenheit eines Modells definiert nicht die gesamte Architektur",[574,575,576,579],{"id":326,"label":327},{"id":330,"label":331},{"id":577,"label":578},"state","Autoritativer Zustand",{"id":580,"label":581},"result","Typische Fähigkeit",{},{"id":584,"data":585,"type":217,"tunes":587},"p-configs-1",{"text":586},"Dies sind Architekturmuster, keine Reifegrad-Rankings. Eine Nur-Modell-Funktion kann das richtige Design sein, wenn die Aufgabe keine externen Fakten oder Aktionen benötigt. Das Hinzufügen von Retrieval, Werkzeugen, Gedächtnis oder einer Agentenschleife ist nur gerechtfertigt, wenn die Aufgabe diese Fähigkeiten erfordert.",{},{"id":589,"data":590,"type":41,"tunes":592},"h-implementation",{"text":591,"level":239},"Implementierungsnachweis: Aaasaasa AI Client",{},{"id":594,"data":595,"type":225,"tunes":598},"implementation-scope",{"body":596,"title":597,"variant":232},"Der folgende Abschnitt beschreibt eine Implementierung, die ich erstellt und gegen die Codebasis und Architektur dokumentation des Aaasaasa AI Client mit Stand \u003Cstrong>26. Juli 2026\u003C\u002Fstrong> überprüft habe. Sie ist ein Nachweis für die Nützlichkeit dieser Grenzen, nicht die Behauptung, dass eine Implementierung ein universeller Standard oder ein kommerziell eingesetztes Unternehmensprodukt ist.","Primärer Implementierungsnachweis",{},{"id":600,"data":601,"type":217,"tunes":603},"p-impl-1",{"text":602},"Aaasaasa AI Client ist ein lokal-first Desktop-KI-Arbeitsbereich, der mit Nuxt 4, Electron und TypeScript erstellt wurde. Sein AI Hub trennt bewusst Agent\u002FClient, Anbieter, Modell, Laufzeitort, Berechtigungen und Webclient, anstatt sie als eine einzige „KI“-Einstellung zu behandeln.",{},{"id":605,"data":606,"type":217,"tunes":608},"p-impl-2",{"text":607},"Diese Trennung erzeugt konkretes Verhalten. Direct Chat kann mit Modellen sprechen, ohne Dateisystem- oder Shell-Werkzeuge. Ein Codex-Agent kann einen ausgewählten Arbeitsbereich und ein Berechtigungsprofil verwenden. Ollama kann direkte lokale Inferenz bereitstellen, während LM Studio und konfigurierbare OpenAI-kompatible Endpunkte andere Anbieterpfade darstellen. Ein lokal laufender Codex-Prozess kann dennoch ein Cloud-Modell verwenden, sodass UI und Architektur lokale Laufzeit nicht mit lokaler Inferenz gleichsetzen.",{},{"id":610,"data":611,"type":217,"tunes":613},"p-impl-3",{"text":612},"Die Implementierung enthält außerdem Qdrant-\u002FVektor-Unterstützung, Dokumentenextraktionsfähigkeiten und einen authentifizierten Directory-MCP-Broker. Diese Komponenten veranschaulichen eine weitere Grenze: Retrieval-Infrastruktur und Werkzeugzugriff können im selben Produkt leben, ohne zu Eigenschaften des Modells selbst zu werden.",{},{"id":615,"data":616,"type":346,"tunes":640},"impl-map",{"content":617,"stretched":42,"withHeadings":13},[618,621,623,626,629,632,635,638],[619,620],"A01-Konzept","Implementierungsnachweis im Aaasaasa AI Client",[322,622],"Eine anbieterspezifische Modellkennung wird getrennt von Anbieter und Laufzeit ausgewählt.",[624,625],"Anbieter","Ollama, LM Studio, OpenAI-kompatible Dienste und andere Anbieterpfade werden getrennt dargestellt.",[627,628],"Laufzeit","Der lokale oder entfernte Agent-\u002FLaufzeitort wird unabhängig vom Modell verfolgt.",[630,631],"Werkzeuge \u002F Zugriff","Direct Chat hat keine Dateisystem- oder Shell-Werkzeuge; kontrollierter Verzeichniszugriff wird separat vermittelt.",[633,634],"Berechtigungen","Arbeitsbereichs-Berechtigungsprofile sind Anwendungs-\u002FSitzungsrichtlinie, keine Modellfähigkeit.",[636,637],"Retrieval-Infrastruktur","Vektor-Unterstützung und Dokumentenextraktion existieren als Daten-\u002FRetrieval-Fähigkeiten statt als Modellfunktionen.",[343,639],"Das Electron\u002FNuxt-Produkt koordiniert UI, Anmeldedaten, Anbieter, Laufzeiterkennung, Berechtigungen, Werkzeuge und Modellinteraktion.",{},{"id":642,"data":643,"type":225,"tunes":646},"impl-lesson",{"body":644,"title":645,"variant":262},"Die Architektur wurde leichter nachvollziehbar, sobald \u003Cstrong>Modell, Anbieter, Laufzeit, Berechtigungen, Werkzeuge, Daten und Client\u003C\u002Fstrong> nicht mehr als eine Konfigurationsentscheidung dargestellt wurden. Die Unterscheidung ist operativ: Sie bestimmt, was lokal laufen kann, was auf Dateien zugreifen darf, was kostenpflichtige Cloud-Inferenz aufrufen darf und welche Schicht die Autorisierung verantwortet.","Implementierungslektion",{},{"id":648,"data":649,"type":41,"tunes":651},"h-errors",{"text":650,"level":239},"Häufige Kategorienfehler",{},{"id":653,"data":654,"type":346,"tunes":680},"errors-table",{"content":655,"stretched":42,"withHeadings":13},[656,659,662,665,668,671,674,677],[657,658],"Kategorienfehler","Was tatsächlich passiert",[660,661],"„Die KI kennt unsere Dokumente.“","Die Anwendung oder die Retrieval-Schicht stellt dem Modell ausgewählte Dokumentinhalte zur Verfügung.",[663,664],"„RAG ist unsere Vektordatenbank.“","Die Vektordatenbank kann ein Index oder Speicher sein, der von einer Retrieval-Pipeline genutzt wird; RAG ist das Muster aus Retrieval und Generierung.",[666,667],"„Das Modell hat unser CRM aufgerufen.“","Das Modell hat eine Tool-Anfrage erzeugt; die Laufzeitumgebung bzw. die Anwendung hat den externen Aufruf autorisiert und ausgeführt.",[669,670],"„Es ist lokale KI, weil der Desktop-Agent lokal läuft.“","Ausführungsort und Inferenzort sind getrennt. Eine lokale Laufzeitumgebung kann dennoch ein entferntes Modell aufrufen.",[672,673],"„Das Modell hat die Berechtigung, Dateien zu bearbeiten.“","Die Anwendung bzw. die Laufzeitumgebung gewährt eine Tool-Fähigkeit im Rahmen einer Berechtigungsrichtlinie; eine Berechtigung ist keine intrinsische Eigenschaft des Modells.",[675,676],"„Mehr Kontext bedeutet mehr Wissen.“","Kontext ist die endliche Eingabe, die für eine Inferenz bereitgestellt wird. Größerer Kontext kann mehr Rauschen, Konflikte oder veraltete Informationen enthalten.",[678,679],"„Der Chatbot ist die KI-Architektur.“","Die Chat-Oberfläche ist eine Schnittstelle. Das System kann auch Identität, Zustand, Retrieval, Tools, Laufzeitumgebung, Validierung, Persistenz und Observability umfassen.",{},{"id":682,"data":683,"type":41,"tunes":685},"h-failures",{"text":684,"level":239},"Fehlermodi, wenn die Grenzen zusammenbrechen",{},{"id":687,"data":688,"type":217,"tunes":690},"p-failure-intro",{"text":689},"Grenzfehler sind nicht nur Terminologieprobleme. Sie erzeugen unterschiedliche Produktionsfehler, die unterschiedliche Korrekturen erfordern.",{},{"id":692,"data":693,"type":357,"tunes":730},"failure-comparison",{"rows":694,"title":719,"layout":346,"columns":720},[695,699,703,707,711,715],{"id":696,"label":697,"values":698},"stale","Veraltete Antwort",[324,324,324],{"id":700,"label":701,"values":702},"missing","Fehlende Unternehmensinformation",[324,324,324],{"id":704,"label":705,"values":706},"unsafe","Unsichere Nebenwirkung",[324,324,324],{"id":708,"label":709,"values":710},"noise","Verwirrte Antwort bei viel bereitgestelltem Text",[324,324,324],{"id":712,"label":713,"values":714},"route","Unerwartete Cloud-Nutzung",[324,324,324],{"id":716,"label":717,"values":718},"loop","Agent stockt oder wiederholt sich",[324,324,324],"Diagnostizieren Sie die fehlerhafte Schicht, bevor Sie das Modell ersetzen",[721,724,727],{"id":722,"label":723},"symptom","Symptom",{"id":725,"label":726},"likely","Wahrscheinliches Grenzproblem",{"id":728,"label":729},"fix","Erste architektonische Prüfung",{},{"id":732,"data":733,"type":41,"tunes":735},"h-version",{"text":734,"level":239},"Was ist stabil und was ist versionsabhängig?",{},{"id":737,"data":738,"type":217,"tunes":740},"p-version-1",{"text":739},"Die architektonischen Unterscheidungen in diesem Artikel sind bewusst herstellerneutral. Die aktuellen Beispiele unten sind Implementierungsfakten, die bei der Weiterentwicklung von APIs erneut überprüft werden sollten.",{},{"id":742,"data":743,"type":346,"tunes":773},"version-table",{"content":744,"stretched":42,"withHeadings":13},[745,749,753,757,761,765,769],[746,747,748],"Bereich","Stabile architektonische Idee","Verifiziertes aktuelles Beispiel am 8. Okt. 2026",[750,751,752],"KI-Modell vs. System","Ein Modell ist eine Komponente innerhalb eines umfassenderen Systems","Das aktuelle Glossar von NIST definiert KI-Modell und KI-System getrennt.",[754,755,756],"RAG","Die Generierung kann auf abgerufene externe Informationen konditioniert werden","Die Formulierung von Lewis et al. 2020 bleibt die grundlegende Referenz; Produktions-Retrieval-Methoden gehen heute weit über ein einzelnes dichtes Indexdesign hinaus.",[758,759,760],"Gehostetes Retrieval","Retrieval kann als verwaltetes Tool bereitgestellt werden","OpenAI File Search ist derzeit ein Responses-API-Tool, das hochgeladene Dateiwissensbasen mithilfe semantischen und schlüsselwortbasierten Retrievals durchsucht.",[762,763,764],"Funktions-\u002FTool-Aufruf","Ein Modell kann anwendungsdefinierte externe Fähigkeiten anfordern","OpenAI dokumentiert Funktionsaufrufe derzeit als Schnittstelle zu externen Systemen, Daten und Aktionen.",[766,767,768],"Kontext-Engineering","Das Modellverhalten hängt von den endlichen Informationen ab, die für die aktuelle Inferenz bereitgestellt werden","Die aktuelle Engineering-Anleitung von Anthropic definiert Kontext als die Token-Menge, die beim Sampling aus dem LLM einbezogen wird, und konzentriert sich auf die Kuratierung dieser Menge.",[770,771,772],"Hersteller-APIs","SDKs, Tool-Namen, Endpunktformen und unterstützte Funktionen ändern sich","Behandeln Sie Herstellerdokumentation als versionsabhängig, auch wenn die Verantwortungsgrenze stabil bleibt.",{},{"id":775,"data":776,"type":217,"tunes":778},"p-version-2",{"text":777},"Ein Artikel, der als Quelle der Wahrheit dienen soll, sollte daher beide Ebenen bewahren: stabile Konzepte für die Architektur und datierte Belege für aktuelle Implementierungen. Die Vermischung beider lässt einen Artikel unnötig schnell veralten.",{},{"id":780,"data":781,"type":41,"tunes":783},"h-test",{"text":782,"level":239},"Der KI-Komponentengrenzentest",{},{"id":785,"data":786,"type":217,"tunes":788},"p-test-1",{"text":787},"Wenn Sie eine KI-Funktion bewerten, stellen Sie die folgenden Fragen in dieser Reihenfolge. Die Antworten zeigen, welche Komponenten das System tatsächlich hat und welche Verantwortlichkeiten noch implizit sind.",{},{"id":790,"data":791,"type":304,"tunes":815},"boundary-test",{"steps":792,"title":814,"orientation":303},[793,796,799,802,805,808,811],{"label":794,"description":795},"1. Was erzeugt die Ausgabe?","Identifizieren Sie das genaue Modell und die Modalitäten oder strukturierten Ausgaben, die es bereitstellt.",{"label":797,"description":798},"2. Welche Fakten sind außerhalb des Modells maßgeblich?","Identifizieren Sie Dokumente, Datenbanken, APIs, aktuellen Zustand und andere Wahrheitsquellen.",{"label":800,"description":801},"3. Wie werden relevante Informationen ausgewählt?","Trennen Sie direkte Suche, Suchvorgang, Retrieval, Ranking und Kontextkonstruktion.",{"label":803,"description":804},"4. Was kann echte Nebenwirkungen verursachen?","Listen Sie Tools und externe Aktionen auf und identifizieren Sie dann, wer sie validiert und autorisiert.",{"label":806,"description":807},"5. Was erreicht das Modell als Kontext?","Machen Sie Anweisungen, Belege, Zustand, Verlauf, Gedächtnis und Tool-Definitionen explizit.",{"label":809,"description":810},"6. Wer besitzt die Schleife?","Identifizieren Sie die Laufzeitumgebung oder das Harness, das Aufrufe, Ereignisse, Wiederholungen, Tool-Schleifen und Sitzungen verwaltet.",{"label":812,"description":813},"7. Was bleibt in der Verantwortung der Anwendung?","Machen Sie Identität, Berechtigungen, Domänenzustand, Validierung, Persistenz, Observability und UX explizit.","Sieben Fragen für ein Produktionsdesign",{},{"id":817,"data":818,"type":41,"tunes":820},"h-not",{"text":819,"level":239},"Was generative KI nicht ist",{},{"id":822,"data":823,"type":217,"tunes":825},"p-not-1",{"text":824},"Generative KI ist nicht gleichbedeutend mit einem LLM, obwohl LLMs eine bedeutende Klasse generativer Modelle sind. Sie ist auch nicht gleichbedeutend mit RAG, einer Vektordatenbank, einem Agenten, einem Tool-Protokoll, einer Chatbot-Oberfläche oder einer Anwendung.",{},{"id":827,"data":828,"type":217,"tunes":830},"p-not-2",{"text":829},"Diese Konzepte können verbunden sein, aber jedes beantwortet eine andere architektonische Frage. Ein LLM fragt, wie Sprachausgabe erzeugt wird. Retrieval fragt, woher externe Belege kommen. Tools fragen, wie externe Fähigkeiten bereitgestellt werden. Kontext fragt, was das Modell sehen kann. Laufzeitumgebung fragt, wie die Ausführung koordiniert wird. Die Anwendung fragt, wie die Fähigkeit zu einem kontrollierten Produkt wird.",{},{"id":832,"data":833,"type":225,"tunes":836},"remember",{"body":834,"title":835,"variant":262},"\u003Cstrong>Modell = generieren.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Retrieval = Belege finden.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Tools = außerhalb des Modells lesen oder handeln.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Kontext = was das Modell jetzt sieht.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Laufzeitumgebung = Ausführung koordinieren.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Anwendung = Produkt, Zustand, Regeln und Berechtigungen besitzen.\u003C\u002Fstrong>","Wenn Sie sich nur ein Modell merken",{},{"id":838,"data":839,"type":41,"tunes":841},"h-next",{"text":840,"level":239},"Wohin als Nächstes im Wissensgraphen",{},{"id":843,"data":844,"type":217,"tunes":846},"p-next-1",{"text":845},"Sobald diese Grenzen klar sind, lassen sich tiefergehende Themen leichter einordnen. RAG gehört zu Retrieval und Kontextkonstruktion. Retrieval Trigger entscheidet, wann externe Belege erforderlich sind. Agent Memory betrifft das, was über die Zeit hinweg bestehen bleibt. Tool Calling und MCP gehören zum Fähigkeitszugriff. Agent Harnesses gehören zur Laufzeitorchestrierung. RBAC, Mandantentrennung und Domänenautorisierung gehören zur Anwendungs- und Plattformsicherheitsgrenze.",{},{"id":848,"data":849,"type":408,"tunes":854},"ref-data",{"url":850,"title":851,"excerpt":852,"ctaLabel":853},"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fwhere-does-an-llm-get-its-data-rag-data-sources-in-python","Woher bezieht ein LLM seine Daten? RAG-Datenquellen in Python","Eine praktische Fortsetzung, die zeigt, wie Dateien, SQL, APIs, Volltextsuche, Embeddings und Kontextzusammenstellung externe Daten mit einem LLM verbinden.","Den Datenpfad im Code sehen",{},{"id":856,"data":857,"type":408,"tunes":862},"ref-trigger",{"url":858,"title":859,"excerpt":860,"ctaLabel":861},"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger","Wann sollte eine KI aufhören, ihrem eigenen Wissen zu vertrauen? — Der Retrieval-Trigger","Ein Entscheidungsmodell dafür, wann ein KI-System aufhören sollte, sich nur auf Modellwissen zu verlassen, und externe Belege einholen sollte.","Das Retrieval-Entscheidungsmodell lesen",{},{"id":864,"data":865,"type":41,"tunes":867},"h-limit",{"text":866,"level":239},"Einschränkungen",{},{"id":869,"data":870,"type":217,"tunes":872},"p-limit-1",{"text":871},"Das Sechs-Schichten-Modell ist eine Verantwortungskarte, keine Anforderung, dass jedes Produkt sechs separate Dienste bereitstellen muss. Eine kleine Anwendung kann Kontextkonstruktion, Retrieval und Orchestrierung innerhalb eines Prozesses implementieren. Eine verwaltete Plattform kann mehrere Verantwortlichkeiten hinter einer API bündeln. Die physische Bereitstellung kann kombiniert werden, während die semantische Zuständigkeit getrennt bleibt.",{},{"id":874,"data":875,"type":217,"tunes":877},"p-limit-2",{"text":876},"Auch die Terminologie variiert zwischen Anbietern und Forschung. „Agent“, „Runtime“, „Memory“, „Tool“, „Connector“ und „Kontext“ können unterschiedlich definiert werden. Die hier gewählten Definitionen sollen operative Zuständigkeit und Fehlerdiagnose explizit machen, nicht behaupten, dass jedes Framework identische Vokabeln verwendet.",{},{"id":879,"data":880,"type":217,"tunes":882},"p-limit-3",{"text":881},"Der Abschnitt Aaasaasa AI Client dokumentiert ein Implementierungsmuster. Er zeigt, dass explizite Grenzen praktikabel sind, beweist aber nicht, dass dasselbe Komponentenlayout für jedes KI-Produkt optimal ist.",{},{"id":884,"data":885,"type":41,"tunes":887},"h-change",{"text":886,"level":239},"Was würde diese Antwort ändern?",{},{"id":889,"data":890,"type":217,"tunes":892},"p-change-1",{"text":891},"Die Verantwortungskarte müsste überarbeitet werden, wenn Modellarchitekturen selbst begannen, autoritativen externen Zustand, Berechtigungen, dauerhafte transaktionale Seiteneffekte und verifizierbaren Quellenzugriff als intrinsische Eigenschaften zu besitzen, statt als Fähigkeiten, die von einem umgebenden System bereitgestellt werden. Aktuelle Produktionsarchitekturen machen das nicht zu einer sicheren allgemeinen Annahme.",{},{"id":894,"data":895,"type":217,"tunes":897},"p-change-2",{"text":896},"Einzelne Implementierungsbeispiele werden sich viel schneller ändern. Gehostete Retrieval-Tools, Agent-APIs, MCP-Integrationen, Kontextmanagement-Funktionen und Anbieterfähigkeiten entwickeln sich schnell. Diese Details sollten aktualisiert werden, ohne die zugrunde liegenden Unterscheidungen zwischen Generierung, Evidenz, Fähigkeitszugriff, Kontext, Ausführung und Anwendungssteuerung aufzulösen.",{},{"id":899,"data":900,"type":41,"tunes":902},"h-conclusion",{"text":901,"level":239},"Fazit",{},{"id":904,"data":905,"type":217,"tunes":907},"p-conclusion-1",{"text":906},"Generative KI lässt sich leichter entwerfen, sobald „die KI“ nicht mehr als eine Blackbox behandelt wird. Das Modell ist die generative Komponente, nicht das vollständige Produkt. Retrieval liefert externe Evidenz. Tools stellen Fähigkeiten bereit. Kontext trägt ausgewählte Informationen in die aktuelle Inferenz. Die Runtime koordiniert die Ausführung. Die Anwendung besitzt die autoritative Produktgrenze.",{},{"id":909,"data":910,"type":217,"tunes":912},"p-conclusion-2",{"text":911},"Diese Trennung ist mehr als eine Erklärung. Sie sagt Ingenieuren, wo veraltete Fakten entstehen, wohin Autorisierung gehört, warum eine lokale Runtime dennoch Cloud-Inferenz nutzen kann, warum RAG nicht gleich einer Vektordatenbank ist, warum Tool-Aufrufe Validierung erfordern und warum ein Modellwechsel nicht jeden Systemfehler beheben kann.",{},{"id":914,"data":915,"type":217,"tunes":917},"p-conclusion-3",{"text":916},"Die dauerhafte Architekturfrage lautet daher nicht „Welches KI-Modell verwenden wir?“ Sie lautet: Welche Verantwortung besitzt jede Komponente, welche Evidenz überschreitet jede Grenze, und welche Schicht darf echten Zustand ändern?",{},{"id":919,"data":920,"type":41,"tunes":922},"h-faq",{"text":921,"level":239},"FAQ",{},{"id":924,"data":925,"type":924,"tunes":956},"faq",{"items":926,"title":955},[927,931,935,939,943,947,951],{"id":928,"answer":929,"question":930},"faq1","Nein. Ein LLM ist eine Art generatives Modell. Generative KI umfasst auch andere Modalitäten, und ein produktives generatives KI-System kann Retrieval, Tools, Runtime-Logik, Anwendungszustand, Berechtigungen, Persistenz und Benutzeroberflächen um das Modell herum enthalten.","Ist generative KI dasselbe wie ein LLM?",{"id":932,"answer":933,"question":934},"faq2","Normalerweise nein. RAG ist ein Anwendungs-\u002FSystemmuster, das externe Informationen abruft und dem Modell ausgewählte Evidenz bereitstellt. Einige Plattformen bündeln Retrieval eng mit Modell-APIs, aber die Verantwortung bleibt getrennt.","Ist RAG Teil des Modells?",{"id":936,"answer":937,"question":938},"faq3","Nein. RAG kann Vektorsuche, lexikalische Suche, hybride Suche, SQL, APIs, Wissensgraphen oder andere Methoden verwenden. Die definierende Eigenschaft ist der Abruf externer Informationen für die Generierung, nicht eine einzelne Speichertechnologie.","Ist eine Vektordatenbank für RAG erforderlich?",{"id":940,"answer":941,"question":942},"faq4","Nein. Ein Tool ist eine externe Fähigkeit. Seine Definition kann im Kontext dargestellt werden, und sein Ergebnis kann später in den Kontext gelangen, aber die eigentliche Fähigkeit wird außerhalb des Modells ausgeführt.","Sind Tools dasselbe wie Kontext?",{"id":944,"answer":945,"question":946},"faq5","Nein. Runtime-Standort und Inferenz-Standort sind getrennt. Eine lokale Desktop-Anwendung oder ein Agent kann ein entferntes Modell aufrufen, während eine entfernte Anwendung ein intern gehostetes Modell aufrufen kann.","Bedeutet der lokale Betrieb eines KI-Clients, dass das Modell lokal ist?",{"id":948,"answer":949,"question":950},"faq6","Die Anwendungs- oder Runtime-Sicherheitsgrenze sollte die Autorisierung durchsetzen. Ein Modell kann eine Operation anfordern, aber die Absicht des Modells sollte niemals als ausreichende Ausführungsberechtigung behandelt werden.","Wer sollte Berechtigungen für KI-Tools durchsetzen?",{"id":952,"answer":953,"question":954},"faq7","Autoritativer flüchtiger Zustand sollte normalerweise in der Anwendung oder im Domänensystem bleiben, dem er gehört. Die KI kann den relevanten Zustand bei Bedarf über kontrollierten Kontext oder Tool-Zugriff erhalten.","Wohin gehört der aktuelle Anwendungszustand?","Systemgrenzen generativer KI",{},{"id":958,"data":959,"type":41,"tunes":961},"h-glossary",{"text":960,"level":239},"Glossar",{},{"id":963,"data":964,"type":963,"tunes":989},"glossary",{"title":965,"entries":966},"Kernthemen",[967,971,973,975,978,980,984,986],{"term":968,"anchor":969,"definition":970},"Generatives Modell","generative-model","Ein KI-Modell, das darauf ausgelegt ist, abgeleitete synthetische Inhalte wie Text, Bilder, Audio, Video, Code oder strukturierte Ausgaben zu erzeugen.",{"term":327,"anchor":326,"definition":972},"Der Prozess der Auswahl relevanter Informationen aus einer externen Quelle oder einem Speicher für die aktuelle Aufgabe.",{"term":754,"anchor":561,"definition":974},"Retrieval-Augmented Generation: ein Muster, bei dem abgerufene externe Informationen einem generativen Modell bereitgestellt werden, um die aktuelle Ausgabe zu verbessern.",{"term":976,"anchor":565,"definition":977},"Tool","Eine Fähigkeit, die einer KI-Runtime zum Lesen von Daten, Berechnen, Suchen oder Ausführen einer externen Aktion bereitgestellt wird.",{"term":335,"anchor":334,"definition":979},"Die Informationen, die dem Modell für einen bestimmten Inferenzschritt zur Verfügung stehen.",{"term":981,"anchor":982,"definition":983},"Runtime \u002F Orchestrator","runtime-orchestrator","Die Softwareschicht, die Modellaufrufe, Tool-Aufrufe, Aufgaben-Schleifen, Sitzungen, Wiederholungen, Ereignisse oder Ausführungsumgebungen koordiniert.",{"term":343,"anchor":342,"definition":985},"Die Produkt- und Domänenschicht, die Benutzerinteraktion, autoritativen Zustand, Berechtigungen, Validierung, Persistenz und Geschäftsverhalten besitzt.",{"term":624,"anchor":987,"definition":988},"provider","Der Dienst oder die Runtime, die Zugriff auf ein oder mehrere Modelle bereitstellt; Anbieteridentität und Modellidentität sind getrennte Angelegenheiten.",{},{"id":991,"data":992,"type":41,"tunes":994},"h-sources",{"text":993,"level":239},"Primärquellen und Implementierungsnachweise",{},{"id":996,"data":997,"type":217,"tunes":999},"p-sources-note",{"text":998},"Die folgenden stabilen Definitionen sind in Standards\u002FForschung verankert; sich schnell entwickelnde Implementierungsbeispiele verwenden aktuelle offizielle Engineering-Dokumentation. Aaasaasa AI Client ist ein originaler Implementierungsnachweis und wurde gegen seinen Codebase-\u002FDokumentationsstand vom 26. Juli 2026 geprüft.",{},{"id":1001,"data":1002,"type":1008,"tunes":1009},"src-nist-profile",{"link":1003,"meta":1004},"https:\u002F\u002Fnvlpubs.nist.gov\u002Fnistpubs\u002Fai\u002FNIST.AI.600-1.pdf",{"image":1005,"title":1006,"description":1007},{"url":324},"NIST AI 600-1 — Generative Artificial Intelligence Profile","NISTs Generative-AI-Profil, einschließlich der Definition generativer KI und der ausdrücklichen Unterscheidung zwischen Fragestellungen auf Modell-, System-, Anwendungs- und Anwendungsfall-Ebene.","linkTool",{},{"id":1011,"data":1012,"type":1008,"tunes":1018},"src-nist-model",{"link":1013,"meta":1014},"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_model",{"image":1015,"title":1016,"description":1017},{"url":324},"NIST — Artificial Intelligence Model","Aktuelle NIST-Glossardefinition eines KI-Modells als Komponente eines Informationssystems, das mithilfe von KI-Techniken aus Eingaben Ausgaben erzeugt.",{},{"id":1020,"data":1021,"type":1008,"tunes":1027},"src-nist-system",{"link":1022,"meta":1023},"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_system",{"image":1024,"title":1025,"description":1026},{"url":324},"NIST — Artificial Intelligence System","Aktuelle NIST-Glossardefinition, die zeigt, dass ein KI-System Datensysteme, Software, Hardware, Anwendungen, Tools oder Utilities umfassen kann, die KI verwenden.",{},{"id":1029,"data":1030,"type":1008,"tunes":1036},"src-rag-paper",{"link":1031,"meta":1032},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2005.11401",{"image":1033,"title":1034,"description":1035},{"url":324},"Lewis et al. — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","Das Paper von 2020, das die RAG-Formulierung einführte, die ein generatives Modell mit abgerufenem nicht-parametrischem Speicher kombiniert.",{},{"id":1038,"data":1039,"type":1008,"tunes":1045},"src-openai-file-search",{"link":1040,"meta":1041},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-file-search",{"image":1042,"title":1043,"description":1044},{"url":324},"OpenAI — File Search","Aktuelle offizielle Dokumentation für gehosteten Dateiabruf in der Responses API unter Verwendung hochgeladener Dateiwissensbasen, semantischer Suche und Stichwortsuche.",{},{"id":1047,"data":1048,"type":1008,"tunes":1054},"src-openai-functions",{"link":1049,"meta":1050},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ffunction-calling",{"image":1051,"title":1052,"description":1053},{"url":324},"OpenAI — Function Calling","Aktuelle offizielle Dokumentation, die Tool-\u002FFunktionsaufrufe als Schnittstelle zwischen Modellen und externen Systemen, Daten und Aktionen beschreibt.",{},{"id":1056,"data":1057,"type":1008,"tunes":1063},"src-anthropic-context",{"link":1058,"meta":1059},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents",{"image":1060,"title":1061,"description":1062},{"url":324},"Anthropic — Effective Context Engineering for AI Agents","Engineering-Leitfaden, der Kontext als die während der LLM-Sampling verfügbare Token-Menge definiert und erklärt, warum die Kontextauswahl ein Problem endlicher Ressourcen ist.",{},"2.31","Generative KI ist mehr als ein Modell. Erfahren Sie, wie Modelle, Retrieval, Tools, Kontext, Runtimes und Anwendungen in Produktions-KI-Systemen zusammenwirken.","\u002Fuploads\u002F2026\u002F10\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing-1791475411822-pp0dvz.webp","generative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing-1791475411822-pp0dvz","PUBLISHED","2026-10-08T12:00:00.000Z","2026-10-08T16:00:39.350Z","2026-10-08T16:10:51.437Z",{"en":1073,"de":1074,"sr":1075,"es":1076,"fr":1077,"it":1078,"ru":1079,"zh":1080},"\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fde\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fsr\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fes\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Ffr\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fit\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fru\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","\u002Fzh\u002Fblog\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing",[1082,1086,1090,1094,1098],{"id":1083,"name":1084,"slug":1085},84,"Policy & Datengrenzen","policy-and-data",{"id":1087,"name":1088,"slug":1089},57,"Daten-Grenzen","data-boundaries",{"id":1091,"name":1092,"slug":1093},80,"Zugriff & Identität","access-and-identity",{"id":1095,"name":1096,"slug":1097},68,"Risiken, Kontrollen & Nachweise","risks-and-controls",{"id":1099,"name":1100,"slug":1101},54,"Bedrohungsmodell","threat-model",{"id":1103,"login":1104,"email":1105,"displayName":1106},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[1108,1536],{"lang":7,"title":207,"content":209,"contentJson":1109,"excerpt":1065},{"time":211,"blocks":1110,"version":1064},[1111,1114,1117,1120,1123,1126,1129,1132,1135,1138,1141,1153,1156,1159,1179,1182,1185,1188,1191,1194,1197,1200,1203,1206,1209,1212,1215,1218,1221,1224,1227,1230,1233,1236,1239,1242,1245,1248,1251,1254,1257,1260,1263,1275,1278,1281,1298,1301,1304,1307,1310,1313,1316,1328,1331,1334,1346,1349,1352,1372,1375,1378,1389,1392,1395,1398,1409,1412,1415,1418,1421,1424,1427,1430,1433,1436,1439,1442,1445,1448,1451,1454,1457,1460,1463,1466,1469,1480,1483,1495,1498,1501,1506,1511,1516,1521,1526,1531],{"id":214,"data":1112,"type":217,"tunes":1113},{"text":216},{},{"id":220,"data":1115,"type":225,"tunes":1116},{"body":222,"title":223,"variant":224},{},{"id":228,"data":1118,"type":225,"tunes":1119},{"body":230,"title":231,"variant":232},{},{"id":235,"data":1121,"type":240,"tunes":1122},{"title":237,"maxLevel":238,"minLevel":239},{},{"id":243,"data":1124,"type":41,"tunes":1125},{"text":245,"level":239},{},{"id":248,"data":1127,"type":217,"tunes":1128},{"text":250},{},{"id":253,"data":1130,"type":217,"tunes":1131},{"text":255},{},{"id":258,"data":1133,"type":225,"tunes":1134},{"body":260,"title":261,"variant":262},{},{"id":265,"data":1136,"type":41,"tunes":1137},{"text":267,"level":239},{},{"id":270,"data":1139,"type":217,"tunes":1140},{"text":272},{},{"id":275,"data":1142,"type":304,"tunes":1152},{"steps":1143,"title":302,"orientation":303},[1144,1145,1146,1147,1148,1149,1150,1151],{"label":279,"description":280},{"label":282,"description":283},{"label":285,"description":286},{"label":288,"description":289},{"label":291,"description":292},{"label":294,"description":295},{"label":297,"description":298},{"label":300,"description":301},{},{"id":307,"data":1154,"type":217,"tunes":1155},{"text":309},{},{"id":312,"data":1157,"type":41,"tunes":1158},{"text":314,"level":239},{},{"id":317,"data":1160,"type":357,"tunes":1178},{"rows":1161,"title":345,"layout":346,"columns":1174},[1162,1164,1166,1168,1170,1172],{"id":321,"label":322,"values":1163},[324,324,324],{"id":326,"label":327,"values":1165},[324,324,324],{"id":330,"label":331,"values":1167},[324,324,324],{"id":334,"label":335,"values":1169},[324,324,324],{"id":338,"label":339,"values":1171},[324,324,324],{"id":342,"label":343,"values":1173},[324,324,324],[1175,1176,1177],{"id":349,"label":350},{"id":352,"label":353},{"id":355,"label":356},{},{"id":360,"data":1180,"type":41,"tunes":1181},{"text":362,"level":239},{},{"id":365,"data":1183,"type":217,"tunes":1184},{"text":367},{},{"id":370,"data":1186,"type":217,"tunes":1187},{"text":372},{},{"id":375,"data":1189,"type":217,"tunes":1190},{"text":377},{},{"id":380,"data":1192,"type":41,"tunes":1193},{"text":382,"level":239},{},{"id":385,"data":1195,"type":217,"tunes":1196},{"text":387},{},{"id":390,"data":1198,"type":217,"tunes":1199},{"text":392},{},{"id":395,"data":1201,"type":225,"tunes":1202},{"body":397,"title":398,"variant":399},{},{"id":402,"data":1204,"type":408,"tunes":1205},{"url":404,"title":405,"excerpt":406,"ctaLabel":407},{},{"id":411,"data":1207,"type":41,"tunes":1208},{"text":413,"level":239},{},{"id":416,"data":1210,"type":217,"tunes":1211},{"text":418},{},{"id":421,"data":1213,"type":217,"tunes":1214},{"text":423},{},{"id":426,"data":1216,"type":217,"tunes":1217},{"text":428},{},{"id":431,"data":1219,"type":225,"tunes":1220},{"body":433,"title":434,"variant":262},{},{"id":437,"data":1222,"type":41,"tunes":1223},{"text":439,"level":239},{},{"id":442,"data":1225,"type":217,"tunes":1226},{"text":444},{},{"id":447,"data":1228,"type":217,"tunes":1229},{"text":449},{},{"id":452,"data":1231,"type":217,"tunes":1232},{"text":454},{},{"id":457,"data":1234,"type":41,"tunes":1235},{"text":459,"level":239},{},{"id":462,"data":1237,"type":217,"tunes":1238},{"text":464},{},{"id":467,"data":1240,"type":217,"tunes":1241},{"text":469},{},{"id":472,"data":1243,"type":217,"tunes":1244},{"text":474},{},{"id":477,"data":1246,"type":41,"tunes":1247},{"text":479,"level":239},{},{"id":482,"data":1249,"type":217,"tunes":1250},{"text":484},{},{"id":487,"data":1252,"type":217,"tunes":1253},{"text":489},{},{"id":492,"data":1255,"type":225,"tunes":1256},{"body":494,"title":495,"variant":224},{},{"id":498,"data":1258,"type":41,"tunes":1259},{"text":500,"level":239},{},{"id":503,"data":1261,"type":217,"tunes":1262},{"text":505},{},{"id":508,"data":1264,"type":346,"tunes":1274},{"content":1265,"stretched":42,"withHeadings":13},[1266,1267,1268,1269,1270,1271,1272,1273],[512,513,514],[516,327,517],[519,520,521],[523,524,525],[527,528,529],[531,532,533],[535,322,536],[538,539,540],{},{"id":543,"data":1276,"type":217,"tunes":1277},{"text":545},{},{"id":548,"data":1279,"type":41,"tunes":1280},{"text":550,"level":239},{},{"id":553,"data":1282,"type":357,"tunes":1297},{"rows":1283,"title":572,"layout":346,"columns":1292},[1284,1286,1288,1290],{"id":557,"label":558,"values":1285},[324,324,324,324],{"id":561,"label":562,"values":1287},[324,324,324,324],{"id":565,"label":566,"values":1289},[324,324,324,324],{"id":569,"label":570,"values":1291},[324,324,324,324],[1293,1294,1295,1296],{"id":326,"label":327},{"id":330,"label":331},{"id":577,"label":578},{"id":580,"label":581},{},{"id":584,"data":1299,"type":217,"tunes":1300},{"text":586},{},{"id":589,"data":1302,"type":41,"tunes":1303},{"text":591,"level":239},{},{"id":594,"data":1305,"type":225,"tunes":1306},{"body":596,"title":597,"variant":232},{},{"id":600,"data":1308,"type":217,"tunes":1309},{"text":602},{},{"id":605,"data":1311,"type":217,"tunes":1312},{"text":607},{},{"id":610,"data":1314,"type":217,"tunes":1315},{"text":612},{},{"id":615,"data":1317,"type":346,"tunes":1327},{"content":1318,"stretched":42,"withHeadings":13},[1319,1320,1321,1322,1323,1324,1325,1326],[619,620],[322,622],[624,625],[627,628],[630,631],[633,634],[636,637],[343,639],{},{"id":642,"data":1329,"type":225,"tunes":1330},{"body":644,"title":645,"variant":262},{},{"id":648,"data":1332,"type":41,"tunes":1333},{"text":650,"level":239},{},{"id":653,"data":1335,"type":346,"tunes":1345},{"content":1336,"stretched":42,"withHeadings":13},[1337,1338,1339,1340,1341,1342,1343,1344],[657,658],[660,661],[663,664],[666,667],[669,670],[672,673],[675,676],[678,679],{},{"id":682,"data":1347,"type":41,"tunes":1348},{"text":684,"level":239},{},{"id":687,"data":1350,"type":217,"tunes":1351},{"text":689},{},{"id":692,"data":1353,"type":357,"tunes":1371},{"rows":1354,"title":719,"layout":346,"columns":1367},[1355,1357,1359,1361,1363,1365],{"id":696,"label":697,"values":1356},[324,324,324],{"id":700,"label":701,"values":1358},[324,324,324],{"id":704,"label":705,"values":1360},[324,324,324],{"id":708,"label":709,"values":1362},[324,324,324],{"id":712,"label":713,"values":1364},[324,324,324],{"id":716,"label":717,"values":1366},[324,324,324],[1368,1369,1370],{"id":722,"label":723},{"id":725,"label":726},{"id":728,"label":729},{},{"id":732,"data":1373,"type":41,"tunes":1374},{"text":734,"level":239},{},{"id":737,"data":1376,"type":217,"tunes":1377},{"text":739},{},{"id":742,"data":1379,"type":346,"tunes":1388},{"content":1380,"stretched":42,"withHeadings":13},[1381,1382,1383,1384,1385,1386,1387],[746,747,748],[750,751,752],[754,755,756],[758,759,760],[762,763,764],[766,767,768],[770,771,772],{},{"id":775,"data":1390,"type":217,"tunes":1391},{"text":777},{},{"id":780,"data":1393,"type":41,"tunes":1394},{"text":782,"level":239},{},{"id":785,"data":1396,"type":217,"tunes":1397},{"text":787},{},{"id":790,"data":1399,"type":304,"tunes":1408},{"steps":1400,"title":814,"orientation":303},[1401,1402,1403,1404,1405,1406,1407],{"label":794,"description":795},{"label":797,"description":798},{"label":800,"description":801},{"label":803,"description":804},{"label":806,"description":807},{"label":809,"description":810},{"label":812,"description":813},{},{"id":817,"data":1410,"type":41,"tunes":1411},{"text":819,"level":239},{},{"id":822,"data":1413,"type":217,"tunes":1414},{"text":824},{},{"id":827,"data":1416,"type":217,"tunes":1417},{"text":829},{},{"id":832,"data":1419,"type":225,"tunes":1420},{"body":834,"title":835,"variant":262},{},{"id":838,"data":1422,"type":41,"tunes":1423},{"text":840,"level":239},{},{"id":843,"data":1425,"type":217,"tunes":1426},{"text":845},{},{"id":848,"data":1428,"type":408,"tunes":1429},{"url":850,"title":851,"excerpt":852,"ctaLabel":853},{},{"id":856,"data":1431,"type":408,"tunes":1432},{"url":858,"title":859,"excerpt":860,"ctaLabel":861},{},{"id":864,"data":1434,"type":41,"tunes":1435},{"text":866,"level":239},{},{"id":869,"data":1437,"type":217,"tunes":1438},{"text":871},{},{"id":874,"data":1440,"type":217,"tunes":1441},{"text":876},{},{"id":879,"data":1443,"type":217,"tunes":1444},{"text":881},{},{"id":884,"data":1446,"type":41,"tunes":1447},{"text":886,"level":239},{},{"id":889,"data":1449,"type":217,"tunes":1450},{"text":891},{},{"id":894,"data":1452,"type":217,"tunes":1453},{"text":896},{},{"id":899,"data":1455,"type":41,"tunes":1456},{"text":901,"level":239},{},{"id":904,"data":1458,"type":217,"tunes":1459},{"text":906},{},{"id":909,"data":1461,"type":217,"tunes":1462},{"text":911},{},{"id":914,"data":1464,"type":217,"tunes":1465},{"text":916},{},{"id":919,"data":1467,"type":41,"tunes":1468},{"text":921,"level":239},{},{"id":924,"data":1470,"type":924,"tunes":1479},{"items":1471,"title":955},[1472,1473,1474,1475,1476,1477,1478],{"id":928,"answer":929,"question":930},{"id":932,"answer":933,"question":934},{"id":936,"answer":937,"question":938},{"id":940,"answer":941,"question":942},{"id":944,"answer":945,"question":946},{"id":948,"answer":949,"question":950},{"id":952,"answer":953,"question":954},{},{"id":958,"data":1481,"type":41,"tunes":1482},{"text":960,"level":239},{},{"id":963,"data":1484,"type":963,"tunes":1494},{"title":965,"entries":1485},[1486,1487,1488,1489,1490,1491,1492,1493],{"term":968,"anchor":969,"definition":970},{"term":327,"anchor":326,"definition":972},{"term":754,"anchor":561,"definition":974},{"term":976,"anchor":565,"definition":977},{"term":335,"anchor":334,"definition":979},{"term":981,"anchor":982,"definition":983},{"term":343,"anchor":342,"definition":985},{"term":624,"anchor":987,"definition":988},{},{"id":991,"data":1496,"type":41,"tunes":1497},{"text":993,"level":239},{},{"id":996,"data":1499,"type":217,"tunes":1500},{"text":998},{},{"id":1001,"data":1502,"type":1008,"tunes":1505},{"link":1003,"meta":1503},{"image":1504,"title":1006,"description":1007},{"url":324},{},{"id":1011,"data":1507,"type":1008,"tunes":1510},{"link":1013,"meta":1508},{"image":1509,"title":1016,"description":1017},{"url":324},{},{"id":1020,"data":1512,"type":1008,"tunes":1515},{"link":1022,"meta":1513},{"image":1514,"title":1025,"description":1026},{"url":324},{},{"id":1029,"data":1517,"type":1008,"tunes":1520},{"link":1031,"meta":1518},{"image":1519,"title":1034,"description":1035},{"url":324},{},{"id":1038,"data":1522,"type":1008,"tunes":1525},{"link":1040,"meta":1523},{"image":1524,"title":1043,"description":1044},{"url":324},{},{"id":1047,"data":1527,"type":1008,"tunes":1530},{"link":1049,"meta":1528},{"image":1529,"title":1052,"description":1053},{"url":324},{},{"id":1056,"data":1532,"type":1008,"tunes":1535},{"link":1058,"meta":1533},{"image":1534,"title":1061,"description":1062},{"url":324},{},{"lang":1537,"title":1538,"content":1539,"contentJson":1540,"excerpt":2227},"en","Generative AI Explained: Models, Retrieval, Tools and Applications Are Not the Same Thing","{\"time\":1791475413504,\"blocks\":[{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Generative AI is not one component. A production generative AI system usually combines a generative model with application code that supplies instructions and context, retrieves external knowledge when needed, exposes tools for reading or changing external systems, manages runtime state and permissions, and turns the result into a usable product. Treating the model, retrieval, tools, context, runtime, and application as the same thing hides the boundaries that determine freshness, security, reliability, cost, and control.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"\u003Cstrong>The model generates; retrieval finds external evidence; tools access data or perform actions; context is what the model can see for the current inference; the runtime coordinates execution; the application owns product rules, state, permissions, persistence, and user experience.\u003C\u002Fstrong> These layers can be packaged together by a vendor, but their responsibilities remain different.\"},\"tunes\":{}},{\"id\":\"scope-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"Terminology and version note\",\"body\":\"This article defines durable architectural responsibilities rather than one vendor stack. Current implementation examples were re-checked on \u003Cstrong>8 October 2026\u003C\u002Fstrong>. Vendor APIs and product names can change; the responsibility boundaries are more stable than any individual SDK or endpoint.\"},\"tunes\":{}},{\"id\":\"toc\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"h-meaning\",\"type\":\"header\",\"data\":{\"text\":\"What does “generative AI” actually mean?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-meaning-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"At the model level, generative AI refers to AI models that generate derived synthetic content such as text, images, audio, video, code, or other digital output. NIST AI 600-1 uses this model-oriented meaning and separately discusses risks at model, system, application, and use-case levels.\"},\"tunes\":{}},{\"id\":\"p-meaning-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That distinction matters because an AI model is not the same thing as the complete AI system. NIST's current glossary defines an AI model as a component that produces outputs from inputs using computational, statistical, or machine-learning techniques, while an AI system can include software, hardware, applications, tools, or utilities that operate using AI.\"},\"tunes\":{}},{\"id\":\"model-system-rule\",\"type\":\"callout\",\"data\":{\"variant\":\"success\",\"title\":\"A useful boundary\",\"body\":\"\u003Cstrong>Generative model ≠ generative AI application.\u003C\u002Fstrong>\u003Cbr>A model is one computational component. A usable AI product is a system built around that component.\"},\"tunes\":{}},{\"id\":\"h-simple\",\"type\":\"header\",\"data\":{\"text\":\"The simplest useful model of a generative AI system\",\"level\":2},\"tunes\":{}},{\"id\":\"p-simple-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"For a first mental model, imagine a company assistant answering: “Can this customer receive a refund today?” A useful answer may require several different responsibilities. The language model can interpret the question and write the explanation, but the current order state may come from a database tool, the refund policy may come from document retrieval, permissions may be enforced by the application, and the final action may require a controlled API call.\"},\"tunes\":{}},{\"id\":\"simple-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"One common execution path\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. User request\",\"description\":\"The application receives a natural-language question or task.\"},{\"label\":\"2. Application policy and state\",\"description\":\"Identity, tenant, permissions, current workflow state, and product rules define what the request is allowed to do.\"},{\"label\":\"3. Retrieval or direct data access\",\"description\":\"The system obtains external evidence or current facts when model knowledge is insufficient.\"},{\"label\":\"4. Context construction\",\"description\":\"Instructions, user input, selected evidence, relevant state, and tool definitions are assembled for the model.\"},{\"label\":\"5. Model inference\",\"description\":\"The generative model interprets the supplied context and produces text, structured output, or a tool request.\"},{\"label\":\"6. Tool execution when needed\",\"description\":\"The runtime or application validates and executes approved tool calls outside the model.\"},{\"label\":\"7. Observation and continuation\",\"description\":\"Tool results can return to the model as new context for another inference step.\"},{\"label\":\"8. Validation and product output\",\"description\":\"The application validates the result, records required state or audit data, and presents or executes the final outcome.\"}]},\"tunes\":{}},{\"id\":\"p-simple-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Real systems do not always follow this sequence exactly. Retrieval can happen before the first model call, tools can be selected during an agent loop, deterministic application logic can bypass the model entirely, and validation can occur at several stages. The point is to separate responsibilities, not to impose one universal workflow.\"},\"tunes\":{}},{\"id\":\"h-boundaries\",\"type\":\"header\",\"data\":{\"text\":\"The six boundaries that matter\",\"level\":2},\"tunes\":{}},{\"id\":\"boundary-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Six responsibilities inside one AI product\",\"layout\":\"table\",\"columns\":[{\"id\":\"job\",\"label\":\"Primary job\"},{\"id\":\"input\",\"label\":\"Typical inputs\"},{\"id\":\"not\",\"label\":\"Not the same as\"}],\"rows\":[{\"id\":\"model\",\"label\":\"Model\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"retrieval\",\"label\":\"Retrieval\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"tools\",\"label\":\"Tools\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"context\",\"label\":\"Context\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"runtime\",\"label\":\"Runtime \u002F orchestrator\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"application\",\"label\":\"Application\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-model\",\"type\":\"header\",\"data\":{\"text\":\"1. The model: generation is its core responsibility\",\"level\":2},\"tunes\":{}},{\"id\":\"p-model-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A generative model maps supplied inputs to generated outputs. For a language model, that can include natural-language text, structured JSON, code, classifications, summaries, plans, or tool-call arguments. Multimodal generative models can work with additional input and output types.\"},\"tunes\":{}},{\"id\":\"p-model-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The model can contain substantial learned knowledge in its parameters, but parameterized knowledge is not a live database. The model does not automatically know a document created five minutes ago, the current stock level, a private customer record, or the state of an application unless that information is supplied through the current input path.\"},\"tunes\":{}},{\"id\":\"p-model-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is why changing the model does not automatically solve stale knowledge, missing permissions, broken retrieval, incorrect state ownership, or unsafe tool execution. Those failures often belong to other layers.\"},\"tunes\":{}},{\"id\":\"h-retrieval\",\"type\":\"header\",\"data\":{\"text\":\"2. Retrieval: finding external evidence is a separate operation\",\"level\":2},\"tunes\":{}},{\"id\":\"p-retrieval-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval selects information from an external source before or during generation. The 2020 Retrieval-Augmented Generation work by Lewis et al. made the separation explicit by combining a parametric generative model with retrieved non-parametric memory. Modern production systems use many retrieval variants, but the architectural idea remains: useful evidence can be fetched at inference time instead of relying only on what the model learned during training.\"},\"tunes\":{}},{\"id\":\"p-retrieval-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval can use lexical search, embeddings, vector search, hybrid search, SQL, knowledge graphs, metadata filters, APIs, or other selection mechanisms. A vector database is therefore one possible retrieval component, not the definition of RAG.\"},\"tunes\":{}},{\"id\":\"retrieval-rule\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Relevance is not authority\",\"body\":\"A retrieved passage can be highly relevant and still be stale, unauthorized, from the wrong version, or insufficient to support a claim. Retrieval quality and evidence quality must be evaluated separately.\"},\"tunes\":{}},{\"id\":\"ref-rag\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works\",\"title\":\"What Is RAG? The Simplest Explanation of How It Works\",\"excerpt\":\"The canonical plain-English explanation of retrieval-augmented generation, including the separation between LLM, knowledge, state, memory and tools.\",\"ctaLabel\":\"Read the RAG foundation\"},\"tunes\":{}},{\"id\":\"h-tools\",\"type\":\"header\",\"data\":{\"text\":\"3. Tools: access and action are not model knowledge\",\"level\":2},\"tunes\":{}},{\"id\":\"p-tools-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A tool is an interface through which an AI runtime can request functionality outside the model. A tool can query a database, search the web, read a file, calculate a value, call an internal service, create a ticket, send a message, modify a record, or trigger another controlled operation.\"},\"tunes\":{}},{\"id\":\"p-tools-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"OpenAI's current function-calling documentation makes this boundary explicit: function calling lets models interface with external systems and access data or actions provided by the application. The model can propose or select a call, but the external system performs the real operation.\"},\"tunes\":{}},{\"id\":\"p-tools-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Tool use therefore creates two separate questions: Can the model request this capability? and Will the application authorize and execute it? A production system should not confuse model intent with permission to cause a side effect.\"},\"tunes\":{}},{\"id\":\"tool-rule\",\"type\":\"callout\",\"data\":{\"variant\":\"success\",\"title\":\"Model intent is not execution authority\",\"body\":\"A model can emit a valid tool request and still be denied. Authorization, argument validation, rate limits, transaction rules, audit requirements, and rollback belong outside the model.\"},\"tunes\":{}},{\"id\":\"h-context\",\"type\":\"header\",\"data\":{\"text\":\"4. Context: what the model can see right now\",\"level\":2},\"tunes\":{}},{\"id\":\"p-context-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Context is the information available to the model for a particular inference step. Anthropic's context-engineering guidance describes context as the set of tokens included when sampling from an LLM. In practice, that set can contain system instructions, user messages, conversation history, retrieved evidence, tool definitions, tool results, memory summaries, and selected application state.\"},\"tunes\":{}},{\"id\":\"p-context-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Context is therefore neither the complete knowledge base nor long-term memory. A company may store ten million documents while only a handful of passages enter one model call. A runtime may persist a year of conversation history while exposing only the pieces needed for the current task.\"},\"tunes\":{}},{\"id\":\"p-context-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The context window also creates an engineering constraint. Adding more text does not guarantee a better answer; irrelevant, stale, contradictory, or low-authority information can dilute the evidence that actually matters.\"},\"tunes\":{}},{\"id\":\"h-runtime\",\"type\":\"header\",\"data\":{\"text\":\"5. Runtime and orchestration: coordinating the loop\",\"level\":2},\"tunes\":{}},{\"id\":\"p-runtime-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The runtime or orchestration layer coordinates how the model participates in a task. Depending on the architecture, it can manage sessions, model requests, tool discovery, tool-call loops, retries, handoffs, streaming events, timeouts, checkpoints, compaction, or execution environments.\"},\"tunes\":{}},{\"id\":\"p-runtime-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Some runtimes are thin application code around a model API. Others are full agent harnesses. A managed vendor runtime can own part of the loop while the application still owns domain truth, authorization, business side effects, and product lifecycle.\"},\"tunes\":{}},{\"id\":\"p-runtime-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"This boundary is important because where the runtime runs and where inference runs are separate decisions. A locally running client or agent process can still call a remote model, while a remote application can call a model hosted on infrastructure under the organization's control.\"},\"tunes\":{}},{\"id\":\"h-application\",\"type\":\"header\",\"data\":{\"text\":\"6. The application: where AI becomes a product\",\"level\":2},\"tunes\":{}},{\"id\":\"p-app-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The application is the product boundary around the AI components. It owns the user experience, domain model, current state, identity, tenant scope, permissions, persistence, service integrations, validation, observability, billing or quota logic where relevant, and the rules that determine what the AI is allowed to see or do.\"},\"tunes\":{}},{\"id\":\"p-app-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is the layer that turns “a model can produce useful output” into “a system can deliver a reliable capability.” The same model can participate in a private research assistant, a support workflow, a code agent, or a commerce application because the surrounding application changes the data, tools, policies, state, and execution contract.\"},\"tunes\":{}},{\"id\":\"app-rule\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"The model is replaceable; the product boundary is not\",\"body\":\"Provider and model substitution can be an architectural goal. The application's authoritative state, permissions, domain rules, audit trail, and user contract cannot simply be delegated to whichever model is currently selected.\"},\"tunes\":{}},{\"id\":\"h-work-together\",\"type\":\"header\",\"data\":{\"text\":\"How the parts work together in a real request\",\"level\":2},\"tunes\":{}},{\"id\":\"p-together-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Consider a support assistant asked: “Refund order 4711 if it is still eligible, and explain why.” The request combines knowledge, current state, authorization, reasoning, and a side effect.\"},\"tunes\":{}},{\"id\":\"support-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Need\",\"Correct layer\",\"Why\"],[\"Refund policy\",\"Retrieval\",\"The system must find the current applicable policy and preserve its provenance.\"],[\"Order 4711 status\",\"Direct data\u002Ftool access\",\"The current order record is volatile authoritative state, not something to guess from model knowledge.\"],[\"User's authority to refund\",\"Application \u002F authorization\",\"Permissions must be enforced independently of what the model asks for.\"],[\"Interpret policy against order facts\",\"Model + context\",\"The model can reason over the policy evidence and current order state supplied to it.\"],[\"Execute refund\",\"Tool + application transaction rules\",\"A controlled external operation changes real state.\"],[\"Explain outcome\",\"Model\",\"The model can generate the user-facing explanation from validated results.\"],[\"Audit what happened\",\"Application \u002F runtime\",\"The system records evidence, calls, decisions, side effects, and errors as required.\"]]},\"tunes\":{}},{\"id\":\"p-together-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"If the assistant only has the language model, it can discuss refunds but cannot safely know whether order 4711 is currently eligible or perform the transaction. If it only has retrieval, it may find the policy but still lack live order state. If it has tools without application authorization, it may become capable but unsafe. Reliability comes from composing the layers with explicit ownership.\"},\"tunes\":{}},{\"id\":\"h-configs\",\"type\":\"header\",\"data\":{\"text\":\"Different AI products use different combinations\",\"level\":2},\"tunes\":{}},{\"id\":\"config-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"The presence of a model does not define the whole architecture\",\"layout\":\"table\",\"columns\":[{\"id\":\"retrieval\",\"label\":\"Retrieval\"},{\"id\":\"tools\",\"label\":\"Tools\"},{\"id\":\"state\",\"label\":\"Authoritative state\"},{\"id\":\"result\",\"label\":\"Typical capability\"}],\"rows\":[{\"id\":\"bare\",\"label\":\"Model-only assistant\",\"values\":[\"\",\"\",\"\",\"\"]},{\"id\":\"rag\",\"label\":\"Retrieval-grounded assistant\",\"values\":[\"\",\"\",\"\",\"\"]},{\"id\":\"tool\",\"label\":\"Tool-using assistant\",\"values\":[\"\",\"\",\"\",\"\"]},{\"id\":\"agent\",\"label\":\"Agentic application\",\"values\":[\"\",\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"p-configs-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"These are architecture patterns, not maturity rankings. A model-only feature can be the correct design when the task needs no external facts or actions. Adding retrieval, tools, memory, or an agent loop is justified only when the task requires those capabilities.\"},\"tunes\":{}},{\"id\":\"h-implementation\",\"type\":\"header\",\"data\":{\"text\":\"Implementation evidence: Aaasaasa AI Client\",\"level\":2},\"tunes\":{}},{\"id\":\"implementation-scope\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"Primary implementation evidence\",\"body\":\"The following section describes an implementation I built and reviewed against the Aaasaasa AI Client codebase and architecture documentation as of \u003Cstrong>26 July 2026\u003C\u002Fstrong>. It is evidence for the usefulness of these boundaries, not a claim that one implementation is a universal standard or a commercially deployed enterprise product.\"},\"tunes\":{}},{\"id\":\"p-impl-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Aaasaasa AI Client is a local-first desktop AI workspace built with Nuxt 4, Electron and TypeScript. Its AI Hub deliberately separates agent\u002Fclient, provider, model, runtime location, permissions, and web client instead of treating them as one “AI” setting.\"},\"tunes\":{}},{\"id\":\"p-impl-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That separation creates concrete behavior. Direct Chat can talk to models without filesystem or shell tools. A Codex agent can use a selected workspace and permission profile. Ollama can provide direct local inference, while LM Studio and configurable OpenAI-compatible endpoints represent other provider paths. A locally running Codex process can still use a cloud model, so the UI and architecture do not equate local runtime with local inference.\"},\"tunes\":{}},{\"id\":\"p-impl-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The implementation also contains Qdrant\u002Fvector support, document-extraction capabilities and an authenticated directory MCP broker. Those components illustrate another boundary: retrieval infrastructure and tool access can live in the same product without becoming properties of the model itself.\"},\"tunes\":{}},{\"id\":\"impl-map\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"A01 concept\",\"Aaasaasa AI Client implementation evidence\"],[\"Model\",\"A provider-specific model identifier is selected separately from provider and runtime.\"],[\"Provider\",\"Ollama, LM Studio, OpenAI-compatible services and other provider paths are represented separately.\"],[\"Runtime\",\"Local or remote agent\u002Fruntime location is tracked independently of the model.\"],[\"Tools \u002F access\",\"Direct Chat has no filesystem or shell tools; controlled directory access is brokered separately.\"],[\"Permissions\",\"Workspace permission profiles are application\u002Fsession policy, not model capability.\"],[\"Retrieval infrastructure\",\"Vector support and document extraction exist as data\u002Fretrieval capabilities rather than model features.\"],[\"Application\",\"The Electron\u002FNuxt product coordinates UI, credentials, providers, runtime discovery, permissions, tools and model interaction.\"]]},\"tunes\":{}},{\"id\":\"impl-lesson\",\"type\":\"callout\",\"data\":{\"variant\":\"success\",\"title\":\"Implementation lesson\",\"body\":\"The architecture became easier to reason about once \u003Cstrong>model, provider, runtime, permissions, tools, data and client\u003C\u002Fstrong> stopped being represented as one configuration choice. The distinction is operational: it determines what can run locally, what can access files, what may call paid cloud inference, and which layer owns authorization.\"},\"tunes\":{}},{\"id\":\"h-errors\",\"type\":\"header\",\"data\":{\"text\":\"Common category errors\",\"level\":2},\"tunes\":{}},{\"id\":\"errors-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Category error\",\"What is actually happening\"],[\"“The AI knows our documents.”\",\"The application or retrieval layer makes selected document content available to the model.\"],[\"“RAG is our vector database.”\",\"The vector database can be one index or store used by a retrieval pipeline; RAG is the retrieval-plus-generation pattern.\"],[\"“The model called our CRM.”\",\"The model produced a tool request; the runtime\u002Fapplication authorized and executed the external call.\"],[\"“It is local AI because the desktop agent runs locally.”\",\"Runtime location and inference location are separate. A local runtime can still invoke a remote model.\"],[\"“The model has permission to edit files.”\",\"The application\u002Fruntime grants a tool capability under a permission policy; permission is not an intrinsic model property.\"],[\"“More context means more knowledge.”\",\"Context is the finite input made available for one inference. Larger context can contain more noise, conflict or stale information.\"],[\"“The chatbot is the AI architecture.”\",\"The chat UI is one interface. The system can also include identity, state, retrieval, tools, runtime, validation, persistence and observability.\"]]},\"tunes\":{}},{\"id\":\"h-failures\",\"type\":\"header\",\"data\":{\"text\":\"Failure modes when the boundaries collapse\",\"level\":2},\"tunes\":{}},{\"id\":\"p-failure-intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Boundary mistakes are not merely terminology problems. They create distinct production failures that require different fixes.\"},\"tunes\":{}},{\"id\":\"failure-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Diagnose the failing layer before replacing the model\",\"layout\":\"table\",\"columns\":[{\"id\":\"symptom\",\"label\":\"Symptom\"},{\"id\":\"likely\",\"label\":\"Likely boundary problem\"},{\"id\":\"fix\",\"label\":\"First architectural check\"}],\"rows\":[{\"id\":\"stale\",\"label\":\"Stale answer\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"missing\",\"label\":\"Missing company fact\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"unsafe\",\"label\":\"Unsafe side effect\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"noise\",\"label\":\"Confused answer with lots of supplied text\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"route\",\"label\":\"Unexpected cloud use\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"loop\",\"label\":\"Agent stalls or repeats\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-version\",\"type\":\"header\",\"data\":{\"text\":\"What is stable and what is version-sensitive?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-version-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The architectural distinctions in this article are intentionally vendor-neutral. The current examples below are implementation facts that should be re-checked when APIs evolve.\"},\"tunes\":{}},{\"id\":\"version-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Area\",\"Stable architectural idea\",\"Verified current example on 8 Oct 2026\"],[\"AI model vs system\",\"A model is a component inside a broader system\",\"NIST's current glossary separately defines AI model and AI system.\"],[\"RAG\",\"Generation can be conditioned on retrieved external information\",\"The Lewis et al. 2020 formulation remains the foundational reference; production retrieval methods now extend far beyond one dense index design.\"],[\"Hosted retrieval\",\"Retrieval can be exposed as a managed tool\",\"OpenAI File Search is currently a Responses API tool that searches uploaded-file knowledge bases using semantic and keyword retrieval.\"],[\"Function\u002Ftool calling\",\"A model can request application-defined external capabilities\",\"OpenAI currently documents function calling as an interface to external systems, data and actions.\"],[\"Context engineering\",\"Model behavior depends on the finite information supplied for the current inference\",\"Anthropic's current engineering guidance defines context as the token set included when sampling from the LLM and focuses on curating that set.\"],[\"Vendor APIs\",\"SDKs, tool names, endpoint shapes and supported features change\",\"Treat vendor documentation as version-sensitive even when the responsibility boundary remains stable.\"]]},\"tunes\":{}},{\"id\":\"p-version-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"A source-of-truth article should therefore preserve both levels: stable concepts for architecture, and dated evidence for current implementations. Mixing the two makes an article age unnecessarily fast.\"},\"tunes\":{}},{\"id\":\"h-test\",\"type\":\"header\",\"data\":{\"text\":\"The AI component-boundary test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-test-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"When evaluating an AI feature, ask the following questions in order. The answers reveal which components the system actually has and which responsibilities are still implicit.\"},\"tunes\":{}},{\"id\":\"boundary-test\",\"type\":\"processFlow\",\"data\":{\"title\":\"Seven questions for a production design\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. What generates the output?\",\"description\":\"Identify the exact model and the modalities or structured outputs it provides.\"},{\"label\":\"2. What facts are authoritative outside the model?\",\"description\":\"Identify documents, databases, APIs, current state and other sources of truth.\"},{\"label\":\"3. How is relevant information selected?\",\"description\":\"Separate direct lookup, search, retrieval, ranking and context construction.\"},{\"label\":\"4. What can cause real side effects?\",\"description\":\"List tools and external actions, then identify who validates and authorizes them.\"},{\"label\":\"5. What reaches the model as context?\",\"description\":\"Make instructions, evidence, state, history, memory and tool definitions explicit.\"},{\"label\":\"6. Who owns the loop?\",\"description\":\"Identify the runtime or harness that manages calls, events, retries, tool loops and sessions.\"},{\"label\":\"7. What remains the application's responsibility?\",\"description\":\"Make identity, permissions, domain state, validation, persistence, observability and UX explicit.\"}]},\"tunes\":{}},{\"id\":\"h-not\",\"type\":\"header\",\"data\":{\"text\":\"What generative AI is not\",\"level\":2},\"tunes\":{}},{\"id\":\"p-not-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Generative AI is not synonymous with an LLM, even though LLMs are a major class of generative model. It is also not synonymous with RAG, a vector database, an agent, a tool protocol, a chatbot UI, or an application.\"},\"tunes\":{}},{\"id\":\"p-not-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Those concepts can be connected, but each answers a different architectural question. An LLM asks how language output is produced. Retrieval asks where external evidence comes from. Tools ask how external capabilities are exposed. Context asks what the model can see. Runtime asks how execution is coordinated. The application asks how the capability becomes a controlled product.\"},\"tunes\":{}},{\"id\":\"remember\",\"type\":\"callout\",\"data\":{\"variant\":\"success\",\"title\":\"If you remember only one model\",\"body\":\"\u003Cstrong>Model = generate.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Retrieval = find evidence.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Tools = read or act outside the model.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Context = what the model sees now.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Runtime = coordinate execution.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Application = own the product, state, rules and permissions.\u003C\u002Fstrong>\"},\"tunes\":{}},{\"id\":\"h-next\",\"type\":\"header\",\"data\":{\"text\":\"Where to go next in the knowledge graph\",\"level\":2},\"tunes\":{}},{\"id\":\"p-next-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Once these boundaries are clear, deeper topics become easier to place. RAG belongs in retrieval and context construction. Retrieval Trigger decides when external evidence is required. Agent memory concerns what persists across time. Tool calling and MCP belong to capability access. Agent harnesses belong to runtime orchestration. RBAC, tenant isolation and domain authorization belong to the application and platform security boundary.\"},\"tunes\":{}},{\"id\":\"ref-data\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhere-does-an-llm-get-its-data-rag-data-sources-in-python\",\"title\":\"Where Does an LLM Get Its Data? RAG Data Sources in Python\",\"excerpt\":\"A practical continuation showing how files, SQL, APIs, full-text search, embeddings and context assembly connect external data to an LLM.\",\"ctaLabel\":\"See the data path in code\"},\"tunes\":{}},{\"id\":\"ref-trigger\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger\",\"title\":\"When Should an AI Stop Trusting Its Own Knowledge? — The Retrieval Trigger\",\"excerpt\":\"A decision model for when an AI system should stop relying only on model knowledge and obtain external evidence.\",\"ctaLabel\":\"Read the retrieval decision model\"},\"tunes\":{}},{\"id\":\"h-limit\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The six-layer model is a responsibility map, not a requirement that every product deploy six separate services. A small application may implement context construction, retrieval and orchestration inside one process. A managed platform may bundle several responsibilities behind one API. Physical deployment can be combined while semantic ownership remains distinct.\"},\"tunes\":{}},{\"id\":\"p-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Terminology also varies across vendors and research. “Agent,” “runtime,” “memory,” “tool,” “connector,” and “context” can be defined differently. The definitions here are chosen to make operational ownership and failure diagnosis explicit rather than to claim that every framework uses identical vocabulary.\"},\"tunes\":{}},{\"id\":\"p-limit-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The Aaasaasa AI Client section documents one implementation pattern. It demonstrates that explicit boundaries are practical, but it does not prove that the same component layout is optimal for every AI product.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The responsibility map would need revision if model architectures themselves began to own authoritative external state, permissions, durable transactional side effects, and verifiable source access as intrinsic properties rather than capabilities supplied by a surrounding system. Current production architectures do not make that a safe general assumption.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Individual implementation examples will change much sooner. Hosted retrieval tools, agent APIs, MCP integrations, context-management features and provider capabilities evolve quickly. Those details should be updated without collapsing the underlying distinctions between generation, evidence, capability access, context, execution and application control.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Generative AI becomes easier to design once “the AI” stops being treated as one black box. The model is the generative component, not the complete product. Retrieval provides external evidence. Tools expose capabilities. Context carries selected information into the current inference. The runtime coordinates execution. The application owns the authoritative product boundary.\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That separation is useful for more than explanation. It tells engineers where stale facts originate, where authorization belongs, why a local runtime can still use cloud inference, why RAG does not equal a vector database, why tool calls require validation, and why changing the model cannot repair every system failure.\"},\"tunes\":{}},{\"id\":\"p-conclusion-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The durable architecture question is therefore not “Which AI model are we using?” It is: Which responsibility does each component own, what evidence crosses each boundary, and which layer is allowed to change real state?\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Generative AI system boundaries\",\"items\":[{\"id\":\"faq1\",\"question\":\"Is generative AI the same as an LLM?\",\"answer\":\"No. An LLM is one type of generative model. Generative AI also includes other modalities, and a production generative AI system can include retrieval, tools, runtime logic, application state, permissions, persistence and user interfaces around the model.\"},{\"id\":\"faq2\",\"question\":\"Is RAG part of the model?\",\"answer\":\"Usually no. RAG is an application\u002Fsystem pattern that retrieves external information and supplies selected evidence to the model. Some platforms package retrieval tightly with model APIs, but the responsibility remains distinct.\"},{\"id\":\"faq3\",\"question\":\"Is a vector database required for RAG?\",\"answer\":\"No. RAG can use vector search, lexical search, hybrid retrieval, SQL, APIs, knowledge graphs or other methods. The defining property is retrieval of external information for generation, not one storage technology.\"},{\"id\":\"faq4\",\"question\":\"Are tools the same as context?\",\"answer\":\"No. A tool is an external capability. Its definition may be represented in context, and its result may later enter context, but the actual capability executes outside the model.\"},{\"id\":\"faq5\",\"question\":\"Does running an AI client locally mean the model is local?\",\"answer\":\"No. Runtime location and inference location are separate. A local desktop application or agent can call a remote model, while a remote application can call an internally hosted model.\"},{\"id\":\"faq6\",\"question\":\"Who should enforce permissions for AI tools?\",\"answer\":\"The application or runtime security boundary should enforce authorization. A model can request an operation, but model intent should never be treated as sufficient execution authority.\"},{\"id\":\"faq7\",\"question\":\"Where does current application state belong?\",\"answer\":\"Authoritative volatile state should normally remain in the application or domain system that owns it. The AI can receive the relevant state through controlled context or tool access when needed.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Core terms\",\"entries\":[{\"term\":\"Generative model\",\"definition\":\"An AI model designed to generate derived synthetic content such as text, images, audio, video, code or structured output.\",\"anchor\":\"generative-model\"},{\"term\":\"Retrieval\",\"definition\":\"The process of selecting relevant information from an external source or store for the current task.\",\"anchor\":\"retrieval\"},{\"term\":\"RAG\",\"definition\":\"Retrieval-Augmented Generation: a pattern in which retrieved external information is supplied to a generative model to improve the current output.\",\"anchor\":\"rag\"},{\"term\":\"Tool\",\"definition\":\"A capability exposed to an AI runtime for reading data, calculating, searching, or performing an external action.\",\"anchor\":\"tool\"},{\"term\":\"Context\",\"definition\":\"The information available to the model for a particular inference step.\",\"anchor\":\"context\"},{\"term\":\"Runtime \u002F orchestrator\",\"definition\":\"The software layer that coordinates model calls, tool calls, task loops, sessions, retries, events or execution environments.\",\"anchor\":\"runtime-orchestrator\"},{\"term\":\"Application\",\"definition\":\"The product and domain layer that owns user interaction, authoritative state, permissions, validation, persistence and business behavior.\",\"anchor\":\"application\"},{\"term\":\"Provider\",\"definition\":\"The service or runtime that exposes access to one or more models; provider identity and model identity are separate concerns.\",\"anchor\":\"provider\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and implementation evidence\",\"level\":2},\"tunes\":{}},{\"id\":\"p-sources-note\",\"type\":\"paragraph\",\"data\":{\"text\":\"Stable definitions below are anchored in standards\u002Fresearch; fast-moving implementation examples use current official engineering documentation. Aaasaasa AI Client is original implementation evidence and was checked against its codebase\u002Fdocumentation state dated 26 July 2026.\"},\"tunes\":{}},{\"id\":\"src-nist-profile\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fnvlpubs.nist.gov\u002Fnistpubs\u002Fai\u002FNIST.AI.600-1.pdf\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"NIST AI 600-1 — Generative Artificial Intelligence Profile\",\"description\":\"NIST's Generative AI profile, including the generative-AI definition and explicit distinction between model-, system-, application- and use-case-level concerns.\"}},\"tunes\":{}},{\"id\":\"src-nist-model\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_model\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"NIST — Artificial Intelligence Model\",\"description\":\"Current NIST glossary definition of an AI model as a component of an information system that produces outputs from inputs using AI techniques.\"}},\"tunes\":{}},{\"id\":\"src-nist-system\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fcsrc.nist.gov\u002Fglossary\u002Fterm\u002Fartificial_intelligence_system\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"NIST — Artificial Intelligence System\",\"description\":\"Current NIST glossary definition showing that an AI system can include data systems, software, hardware, applications, tools or utilities using AI.\"}},\"tunes\":{}},{\"id\":\"src-rag-paper\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2005.11401\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Lewis et al. — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks\",\"description\":\"The 2020 paper introducing the RAG formulation that combines a generative model with retrieved non-parametric memory.\"}},\"tunes\":{}},{\"id\":\"src-openai-file-search\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ftools-file-search\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — File Search\",\"description\":\"Current official documentation for hosted file retrieval in the Responses API using uploaded-file knowledge bases, semantic search and keyword search.\"}},\"tunes\":{}},{\"id\":\"src-openai-functions\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ffunction-calling\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Function Calling\",\"description\":\"Current official documentation describing tool\u002Ffunction calling as the interface between models and external systems, data and actions.\"}},\"tunes\":{}},{\"id\":\"src-anthropic-context\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Effective Context Engineering for AI Agents\",\"description\":\"Engineering guidance defining context as the token set available during LLM sampling and explaining why context selection is a finite-resource problem.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":1541,"blocks":1542,"version":2226},1791475413504,[1543,1547,1552,1557,1561,1565,1569,1573,1578,1582,1586,1615,1619,1623,1652,1656,1660,1664,1668,1672,1676,1680,1685,1692,1696,1700,1704,1708,1713,1717,1721,1725,1729,1733,1737,1741,1745,1749,1753,1757,1762,1766,1770,1804,1808,1812,1836,1840,1844,1849,1853,1857,1861,1887,1892,1896,1924,1928,1932,1961,1965,1969,2000,2004,2008,2012,2038,2042,2046,2050,2055,2059,2063,2070,2077,2081,2085,2089,2093,2097,2101,2105,2109,2113,2117,2121,2124,2150,2154,2176,2180,2184,2190,2196,2202,2208,2214,2220],{"id":214,"data":1544,"type":217,"tunes":1546},{"text":1545},"Generative AI is not one component. A production generative AI system usually combines a generative model with application code that supplies instructions and context, retrieves external knowledge when needed, exposes tools for reading or changing external systems, manages runtime state and permissions, and turns the result into a usable product. Treating the model, retrieval, tools, context, runtime, and application as the same thing hides the boundaries that determine freshness, security, reliability, cost, and control.",{},{"id":220,"data":1548,"type":225,"tunes":1551},{"body":1549,"title":1550,"variant":224},"\u003Cstrong>The model generates; retrieval finds external evidence; tools access data or perform actions; context is what the model can see for the current inference; the runtime coordinates execution; the application owns product rules, state, permissions, persistence, and user experience.\u003C\u002Fstrong> These layers can be packaged together by a vendor, but their responsibilities remain different.","Direct answer",{},{"id":228,"data":1553,"type":225,"tunes":1556},{"body":1554,"title":1555,"variant":232},"This article defines durable architectural responsibilities rather than one vendor stack. Current implementation examples were re-checked on \u003Cstrong>8 October 2026\u003C\u002Fstrong>. Vendor APIs and product names can change; the responsibility boundaries are more stable than any individual SDK or endpoint.","Terminology and version note",{},{"id":235,"data":1558,"type":240,"tunes":1560},{"title":1559,"maxLevel":238,"minLevel":239},"Contents",{},{"id":243,"data":1562,"type":41,"tunes":1564},{"text":1563,"level":239},"What does “generative AI” actually mean?",{},{"id":248,"data":1566,"type":217,"tunes":1568},{"text":1567},"At the model level, generative AI refers to AI models that generate derived synthetic content such as text, images, audio, video, code, or other digital output. NIST AI 600-1 uses this model-oriented meaning and separately discusses risks at model, system, application, and use-case levels.",{},{"id":253,"data":1570,"type":217,"tunes":1572},{"text":1571},"That distinction matters because an AI model is not the same thing as the complete AI system. NIST's current glossary defines an AI model as a component that produces outputs from inputs using computational, statistical, or machine-learning techniques, while an AI system can include software, hardware, applications, tools, or utilities that operate using AI.",{},{"id":258,"data":1574,"type":225,"tunes":1577},{"body":1575,"title":1576,"variant":262},"\u003Cstrong>Generative model ≠ generative AI application.\u003C\u002Fstrong>\u003Cbr>A model is one computational component. A usable AI product is a system built around that component.","A useful boundary",{},{"id":265,"data":1579,"type":41,"tunes":1581},{"text":1580,"level":239},"The simplest useful model of a generative AI system",{},{"id":270,"data":1583,"type":217,"tunes":1585},{"text":1584},"For a first mental model, imagine a company assistant answering: “Can this customer receive a refund today?” A useful answer may require several different responsibilities. The language model can interpret the question and write the explanation, but the current order state may come from a database tool, the refund policy may come from document retrieval, permissions may be enforced by the application, and the final action may require a controlled API call.",{},{"id":275,"data":1587,"type":304,"tunes":1614},{"steps":1588,"title":1613,"orientation":303},[1589,1592,1595,1598,1601,1604,1607,1610],{"label":1590,"description":1591},"1. User request","The application receives a natural-language question or task.",{"label":1593,"description":1594},"2. Application policy and state","Identity, tenant, permissions, current workflow state, and product rules define what the request is allowed to do.",{"label":1596,"description":1597},"3. Retrieval or direct data access","The system obtains external evidence or current facts when model knowledge is insufficient.",{"label":1599,"description":1600},"4. Context construction","Instructions, user input, selected evidence, relevant state, and tool definitions are assembled for the model.",{"label":1602,"description":1603},"5. Model inference","The generative model interprets the supplied context and produces text, structured output, or a tool request.",{"label":1605,"description":1606},"6. Tool execution when needed","The runtime or application validates and executes approved tool calls outside the model.",{"label":1608,"description":1609},"7. Observation and continuation","Tool results can return to the model as new context for another inference step.",{"label":1611,"description":1612},"8. Validation and product output","The application validates the result, records required state or audit data, and presents or executes the final outcome.","One common execution path",{},{"id":307,"data":1616,"type":217,"tunes":1618},{"text":1617},"Real systems do not always follow this sequence exactly. Retrieval can happen before the first model call, tools can be selected during an agent loop, deterministic application logic can bypass the model entirely, and validation can occur at several stages. The point is to separate responsibilities, not to impose one universal workflow.",{},{"id":312,"data":1620,"type":41,"tunes":1622},{"text":1621,"level":239},"The six boundaries that matter",{},{"id":317,"data":1624,"type":357,"tunes":1651},{"rows":1625,"title":1643,"layout":346,"columns":1644},[1626,1629,1631,1634,1637,1640],{"id":321,"label":1627,"values":1628},"Model",[324,324,324],{"id":326,"label":327,"values":1630},[324,324,324],{"id":330,"label":1632,"values":1633},"Tools",[324,324,324],{"id":334,"label":1635,"values":1636},"Context",[324,324,324],{"id":338,"label":1638,"values":1639},"Runtime \u002F orchestrator",[324,324,324],{"id":342,"label":1641,"values":1642},"Application",[324,324,324],"Six responsibilities inside one AI product",[1645,1647,1649],{"id":349,"label":1646},"Primary job",{"id":352,"label":1648},"Typical inputs",{"id":355,"label":1650},"Not the same as",{},{"id":360,"data":1653,"type":41,"tunes":1655},{"text":1654,"level":239},"1. The model: generation is its core responsibility",{},{"id":365,"data":1657,"type":217,"tunes":1659},{"text":1658},"A generative model maps supplied inputs to generated outputs. For a language model, that can include natural-language text, structured JSON, code, classifications, summaries, plans, or tool-call arguments. Multimodal generative models can work with additional input and output types.",{},{"id":370,"data":1661,"type":217,"tunes":1663},{"text":1662},"The model can contain substantial learned knowledge in its parameters, but parameterized knowledge is not a live database. The model does not automatically know a document created five minutes ago, the current stock level, a private customer record, or the state of an application unless that information is supplied through the current input path.",{},{"id":375,"data":1665,"type":217,"tunes":1667},{"text":1666},"This is why changing the model does not automatically solve stale knowledge, missing permissions, broken retrieval, incorrect state ownership, or unsafe tool execution. Those failures often belong to other layers.",{},{"id":380,"data":1669,"type":41,"tunes":1671},{"text":1670,"level":239},"2. Retrieval: finding external evidence is a separate operation",{},{"id":385,"data":1673,"type":217,"tunes":1675},{"text":1674},"Retrieval selects information from an external source before or during generation. The 2020 Retrieval-Augmented Generation work by Lewis et al. made the separation explicit by combining a parametric generative model with retrieved non-parametric memory. Modern production systems use many retrieval variants, but the architectural idea remains: useful evidence can be fetched at inference time instead of relying only on what the model learned during training.",{},{"id":390,"data":1677,"type":217,"tunes":1679},{"text":1678},"Retrieval can use lexical search, embeddings, vector search, hybrid search, SQL, knowledge graphs, metadata filters, APIs, or other selection mechanisms. A vector database is therefore one possible retrieval component, not the definition of RAG.",{},{"id":395,"data":1681,"type":225,"tunes":1684},{"body":1682,"title":1683,"variant":399},"A retrieved passage can be highly relevant and still be stale, unauthorized, from the wrong version, or insufficient to support a claim. Retrieval quality and evidence quality must be evaluated separately.","Relevance is not authority",{},{"id":402,"data":1686,"type":408,"tunes":1691},{"url":1687,"title":1688,"excerpt":1689,"ctaLabel":1690},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works","What Is RAG? The Simplest Explanation of How It Works","The canonical plain-English explanation of retrieval-augmented generation, including the separation between LLM, knowledge, state, memory and tools.","Read the RAG foundation",{},{"id":411,"data":1693,"type":41,"tunes":1695},{"text":1694,"level":239},"3. Tools: access and action are not model knowledge",{},{"id":416,"data":1697,"type":217,"tunes":1699},{"text":1698},"A tool is an interface through which an AI runtime can request functionality outside the model. A tool can query a database, search the web, read a file, calculate a value, call an internal service, create a ticket, send a message, modify a record, or trigger another controlled operation.",{},{"id":421,"data":1701,"type":217,"tunes":1703},{"text":1702},"OpenAI's current function-calling documentation makes this boundary explicit: function calling lets models interface with external systems and access data or actions provided by the application. The model can propose or select a call, but the external system performs the real operation.",{},{"id":426,"data":1705,"type":217,"tunes":1707},{"text":1706},"Tool use therefore creates two separate questions: Can the model request this capability? and Will the application authorize and execute it? A production system should not confuse model intent with permission to cause a side effect.",{},{"id":431,"data":1709,"type":225,"tunes":1712},{"body":1710,"title":1711,"variant":262},"A model can emit a valid tool request and still be denied. Authorization, argument validation, rate limits, transaction rules, audit requirements, and rollback belong outside the model.","Model intent is not execution authority",{},{"id":437,"data":1714,"type":41,"tunes":1716},{"text":1715,"level":239},"4. Context: what the model can see right now",{},{"id":442,"data":1718,"type":217,"tunes":1720},{"text":1719},"Context is the information available to the model for a particular inference step. Anthropic's context-engineering guidance describes context as the set of tokens included when sampling from an LLM. In practice, that set can contain system instructions, user messages, conversation history, retrieved evidence, tool definitions, tool results, memory summaries, and selected application state.",{},{"id":447,"data":1722,"type":217,"tunes":1724},{"text":1723},"Context is therefore neither the complete knowledge base nor long-term memory. A company may store ten million documents while only a handful of passages enter one model call. A runtime may persist a year of conversation history while exposing only the pieces needed for the current task.",{},{"id":452,"data":1726,"type":217,"tunes":1728},{"text":1727},"The context window also creates an engineering constraint. Adding more text does not guarantee a better answer; irrelevant, stale, contradictory, or low-authority information can dilute the evidence that actually matters.",{},{"id":457,"data":1730,"type":41,"tunes":1732},{"text":1731,"level":239},"5. Runtime and orchestration: coordinating the loop",{},{"id":462,"data":1734,"type":217,"tunes":1736},{"text":1735},"The runtime or orchestration layer coordinates how the model participates in a task. Depending on the architecture, it can manage sessions, model requests, tool discovery, tool-call loops, retries, handoffs, streaming events, timeouts, checkpoints, compaction, or execution environments.",{},{"id":467,"data":1738,"type":217,"tunes":1740},{"text":1739},"Some runtimes are thin application code around a model API. Others are full agent harnesses. A managed vendor runtime can own part of the loop while the application still owns domain truth, authorization, business side effects, and product lifecycle.",{},{"id":472,"data":1742,"type":217,"tunes":1744},{"text":1743},"This boundary is important because where the runtime runs and where inference runs are separate decisions. A locally running client or agent process can still call a remote model, while a remote application can call a model hosted on infrastructure under the organization's control.",{},{"id":477,"data":1746,"type":41,"tunes":1748},{"text":1747,"level":239},"6. The application: where AI becomes a product",{},{"id":482,"data":1750,"type":217,"tunes":1752},{"text":1751},"The application is the product boundary around the AI components. It owns the user experience, domain model, current state, identity, tenant scope, permissions, persistence, service integrations, validation, observability, billing or quota logic where relevant, and the rules that determine what the AI is allowed to see or do.",{},{"id":487,"data":1754,"type":217,"tunes":1756},{"text":1755},"This is the layer that turns “a model can produce useful output” into “a system can deliver a reliable capability.” The same model can participate in a private research assistant, a support workflow, a code agent, or a commerce application because the surrounding application changes the data, tools, policies, state, and execution contract.",{},{"id":492,"data":1758,"type":225,"tunes":1761},{"body":1759,"title":1760,"variant":224},"Provider and model substitution can be an architectural goal. The application's authoritative state, permissions, domain rules, audit trail, and user contract cannot simply be delegated to whichever model is currently selected.","The model is replaceable; the product boundary is not",{},{"id":498,"data":1763,"type":41,"tunes":1765},{"text":1764,"level":239},"How the parts work together in a real request",{},{"id":503,"data":1767,"type":217,"tunes":1769},{"text":1768},"Consider a support assistant asked: “Refund order 4711 if it is still eligible, and explain why.” The request combines knowledge, current state, authorization, reasoning, and a side effect.",{},{"id":508,"data":1771,"type":346,"tunes":1803},{"content":1772,"stretched":42,"withHeadings":13},[1773,1777,1780,1784,1788,1792,1796,1799],[1774,1775,1776],"Need","Correct layer","Why",[1778,327,1779],"Refund policy","The system must find the current applicable policy and preserve its provenance.",[1781,1782,1783],"Order 4711 status","Direct data\u002Ftool access","The current order record is volatile authoritative state, not something to guess from model knowledge.",[1785,1786,1787],"User's authority to refund","Application \u002F authorization","Permissions must be enforced independently of what the model asks for.",[1789,1790,1791],"Interpret policy against order facts","Model + context","The model can reason over the policy evidence and current order state supplied to it.",[1793,1794,1795],"Execute refund","Tool + application transaction rules","A controlled external operation changes real state.",[1797,1627,1798],"Explain outcome","The model can generate the user-facing explanation from validated results.",[1800,1801,1802],"Audit what happened","Application \u002F runtime","The system records evidence, calls, decisions, side effects, and errors as required.",{},{"id":543,"data":1805,"type":217,"tunes":1807},{"text":1806},"If the assistant only has the language model, it can discuss refunds but cannot safely know whether order 4711 is currently eligible or perform the transaction. If it only has retrieval, it may find the policy but still lack live order state. If it has tools without application authorization, it may become capable but unsafe. Reliability comes from composing the layers with explicit ownership.",{},{"id":548,"data":1809,"type":41,"tunes":1811},{"text":1810,"level":239},"Different AI products use different combinations",{},{"id":553,"data":1813,"type":357,"tunes":1835},{"rows":1814,"title":1827,"layout":346,"columns":1828},[1815,1818,1821,1824],{"id":557,"label":1816,"values":1817},"Model-only assistant",[324,324,324,324],{"id":561,"label":1819,"values":1820},"Retrieval-grounded assistant",[324,324,324,324],{"id":565,"label":1822,"values":1823},"Tool-using assistant",[324,324,324,324],{"id":569,"label":1825,"values":1826},"Agentic application",[324,324,324,324],"The presence of a model does not define the whole architecture",[1829,1830,1831,1833],{"id":326,"label":327},{"id":330,"label":1632},{"id":577,"label":1832},"Authoritative state",{"id":580,"label":1834},"Typical capability",{},{"id":584,"data":1837,"type":217,"tunes":1839},{"text":1838},"These are architecture patterns, not maturity rankings. A model-only feature can be the correct design when the task needs no external facts or actions. Adding retrieval, tools, memory, or an agent loop is justified only when the task requires those capabilities.",{},{"id":589,"data":1841,"type":41,"tunes":1843},{"text":1842,"level":239},"Implementation evidence: Aaasaasa AI Client",{},{"id":594,"data":1845,"type":225,"tunes":1848},{"body":1846,"title":1847,"variant":232},"The following section describes an implementation I built and reviewed against the Aaasaasa AI Client codebase and architecture documentation as of \u003Cstrong>26 July 2026\u003C\u002Fstrong>. It is evidence for the usefulness of these boundaries, not a claim that one implementation is a universal standard or a commercially deployed enterprise product.","Primary implementation evidence",{},{"id":600,"data":1850,"type":217,"tunes":1852},{"text":1851},"Aaasaasa AI Client is a local-first desktop AI workspace built with Nuxt 4, Electron and TypeScript. Its AI Hub deliberately separates agent\u002Fclient, provider, model, runtime location, permissions, and web client instead of treating them as one “AI” setting.",{},{"id":605,"data":1854,"type":217,"tunes":1856},{"text":1855},"That separation creates concrete behavior. Direct Chat can talk to models without filesystem or shell tools. A Codex agent can use a selected workspace and permission profile. Ollama can provide direct local inference, while LM Studio and configurable OpenAI-compatible endpoints represent other provider paths. A locally running Codex process can still use a cloud model, so the UI and architecture do not equate local runtime with local inference.",{},{"id":610,"data":1858,"type":217,"tunes":1860},{"text":1859},"The implementation also contains Qdrant\u002Fvector support, document-extraction capabilities and an authenticated directory MCP broker. Those components illustrate another boundary: retrieval infrastructure and tool access can live in the same product without becoming properties of the model itself.",{},{"id":615,"data":1862,"type":346,"tunes":1886},{"content":1863,"stretched":42,"withHeadings":13},[1864,1867,1869,1872,1875,1878,1881,1884],[1865,1866],"A01 concept","Aaasaasa AI Client implementation evidence",[1627,1868],"A provider-specific model identifier is selected separately from provider and runtime.",[1870,1871],"Provider","Ollama, LM Studio, OpenAI-compatible services and other provider paths are represented separately.",[1873,1874],"Runtime","Local or remote agent\u002Fruntime location is tracked independently of the model.",[1876,1877],"Tools \u002F access","Direct Chat has no filesystem or shell tools; controlled directory access is brokered separately.",[1879,1880],"Permissions","Workspace permission profiles are application\u002Fsession policy, not model capability.",[1882,1883],"Retrieval infrastructure","Vector support and document extraction exist as data\u002Fretrieval capabilities rather than model features.",[1641,1885],"The Electron\u002FNuxt product coordinates UI, credentials, providers, runtime discovery, permissions, tools and model interaction.",{},{"id":642,"data":1888,"type":225,"tunes":1891},{"body":1889,"title":1890,"variant":262},"The architecture became easier to reason about once \u003Cstrong>model, provider, runtime, permissions, tools, data and client\u003C\u002Fstrong> stopped being represented as one configuration choice. The distinction is operational: it determines what can run locally, what can access files, what may call paid cloud inference, and which layer owns authorization.","Implementation lesson",{},{"id":648,"data":1893,"type":41,"tunes":1895},{"text":1894,"level":239},"Common category errors",{},{"id":653,"data":1897,"type":346,"tunes":1923},{"content":1898,"stretched":42,"withHeadings":13},[1899,1902,1905,1908,1911,1914,1917,1920],[1900,1901],"Category error","What is actually happening",[1903,1904],"“The AI knows our documents.”","The application or retrieval layer makes selected document content available to the model.",[1906,1907],"“RAG is our vector database.”","The vector database can be one index or store used by a retrieval pipeline; RAG is the retrieval-plus-generation pattern.",[1909,1910],"“The model called our CRM.”","The model produced a tool request; the runtime\u002Fapplication authorized and executed the external call.",[1912,1913],"“It is local AI because the desktop agent runs locally.”","Runtime location and inference location are separate. A local runtime can still invoke a remote model.",[1915,1916],"“The model has permission to edit files.”","The application\u002Fruntime grants a tool capability under a permission policy; permission is not an intrinsic model property.",[1918,1919],"“More context means more knowledge.”","Context is the finite input made available for one inference. Larger context can contain more noise, conflict or stale information.",[1921,1922],"“The chatbot is the AI architecture.”","The chat UI is one interface. The system can also include identity, state, retrieval, tools, runtime, validation, persistence and observability.",{},{"id":682,"data":1925,"type":41,"tunes":1927},{"text":1926,"level":239},"Failure modes when the boundaries collapse",{},{"id":687,"data":1929,"type":217,"tunes":1931},{"text":1930},"Boundary mistakes are not merely terminology problems. They create distinct production failures that require different fixes.",{},{"id":692,"data":1933,"type":357,"tunes":1960},{"rows":1934,"title":1953,"layout":346,"columns":1954},[1935,1938,1941,1944,1947,1950],{"id":696,"label":1936,"values":1937},"Stale answer",[324,324,324],{"id":700,"label":1939,"values":1940},"Missing company fact",[324,324,324],{"id":704,"label":1942,"values":1943},"Unsafe side effect",[324,324,324],{"id":708,"label":1945,"values":1946},"Confused answer with lots of supplied text",[324,324,324],{"id":712,"label":1948,"values":1949},"Unexpected cloud use",[324,324,324],{"id":716,"label":1951,"values":1952},"Agent stalls or repeats",[324,324,324],"Diagnose the failing layer before replacing the model",[1955,1956,1958],{"id":722,"label":723},{"id":725,"label":1957},"Likely boundary problem",{"id":728,"label":1959},"First architectural check",{},{"id":732,"data":1962,"type":41,"tunes":1964},{"text":1963,"level":239},"What is stable and what is version-sensitive?",{},{"id":737,"data":1966,"type":217,"tunes":1968},{"text":1967},"The architectural distinctions in this article are intentionally vendor-neutral. The current examples below are implementation facts that should be re-checked when APIs evolve.",{},{"id":742,"data":1970,"type":346,"tunes":1999},{"content":1971,"stretched":42,"withHeadings":13},[1972,1976,1980,1983,1987,1991,1995],[1973,1974,1975],"Area","Stable architectural idea","Verified current example on 8 Oct 2026",[1977,1978,1979],"AI model vs system","A model is a component inside a broader system","NIST's current glossary separately defines AI model and AI system.",[754,1981,1982],"Generation can be conditioned on retrieved external information","The Lewis et al. 2020 formulation remains the foundational reference; production retrieval methods now extend far beyond one dense index design.",[1984,1985,1986],"Hosted retrieval","Retrieval can be exposed as a managed tool","OpenAI File Search is currently a Responses API tool that searches uploaded-file knowledge bases using semantic and keyword retrieval.",[1988,1989,1990],"Function\u002Ftool calling","A model can request application-defined external capabilities","OpenAI currently documents function calling as an interface to external systems, data and actions.",[1992,1993,1994],"Context engineering","Model behavior depends on the finite information supplied for the current inference","Anthropic's current engineering guidance defines context as the token set included when sampling from the LLM and focuses on curating that set.",[1996,1997,1998],"Vendor APIs","SDKs, tool names, endpoint shapes and supported features change","Treat vendor documentation as version-sensitive even when the responsibility boundary remains stable.",{},{"id":775,"data":2001,"type":217,"tunes":2003},{"text":2002},"A source-of-truth article should therefore preserve both levels: stable concepts for architecture, and dated evidence for current implementations. Mixing the two makes an article age unnecessarily fast.",{},{"id":780,"data":2005,"type":41,"tunes":2007},{"text":2006,"level":239},"The AI component-boundary test",{},{"id":785,"data":2009,"type":217,"tunes":2011},{"text":2010},"When evaluating an AI feature, ask the following questions in order. The answers reveal which components the system actually has and which responsibilities are still implicit.",{},{"id":790,"data":2013,"type":304,"tunes":2037},{"steps":2014,"title":2036,"orientation":303},[2015,2018,2021,2024,2027,2030,2033],{"label":2016,"description":2017},"1. What generates the output?","Identify the exact model and the modalities or structured outputs it provides.",{"label":2019,"description":2020},"2. What facts are authoritative outside the model?","Identify documents, databases, APIs, current state and other sources of truth.",{"label":2022,"description":2023},"3. How is relevant information selected?","Separate direct lookup, search, retrieval, ranking and context construction.",{"label":2025,"description":2026},"4. What can cause real side effects?","List tools and external actions, then identify who validates and authorizes them.",{"label":2028,"description":2029},"5. What reaches the model as context?","Make instructions, evidence, state, history, memory and tool definitions explicit.",{"label":2031,"description":2032},"6. Who owns the loop?","Identify the runtime or harness that manages calls, events, retries, tool loops and sessions.",{"label":2034,"description":2035},"7. What remains the application's responsibility?","Make identity, permissions, domain state, validation, persistence, observability and UX explicit.","Seven questions for a production design",{},{"id":817,"data":2039,"type":41,"tunes":2041},{"text":2040,"level":239},"What generative AI is not",{},{"id":822,"data":2043,"type":217,"tunes":2045},{"text":2044},"Generative AI is not synonymous with an LLM, even though LLMs are a major class of generative model. It is also not synonymous with RAG, a vector database, an agent, a tool protocol, a chatbot UI, or an application.",{},{"id":827,"data":2047,"type":217,"tunes":2049},{"text":2048},"Those concepts can be connected, but each answers a different architectural question. An LLM asks how language output is produced. Retrieval asks where external evidence comes from. Tools ask how external capabilities are exposed. Context asks what the model can see. Runtime asks how execution is coordinated. The application asks how the capability becomes a controlled product.",{},{"id":832,"data":2051,"type":225,"tunes":2054},{"body":2052,"title":2053,"variant":262},"\u003Cstrong>Model = generate.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Retrieval = find evidence.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Tools = read or act outside the model.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Context = what the model sees now.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Runtime = coordinate execution.\u003C\u002Fstrong>\u003Cbr>\u003Cstrong>Application = own the product, state, rules and permissions.\u003C\u002Fstrong>","If you remember only one model",{},{"id":838,"data":2056,"type":41,"tunes":2058},{"text":2057,"level":239},"Where to go next in the knowledge graph",{},{"id":843,"data":2060,"type":217,"tunes":2062},{"text":2061},"Once these boundaries are clear, deeper topics become easier to place. RAG belongs in retrieval and context construction. Retrieval Trigger decides when external evidence is required. Agent memory concerns what persists across time. Tool calling and MCP belong to capability access. Agent harnesses belong to runtime orchestration. RBAC, tenant isolation and domain authorization belong to the application and platform security boundary.",{},{"id":848,"data":2064,"type":408,"tunes":2069},{"url":2065,"title":2066,"excerpt":2067,"ctaLabel":2068},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhere-does-an-llm-get-its-data-rag-data-sources-in-python","Where Does an LLM Get Its Data? RAG Data Sources in Python","A practical continuation showing how files, SQL, APIs, full-text search, embeddings and context assembly connect external data to an LLM.","See the data path in code",{},{"id":856,"data":2071,"type":408,"tunes":2076},{"url":2072,"title":2073,"excerpt":2074,"ctaLabel":2075},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger","When Should an AI Stop Trusting Its Own Knowledge? — The Retrieval Trigger","A decision model for when an AI system should stop relying only on model knowledge and obtain external evidence.","Read the retrieval decision model",{},{"id":864,"data":2078,"type":41,"tunes":2080},{"text":2079,"level":239},"Limitations",{},{"id":869,"data":2082,"type":217,"tunes":2084},{"text":2083},"The six-layer model is a responsibility map, not a requirement that every product deploy six separate services. A small application may implement context construction, retrieval and orchestration inside one process. A managed platform may bundle several responsibilities behind one API. Physical deployment can be combined while semantic ownership remains distinct.",{},{"id":874,"data":2086,"type":217,"tunes":2088},{"text":2087},"Terminology also varies across vendors and research. “Agent,” “runtime,” “memory,” “tool,” “connector,” and “context” can be defined differently. The definitions here are chosen to make operational ownership and failure diagnosis explicit rather than to claim that every framework uses identical vocabulary.",{},{"id":879,"data":2090,"type":217,"tunes":2092},{"text":2091},"The Aaasaasa AI Client section documents one implementation pattern. It demonstrates that explicit boundaries are practical, but it does not prove that the same component layout is optimal for every AI product.",{},{"id":884,"data":2094,"type":41,"tunes":2096},{"text":2095,"level":239},"What would change this answer?",{},{"id":889,"data":2098,"type":217,"tunes":2100},{"text":2099},"The responsibility map would need revision if model architectures themselves began to own authoritative external state, permissions, durable transactional side effects, and verifiable source access as intrinsic properties rather than capabilities supplied by a surrounding system. Current production architectures do not make that a safe general assumption.",{},{"id":894,"data":2102,"type":217,"tunes":2104},{"text":2103},"Individual implementation examples will change much sooner. Hosted retrieval tools, agent APIs, MCP integrations, context-management features and provider capabilities evolve quickly. Those details should be updated without collapsing the underlying distinctions between generation, evidence, capability access, context, execution and application control.",{},{"id":899,"data":2106,"type":41,"tunes":2108},{"text":2107,"level":239},"Conclusion",{},{"id":904,"data":2110,"type":217,"tunes":2112},{"text":2111},"Generative AI becomes easier to design once “the AI” stops being treated as one black box. The model is the generative component, not the complete product. Retrieval provides external evidence. Tools expose capabilities. Context carries selected information into the current inference. The runtime coordinates execution. The application owns the authoritative product boundary.",{},{"id":909,"data":2114,"type":217,"tunes":2116},{"text":2115},"That separation is useful for more than explanation. It tells engineers where stale facts originate, where authorization belongs, why a local runtime can still use cloud inference, why RAG does not equal a vector database, why tool calls require validation, and why changing the model cannot repair every system failure.",{},{"id":914,"data":2118,"type":217,"tunes":2120},{"text":2119},"The durable architecture question is therefore not “Which AI model are we using?” It is: Which responsibility does each component own, what evidence crosses each boundary, and which layer is allowed to change real state?",{},{"id":919,"data":2122,"type":41,"tunes":2123},{"text":921,"level":239},{},{"id":924,"data":2125,"type":924,"tunes":2149},{"items":2126,"title":2148},[2127,2130,2133,2136,2139,2142,2145],{"id":928,"answer":2128,"question":2129},"No. An LLM is one type of generative model. Generative AI also includes other modalities, and a production generative AI system can include retrieval, tools, runtime logic, application state, permissions, persistence and user interfaces around the model.","Is generative AI the same as an LLM?",{"id":932,"answer":2131,"question":2132},"Usually no. RAG is an application\u002Fsystem pattern that retrieves external information and supplies selected evidence to the model. Some platforms package retrieval tightly with model APIs, but the responsibility remains distinct.","Is RAG part of the model?",{"id":936,"answer":2134,"question":2135},"No. RAG can use vector search, lexical search, hybrid retrieval, SQL, APIs, knowledge graphs or other methods. The defining property is retrieval of external information for generation, not one storage technology.","Is a vector database required for RAG?",{"id":940,"answer":2137,"question":2138},"No. A tool is an external capability. Its definition may be represented in context, and its result may later enter context, but the actual capability executes outside the model.","Are tools the same as context?",{"id":944,"answer":2140,"question":2141},"No. Runtime location and inference location are separate. A local desktop application or agent can call a remote model, while a remote application can call an internally hosted model.","Does running an AI client locally mean the model is local?",{"id":948,"answer":2143,"question":2144},"The application or runtime security boundary should enforce authorization. A model can request an operation, but model intent should never be treated as sufficient execution authority.","Who should enforce permissions for AI tools?",{"id":952,"answer":2146,"question":2147},"Authoritative volatile state should normally remain in the application or domain system that owns it. The AI can receive the relevant state through controlled context or tool access when needed.","Where does current application state belong?","Generative AI system boundaries",{},{"id":958,"data":2151,"type":41,"tunes":2153},{"text":2152,"level":239},"Glossary",{},{"id":963,"data":2155,"type":963,"tunes":2175},{"title":2156,"entries":2157},"Core terms",[2158,2161,2163,2165,2167,2169,2171,2173],{"term":2159,"anchor":969,"definition":2160},"Generative model","An AI model designed to generate derived synthetic content such as text, images, audio, video, code or structured output.",{"term":327,"anchor":326,"definition":2162},"The process of selecting relevant information from an external source or store for the current task.",{"term":754,"anchor":561,"definition":2164},"Retrieval-Augmented Generation: a pattern in which retrieved external information is supplied to a generative model to improve the current output.",{"term":976,"anchor":565,"definition":2166},"A capability exposed to an AI runtime for reading data, calculating, searching, or performing an external action.",{"term":1635,"anchor":334,"definition":2168},"The information available to the model for a particular inference step.",{"term":1638,"anchor":982,"definition":2170},"The software layer that coordinates model calls, tool calls, task loops, sessions, retries, events or execution environments.",{"term":1641,"anchor":342,"definition":2172},"The product and domain layer that owns user interaction, authoritative state, permissions, validation, persistence and business behavior.",{"term":1870,"anchor":987,"definition":2174},"The service or runtime that exposes access to one or more models; provider identity and model identity are separate concerns.",{},{"id":991,"data":2177,"type":41,"tunes":2179},{"text":2178,"level":239},"Primary sources and implementation evidence",{},{"id":996,"data":2181,"type":217,"tunes":2183},{"text":2182},"Stable definitions below are anchored in standards\u002Fresearch; fast-moving implementation examples use current official engineering documentation. Aaasaasa AI Client is original implementation evidence and was checked against its codebase\u002Fdocumentation state dated 26 July 2026.",{},{"id":1001,"data":2185,"type":1008,"tunes":2189},{"link":1003,"meta":2186},{"image":2187,"title":1006,"description":2188},{"url":324},"NIST's Generative AI profile, including the generative-AI definition and explicit distinction between model-, system-, application- and use-case-level concerns.",{},{"id":1011,"data":2191,"type":1008,"tunes":2195},{"link":1013,"meta":2192},{"image":2193,"title":1016,"description":2194},{"url":324},"Current NIST glossary definition of an AI model as a component of an information system that produces outputs from inputs using AI techniques.",{},{"id":1020,"data":2197,"type":1008,"tunes":2201},{"link":1022,"meta":2198},{"image":2199,"title":1025,"description":2200},{"url":324},"Current NIST glossary definition showing that an AI system can include data systems, software, hardware, applications, tools or utilities using AI.",{},{"id":1029,"data":2203,"type":1008,"tunes":2207},{"link":1031,"meta":2204},{"image":2205,"title":1034,"description":2206},{"url":324},"The 2020 paper introducing the RAG formulation that combines a generative model with retrieved non-parametric memory.",{},{"id":1038,"data":2209,"type":1008,"tunes":2213},{"link":1040,"meta":2210},{"image":2211,"title":1043,"description":2212},{"url":324},"Current official documentation for hosted file retrieval in the Responses API using uploaded-file knowledge bases, semantic search and keyword search.",{},{"id":1047,"data":2215,"type":1008,"tunes":2219},{"link":1049,"meta":2216},{"image":2217,"title":1052,"description":2218},{"url":324},"Current official documentation describing tool\u002Ffunction calling as the interface between models and external systems, data and actions.",{},{"id":1056,"data":2221,"type":1008,"tunes":2225},{"link":1058,"meta":2222},{"image":2223,"title":1061,"description":2224},{"url":324},"Engineering guidance defining context as the token set available during LLM sampling and explaining why context selection is a finite-resource problem.",{},"2.31.6","Generative AI is more than a model. Learn how models, retrieval, tools, context, runtimes and applications fit together in production AI systems.","Post erfolgreich abgerufen",{"items":2230,"source":2313,"manualIds":2314,"manualMatchedIds":2315},[2231,2238,2244,2251,2258,2265,2272,2279,2285,2292,2299,2306],{"id":2232,"slug":2233,"title":2234,"excerpt":2235,"featuredImage":2236,"publishedAt":2237},"482","adr-vs-nfr-architecture-decisions-and-system-quality-are-not-the-same-thing","ADR vs. NFR: Architekturentscheidungen und Systemqualität sind nicht dasselbe","ADR vs. NFR erklärt: Erfahren Sie, wie Systemqualitätsanforderungen Architekturentscheidungen beeinflussen, wie ADRs Abwägungen dokumentieren und warum die Validierung getrennt bleibt.","\u002Fuploads\u002F2026\u002F10\u002Fadr-vs-nfr-architecture-decisions-and-system-quality-are-not-the-same-thing-1791475921511-6zgen1.webp","2026-10-08T12:11:00.000Z",{"id":2239,"slug":2240,"title":405,"excerpt":2241,"featuredImage":2242,"publishedAt":2243},"478","what-is-rag-the-simplest-explanation-of-how-it-works","RAG klingt kompliziert, aber die Idee ist einfach: Bevor eine KI antwortet, sucht sie zunächst nützliche Informationen aus einer Wissensquelle und gibt diese Informationen an das Sprachmodell weiter. Dieser Leitfaden erklärt RAG, LLMs, Zustand, Gedächtnis und Werkzeuge anhand eines einfachen mentalen Modells.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":2245,"slug":2246,"title":2247,"excerpt":2248,"featuredImage":2249,"publishedAt":2250},"490","rbac-vs-tenant-isolation-two-different-security-boundaries","RBAC vs. Mandantenisolierung: Zwei unterschiedliche Sicherheitsgrenzen","RBAC steuert, was ein Benutzer tun darf; Mandantenisolierung steuert, auf welche Ressourcen eines Mandanten diese Aktion zugreifen darf. Erfahren Sie, warum die Sicherheit von Multi-Tenant-SaaS beide Grenzen erfordert.","\u002Fuploads\u002F2026\u002F10\u002Frbac-vs-tenant-isolation-two-different-security-boundaries-1791485111528-qqtzby.webp","2026-10-08T14:43:00.000Z",{"id":2252,"slug":2253,"title":2254,"excerpt":2255,"featuredImage":2256,"publishedAt":2257},"483","what-is-an-ai-solution-architect-system-boundaries-responsibilities-and-trade-offs","Was ist ein KI-Lösungsarchitekt? Systemgrenzen, Verantwortlichkeiten und Kompromisse","Ein KI-Lösungsarchitekt verwandelt Geschäftsanforderungen in ein produktionsreifes KI-System über Daten, Modelle, Tools, Sicherheit, Laufzeit, Evaluierung und Betrieb hinweg.","\u002Fuploads\u002F2026\u002F10\u002Fwhat-is-an-ai-solution-architect-system-boundaries-responsibilities-and-trade-offs-1791476643267-1st5xz.webp","2026-10-08T12:23:00.000Z",{"id":2259,"slug":2260,"title":2261,"excerpt":2262,"featuredImage":2263,"publishedAt":2264},"495","sovereign-ai-control-of-models-data-infrastructure-and-dependencies","Souveräne KI: Kontrolle über Modelle, Daten, Infrastruktur und Abhängigkeiten","Souveräne KI bedeutet wirksame Kontrolle über Modelle, Daten, Infrastruktur, Software, Betrieb und strategische Abhängigkeiten – nicht einfach, wo ein KI-Modell gehostet wird.","\u002Fuploads\u002F2026\u002F10\u002Fsovereign-ai-control-of-models-data-infrastructure-and-dependencies-1791488833132-niy85x.webp","2026-10-08T15:45:00.000Z",{"id":2266,"slug":2267,"title":2268,"excerpt":2269,"featuredImage":2270,"publishedAt":2271},"470","what-should-an-ai-agent-remember-forget-recompute-or-retrieve-again","Was sollte ein KI-Agent behalten, vergessen, neu berechnen oder erneut abrufen?","Langlaufende Agenten sollten sich nicht alles merken. Dieser Artikel bietet ein praktisches Lebenszyklusmodell für die Entscheidung, was in den dauerhaften Speicher gehört, was erneut abgerufen werden sollte, was sicherer neu zu berechnen ist und was ablaufen oder ersetzt werden sollte.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-should-an-ai-agent-remember-forget-recompute-or-retrieve-again-1790351131087-iehz28.webp","2026-09-25T09:43:00.000Z",{"id":2273,"slug":2274,"title":2275,"excerpt":2276,"featuredImage":2277,"publishedAt":2278},"485","enterprise-ai-architecture-what-changes-when-ai-enters-a-company","Enterprise-KI-Architektur: Was ändert sich, wenn KI in ein Unternehmen eintritt","Enterprise-KI-Architektur erklärt, wie KI Unternehmenssysteme über Datenhoheit, Identität, Berechtigungen, Anbieter, Risiko, Governance, Evaluierung, Compliance und Betrieb hinweg verändert.","\u002Fuploads\u002F2026\u002F10\u002Fenterprise-ai-architecture-what-changes-when-ai-enters-a-company-1791478161363-czrwaq.webp","2026-10-08T10:48:00.000Z",{"id":2280,"slug":2281,"title":859,"excerpt":2282,"featuredImage":2283,"publishedAt":2284},"480","when-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger","Ein KI-Modell benötigt nicht für jede Frage einen Retrieval. Das wichtige Problem ist zu erkennen, wann sein internes Wissen nicht mehr ausreicht. Der Retrieval-Trigger ist eine praktische Entscheidungsgrenze, die bestimmt, wann ein KI-System aufhören sollte, sich allein auf das Modellwissen zu verlassen, und vor der Beantwortung externe Evidenz einholen sollte.","\u002Fuploads\u002F2026\u002F09\u002Fwhen-should-an-ai-stop-trusting-its-own-knowledge-the-retrieval-trigger-1790574991244-f4rpyg.webp","2026-09-28T01:49:00.000Z",{"id":2286,"slug":2287,"title":2288,"excerpt":2289,"featuredImage":2290,"publishedAt":2291},"476","mcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained","MCP vs A2A vs UCP vs AP2 vs A2UI: Der Agenten-Protokoll-Stack erklärt","MCP, A2A, UCP, AP2 und A2UI werden oft als konkurrierende Agentenstandards dargestellt. Sie lösen größtenteils unterschiedliche Interoperabilitätsprobleme. Dieser Leitfaden ordnet jedes Protokoll der Grenze zu, die es tatsächlich standardisiert—und zeigt, wie sie in einem Produktionssystem zusammenarbeiten können.","\u002Fuploads\u002F2026\u002F09\u002Fmcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained-1790352625869-2ezle0.webp","2026-09-25T12:09:00.000Z",{"id":2293,"slug":2294,"title":2295,"excerpt":2296,"featuredImage":2297,"publishedAt":2298},"471","how-to-know-whether-an-ai-agent-actually-used-the-right-evidence","Wie man erkennt, ob ein KI-Agent tatsächlich die richtigen Belege verwendet hat","Ein KI-Agent kann Quellen zitieren und trotzdem die falschen Belege verwenden. Dieser Artikel stellt eine praktische Methode zur Überprüfung der Belegung von Behauptungen, der Quellenautorität, der Anwendbarkeit, der Herkunft sowie der Frage vor, ob die Belege die Antwort tatsächlich beeinflusst haben.","\u002Fuploads\u002F2026\u002F09\u002Fhow-to-know-whether-an-ai-agent-actually-used-the-right-evidence-1790351317188-o5z9ve.webp","2026-09-25T11:47:00.000Z",{"id":2300,"slug":2301,"title":2302,"excerpt":2303,"featuredImage":2304,"publishedAt":2305},"489","agentic-ai-explained-when-an-ai-system-can-plan-use-tools-and-act","Agentische KI erklärt: Wenn ein KI-System planen, Werkzeuge nutzen und handeln kann","Agentische KI verwendet Modelle innerhalb mehrstufiger Ausführungsschleifen, in denen sie Werkzeuge auswählen, Ergebnisse beobachten, den Zustand aktualisieren und ihre nächste Aktion innerhalb expliziter Laufzeit- und Berechtigungsgrenzen anpassen können.","\u002Fuploads\u002F2026\u002F10\u002Fagentic-ai-explained-when-an-ai-system-can-plan-use-tools-and-act-1791481499084-wnji2a.webp","2026-10-08T11:43:00.000Z",{"id":2307,"slug":2308,"title":2309,"excerpt":2310,"featuredImage":2311,"publishedAt":2312},"492","mcp-explained-what-it-connects-what-it-does-not-do-and-where-it-fits","MCP erklärt: Was es verbindet, was es nicht tut und wo es passt","Das Model Context Protocol verbindet KI-Anwendungen über eine standardisierte Client-Server-Grenze mit externen Tools, Ressourcen und Prompts. Erfahren Sie, was MCP tut, was es nicht tut und wo es in der Agentenarchitektur einzuordnen ist.","\u002Fuploads\u002F2026\u002F10\u002Fmcp-explained-what-it-connects-what-it-does-not-do-and-where-it-fits-1791486640275-7ub1cq.webp","2026-10-08T15:09:00.000Z","fallback",[],[]]