[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:de":3,"public-menus:all":37,"post:ai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context:de":204,"related:post:ai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context:de:1":1498},{"statusCode":4,"data":5,"message":36},200,{"tenantId":6,"lang":7,"defaultLang":7,"siteUrl":8,"contactEmail":9,"brandName":10,"logoUrl":11,"siteName":10,"siteDescription":12,"ogImage":9,"robotsIndex":13,"socialLinks":9,"reservedSlugs":9,"seoPolicy":14},"stajic","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":15,"relatedContent":16,"crossDomainLinks":17},{"logoUrl":11},{"enabled":13},[18,21,24,27,30,33],{"url":19,"label":20,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":22,"label":23,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":25,"label":26,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.com","bazify.com",{"url":28,"label":29,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.de","bazify.de",{"url":31,"label":32,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.at","bazify.at",{"url":34,"label":35,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[38,44],{"id":39,"name":40,"location":41,"isActive":13,"isDefault":42,"items":43},1,"main-navigation","header",false,[],{"id":45,"name":46,"location":47,"isActive":13,"isDefault":13,"items":48},4,"main-menu","sidebar",[49,65,78,92,102,117,132],{"id":50,"title":51,"url":59,"target":60,"icon":61,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":63,"portfolioId":9,"children":64},"item-18",{"de":52,"en":53,"es":54,"fr":55,"it":53,"ru":56,"sr":57,"zh":58},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":66,"title":67,"url":74,"target":60,"icon":75,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":76,"portfolioId":9,"children":77},"item-22",{"de":68,"en":68,"es":69,"fr":68,"it":70,"ru":71,"sr":72,"zh":73},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":79,"title":80,"url":88,"target":60,"icon":89,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":90,"portfolioId":9,"children":91},"item-19",{"de":81,"en":82,"es":83,"fr":82,"it":84,"ru":85,"sr":86,"zh":87},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":93,"title":94,"url":98,"target":60,"icon":99,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":100,"portfolioId":9,"children":101},"item-23",{"de":95,"en":95,"es":95,"fr":95,"it":95,"ru":96,"sr":96,"zh":97},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":103,"title":104,"url":113,"target":60,"icon":114,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":115,"portfolioId":9,"children":116},"item-32",{"de":105,"en":106,"es":107,"fr":108,"it":109,"ru":110,"sr":111,"zh":112},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":118,"title":119,"url":128,"target":60,"icon":129,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":130,"portfolioId":9,"children":131},"item-20",{"de":120,"en":121,"es":122,"fr":123,"it":124,"ru":125,"sr":126,"zh":127},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":133,"title":134,"url":143,"target":60,"icon":144,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":146},"item-21",{"de":135,"en":136,"es":137,"fr":138,"it":139,"ru":140,"sr":141,"zh":142},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[147,160,174,180,192],{"id":148,"title":149,"url":143,"target":60,"icon":158,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":159},"item-24",{"de":150,"en":151,"es":152,"fr":153,"it":154,"ru":155,"sr":156,"zh":157},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":161,"title":162,"url":170,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":173},"item-29",{"de":163,"en":164,"es":165,"fr":166,"it":167,"ru":168,"sr":169,"zh":142},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":175,"title":176,"url":178,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":179},"item-28",{"de":177,"en":177,"es":177,"fr":177,"it":177,"ru":177,"sr":177,"zh":177},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":181,"title":182,"url":190,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":191},"item-27",{"de":183,"en":184,"es":185,"fr":186,"it":187,"ru":188,"sr":189,"zh":184},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":193,"title":194,"url":202,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":203},"item-31",{"de":195,"en":196,"es":197,"fr":198,"it":199,"ru":200,"sr":201,"zh":196},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":205,"message":1497},{"id":206,"title":207,"slug":208,"content":209,"contentJson":210,"excerpt":756,"featuredImage":757,"featuredImageAlt":758,"featuredImageCaption":9,"featuredImageTitle":9,"featuredImageCopyright":9,"featuredImageAuthor":9,"featuredImageSourceUrl":9,"featuredImageLicense":9,"featuredImageIsAiGenerated":42,"status":759,"publishedAt":760,"createdAt":761,"updatedAt":762,"seoLocalePaths":763,"categories":772,"author":785,"translations":790},"468","KI-Agenten-Gedächtnis ist kein RAG: Wie man Gedächtnis, Retrieval, Zustand und Kontext voneinander trennt","ai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Inhalt\">\u003Cstrong class=\"editorjs-toc__title\">Inhalt\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-5\" class=\"editorjs-toc__link\">Der Kategorienfehler: Alles, was persistent wirkt, als Gedächtnis zu behandeln\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-8\" class=\"editorjs-toc__link\">Eine Vier-Schichten-Architektur: Zustand, Gedächtnis, Retrieval, Kontext\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">1. Zustand: Was jetzt zutrifft\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-13\" class=\"editorjs-toc__link\">2. Gedächtnis: Was aus der Vergangenheit persistent bleiben soll\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-16\" class=\"editorjs-toc__link\">3. Retrieval: Was jetzt ausgewählt werden sollte\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-19\" class=\"editorjs-toc__link\">4. Kontext: Was das Modell im Moment tatsächlich nutzen kann\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-22\" class=\"editorjs-toc__link\">Wie die Ebenen interagieren\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-24\" class=\"editorjs-toc__link\">Warum RAG kein Gedächtnis ist\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-28\" class=\"editorjs-toc__link\">Der Trennungstest der vier Ebenen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-32\" class=\"editorjs-toc__link\">Fehlermodi durch das Verschmelzen der Ebenen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-34\" class=\"editorjs-toc__link\">Was sollte erinnert, abgerufen, neu berechnet oder neu ausgelesen werden?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-36\" class=\"editorjs-toc__link\">Ein Gedächtnissystem benötigt eine Schreibrichtlinie, nicht nur eine Abrufrichtlinie\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-40\" class=\"editorjs-toc__link\">Provenienz ist die Brücke zwischen Gedächtnis und verlässlichen Belegen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-43\" class=\"editorjs-toc__link\">Mehr Speicher bedeutet nicht mehr Kontext\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-46\" class=\"editorjs-toc__link\">Checkliste für das Produktionsdesign\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-48\" class=\"editorjs-toc__link\">Was würde diese Antwort ändern?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-51\" class=\"editorjs-toc__link\">Einschränkungen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-53\" class=\"editorjs-toc__link\">Fazit\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-56\" class=\"editorjs-toc__link\">FAQ\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-58\" class=\"editorjs-toc__link\">Glossar\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-60\" class=\"editorjs-toc__link\">Primärquellen und weiterführende Literatur\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Cp>Das Gedächtnis von KI-Agenten, Retrieval-Augmented Generation (RAG), Laufzeitzustand und Modellkontext werden oft so diskutiert, als seien sie austauschbar. Das sind sie nicht. Werden sie zu einem einzigen Konzept zusammengefasst, wird es schwieriger, Agentensysteme logisch zu erfassen, zu debuggen und das Risiko für veraltete oder unsichere Daten steigt.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Direkte Antwort\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">&lt;strong&gt;RAG ist kein Agentengedächtnis.&lt;\u002Fstrong&gt; RAG ist ein Retrieval-Muster: Es wählt Informationen aus, die für den aktuellen Modellaufruf nützlich sein könnten. Gedächtnis sind persistente Informationen, die aus früheren Interaktionen oder Erfahrungen stammen und über die Zeit hinweg verwaltet werden. Der Zustand stellt dar, was aktuell für die laufende Aufgabe oder Umgebung zutrifft. Kontext sind die Informationen, die dem Modell für die aktuelle Inferenz tatsächlich zur Verfügung gestellt werden. Ein produktiver Agent kann alle vier nutzen, aber sie lösen unterschiedliche Probleme.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Über das in diesem Artikel verwendete Modell\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Die unten beschriebene Vierteilung ist ein praktisches Architekturmodell, kein formaler Industriestandard. Anbieter und wissenschaftliche Arbeiten verwenden oft überlappende Terminologien. Der Zweck ist operativer Natur: Designentscheidungen, Zuständigkeiten, Fehleranalysen und Tests klarer zu gestalten.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-5\">Der Kategorienfehler: Alles, was persistent wirkt, als Gedächtnis zu behandeln\u003C\u002Fh2>\n\u003Cp>Eine Vektordatenbank kann Konversationsfragmente speichern. Ein Sitzungsobjekt kann die letzten Interaktionsschritte enthalten. Eine Datenbankzeile kann den aktuellen Workflow-Status abbilden. Ein Summarizer kann frühere Schritte komprimieren. Ein Retriever kann alte Belege abrufen. All dies kann den Eindruck erwecken, dass sich ein Agent „erinnert“, aber die Semantik ist keineswegs dieselbe.\u003C\u002Fp>\n\u003Cp>Die Unterscheidung ist wichtig, da die erforderlichen Korrektheitsregeln unterschiedlich sind. Der aktuelle Zustand muss maßgeblich und aktuell sein. Das Gedächtnis benötigt Lebenszyklusregeln für das Schreiben, Überarbeiten, Vergessen und die Konfliktbewältigung. Das Retrieval erfordert Relevanz und Qualität bei der Auswahl von Belegen. Der Kontext erfordert Disziplin beim Token-Budget und Schutz vor irrelevanten oder widersprüchlichen Inhalten.\u003C\u002Fp>\n\u003Ch2 id=\"section-8\">Eine Vier-Schichten-Architektur: Zustand, Gedächtnis, Retrieval, Kontext\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Schicht\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Kernfrage\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Typische Beispiele\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Primäres Korrektheitskriterium\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Zustand\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Was trifft jetzt zu?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Aufgabenstatus, Warenkorbinhalt, Workflow-Schritt, aktive Berechtigungen, aktueller Spielstatus\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Aktualität und Autorität\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Gedächtnis\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Was aus der Vergangenheit soll persistent bleiben?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Benutzerpräferenz, frühere Entscheidung, erlernte Einschränkung, gelöster Fehler, dauerhafter Projektfakt\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Lebenszyklus, Überarbeitung, Herkunft (Provenance), Vergessen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Retrieval\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Welche Informationen sollten jetzt ausgewählt werden?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Vektorsuche, Stichwortsuche, Graph-Abfrage, Reranking, Dokumentensuche\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Relevanz und Auswahl von Belegen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kontext\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Was sieht das Modell bei diesem Aufruf?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Systemanweisungen, aktuelle Anfrage, abgerufene Passagen, Tool-Ergebnisse, Zusammenfassungen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Nutzen pro Token, Reihenfolge, Konsistenz, Rauschen\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch3 id=\"section-10\">1. Zustand: Was jetzt zutrifft\u003C\u002Fh3>\n\u003Cp>Der Zustand gehört zum laufenden System, nicht zur Erinnerung des Modells. Wenn eine Bestellung storniert wird, ein Deployment pausiert wird, ein Benutzer eine Berechtigung verliert oder eine Aufgabe von „in Bearbeitung“ zu „genehmigt“ wechselt, sollte der maßgebliche Wert aus dem System stammen, das diese Tatsache verwaltet.\u003C\u002Fp>\n\u003Cp>Ein gefährliches Design besteht darin, eine alte Gesprächszusammenfassung als Ersatz für den aktuellen Zustand zu verwenden. Der Agent erinnert sich möglicherweise präzise daran, dass die Bestellung gestern aktiv war, und liegt heute dennoch falsch. Der Zustand erfordert daher eine eindeutige Zuständigkeit, Versionierung oder Zeitstempel, wo relevant, sowie einen Weg, die verlässliche Datenquelle vor folgenreichen Aktionen erneut abzufragen.\u003C\u002Fp>\n\u003Ch3 id=\"section-13\">2. Gedächtnis: Was aus der Vergangenheit persistent bleiben soll\u003C\u002Fh3>\n\u003Cp>Gedächtnis ist nicht einfach „alles, was wir speichern können“. Eine sinnvolle Gedächtnisschicht entscheidet, was Persistenz verdient, in welcher Form, für wie lange, mit welcher Herkunft und unter welchen Bedingungen es überarbeitet oder entfernt werden muss.\u003C\u002Fp>\n\u003Cp>Neuere Forschungen zum Gedächtnis von Agenten betrachten die reine Speicherung von Transkripten zunehmend als unzureichend. Die Arbeit rund um PlugMem von Microsoft konzentriert sich darauf, rohe Interaktionsverläufe in strukturiertes, wiederverwendbares Wissen zu transformieren. Memora trennt reichhaltige gespeicherte Inhalte von leichteren Abstraktionen und Retrieval-Hinweisen, sodass Systeme mit langen Zeithorizonten nicht mehr zwischen Detailtreue und skalierbarem Zugriff wählen müssen.\u003C\u002Fp>\n\u003Ch3 id=\"section-16\">3. Retrieval: Was jetzt ausgewählt werden sollte\u003C\u002Fh3>\n\u003Cp>Retrieval ist ein Auswahlmechanismus. Er kann externe Dokumente, interne Wissensdatenbanken, gespeicherte Gedächtnisinhalte, Protokolle, Graphen, Datenbanken oder gemischte Quellen durchsuchen. RAG ist typischerweise hier angesiedelt: Belege abrufen, ausgewähltes Material in die Arbeitseingabe des Modells einfügen und dann eine Antwort generieren.\u003C\u002Fp>\n\u003Cp>Dieser Mechanismus wird nicht allein dadurch zum Gedächtnis, dass der durchsuchte Datenbestand frühere Interaktionen enthält. Derselbe Retriever kann Richtliniendokumente durchsuchen, die der Agent nie erlebt hat, Produktdaten aus einem anderen System oder frühere Entscheidungen eines Nutzers. Retrieval beschreibt, wie Informationen ausgewählt werden; Gedächtnis beschreibt, warum manche Informationen über die Zeit hinweg bestehen bleiben und wie dieses Fortbestehen gesteuert wird.\u003C\u002Fp>\n\u003Ch3 id=\"section-19\">4. Kontext: Was das Modell im Moment tatsächlich nutzen kann\u003C\u002Fh3>\n\u003Cp>Der Kontext ist die dem Modell zugewandte Ebene. Anthropic beschreibt Context Engineering als die Entscheidung darüber, welche Konfiguration des Kontexts am ehesten das gewünschte Verhalten hervorruft, wobei der Kontext aus den Token besteht, die dem Modell während der Generierung zur Verfügung stehen. Die Richtlinien von OpenAI zum Sitzungsgedächtnis behandeln Kürzung und Komprimierung ähnlich als Kontextmanagement-Techniken für langlebige Agenten-Interaktionen.\u003C\u002Fp>\n\u003Cp>Aus diesem Grund kann ein System über ein hervorragendes Gedächtnis verfügen und dennoch scheitern. Die relevante Erinnerung existiert möglicherweise, wird jedoch nicht abgerufen. Sie wird vielleicht abgerufen, aber im Kontext neben stärkeren, widersprüchlichen Text platziert. Sie wird eventuell so weit komprimiert, dass das entscheidende Detail verschwindet. Oder das Modell erhält so viel Material, dass nützliche Belege durch Rauschen verwässert werden.\u003C\u002Fp>\n\u003Ch2 id=\"section-22\">Wie die Ebenen interagieren\u003C\u002Fh2>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Ein möglicher Produktionsablauf\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Autoritativ festgelegten Zustand lesen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Aktuelle Aufgaben-, Benutzer-, System- oder Umgebungsfakten aus den zuständigen Systemen laden.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Gedächtnisbedarf identifizieren\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Feststellen, ob frühere Entscheidungen, Präferenzen, Erkenntnisse oder langfristige Einschränkungen relevant sind.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Belege abrufen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Gedächtnis und externes Wissen mittels semantischer, lexikalischer, graphbasierter, strukturierter oder hybrider Suche abfragen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Kontext aufbauen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Anweisungen, aktuellen Zustand, ausgewählte Belege und komprimierten Verlauf innerhalb des nutzbaren Kontexts des Modells zusammenstellen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Generieren oder handeln\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Das Modell zieht Schlüsse aus dem zusammengestellten Kontext und generiert eine Antwort, einen Plan oder einen Tool-Aufruf.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Validieren und zurückschreiben\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Folgenreiche Ausgaben validieren, autoritativen Zustand aktualisieren (wo zulässig) und nur Erinnerungen speichern, die den Schreibrichtlinien entsprechen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-24\">Warum RAG kein Gedächtnis ist\u003C\u002Fh2>\n\u003Cp>Der einfachste Test lautet: Ein RAG-System kann Informationen abrufen, die der Agent noch nie zuvor gesehen hat. Das allein zeigt bereits, dass Abruf und Gedächtnis unterschiedliche Abstraktionen sind.\u003C\u002Fp>\n\u003Cp>RAG beantwortet: „Welche Belege soll ich abrufen?“ Ein Gedächtnissystem muss zusätzlich Fragen beantworten wie: „Sollte dieses Ereignis zu dauerhaftem Wissen werden?“, „Ersetzt diese neue Information eine ältere Erinnerung?“, „Kann man dieser Erinnerung noch vertrauen?“, „Wer darf sie lesen?“ und „Wann sollte sie vergessen werden?“\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Eine häufige Designfalle\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Wenn jeder Gesprächsschritt in einen Vektorspeicher eingebettet und später anhand von Ähnlichkeit abgerufen wird, verfügt das System zwar über ein persistentes Lookup, aber nicht zwingend über eine sauber geregelte Gedächtnisarchitektur. Persistenz allein bestimmt nicht die Qualität des Gedächtnisses.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-28\">Der Trennungstest der vier Ebenen\u003C\u002Fh2>\n\u003Cp>Wenn eine Funktion als „Gedächtnis“ bezeichnet wird, stellen Sie die folgenden vier Fragen. Die Antworten zeigen gewöhnlich, welche Ebene tatsächlich betroffen ist.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Frage\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Wenn ja, haben Sie es primär zu tun mit\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Stellt dies den aktuellen, autoritativen Zustand der Aufgabe oder Umgebung dar?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Zustand (State)\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Muss diese Information die aktuelle Ausführung überdauern, weil sie nützliche frühere Erfahrungen, Präferenzen oder Entscheidungen festhält?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Gedächtnis (Memory)\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Besteht das Hauptproblem darin zu entscheiden, welche gespeicherten oder externen Informationen für die aktuelle Anfrage relevant sind?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Abruf (Retrieval)\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Besteht das Hauptproblem darin zu entscheiden, welche Informationen in den aktuellen Modellaufruf aufgenommen werden sollen?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kontext (Context)\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Eine einzelne Komponente kann an mehr als einer Ebene beteiligt sein. Eine Datenbank kann sowohl Zustand als auch Gedächtnis speichern. Ein Vektorindex kann sowohl externes Wissen als auch Erinnerungen abrufen. Die Trennung ist semantischer Natur, nicht zwingend physischer.\u003C\u002Fp>\n\u003Ch2 id=\"section-32\">Fehlermodi durch das Verschmelzen der Ebenen\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Fehlermodus\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Was passiert ist\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Ergebnis\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Veralteter Zustand als Gedächtnis getarnt\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Einer alten Zusammenfassung wird vertraut, anstatt das autoritative System erneut auszulesen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Der Agent agiert auf der Grundlage von Fakten, die einmal wahr waren\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Gedächtnis als unveränderliche Tatsache behandelt\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Eine frühere Präferenz oder Entscheidung wird ohne Revisionsregeln gespeichert\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Überholte Informationen beeinflussen weiterhin zukünftige Antworten\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Abruftreffer als Wahrheit behandelt\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Hohe Ähnlichkeit wird mit faktischer Autorität verwechselt\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Relevant wirkende, aber falsche Belege dominieren\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kontextüberlastung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Zu viele abgerufene Passagen, Erinnerungen, Protokolle und Anweisungen werden injiziert\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Die entscheidenden Belege werden verwässert oder widersprochen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Unkontrolliertes Schreiben ins Gedächtnis\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Vom Modell generierte Interpretationen werden automatisch als dauerhaftes Gedächtnis gespeichert\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Fehler werden dauerhaft und verstärken sich selbst\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Keine Herkunftsgrenze (Provenance)\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Das System kann nicht zwischen Benutzeraussage, Quellfakt, Modellinferenz und generierter Zusammenfassung unterscheiden\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Bei späteren Abrufen geht der Belegstatus der Information verloren\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-34\">Was sollte erinnert, abgerufen, neu berechnet oder neu ausgelesen werden?\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Informationstyp\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Bevorzugte Behandlung\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Grund\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Aktuelle Berechtigung, Bestellstatus, Inventar, Workflow-Status\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Autoritativen Zustand neu auslesen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Aktualität ist wichtiger als Erinnerung\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Stabile, vom Benutzer explizit angegebene Benutzerpräferenz\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Gedächtnis mit Bearbeitungs-\u002FLöschsemantik\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sitzungsübergreifend nützlich und im Besitz des Benutzers\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Entscheidung während eines länger laufenden Projekts\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Gedächtnis mit Zeitstempel, Herkunft und Ersetzungsregeln\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Der Verlauf ist wichtig, aber Entscheidungen können sich ändern\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Produktspezifikation oder öffentliches Richtliniendokument\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Aus der Quelle abrufen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Externes Wissen sollte an seine Belege gebunden bleiben\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Abgeleitete Metrik, die kostengünstig neu berechnet werden kann\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Neu berechnen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Vermeiden, veraltete abgeleitete Werte persistent zu speichern\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Lange Tool-Rohausgabe\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Extern speichern; bei Bedarf abrufen oder zusammenfassen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kontext nicht dauerhaft belegen\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Modellhypothese oder unsichere Interpretation\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Nicht automatisch zu dauerhaftem Gedächtnis befördern\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Inferenz ist nicht gleichbedeutend mit Tatsachen\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-36\">Ein Gedächtnissystem benötigt eine Schreibrichtlinie, nicht nur eine Abrufrichtlinie\u003C\u002Fh2>\n\u003Cp>Diskussionen über RAG-Architekturen konzentrieren sich häufig auf die Retrieval-Qualität: Chunking, Embeddings, Reranking, hybride Suche und Grounding. Das Langzeitgedächtnis bringt eine weitere Facette des Problems mit sich: Was darf überhaupt erst in den persistenten Speicher gelangen?\u003C\u002Fp>\n\u003Cp>Für ein dauerhaftes Agentengedächtnis sollte eine praxistaugliche Schreibrichtlinie den Gedächtniskandidaten klassifizieren, die Provenienz bewahren, Konflikte mit bestehenden Einträgen erkennen, Beobachtung von Schlussfolgerung unterscheiden, Sensibilität sowie Zugriffsbereich definieren und entscheiden, ob die Information ablaufen, revidiert werden oder eine Benutzerbestätigung erfordern soll.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--tip my-6 rounded-xl border p-5 border-violet-300 bg-violet-50 dark:border-violet-900 dark:bg-violet-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Designprinzip\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Je kostspieliger eine fehlerhafte Erinnerung im Laufe der Zeit wird, desto strenger sollte die Schreibrichtlinie sein. Ein schlechter Retrieval-Vorgang beeinflusst eine einzige Antwort. Eine fehlerhafte dauerhafte Erinnerung kann jede zukünftige Antwort beeinträchtigen, die darauf zugreift.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-40\">Provenienz ist die Brücke zwischen Gedächtnis und verlässlichen Belegen\u003C\u002Fh2>\n\u003Cp>Ein Gedächtniseintrag sollte idealerweise genügend Provenienz bewahren, um folgende Fragen zu beantworten: Woher stammt dies, wann wurde es beobachtet, wer oder was hat es behauptet, wurde es vom Benutzer bereitgestellt oder vom Modell abgeleitet, welche Quelle stützt es und wurde es durch etwas anderes abgelöst?\u003C\u002Fp>\n\u003Cp>Ohne Provenienz kann eine komprimierte Erinnerung autoritativer wirken als die Belege, aus denen sie entstanden ist. Dies ist besonders riskant bei langlebigen Agenten, bei denen Zusammenfassungen und Abstraktionen wiederholt wiederverwendet werden. Das System behält möglicherweise die Schlussfolgerung bei, während die Bedingungen, unter denen die Schlussfolgerung gültig war, verloren gehen.\u003C\u002Fp>\n\u003Ch2 id=\"section-43\">Mehr Speicher bedeutet nicht mehr Kontext\u003C\u002Fh2>\n\u003Cp>Ein langlebiger Agent kann Gigabytes an Zustand, Historie, Dokumenten und erlernten Informationen ansammeln. Das Modell benötigt nicht – und sollte in der Regel auch nicht erhalten – all dies für jeden Schritt. Der Zweck von Retrieval, Zusammenfassung, Kompaktierung und strukturiertem Gedächtnis besteht darin, einen großen persistenten Informationsraum in einen kleinen, relevanten Arbeitskontext umzuwandeln.\u003C\u002Fp>\n\u003Cp>Aus diesem Grund machen auch größere Kontextfenster eine Gedächtnisarchitektur keineswegs überflüssig. Mehr Kapazität mindert zwar den Druck, löst jedoch weder Fragen zu Aktualität, Autorität, widersprüchlichen Belegen, Datenschutzbereichen, Schreibqualität und Revision noch die Entscheidung darüber, was Aufmerksamkeit verdient.\u003C\u002Fp>\n\u003Ch2 id=\"section-46\">Checkliste für das Produktionsdesign\u003C\u002Fh2>\n\u003Cul>\u003Cli>Definieren Sie, welche Systeme für den autoritativen Laufzeitzustand zuständig sind.\u003C\u002Fli>\u003Cli>Definieren Sie, welche Informationen dafür infrage kommen, zu dauerhaftem Gedächtnis zu werden.\u003C\u002Fli>\u003Cli>Halten Sie vom Benutzer bereitgestellte Fakten, externe Belege und Modellinferenzen unterscheidbar.\u003C\u002Fli>\u003Cli>Verknüpfen Sie wichtige Erinnerungen mit Zeitstempeln, Provenienz, Geltungsbereich und Revisionssemantik.\u003C\u002Fli>\u003Cli>Betrachten Sie Retrieval-Relevanz getrennt von faktischer Autorität.\u003C\u002Fli>\u003Cli>Bauen Sie Kontext gezielt auf, anstatt sämtliches abgerufene Material ungefiltert einzufügen.\u003C\u002Fli>\u003Cli>Lesen Sie volatile Fakten neu ein, anstatt alten Erinnerungen zu vertrauen.\u003C\u002Fli>\u003Cli>Berechnen Sie kostengünstige abgeleitete Werte neu, wenn veraltete Daten kostspielig wären.\u003C\u002Fli>\u003Cli>Testen Sie Schreibvorgänge im Gedächtnis genauso sorgfältig wie Lesevorgänge.\u003C\u002Fli>\u003Cli>Messen Sie Fehler differenziert: Zustandsfehler, Gedächtnisfehler, Retrieval-Fehler, Fehler bei der Kontextbildung, Denkfehler und Aktionsfehler.\u003C\u002Fli>\u003C\u002Ful>\n\u003Ch2 id=\"section-48\">Was würde diese Antwort ändern?\u003C\u002Fh2>\n\u003Cp>Die Grenze zwischen diesen Schichten kann sich verschieben, während sich Agentenplattformen weiterentwickeln. Ein Anbieter bietet möglicherweise einen verwalteten Speicherdienst an, der intern Speicherung, Revision, Retrieval, Zusammenfassung und Kontextbildung übernimmt. Dies kann Implementierungskomponenten zusammenführen, beseitigt jedoch nicht die architektonischen Kernfragen. Sie müssen weiterhin wissen, ob ein zurückgegebenes Element der aktuelle Zustand, persistentes Gedächtnis, ein abgerufener Beleg oder lediglich Text ist, der in den Kontext platziert wurde.\u003C\u002Fp>\n\u003Cp>Die Empfehlung würde sich auch für Systeme ohne sitzungsübergreifende Kontinuität ändern, für Systeme, bei denen jede Aufgabe von einem sauberen, unveränderlichen Korpus ausgeht, oder für eng abgegrenzte Arbeitsabläufe, bei denen der gesamte relevante Zustand sicher in einen einzigen Aufruf passt. In solchen Fällen bringt eine dedizierte Langzeitgedächtnisschicht möglicherweise zusätzliche Komplexität ohne ausreichenden Mehrwert mit sich.\u003C\u002Fp>\n\u003Ch2 id=\"section-51\">Einschränkungen\u003C\u002Fh2>\n\u003Cp>Die Terminologie rund um Agentensysteme entwickelt sich weiterhin rasant. Einige Frameworks bezeichnen den Konversationsverlauf als „Gedächtnis“ (Memory), andere verwenden Begriffe wie „Sitzung“ (Session), „Checkpoint“, „Store“, „Kontext“ oder „Zustand“ (State). Forschungssysteme definieren Gedächtnis ebenfalls auf unterschiedlichen Ebenen – von persistenten Lookup-Tabellen bis hin zu gelernter interner Anpassung. Das Modell in diesem Artikel trennt betriebliche Verantwortlichkeiten bewusst voneinander, anstatt ein einheitliches universelles Vokabular aufzuzwingen.\u003C\u002Fp>\n\u003Ch2 id=\"section-53\">Fazit\u003C\u002Fh2>\n\u003Cp>Die zielführende Frage lautet nicht: „Verfügt dieser Agent über ein Gedächtnis?“ Sie lautet vielmehr: Was ist Zustand, was wird aus Erfahrungen persistent gespeichert, wie werden relevante Informationen abgerufen und was erreicht das Modell letztlich als Kontext?\u003C\u002Fp>\n\u003Cp>Sobald diese Zuständigkeiten getrennt sind, lassen sich Architekturentscheidungen leichter testen. Veraltete Fakten lassen sich auf die Zuständigkeit für den Zustand zurückführen. Schlechtes Recall-Verhalten auf den Lebenszyklus des Gedächtnisses oder das Retrieval. Überladene Prompts auf die Kontextkonstruktion. Anhaltende Halluzinationen auf Schreibrichtlinien und Provenienz. RAG bleibt ein wichtiges Werkzeug, ist jedoch nur ein Teil einer verlässlichen Architektur für langlebige Agenten.\u003C\u002Fp>\n\u003Ch2 id=\"section-56\">FAQ\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Gedächtnis von KI-Agenten, RAG, Zustand und Kontext\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Ist RAG dasselbe wie das Gedächtnis von KI-Agenten?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nein. RAG ist in erster Linie ein Retrieval-Muster, das Informationen für einen Modellaufruf auswählt. Beim Gedächtnis geht es darum, welche Informationen aus früheren Interaktionen oder Erfahrungen über die Zeit hinweg bestehen bleiben und wie diese Informationen verwaltet werden.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Ist eine Vektordatenbank ein Agentengedächtnis?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Sie kann Teil eines solchen sein, aber eine Vektordatenbank allein ist lediglich eine Speicher- und Retrieval-Komponente. Eine produktionsreife Gedächtnisarchitektur erfordert zudem Entscheidungen darüber, was gespeichert wird, sowie über Provenienz, Revision, Konflikte, Zugriff, Ablauf und Vergessen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Macht ein größeres Kontextfenster ein Gedächtnis überflüssig?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nicht zwingend. Ein größerer Kontext hilft bei der Kapazität, löst aber nicht das Problem von persistentem Wissen über Sitzungen hinweg, Aktualität, Provenienz, Datenschutzbereichen, Revisionen oder der Entscheidung, was später wiederverwendet werden soll.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Sollte der aktuelle Anwendungszustand als Gedächtnis gespeichert werden?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">In der Regel sollte das maßgebliche Anwendungs- oder Domänensystem die Source of Truth für flüchtigen Zustand bleiben. Das Gedächtnis kann den Verlauf oder die Bedeutung von Zustandsänderungen aufzeichnen, aber folgenreiche Aktionen sollten aktuelle, maßgebliche Werte erneut abrufen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-58\">Glossar\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Wichtige Begriffe\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"state\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Zustand (State)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Der aktuelle maßgebliche Zustand einer Aufgabe, Anwendung, eines Benutzers, Workflows oder einer Umgebung.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"memory\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Gedächtnis (Memory)\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Informationen aus früheren Erfahrungen oder Interaktionen, die persistent bleiben, weil sie später nützlich sein könnten, und die Lebenszyklusregeln unterliegen.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"retrieval\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Retrieval\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Der Mechanismus, der verwendet wird, um potenziell relevante Informationen aus dem Gedächtnis, externem Wissen, Datenbanken, Graphen oder anderen Speichern auszuwählen.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"context\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Kontext\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Die Informationen, die dem Sprachmodell während eines bestimmten Inferenz- oder Generierungsschritts tatsächlich zur Verfügung stehen.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"rag\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">RAG\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Retrieval-Augmented Generation: Ein Muster, bei dem externe oder gespeicherte Informationen abgerufen und einem generativen Modell bereitgestellt werden, um die aktuelle Ausgabe zu verbessern.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"provenance\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Provenienz\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Metadaten, die beschreiben, woher Informationen stammen, wann sie beobachtet wurden, wer oder was sie behauptet hat und wie sie transformiert wurden.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-60\">Primärquellen und weiterführende Literatur\u003C\u002Fh2>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fcookbook\u002Fexamples\u002Fagents_sdk\u002Fsession_memory\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Context Engineering: Kurzzeit-Gedächtnisverwaltung mit Sitzungen\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Leitfaden von OpenAI zum Kürzen und Komprimieren für langlebigen Agentenkontext.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagents\u002Fsandboxes\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">OpenAI — Sandbox-Agenten\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Dokumentation, die persistentes Gedächtnis als Fähigkeit mit schrittweiser Offenlegung und Lese-\u002FSchreibverhalten zeigt.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Anthropic — Effektives Context Engineering für KI-Agenten\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Technische Anleitung zum Kuratieren begrenzter Modellkontexte für verlässliches Agentenverhalten.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fblog\u002Fmemora-a-harmonic-memory-representation-balancing-abstraction-and-specificity\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — Memora\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Forschung zum Ausbalancieren von Abstraktion und Spezifität im Langzeithorizont-Gedächtnis von Agenten.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fblog\u002Ffrom-raw-interaction-to-reusable-knowledge-rethinking-memory-for-ai-agents\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — PlugMem\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Forschung zur Umwandlung roher Agenten-Interaktionsverläufe in wiederverwendbares, strukturiertes Wissen.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fagentic-context-engineering-evolving-contexts-for-self-improving-language-models\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Microsoft Research — Agentic Context Engineering (ACE)\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Forschung zur Weiterentwicklung von Kontext als strukturierte Playbooks anstelle des wiederholten Umschreibens oder Komprimierens aller Daten.\u003C\u002Fp>\u003C\u002Fa>",{"time":211,"blocks":212,"version":755},1790369724491,[213,221,227,235,242,247,252,257,262,293,298,303,308,313,318,323,328,333,338,343,348,353,358,384,389,394,399,406,411,416,436,441,446,479,484,521,526,531,536,543,548,553,558,563,568,573,578,596,601,606,611,616,621,626,631,636,641,663,668,694,699,710,719,728,737,746],{"id":214,"data":215,"type":219,"tunes":220},"_4kVYTpqbe",{"title":216,"maxLevel":217,"minLevel":218},"Inhalt",3,2,"tableOfContents",{},{"id":222,"data":223,"type":225,"tunes":226},"intro",{"text":224},"Das Gedächtnis von KI-Agenten, Retrieval-Augmented Generation (RAG), Laufzeitzustand und Modellkontext werden oft so diskutiert, als seien sie austauschbar. Das sind sie nicht. Werden sie zu einem einzigen Konzept zusammengefasst, wird es schwieriger, Agentensysteme logisch zu erfassen, zu debuggen und das Risiko für veraltete oder unsichere Daten steigt.","paragraph",{},{"id":228,"data":229,"type":233,"tunes":234},"direct",{"body":230,"title":231,"variant":232},"\u003Cstrong>RAG ist kein Agentengedächtnis.\u003C\u002Fstrong> RAG ist ein Retrieval-Muster: Es wählt Informationen aus, die für den aktuellen Modellaufruf nützlich sein könnten. Gedächtnis sind persistente Informationen, die aus früheren Interaktionen oder Erfahrungen stammen und über die Zeit hinweg verwaltet werden. Der Zustand stellt dar, was aktuell für die laufende Aufgabe oder Umgebung zutrifft. Kontext sind die Informationen, die dem Modell für die aktuelle Inferenz tatsächlich zur Verfügung gestellt werden. Ein produktiver Agent kann alle vier nutzen, aber sie lösen unterschiedliche Probleme.","Direkte Antwort","info","callout",{},{"id":236,"data":237,"type":233,"tunes":241},"model-note",{"body":238,"title":239,"variant":240},"Die unten beschriebene Vierteilung ist ein praktisches Architekturmodell, kein formaler Industriestandard. Anbieter und wissenschaftliche Arbeiten verwenden oft überlappende Terminologien. Der Zweck ist operativer Natur: Designentscheidungen, Zuständigkeiten, Fehleranalysen und Tests klarer zu gestalten.","Über das in diesem Artikel verwendete Modell","note",{},{"id":243,"data":244,"type":41,"tunes":246},"h-category",{"text":245,"level":218},"Der Kategorienfehler: Alles, was persistent wirkt, als Gedächtnis zu behandeln",{},{"id":248,"data":249,"type":225,"tunes":251},"p-cat-1",{"text":250},"Eine Vektordatenbank kann Konversationsfragmente speichern. Ein Sitzungsobjekt kann die letzten Interaktionsschritte enthalten. Eine Datenbankzeile kann den aktuellen Workflow-Status abbilden. Ein Summarizer kann frühere Schritte komprimieren. Ein Retriever kann alte Belege abrufen. All dies kann den Eindruck erwecken, dass sich ein Agent „erinnert“, aber die Semantik ist keineswegs dieselbe.",{},{"id":253,"data":254,"type":225,"tunes":256},"p-cat-2",{"text":255},"Die Unterscheidung ist wichtig, da die erforderlichen Korrektheitsregeln unterschiedlich sind. Der aktuelle Zustand muss maßgeblich und aktuell sein. Das Gedächtnis benötigt Lebenszyklusregeln für das Schreiben, Überarbeiten, Vergessen und die Konfliktbewältigung. Das Retrieval erfordert Relevanz und Qualität bei der Auswahl von Belegen. Der Kontext erfordert Disziplin beim Token-Budget und Schutz vor irrelevanten oder widersprüchlichen Inhalten.",{},{"id":258,"data":259,"type":41,"tunes":261},"h-layers",{"text":260,"level":218},"Eine Vier-Schichten-Architektur: Zustand, Gedächtnis, Retrieval, Kontext",{},{"id":263,"data":264,"type":291,"tunes":292},"table-layers",{"content":265,"stretched":42,"withHeadings":13},[266,271,276,281,286],[267,268,269,270],"Schicht","Kernfrage","Typische Beispiele","Primäres Korrektheitskriterium",[272,273,274,275],"Zustand","Was trifft jetzt zu?","Aufgabenstatus, Warenkorbinhalt, Workflow-Schritt, aktive Berechtigungen, aktueller Spielstatus","Aktualität und Autorität",[277,278,279,280],"Gedächtnis","Was aus der Vergangenheit soll persistent bleiben?","Benutzerpräferenz, frühere Entscheidung, erlernte Einschränkung, gelöster Fehler, dauerhafter Projektfakt","Lebenszyklus, Überarbeitung, Herkunft (Provenance), Vergessen",[282,283,284,285],"Retrieval","Welche Informationen sollten jetzt ausgewählt werden?","Vektorsuche, Stichwortsuche, Graph-Abfrage, Reranking, Dokumentensuche","Relevanz und Auswahl von Belegen",[287,288,289,290],"Kontext","Was sieht das Modell bei diesem Aufruf?","Systemanweisungen, aktuelle Anfrage, abgerufene Passagen, Tool-Ergebnisse, Zusammenfassungen","Nutzen pro Token, Reihenfolge, Konsistenz, Rauschen","table",{},{"id":294,"data":295,"type":41,"tunes":297},"h-state",{"text":296,"level":217},"1. Zustand: Was jetzt zutrifft",{},{"id":299,"data":300,"type":225,"tunes":302},"p-state-1",{"text":301},"Der Zustand gehört zum laufenden System, nicht zur Erinnerung des Modells. Wenn eine Bestellung storniert wird, ein Deployment pausiert wird, ein Benutzer eine Berechtigung verliert oder eine Aufgabe von „in Bearbeitung“ zu „genehmigt“ wechselt, sollte der maßgebliche Wert aus dem System stammen, das diese Tatsache verwaltet.",{},{"id":304,"data":305,"type":225,"tunes":307},"p-state-2",{"text":306},"Ein gefährliches Design besteht darin, eine alte Gesprächszusammenfassung als Ersatz für den aktuellen Zustand zu verwenden. Der Agent erinnert sich möglicherweise präzise daran, dass die Bestellung gestern aktiv war, und liegt heute dennoch falsch. Der Zustand erfordert daher eine eindeutige Zuständigkeit, Versionierung oder Zeitstempel, wo relevant, sowie einen Weg, die verlässliche Datenquelle vor folgenreichen Aktionen erneut abzufragen.",{},{"id":309,"data":310,"type":41,"tunes":312},"h-memory",{"text":311,"level":217},"2. Gedächtnis: Was aus der Vergangenheit persistent bleiben soll",{},{"id":314,"data":315,"type":225,"tunes":317},"p-memory-1",{"text":316},"Gedächtnis ist nicht einfach „alles, was wir speichern können“. Eine sinnvolle Gedächtnisschicht entscheidet, was Persistenz verdient, in welcher Form, für wie lange, mit welcher Herkunft und unter welchen Bedingungen es überarbeitet oder entfernt werden muss.",{},{"id":319,"data":320,"type":225,"tunes":322},"p-memory-2",{"text":321},"Neuere Forschungen zum Gedächtnis von Agenten betrachten die reine Speicherung von Transkripten zunehmend als unzureichend. Die Arbeit rund um PlugMem von Microsoft konzentriert sich darauf, rohe Interaktionsverläufe in strukturiertes, wiederverwendbares Wissen zu transformieren. Memora trennt reichhaltige gespeicherte Inhalte von leichteren Abstraktionen und Retrieval-Hinweisen, sodass Systeme mit langen Zeithorizonten nicht mehr zwischen Detailtreue und skalierbarem Zugriff wählen müssen.",{},{"id":324,"data":325,"type":41,"tunes":327},"h-retrieval",{"text":326,"level":217},"3. Retrieval: Was jetzt ausgewählt werden sollte",{},{"id":329,"data":330,"type":225,"tunes":332},"p-ret-1",{"text":331},"Retrieval ist ein Auswahlmechanismus. Er kann externe Dokumente, interne Wissensdatenbanken, gespeicherte Gedächtnisinhalte, Protokolle, Graphen, Datenbanken oder gemischte Quellen durchsuchen. RAG ist typischerweise hier angesiedelt: Belege abrufen, ausgewähltes Material in die Arbeitseingabe des Modells einfügen und dann eine Antwort generieren.",{},{"id":334,"data":335,"type":225,"tunes":337},"p-ret-2",{"text":336},"Dieser Mechanismus wird nicht allein dadurch zum Gedächtnis, dass der durchsuchte Datenbestand frühere Interaktionen enthält. Derselbe Retriever kann Richtliniendokumente durchsuchen, die der Agent nie erlebt hat, Produktdaten aus einem anderen System oder frühere Entscheidungen eines Nutzers. Retrieval beschreibt, wie Informationen ausgewählt werden; Gedächtnis beschreibt, warum manche Informationen über die Zeit hinweg bestehen bleiben und wie dieses Fortbestehen gesteuert wird.",{},{"id":339,"data":340,"type":41,"tunes":342},"h-context",{"text":341,"level":217},"4. Kontext: Was das Modell im Moment tatsächlich nutzen kann",{},{"id":344,"data":345,"type":225,"tunes":347},"p-ctx-1",{"text":346},"Der Kontext ist die dem Modell zugewandte Ebene. Anthropic beschreibt Context Engineering als die Entscheidung darüber, welche Konfiguration des Kontexts am ehesten das gewünschte Verhalten hervorruft, wobei der Kontext aus den Token besteht, die dem Modell während der Generierung zur Verfügung stehen. Die Richtlinien von OpenAI zum Sitzungsgedächtnis behandeln Kürzung und Komprimierung ähnlich als Kontextmanagement-Techniken für langlebige Agenten-Interaktionen.",{},{"id":349,"data":350,"type":225,"tunes":352},"p-ctx-2",{"text":351},"Aus diesem Grund kann ein System über ein hervorragendes Gedächtnis verfügen und dennoch scheitern. Die relevante Erinnerung existiert möglicherweise, wird jedoch nicht abgerufen. Sie wird vielleicht abgerufen, aber im Kontext neben stärkeren, widersprüchlichen Text platziert. Sie wird eventuell so weit komprimiert, dass das entscheidende Detail verschwindet. Oder das Modell erhält so viel Material, dass nützliche Belege durch Rauschen verwässert werden.",{},{"id":354,"data":355,"type":41,"tunes":357},"h-flow",{"text":356,"level":218},"Wie die Ebenen interagieren",{},{"id":359,"data":360,"type":382,"tunes":383},"flow",{"steps":361,"title":380,"orientation":381},[362,365,368,371,374,377],{"label":363,"description":364},"1. Autoritativ festgelegten Zustand lesen","Aktuelle Aufgaben-, Benutzer-, System- oder Umgebungsfakten aus den zuständigen Systemen laden.",{"label":366,"description":367},"2. Gedächtnisbedarf identifizieren","Feststellen, ob frühere Entscheidungen, Präferenzen, Erkenntnisse oder langfristige Einschränkungen relevant sind.",{"label":369,"description":370},"3. Belege abrufen","Gedächtnis und externes Wissen mittels semantischer, lexikalischer, graphbasierter, strukturierter oder hybrider Suche abfragen.",{"label":372,"description":373},"4. Kontext aufbauen","Anweisungen, aktuellen Zustand, ausgewählte Belege und komprimierten Verlauf innerhalb des nutzbaren Kontexts des Modells zusammenstellen.",{"label":375,"description":376},"5. Generieren oder handeln","Das Modell zieht Schlüsse aus dem zusammengestellten Kontext und generiert eine Antwort, einen Plan oder einen Tool-Aufruf.",{"label":378,"description":379},"6. Validieren und zurückschreiben","Folgenreiche Ausgaben validieren, autoritativen Zustand aktualisieren (wo zulässig) und nur Erinnerungen speichern, die den Schreibrichtlinien entsprechen.","Ein möglicher Produktionsablauf","auto","processFlow",{},{"id":385,"data":386,"type":41,"tunes":388},"h-rag",{"text":387,"level":218},"Warum RAG kein Gedächtnis ist",{},{"id":390,"data":391,"type":225,"tunes":393},"p-rag-1",{"text":392},"Der einfachste Test lautet: Ein RAG-System kann Informationen abrufen, die der Agent noch nie zuvor gesehen hat. Das allein zeigt bereits, dass Abruf und Gedächtnis unterschiedliche Abstraktionen sind.",{},{"id":395,"data":396,"type":225,"tunes":398},"p-rag-2",{"text":397},"RAG beantwortet: „Welche Belege soll ich abrufen?“ Ein Gedächtnissystem muss zusätzlich Fragen beantworten wie: „Sollte dieses Ereignis zu dauerhaftem Wissen werden?“, „Ersetzt diese neue Information eine ältere Erinnerung?“, „Kann man dieser Erinnerung noch vertrauen?“, „Wer darf sie lesen?“ und „Wann sollte sie vergessen werden?“",{},{"id":400,"data":401,"type":233,"tunes":405},"rag-trap",{"body":402,"title":403,"variant":404},"Wenn jeder Gesprächsschritt in einen Vektorspeicher eingebettet und später anhand von Ähnlichkeit abgerufen wird, verfügt das System zwar über ein persistentes Lookup, aber nicht zwingend über eine sauber geregelte Gedächtnisarchitektur. Persistenz allein bestimmt nicht die Qualität des Gedächtnisses.","Eine häufige Designfalle","warning",{},{"id":407,"data":408,"type":41,"tunes":410},"h-test",{"text":409,"level":218},"Der Trennungstest der vier Ebenen",{},{"id":412,"data":413,"type":225,"tunes":415},"p-test",{"text":414},"Wenn eine Funktion als „Gedächtnis“ bezeichnet wird, stellen Sie die folgenden vier Fragen. Die Antworten zeigen gewöhnlich, welche Ebene tatsächlich betroffen ist.",{},{"id":417,"data":418,"type":291,"tunes":435},"table-test",{"content":419,"stretched":42,"withHeadings":13},[420,423,426,429,432],[421,422],"Frage","Wenn ja, haben Sie es primär zu tun mit",[424,425],"Stellt dies den aktuellen, autoritativen Zustand der Aufgabe oder Umgebung dar?","Zustand (State)",[427,428],"Muss diese Information die aktuelle Ausführung überdauern, weil sie nützliche frühere Erfahrungen, Präferenzen oder Entscheidungen festhält?","Gedächtnis (Memory)",[430,431],"Besteht das Hauptproblem darin zu entscheiden, welche gespeicherten oder externen Informationen für die aktuelle Anfrage relevant sind?","Abruf (Retrieval)",[433,434],"Besteht das Hauptproblem darin zu entscheiden, welche Informationen in den aktuellen Modellaufruf aufgenommen werden sollen?","Kontext (Context)",{},{"id":437,"data":438,"type":225,"tunes":440},"p-test-note",{"text":439},"Eine einzelne Komponente kann an mehr als einer Ebene beteiligt sein. Eine Datenbank kann sowohl Zustand als auch Gedächtnis speichern. Ein Vektorindex kann sowohl externes Wissen als auch Erinnerungen abrufen. Die Trennung ist semantischer Natur, nicht zwingend physischer.",{},{"id":442,"data":443,"type":41,"tunes":445},"h-fail",{"text":444,"level":218},"Fehlermodi durch das Verschmelzen der Ebenen",{},{"id":447,"data":448,"type":291,"tunes":478},"table-fail",{"content":449,"stretched":42,"withHeadings":13},[450,454,458,462,466,470,474],[451,452,453],"Fehlermodus","Was passiert ist","Ergebnis",[455,456,457],"Veralteter Zustand als Gedächtnis getarnt","Einer alten Zusammenfassung wird vertraut, anstatt das autoritative System erneut auszulesen","Der Agent agiert auf der Grundlage von Fakten, die einmal wahr waren",[459,460,461],"Gedächtnis als unveränderliche Tatsache behandelt","Eine frühere Präferenz oder Entscheidung wird ohne Revisionsregeln gespeichert","Überholte Informationen beeinflussen weiterhin zukünftige Antworten",[463,464,465],"Abruftreffer als Wahrheit behandelt","Hohe Ähnlichkeit wird mit faktischer Autorität verwechselt","Relevant wirkende, aber falsche Belege dominieren",[467,468,469],"Kontextüberlastung","Zu viele abgerufene Passagen, Erinnerungen, Protokolle und Anweisungen werden injiziert","Die entscheidenden Belege werden verwässert oder widersprochen",[471,472,473],"Unkontrolliertes Schreiben ins Gedächtnis","Vom Modell generierte Interpretationen werden automatisch als dauerhaftes Gedächtnis gespeichert","Fehler werden dauerhaft und verstärken sich selbst",[475,476,477],"Keine Herkunftsgrenze (Provenance)","Das System kann nicht zwischen Benutzeraussage, Quellfakt, Modellinferenz und generierter Zusammenfassung unterscheiden","Bei späteren Abrufen geht der Belegstatus der Information verloren",{},{"id":480,"data":481,"type":41,"tunes":483},"h-decision",{"text":482,"level":218},"Was sollte erinnert, abgerufen, neu berechnet oder neu ausgelesen werden?",{},{"id":485,"data":486,"type":291,"tunes":520},"table-decision",{"content":487,"stretched":42,"withHeadings":13},[488,492,496,500,504,508,512,516],[489,490,491],"Informationstyp","Bevorzugte Behandlung","Grund",[493,494,495],"Aktuelle Berechtigung, Bestellstatus, Inventar, Workflow-Status","Autoritativen Zustand neu auslesen","Aktualität ist wichtiger als Erinnerung",[497,498,499],"Stabile, vom Benutzer explizit angegebene Benutzerpräferenz","Gedächtnis mit Bearbeitungs-\u002FLöschsemantik","Sitzungsübergreifend nützlich und im Besitz des Benutzers",[501,502,503],"Entscheidung während eines länger laufenden Projekts","Gedächtnis mit Zeitstempel, Herkunft und Ersetzungsregeln","Der Verlauf ist wichtig, aber Entscheidungen können sich ändern",[505,506,507],"Produktspezifikation oder öffentliches Richtliniendokument","Aus der Quelle abrufen","Externes Wissen sollte an seine Belege gebunden bleiben",[509,510,511],"Abgeleitete Metrik, die kostengünstig neu berechnet werden kann","Neu berechnen","Vermeiden, veraltete abgeleitete Werte persistent zu speichern",[513,514,515],"Lange Tool-Rohausgabe","Extern speichern; bei Bedarf abrufen oder zusammenfassen","Kontext nicht dauerhaft belegen",[517,518,519],"Modellhypothese oder unsichere Interpretation","Nicht automatisch zu dauerhaftem Gedächtnis befördern","Inferenz ist nicht gleichbedeutend mit Tatsachen",{},{"id":522,"data":523,"type":41,"tunes":525},"h-write",{"text":524,"level":218},"Ein Gedächtnissystem benötigt eine Schreibrichtlinie, nicht nur eine Abrufrichtlinie",{},{"id":527,"data":528,"type":225,"tunes":530},"p-write-1",{"text":529},"Diskussionen über RAG-Architekturen konzentrieren sich häufig auf die Retrieval-Qualität: Chunking, Embeddings, Reranking, hybride Suche und Grounding. Das Langzeitgedächtnis bringt eine weitere Facette des Problems mit sich: Was darf überhaupt erst in den persistenten Speicher gelangen?",{},{"id":532,"data":533,"type":225,"tunes":535},"p-write-2",{"text":534},"Für ein dauerhaftes Agentengedächtnis sollte eine praxistaugliche Schreibrichtlinie den Gedächtniskandidaten klassifizieren, die Provenienz bewahren, Konflikte mit bestehenden Einträgen erkennen, Beobachtung von Schlussfolgerung unterscheiden, Sensibilität sowie Zugriffsbereich definieren und entscheiden, ob die Information ablaufen, revidiert werden oder eine Benutzerbestätigung erfordern soll.",{},{"id":537,"data":538,"type":233,"tunes":542},"write-tip",{"body":539,"title":540,"variant":541},"Je kostspieliger eine fehlerhafte Erinnerung im Laufe der Zeit wird, desto strenger sollte die Schreibrichtlinie sein. Ein schlechter Retrieval-Vorgang beeinflusst eine einzige Antwort. Eine fehlerhafte dauerhafte Erinnerung kann jede zukünftige Antwort beeinträchtigen, die darauf zugreift.","Designprinzip","tip",{},{"id":544,"data":545,"type":41,"tunes":547},"h-prov",{"text":546,"level":218},"Provenienz ist die Brücke zwischen Gedächtnis und verlässlichen Belegen",{},{"id":549,"data":550,"type":225,"tunes":552},"p-prov-1",{"text":551},"Ein Gedächtniseintrag sollte idealerweise genügend Provenienz bewahren, um folgende Fragen zu beantworten: Woher stammt dies, wann wurde es beobachtet, wer oder was hat es behauptet, wurde es vom Benutzer bereitgestellt oder vom Modell abgeleitet, welche Quelle stützt es und wurde es durch etwas anderes abgelöst?",{},{"id":554,"data":555,"type":225,"tunes":557},"p-prov-2",{"text":556},"Ohne Provenienz kann eine komprimierte Erinnerung autoritativer wirken als die Belege, aus denen sie entstanden ist. Dies ist besonders riskant bei langlebigen Agenten, bei denen Zusammenfassungen und Abstraktionen wiederholt wiederverwendet werden. Das System behält möglicherweise die Schlussfolgerung bei, während die Bedingungen, unter denen die Schlussfolgerung gültig war, verloren gehen.",{},{"id":559,"data":560,"type":41,"tunes":562},"h-budget",{"text":561,"level":218},"Mehr Speicher bedeutet nicht mehr Kontext",{},{"id":564,"data":565,"type":225,"tunes":567},"p-budget-1",{"text":566},"Ein langlebiger Agent kann Gigabytes an Zustand, Historie, Dokumenten und erlernten Informationen ansammeln. Das Modell benötigt nicht – und sollte in der Regel auch nicht erhalten – all dies für jeden Schritt. Der Zweck von Retrieval, Zusammenfassung, Kompaktierung und strukturiertem Gedächtnis besteht darin, einen großen persistenten Informationsraum in einen kleinen, relevanten Arbeitskontext umzuwandeln.",{},{"id":569,"data":570,"type":225,"tunes":572},"p-budget-2",{"text":571},"Aus diesem Grund machen auch größere Kontextfenster eine Gedächtnisarchitektur keineswegs überflüssig. Mehr Kapazität mindert zwar den Druck, löst jedoch weder Fragen zu Aktualität, Autorität, widersprüchlichen Belegen, Datenschutzbereichen, Schreibqualität und Revision noch die Entscheidung darüber, was Aufmerksamkeit verdient.",{},{"id":574,"data":575,"type":41,"tunes":577},"h-check",{"text":576,"level":218},"Checkliste für das Produktionsdesign",{},{"id":579,"data":580,"type":594,"tunes":595},"checklist",{"meta":581,"items":582,"style":593},{},[583,584,585,586,587,588,589,590,591,592],"Definieren Sie, welche Systeme für den autoritativen Laufzeitzustand zuständig sind.","Definieren Sie, welche Informationen dafür infrage kommen, zu dauerhaftem Gedächtnis zu werden.","Halten Sie vom Benutzer bereitgestellte Fakten, externe Belege und Modellinferenzen unterscheidbar.","Verknüpfen Sie wichtige Erinnerungen mit Zeitstempeln, Provenienz, Geltungsbereich und Revisionssemantik.","Betrachten Sie Retrieval-Relevanz getrennt von faktischer Autorität.","Bauen Sie Kontext gezielt auf, anstatt sämtliches abgerufene Material ungefiltert einzufügen.","Lesen Sie volatile Fakten neu ein, anstatt alten Erinnerungen zu vertrauen.","Berechnen Sie kostengünstige abgeleitete Werte neu, wenn veraltete Daten kostspielig wären.","Testen Sie Schreibvorgänge im Gedächtnis genauso sorgfältig wie Lesevorgänge.","Messen Sie Fehler differenziert: Zustandsfehler, Gedächtnisfehler, Retrieval-Fehler, Fehler bei der Kontextbildung, Denkfehler und Aktionsfehler.","unordered","list",{},{"id":597,"data":598,"type":41,"tunes":600},"h-change",{"text":599,"level":218},"Was würde diese Antwort ändern?",{},{"id":602,"data":603,"type":225,"tunes":605},"p-change-1",{"text":604},"Die Grenze zwischen diesen Schichten kann sich verschieben, während sich Agentenplattformen weiterentwickeln. Ein Anbieter bietet möglicherweise einen verwalteten Speicherdienst an, der intern Speicherung, Revision, Retrieval, Zusammenfassung und Kontextbildung übernimmt. Dies kann Implementierungskomponenten zusammenführen, beseitigt jedoch nicht die architektonischen Kernfragen. Sie müssen weiterhin wissen, ob ein zurückgegebenes Element der aktuelle Zustand, persistentes Gedächtnis, ein abgerufener Beleg oder lediglich Text ist, der in den Kontext platziert wurde.",{},{"id":607,"data":608,"type":225,"tunes":610},"p-change-2",{"text":609},"Die Empfehlung würde sich auch für Systeme ohne sitzungsübergreifende Kontinuität ändern, für Systeme, bei denen jede Aufgabe von einem sauberen, unveränderlichen Korpus ausgeht, oder für eng abgegrenzte Arbeitsabläufe, bei denen der gesamte relevante Zustand sicher in einen einzigen Aufruf passt. In solchen Fällen bringt eine dedizierte Langzeitgedächtnisschicht möglicherweise zusätzliche Komplexität ohne ausreichenden Mehrwert mit sich.",{},{"id":612,"data":613,"type":41,"tunes":615},"h-limit",{"text":614,"level":218},"Einschränkungen",{},{"id":617,"data":618,"type":225,"tunes":620},"p-limit",{"text":619},"Die Terminologie rund um Agentensysteme entwickelt sich weiterhin rasant. Einige Frameworks bezeichnen den Konversationsverlauf als „Gedächtnis“ (Memory), andere verwenden Begriffe wie „Sitzung“ (Session), „Checkpoint“, „Store“, „Kontext“ oder „Zustand“ (State). Forschungssysteme definieren Gedächtnis ebenfalls auf unterschiedlichen Ebenen – von persistenten Lookup-Tabellen bis hin zu gelernter interner Anpassung. Das Modell in diesem Artikel trennt betriebliche Verantwortlichkeiten bewusst voneinander, anstatt ein einheitliches universelles Vokabular aufzuzwingen.",{},{"id":622,"data":623,"type":41,"tunes":625},"h-conclusion",{"text":624,"level":218},"Fazit",{},{"id":627,"data":628,"type":225,"tunes":630},"p-conclusion-1",{"text":629},"Die zielführende Frage lautet nicht: „Verfügt dieser Agent über ein Gedächtnis?“ Sie lautet vielmehr: Was ist Zustand, was wird aus Erfahrungen persistent gespeichert, wie werden relevante Informationen abgerufen und was erreicht das Modell letztlich als Kontext?",{},{"id":632,"data":633,"type":225,"tunes":635},"p-conclusion-2",{"text":634},"Sobald diese Zuständigkeiten getrennt sind, lassen sich Architekturentscheidungen leichter testen. Veraltete Fakten lassen sich auf die Zuständigkeit für den Zustand zurückführen. Schlechtes Recall-Verhalten auf den Lebenszyklus des Gedächtnisses oder das Retrieval. Überladene Prompts auf die Kontextkonstruktion. Anhaltende Halluzinationen auf Schreibrichtlinien und Provenienz. RAG bleibt ein wichtiges Werkzeug, ist jedoch nur ein Teil einer verlässlichen Architektur für langlebige Agenten.",{},{"id":637,"data":638,"type":41,"tunes":640},"h-faq",{"text":639,"level":218},"FAQ",{},{"id":642,"data":643,"type":642,"tunes":662},"faq",{"items":644,"title":661},[645,649,653,657],{"id":646,"answer":647,"question":648},"faq1","Nein. RAG ist in erster Linie ein Retrieval-Muster, das Informationen für einen Modellaufruf auswählt. Beim Gedächtnis geht es darum, welche Informationen aus früheren Interaktionen oder Erfahrungen über die Zeit hinweg bestehen bleiben und wie diese Informationen verwaltet werden.","Ist RAG dasselbe wie das Gedächtnis von KI-Agenten?",{"id":650,"answer":651,"question":652},"faq2","Sie kann Teil eines solchen sein, aber eine Vektordatenbank allein ist lediglich eine Speicher- und Retrieval-Komponente. Eine produktionsreife Gedächtnisarchitektur erfordert zudem Entscheidungen darüber, was gespeichert wird, sowie über Provenienz, Revision, Konflikte, Zugriff, Ablauf und Vergessen.","Ist eine Vektordatenbank ein Agentengedächtnis?",{"id":654,"answer":655,"question":656},"faq3","Nicht zwingend. Ein größerer Kontext hilft bei der Kapazität, löst aber nicht das Problem von persistentem Wissen über Sitzungen hinweg, Aktualität, Provenienz, Datenschutzbereichen, Revisionen oder der Entscheidung, was später wiederverwendet werden soll.","Macht ein größeres Kontextfenster ein Gedächtnis überflüssig?",{"id":658,"answer":659,"question":660},"faq4","In der Regel sollte das maßgebliche Anwendungs- oder Domänensystem die Source of Truth für flüchtigen Zustand bleiben. Das Gedächtnis kann den Verlauf oder die Bedeutung von Zustandsänderungen aufzeichnen, aber folgenreiche Aktionen sollten aktuelle, maßgebliche Werte erneut abrufen.","Sollte der aktuelle Anwendungszustand als Gedächtnis gespeichert werden?","Gedächtnis von KI-Agenten, RAG, Zustand und Kontext",{},{"id":664,"data":665,"type":41,"tunes":667},"h-glossary",{"text":666,"level":218},"Glossar",{},{"id":669,"data":670,"type":669,"tunes":693},"glossary",{"title":671,"entries":672},"Wichtige Begriffe",[673,676,679,682,685,689],{"term":425,"anchor":674,"definition":675},"state","Der aktuelle maßgebliche Zustand einer Aufgabe, Anwendung, eines Benutzers, Workflows oder einer Umgebung.",{"term":428,"anchor":677,"definition":678},"memory","Informationen aus früheren Erfahrungen oder Interaktionen, die persistent bleiben, weil sie später nützlich sein könnten, und die Lebenszyklusregeln unterliegen.",{"term":282,"anchor":680,"definition":681},"retrieval","Der Mechanismus, der verwendet wird, um potenziell relevante Informationen aus dem Gedächtnis, externem Wissen, Datenbanken, Graphen oder anderen Speichern auszuwählen.",{"term":287,"anchor":683,"definition":684},"context","Die Informationen, die dem Sprachmodell während eines bestimmten Inferenz- oder Generierungsschritts tatsächlich zur Verfügung stehen.",{"term":686,"anchor":687,"definition":688},"RAG","rag","Retrieval-Augmented Generation: Ein Muster, bei dem externe oder gespeicherte Informationen abgerufen und einem generativen Modell bereitgestellt werden, um die aktuelle Ausgabe zu verbessern.",{"term":690,"anchor":691,"definition":692},"Provenienz","provenance","Metadaten, die beschreiben, woher Informationen stammen, wann sie beobachtet wurden, wer oder was sie behauptet hat und wie sie transformiert wurden.",{},{"id":695,"data":696,"type":41,"tunes":698},"h-sources",{"text":697,"level":218},"Primärquellen und weiterführende Literatur",{},{"id":700,"data":701,"type":708,"tunes":709},"openai-session",{"link":702,"meta":703},"https:\u002F\u002Fdevelopers.openai.com\u002Fcookbook\u002Fexamples\u002Fagents_sdk\u002Fsession_memory",{"image":704,"title":706,"description":707},{"url":705},"","OpenAI — Context Engineering: Kurzzeit-Gedächtnisverwaltung mit Sitzungen","Leitfaden von OpenAI zum Kürzen und Komprimieren für langlebigen Agentenkontext.","linkTool",{},{"id":711,"data":712,"type":708,"tunes":718},"openai-sandbox",{"link":713,"meta":714},"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagents\u002Fsandboxes",{"image":715,"title":716,"description":717},{"url":705},"OpenAI — Sandbox-Agenten","Dokumentation, die persistentes Gedächtnis als Fähigkeit mit schrittweiser Offenlegung und Lese-\u002FSchreibverhalten zeigt.",{},{"id":720,"data":721,"type":708,"tunes":727},"anthropic-context",{"link":722,"meta":723},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents",{"image":724,"title":725,"description":726},{"url":705},"Anthropic — Effektives Context Engineering für KI-Agenten","Technische Anleitung zum Kuratieren begrenzter Modellkontexte für verlässliches Agentenverhalten.",{},{"id":729,"data":730,"type":708,"tunes":736},"ms-memora",{"link":731,"meta":732},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fblog\u002Fmemora-a-harmonic-memory-representation-balancing-abstraction-and-specificity\u002F",{"image":733,"title":734,"description":735},{"url":705},"Microsoft Research — Memora","Forschung zum Ausbalancieren von Abstraktion und Spezifität im Langzeithorizont-Gedächtnis von Agenten.",{},{"id":738,"data":739,"type":708,"tunes":745},"ms-plugmem",{"link":740,"meta":741},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fblog\u002Ffrom-raw-interaction-to-reusable-knowledge-rethinking-memory-for-ai-agents\u002F",{"image":742,"title":743,"description":744},{"url":705},"Microsoft Research — PlugMem","Forschung zur Umwandlung roher Agenten-Interaktionsverläufe in wiederverwendbares, strukturiertes Wissen.",{},{"id":747,"data":748,"type":708,"tunes":754},"ms-ace",{"link":749,"meta":750},"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fagentic-context-engineering-evolving-contexts-for-self-improving-language-models\u002F",{"image":751,"title":752,"description":753},{"url":705},"Microsoft Research — Agentic Context Engineering (ACE)","Forschung zur Weiterentwicklung von Kontext als strukturierte Playbooks anstelle des wiederholten Umschreibens oder Komprimierens aller Daten.",{},"2.31","Agentengedächtnis, RAG, Zustand und Kontext werden oft so verwendet, als wären sie austauschbar. Das sind sie nicht. Dieses praktische Architekturmodell trennt die vier Schichten, zeigt, wohin jede gehört, und erklärt, was kaputtgeht, wenn Systeme sie zu einer einzigen zusammenfassen.","\u002Fuploads\u002F2026\u002F09\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context-1790350560308-np0xy6.webp","ai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context-1790350560308-np0xy6","PUBLISHED","2026-09-25T11:34:00.000Z","2026-09-25T15:34:35.975Z","2026-09-25T21:01:33.061Z",{"en":764,"de":765,"sr":766,"es":767,"fr":768,"it":769,"ru":770,"zh":771},"\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","\u002Fde\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","\u002Fsr\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","\u002Fes\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","\u002Ffr\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","\u002Fit\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","\u002Fru\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context","\u002Fzh\u002Fblog\u002Fai-agent-memory-is-not-rag-how-to-separate-memory-retrieval-state-and-context",[773,777,781],{"id":774,"name":775,"slug":776},64,"Informationsarchitektur","information-architecture",{"id":778,"name":779,"slug":780},57,"Daten-Grenzen","data-boundaries",{"id":782,"name":783,"slug":784},85,"Qualitäts-Gates","quality-gates",{"id":786,"login":787,"email":788,"displayName":789},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[791,1054],{"lang":7,"title":207,"content":209,"contentJson":792,"excerpt":756},{"time":211,"blocks":793,"version":755},[794,797,800,803,806,809,812,815,818,827,830,833,836,839,842,845,848,851,854,857,860,863,866,876,879,882,885,888,891,894,903,906,909,920,923,935,938,941,944,947,950,953,956,959,962,965,968,973,976,979,982,985,988,991,994,997,1000,1008,1011,1021,1024,1029,1034,1039,1044,1049],{"id":214,"data":795,"type":219,"tunes":796},{"title":216,"maxLevel":217,"minLevel":218},{},{"id":222,"data":798,"type":225,"tunes":799},{"text":224},{},{"id":228,"data":801,"type":233,"tunes":802},{"body":230,"title":231,"variant":232},{},{"id":236,"data":804,"type":233,"tunes":805},{"body":238,"title":239,"variant":240},{},{"id":243,"data":807,"type":41,"tunes":808},{"text":245,"level":218},{},{"id":248,"data":810,"type":225,"tunes":811},{"text":250},{},{"id":253,"data":813,"type":225,"tunes":814},{"text":255},{},{"id":258,"data":816,"type":41,"tunes":817},{"text":260,"level":218},{},{"id":263,"data":819,"type":291,"tunes":826},{"content":820,"stretched":42,"withHeadings":13},[821,822,823,824,825],[267,268,269,270],[272,273,274,275],[277,278,279,280],[282,283,284,285],[287,288,289,290],{},{"id":294,"data":828,"type":41,"tunes":829},{"text":296,"level":217},{},{"id":299,"data":831,"type":225,"tunes":832},{"text":301},{},{"id":304,"data":834,"type":225,"tunes":835},{"text":306},{},{"id":309,"data":837,"type":41,"tunes":838},{"text":311,"level":217},{},{"id":314,"data":840,"type":225,"tunes":841},{"text":316},{},{"id":319,"data":843,"type":225,"tunes":844},{"text":321},{},{"id":324,"data":846,"type":41,"tunes":847},{"text":326,"level":217},{},{"id":329,"data":849,"type":225,"tunes":850},{"text":331},{},{"id":334,"data":852,"type":225,"tunes":853},{"text":336},{},{"id":339,"data":855,"type":41,"tunes":856},{"text":341,"level":217},{},{"id":344,"data":858,"type":225,"tunes":859},{"text":346},{},{"id":349,"data":861,"type":225,"tunes":862},{"text":351},{},{"id":354,"data":864,"type":41,"tunes":865},{"text":356,"level":218},{},{"id":359,"data":867,"type":382,"tunes":875},{"steps":868,"title":380,"orientation":381},[869,870,871,872,873,874],{"label":363,"description":364},{"label":366,"description":367},{"label":369,"description":370},{"label":372,"description":373},{"label":375,"description":376},{"label":378,"description":379},{},{"id":385,"data":877,"type":41,"tunes":878},{"text":387,"level":218},{},{"id":390,"data":880,"type":225,"tunes":881},{"text":392},{},{"id":395,"data":883,"type":225,"tunes":884},{"text":397},{},{"id":400,"data":886,"type":233,"tunes":887},{"body":402,"title":403,"variant":404},{},{"id":407,"data":889,"type":41,"tunes":890},{"text":409,"level":218},{},{"id":412,"data":892,"type":225,"tunes":893},{"text":414},{},{"id":417,"data":895,"type":291,"tunes":902},{"content":896,"stretched":42,"withHeadings":13},[897,898,899,900,901],[421,422],[424,425],[427,428],[430,431],[433,434],{},{"id":437,"data":904,"type":225,"tunes":905},{"text":439},{},{"id":442,"data":907,"type":41,"tunes":908},{"text":444,"level":218},{},{"id":447,"data":910,"type":291,"tunes":919},{"content":911,"stretched":42,"withHeadings":13},[912,913,914,915,916,917,918],[451,452,453],[455,456,457],[459,460,461],[463,464,465],[467,468,469],[471,472,473],[475,476,477],{},{"id":480,"data":921,"type":41,"tunes":922},{"text":482,"level":218},{},{"id":485,"data":924,"type":291,"tunes":934},{"content":925,"stretched":42,"withHeadings":13},[926,927,928,929,930,931,932,933],[489,490,491],[493,494,495],[497,498,499],[501,502,503],[505,506,507],[509,510,511],[513,514,515],[517,518,519],{},{"id":522,"data":936,"type":41,"tunes":937},{"text":524,"level":218},{},{"id":527,"data":939,"type":225,"tunes":940},{"text":529},{},{"id":532,"data":942,"type":225,"tunes":943},{"text":534},{},{"id":537,"data":945,"type":233,"tunes":946},{"body":539,"title":540,"variant":541},{},{"id":544,"data":948,"type":41,"tunes":949},{"text":546,"level":218},{},{"id":549,"data":951,"type":225,"tunes":952},{"text":551},{},{"id":554,"data":954,"type":225,"tunes":955},{"text":556},{},{"id":559,"data":957,"type":41,"tunes":958},{"text":561,"level":218},{},{"id":564,"data":960,"type":225,"tunes":961},{"text":566},{},{"id":569,"data":963,"type":225,"tunes":964},{"text":571},{},{"id":574,"data":966,"type":41,"tunes":967},{"text":576,"level":218},{},{"id":579,"data":969,"type":594,"tunes":972},{"meta":970,"items":971,"style":593},{},[583,584,585,586,587,588,589,590,591,592],{},{"id":597,"data":974,"type":41,"tunes":975},{"text":599,"level":218},{},{"id":602,"data":977,"type":225,"tunes":978},{"text":604},{},{"id":607,"data":980,"type":225,"tunes":981},{"text":609},{},{"id":612,"data":983,"type":41,"tunes":984},{"text":614,"level":218},{},{"id":617,"data":986,"type":225,"tunes":987},{"text":619},{},{"id":622,"data":989,"type":41,"tunes":990},{"text":624,"level":218},{},{"id":627,"data":992,"type":225,"tunes":993},{"text":629},{},{"id":632,"data":995,"type":225,"tunes":996},{"text":634},{},{"id":637,"data":998,"type":41,"tunes":999},{"text":639,"level":218},{},{"id":642,"data":1001,"type":642,"tunes":1007},{"items":1002,"title":661},[1003,1004,1005,1006],{"id":646,"answer":647,"question":648},{"id":650,"answer":651,"question":652},{"id":654,"answer":655,"question":656},{"id":658,"answer":659,"question":660},{},{"id":664,"data":1009,"type":41,"tunes":1010},{"text":666,"level":218},{},{"id":669,"data":1012,"type":669,"tunes":1020},{"title":671,"entries":1013},[1014,1015,1016,1017,1018,1019],{"term":425,"anchor":674,"definition":675},{"term":428,"anchor":677,"definition":678},{"term":282,"anchor":680,"definition":681},{"term":287,"anchor":683,"definition":684},{"term":686,"anchor":687,"definition":688},{"term":690,"anchor":691,"definition":692},{},{"id":695,"data":1022,"type":41,"tunes":1023},{"text":697,"level":218},{},{"id":700,"data":1025,"type":708,"tunes":1028},{"link":702,"meta":1026},{"image":1027,"title":706,"description":707},{"url":705},{},{"id":711,"data":1030,"type":708,"tunes":1033},{"link":713,"meta":1031},{"image":1032,"title":716,"description":717},{"url":705},{},{"id":720,"data":1035,"type":708,"tunes":1038},{"link":722,"meta":1036},{"image":1037,"title":725,"description":726},{"url":705},{},{"id":729,"data":1040,"type":708,"tunes":1043},{"link":731,"meta":1041},{"image":1042,"title":734,"description":735},{"url":705},{},{"id":738,"data":1045,"type":708,"tunes":1048},{"link":740,"meta":1046},{"image":1047,"title":743,"description":744},{"url":705},{},{"id":747,"data":1050,"type":708,"tunes":1053},{"link":749,"meta":1051},{"image":1052,"title":752,"description":753},{"url":705},{},{"lang":1055,"title":1056,"content":1057,"contentJson":1058,"excerpt":1496},"en","AI Agent Memory Is Not RAG: How to Separate Memory, Retrieval, State and Context","{\"time\":1790350647507,\"blocks\":[{\"id\":\"_4kVYTpqbe\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"AI agent memory, retrieval-augmented generation (RAG), runtime state, and model context are often discussed as if they were interchangeable. They are not. Collapsing them into one concept makes agent systems harder to reason about, harder to debug, and easier to make stale or unsafe.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"\u003Cstrong>RAG is not agent memory.\u003C\u002Fstrong> RAG is a retrieval pattern: it selects information that may be useful for the current model call. Memory is persistent information derived from prior interaction or experience and managed across time. State represents what is currently true about the running task or environment. Context is the information actually made available to the model for the current inference. A production agent may use all four, but they solve different problems.\"},\"tunes\":{}},{\"id\":\"model-note\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"About the model used in this article\",\"body\":\"The four-layer separation below is a practical architecture model, not a formal industry standard. Vendors and research papers use overlapping terminology. The purpose is operational: to make design decisions, ownership, failure analysis, and testing clearer.\"},\"tunes\":{}},{\"id\":\"h-category\",\"type\":\"header\",\"data\":{\"text\":\"The category error: treating every persistent-looking thing as memory\",\"level\":2},\"tunes\":{}},{\"id\":\"p-cat-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A vector database can store conversation fragments. A session object can carry recent turns. A database row can hold the current workflow status. A summarizer can compress previous work. A retriever can fetch old evidence. All of these can make an agent appear to “remember,” but they do not have the same semantics.\"},\"tunes\":{}},{\"id\":\"p-cat-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The distinction matters because the required correctness rules are different. Current state must be authoritative and fresh. Memory needs lifecycle rules for writing, revising, forgetting, and conflict handling. Retrieval needs relevance and evidence-selection quality. Context needs token-budget discipline and protection against irrelevant or conflicting material.\"},\"tunes\":{}},{\"id\":\"h-layers\",\"type\":\"header\",\"data\":{\"text\":\"A four-layer architecture: state, memory, retrieval, context\",\"level\":2},\"tunes\":{}},{\"id\":\"table-layers\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Layer\",\"Core question\",\"Typical examples\",\"Primary correctness concern\"],[\"State\",\"What is true now?\",\"Task status, cart contents, workflow step, active permissions, current game state\",\"Freshness and authority\"],[\"Memory\",\"What from the past should persist?\",\"User preference, prior decision, learned constraint, resolved failure, durable project fact\",\"Lifecycle, revision, provenance, forgetting\"],[\"Retrieval\",\"What information should be selected now?\",\"Vector search, keyword search, graph lookup, reranking, document search\",\"Relevance and evidence selection\"],[\"Context\",\"What does the model see for this call?\",\"System instructions, current request, retrieved passages, tool results, summaries\",\"Utility per token, ordering, consistency, noise\"]]},\"tunes\":{}},{\"id\":\"h-state\",\"type\":\"header\",\"data\":{\"text\":\"1. State: what is true now\",\"level\":3},\"tunes\":{}},{\"id\":\"p-state-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"State belongs to the running system, not to the model's recollection. If an order is cancelled, a deployment is paused, a user loses a permission, or a task moves from “in progress” to “approved,” the authoritative value should come from the system that owns that fact.\"},\"tunes\":{}},{\"id\":\"p-state-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"A dangerous design is to let an old conversation summary become a substitute for current state. The agent may accurately remember that the order was active yesterday and still be wrong today. State therefore needs explicit ownership, versioning or timestamps where relevant, and a path to re-read the source of truth before consequential actions.\"},\"tunes\":{}},{\"id\":\"h-memory\",\"type\":\"header\",\"data\":{\"text\":\"2. Memory: what from the past should persist\",\"level\":3},\"tunes\":{}},{\"id\":\"p-memory-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Memory is not simply “everything we can store.” A useful memory layer decides what deserves persistence, in what form, for how long, with what provenance, and under what conditions it must be revised or removed.\"},\"tunes\":{}},{\"id\":\"p-memory-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Recent agent-memory research increasingly treats raw transcript storage as insufficient. Microsoft's PlugMem work focuses on transforming raw interaction histories into structured reusable knowledge. Memora separates rich stored content from lighter abstractions and retrieval cues so that long-horizon systems do not have to choose between detail and scalable access.\"},\"tunes\":{}},{\"id\":\"h-retrieval\",\"type\":\"header\",\"data\":{\"text\":\"3. Retrieval: what should be selected now\",\"level\":3},\"tunes\":{}},{\"id\":\"p-ret-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Retrieval is a selection mechanism. It can search external documents, internal knowledge bases, stored memories, logs, graphs, databases, or mixed sources. RAG normally sits here: retrieve evidence, place selected material into the model's working input, then generate an answer.\"},\"tunes\":{}},{\"id\":\"p-ret-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That mechanism does not become memory merely because the retrieved corpus contains past interactions. The same retriever can search policy documents that the agent never experienced, product data from another system, or a user's prior decisions. Retrieval describes how information is selected; memory describes why some information persists across time and how that persistence is governed.\"},\"tunes\":{}},{\"id\":\"h-context\",\"type\":\"header\",\"data\":{\"text\":\"4. Context: what the model can actually use right now\",\"level\":3},\"tunes\":{}},{\"id\":\"p-ctx-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Context is the model-facing layer. Anthropic describes context engineering as deciding what configuration of context is most likely to produce the desired behaviour, with context being the tokens available to the model during generation. OpenAI's session-memory guidance similarly treats trimming and compression as context-management techniques for long-running agent interactions.\"},\"tunes\":{}},{\"id\":\"p-ctx-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is why a system can have excellent memory and still fail. The relevant memory may exist but not be retrieved. It may be retrieved but placed into context next to stronger conflicting text. It may be compressed until the decisive detail disappears. Or the model may receive so much material that useful evidence is diluted by noise.\"},\"tunes\":{}},{\"id\":\"h-flow\",\"type\":\"header\",\"data\":{\"text\":\"How the layers interact\",\"level\":2},\"tunes\":{}},{\"id\":\"flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"One possible production flow\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Read authoritative state\",\"description\":\"Load current task, user, system, or environment facts from the systems that own them.\"},{\"label\":\"2. Identify memory needs\",\"description\":\"Determine whether prior decisions, preferences, lessons, or long-term constraints are relevant.\"},{\"label\":\"3. Retrieve evidence\",\"description\":\"Search memory and external knowledge using semantic, lexical, graph, structured, or hybrid retrieval.\"},{\"label\":\"4. Build context\",\"description\":\"Assemble instructions, current state, selected evidence, and compacted history within the model's usable context.\"},{\"label\":\"5. Generate or act\",\"description\":\"The model reasons over the assembled context and produces an answer, plan, or tool call.\"},{\"label\":\"6. Validate and write back\",\"description\":\"Validate consequential outputs, update authoritative state where permitted, and persist only memories that pass the write policy.\"}]},\"tunes\":{}},{\"id\":\"h-rag\",\"type\":\"header\",\"data\":{\"text\":\"Why RAG is not memory\",\"level\":2},\"tunes\":{}},{\"id\":\"p-rag-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The simplest test is this: a RAG system can retrieve information the agent has never seen before. That alone shows that retrieval and memory are different abstractions.\"},\"tunes\":{}},{\"id\":\"p-rag-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"RAG answers: “Which evidence should I fetch?” A memory system must additionally answer questions such as: “Should this event become durable knowledge?”, “Does this new information supersede an older memory?”, “Can this memory still be trusted?”, “Who is allowed to read it?”, and “When should it be forgotten?”\"},\"tunes\":{}},{\"id\":\"rag-trap\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"A common design trap\",\"body\":\"If every conversation turn is embedded into a vector store and later retrieved by similarity, the system has persistent lookup, but not necessarily a well-governed memory architecture. Persistence alone does not define memory quality.\"},\"tunes\":{}},{\"id\":\"h-test\",\"type\":\"header\",\"data\":{\"text\":\"The four-layer separation test\",\"level\":2},\"tunes\":{}},{\"id\":\"p-test\",\"type\":\"paragraph\",\"data\":{\"text\":\"When a feature is called “memory,” ask the following four questions. The answers usually reveal which layer is actually involved.\"},\"tunes\":{}},{\"id\":\"table-test\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Question\",\"If yes, you are primarily dealing with\"],[\"Does this represent the current authoritative condition of the task or environment?\",\"State\"],[\"Must this information survive the current run because it captures useful prior experience, preference, or decision?\",\"Memory\"],[\"Is the main problem deciding which stored or external information is relevant to the current request?\",\"Retrieval\"],[\"Is the main problem deciding what information to place inside the current model call?\",\"Context\"]]},\"tunes\":{}},{\"id\":\"p-test-note\",\"type\":\"paragraph\",\"data\":{\"text\":\"A single component can participate in more than one layer. A database may store both state and memory. A vector index may retrieve both external knowledge and memories. The separation is semantic, not necessarily physical.\"},\"tunes\":{}},{\"id\":\"h-fail\",\"type\":\"header\",\"data\":{\"text\":\"Failure modes caused by collapsing the layers\",\"level\":2},\"tunes\":{}},{\"id\":\"table-fail\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Failure mode\",\"What happened\",\"Result\"],[\"Stale state disguised as memory\",\"An old summary is trusted instead of re-reading the authoritative system\",\"The agent acts on facts that were once true\"],[\"Memory treated as immutable fact\",\"A prior preference or decision is stored without revision rules\",\"Superseded information keeps influencing future answers\"],[\"Retrieval hit treated as truth\",\"High similarity is mistaken for factual authority\",\"Relevant-looking but incorrect evidence dominates\"],[\"Context overload\",\"Too many retrieved passages, memories, logs, and instructions are injected\",\"The decisive evidence is diluted or contradicted\"],[\"Uncontrolled memory write\",\"Model-generated interpretations are stored automatically as durable memory\",\"Errors become persistent and self-reinforcing\"],[\"No provenance boundary\",\"The system cannot distinguish user statement, source fact, model inference, and generated summary\",\"Later retrieval loses the evidential status of the information\"]]},\"tunes\":{}},{\"id\":\"h-decision\",\"type\":\"header\",\"data\":{\"text\":\"What should be remembered, retrieved, recomputed, or re-read?\",\"level\":2},\"tunes\":{}},{\"id\":\"table-decision\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Information type\",\"Preferred treatment\",\"Reason\"],[\"Current permission, order status, inventory, workflow status\",\"Re-read authoritative state\",\"Freshness matters more than recollection\"],[\"Stable user preference explicitly provided by the user\",\"Memory, with edit\u002Fdelete semantics\",\"Useful across sessions and owned by the user\"],[\"Decision made during a long-running project\",\"Memory with timestamp, provenance, and supersession rules\",\"The history matters, but decisions can change\"],[\"Product specification or public policy document\",\"Retrieve from source\",\"External knowledge should remain tied to its evidence\"],[\"Derived metric that can be cheaply recalculated\",\"Recompute\",\"Avoid persisting stale derived values\"],[\"Long raw tool output\",\"Store externally; retrieve or summarize when needed\",\"Do not consume context permanently\"],[\"Model hypothesis or uncertain interpretation\",\"Do not promote automatically to durable memory\",\"Inference is not equivalent to fact\"]]},\"tunes\":{}},{\"id\":\"h-write\",\"type\":\"header\",\"data\":{\"text\":\"A memory system needs a write policy, not only a retrieval policy\",\"level\":2},\"tunes\":{}},{\"id\":\"p-write-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"RAG architecture discussions often focus on retrieval quality: chunking, embeddings, reranking, hybrid search, and grounding. Long-term memory introduces another side of the problem: what is allowed to enter the persistent store in the first place?\"},\"tunes\":{}},{\"id\":\"p-write-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"For durable agent memory, a practical write policy should classify the candidate memory, preserve provenance, detect conflicts with existing entries, distinguish observation from inference, define sensitivity and access scope, and decide whether the information should expire, be revised, or require user confirmation.\"},\"tunes\":{}},{\"id\":\"write-tip\",\"type\":\"callout\",\"data\":{\"variant\":\"tip\",\"title\":\"Design principle\",\"body\":\"The more expensive a wrong memory becomes over time, the stricter the write policy should be. A bad retrieval affects one answer. A bad durable memory can affect every future answer that retrieves it.\"},\"tunes\":{}},{\"id\":\"h-prov\",\"type\":\"header\",\"data\":{\"text\":\"Provenance is the bridge between memory and reliable evidence\",\"level\":2},\"tunes\":{}},{\"id\":\"p-prov-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A memory entry should ideally retain enough provenance to answer: where did this come from, when was it observed, who or what asserted it, was it user-provided or model-inferred, what source supported it, and has anything superseded it?\"},\"tunes\":{}},{\"id\":\"p-prov-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Without provenance, a compressed memory can become more authoritative than the evidence that created it. This is especially risky in long-running agents where summaries and abstractions are repeatedly reused. The system may preserve the conclusion while losing the conditions under which the conclusion was valid.\"},\"tunes\":{}},{\"id\":\"h-budget\",\"type\":\"header\",\"data\":{\"text\":\"More memory does not mean more context\",\"level\":2},\"tunes\":{}},{\"id\":\"p-budget-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A long-lived agent may accumulate gigabytes of state, history, documents, and learned information. The model does not need — and usually should not receive — all of it for each step. The purpose of retrieval, summarization, compaction, and structured memory is to convert a large persistent information space into a small, relevant working context.\"},\"tunes\":{}},{\"id\":\"p-budget-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is also why larger context windows do not eliminate memory architecture. Capacity reduces some pressure, but it does not solve freshness, authority, conflicting evidence, privacy scope, write quality, revision, or deciding what deserves attention.\"},\"tunes\":{}},{\"id\":\"h-check\",\"type\":\"header\",\"data\":{\"text\":\"Production design checklist\",\"level\":2},\"tunes\":{}},{\"id\":\"checklist\",\"type\":\"list\",\"data\":{\"style\":\"unordered\",\"meta\":{},\"items\":[\"Define which systems own authoritative runtime state.\",\"Define which information is eligible to become durable memory.\",\"Keep user-provided facts, external evidence, and model inference distinguishable.\",\"Attach timestamps, provenance, scope, and revision semantics to important memories.\",\"Treat retrieval relevance as different from factual authority.\",\"Build context intentionally instead of injecting all retrieved material.\",\"Re-read volatile facts instead of trusting old memories.\",\"Recompute cheap derived values when staleness would be costly.\",\"Test memory writes as carefully as memory reads.\",\"Measure failures separately: state error, memory error, retrieval error, context-construction error, reasoning error, and action error.\"]},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The boundary between these layers can move as agent platforms evolve. A vendor may offer a managed memory service that internally performs storage, revision, retrieval, summarization, and context construction. That can collapse implementation components, but it does not eliminate the architectural questions. You still need to know whether a returned item is current state, persistent memory, retrieved evidence, or simply text placed into context.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The recommendation would also change for systems with no cross-session continuity, systems where every task starts from a clean immutable corpus, or tightly bounded workflows where all relevant state fits safely inside one call. In those cases, a dedicated long-term memory layer may add complexity without enough value.\"},\"tunes\":{}},{\"id\":\"h-limit\",\"type\":\"header\",\"data\":{\"text\":\"Limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-limit\",\"type\":\"paragraph\",\"data\":{\"text\":\"Terminology in agent systems is still moving quickly. Some frameworks call conversation history “memory,” others use “session,” “checkpoint,” “store,” “context,” or “state.” Research systems also define memory at different levels, from persistent lookup to learned internal adaptation. The model in this article deliberately separates operational responsibilities rather than trying to impose one universal vocabulary.\"},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The useful question is not “Does this agent have memory?” It is: What is state, what is persisted from experience, how is relevant information retrieved, and what finally reaches the model as context?\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Once those responsibilities are separated, design choices become easier to test. Stale facts can be traced to state ownership. Bad recall can be traced to memory lifecycle or retrieval. Overloaded prompts can be traced to context construction. Persistent hallucinations can be traced to write policy and provenance. RAG remains an important tool, but it is only one part of a reliable long-running agent architecture.\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"FAQ\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"AI agent memory, RAG, state and context\",\"items\":[{\"id\":\"faq1\",\"question\":\"Is RAG the same as AI agent memory?\",\"answer\":\"No. RAG is primarily a retrieval pattern that selects information for a model call. Memory concerns what information from prior interactions or experience persists across time and how that information is governed.\"},{\"id\":\"faq2\",\"question\":\"Is a vector database an agent memory?\",\"answer\":\"It can be part of one, but a vector database by itself is a storage and retrieval component. A production memory architecture also needs decisions about what to store, provenance, revision, conflicts, access, expiration, and forgetting.\"},{\"id\":\"faq3\",\"question\":\"Does a larger context window remove the need for memory?\",\"answer\":\"Not necessarily. Larger context helps with capacity, but it does not solve persistent knowledge across sessions, freshness, provenance, privacy scope, revision, or deciding what should be reused later.\"},{\"id\":\"faq4\",\"question\":\"Should current application state be stored as memory?\",\"answer\":\"Usually the authoritative application or domain system should remain the source of truth for volatile state. Memory may record the history or significance of state changes, but consequential actions should re-read current authoritative values.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key terms\",\"entries\":[{\"term\":\"State\",\"definition\":\"The current authoritative condition of a task, application, user, workflow, or environment.\",\"anchor\":\"state\"},{\"term\":\"Memory\",\"definition\":\"Information from prior experience or interaction that persists because it may be useful later and is subject to lifecycle rules.\",\"anchor\":\"memory\"},{\"term\":\"Retrieval\",\"definition\":\"The mechanism used to select potentially relevant information from memory, external knowledge, databases, graphs, or other stores.\",\"anchor\":\"retrieval\"},{\"term\":\"Context\",\"definition\":\"The information actually available to the language model during a particular inference or generation step.\",\"anchor\":\"context\"},{\"term\":\"RAG\",\"definition\":\"Retrieval-augmented generation: a pattern in which external or stored information is retrieved and supplied to a generative model to improve the current output.\",\"anchor\":\"rag\"},{\"term\":\"Provenance\",\"definition\":\"Metadata describing where information came from, when it was observed, who or what asserted it, and how it was transformed.\",\"anchor\":\"provenance\"}]},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and further reading\",\"level\":2},\"tunes\":{}},{\"id\":\"openai-session\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fcookbook\u002Fexamples\u002Fagents_sdk\u002Fsession_memory\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Context Engineering: Short-Term Memory Management with Sessions\",\"description\":\"OpenAI guidance on trimming and compression for long-running agent context.\"}},\"tunes\":{}},{\"id\":\"openai-sandbox\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fagents\u002Fsandboxes\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"OpenAI — Sandbox Agents\",\"description\":\"Documentation showing persistent memory as a capability with progressive disclosure and read\u002Fwrite behaviour.\"}},\"tunes\":{}},{\"id\":\"anthropic-context\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Anthropic — Effective Context Engineering for AI Agents\",\"description\":\"Engineering guidance on curating finite model context for reliable agent behaviour.\"}},\"tunes\":{}},{\"id\":\"ms-memora\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fblog\u002Fmemora-a-harmonic-memory-representation-balancing-abstraction-and-specificity\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Microsoft Research — Memora\",\"description\":\"Research on balancing abstraction and specificity in long-horizon agent memory.\"}},\"tunes\":{}},{\"id\":\"ms-plugmem\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fblog\u002Ffrom-raw-interaction-to-reusable-knowledge-rethinking-memory-for-ai-agents\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Microsoft Research — PlugMem\",\"description\":\"Research on converting raw agent interaction histories into reusable structured knowledge.\"}},\"tunes\":{}},{\"id\":\"ms-ace\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.microsoft.com\u002Fen-us\u002Fresearch\u002Fpublication\u002Fagentic-context-engineering-evolving-contexts-for-self-improving-language-models\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Microsoft Research — Agentic Context Engineering (ACE)\",\"description\":\"Research on evolving context as structured playbooks rather than repeatedly rewriting or compressing everything.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":1059,"blocks":1060,"version":1495},1790350647507,[1061,1065,1069,1074,1079,1083,1087,1091,1095,1123,1127,1131,1135,1139,1143,1147,1151,1155,1159,1163,1167,1171,1175,1198,1202,1206,1210,1215,1219,1223,1238,1242,1246,1278,1282,1318,1322,1326,1330,1335,1339,1343,1347,1351,1355,1359,1363,1378,1382,1386,1390,1394,1398,1402,1406,1410,1413,1430,1434,1452,1456,1463,1470,1477,1483,1489],{"id":214,"data":1062,"type":219,"tunes":1064},{"title":1063,"maxLevel":217,"minLevel":218},"Contents",{},{"id":222,"data":1066,"type":225,"tunes":1068},{"text":1067},"AI agent memory, retrieval-augmented generation (RAG), runtime state, and model context are often discussed as if they were interchangeable. They are not. Collapsing them into one concept makes agent systems harder to reason about, harder to debug, and easier to make stale or unsafe.",{},{"id":228,"data":1070,"type":233,"tunes":1073},{"body":1071,"title":1072,"variant":232},"\u003Cstrong>RAG is not agent memory.\u003C\u002Fstrong> RAG is a retrieval pattern: it selects information that may be useful for the current model call. Memory is persistent information derived from prior interaction or experience and managed across time. State represents what is currently true about the running task or environment. Context is the information actually made available to the model for the current inference. A production agent may use all four, but they solve different problems.","Direct answer",{},{"id":236,"data":1075,"type":233,"tunes":1078},{"body":1076,"title":1077,"variant":240},"The four-layer separation below is a practical architecture model, not a formal industry standard. Vendors and research papers use overlapping terminology. The purpose is operational: to make design decisions, ownership, failure analysis, and testing clearer.","About the model used in this article",{},{"id":243,"data":1080,"type":41,"tunes":1082},{"text":1081,"level":218},"The category error: treating every persistent-looking thing as memory",{},{"id":248,"data":1084,"type":225,"tunes":1086},{"text":1085},"A vector database can store conversation fragments. A session object can carry recent turns. A database row can hold the current workflow status. A summarizer can compress previous work. A retriever can fetch old evidence. All of these can make an agent appear to “remember,” but they do not have the same semantics.",{},{"id":253,"data":1088,"type":225,"tunes":1090},{"text":1089},"The distinction matters because the required correctness rules are different. Current state must be authoritative and fresh. Memory needs lifecycle rules for writing, revising, forgetting, and conflict handling. Retrieval needs relevance and evidence-selection quality. Context needs token-budget discipline and protection against irrelevant or conflicting material.",{},{"id":258,"data":1092,"type":41,"tunes":1094},{"text":1093,"level":218},"A four-layer architecture: state, memory, retrieval, context",{},{"id":263,"data":1096,"type":291,"tunes":1122},{"content":1097,"stretched":42,"withHeadings":13},[1098,1103,1108,1113,1117],[1099,1100,1101,1102],"Layer","Core question","Typical examples","Primary correctness concern",[1104,1105,1106,1107],"State","What is true now?","Task status, cart contents, workflow step, active permissions, current game state","Freshness and authority",[1109,1110,1111,1112],"Memory","What from the past should persist?","User preference, prior decision, learned constraint, resolved failure, durable project fact","Lifecycle, revision, provenance, forgetting",[282,1114,1115,1116],"What information should be selected now?","Vector search, keyword search, graph lookup, reranking, document search","Relevance and evidence selection",[1118,1119,1120,1121],"Context","What does the model see for this call?","System instructions, current request, retrieved passages, tool results, summaries","Utility per token, ordering, consistency, noise",{},{"id":294,"data":1124,"type":41,"tunes":1126},{"text":1125,"level":217},"1. State: what is true now",{},{"id":299,"data":1128,"type":225,"tunes":1130},{"text":1129},"State belongs to the running system, not to the model's recollection. If an order is cancelled, a deployment is paused, a user loses a permission, or a task moves from “in progress” to “approved,” the authoritative value should come from the system that owns that fact.",{},{"id":304,"data":1132,"type":225,"tunes":1134},{"text":1133},"A dangerous design is to let an old conversation summary become a substitute for current state. The agent may accurately remember that the order was active yesterday and still be wrong today. State therefore needs explicit ownership, versioning or timestamps where relevant, and a path to re-read the source of truth before consequential actions.",{},{"id":309,"data":1136,"type":41,"tunes":1138},{"text":1137,"level":217},"2. Memory: what from the past should persist",{},{"id":314,"data":1140,"type":225,"tunes":1142},{"text":1141},"Memory is not simply “everything we can store.” A useful memory layer decides what deserves persistence, in what form, for how long, with what provenance, and under what conditions it must be revised or removed.",{},{"id":319,"data":1144,"type":225,"tunes":1146},{"text":1145},"Recent agent-memory research increasingly treats raw transcript storage as insufficient. Microsoft's PlugMem work focuses on transforming raw interaction histories into structured reusable knowledge. Memora separates rich stored content from lighter abstractions and retrieval cues so that long-horizon systems do not have to choose between detail and scalable access.",{},{"id":324,"data":1148,"type":41,"tunes":1150},{"text":1149,"level":217},"3. Retrieval: what should be selected now",{},{"id":329,"data":1152,"type":225,"tunes":1154},{"text":1153},"Retrieval is a selection mechanism. It can search external documents, internal knowledge bases, stored memories, logs, graphs, databases, or mixed sources. RAG normally sits here: retrieve evidence, place selected material into the model's working input, then generate an answer.",{},{"id":334,"data":1156,"type":225,"tunes":1158},{"text":1157},"That mechanism does not become memory merely because the retrieved corpus contains past interactions. The same retriever can search policy documents that the agent never experienced, product data from another system, or a user's prior decisions. Retrieval describes how information is selected; memory describes why some information persists across time and how that persistence is governed.",{},{"id":339,"data":1160,"type":41,"tunes":1162},{"text":1161,"level":217},"4. Context: what the model can actually use right now",{},{"id":344,"data":1164,"type":225,"tunes":1166},{"text":1165},"Context is the model-facing layer. Anthropic describes context engineering as deciding what configuration of context is most likely to produce the desired behaviour, with context being the tokens available to the model during generation. OpenAI's session-memory guidance similarly treats trimming and compression as context-management techniques for long-running agent interactions.",{},{"id":349,"data":1168,"type":225,"tunes":1170},{"text":1169},"This is why a system can have excellent memory and still fail. The relevant memory may exist but not be retrieved. It may be retrieved but placed into context next to stronger conflicting text. It may be compressed until the decisive detail disappears. Or the model may receive so much material that useful evidence is diluted by noise.",{},{"id":354,"data":1172,"type":41,"tunes":1174},{"text":1173,"level":218},"How the layers interact",{},{"id":359,"data":1176,"type":382,"tunes":1197},{"steps":1177,"title":1196,"orientation":381},[1178,1181,1184,1187,1190,1193],{"label":1179,"description":1180},"1. Read authoritative state","Load current task, user, system, or environment facts from the systems that own them.",{"label":1182,"description":1183},"2. Identify memory needs","Determine whether prior decisions, preferences, lessons, or long-term constraints are relevant.",{"label":1185,"description":1186},"3. Retrieve evidence","Search memory and external knowledge using semantic, lexical, graph, structured, or hybrid retrieval.",{"label":1188,"description":1189},"4. Build context","Assemble instructions, current state, selected evidence, and compacted history within the model's usable context.",{"label":1191,"description":1192},"5. Generate or act","The model reasons over the assembled context and produces an answer, plan, or tool call.",{"label":1194,"description":1195},"6. Validate and write back","Validate consequential outputs, update authoritative state where permitted, and persist only memories that pass the write policy.","One possible production flow",{},{"id":385,"data":1199,"type":41,"tunes":1201},{"text":1200,"level":218},"Why RAG is not memory",{},{"id":390,"data":1203,"type":225,"tunes":1205},{"text":1204},"The simplest test is this: a RAG system can retrieve information the agent has never seen before. That alone shows that retrieval and memory are different abstractions.",{},{"id":395,"data":1207,"type":225,"tunes":1209},{"text":1208},"RAG answers: “Which evidence should I fetch?” A memory system must additionally answer questions such as: “Should this event become durable knowledge?”, “Does this new information supersede an older memory?”, “Can this memory still be trusted?”, “Who is allowed to read it?”, and “When should it be forgotten?”",{},{"id":400,"data":1211,"type":233,"tunes":1214},{"body":1212,"title":1213,"variant":404},"If every conversation turn is embedded into a vector store and later retrieved by similarity, the system has persistent lookup, but not necessarily a well-governed memory architecture. Persistence alone does not define memory quality.","A common design trap",{},{"id":407,"data":1216,"type":41,"tunes":1218},{"text":1217,"level":218},"The four-layer separation test",{},{"id":412,"data":1220,"type":225,"tunes":1222},{"text":1221},"When a feature is called “memory,” ask the following four questions. The answers usually reveal which layer is actually involved.",{},{"id":417,"data":1224,"type":291,"tunes":1237},{"content":1225,"stretched":42,"withHeadings":13},[1226,1229,1231,1233,1235],[1227,1228],"Question","If yes, you are primarily dealing with",[1230,1104],"Does this represent the current authoritative condition of the task or environment?",[1232,1109],"Must this information survive the current run because it captures useful prior experience, preference, or decision?",[1234,282],"Is the main problem deciding which stored or external information is relevant to the current request?",[1236,1118],"Is the main problem deciding what information to place inside the current model call?",{},{"id":437,"data":1239,"type":225,"tunes":1241},{"text":1240},"A single component can participate in more than one layer. A database may store both state and memory. A vector index may retrieve both external knowledge and memories. The separation is semantic, not necessarily physical.",{},{"id":442,"data":1243,"type":41,"tunes":1245},{"text":1244,"level":218},"Failure modes caused by collapsing the layers",{},{"id":447,"data":1247,"type":291,"tunes":1277},{"content":1248,"stretched":42,"withHeadings":13},[1249,1253,1257,1261,1265,1269,1273],[1250,1251,1252],"Failure mode","What happened","Result",[1254,1255,1256],"Stale state disguised as memory","An old summary is trusted instead of re-reading the authoritative system","The agent acts on facts that were once true",[1258,1259,1260],"Memory treated as immutable fact","A prior preference or decision is stored without revision rules","Superseded information keeps influencing future answers",[1262,1263,1264],"Retrieval hit treated as truth","High similarity is mistaken for factual authority","Relevant-looking but incorrect evidence dominates",[1266,1267,1268],"Context overload","Too many retrieved passages, memories, logs, and instructions are injected","The decisive evidence is diluted or contradicted",[1270,1271,1272],"Uncontrolled memory write","Model-generated interpretations are stored automatically as durable memory","Errors become persistent and self-reinforcing",[1274,1275,1276],"No provenance boundary","The system cannot distinguish user statement, source fact, model inference, and generated summary","Later retrieval loses the evidential status of the information",{},{"id":480,"data":1279,"type":41,"tunes":1281},{"text":1280,"level":218},"What should be remembered, retrieved, recomputed, or re-read?",{},{"id":485,"data":1283,"type":291,"tunes":1317},{"content":1284,"stretched":42,"withHeadings":13},[1285,1289,1293,1297,1301,1305,1309,1313],[1286,1287,1288],"Information type","Preferred treatment","Reason",[1290,1291,1292],"Current permission, order status, inventory, workflow status","Re-read authoritative state","Freshness matters more than recollection",[1294,1295,1296],"Stable user preference explicitly provided by the user","Memory, with edit\u002Fdelete semantics","Useful across sessions and owned by the user",[1298,1299,1300],"Decision made during a long-running project","Memory with timestamp, provenance, and supersession rules","The history matters, but decisions can change",[1302,1303,1304],"Product specification or public policy document","Retrieve from source","External knowledge should remain tied to its evidence",[1306,1307,1308],"Derived metric that can be cheaply recalculated","Recompute","Avoid persisting stale derived values",[1310,1311,1312],"Long raw tool output","Store externally; retrieve or summarize when needed","Do not consume context permanently",[1314,1315,1316],"Model hypothesis or uncertain interpretation","Do not promote automatically to durable memory","Inference is not equivalent to fact",{},{"id":522,"data":1319,"type":41,"tunes":1321},{"text":1320,"level":218},"A memory system needs a write policy, not only a retrieval policy",{},{"id":527,"data":1323,"type":225,"tunes":1325},{"text":1324},"RAG architecture discussions often focus on retrieval quality: chunking, embeddings, reranking, hybrid search, and grounding. Long-term memory introduces another side of the problem: what is allowed to enter the persistent store in the first place?",{},{"id":532,"data":1327,"type":225,"tunes":1329},{"text":1328},"For durable agent memory, a practical write policy should classify the candidate memory, preserve provenance, detect conflicts with existing entries, distinguish observation from inference, define sensitivity and access scope, and decide whether the information should expire, be revised, or require user confirmation.",{},{"id":537,"data":1331,"type":233,"tunes":1334},{"body":1332,"title":1333,"variant":541},"The more expensive a wrong memory becomes over time, the stricter the write policy should be. A bad retrieval affects one answer. A bad durable memory can affect every future answer that retrieves it.","Design principle",{},{"id":544,"data":1336,"type":41,"tunes":1338},{"text":1337,"level":218},"Provenance is the bridge between memory and reliable evidence",{},{"id":549,"data":1340,"type":225,"tunes":1342},{"text":1341},"A memory entry should ideally retain enough provenance to answer: where did this come from, when was it observed, who or what asserted it, was it user-provided or model-inferred, what source supported it, and has anything superseded it?",{},{"id":554,"data":1344,"type":225,"tunes":1346},{"text":1345},"Without provenance, a compressed memory can become more authoritative than the evidence that created it. This is especially risky in long-running agents where summaries and abstractions are repeatedly reused. The system may preserve the conclusion while losing the conditions under which the conclusion was valid.",{},{"id":559,"data":1348,"type":41,"tunes":1350},{"text":1349,"level":218},"More memory does not mean more context",{},{"id":564,"data":1352,"type":225,"tunes":1354},{"text":1353},"A long-lived agent may accumulate gigabytes of state, history, documents, and learned information. The model does not need — and usually should not receive — all of it for each step. The purpose of retrieval, summarization, compaction, and structured memory is to convert a large persistent information space into a small, relevant working context.",{},{"id":569,"data":1356,"type":225,"tunes":1358},{"text":1357},"This is also why larger context windows do not eliminate memory architecture. Capacity reduces some pressure, but it does not solve freshness, authority, conflicting evidence, privacy scope, write quality, revision, or deciding what deserves attention.",{},{"id":574,"data":1360,"type":41,"tunes":1362},{"text":1361,"level":218},"Production design checklist",{},{"id":579,"data":1364,"type":594,"tunes":1377},{"meta":1365,"items":1366,"style":593},{},[1367,1368,1369,1370,1371,1372,1373,1374,1375,1376],"Define which systems own authoritative runtime state.","Define which information is eligible to become durable memory.","Keep user-provided facts, external evidence, and model inference distinguishable.","Attach timestamps, provenance, scope, and revision semantics to important memories.","Treat retrieval relevance as different from factual authority.","Build context intentionally instead of injecting all retrieved material.","Re-read volatile facts instead of trusting old memories.","Recompute cheap derived values when staleness would be costly.","Test memory writes as carefully as memory reads.","Measure failures separately: state error, memory error, retrieval error, context-construction error, reasoning error, and action error.",{},{"id":597,"data":1379,"type":41,"tunes":1381},{"text":1380,"level":218},"What would change this answer?",{},{"id":602,"data":1383,"type":225,"tunes":1385},{"text":1384},"The boundary between these layers can move as agent platforms evolve. A vendor may offer a managed memory service that internally performs storage, revision, retrieval, summarization, and context construction. That can collapse implementation components, but it does not eliminate the architectural questions. You still need to know whether a returned item is current state, persistent memory, retrieved evidence, or simply text placed into context.",{},{"id":607,"data":1387,"type":225,"tunes":1389},{"text":1388},"The recommendation would also change for systems with no cross-session continuity, systems where every task starts from a clean immutable corpus, or tightly bounded workflows where all relevant state fits safely inside one call. In those cases, a dedicated long-term memory layer may add complexity without enough value.",{},{"id":612,"data":1391,"type":41,"tunes":1393},{"text":1392,"level":218},"Limitations",{},{"id":617,"data":1395,"type":225,"tunes":1397},{"text":1396},"Terminology in agent systems is still moving quickly. Some frameworks call conversation history “memory,” others use “session,” “checkpoint,” “store,” “context,” or “state.” Research systems also define memory at different levels, from persistent lookup to learned internal adaptation. The model in this article deliberately separates operational responsibilities rather than trying to impose one universal vocabulary.",{},{"id":622,"data":1399,"type":41,"tunes":1401},{"text":1400,"level":218},"Conclusion",{},{"id":627,"data":1403,"type":225,"tunes":1405},{"text":1404},"The useful question is not “Does this agent have memory?” It is: What is state, what is persisted from experience, how is relevant information retrieved, and what finally reaches the model as context?",{},{"id":632,"data":1407,"type":225,"tunes":1409},{"text":1408},"Once those responsibilities are separated, design choices become easier to test. Stale facts can be traced to state ownership. Bad recall can be traced to memory lifecycle or retrieval. Overloaded prompts can be traced to context construction. Persistent hallucinations can be traced to write policy and provenance. RAG remains an important tool, but it is only one part of a reliable long-running agent architecture.",{},{"id":637,"data":1411,"type":41,"tunes":1412},{"text":639,"level":218},{},{"id":642,"data":1414,"type":642,"tunes":1429},{"items":1415,"title":1428},[1416,1419,1422,1425],{"id":646,"answer":1417,"question":1418},"No. RAG is primarily a retrieval pattern that selects information for a model call. Memory concerns what information from prior interactions or experience persists across time and how that information is governed.","Is RAG the same as AI agent memory?",{"id":650,"answer":1420,"question":1421},"It can be part of one, but a vector database by itself is a storage and retrieval component. A production memory architecture also needs decisions about what to store, provenance, revision, conflicts, access, expiration, and forgetting.","Is a vector database an agent memory?",{"id":654,"answer":1423,"question":1424},"Not necessarily. Larger context helps with capacity, but it does not solve persistent knowledge across sessions, freshness, provenance, privacy scope, revision, or deciding what should be reused later.","Does a larger context window remove the need for memory?",{"id":658,"answer":1426,"question":1427},"Usually the authoritative application or domain system should remain the source of truth for volatile state. Memory may record the history or significance of state changes, but consequential actions should re-read current authoritative values.","Should current application state be stored as memory?","AI agent memory, RAG, state and context",{},{"id":664,"data":1431,"type":41,"tunes":1433},{"text":1432,"level":218},"Glossary",{},{"id":669,"data":1435,"type":669,"tunes":1451},{"title":1436,"entries":1437},"Key terms",[1438,1440,1442,1444,1446,1448],{"term":1104,"anchor":674,"definition":1439},"The current authoritative condition of a task, application, user, workflow, or environment.",{"term":1109,"anchor":677,"definition":1441},"Information from prior experience or interaction that persists because it may be useful later and is subject to lifecycle rules.",{"term":282,"anchor":680,"definition":1443},"The mechanism used to select potentially relevant information from memory, external knowledge, databases, graphs, or other stores.",{"term":1118,"anchor":683,"definition":1445},"The information actually available to the language model during a particular inference or generation step.",{"term":686,"anchor":687,"definition":1447},"Retrieval-augmented generation: a pattern in which external or stored information is retrieved and supplied to a generative model to improve the current output.",{"term":1449,"anchor":691,"definition":1450},"Provenance","Metadata describing where information came from, when it was observed, who or what asserted it, and how it was transformed.",{},{"id":695,"data":1453,"type":41,"tunes":1455},{"text":1454,"level":218},"Primary sources and further reading",{},{"id":700,"data":1457,"type":708,"tunes":1462},{"link":702,"meta":1458},{"image":1459,"title":1460,"description":1461},{"url":705},"OpenAI — Context Engineering: Short-Term Memory Management with Sessions","OpenAI guidance on trimming and compression for long-running agent context.",{},{"id":711,"data":1464,"type":708,"tunes":1469},{"link":713,"meta":1465},{"image":1466,"title":1467,"description":1468},{"url":705},"OpenAI — Sandbox Agents","Documentation showing persistent memory as a capability with progressive disclosure and read\u002Fwrite behaviour.",{},{"id":720,"data":1471,"type":708,"tunes":1476},{"link":722,"meta":1472},{"image":1473,"title":1474,"description":1475},{"url":705},"Anthropic — Effective Context Engineering for AI Agents","Engineering guidance on curating finite model context for reliable agent behaviour.",{},{"id":729,"data":1478,"type":708,"tunes":1482},{"link":731,"meta":1479},{"image":1480,"title":734,"description":1481},{"url":705},"Research on balancing abstraction and specificity in long-horizon agent memory.",{},{"id":738,"data":1484,"type":708,"tunes":1488},{"link":740,"meta":1485},{"image":1486,"title":743,"description":1487},{"url":705},"Research on converting raw agent interaction histories into reusable structured knowledge.",{},{"id":747,"data":1490,"type":708,"tunes":1494},{"link":749,"meta":1491},{"image":1492,"title":752,"description":1493},{"url":705},"Research on evolving context as structured playbooks rather than repeatedly rewriting or compressing everything.",{},"2.31.6","Agent memory, RAG, state, and context are often used as if they were interchangeable. They are not. This practical architecture model separates the four layers, shows where each belongs, and explains what breaks when systems collapse them into one.","Post erfolgreich abgerufen",{"items":1499,"source":1570,"manualIds":1571,"manualMatchedIds":1572},[1500,1507,1514,1521,1528,1535,1542,1549,1556,1563],{"id":1501,"slug":1502,"title":1503,"excerpt":1504,"featuredImage":1505,"publishedAt":1506},"364","tipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung","Meistern des SEO-Workflows: Essenzielle Optimierungsstrategien für organisches Wachstum","Ein strukturierter SEO-Workflow ist entscheidend für nachhaltiges organisches Wachstum. Lerne die zehn grundlegenden Strategien, von der Keyword-Recherche und technischen Optimierung bis hin zur Content-Qualität und Performance-Analyse.","\u002Fuploads\u002F2026\u002F03\u002Ftipps-fuer-die-verbesserung-der-seo-suchmaschinenoptimierung-1774866098131-hwkzrg.webp","2024-01-26T06:35:00.000Z",{"id":1508,"slug":1509,"title":1510,"excerpt":1511,"featuredImage":1512,"publishedAt":1513},"469","rag-failed-but-which-layer-actually-failed-a-diagnostic-method","RAG fehlgeschlagen – aber welche Ebene ist tatsächlich fehlgeschlagen? Eine diagnostische Methode","Wenn eine RAG-Antwort falsch ist, ist es zu vage, das Retrieval oder das Modell verantwortlich zu machen. Diese Diagnosemethode isoliert Quellenabdeckung, Query-Konstruktion, Retrieval, Ranking, Kontextzusammenstellung, Generierung, Evidenzzuordnung und Aktualität – sodass der tatsächliche Fehler reproduziert und behoben werden kann.","\u002Fuploads\u002F2026\u002F09\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method-1790350847177-pior4c.webp","2026-09-24T19:39:00.000Z",{"id":1515,"slug":1516,"title":1517,"excerpt":1518,"featuredImage":1519,"publishedAt":1520},"476","mcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained","MCP vs A2A vs UCP vs AP2 vs A2UI: Der Agenten-Protokoll-Stack erklärt","MCP, A2A, UCP, AP2 und A2UI werden oft als konkurrierende Agentenstandards dargestellt. Sie lösen größtenteils unterschiedliche Interoperabilitätsprobleme. Dieser Leitfaden ordnet jedes Protokoll der Grenze zu, die es tatsächlich standardisiert—und zeigt, wie sie in einem Produktionssystem zusammenarbeiten können.","\u002Fuploads\u002F2026\u002F09\u002Fmcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained-1790352625869-2ezle0.webp","2026-09-25T12:09:00.000Z",{"id":1522,"slug":1523,"title":1524,"excerpt":1525,"featuredImage":1526,"publishedAt":1527},"472","why-more-context-can-make-ai-answers-worse","Warum mehr Kontext KI-Antworten verschlechtern kann","Ein größeres Kontextfenster garantiert keine bessere Antwort. Dieser Artikel erklärt, wie Signalverwässerung, widersprüchliche Belege, veralteter Zustand, Positionssensitivität und verlustbehaftete Kompression die KI-Zuverlässigkeit verringern können—und stellt einen praktischen Context Pressure Test vor.","\u002Fuploads\u002F2026\u002F09\u002Fwhy-more-context-can-make-ai-answers-worse-1790351615793-2ntv2v.webp","2026-09-25T11:51:00.000Z",{"id":1529,"slug":1530,"title":1531,"excerpt":1532,"featuredImage":1533,"publishedAt":1534},"363","front-und-backend-entwicklung","Frontend- und Backend-Entwicklung","Front-End- und Back-End-Entwicklung ist ein wesentlicher Bestandteil der Webentwicklung und umfasst die Erstellung von Webanwendungen und Websites. Die Front-End-Entwicklung konzentriert sich auf die Benutzeroberfläche, während die Back-End-Entwicklung für die Programmierung und Verwaltung der Serverseite verantwortlich ist.","\u002Fuploads\u002F2026\u002F03\u002Ffront-und-backend-entwicklung-1774872219531-wyu4i1.webp","2023-04-12T11:11:00.000Z",{"id":1536,"slug":1537,"title":1538,"excerpt":1539,"featuredImage":1540,"publishedAt":1541},"467","the-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","Die Antwortgültigkeitsgrenze: Die fehlende Schicht zwischen Relevanz und zuverlässigen KI-Antworten","Eine Quelle kann relevant und maßgeblich sein und dennoch falsch für die gestellte Frage. Die fehlende Ebene ist die Anwendbarkeit: die Bedingungen, unter denen eine Antwort gilt, und die Veränderungen, die erzwingen, dass sie überdacht werden muss. Dieser Artikel führt die Answer Validity Boundary als ein Quellendesign-Muster für Menschen, KI-Suche und RAG-Systeme ein.","\u002Fuploads\u002F2026\u002F09\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers-1790272901306-1g5jly.webp","2026-09-24T11:59:00.000Z",{"id":1543,"slug":1544,"title":1545,"excerpt":1546,"featuredImage":1547,"publishedAt":1548},"470","what-should-an-ai-agent-remember-forget-recompute-or-retrieve-again","Was sollte ein KI-Agent behalten, vergessen, neu berechnen oder erneut abrufen?","Langlaufende Agenten sollten sich nicht alles merken. Dieser Artikel bietet ein praktisches Lebenszyklusmodell für die Entscheidung, was in den dauerhaften Speicher gehört, was erneut abgerufen werden sollte, was sicherer neu zu berechnen ist und was ablaufen oder ersetzt werden sollte.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-should-an-ai-agent-remember-forget-recompute-or-retrieve-again-1790351131087-iehz28.webp","2026-09-25T09:43:00.000Z",{"id":1550,"slug":1551,"title":1552,"excerpt":1553,"featuredImage":1554,"publishedAt":1555},"478","what-is-rag-the-simplest-explanation-of-how-it-works","Was ist RAG? Die einfachste Erklärung, wie es funktioniert","RAG klingt kompliziert, aber die Idee ist einfach: Bevor eine KI antwortet, sucht sie zunächst nützliche Informationen aus einer Wissensquelle und gibt diese Informationen an das Sprachmodell weiter. Dieser Leitfaden erklärt RAG, LLMs, Zustand, Gedächtnis und Werkzeuge anhand eines einfachen mentalen Modells.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":1557,"slug":1558,"title":1559,"excerpt":1560,"featuredImage":1561,"publishedAt":1562},"459","ollama-is-not-the-product-building-production-ready-open-llm-applications","Ollama ist nicht das Produkt: Entwicklung produktionsreifer Open-LLM-Anwendungen","Das Ausführen eines lokalen Modells mit Ollama ist einfach. Das Erstellen einer produktionsreifen Open-LLM-Anwendung ist schwieriger: Es erfordert RAG, Zugriffskontrolle, Anbieterabstraktion, Evaluierung, Protokollierung, Bereitstellungsdisziplin und eine kontrollierte Anwendungsschicht um das Modell herum.","\u002Fuploads\u002F2026\u002F06\u002Follama-is-not-the-product-building-production-ready-open-llm-applications-1782679361640-h0usqf.webp","2026-06-28T16:39:00.000Z",{"id":1564,"slug":1565,"title":1566,"excerpt":1567,"featuredImage":1568,"publishedAt":1569},"466","the-gpu-is-not-the-product-future-proof-private-ai-architecture","Die GPU ist nicht das Produkt: Zukunftssichere private KI-Architektur","Private KI-Infrastruktur sollte nicht um eine einzige GPU oder ein einziges Modell herum konzipiert werden. Ein resilienterer Ansatz kombiniert schnelle Inferenz-GPUs, speicherstarke KI-Systeme, physische KI-Knoten und optionale Frontier-Cloud-Modelle hinter einer fähigkeitsbewussten Routing-Schicht.","\u002Fuploads\u002F2026\u002F09\u002Fthe-gpu-is-not-the-product-future-proof-private-ai-architecture-1790140878812-8hsl39.webp","2026-09-23T01:19:00.000Z","fallback",[],[]]