Was ist RAG? Die einfachste Erklärung, wie es funktioniert

RAG klingt kompliziert, aber die Idee ist einfach: Bevor eine KI antwortet, sucht sie zunächst nützliche Informationen aus einer Wissensquelle und gibt diese Informationen an das Sprachmodell weiter. Dieser Leitfaden erklärt RAG, LLMs, Zustand, Gedächtnis und Werkzeuge anhand eines einfachen mentalen Modells.
Veröffentlicht:
Aleksandar Stajić
Updated: 26. September 2026 um 01:41
Was ist RAG? Die einfachste Erklärung, wie es funktioniert

RAG klingt kompliziert, weil der Name kompliziert ist. Die Idee ist es nicht. RAG bedeutet einfach: Bevor die KI antwortet, sucht sie zuerst nach relevanten Informationen aus einer Wissensquelle und gibt diese Informationen an das Sprachmodell weiter.

Stellen Sie sich ein LLM wie eine kluge Person vor, die an einem Schreibtisch sitzt. RAG ist der Bibliothekar, der die richtige Seite aus dem richtigen Buch bringt. Das LLM liest dann diese Seite und antwortet Ihnen.

Zuerst: Was macht das LLM?

Das LLM ist der Teil, der Sprache versteht und Sprache erzeugt. Es kann Ihre Frage lesen, Anweisungen verstehen, Informationen vergleichen, etwas erklären und eine Antwort schreiben.

Aber das LLM weiß nicht automatisch, was sich gerade in Ihrer Unternehmensdatenbank, Ihrer Spielsitzung, Ihren privaten Dokumenten oder einer Datei befindet, die Sie vor fünf Minuten erstellt haben.

Es weiß nur, was bereits im Modell enthalten ist, plus alle Informationen, die die Anwendung ihm in der aktuellen Anfrage gibt.

Dann: Was ist die Wissensdatenbank?

Eine Wissensdatenbank ist einfach eine Information, die die Anwendung durchsuchen kann.

Sie könnte PDFs, Handbücher, Produktdokumentationen, Support-Artikel, Verträge, Spielregeln, Waffendaten, interne Unternehmensdokumente, Datenbankeinträge oder anderen Text enthalten.

Die Wissensdatenbank kann lokal auf Ihrem eigenen Rechner sein. Sie kann auf einem Server sein. Sie kann in einer Vektordatenbank sein. Sie kann auch aus normalen Dateien erstellt werden. RAG bedeutet nicht Internet.

Was macht RAG also tatsächlich?

Der gesamte RAG-Prozess

1
1. Sie stellen eine Frage
Zum Beispiel: Welche Munition verwendet diese Waffe?
2
2. RAG durchsucht die Wissensdatenbank
Das System sucht nach den kleinen Informationsstücken, die für Ihre Frage am relevantesten sind.
3
3. RAG gibt diese Stücke an das LLM
Das LLM erhält die Frage plus die abgerufenen Informationen.
4
4. Das LLM schreibt die Antwort
Es verwendet die abgerufenen Informationen als Kontext für die Antwort.

Das ist RAG.

Der vollständige Name ist Retrieval-Augmented Generation. Retrieval bedeutet, die relevanten Informationen zu finden. Augmented bedeutet, diese Informationen zum Kontext des Modells hinzuzufügen. Generation bedeutet, dass das LLM die endgültige Antwort schreibt.

Ein sehr einfaches Beispiel

Stellen Sie sich vor, Sie haben eine lokale Wissensdatenbank über ein Spiel.

Wissensdatenbank enthältBeispiel
WaffenAKM verwendet 7,62-mm-Munition
HeilgegenständeMed Kit stellt Gesundheit wieder her
AnbauteileDieses Anbauteil funktioniert mit diesen Waffen
KartenregelnDiese Zone verhält sich auf diese Weise

Sie fragen: „Welche Munition verwendet die AKM?“

RAG durchsucht die Wissensdatenbank und findet den Eintrag über die AKM. Es gibt dieses kleine Stück Information an das LLM weiter. Das LLM antwortet dann: „Die AKM verwendet 7,62-mm-Munition.“

Das LLM brauchte nicht die gesamte Datenbank. RAG brachte nur den nützlichen Teil.

Nun der wichtige Teil: RAG ist nicht der aktuelle Zustand

Hier werden viele Erklärungen verwirrend.

RAG gibt der KI normalerweise Wissen. Ein Zustandssystem gibt der KI Fakten darüber, was gerade jetzt wahr ist.

Wissen vs. aktueller Zustand

RAG / WissenAktueller Zustand
Waffe
Munition
Gesundheit
Gegner

Was ist eine Zustandsdatenbank?

Eine Zustandsdatenbank oder ein Zustandsspeicher ist einfach ein Ort, an dem die Anwendung aktuelle Fakten aufbewahrt.

In einem Spiel kennt die Engine bereits Dinge wie Ihre Gesundheit, Position, Inventar, Munition, aktuelle Mission, nahe Objekte und Gegnerstatus. Ein KI-System kann ausgewählte Teile dieses Zustands dem Modell zugänglich machen.

In einer Geschäftsanwendung könnte dieselbe Idee eine Bestelldatenbank, ein Kundendatensatz, ein Projektstatus oder der aktuelle Wert eines Sensors sein.

Der Zustand wird von der Anwendung selbst erstellt, während Dinge geschehen. Wenn Sie Gesundheit verlieren, aktualisiert das Spiel den Gesundheitswert. Wenn Sie Munition aufnehmen, ändert sich das Inventar. Wenn eine Bestellung bezahlt wird, ändert das Geschäftssystem den Bestellstatus.

Wie die drei Teile zusammenwirken

LLM + Zustand + RAG

1
1. Aktueller Zustand
Die Anwendung teilt der KI mit, was jetzt gilt: Gesundheit 41 %, AKM ausgerüstet, 23 Schuss.
2
2. RAG
Das System ruft nützliches Wissen ab: wie die Waffe funktioniert, welches Heilmittel verfügbar ist oder eine relevante Regel.
3
3. LLM
Das Modell erhält die Frage, den aktuellen Zustand und das abgerufene Wissen.
4
4. Schlussfolgerung
Das LLM kombiniert diese Eingaben und entscheidet, welche Antwort oder übergeordnete Aktion sinnvoll ist.
5
5. Anwendung
Wenn eine Aktion erforderlich ist, führt die Anwendung oder die Spiel-Engine sie aus und aktualisiert den Zustand erneut.

Die grundlegende Architektur ist also:

Verwendet RAG immer eine Vektordatenbank?

Nein.

Eine Vektordatenbank ist eine gängige Methode, um semantische Suche aufzubauen, aber sie ist nicht die Definition von RAG.

Der wichtige Teil ist das Abrufen: Das System findet relevante externe Informationen und fügt sie dem Kontext des LLM hinzu, bevor die Antwort generiert wird.

OpenAIs File Search kann beispielsweise mit Dateien arbeiten, die in Vektorspeichern abgelegt sind. Dateien werden in kleinere Stücke aufgeteilt, damit das System die Teile abrufen kann, die für eine Frage relevant sind. Das ist eine Umsetzung derselben Grundidee.

Was ist ein Embedding, einfach erklärt?

Du musst Embeddings nicht verstehen, um RAG zu verstehen.

Aber die einfache Version ist diese: Ein Embedding ist eine numerische Darstellung von Bedeutung. Es hilft einem Suchsystem, Text zu finden, der konzeptionell ähnlich ist, auch wenn die Wörter nicht genau dieselben sind.

Zum Beispiel sucht eine normale Stichwortsuche möglicherweise nach den genauen Wörtern „Autoreparatur“. Die semantische Suche kann auch verstehen, dass „repariere mein Fahrzeug“ ein ähnliches Thema betrifft.

Das macht Embeddings für RAG nützlich, aber RAG kann auch Stichwortsuche, Datenbankabfragen oder eine Mischung aus mehreren Methoden verwenden.

RAG ist auch kein Gedächtnis

Gedächtnis ist ein weiteres Konzept, das oft mit RAG vermischt wird.

Gedächtnis sind normalerweise Informationen, die das System über frühere Interaktionen oder frühere Ereignisse behält. RAG ist der Mechanismus, mit dem relevantes Wissen abgerufen wird, wenn es benötigt wird.

TeilEinfache Bedeutung
LLMDer Teil, der Sprache versteht und generiert
RAGDer Teil, der vor der Antwort relevantes Wissen nachschlägt
WissensbasisDie Informationen, die RAG durchsuchen kann
ZustandWas gerade jetzt in der Anwendung oder Welt gilt
GedächtnisInformationen, die aus früheren Interaktionen oder Ereignissen behalten werden
Werkzeug / AktionEtwas, das die KI aufrufen oder die Anwendung bitten darf zu tun
KontextDie Informationen, die dem LLM für diese Anfrage gerade vorgelegt werden

Ein echtes Spielbeispiel: PUBG Ally

PUBG Ally ist ein nützliches Beispiel, weil es den Unterschied sichtbar macht.

KRAFTON beschreibt den Live-Match-Zustand als separate Quelle der Wahrheit. Das Spiel gibt aktuelle Fakten über Beobachtungswerkzeuge preis: aktuelle Waffe, Munition, Gesundheit, Status der Sicherheitszone, Gegenstände in der Nähe und Kampfsituation.

Die Wissenssuche ist eine andere Aufgabe. Das System kann kuratiertes Wissen über Waffen, Aufsätze, Gegenstände und Regeln nutzen. Das ACE Game Agent SDK von NVIDIA bietet außerdem eine separate RAG-API zum Abrufen von Wissen aus von Entwicklern erstellten Datenbanken.

Das gibt uns die klare Trennung: Die Spiel-Engine sagt, was gerade passiert, der Abruf liefert relevantes Wissen, und das Sprachmodell entscheidet, was die Informationen bedeuten.

Ein vollständiges Beispiel

Stellen Sie sich vor, Sie sagen einem KI-Teamkollegen: „Ich habe wenig Gesundheit. Sollten wir angreifen?“

Was als Nächstes passiert

1
Zustand
Das Spiel meldet: Gesundheit 24 %, ein Gegner in der Nähe, zwei Heilgegenstände verfügbar.
2
RAG
Das Wissenssystem ruft die relevanten Regeln für den Heilgegenstand und möglicherweise Informationen über die aktuelle Waffe oder taktische Mechanik ab.
3
LLM
Das Modell kombiniert Ihre Anfrage, den aktuellen Zustand und das abgerufene Wissen.
4
Entscheidung
Es kommt zu dem Schluss, dass zuerst zu heilen sicherer ist, als sofort anzugreifen.
5
Werkzeug / Spiel-Engine
Der Agent fordert eine legale Spielaktion an, z. B. sich in Deckung zu bewegen oder den Heilgegenstand zu verwenden.
6
Neuer Zustand
Das Spiel führt die Aktion aus und meldet die aktualisierte Situation an den Agenten zurück.

RAG hat die Figur nicht gesteuert. Die Zustandsdatenbank hat nicht geschlussfolgert. Das LLM hat das Spiel nicht direkt verändert. Jeder Teil hatte eine Aufgabe.

Warum überhaupt RAG verwenden?

Weil es langsam, teuer und oft verwirrend wäre, jedes Dokument, jede Regel und jeden Datenbankeintrag in jeden Prompt aufzunehmen.

RAG ermöglicht es dem System, nur die Informationen auszuwählen, die für die aktuelle Frage nützlich sind.

Es ermöglicht außerdem, die Wissensbasis zu aktualisieren, ohne das gesamte Sprachmodell neu zu trainieren. Ändern Sie das Dokument oder die Datenbank, bauen Sie den Index bei Bedarf neu auf oder aktualisieren Sie ihn, und der nächste Abruf kann die neueren Informationen verwenden.

Was RAG nicht garantiert

RAG kann die Fundierung verbessern, aber es macht eine Antwort nicht automatisch korrekt.

Der Abrufschritt kann das falsche Dokument finden. Das richtige Dokument kann veraltet sein. Das LLM kann gute Belege missverstehen. Oder der aktuelle Zustand kann sich geändert haben.

Ein zuverlässiges System muss daher den Abruf, die Aktualität des Zustands und die endgültige Schlussfolgerung des Modells getrennt validieren.

Das einfachste mentale Modell zum Merken

Stellen Sie sich ein KI-System wie eine Person an einem Schreibtisch vor

AnalogieKI-System
Denkende Person
Ein Nachschlagewerk finden
Bücher im Regal
Aktuelles Dashboard oder Instrumententafel
Notizen von früheren Besprechungen
Etwas in der realen Welt tun

Fazit

RAG ist viel weniger mysteriös, sobald die Teile getrennt sind.

Das LLM versteht und erzeugt Sprache. Die Anwendung verwaltet den aktuellen Zustand. Die Wissensbasis speichert Informationen. RAG findet den nützlichen Teil dieser Informationen und fügt ihn in den Kontext des LLM ein. Werkzeuge oder die Anwendung führen reale Aktionen aus.

Das ist die grundlegende Architektur hinter vielen modernen KI-Assistenten und Agenten.

FAQ

RAG in einfachen Worten

Was ist RAG in einfachen Worten?

RAG ist ein Schritt, bei dem eine KI eine Wissensquelle nach relevanten Informationen durchsucht, bevor das Sprachmodell seine Antwort schreibt.

Braucht RAG das Internet?

Nein. Die Wissensbasis kann vollständig lokal auf Ihrem Computer oder Server liegen.

Ist RAG dasselbe wie eine Datenbank?

Nein. Die Datenbank oder Dateien enthalten die Informationen. RAG ist der Abrufprozess, der den nützlichen Teil findet und ihn dem LLM gibt.

Ist RAG dasselbe wie Gedächtnis?

Nein. Das Gedächtnis speichert normalerweise frühere Interaktionen oder Ereignisse. RAG ruft relevantes Wissen ab, wenn es benötigt wird.

Ist der aktuelle Anwendungszustand Teil von RAG?

Nicht unbedingt. Der aktuelle Zustand wird normalerweise direkt von der Anwendung oder einem Zustandsspeicher bezogen. RAG wird besser als Abruf aus einer Wissensquelle verstanden.

Macht RAG KI-Antworten korrekt?

Nein. Es kann bessere Belege liefern, aber der Abruf kann immer noch falsch oder veraltet sein und das LLM kann immer noch falsch schlussfolgern.

Glossar

Die grundlegenden Begriffe

LLM
Ein Sprachmodell, das Text versteht und erzeugt und über Informationen, die in seinen Kontext gestellt werden, schlussfolgern kann.
RAG
Retrieval-Augmented Generation: Abrufen relevanter externer Informationen und Hinzufügen zum Kontext des Modells, bevor eine Antwort generiert wird.
Wissensbasis
Die Dateien, Dokumente, Datensätze oder anderen Informationen, die der Abruf durchsuchen kann.
Zustand
Die aktuellen Fakten einer Anwendung, eines Systems oder der Welt zu einem bestimmten Zeitpunkt.
Kontext
Die Informationen, die dem Sprachmodell derzeit für eine Anfrage oder einen Schlussfolgerungsschritt bereitgestellt werden.
Embedding
Eine numerische Darstellung von Bedeutung, die der semantischen Suche helfen kann, konzeptionell ähnliche Informationen zu finden.

Primärquellen

OpenAI — Vector Store Files

Offizielle Dokumentation, die zeigt, wie Dateien an Vektorspeicher angehängt, in Chunks aufgeteilt und für den Dateisuche-Abruf verfügbar gemacht werden können.

OpenAI — Developer Quickstart

Offizielle OpenAI-Dokumentation, die Werkzeuge wie die Dateisuche beschreibt, um Modellen Zugriff auf externe Informationen zu geben.

NVIDIA Developer — ACE for Games

Offizielle NVIDIA-Dokumentation, die separate Agent-, Chat- und RAG-APIs beschreibt, um Spielcharaktere mit Spielzustand, kontextuellem Wissen und modellgesteuerten Aktionen zu verbinden.

NVIDIA Developer — How KRAFTON Built PUBG Ally

Offizielle technische Erklärung, die den Live-Match-Zustand von der Wissenssuche und der Schlussfolgerung des Sprachmodells trennt.

Related Articles

RAG fehlgeschlagen – aber welche Ebene ist tatsächlich fehlgeschlagen? Eine diagnostische Methode

RAG fehlgeschlagen – aber welche Ebene ist tatsächlich fehlgeschlagen? Eine diagnostische Methode

Wenn eine RAG-Antwort falsch ist, ist es zu vage, das Retrieval oder das Modell verantwortlich zu machen. Diese Diagnosemethode isoliert Quellenabdeckung, Query-Konstruktion, Retrieval, Ranking, Kontextzusammenstellung, Generierung, Evidenzzuordnung und Aktualität – sodass der tatsächliche Fehler reproduziert und behoben werden kann.

Meistern des SEO-Workflows: Essenzielle Optimierungsstrategien für organisches Wachstum

Meistern des SEO-Workflows: Essenzielle Optimierungsstrategien für organisches Wachstum

Ein strukturierter SEO-Workflow ist entscheidend für nachhaltiges organisches Wachstum. Lerne die zehn grundlegenden Strategien, von der Keyword-Recherche und technischen Optimierung bis hin zur Content-Qualität und Performance-Analyse.

Git with automatic upload and synchronization to a production server

Git with automatic upload and synchronization to a production server

Die Antwortgültigkeitsgrenze: Die fehlende Schicht zwischen Relevanz und zuverlässigen KI-Antworten

Die Antwortgültigkeitsgrenze: Die fehlende Schicht zwischen Relevanz und zuverlässigen KI-Antworten

Eine Quelle kann relevant und maßgeblich sein und dennoch falsch für die gestellte Frage. Die fehlende Ebene ist die Anwendbarkeit: die Bedingungen, unter denen eine Antwort gilt, und die Veränderungen, die erzwingen, dass sie überdacht werden muss. Dieser Artikel führt die Answer Validity Boundary als ein Quellendesign-Muster für Menschen, KI-Suche und RAG-Systeme ein.

MCP vs A2A vs UCP vs AP2 vs A2UI: Der Agenten-Protokoll-Stack erklärt

MCP vs A2A vs UCP vs AP2 vs A2UI: Der Agenten-Protokoll-Stack erklärt

MCP, A2A, UCP, AP2 und A2UI werden oft als konkurrierende Agentenstandards dargestellt. Sie lösen größtenteils unterschiedliche Interoperabilitätsprobleme. Dieser Leitfaden ordnet jedes Protokoll der Grenze zu, die es tatsächlich standardisiert—und zeigt, wie sie in einem Produktionssystem zusammenarbeiten können.

Zuverlässigkeit von KI-Agenten: Warum die endgültige Antwort nicht ausreicht

Zuverlässigkeit von KI-Agenten: Warum die endgültige Antwort nicht ausreicht

Korrekte Ausgabe beweist weder korrektes Denken, sichere Ausführung noch ein vertrauenswürdiges System.

Warum mehr Kontext KI-Antworten verschlechtern kann

Warum mehr Kontext KI-Antworten verschlechtern kann

Ein größeres Kontextfenster garantiert keine bessere Antwort. Dieser Artikel erklärt, wie Signalverwässerung, widersprüchliche Belege, veralteter Zustand, Positionssensitivität und verlustbehaftete Kompression die KI-Zuverlässigkeit verringern können—und stellt einen praktischen Context Pressure Test vor.

OpenAI Agents API vs. Agents SDK vs. Responses API: Worauf sollten Sie 2026 aufbauen?

OpenAI Agents API vs. Agents SDK vs. Responses API: Worauf sollten Sie 2026 aufbauen?

Der Agent-Stack von OpenAI hat sich im September 2026 geändert. Dieser Architekturleitfaden unterscheidet die Agents API, das Agents SDK, die Responses API und das Codex SDK nach Runtime-Ownership—sodass Teams die richtige Kontrollgrenze wählen können, anstatt Produktnamen zu vergleichen.

Was sollte ein KI-Agent behalten, vergessen, neu berechnen oder erneut abrufen?

Was sollte ein KI-Agent behalten, vergessen, neu berechnen oder erneut abrufen?

Langlaufende Agenten sollten sich nicht alles merken. Dieser Artikel bietet ein praktisches Lebenszyklusmodell für die Entscheidung, was in den dauerhaften Speicher gehört, was erneut abgerufen werden sollte, was sicherer neu zu berechnen ist und was ablaufen oder ersetzt werden sollte.

Die GPU ist nicht das Produkt: Zukunftssichere private KI-Architektur

Die GPU ist nicht das Produkt: Zukunftssichere private KI-Architektur

Private KI-Infrastruktur sollte nicht um eine einzige GPU oder ein einziges Modell herum konzipiert werden. Ein resilienterer Ansatz kombiniert schnelle Inferenz-GPUs, speicherstarke KI-Systeme, physische KI-Knoten und optionale Frontier-Cloud-Modelle hinter einer fähigkeitsbewussten Routing-Schicht.

Ollama ist nicht das Produkt: Entwicklung produktionsreifer Open-LLM-Anwendungen

Ollama ist nicht das Produkt: Entwicklung produktionsreifer Open-LLM-Anwendungen

Das Ausführen eines lokalen Modells mit Ollama ist einfach. Das Erstellen einer produktionsreifen Open-LLM-Anwendung ist schwieriger: Es erfordert RAG, Zugriffskontrolle, Anbieterabstraktion, Evaluierung, Protokollierung, Bereitstellungsdisziplin und eine kontrollierte Anwendungsschicht um das Modell herum.

Computer-Use-Agenten: Warum eine erfolgreiche Demo dennoch ein unzuverlässiges System sein kann

Computer-Use-Agenten: Warum eine erfolgreiche Demo dennoch ein unzuverlässiges System sein kann

Computer-Use-Agenten können mittlerweile beeindruckende Browser- und Desktop-Workflows abschließen, aber ein erfolgreicher Durchlauf beweist Fähigkeit—nicht Zuverlässigkeit. Dieser Artikel zeigt, wie man Wiederholbarkeit, Umgebungsrobustheit, Steuerung über lange Zeithorizonte, Zustandsbewusstsein, Ergebnisüberprüfung und sichere Zielhandhabung testet.