[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"portal-settings:stajic:de":3,"public-menus:all":37,"post:vector-databases-embeddings-and-reranking-three-different-parts-of-retrieval:de":204,"related:post:vector-databases-embeddings-and-reranking-three-different-parts-of-retrieval:de:1":2651},{"statusCode":4,"data":5,"message":36},200,{"tenantId":6,"lang":7,"defaultLang":7,"siteUrl":8,"contactEmail":9,"brandName":10,"logoUrl":11,"siteName":10,"siteDescription":12,"ogImage":9,"robotsIndex":13,"socialLinks":9,"reservedSlugs":9,"seoPolicy":14},"stajic","de","https:\u002F\u002Fstajic.de",null,"Stajic Platform","\u002FLogo_Planet.svg","Stajic Portal",true,{"branding":15,"relatedContent":16,"crossDomainLinks":17},{"logoUrl":11},{"enabled":13},[18,21,24,27,30,33],{"url":19,"label":20,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Ffigure.rocks","figure.rocks",{"url":22,"label":23,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Floving.rocks","loving.rocks",{"url":25,"label":26,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.com","bazify.com",{"url":28,"label":29,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.de","bazify.de",{"url":31,"label":32,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.at","bazify.at",{"url":34,"label":35,"isActive":13,"showInFooter":13,"includeInSameAs":13},"https:\u002F\u002Fbazify.ba","bazify.ba","Portal settings resolved",[38,44],{"id":39,"name":40,"location":41,"isActive":13,"isDefault":42,"items":43},1,"main-navigation","header",false,[],{"id":45,"name":46,"location":47,"isActive":13,"isDefault":13,"items":48},4,"main-menu","sidebar",[49,65,78,92,102,117,132],{"id":50,"title":51,"url":59,"target":60,"icon":61,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":63,"portfolioId":9,"children":64},"item-18",{"de":52,"en":53,"es":54,"fr":55,"it":53,"ru":56,"sr":57,"zh":58},"Startseite","Home","Inicio","Accueil","Главная","Почетна","首页","\u002Ffull-stack-web-developer-munich-performance-seo-and-maintainable-builds","_self","i-lucide-home","page",111,[],{"id":66,"title":67,"url":74,"target":60,"icon":75,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":76,"portfolioId":9,"children":77},"item-22",{"de":68,"en":68,"es":69,"fr":68,"it":70,"ru":71,"sr":72,"zh":73},"Vision","Visión","Visione","Видение","Визија","想象","\u002Fueber-uns-webdesign-muenchen-webaplikation","i-lucide-eye",113,[],{"id":79,"title":80,"url":88,"target":60,"icon":89,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":90,"portfolioId":9,"children":91},"item-19",{"de":81,"en":82,"es":83,"fr":82,"it":84,"ru":85,"sr":86,"zh":87},"Leistungen","Services","Servicios","Servizi","Услуги","Услуге","服务","\u002Fservices-dienstleistungen-muenchen","i-lucide-wrench",116,[],{"id":93,"title":94,"url":98,"target":60,"icon":99,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":100,"portfolioId":9,"children":101},"item-23",{"de":95,"en":95,"es":95,"fr":95,"it":95,"ru":96,"sr":96,"zh":97},"Blog","Блог","博客","\u002Fblog","i-lucide-book-open",112,[],{"id":103,"title":104,"url":113,"target":60,"icon":114,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":115,"portfolioId":9,"children":116},"item-32",{"de":105,"en":106,"es":107,"fr":108,"it":109,"ru":110,"sr":111,"zh":112},"Neue Technologien","New Technologies","Nuevas tecnologías","Nouvelles technologies","Nuove tecnologie","Новые технологии","Нове технологије","新技术！","\u002Fneue-webtechnologien","i-lucide-sparkles",122,[],{"id":118,"title":119,"url":128,"target":60,"icon":129,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":130,"portfolioId":9,"children":131},"item-20",{"de":120,"en":121,"es":122,"fr":123,"it":124,"ru":125,"sr":126,"zh":127},"Kontakt","Contact us!","Contacto","Contact","Contatto","Контакт","Контактирајте нас","联系我们！","\u002Fcontact","i-lucide-mail",115,[],{"id":133,"title":134,"url":143,"target":60,"icon":144,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":146},"item-21",{"de":135,"en":136,"es":137,"fr":138,"it":139,"ru":140,"sr":141,"zh":142},"Unsere Arbeit","Our Work","Nuestro trabajo","Nos réalisations","I nostri lavori","Наши работы","Наши радови","文件夹","\u002Fportfolio","i-lucide-briefcase",114,[147,160,174,180,192],{"id":148,"title":149,"url":143,"target":60,"icon":158,"isActive":13,"type":62,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":145,"portfolioId":9,"children":159},"item-24",{"de":150,"en":151,"es":152,"fr":153,"it":154,"ru":155,"sr":156,"zh":157},"Alle Projekte","All Projects","Todos los proyectos","Tous les projets","Tutti i progetti","Все проекты","Сви пројекти","所有项目","i-lucide-grid-3x3",[],{"id":161,"title":162,"url":170,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":173},"item-29",{"de":163,"en":164,"es":165,"fr":166,"it":167,"ru":168,"sr":169,"zh":142},"Local Roots, Global Reach","Local Roots - Global Reach","Empresa local ","Entreprise locale","Azienda locale","Местная компания","Локално предузеће глобално тржиште","\u002Fportfolio\u002Flocal-roots-global-reach-communication-media-systems-for-modern-business","i-lucide-folder","custom",[],{"id":175,"title":176,"url":178,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":179},"item-28",{"de":177,"en":177,"es":177,"fr":177,"it":177,"ru":177,"sr":177,"zh":177},"Solr Suggester","\u002Fportfolio\u002Fsolr-fuzzy-suggester-und-solr-infix-suggester-abfrage-ueber-ajax-und-filterung",[],{"id":181,"title":182,"url":190,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":191},"item-27",{"de":183,"en":184,"es":185,"fr":186,"it":187,"ru":188,"sr":189,"zh":184},"Firmenwebseite SEO","Company Website SEO","Sitio web corporativo SEO","Site web d’entreprise SEO","Sito web aziendale SEO","Корпоративный сайт SEO","Пословна веб-страница SEO","\u002Fportfolio\u002Fseo-sem-branding-mobile-webseite-muenchen",[],{"id":193,"title":194,"url":202,"target":60,"icon":171,"isActive":13,"type":172,"productId":9,"categoryId":9,"shopCategoryId":9,"articleId":9,"pageId":9,"portfolioId":9,"children":203},"item-31",{"de":195,"en":196,"es":197,"fr":198,"it":199,"ru":200,"sr":201,"zh":196},"Digitalisierungsportal","Digitalization Portal","Portal de digitalización","Portail de numérisation","Portale di digitalizzazione","Портал цифровизации","Портал за дигитализацију","\u002Fportfolio\u002Fdigitalisierungsportal-archiv-museum-bibliothek-ead-lido-mets-mods",[],{"statusCode":4,"data":205,"message":2650},{"id":206,"title":207,"slug":208,"content":209,"contentJson":210,"excerpt":1250,"featuredImage":1251,"featuredImageAlt":1252,"featuredImageCaption":9,"featuredImageTitle":9,"featuredImageCopyright":9,"featuredImageAuthor":9,"featuredImageSourceUrl":9,"featuredImageLicense":9,"featuredImageIsAiGenerated":42,"status":1253,"publishedAt":1254,"createdAt":1255,"updatedAt":1256,"seoLocalePaths":1257,"categories":1266,"author":1279,"translations":1284},"487","Vektordatenbanken, Embeddings und Reranking: Drei verschiedene Teile des Retrievals","vector-databases-embeddings-and-reranking-three-different-parts-of-retrieval","\u003Cp>Embeddings, Vektordatenbanken und Reranker sind drei verschiedene Teile des Retrievals. Ein Embedding-Modell wandelt Text oder andere Daten in numerische Repräsentationen um; eine Vektordatenbank oder ein Vektorindex speichert und durchsucht diese Repräsentationen, um Kandidatenelemente abzurufen; ein Reranker nimmt eine kleinere Kandidatenmenge und ordnet sie mithilfe eines teureren Relevanzmodells oder Bewertungsverfahrens neu. Sie treten häufig gemeinsam in RAG auf, aber keines von ihnen ist dasselbe wie RAG, und keines ist in jedem Retrieval-System zwingend erforderlich.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--info my-6 rounded-xl border p-5 border-blue-300 bg-blue-50 dark:border-blue-900 dark:bg-blue-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Direkte Antwort\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">\u003Cstrong>Embeddings repräsentieren. Vektorsuche ruft ab. Reranking verfeinert.\u003C\u002Fstrong>\u003Cbr>\u003Cbr>Ein nützliches mentales Modell ist:\u003Cbr>\u003Cstrong>Inhalt → Embedding → Kandidatenabruf → Reranking → ausgewählter Kontext → Modell\u003C\u002Fstrong>.\u003Cbr>\u003Cbr>Die Grenzen sind wichtig, weil jede Ebene auf unterschiedliche Weise versagt. Schlechte Embeddings verzerren die semantische Ähnlichkeit. Ein schwacher Retrieval-Index verpasst nützliche Kandidaten. Ein Reranker kann Kandidaten neu ordnen, aber er kann kein relevantes Dokument wiederherstellen, das nie abgerufen wurde.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Den Retrieval-Stack nicht zusammenfallen lassen\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Eine Vektordatenbank ist kein Embedding-Modell. Ein Embedding ist kein Suchergebnis. Ein Reranker ist keine Vektordatenbank. RAG ist das übergeordnete Muster, das jede dieser Komponenten nutzen kann, um externe Informationen vor der Generierung abzurufen.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Hinweis zu aktuellen Quellen — 8. Oktober 2026\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Die grundlegende Architektur ist stabil, auch wenn sich Produkte schnell weiterentwickeln. Die aktuelle Qdrant-Dokumentation trennt Vektoren, Payload-Metadaten, Collections und Vektorindizes; die aktuelle Elastic-Anleitung behandelt semantisches Reranking als eine später im Prozess stattfindende Operation über eine kleine Kandidatenmenge; die aktuelle Cohere-Dokumentation beschreibt Reranking ebenfalls als eine Verbesserung der zweiten Stufe gegenüber lexikalischer oder semantischer Suche.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Cnav class=\"editorjs-toc\" data-editorjs-toc=\"true\" aria-label=\"Inhalt\">\u003Cstrong class=\"editorjs-toc__title\">Inhalt\u003C\u002Fstrong>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-0\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-6\" class=\"editorjs-toc__link\">Was das wirklich bedeutet\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-10\" class=\"editorjs-toc__link\">Das einfachste Beispiel\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-15\" class=\"editorjs-toc__link\">Wo das einfache Beispiel endet\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-20\" class=\"editorjs-toc__link\">Embeddings: Repräsentation, nicht Retrieval\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-24\" class=\"editorjs-toc__link\">Das Embedding-Modell definiert den Repräsentationsraum\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-27\" class=\"editorjs-toc__link\">Dichte und sparse Repräsentationen sind unterschiedlich\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-30\" class=\"editorjs-toc__link\">Ähnlichkeitsfunktionen sind Teil des Repräsentationsvertrags\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-34\" class=\"editorjs-toc__link\">Vektordatenbanken und Indizes: Kandidaten-Retrieval\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-38\" class=\"editorjs-toc__link\">Approximative Nearest-Neighbor-Suche tauscht Genauigkeit gegen Effizienz\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-42\" class=\"editorjs-toc__link\">Metadaten-Filterung gehört vor oder während der Kandidatenermittlung\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-45\" class=\"editorjs-toc__link\">Eine Vektordatenbank ist optional\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-48\" class=\"editorjs-toc__link\">Reranking: Relevanzverfeinerung in der zweiten Stufe\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-52\" class=\"editorjs-toc__link\">Bi-Encoder-Retrieval und Cross-Encoder-Reranking lösen unterschiedliche Kostenprobleme\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-54\" class=\"editorjs-toc__link\">Ein Reranker kann nicht wiederherstellen, was das Retrieval verpasst hat\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-58\" class=\"editorjs-toc__link\">Hybrides Retrieval ist eine separate Designentscheidung\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-62\" class=\"editorjs-toc__link\">BM25 ist nicht obsolet, nur weil Embeddings existieren\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-65\" class=\"editorjs-toc__link\">Chunking verändert, was Embeddings und Reranker sehen können\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-68\" class=\"editorjs-toc__link\">Vergleichen Sie Retrieval-Scores nicht, als wären sie universelle Wahrscheinlichkeiten\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-71\" class=\"editorjs-toc__link\">Evaluieren Sie Retrieval-Stufen getrennt\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-74\" class=\"editorjs-toc__link\">Welche Ebene ist tatsächlich ausgefallen?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-76\" class=\"editorjs-toc__link\">Relevanz und Quelle der Wahrheit sind verschieden\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-80\" class=\"editorjs-toc__link\">Belege aus der ursprünglichen Implementierung\u003C\u002Fa>\u003Col class=\"editorjs-toc__list editorjs-toc__list--depth-1\">\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-81\" class=\"editorjs-toc__link\">Source of Truth Research Engine: lexikalisches und semantisches Retrieval sind getrennt\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-85\" class=\"editorjs-toc__link\">Aaasaasa AI Client: Qdrant ist eine Vektorinfrastrukturkomponente\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-91\" class=\"editorjs-toc__link\">Wann benötigen Sie welche Komponente?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-93\" class=\"editorjs-toc__link\">Eine praktische Abfolge für das Retrieval-Design\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-95\" class=\"editorjs-toc__link\">Häufige Missverständnisse\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-97\" class=\"editorjs-toc__link\">Randfälle und Einschränkungen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-103\" class=\"editorjs-toc__link\">Was würde diese Antwort ändern?\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-107\" class=\"editorjs-toc__link\">Verwandtes kanonisches Wissen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-113\" class=\"editorjs-toc__link\">Häufig gestellte Fragen\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-115\" class=\"editorjs-toc__link\">Glossar\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-117\" class=\"editorjs-toc__link\">Fazit\u003C\u002Fa>\u003C\u002Fli>\u003Cli class=\"editorjs-toc__item\">\u003Ca href=\"#section-121\" class=\"editorjs-toc__link\">Primärquellen und Implementierungsnachweise\u003C\u002Fa>\u003C\u002Fli>\u003C\u002Fol>\u003C\u002Fnav>\n\u003Ch2 id=\"section-6\">Was das wirklich bedeutet\u003C\u002Fh2>\n\u003Cp>Suchsysteme haben zwei konkurrierende Ziele: genügend potenziell relevantes Material finden und das beste Material nahe an die Spitze bringen. Schnelles Retrieval der ersten Stufe optimiert üblicherweise die Kandidatengenerierung. Ein stärkeres Modell der zweiten Stufe kann dann mehr Rechenleistung aufwenden, um die besten Kandidaten zu unterscheiden.\u003C\u002Fp>\n\u003Cp>Embeddings, Vektorindizes und Reranker nehmen unterschiedliche Positionen in diesem Prozess ein. Sie als ein einziges Feature zu behandeln, verdeckt wichtige Designentscheidungen zu Recall, Precision, Latenz, Speicherung, Metadatenfilterung und Modellkosten.\u003C\u002Fp>\n\u003Cp>Die Unterscheidung verhindert außerdem einen häufigen RAG-Fehler: anzunehmen, dass das Speichern von Dokument-Embeddings in einer Vektordatenbank automatisch hochwertiges Retrieval erzeugt. Die Retrieval-Qualität hängt vom Embedding-Modell, Chunking, Metadaten, Query-Konstruktion, Indexkonfiguration, Kandidatenanzahl, hybridem Retrieval, Reranking und der Autorität der zugrunde liegenden Quellen ab.\u003C\u002Fp>\n\u003Ch2 id=\"section-10\">Das einfachste Beispiel\u003C\u002Fh2>\n\u003Cp>Angenommen, eine Wissensdatenbank enthält 100.000 Dokument-Chunks. Ein Benutzer fragt: „Wie widerrufe ich ein API-Token?“\u003C\u002Fp>\n\u003Cp>Zuerst kann ein Embedding-Modell die Anfrage in einen Vektor kodieren. Dokument-Chunks haben möglicherweise bereits ihre eigenen gespeicherten Embeddings. Eine Vektorsuche vergleicht dann den Anfragevektor mit den indexierten Dokumentvektoren und liefert beispielsweise 30 wahrscheinliche Kandidaten.\u003C\u002Fp>\n\u003Cp>Diese 30 Kandidaten können dann an einen Reranker übergeben werden. Der Reranker vergleicht die Anfrage direkter mit jedem Kandidaten und erzeugt eine neue Relevanzreihenfolge. Die Anwendung könnte die besten fünf für den Modellkontext behalten.\u003C\u002Fp>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Eine grundlegende zweistufige semantische Retrieval-Pipeline\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Dokumente einbetten\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Jeden durchsuchbaren Chunk in eine numerische Repräsentation umwandeln, üblicherweise zum Zeitpunkt der Aufnahme.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Vektoren speichern\u002Findexieren\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Vektoren mit Dokument-IDs und Metadaten in einem durchsuchbaren Vektorindex oder einer Datenbank verknüpfen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Die Anfrage einbetten\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Die Benutzeranfrage mit dem kompatiblen Embedding-Modell und der Abfragekonfiguration kodieren.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Kandidaten abrufen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Eine Vektorähnlichkeitssuche ausführen, oft mit Metadatenfiltern, um eine größere Top-k-Kandidatenmenge zu erzeugen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Kandidaten neu ordnen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Ein stärkeres Relevanzmodell auf die Anfrage und die kleine Kandidatenmenge anwenden.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Kontext auswählen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Die nützlichsten Passagen für die nachgelagerte Antwort, den Agentenschritt oder das Suchergebnis behalten.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-15\">Wo das einfache Beispiel endet\u003C\u002Fh2>\n\u003Cp>Reale Retrieval-Systeme müssen überhaupt keine dichten Embeddings verwenden. Keyword-Suche wie BM25 kann der Retriever der ersten Stufe sein. Sparse Learned Retrieval, SQL-Filter, Graph-Traversierung oder Anwendungs-APIs können ebenfalls Kandidaten erzeugen.\u003C\u002Fp>\n\u003Cp>Ein Reranker kümmert sich auch nicht darum, dass die Kandidaten aus einer Vektordatenbank stammen. Er kann BM25-Ergebnisse, hybride Ergebnisse, handverlesene Dokumente oder Kandidaten aus mehreren Retrievern neu ordnen.\u003C\u002Fp>\n\u003Cp>Ebenso erfordern Embeddings keine spezialisierte Vektordatenbank. Kleine Datensätze können im Speicher oder mit Allzweckdatenbanken und Vektorerweiterungen verglichen werden. Spezialisierte Vektorsysteme werden nützlich, wenn Indexierung, approximative Nächste-Nachbarn-Suche, Filterung, Skalierung, Aktualisierungsverhalten oder betriebliche Anforderungen sie rechtfertigen.\u003C\u002Fp>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Drei verschiedene Retrieval-Komponenten\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Embedding\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Vektordatenbank \u002F Index\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Reranker\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Hauptaufgabe\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Typische Eingabe\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Typische Ausgabe\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Kostenprofil\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Typisches Versagen\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-20\">Embeddings: Repräsentation, nicht Retrieval\u003C\u002Fh2>\n\u003Cp>Ein Embedding ist eine numerische Repräsentation, die von einem Modell erzeugt wird. Für semantisches Retrieval sollen Texte mit verwandter Bedeutung nützliche Positionen in einem Vektorraum einnehmen, damit eine Ähnlichkeits- oder Distanzfunktion sie vergleichen kann.\u003C\u002Fp>\n\u003Cp>Sentence-BERT war ein einflussreicher Schritt, um semantische Ähnlichkeit auf Satzebene mit bi-encoder-artigen Repräsentationen praktikabel zu machen, die unabhängig berechnet und effizient verglichen werden können. Die allgemeine Idee bleibt zentral für modernes dichtes Retrieval: Dokumentrepräsentationen vorab berechnen, die Query-Repräsentation zur Suchzeit berechnen und sie dann vergleichen.\u003C\u002Fp>\n\u003Cp>Das Embedding selbst durchsucht keinen Korpus. Es sind Daten, die von einem Embedding-Modell erzeugt werden. Retrieval beginnt, wenn das System die Query-Repräsentation mit gespeicherten Kandidaten vergleicht.\u003C\u002Fp>\n\u003Ch3 id=\"section-24\">Das Embedding-Modell definiert den Repräsentationsraum\u003C\u002Fh3>\n\u003Cp>Dokument- und Query-Vektoren müssen mit dem Modell und der Konfiguration kompatibel sein, mit der sie erstellt wurden. Der Austausch eines Embedding-Modells kann Dimensionalität, Ähnlichkeitsverhalten, Sprachabdeckung und Domänenleistung verändern.\u003C\u002Fp>\n\u003Cp>Deshalb ist eine Embedding-Modell-Migration nicht bloß eine Änderung des API-Namens. Bestehende Dokumente müssen möglicherweise neu eingebettet und der Index neu aufgebaut oder versioniert werden.\u003C\u002Fp>\n\u003Ch3 id=\"section-27\">Dichte und sparse Repräsentationen sind unterschiedlich\u003C\u002Fh3>\n\u003Cp>Dichte Embeddings enthalten üblicherweise viele Nicht-Null-Dimensionen und werden häufig für semantische Ähnlichkeit verwendet. Sparse Repräsentationen enthalten viele Nullen und können eine stärkere token- oder termartige Struktur bewahren.\u003C\u002Fp>\n\u003Cp>Beide können semantisches Retrieval unterstützen, und moderne Suchsysteme können dichte, sparse und lexikalische Signale kombinieren. „Vektorsuche“ bedeutet daher nicht immer eine einzige dichte Cosine-Similarity-Pipeline.\u003C\u002Fp>\n\u003Ch3 id=\"section-30\">Ähnlichkeitsfunktionen sind Teil des Repräsentationsvertrags\u003C\u002Fh3>\n\u003Cp>Cosine-Ähnlichkeit, Skalarprodukt und euklidische Distanz bedeuten nicht dasselbe. Die korrekte Metrik hängt davon ab, wie das Embedding-Modell trainiert und normalisiert wurde.\u003C\u002Fp>\n\u003Cp>Die aktuelle Qdrant-Dokumentation verlangt beispielsweise eine Distanzmetrik als Teil der Vektorkonfiguration und dokumentiert Cosine-, Skalarprodukt- und euklidische Optionen. Die wichtige architektonische Regel ist, die Metrik als Teil des Embedding-\u002FIndex-Vertrags zu behandeln, statt eine willkürlich zu wählen.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Embedding-Ähnlichkeit ist keine faktische Stütze\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Zwei Passagen können semantisch nah beieinanderliegen, während eine veraltet, nicht autorisiert oder falsch ist. Embeddings schätzen repräsentative Ähnlichkeit; sie bestimmen nicht die Autorität, Aktualität oder Beweiskraft einer Source of Truth.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-34\">Vektordatenbanken und Indizes: Kandidaten-Retrieval\u003C\u002Fh2>\n\u003Cp>Eine Vektordatenbank oder ein vektorfähiges Suchsystem organisiert Vektorrepräsentationen so, dass die Anwendung nahegelegene Kandidaten effizient abrufen kann. Praktische Systeme verknüpfen Vektoren üblicherweise mit IDs und Payload-Metadaten wie Quelle, Sprache, Mandant, Dokumenttyp, Zeitstempel oder Zugriffsbereich.\u003C\u002Fp>\n\u003Cp>Qdrant organisiert Daten beispielsweise in Sammlungen von Punkten, wobei ein Punkt einen Vektor und optionale Payload-Metadaten enthält. Seine Dokumentation beschreibt HNSW-basierte Ähnlichkeitssuche und Metadatenfilterung als separate Fähigkeiten der Retrieval-Schicht.\u003C\u002Fp>\n\u003Cp>Diese Unterscheidung ist wichtig: Der Vektorindex beantwortet ein Nearest-Neighbor-Problem, während Payload-Filter strukturelle Einschränkungen wie Mandant, Dokumentklasse oder Sprache durchsetzen.\u003C\u002Fp>\n\u003Ch3 id=\"section-38\">Approximative Nearest-Neighbor-Suche tauscht Genauigkeit gegen Effizienz\u003C\u002Fh3>\n\u003Cp>Der Vergleich eines Query-Vektors mit jedem Vektor kann für kleine Sammlungen praktikabel sein, ist aber bei großem Maßstab teuer. Approximative Nearest-Neighbor-Indizes wie HNSW reduzieren die Suchkosten, indem sie eine Indexstruktur durchlaufen, anstatt jeden Vektor erschöpfend zu scannen.\u003C\u002Fp>\n\u003Cp>Approximative Suche führt zu einem Trade-off zwischen Recall und Latenz. Eine schnellere Suche kann Kandidaten verfehlen, die eine exakte Suche zurückgeben würde. Indexparameter beeinflussen daher die Retrieval-Qualität, nicht nur die Infrastrukturleistung.\u003C\u002Fp>\n\u003Cp>Qdrant stellt sowohl HNSW-bezogene Parameter als auch eine Option für exakte Suche bereit, was verdeutlicht, dass Vektorspeicherung und approximative Retrieval-Strategie separate Entscheidungen sind.\u003C\u002Fp>\n\u003Ch3 id=\"section-42\">Metadaten-Filterung gehört vor oder während der Kandidatenermittlung\u003C\u002Fh3>\n\u003Cp>Wenn der Benutzer nur auf Mandant A zugreifen darf, ist es die falsche Sicherheitsgrenze, semantisch ähnliche Chunks von Mandant B abzurufen und zu versuchen, sie später zu entfernen. Autorisierung und harte Eignungsfilter sollten den Kandidatenraum einschränken, bevor diese Kandidaten die nachgelagerte Verarbeitung beeinflussen können.\u003C\u002Fp>\n\u003Cp>Dasselbe Prinzip gilt für Locale, Dokumentstatus, Quellklasse, Datum, Produktversion und andere deterministische Einschränkungen. Ähnlichkeit sollte berechtigte Kandidaten ranken; sie sollte die Berechtigung nicht außer Kraft setzen.\u003C\u002Fp>\n\u003Ch3 id=\"section-45\">Eine Vektordatenbank ist optional\u003C\u002Fh3>\n\u003Cp>Für einen kleinen Korpus kann ein Brute-Force-Cosine-Vergleich einfach und ausreichend sein. Eine relationale Datenbank mit Vektorunterstützung kann ebenfalls ausreichen. Eine dedizierte Vektordatenbank wird wertvoll, wenn ihre Indizierung, Filterung, verteilte Speicherung, Aktualisierungsverhalten oder betriebliche Funktionen eine echte Anforderung erfüllen.\u003C\u002Fp>\n\u003Cp>Eine Vektordatenbank zu wählen, weil „RAG eine braucht“, kehrt den Architekturprozess um. Beginnen Sie mit den Retrieval-Anforderungen und dem Maßstab und wählen Sie dann die Speicher-\u002FIndextechnologie aus.\u003C\u002Fp>\n\u003Ch2 id=\"section-48\">Reranking: Relevanzverfeinerung in der zweiten Stufe\u003C\u002Fh2>\n\u003Cp>Ein Reranker erhält eine Query und eine kleinere Menge bereits abgerufener Kandidaten und weist dann stärkere Relevanzbewertungen oder eine neue Reihenfolge zu. Er ist normalerweise rechenintensiver als das Retrieval der ersten Stufe, weshalb er nach der Kandidatengenerierung und nicht auf den gesamten Korpus angewendet wird.\u003C\u002Fp>\n\u003Cp>Die aktuelle Elastic-Empfehlung beschreibt semantisches Reranking als eine Technik der letzten Stufe über eine kleine Top-k-Menge und merkt an, dass sie lexikalisches, semantisches oder hybrides Retrieval verfeinern kann. Cohere dokumentiert dieselbe Architektur: lexikalische oder semantische Suche in der ersten Stufe, gefolgt von einer Reranking-Stufe.\u003C\u002Fp>\n\u003Cp>Eine übliche Implementierung verwendet ein Cross-Encoder-ähnliches Modell, das die Query und jeden Kandidaten gemeinsam untersucht. Diese reichhaltigere Interaktion kann Relevanz präziser unterscheiden als unabhängige Embedding-Ähnlichkeit, ist aber im Korpusmaßstab deutlich teurer.\u003C\u002Fp>\n\u003Ch3 id=\"section-52\">Bi-Encoder-Retrieval und Cross-Encoder-Reranking lösen unterschiedliche Kostenprobleme\u003C\u002Fh3>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Eigenschaft\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Bi-Encoder-\u002FEmbedding-Retrieval\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Cross-Encoder-artiges Reranking\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kodierung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Query und Dokumente unabhängig repräsentiert\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Query und Kandidat gemeinsam verarbeitet\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Dokumentberechnung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kann bei der Aufnahme vorab berechnet werden\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Wird normalerweise pro Query-Kandidat-Paar neu berechnet\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Suche im Korpusmaßstab\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Geeignet mit Vektorindizes\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Üblicherweise zu teuer über den gesamten Korpus\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Typische Rolle\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kandidatengenerierung mit hohem Recall\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Hochpräzise Reihenfolge einer kleinen Kandidatenmenge\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Haupt-Trade-off\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Schnell und skalierbar, aber Relevanzinteraktion wird in Vektoren komprimiert\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Reichhaltigere Relevanzbeurteilung, aber höhere Latenz\u002FKosten\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch3 id=\"section-54\">Ein Reranker kann nicht wiederherstellen, was das Retrieval verpasst hat\u003C\u002Fh3>\n\u003Cp>Wenn das relevante Dokument im Kandidatensatz fehlt, hat das Reranking nichts zu befördern. Dies ist der zentrale Grund, Retrieval und Reranking getrennt zu evaluieren.\u003C\u002Fp>\n\u003Cp>Eine Pipeline kann eine hervorragende Reranker-Präzision aufweisen und dennoch scheitern, weil der Recall der ersten Stufe schlecht ist. Eine Verbesserung der Reranker-Qualität wird fehlende Quellenabdeckung, schlechtes Chunking, restriktive Filter oder einen schwachen Kandidaten-Retriever nicht beheben.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--success my-6 rounded-xl border p-5 border-emerald-300 bg-emerald-50 dark:border-emerald-900 dark:bg-emerald-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Nützliches Retrieval-Ziel\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Erste Stufe: \u003Cstrong>die nützlichen Kandidaten nicht verpassen.\u003C\u002Fstrong>\u003Cbr>Zweite Stufe: \u003Cstrong>die besten Kandidaten zuerst platzieren.\u003C\u002Fstrong>\u003Cbr>\u003Cbr>Dies ist keine universelle mathematische Regel, aber ein nützliches Ingenieurmodell für zweistufiges Retrieval.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-58\">Hybrides Retrieval ist eine separate Designentscheidung\u003C\u002Fh2>\n\u003Cp>Dichtes semantisches Retrieval ist stark, wenn Anfrage und Dokument unterschiedliche Formulierungen verwenden, aber verwandte Bedeutung ausdrücken. Lexikalisches Retrieval ist stark, wenn exakte Begriffe, Identifikatoren, Namen, Codes oder seltene Phrasen wichtig sind.\u003C\u002Fp>\n\u003Cp>Hybrides Retrieval kombiniert mehrere Kandidatensignale, oft lexikalisches BM25 und Vektorähnlichkeit, und führt die Ranglisten dann mit einer Methode wie Reciprocal Rank Fusion oder einer gewichteten Score-Kombination zusammen.\u003C\u002Fp>\n\u003Cp>Das Reranking kann dann auf dem fusionierten Kandidatensatz arbeiten. Hybrides Retrieval und Reranking sind daher komplementäre, aber unterschiedliche Stufen.\u003C\u002Fp>\n\u003Ch3 id=\"section-62\">BM25 ist nicht obsolet, nur weil Embeddings existieren\u003C\u002Fh3>\n\u003Cp>Die Keyword-Suche kann bei exakten Identifikatoren, Versionsnummern, Fehlermeldungen, Produktcodes und spezialisiertem Vokabular das dichte Retrieval übertreffen. SQLite FTS5 enthält beispielsweise eine BM25-Rangfolgefunktion für die Volltextsuche.\u003C\u002Fp>\n\u003Cp>Eine starke Retrieval-Architektur kann lexikalisches Retrieval als einzige erste Stufe, Vektor-Retrieval als einzige erste Stufe verwenden oder beides kombinieren, je nach Korpus und Anfrageverteilung.\u003C\u002Fp>\n\u003Ch2 id=\"section-65\">Chunking verändert, was Embeddings und Reranker sehen können\u003C\u002Fh2>\n\u003Cp>Wenn ein Dokument schlecht aufgeteilt wird, kann keine spätere Retrieval-Komponente die fehlende semantische Einheit vollständig rekonstruieren. Ein Chunk, der eine Bedingung von ihrer Ausnahme trennt, kann irreführend eingebettet werden und auch falsch gererankt werden, weil der Kandidatentext unvollständig ist.\u003C\u002Fp>\n\u003Cp>Chunk-Größe, Überlappung, strukturelle Grenzen und Metadaten beeinflussen daher sowohl den Kandidaten-Recall als auch das Reranker-Urteil. Die Retrieval-Evaluierung sollte die vollständige Pipeline von der Ingestion bis zum Ranking testen, nicht nur das Embedding-Modell.\u003C\u002Fp>\n\u003Ch2 id=\"section-68\">Vergleichen Sie Retrieval-Scores nicht, als wären sie universelle Wahrscheinlichkeiten\u003C\u002Fh2>\n\u003Cp>Kosinus-Ähnlichkeit, BM25-Scores, Sparse-Vektor-Scores, RRF-Ränge und Reranker-Scores haben unterschiedliche Bedeutungen. Ein Score von 0,82 von einem Embedding-Modell ist nicht automatisch mit 0,82 von einem anderen Modell oder mit einem Reranker-Score vergleichbar.\u003C\u002Fp>\n\u003Cp>Schwellenwerte sollten für das tatsächliche Modell, den Korpus und die Aufgabe kalibriert werden. Die aktuelle Elastic-Richtlinie weist auch darauf hin, dass Embedding-Ähnlichkeitswerte anfrageabhängig sein können, was universelle Grenzwerte riskant macht.\u003C\u002Fp>\n\u003Ch2 id=\"section-71\">Evaluieren Sie Retrieval-Stufen getrennt\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Ebene\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Nützliche Frage\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Beispielmetrik oder Test\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Quellenabdeckung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Enthält der Korpus die benötigten Informationen?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Abdeckungsaudit \u002F Quellensatz mit bekannten Antworten\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Chunking\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ist der benötigte Beleg als kohärente Einheit abrufbar?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Überprüfung der Unterstützung auf Chunk-Ebene\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Retrieval der ersten Stufe\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Gelangt das relevante Element in den Kandidatensatz?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Recall@k\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ranking\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Wie hoch erscheint relevanter Beleg?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">MRR, nDCG, Precision@k\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Reranking\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Verbessert die Bewertung der zweiten Stufe die Reihenfolge?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Delta nDCG \u002F MRR \u002F Precision\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kontextauswahl\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Enthalten die endgültig ausgewählten Passagen ausreichende Unterstützung?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kontextrelevanz \u002F Abdeckung\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Antwortstufe\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Verwendet das Modell den ausgewählten Beleg korrekt?\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Treue \u002F Claim-Evidence-Evaluierung\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Cp>Diese Trennung ist operativ wichtig. Wenn Recall@50 schlecht ist, ist der Reranker nicht die erste Komponente, die behoben werden muss. Wenn Recall@50 stark ist, aber die beste Passage auf Rang 38 bleibt, wird Reranking oder Ranking-Fusion zu einem plausiblen Ziel.\u003C\u002Fp>\n\u003Ch2 id=\"section-74\">Welche Ebene ist tatsächlich ausgefallen?\u003C\u002Fh2>\n\u003Csection class=\"editorjs-comparison my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Symptome und wahrscheinliche Retrieval-Ebene\u003C\u002Fh3>\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left dark:border-gray-700 dark:bg-gray-900\">\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Beobachtetes Symptom\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Wahrscheinliche Ebene\u003C\u002Fth>\u003Cth class=\"border border-gray-300 bg-gray-50 px-4 py-3 text-left font-semibold dark:border-gray-700 dark:bg-gray-900\">Erste Diagnose\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Relevantes Dokument erscheint nie\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Relevantes Dokument erscheint zu niedrig\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Semantisch gut, aber verbotenes Ergebnis\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Relevantes, aber veraltetes Ergebnis\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-3 text-left font-semibold dark:border-gray-700\">Korrektes Ergebnis abgerufen, aber aus dem Prompt weggelassen\u003C\u002Fth>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-3 dark:border-gray-700\">\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-76\">Relevanz und Quelle der Wahrheit sind verschieden\u003C\u002Fh2>\n\u003Cp>Ein Reranker kann ein veraltetes Dokument extrem relevant erscheinen lassen. Ein Vektorindex kann eine sekundäre Zusammenfassung abrufen, die semantisch näher liegt als die Primärquelle. Retrieval-Qualität kann daher keine Autoritätsregeln ersetzen.\u003C\u002Fp>\n\u003Cp>Wo Quellenautorität wichtig ist, sollten Metadatenfilter, Quellenklassen, Versionsregeln und Provenienz das Retrieval einschränken, bevor das Ergebnis zum Modellkontext wird.\u003C\u002Fp>\n\u003Caside class=\"editorjs-callout editorjs-callout--warning my-6 rounded-xl border p-5 border-amber-300 bg-amber-50 dark:border-amber-900 dark:bg-amber-950\u002F20\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Reranking kann eine nicht-autoritative Quelle nicht autoritativ machen\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Relevanz beantwortet, ob ein Kandidat zur Anfrage passt. Source-of-Truth-Architektur beantwortet, ob dieser Kandidat die Behauptung belegen darf.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-80\">Belege aus der ursprünglichen Implementierung\u003C\u002Fh2>\n\u003Ch3 id=\"section-81\">Source of Truth Research Engine: lexikalisches und semantisches Retrieval sind getrennt\u003C\u002Fh3>\n\u003Cp>Die Source of Truth Research Engine enthält einen lokalen lexikalischen Retrieval-Pfad mit SQLite FTS5\u002FBM25 und einen separaten optionalen semantischen Retrieval-Pfad mit lokal generierten Embeddings.\u003C\u002Fp>\n\u003Cp>Ihre semantische Suchimplementierung berechnet einen Query-Vektor und vergleicht ihn mit gespeicherten Chunk-Vektoren mittels Kosinus-Ähnlichkeit. Das Projekt behandelt semantische Ähnlichkeit bewusst als Entdeckungssignal und nicht als Beweis: Ein Kandidat muss immer noch auf eine konkrete Quelle und einen Locator zurückverfolgt werden, bevor er eine Behauptung stützt.\u003C\u002Fp>\n\u003Cp>Dies ist nützlicher Implementierungsbeleg für R01, weil derselbe Korpus lexikalisches Ranking und Vektorähnlichkeit unterstützen kann, ohne einen der beiden Mechanismen mit evidentieller Autorität zu verwechseln.\u003C\u002Fp>\n\u003Ch3 id=\"section-85\">Aaasaasa AI Client: Qdrant ist eine Vektorinfrastrukturkomponente\u003C\u002Fh3>\n\u003Cp>Der Aaasaasa AI Client enthält Qdrant\u002FVektorinfrastruktur als separate lokale Ressource. Die Electron-Architektur stellt Qdrant-Dienste von der vertrauenswürdigen Main-Process-Seite bereit, anstatt Vektorsuche als Teil des Modells selbst zu behandeln.\u003C\u002Fp>\n\u003Cp>Das Repository enthält einen Qdrant-Client-Adapter, Qdrant-Dienstkonfiguration und Docker-basierte Qdrant-Infrastruktur. Dies demonstriert die architektonische Trennung zwischen KI-Anbieter-\u002FModellausführung und Vektorspeicherung\u002F-suche.\u003C\u002Fp>\n\u003Cp>Die Existenz von Qdrant-Unterstützung sollte nicht als vollständige Produktions-RAG-Pipeline überbewertet werden. Der Beleg hier ist enger: Vektorinfrastruktur ist als eigene Komponentengrenze implementiert.\u003C\u002Fp>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Implementierungsbeleg\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Was er demonstriert\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">SQLite FTS5\u002FBM25 in Source of Truth Research Engine\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Lexikalisches Retrieval kann unabhängig von Embeddings existieren.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Lokale Ollama-Embeddings\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Repräsentationsgenerierung ist eine eigene Stufe.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Gespeicherte semantische Vektoren + Kosinusvergleich\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Semantisches Retrieval konsumiert Embeddings, nachdem sie erzeugt wurden.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Qdrant-Unterstützung im Aaasaasa AI Client\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Vektorspeicherung\u002F-suche ist eine Infrastrukturfähigkeit, die vom Modellanbieter getrennt ist.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Evidenz-\u002FProvenienzregeln in Source of Truth Research Engine\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Abgerufene Ähnlichkeit ist nicht gleich Autorität oder Beweis.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kein behaupteter benutzerdefinierter Reranker in diesen Implementierungen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Reranking wird als architektonische Stufe erklärt, nicht fälschlich als bereits implementierter Beleg behauptet.\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Caside class=\"editorjs-callout editorjs-callout--note my-6 rounded-xl border p-5 border-gray-300 bg-gray-50 dark:border-gray-700 dark:bg-gray-900\u002F40\" role=\"note\">\u003Cstrong class=\"block mb-2 text-gray-900 dark:text-gray-100\">Evidenzgrenze\u003C\u002Fstrong>\u003Cdiv class=\"text-gray-700 dark:text-gray-200\">Die aktuellen Implementierungsbelege bestätigen lexikalisches Retrieval, Embeddings, Vektorsuchinfrastruktur und provenienzbewusstes Retrieval. Dieser Artikel behauptet \u003Cstrong>nicht\u003C\u002Fstrong>, dass ein Produktions-Cross-Encoder-Reranking-Dienst bereits in diesen Projekten implementiert ist.\u003C\u002Fdiv>\u003C\u002Faside>\n\u003Ch2 id=\"section-91\">Wann benötigen Sie welche Komponente?\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Bedarf\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Wahrscheinliche Komponente\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Semantische Ähnlichkeit über unterschiedliche Formulierungen hinweg\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Embedding-Modell + Vektorähnlichkeitssuche\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Effiziente Suche über einen großen Vektorkorpus\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Vektorindex\u002F-datenbank oder vektorfähige Suchmaschine\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Exakte Identifikatoren, Fehlercodes oder seltene Begriffe\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Lexikalischer\u002FVolltext-Abruf wie BM25\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sowohl exakte Terminologie als auch semantische Bedeutung\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Hybrider lexikalischer + semantischer Abruf\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kandidatenmenge ist gut, aber die Reihenfolge ist schwach\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Reranker\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Relevante Elemente fehlen in der Kandidatenmenge\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Verbessern Sie Quellenabdeckung, Chunking, Retriever, Filter oder Kandidatenanzahl vor dem Reranking\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Harte Mandanten-\u002FQuellen-\u002FVersionsbeschränkungen\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Deterministische Metadaten-\u002FAutorisierungsfilterung\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Kleiner Korpus\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Potenziell einfache Brute-Force-Ähnlichkeit oder Allzweckdatenbank statt dedizierter Vektordatenbank\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-93\">Eine praktische Abfolge für das Retrieval-Design\u003C\u002Fh2>\n\u003Csection class=\"editorjs-process my-6\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Entwerfen Sie das Retrieval aus den Anforderungen, nicht aus Produktnamen\u003C\u002Fh3>\u003Cdiv class=\"grid grid-cols-1 md:grid-cols-2 xl:grid-cols-3 gap-4\">\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">1\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">1. Definieren Sie die Abfragetypen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Identifizieren Sie semantische Fragen, exakte Lookups, Identifikatoren, Aktuellzustands-Lesevorgänge und domänenspezifische Muster.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">2\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">2. Definieren Sie zulässige Quellen\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Wenden Sie Mandanten-, Autorisierungs-, Locale-, Versions-, Quellenklassen- und Aktualitätsbeschränkungen an.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">3\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">3. Etablieren Sie eine lexikalische Baseline\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Messen Sie, ob einfacher Volltext-\u002FBM25-Abruf bereits einen Großteil der Arbeitslast löst.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">4\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">4. Fügen Sie Embeddings hinzu, wo semantischer Recall benötigt wird\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Wählen und bewerten Sie ein Embedding-Modell anhand repräsentativer Domänenabfragen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">5\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">5. Wählen Sie Vektorspeicherung\u002F-indizierung basierend auf der Skalierung\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Verwenden Sie Brute Force, Datenbank-Vektorunterstützung oder eine dedizierte Vektor-Engine entsprechend den Anforderungen.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">6\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">6. Bewerten Sie den Recall der ersten Stufe\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Bestätigen Sie, dass relevante Evidenz in eine ausreichend große Kandidatenmenge gelangt.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">7\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">7. Fügen Sie hybrides Retrieval hinzu, wenn die Signale komplementär sind\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Fusionieren Sie lexikalische und semantische Rankings, wenn beide die Kandidatengenerierung wesentlich verbessern.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">8\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">8. Fügen Sie Reranking hinzu, wenn die Reihenfolge der Engpass bleibt\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Wenden Sie das stärkere Modell nur auf die Kandidatenmenge an, wo seine Kosten gerechtfertigt sind.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">9\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">9. Optimieren Sie die endgültige Kontextauswahl\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Steuern Sie Redundanz, Kontextbudget, Autorität, Diversität und Evidenzabdeckung vor der Generierung.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv class=\"editorjs-process__step min-w-0  rounded-xl border border-gray-200 dark:border-gray-700 p-4\">\u003Cdiv class=\"text-xs font-semibold text-gray-500 dark:text-gray-400\">10\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 font-semibold text-gray-900 dark:text-gray-100\">10. Bewerten Sie End-to-End\u003C\u002Fdiv>\u003Cdiv class=\"mt-1 text-sm text-gray-600 dark:text-gray-300\">Messen Sie Retrieval-, Kontext- und Antwortqualität separat, damit Fehler lokalisiert werden können.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-95\">Häufige Missverständnisse\u003C\u002Fh2>\n\u003Cdiv class=\"overflow-x-auto\">\u003Ctable class=\"w-full border-collapse\">\u003Cthead>\u003Ctr>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Missverständnis\u003C\u002Fth>\u003Cth class=\"border border-gray-300 px-4 py-2 text-left font-semibold\">Korrektur\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Ein Embedding ist eine Vektordatenbank.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ein Embedding ist eine Repräsentation; die Datenbank\u002Fder Index speichert und durchsucht Repräsentationen.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Eine Vektordatenbank erzeugt semantische Bedeutung.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Das Embedding-Modell erzeugt die Repräsentation; das Vektorsystem indiziert und vergleicht sie.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„RAG erfordert eine Vektordatenbank.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">RAG erfordert Retrieval, nicht eine bestimmte Retrieval-Technologie.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Reranking ist dasselbe wie Vektorsuche.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Vektorsuche generiert Kandidaten; Reranking ordnet eine Kandidatenmenge neu.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Reranker beheben schlechten Recall.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sie können ein Dokument nicht hochstufen, das nie abgerufen wurde.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Dense Search ersetzt BM25.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Lexikalische Suche bleibt wertvoll für exakte Begriffe, Identifikatoren und spezialisiertes Vokabular.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Höhere Ähnlichkeit bedeutet mehr Autorität.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Ähnlichkeit und Quellenautorität sind unterschiedliche Dimensionen.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Mehr Top-k verbessert RAG immer.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Größere Kandidatenmengen können den Recall verbessern, aber Latenz, Rauschen und Kontextauswahlaufwand erhöhen.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Ein Score-Schwellenwert funktioniert überall.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Scores hängen von Modell, Abfrage, Korpus und Retrieval-Methode ab und müssen kalibriert werden.\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd class=\"border border-gray-300 px-4 py-2\">„Eine dedizierte Vektordatenbank ist immer fortschrittlicher.“\u003C\u002Ftd>\u003Ctd class=\"border border-gray-300 px-4 py-2\">Sie ist nur gerechtfertigt, wenn ihre operativen und Retrieval-Fähigkeiten den Anforderungen entsprechen.\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003C\u002Fdiv>\n\u003Ch2 id=\"section-97\">Randfälle und Einschränkungen\u003C\u002Fh2>\n\u003Cp>Einige Anwendungen benötigen keine semantische Suche. Exakte Datenbank-Lookups oder strukturiertes SQL können korrekter, schneller und leichter auditierbar sein als Embedding-Retrieval.\u003C\u002Fp>\n\u003Cp>Einige Korpora sind so klein, dass ein vollständiger Vektor-Scan akzeptabel ist. Approximative Indizierung fügt Komplexität ohne nennenswerten Nutzen hinzu.\u003C\u002Fp>\n\u003Cp>Einige Abfragen erfordern hohen Recall vor jeglicher Präzisionsoptimierung. Rechtliche Discovery, Forschung und Compliance-Prüfung bevorzugen möglicherweise breiten Kandidatenabruf gefolgt von transparenter Filterung und menschlicher Überprüfung.\u003C\u002Fp>\n\u003Cp>Mehrsprachiges und domänenspezifisches Retrieval kann sich über Embedding-Modelle hinweg sehr unterschiedlich verhalten. Benchmark-Behauptungen aus öffentlichen Datensätzen sollten nicht als Beweis für einen privaten Korpus behandelt werden.\u003C\u002Fp>\n\u003Cp>Die Reranking-Latenz wächst mit Anzahl und Länge der Kandidaten. Die Kandidatengröße sollte daher als Genauigkeits-\u002FKosten-\u002FLatenz-Variable optimiert und nicht aus einem Tutorial kopiert werden.\u003C\u002Fp>\n\u003Ch2 id=\"section-103\">Was würde diese Antwort ändern?\u003C\u002Fh2>\n\u003Cp>Die Komponentengrenzen würden sich nicht ändern, wenn ein Anbieter Embedding-Generierung, Vektorindizierung und Reranking hinter einer API bündelt. Das Produkt mag die Stufen verbergen, aber sie bleiben konzeptionell unterschiedliche Verantwortlichkeiten mit unterschiedlichen Fehlermodi.\u003C\u002Fp>\n\u003Cp>Zukünftige Embedding- oder Retrieval-Modelle könnten den Bedarf an separatem Reranking in einigen Arbeitslasten verringern, während stärkere Late-Interaction- oder gelernte Sparse-Methoden traditionelle Dense-\u002FLexikalisch-Kategorien verwischen können. Die Architektur sollte dennoch fragen, welche Stufe Repräsentationen erzeugt, welche Stufe Kandidaten generiert und welche Stufe das Ranking verfeinert.\u003C\u002Fp>\n\u003Cp>Das beste Design ändert sich auch mit Korpusgröße, Abfragemix, Sprache, Domänenterminologie, Aktualisierungsfrequenz, Quellenautorität, Latenzbudget und Evaluierungsergebnissen.\u003C\u002Fp>\n\u003Ch2 id=\"section-107\">Verwandtes kanonisches Wissen\u003C\u002Fh2>\n\u003Cp>R01 setzt voraus, dass das grundlegende RAG-Konzept bereits verstanden ist. RAG ist das übergeordnete Muster, bei dem abgerufene externe Informationen einem Modell zugeführt werden; Embeddings, Vektorsuche und Reranking sind optionale Retrieval-Komponenten innerhalb dieses Musters.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">Was ist RAG? Die einfachste Erklärung, wie es funktioniert\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Eine verständliche Grundlage dafür, wie Retrieval externes Wissen in den Modellkontext einbringt.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Die RAG-Grundlagen lesen →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Cp>Wenn das Retrieval fehlschlägt, diagnostizieren Sie Quellenabdeckung, Retrieval, Ranking, Kontextzusammenstellung und Generierung getrennt, anstatt das gesamte System als einen einzigen „RAG-Fehler“ zu behandeln.\u003C\u002Fp>\n\u003Caside class=\"editorjs-referral my-6\">\u003Ca href=\"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method\" class=\"flex flex-col sm:flex-row gap-4 rounded-xl border border-gray-200 dark:border-gray-700 p-4 transition hover:border-primary-500\">\u003Cdiv class=\"min-w-0 flex-1\">\u003Cstrong class=\"block text-lg text-gray-900 dark:text-gray-100\">RAG fehlgeschlagen — aber welche Ebene ist tatsächlich fehlgeschlagen? Eine diagnostische Methode\u003C\u002Fstrong>\u003Cp class=\"mt-2 text-sm text-gray-600 dark:text-gray-300\">Eine schichtweise Methode zur Isolierung von Fehlern bei Quellenabdeckung, Retrieval, Ranking, Kontextzusammenstellung, Generierung, Evidenzzuordnung und Aktualität.\u003C\u002Fp>\u003Cspan class=\"mt-3 inline-flex text-sm font-medium text-primary-600 dark:text-primary-400\">Die RAG-Diagnosemethode lesen →\u003C\u002Fspan>\u003C\u002Fdiv>\u003C\u002Fa>\u003C\u002Faside>\n\u003Cp>Die Source-of-Truth-Architektur ist die Autoritätsschicht rund um das Retrieval: Sie entscheidet, welche Quelle eine Aussage belegen kann, während Embeddings und Ranking nur entscheiden, welche Kandidaten relevant erscheinen.\u003C\u002Fp>\n\u003Ch2 id=\"section-113\">Häufig gestellte Fragen\u003C\u002Fh2>\n\u003Csection class=\"editorjs-faq my-6 rounded-xl border border-gray-200 p-5 dark:border-gray-700\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Embeddings, Vektordatenbanken und Reranking\u003C\u002Fh3>\u003Cdiv id=\"faq1\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Was ist der Unterschied zwischen Embeddings und einer Vektordatenbank?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Embeddings sind numerische Darstellungen, die von einem Modell erzeugt werden. Eine Vektordatenbank oder ein Vektorindex speichert und durchsucht diese Darstellungen zusammen mit IDs und Metadaten.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq2\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Was macht ein Reranker?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Ein Reranker nimmt eine bereits abgerufene Kandidatenmenge und bewertet oder ordnet diese Kandidaten mithilfe eines stärkeren Relevanzmodells oder einer Bewertungsmethode neu.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq3\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Erfordert RAG eine Vektordatenbank?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nein. RAG erfordert den Abruf externer Informationen. Der Abruf kann lexikalische Suche, SQL, APIs, Graphen, Vektorsuche, hybride Suche oder Kombinationen davon verwenden.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq4\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Warum nicht den Reranker auf den gesamten Korpus anwenden?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Reranker führen häufig eine teurere Query-Dokument-Interaktion durch, weshalb sie normalerweise auf eine kleine Top-k-Kandidatenmenge nach einem schnelleren Erststufen-Retriever angewendet werden.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq5\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Kann Reranking ein fehlendes Dokument beheben?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nein. Wenn das relevante Dokument nicht in die Kandidatenmenge abgerufen wurde, hat das Reranking nichts, was es nach vorne bringen könnte.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq6\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Ist die Kosinusähnlichkeit eine Relevanzwahrscheinlichkeit?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Nein. Sie ist ein Ähnlichkeitsmaß, dessen numerische Bedeutung vom Embedding-Modell und Korpus abhängt. Sie sollte nicht als universelle Wahrscheinlichkeit der Relevanz behandelt werden.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq7\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Sollte ich BM25 und Vektorsuche zusammen verwenden?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Verwenden Sie hybrides Retrieval, wenn die Evaluierung zeigt, dass lexikalische und semantische Signale komplementäre relevante Dokumente auffinden. Es ist nicht automatisch für jeden Korpus besser.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003Cdiv id=\"faq8\" class=\"border-t border-gray-200 py-4 first:border-t-0 dark:border-gray-700\">\u003Ch4 class=\"font-semibold text-gray-900 dark:text-gray-100\">Wann brauche ich eine dedizierte Vektordatenbank?\u003C\u002Fh4>\u003Cdiv class=\"mt-2 text-gray-600 dark:text-gray-300\">Wenn Vektorindizierung, Filterung, Skalierung, Aktualisierungen, verteilter Betrieb oder andere vektorspezifische Anforderungen ein spezialisiertes System rechtfertigen. Kleine Arbeitslasten benötigen möglicherweise keine.\u003C\u002Fdiv>\u003C\u002Fdiv>\u003C\u002Fsection>\n\u003Ch2 id=\"section-115\">Glossar\u003C\u002Fh2>\n\u003Csection class=\"editorjs-glossary my-6 rounded-xl border border-gray-200 dark:border-gray-700 p-5\">\u003Ch3 class=\"mb-3 text-lg font-semibold\">Wichtige Retrieval-Begriffe\u003C\u002Fh3>\u003Cdl>\u003Cdiv id=\"embedding\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Embedding\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Eine numerische Darstellung von Inhalten, die von einem Embedding-Modell für Ähnlichkeit, Clustering, Retrieval oder verwandte Aufgaben erzeugt wird.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"dense-vector\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Dichter Vektor\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Eine Vektordarstellung, bei der viele Dimensionen Werte ungleich null tragen, die üblicherweise im semantischen Retrieval verwendet wird.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"sparse-vector\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Sparse-Vektor\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Eine hochdimensionale Darstellung, bei der die meisten Dimensionen null sind und die oft eine stärkere token- oder termähnliche Struktur bewahrt.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"vector-index\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Vektorindex\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Eine Datenstruktur, die Vektoren für effizientes Ähnlichkeits- oder Nächste-Nachbarn-Retrieval organisiert.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"vector-database\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Vektordatenbank\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Ein Speicher-\u002FSuchsystem, das dafür ausgelegt ist, Vektoren, zugehörige Metadaten und Vektor-Retrieval-Arbeitslasten zu verwalten.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"ann\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">ANN\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Approximate Nearest Neighbor Search, die exakten erschöpfenden Vergleich gegen schnelleres Retrieval in großem Maßstab eintauscht.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"hnsw\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">HNSW\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Hierarchical Navigable Small World, ein graphbasierter Ansatz zur approximativen Nächste-Nachbarn-Indizierung, der häufig für Vektor-Retrieval verwendet wird.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"bm25\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">BM25\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Eine lexikalische Methode zur Relevanzbewertung, die auf Termvorkommen und Korpusstatistiken basiert und in der Volltextsuche weit verbreitet ist.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"hybrid-search\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Hybride Suche\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Retrieval, das Ergebnisse oder Scores aus mehreren Retrieval-Methoden wie lexikalischer und Vektorsuche kombiniert.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"reranking\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Reranking\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Eine spätere Retrieval-Stufe, die eine bereits erzeugte Kandidatenmenge neu bewertet und neu ordnet.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"bi-encoder\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Bi-Encoder\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Eine Architektur, die Query und Kandidat unabhängig kodiert und dadurch Vorberechnung und skalierbare Ähnlichkeitssuche ermöglicht.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"cross-encoder\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Cross-Encoder\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Ein Modell, das einen Query- und Kandidatentext gemeinsam verarbeitet und oft die Relevanzbeurteilung zu höheren Rechenkosten verbessert.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"recall-at-k\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">Recall@k\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Der Anteil relevanter Elemente, die innerhalb der obersten k abgerufenen Kandidaten gefunden werden.\u003C\u002Fdd>\u003C\u002Fdiv>\u003Cdiv id=\"ndcg\" class=\"border-t border-gray-200 dark:border-gray-700 py-3 first:border-t-0\">\u003Cdt class=\"font-semibold text-gray-900 dark:text-gray-100\">nDCG\u003C\u002Fdt>\u003Cdd class=\"mt-1 text-gray-600 dark:text-gray-300\">Normalized Discounted Cumulative Gain, eine Ranking-Metrik, die relevante Ergebnisse belohnt, die höher in einer geordneten Liste erscheinen.\u003C\u002Fdd>\u003C\u002Fdiv>\u003C\u002Fdl>\u003C\u002Fsection>\n\u003Ch2 id=\"section-117\">Fazit\u003C\u002Fh2>\n\u003Cp>Das klare Retrieval-Modell ist einfach: Embeddings repräsentieren Bedeutung, Vektorsuche ruft Kandidaten ab und Reranker verfeinern die Reihenfolge der Kandidaten.\u003C\u002Fp>\n\u003Cp>Sobald diese Grenzen explizit sind, lassen sich Architekturentscheidungen leichter diagnostizieren. Fehlende Kandidaten deuten auf Quellenabdeckung, Chunking, Embeddings, Filter oder Erststufen-Retrieval hin. Schlechte Reihenfolge deutet auf Ranking, Fusion oder Reranking hin. Falsche endgültige Antworten können dann getrennt auf Kontext- und Generierungsebene untersucht werden.\u003C\u002Fp>\n\u003Cp>Das wichtigste Ergebnis ist nicht die Wahl der modischsten Retrieval-Komponente. Es ist der Aufbau einer Retrieval-Pipeline, deren Stufen, Autoritätsgrenzen, Metriken und Fehlermodi unabhängig gemessen werden können.\u003C\u002Fp>\n\u003Ch2 id=\"section-121\">Primärquellen und Implementierungsnachweise\u003C\u002Fh2>\n\u003Cp>Die folgenden externen Referenzen dokumentieren die in diesem Artikel verwendeten Mechanismen für Repräsentation, Vektorsuche und Reranking. Projektspezifische Abschnitte sind originale Implementierungsnachweise und absichtlich enger gefasst als Aussagen über vollständige Produktionsreife von RAG.\u003C\u002Fp>\n\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F1908.10084\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Grundlegende Arbeit, die unabhängig berechenbare Satz-Embeddings für effiziente semantische Ähnlichkeitssuche demonstriert.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fqdrant.tech\u002Fdocumentation\u002Foverview\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Qdrant — Überblick über Architektur und Datenstruktur\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Offizielle Dokumentation, die Collections, Points, Vektoren, Payload-Metadaten und HNSW-basierte Ähnlichkeitsindizierung beschreibt.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fqdrant.tech\u002Fdocumentation\u002Fsearch\u002Fsearch\u002F\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Qdrant — Suche\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Offizielle Vektorsuchdokumentation zu Ähnlichkeitsabfragen, Filterung, exakter versus approximativer Suche und dichtem\u002Fsparsem Verhalten.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.elastic.co\u002Fdocs\u002Fsolutions\u002Fsearch\u002Fvector\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Elastic — Vektorsuche\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Aktuelle Dokumentation zu dichtem\u002Fsparsem Vektor-Retrieval, lexikalischen\u002FVektor-Kombinationen und mehrstufigen Suchpipelines.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.elastic.co\u002Fdocs\u002Fsolutions\u002Fsearch\u002Franking\u002Fsemantic-reranking\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Elastic — Semantisches Reranking\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Aktuelle Anleitung, die semantisches Reranking als nachgelagerten Relevanzvorgang über eine kleinere Kandidatenmenge definiert.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fdocs.cohere.com\u002Fdocs\u002Freranking-with-cohere\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">Cohere — Reranking mit Cohere\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Aktuelle Dokumentation, die Reranking als zweistufige Verbesserung gegenüber lexikalischer oder semantischer Erststufen-Retrieval zeigt.\u003C\u002Fp>\u003C\u002Fa>\n\u003Ca href=\"https:\u002F\u002Fwww.sqlite.org\u002Ffts5.html\" target=\"_blank\" rel=\"noopener noreferrer\" class=\"editorjs-link-tool block border border-gray-200 dark:border-gray-700 rounded-lg p-4 transition text-gray-900 dark:text-gray-100 hover:border-primary-500 hover:bg-primary-50 dark:hover:bg-gray-900 hover:text-gray-900 dark:hover:text-gray-100\">\u003Cstrong class=\"block font-semibold\">SQLite FTS5\u003C\u002Fstrong>\u003Cp class=\"text-sm text-gray-600 dark:text-gray-400\">Offizielle SQLite-Dokumentation für Volltextsuche und die integrierte BM25-Rangfunktion, die als lexikalischer Retrieval-Nachweis dient.\u003C\u002Fp>\u003C\u002Fa>",{"time":211,"blocks":212,"version":1249},1791480192762,[213,219,227,234,241,249,254,259,264,269,274,279,284,289,315,320,325,330,335,374,379,384,389,394,399,404,409,414,419,424,429,434,439,445,450,455,460,465,470,475,480,485,490,495,500,505,510,515,520,525,530,535,540,569,574,579,584,591,596,601,606,611,616,621,626,631,636,641,646,651,656,661,698,703,708,744,749,754,759,765,770,775,780,785,790,795,800,805,810,836,842,847,878,883,919,924,962,967,972,977,982,987,992,997,1002,1007,1012,1017,1022,1031,1036,1044,1049,1054,1092,1097,1155,1160,1165,1170,1175,1180,1185,1195,1204,1213,1222,1231,1240],{"id":214,"data":215,"type":217,"tunes":218},"intro",{"text":216},"Embeddings, Vektordatenbanken und Reranker sind drei verschiedene Teile des Retrievals. Ein Embedding-Modell wandelt Text oder andere Daten in numerische Repräsentationen um; eine Vektordatenbank oder ein Vektorindex speichert und durchsucht diese Repräsentationen, um Kandidatenelemente abzurufen; ein Reranker nimmt eine kleinere Kandidatenmenge und ordnet sie mithilfe eines teureren Relevanzmodells oder Bewertungsverfahrens neu. Sie treten häufig gemeinsam in RAG auf, aber keines von ihnen ist dasselbe wie RAG, und keines ist in jedem Retrieval-System zwingend erforderlich.","paragraph",{},{"id":220,"data":221,"type":225,"tunes":226},"direct",{"body":222,"title":223,"variant":224},"\u003Cstrong>Embeddings repräsentieren. Vektorsuche ruft ab. Reranking verfeinert.\u003C\u002Fstrong>\u003Cbr>\u003Cbr>Ein nützliches mentales Modell ist:\u003Cbr>\u003Cstrong>Inhalt → Embedding → Kandidatenabruf → Reranking → ausgewählter Kontext → Modell\u003C\u002Fstrong>.\u003Cbr>\u003Cbr>Die Grenzen sind wichtig, weil jede Ebene auf unterschiedliche Weise versagt. Schlechte Embeddings verzerren die semantische Ähnlichkeit. Ein schwacher Retrieval-Index verpasst nützliche Kandidaten. Ein Reranker kann Kandidaten neu ordnen, aber er kann kein relevantes Dokument wiederherstellen, das nie abgerufen wurde.","Direkte Antwort","info","callout",{},{"id":228,"data":229,"type":225,"tunes":233},"boundary",{"body":230,"title":231,"variant":232},"Eine Vektordatenbank ist kein Embedding-Modell. Ein Embedding ist kein Suchergebnis. Ein Reranker ist keine Vektordatenbank. RAG ist das übergeordnete Muster, das jede dieser Komponenten nutzen kann, um externe Informationen vor der Generierung abzurufen.","Den Retrieval-Stack nicht zusammenfallen lassen","warning",{},{"id":235,"data":236,"type":225,"tunes":240},"current",{"body":237,"title":238,"variant":239},"Die grundlegende Architektur ist stabil, auch wenn sich Produkte schnell weiterentwickeln. Die aktuelle Qdrant-Dokumentation trennt Vektoren, Payload-Metadaten, Collections und Vektorindizes; die aktuelle Elastic-Anleitung behandelt semantisches Reranking als eine später im Prozess stattfindende Operation über eine kleine Kandidatenmenge; die aktuelle Cohere-Dokumentation beschreibt Reranking ebenfalls als eine Verbesserung der zweiten Stufe gegenüber lexikalischer oder semantischer Suche.","Hinweis zu aktuellen Quellen — 8. Oktober 2026","note",{},{"id":242,"data":243,"type":247,"tunes":248},"toc",{"title":244,"maxLevel":245,"minLevel":246},"Inhalt",3,2,"tableOfContents",{},{"id":250,"data":251,"type":41,"tunes":253},"h-meaning",{"text":252,"level":246},"Was das wirklich bedeutet",{},{"id":255,"data":256,"type":217,"tunes":258},"p-meaning-1",{"text":257},"Suchsysteme haben zwei konkurrierende Ziele: genügend potenziell relevantes Material finden und das beste Material nahe an die Spitze bringen. Schnelles Retrieval der ersten Stufe optimiert üblicherweise die Kandidatengenerierung. Ein stärkeres Modell der zweiten Stufe kann dann mehr Rechenleistung aufwenden, um die besten Kandidaten zu unterscheiden.",{},{"id":260,"data":261,"type":217,"tunes":263},"p-meaning-2",{"text":262},"Embeddings, Vektorindizes und Reranker nehmen unterschiedliche Positionen in diesem Prozess ein. Sie als ein einziges Feature zu behandeln, verdeckt wichtige Designentscheidungen zu Recall, Precision, Latenz, Speicherung, Metadatenfilterung und Modellkosten.",{},{"id":265,"data":266,"type":217,"tunes":268},"p-meaning-3",{"text":267},"Die Unterscheidung verhindert außerdem einen häufigen RAG-Fehler: anzunehmen, dass das Speichern von Dokument-Embeddings in einer Vektordatenbank automatisch hochwertiges Retrieval erzeugt. Die Retrieval-Qualität hängt vom Embedding-Modell, Chunking, Metadaten, Query-Konstruktion, Indexkonfiguration, Kandidatenanzahl, hybridem Retrieval, Reranking und der Autorität der zugrunde liegenden Quellen ab.",{},{"id":270,"data":271,"type":41,"tunes":273},"h-simple",{"text":272,"level":246},"Das einfachste Beispiel",{},{"id":275,"data":276,"type":217,"tunes":278},"p-simple-1",{"text":277},"Angenommen, eine Wissensdatenbank enthält 100.000 Dokument-Chunks. Ein Benutzer fragt: „Wie widerrufe ich ein API-Token?“",{},{"id":280,"data":281,"type":217,"tunes":283},"p-simple-2",{"text":282},"Zuerst kann ein Embedding-Modell die Anfrage in einen Vektor kodieren. Dokument-Chunks haben möglicherweise bereits ihre eigenen gespeicherten Embeddings. Eine Vektorsuche vergleicht dann den Anfragevektor mit den indexierten Dokumentvektoren und liefert beispielsweise 30 wahrscheinliche Kandidaten.",{},{"id":285,"data":286,"type":217,"tunes":288},"p-simple-3",{"text":287},"Diese 30 Kandidaten können dann an einen Reranker übergeben werden. Der Reranker vergleicht die Anfrage direkter mit jedem Kandidaten und erzeugt eine neue Relevanzreihenfolge. Die Anwendung könnte die besten fünf für den Modellkontext behalten.",{},{"id":290,"data":291,"type":313,"tunes":314},"simple-flow",{"steps":292,"title":311,"orientation":312},[293,296,299,302,305,308],{"label":294,"description":295},"1. Dokumente einbetten","Jeden durchsuchbaren Chunk in eine numerische Repräsentation umwandeln, üblicherweise zum Zeitpunkt der Aufnahme.",{"label":297,"description":298},"2. Vektoren speichern\u002Findexieren","Vektoren mit Dokument-IDs und Metadaten in einem durchsuchbaren Vektorindex oder einer Datenbank verknüpfen.",{"label":300,"description":301},"3. Die Anfrage einbetten","Die Benutzeranfrage mit dem kompatiblen Embedding-Modell und der Abfragekonfiguration kodieren.",{"label":303,"description":304},"4. Kandidaten abrufen","Eine Vektorähnlichkeitssuche ausführen, oft mit Metadatenfiltern, um eine größere Top-k-Kandidatenmenge zu erzeugen.",{"label":306,"description":307},"5. Kandidaten neu ordnen","Ein stärkeres Relevanzmodell auf die Anfrage und die kleine Kandidatenmenge anwenden.",{"label":309,"description":310},"6. Kontext auswählen","Die nützlichsten Passagen für die nachgelagerte Antwort, den Agentenschritt oder das Suchergebnis behalten.","Eine grundlegende zweistufige semantische Retrieval-Pipeline","auto","processFlow",{},{"id":316,"data":317,"type":41,"tunes":319},"h-stops",{"text":318,"level":246},"Wo das einfache Beispiel endet",{},{"id":321,"data":322,"type":217,"tunes":324},"p-stops-1",{"text":323},"Reale Retrieval-Systeme müssen überhaupt keine dichten Embeddings verwenden. Keyword-Suche wie BM25 kann der Retriever der ersten Stufe sein. Sparse Learned Retrieval, SQL-Filter, Graph-Traversierung oder Anwendungs-APIs können ebenfalls Kandidaten erzeugen.",{},{"id":326,"data":327,"type":217,"tunes":329},"p-stops-2",{"text":328},"Ein Reranker kümmert sich auch nicht darum, dass die Kandidaten aus einer Vektordatenbank stammen. Er kann BM25-Ergebnisse, hybride Ergebnisse, handverlesene Dokumente oder Kandidaten aus mehreren Retrievern neu ordnen.",{},{"id":331,"data":332,"type":217,"tunes":334},"p-stops-3",{"text":333},"Ebenso erfordern Embeddings keine spezialisierte Vektordatenbank. Kleine Datensätze können im Speicher oder mit Allzweckdatenbanken und Vektorerweiterungen verglichen werden. Spezialisierte Vektorsysteme werden nützlich, wenn Indexierung, approximative Nächste-Nachbarn-Suche, Filterung, Skalierung, Aktualisierungsverhalten oder betriebliche Anforderungen sie rechtfertigen.",{},{"id":336,"data":337,"type":372,"tunes":373},"core-comparison",{"rows":338,"title":360,"layout":361,"columns":362},[339,344,348,352,356],{"id":340,"label":341,"values":342},"job","Hauptaufgabe",[343,343,343],"",{"id":345,"label":346,"values":347},"input","Typische Eingabe",[343,343,343],{"id":349,"label":350,"values":351},"output","Typische Ausgabe",[343,343,343],{"id":353,"label":354,"values":355},"cost","Kostenprofil",[343,343,343],{"id":357,"label":358,"values":359},"can-miss","Typisches Versagen",[343,343,343],"Drei verschiedene Retrieval-Komponenten","table",[363,366,369],{"id":364,"label":365},"embedding","Embedding",{"id":367,"label":368},"vector","Vektordatenbank \u002F Index",{"id":370,"label":371},"reranker","Reranker","comparison",{},{"id":375,"data":376,"type":41,"tunes":378},"h-embeddings",{"text":377,"level":246},"Embeddings: Repräsentation, nicht Retrieval",{},{"id":380,"data":381,"type":217,"tunes":383},"p-emb-1",{"text":382},"Ein Embedding ist eine numerische Repräsentation, die von einem Modell erzeugt wird. Für semantisches Retrieval sollen Texte mit verwandter Bedeutung nützliche Positionen in einem Vektorraum einnehmen, damit eine Ähnlichkeits- oder Distanzfunktion sie vergleichen kann.",{},{"id":385,"data":386,"type":217,"tunes":388},"p-emb-2",{"text":387},"Sentence-BERT war ein einflussreicher Schritt, um semantische Ähnlichkeit auf Satzebene mit bi-encoder-artigen Repräsentationen praktikabel zu machen, die unabhängig berechnet und effizient verglichen werden können. Die allgemeine Idee bleibt zentral für modernes dichtes Retrieval: Dokumentrepräsentationen vorab berechnen, die Query-Repräsentation zur Suchzeit berechnen und sie dann vergleichen.",{},{"id":390,"data":391,"type":217,"tunes":393},"p-emb-3",{"text":392},"Das Embedding selbst durchsucht keinen Korpus. Es sind Daten, die von einem Embedding-Modell erzeugt werden. Retrieval beginnt, wenn das System die Query-Repräsentation mit gespeicherten Kandidaten vergleicht.",{},{"id":395,"data":396,"type":41,"tunes":398},"h-embedding-model",{"text":397,"level":245},"Das Embedding-Modell definiert den Repräsentationsraum",{},{"id":400,"data":401,"type":217,"tunes":403},"p-emodel-1",{"text":402},"Dokument- und Query-Vektoren müssen mit dem Modell und der Konfiguration kompatibel sein, mit der sie erstellt wurden. Der Austausch eines Embedding-Modells kann Dimensionalität, Ähnlichkeitsverhalten, Sprachabdeckung und Domänenleistung verändern.",{},{"id":405,"data":406,"type":217,"tunes":408},"p-emodel-2",{"text":407},"Deshalb ist eine Embedding-Modell-Migration nicht bloß eine Änderung des API-Namens. Bestehende Dokumente müssen möglicherweise neu eingebettet und der Index neu aufgebaut oder versioniert werden.",{},{"id":410,"data":411,"type":41,"tunes":413},"h-dense-sparse",{"text":412,"level":245},"Dichte und sparse Repräsentationen sind unterschiedlich",{},{"id":415,"data":416,"type":217,"tunes":418},"p-dense-1",{"text":417},"Dichte Embeddings enthalten üblicherweise viele Nicht-Null-Dimensionen und werden häufig für semantische Ähnlichkeit verwendet. Sparse Repräsentationen enthalten viele Nullen und können eine stärkere token- oder termartige Struktur bewahren.",{},{"id":420,"data":421,"type":217,"tunes":423},"p-dense-2",{"text":422},"Beide können semantisches Retrieval unterstützen, und moderne Suchsysteme können dichte, sparse und lexikalische Signale kombinieren. „Vektorsuche“ bedeutet daher nicht immer eine einzige dichte Cosine-Similarity-Pipeline.",{},{"id":425,"data":426,"type":41,"tunes":428},"h-distance",{"text":427,"level":245},"Ähnlichkeitsfunktionen sind Teil des Repräsentationsvertrags",{},{"id":430,"data":431,"type":217,"tunes":433},"p-distance-1",{"text":432},"Cosine-Ähnlichkeit, Skalarprodukt und euklidische Distanz bedeuten nicht dasselbe. Die korrekte Metrik hängt davon ab, wie das Embedding-Modell trainiert und normalisiert wurde.",{},{"id":435,"data":436,"type":217,"tunes":438},"p-distance-2",{"text":437},"Die aktuelle Qdrant-Dokumentation verlangt beispielsweise eine Distanzmetrik als Teil der Vektorkonfiguration und dokumentiert Cosine-, Skalarprodukt- und euklidische Optionen. Die wichtige architektonische Regel ist, die Metrik als Teil des Embedding-\u002FIndex-Vertrags zu behandeln, statt eine willkürlich zu wählen.",{},{"id":440,"data":441,"type":225,"tunes":444},"embedding-not-truth",{"body":442,"title":443,"variant":232},"Zwei Passagen können semantisch nah beieinanderliegen, während eine veraltet, nicht autorisiert oder falsch ist. Embeddings schätzen repräsentative Ähnlichkeit; sie bestimmen nicht die Autorität, Aktualität oder Beweiskraft einer Source of Truth.","Embedding-Ähnlichkeit ist keine faktische Stütze",{},{"id":446,"data":447,"type":41,"tunes":449},"h-vector-db",{"text":448,"level":246},"Vektordatenbanken und Indizes: Kandidaten-Retrieval",{},{"id":451,"data":452,"type":217,"tunes":454},"p-vdb-1",{"text":453},"Eine Vektordatenbank oder ein vektorfähiges Suchsystem organisiert Vektorrepräsentationen so, dass die Anwendung nahegelegene Kandidaten effizient abrufen kann. Praktische Systeme verknüpfen Vektoren üblicherweise mit IDs und Payload-Metadaten wie Quelle, Sprache, Mandant, Dokumenttyp, Zeitstempel oder Zugriffsbereich.",{},{"id":456,"data":457,"type":217,"tunes":459},"p-vdb-2",{"text":458},"Qdrant organisiert Daten beispielsweise in Sammlungen von Punkten, wobei ein Punkt einen Vektor und optionale Payload-Metadaten enthält. Seine Dokumentation beschreibt HNSW-basierte Ähnlichkeitssuche und Metadatenfilterung als separate Fähigkeiten der Retrieval-Schicht.",{},{"id":461,"data":462,"type":217,"tunes":464},"p-vdb-3",{"text":463},"Diese Unterscheidung ist wichtig: Der Vektorindex beantwortet ein Nearest-Neighbor-Problem, während Payload-Filter strukturelle Einschränkungen wie Mandant, Dokumentklasse oder Sprache durchsetzen.",{},{"id":466,"data":467,"type":41,"tunes":469},"h-ann",{"text":468,"level":245},"Approximative Nearest-Neighbor-Suche tauscht Genauigkeit gegen Effizienz",{},{"id":471,"data":472,"type":217,"tunes":474},"p-ann-1",{"text":473},"Der Vergleich eines Query-Vektors mit jedem Vektor kann für kleine Sammlungen praktikabel sein, ist aber bei großem Maßstab teuer. Approximative Nearest-Neighbor-Indizes wie HNSW reduzieren die Suchkosten, indem sie eine Indexstruktur durchlaufen, anstatt jeden Vektor erschöpfend zu scannen.",{},{"id":476,"data":477,"type":217,"tunes":479},"p-ann-2",{"text":478},"Approximative Suche führt zu einem Trade-off zwischen Recall und Latenz. Eine schnellere Suche kann Kandidaten verfehlen, die eine exakte Suche zurückgeben würde. Indexparameter beeinflussen daher die Retrieval-Qualität, nicht nur die Infrastrukturleistung.",{},{"id":481,"data":482,"type":217,"tunes":484},"p-ann-3",{"text":483},"Qdrant stellt sowohl HNSW-bezogene Parameter als auch eine Option für exakte Suche bereit, was verdeutlicht, dass Vektorspeicherung und approximative Retrieval-Strategie separate Entscheidungen sind.",{},{"id":486,"data":487,"type":41,"tunes":489},"h-filtering",{"text":488,"level":245},"Metadaten-Filterung gehört vor oder während der Kandidatenermittlung",{},{"id":491,"data":492,"type":217,"tunes":494},"p-filter-1",{"text":493},"Wenn der Benutzer nur auf Mandant A zugreifen darf, ist es die falsche Sicherheitsgrenze, semantisch ähnliche Chunks von Mandant B abzurufen und zu versuchen, sie später zu entfernen. Autorisierung und harte Eignungsfilter sollten den Kandidatenraum einschränken, bevor diese Kandidaten die nachgelagerte Verarbeitung beeinflussen können.",{},{"id":496,"data":497,"type":217,"tunes":499},"p-filter-2",{"text":498},"Dasselbe Prinzip gilt für Locale, Dokumentstatus, Quellklasse, Datum, Produktversion und andere deterministische Einschränkungen. Ähnlichkeit sollte berechtigte Kandidaten ranken; sie sollte die Berechtigung nicht außer Kraft setzen.",{},{"id":501,"data":502,"type":41,"tunes":504},"h-vector-not-required",{"text":503,"level":245},"Eine Vektordatenbank ist optional",{},{"id":506,"data":507,"type":217,"tunes":509},"p-optional-1",{"text":508},"Für einen kleinen Korpus kann ein Brute-Force-Cosine-Vergleich einfach und ausreichend sein. Eine relationale Datenbank mit Vektorunterstützung kann ebenfalls ausreichen. Eine dedizierte Vektordatenbank wird wertvoll, wenn ihre Indizierung, Filterung, verteilte Speicherung, Aktualisierungsverhalten oder betriebliche Funktionen eine echte Anforderung erfüllen.",{},{"id":511,"data":512,"type":217,"tunes":514},"p-optional-2",{"text":513},"Eine Vektordatenbank zu wählen, weil „RAG eine braucht“, kehrt den Architekturprozess um. Beginnen Sie mit den Retrieval-Anforderungen und dem Maßstab und wählen Sie dann die Speicher-\u002FIndextechnologie aus.",{},{"id":516,"data":517,"type":41,"tunes":519},"h-rerank",{"text":518,"level":246},"Reranking: Relevanzverfeinerung in der zweiten Stufe",{},{"id":521,"data":522,"type":217,"tunes":524},"p-rerank-1",{"text":523},"Ein Reranker erhält eine Query und eine kleinere Menge bereits abgerufener Kandidaten und weist dann stärkere Relevanzbewertungen oder eine neue Reihenfolge zu. Er ist normalerweise rechenintensiver als das Retrieval der ersten Stufe, weshalb er nach der Kandidatengenerierung und nicht auf den gesamten Korpus angewendet wird.",{},{"id":526,"data":527,"type":217,"tunes":529},"p-rerank-2",{"text":528},"Die aktuelle Elastic-Empfehlung beschreibt semantisches Reranking als eine Technik der letzten Stufe über eine kleine Top-k-Menge und merkt an, dass sie lexikalisches, semantisches oder hybrides Retrieval verfeinern kann. Cohere dokumentiert dieselbe Architektur: lexikalische oder semantische Suche in der ersten Stufe, gefolgt von einer Reranking-Stufe.",{},{"id":531,"data":532,"type":217,"tunes":534},"p-rerank-3",{"text":533},"Eine übliche Implementierung verwendet ein Cross-Encoder-ähnliches Modell, das die Query und jeden Kandidaten gemeinsam untersucht. Diese reichhaltigere Interaktion kann Relevanz präziser unterscheiden als unabhängige Embedding-Ähnlichkeit, ist aber im Korpusmaßstab deutlich teurer.",{},{"id":536,"data":537,"type":41,"tunes":539},"h-bi-cross",{"text":538,"level":245},"Bi-Encoder-Retrieval und Cross-Encoder-Reranking lösen unterschiedliche Kostenprobleme",{},{"id":541,"data":542,"type":361,"tunes":568},"encoder-table",{"content":543,"stretched":42,"withHeadings":13},[544,548,552,556,560,564],[545,546,547],"Eigenschaft","Bi-Encoder-\u002FEmbedding-Retrieval","Cross-Encoder-artiges Reranking",[549,550,551],"Kodierung","Query und Dokumente unabhängig repräsentiert","Query und Kandidat gemeinsam verarbeitet",[553,554,555],"Dokumentberechnung","Kann bei der Aufnahme vorab berechnet werden","Wird normalerweise pro Query-Kandidat-Paar neu berechnet",[557,558,559],"Suche im Korpusmaßstab","Geeignet mit Vektorindizes","Üblicherweise zu teuer über den gesamten Korpus",[561,562,563],"Typische Rolle","Kandidatengenerierung mit hohem Recall","Hochpräzise Reihenfolge einer kleinen Kandidatenmenge",[565,566,567],"Haupt-Trade-off","Schnell und skalierbar, aber Relevanzinteraktion wird in Vektoren komprimiert","Reichhaltigere Relevanzbeurteilung, aber höhere Latenz\u002FKosten",{},{"id":570,"data":571,"type":41,"tunes":573},"h-rerank-limit",{"text":572,"level":245},"Ein Reranker kann nicht wiederherstellen, was das Retrieval verpasst hat",{},{"id":575,"data":576,"type":217,"tunes":578},"p-rerank-limit-1",{"text":577},"Wenn das relevante Dokument im Kandidatensatz fehlt, hat das Reranking nichts zu befördern. Dies ist der zentrale Grund, Retrieval und Reranking getrennt zu evaluieren.",{},{"id":580,"data":581,"type":217,"tunes":583},"p-rerank-limit-2",{"text":582},"Eine Pipeline kann eine hervorragende Reranker-Präzision aufweisen und dennoch scheitern, weil der Recall der ersten Stufe schlecht ist. Eine Verbesserung der Reranker-Qualität wird fehlende Quellenabdeckung, schlechtes Chunking, restriktive Filter oder einen schwachen Kandidaten-Retriever nicht beheben.",{},{"id":585,"data":586,"type":225,"tunes":590},"recall-precision",{"body":587,"title":588,"variant":589},"Erste Stufe: \u003Cstrong>die nützlichen Kandidaten nicht verpassen.\u003C\u002Fstrong>\u003Cbr>Zweite Stufe: \u003Cstrong>die besten Kandidaten zuerst platzieren.\u003C\u002Fstrong>\u003Cbr>\u003Cbr>Dies ist keine universelle mathematische Regel, aber ein nützliches Ingenieurmodell für zweistufiges Retrieval.","Nützliches Retrieval-Ziel","success",{},{"id":592,"data":593,"type":41,"tunes":595},"h-hybrid",{"text":594,"level":246},"Hybrides Retrieval ist eine separate Designentscheidung",{},{"id":597,"data":598,"type":217,"tunes":600},"p-hybrid-1",{"text":599},"Dichtes semantisches Retrieval ist stark, wenn Anfrage und Dokument unterschiedliche Formulierungen verwenden, aber verwandte Bedeutung ausdrücken. Lexikalisches Retrieval ist stark, wenn exakte Begriffe, Identifikatoren, Namen, Codes oder seltene Phrasen wichtig sind.",{},{"id":602,"data":603,"type":217,"tunes":605},"p-hybrid-2",{"text":604},"Hybrides Retrieval kombiniert mehrere Kandidatensignale, oft lexikalisches BM25 und Vektorähnlichkeit, und führt die Ranglisten dann mit einer Methode wie Reciprocal Rank Fusion oder einer gewichteten Score-Kombination zusammen.",{},{"id":607,"data":608,"type":217,"tunes":610},"p-hybrid-3",{"text":609},"Das Reranking kann dann auf dem fusionierten Kandidatensatz arbeiten. Hybrides Retrieval und Reranking sind daher komplementäre, aber unterschiedliche Stufen.",{},{"id":612,"data":613,"type":41,"tunes":615},"h-bm25",{"text":614,"level":245},"BM25 ist nicht obsolet, nur weil Embeddings existieren",{},{"id":617,"data":618,"type":217,"tunes":620},"p-bm25-1",{"text":619},"Die Keyword-Suche kann bei exakten Identifikatoren, Versionsnummern, Fehlermeldungen, Produktcodes und spezialisiertem Vokabular das dichte Retrieval übertreffen. SQLite FTS5 enthält beispielsweise eine BM25-Rangfolgefunktion für die Volltextsuche.",{},{"id":622,"data":623,"type":217,"tunes":625},"p-bm25-2",{"text":624},"Eine starke Retrieval-Architektur kann lexikalisches Retrieval als einzige erste Stufe, Vektor-Retrieval als einzige erste Stufe verwenden oder beides kombinieren, je nach Korpus und Anfrageverteilung.",{},{"id":627,"data":628,"type":41,"tunes":630},"h-chunking",{"text":629,"level":246},"Chunking verändert, was Embeddings und Reranker sehen können",{},{"id":632,"data":633,"type":217,"tunes":635},"p-chunk-1",{"text":634},"Wenn ein Dokument schlecht aufgeteilt wird, kann keine spätere Retrieval-Komponente die fehlende semantische Einheit vollständig rekonstruieren. Ein Chunk, der eine Bedingung von ihrer Ausnahme trennt, kann irreführend eingebettet werden und auch falsch gererankt werden, weil der Kandidatentext unvollständig ist.",{},{"id":637,"data":638,"type":217,"tunes":640},"p-chunk-2",{"text":639},"Chunk-Größe, Überlappung, strukturelle Grenzen und Metadaten beeinflussen daher sowohl den Kandidaten-Recall als auch das Reranker-Urteil. Die Retrieval-Evaluierung sollte die vollständige Pipeline von der Ingestion bis zum Ranking testen, nicht nur das Embedding-Modell.",{},{"id":642,"data":643,"type":41,"tunes":645},"h-scores",{"text":644,"level":246},"Vergleichen Sie Retrieval-Scores nicht, als wären sie universelle Wahrscheinlichkeiten",{},{"id":647,"data":648,"type":217,"tunes":650},"p-scores-1",{"text":649},"Kosinus-Ähnlichkeit, BM25-Scores, Sparse-Vektor-Scores, RRF-Ränge und Reranker-Scores haben unterschiedliche Bedeutungen. Ein Score von 0,82 von einem Embedding-Modell ist nicht automatisch mit 0,82 von einem anderen Modell oder mit einem Reranker-Score vergleichbar.",{},{"id":652,"data":653,"type":217,"tunes":655},"p-scores-2",{"text":654},"Schwellenwerte sollten für das tatsächliche Modell, den Korpus und die Aufgabe kalibriert werden. Die aktuelle Elastic-Richtlinie weist auch darauf hin, dass Embedding-Ähnlichkeitswerte anfrageabhängig sein können, was universelle Grenzwerte riskant macht.",{},{"id":657,"data":658,"type":41,"tunes":660},"h-eval",{"text":659,"level":246},"Evaluieren Sie Retrieval-Stufen getrennt",{},{"id":662,"data":663,"type":361,"tunes":697},"eval-table",{"content":664,"stretched":42,"withHeadings":13},[665,669,673,677,681,685,689,693],[666,667,668],"Ebene","Nützliche Frage","Beispielmetrik oder Test",[670,671,672],"Quellenabdeckung","Enthält der Korpus die benötigten Informationen?","Abdeckungsaudit \u002F Quellensatz mit bekannten Antworten",[674,675,676],"Chunking","Ist der benötigte Beleg als kohärente Einheit abrufbar?","Überprüfung der Unterstützung auf Chunk-Ebene",[678,679,680],"Retrieval der ersten Stufe","Gelangt das relevante Element in den Kandidatensatz?","Recall@k",[682,683,684],"Ranking","Wie hoch erscheint relevanter Beleg?","MRR, nDCG, Precision@k",[686,687,688],"Reranking","Verbessert die Bewertung der zweiten Stufe die Reihenfolge?","Delta nDCG \u002F MRR \u002F Precision",[690,691,692],"Kontextauswahl","Enthalten die endgültig ausgewählten Passagen ausreichende Unterstützung?","Kontextrelevanz \u002F Abdeckung",[694,695,696],"Antwortstufe","Verwendet das Modell den ausgewählten Beleg korrekt?","Treue \u002F Claim-Evidence-Evaluierung",{},{"id":699,"data":700,"type":217,"tunes":702},"p-eval-1",{"text":701},"Diese Trennung ist operativ wichtig. Wenn Recall@50 schlecht ist, ist der Reranker nicht die erste Komponente, die behoben werden muss. Wenn Recall@50 stark ist, aber die beste Passage auf Rang 38 bleibt, wird Reranking oder Ranking-Fusion zu einem plausiblen Ziel.",{},{"id":704,"data":705,"type":41,"tunes":707},"h-failure-map",{"text":706,"level":246},"Welche Ebene ist tatsächlich ausgefallen?",{},{"id":709,"data":710,"type":372,"tunes":743},"failure-comparison",{"rows":711,"title":732,"layout":361,"columns":733},[712,716,720,724,728],{"id":713,"label":714,"values":715},"missed","Relevantes Dokument erscheint nie",[343,343,343],{"id":717,"label":718,"values":719},"lowrank","Relevantes Dokument erscheint zu niedrig",[343,343,343],{"id":721,"label":722,"values":723},"wrongtenant","Semantisch gut, aber verbotenes Ergebnis",[343,343,343],{"id":725,"label":726,"values":727},"stale","Relevantes, aber veraltetes Ergebnis",[343,343,343],{"id":729,"label":730,"values":731},"context","Korrektes Ergebnis abgerufen, aber aus dem Prompt weggelassen",[343,343,343],"Symptome und wahrscheinliche Retrieval-Ebene",[734,737,740],{"id":735,"label":736},"symptom","Beobachtetes Symptom",{"id":738,"label":739},"likely","Wahrscheinliche Ebene",{"id":741,"label":742},"test","Erste Diagnose",{},{"id":745,"data":746,"type":41,"tunes":748},"h-authority",{"text":747,"level":246},"Relevanz und Quelle der Wahrheit sind verschieden",{},{"id":750,"data":751,"type":217,"tunes":753},"p-authority-1",{"text":752},"Ein Reranker kann ein veraltetes Dokument extrem relevant erscheinen lassen. Ein Vektorindex kann eine sekundäre Zusammenfassung abrufen, die semantisch näher liegt als die Primärquelle. Retrieval-Qualität kann daher keine Autoritätsregeln ersetzen.",{},{"id":755,"data":756,"type":217,"tunes":758},"p-authority-2",{"text":757},"Wo Quellenautorität wichtig ist, sollten Metadatenfilter, Quellenklassen, Versionsregeln und Provenienz das Retrieval einschränken, bevor das Ergebnis zum Modellkontext wird.",{},{"id":760,"data":761,"type":225,"tunes":764},"authority-callout",{"body":762,"title":763,"variant":232},"Relevanz beantwortet, ob ein Kandidat zur Anfrage passt. Source-of-Truth-Architektur beantwortet, ob dieser Kandidat die Behauptung belegen darf.","Reranking kann eine nicht-autoritative Quelle nicht autoritativ machen",{},{"id":766,"data":767,"type":41,"tunes":769},"h-impl",{"text":768,"level":246},"Belege aus der ursprünglichen Implementierung",{},{"id":771,"data":772,"type":41,"tunes":774},"h-sot-engine",{"text":773,"level":245},"Source of Truth Research Engine: lexikalisches und semantisches Retrieval sind getrennt",{},{"id":776,"data":777,"type":217,"tunes":779},"p-sot-1",{"text":778},"Die Source of Truth Research Engine enthält einen lokalen lexikalischen Retrieval-Pfad mit SQLite FTS5\u002FBM25 und einen separaten optionalen semantischen Retrieval-Pfad mit lokal generierten Embeddings.",{},{"id":781,"data":782,"type":217,"tunes":784},"p-sot-2",{"text":783},"Ihre semantische Suchimplementierung berechnet einen Query-Vektor und vergleicht ihn mit gespeicherten Chunk-Vektoren mittels Kosinus-Ähnlichkeit. Das Projekt behandelt semantische Ähnlichkeit bewusst als Entdeckungssignal und nicht als Beweis: Ein Kandidat muss immer noch auf eine konkrete Quelle und einen Locator zurückverfolgt werden, bevor er eine Behauptung stützt.",{},{"id":786,"data":787,"type":217,"tunes":789},"p-sot-3",{"text":788},"Dies ist nützlicher Implementierungsbeleg für R01, weil derselbe Korpus lexikalisches Ranking und Vektorähnlichkeit unterstützen kann, ohne einen der beiden Mechanismen mit evidentieller Autorität zu verwechseln.",{},{"id":791,"data":792,"type":41,"tunes":794},"h-client",{"text":793,"level":245},"Aaasaasa AI Client: Qdrant ist eine Vektorinfrastrukturkomponente",{},{"id":796,"data":797,"type":217,"tunes":799},"p-client-1",{"text":798},"Der Aaasaasa AI Client enthält Qdrant\u002FVektorinfrastruktur als separate lokale Ressource. Die Electron-Architektur stellt Qdrant-Dienste von der vertrauenswürdigen Main-Process-Seite bereit, anstatt Vektorsuche als Teil des Modells selbst zu behandeln.",{},{"id":801,"data":802,"type":217,"tunes":804},"p-client-2",{"text":803},"Das Repository enthält einen Qdrant-Client-Adapter, Qdrant-Dienstkonfiguration und Docker-basierte Qdrant-Infrastruktur. Dies demonstriert die architektonische Trennung zwischen KI-Anbieter-\u002FModellausführung und Vektorspeicherung\u002F-suche.",{},{"id":806,"data":807,"type":217,"tunes":809},"p-client-3",{"text":808},"Die Existenz von Qdrant-Unterstützung sollte nicht als vollständige Produktions-RAG-Pipeline überbewertet werden. Der Beleg hier ist enger: Vektorinfrastruktur ist als eigene Komponentengrenze implementiert.",{},{"id":811,"data":812,"type":361,"tunes":835},"impl-table",{"content":813,"stretched":42,"withHeadings":13},[814,817,820,823,826,829,832],[815,816],"Implementierungsbeleg","Was er demonstriert",[818,819],"SQLite FTS5\u002FBM25 in Source of Truth Research Engine","Lexikalisches Retrieval kann unabhängig von Embeddings existieren.",[821,822],"Lokale Ollama-Embeddings","Repräsentationsgenerierung ist eine eigene Stufe.",[824,825],"Gespeicherte semantische Vektoren + Kosinusvergleich","Semantisches Retrieval konsumiert Embeddings, nachdem sie erzeugt wurden.",[827,828],"Qdrant-Unterstützung im Aaasaasa AI Client","Vektorspeicherung\u002F-suche ist eine Infrastrukturfähigkeit, die vom Modellanbieter getrennt ist.",[830,831],"Evidenz-\u002FProvenienzregeln in Source of Truth Research Engine","Abgerufene Ähnlichkeit ist nicht gleich Autorität oder Beweis.",[833,834],"Kein behaupteter benutzerdefinierter Reranker in diesen Implementierungen","Reranking wird als architektonische Stufe erklärt, nicht fälschlich als bereits implementierter Beleg behauptet.",{},{"id":837,"data":838,"type":225,"tunes":841},"impl-discipline",{"body":839,"title":840,"variant":239},"Die aktuellen Implementierungsbelege bestätigen lexikalisches Retrieval, Embeddings, Vektorsuchinfrastruktur und provenienzbewusstes Retrieval. Dieser Artikel behauptet \u003Cstrong>nicht\u003C\u002Fstrong>, dass ein Produktions-Cross-Encoder-Reranking-Dienst bereits in diesen Projekten implementiert ist.","Evidenzgrenze",{},{"id":843,"data":844,"type":41,"tunes":846},"h-decisions",{"text":845,"level":246},"Wann benötigen Sie welche Komponente?",{},{"id":848,"data":849,"type":361,"tunes":877},"decision-table",{"content":850,"stretched":42,"withHeadings":13},[851,854,857,860,863,866,868,871,874],[852,853],"Bedarf","Wahrscheinliche Komponente",[855,856],"Semantische Ähnlichkeit über unterschiedliche Formulierungen hinweg","Embedding-Modell + Vektorähnlichkeitssuche",[858,859],"Effiziente Suche über einen großen Vektorkorpus","Vektorindex\u002F-datenbank oder vektorfähige Suchmaschine",[861,862],"Exakte Identifikatoren, Fehlercodes oder seltene Begriffe","Lexikalischer\u002FVolltext-Abruf wie BM25",[864,865],"Sowohl exakte Terminologie als auch semantische Bedeutung","Hybrider lexikalischer + semantischer Abruf",[867,371],"Kandidatenmenge ist gut, aber die Reihenfolge ist schwach",[869,870],"Relevante Elemente fehlen in der Kandidatenmenge","Verbessern Sie Quellenabdeckung, Chunking, Retriever, Filter oder Kandidatenanzahl vor dem Reranking",[872,873],"Harte Mandanten-\u002FQuellen-\u002FVersionsbeschränkungen","Deterministische Metadaten-\u002FAutorisierungsfilterung",[875,876],"Kleiner Korpus","Potenziell einfache Brute-Force-Ähnlichkeit oder Allzweckdatenbank statt dedizierter Vektordatenbank",{},{"id":879,"data":880,"type":41,"tunes":882},"h-sequence",{"text":881,"level":246},"Eine praktische Abfolge für das Retrieval-Design",{},{"id":884,"data":885,"type":313,"tunes":918},"design-flow",{"steps":886,"title":917,"orientation":312},[887,890,893,896,899,902,905,908,911,914],{"label":888,"description":889},"1. Definieren Sie die Abfragetypen","Identifizieren Sie semantische Fragen, exakte Lookups, Identifikatoren, Aktuellzustands-Lesevorgänge und domänenspezifische Muster.",{"label":891,"description":892},"2. Definieren Sie zulässige Quellen","Wenden Sie Mandanten-, Autorisierungs-, Locale-, Versions-, Quellenklassen- und Aktualitätsbeschränkungen an.",{"label":894,"description":895},"3. Etablieren Sie eine lexikalische Baseline","Messen Sie, ob einfacher Volltext-\u002FBM25-Abruf bereits einen Großteil der Arbeitslast löst.",{"label":897,"description":898},"4. Fügen Sie Embeddings hinzu, wo semantischer Recall benötigt wird","Wählen und bewerten Sie ein Embedding-Modell anhand repräsentativer Domänenabfragen.",{"label":900,"description":901},"5. Wählen Sie Vektorspeicherung\u002F-indizierung basierend auf der Skalierung","Verwenden Sie Brute Force, Datenbank-Vektorunterstützung oder eine dedizierte Vektor-Engine entsprechend den Anforderungen.",{"label":903,"description":904},"6. Bewerten Sie den Recall der ersten Stufe","Bestätigen Sie, dass relevante Evidenz in eine ausreichend große Kandidatenmenge gelangt.",{"label":906,"description":907},"7. Fügen Sie hybrides Retrieval hinzu, wenn die Signale komplementär sind","Fusionieren Sie lexikalische und semantische Rankings, wenn beide die Kandidatengenerierung wesentlich verbessern.",{"label":909,"description":910},"8. Fügen Sie Reranking hinzu, wenn die Reihenfolge der Engpass bleibt","Wenden Sie das stärkere Modell nur auf die Kandidatenmenge an, wo seine Kosten gerechtfertigt sind.",{"label":912,"description":913},"9. Optimieren Sie die endgültige Kontextauswahl","Steuern Sie Redundanz, Kontextbudget, Autorität, Diversität und Evidenzabdeckung vor der Generierung.",{"label":915,"description":916},"10. Bewerten Sie End-to-End","Messen Sie Retrieval-, Kontext- und Antwortqualität separat, damit Fehler lokalisiert werden können.","Entwerfen Sie das Retrieval aus den Anforderungen, nicht aus Produktnamen",{},{"id":920,"data":921,"type":41,"tunes":923},"h-misconceptions",{"text":922,"level":246},"Häufige Missverständnisse",{},{"id":925,"data":926,"type":361,"tunes":961},"misconceptions-table",{"content":927,"stretched":42,"withHeadings":13},[928,931,934,937,940,943,946,949,952,955,958],[929,930],"Missverständnis","Korrektur",[932,933],"„Ein Embedding ist eine Vektordatenbank.“","Ein Embedding ist eine Repräsentation; die Datenbank\u002Fder Index speichert und durchsucht Repräsentationen.",[935,936],"„Eine Vektordatenbank erzeugt semantische Bedeutung.“","Das Embedding-Modell erzeugt die Repräsentation; das Vektorsystem indiziert und vergleicht sie.",[938,939],"„RAG erfordert eine Vektordatenbank.“","RAG erfordert Retrieval, nicht eine bestimmte Retrieval-Technologie.",[941,942],"„Reranking ist dasselbe wie Vektorsuche.“","Vektorsuche generiert Kandidaten; Reranking ordnet eine Kandidatenmenge neu.",[944,945],"„Reranker beheben schlechten Recall.“","Sie können ein Dokument nicht hochstufen, das nie abgerufen wurde.",[947,948],"„Dense Search ersetzt BM25.“","Lexikalische Suche bleibt wertvoll für exakte Begriffe, Identifikatoren und spezialisiertes Vokabular.",[950,951],"„Höhere Ähnlichkeit bedeutet mehr Autorität.“","Ähnlichkeit und Quellenautorität sind unterschiedliche Dimensionen.",[953,954],"„Mehr Top-k verbessert RAG immer.“","Größere Kandidatenmengen können den Recall verbessern, aber Latenz, Rauschen und Kontextauswahlaufwand erhöhen.",[956,957],"„Ein Score-Schwellenwert funktioniert überall.“","Scores hängen von Modell, Abfrage, Korpus und Retrieval-Methode ab und müssen kalibriert werden.",[959,960],"„Eine dedizierte Vektordatenbank ist immer fortschrittlicher.“","Sie ist nur gerechtfertigt, wenn ihre operativen und Retrieval-Fähigkeiten den Anforderungen entsprechen.",{},{"id":963,"data":964,"type":41,"tunes":966},"h-edge",{"text":965,"level":246},"Randfälle und Einschränkungen",{},{"id":968,"data":969,"type":217,"tunes":971},"p-edge-1",{"text":970},"Einige Anwendungen benötigen keine semantische Suche. Exakte Datenbank-Lookups oder strukturiertes SQL können korrekter, schneller und leichter auditierbar sein als Embedding-Retrieval.",{},{"id":973,"data":974,"type":217,"tunes":976},"p-edge-2",{"text":975},"Einige Korpora sind so klein, dass ein vollständiger Vektor-Scan akzeptabel ist. Approximative Indizierung fügt Komplexität ohne nennenswerten Nutzen hinzu.",{},{"id":978,"data":979,"type":217,"tunes":981},"p-edge-3",{"text":980},"Einige Abfragen erfordern hohen Recall vor jeglicher Präzisionsoptimierung. Rechtliche Discovery, Forschung und Compliance-Prüfung bevorzugen möglicherweise breiten Kandidatenabruf gefolgt von transparenter Filterung und menschlicher Überprüfung.",{},{"id":983,"data":984,"type":217,"tunes":986},"p-edge-4",{"text":985},"Mehrsprachiges und domänenspezifisches Retrieval kann sich über Embedding-Modelle hinweg sehr unterschiedlich verhalten. Benchmark-Behauptungen aus öffentlichen Datensätzen sollten nicht als Beweis für einen privaten Korpus behandelt werden.",{},{"id":988,"data":989,"type":217,"tunes":991},"p-edge-5",{"text":990},"Die Reranking-Latenz wächst mit Anzahl und Länge der Kandidaten. Die Kandidatengröße sollte daher als Genauigkeits-\u002FKosten-\u002FLatenz-Variable optimiert und nicht aus einem Tutorial kopiert werden.",{},{"id":993,"data":994,"type":41,"tunes":996},"h-change",{"text":995,"level":246},"Was würde diese Antwort ändern?",{},{"id":998,"data":999,"type":217,"tunes":1001},"p-change-1",{"text":1000},"Die Komponentengrenzen würden sich nicht ändern, wenn ein Anbieter Embedding-Generierung, Vektorindizierung und Reranking hinter einer API bündelt. Das Produkt mag die Stufen verbergen, aber sie bleiben konzeptionell unterschiedliche Verantwortlichkeiten mit unterschiedlichen Fehlermodi.",{},{"id":1003,"data":1004,"type":217,"tunes":1006},"p-change-2",{"text":1005},"Zukünftige Embedding- oder Retrieval-Modelle könnten den Bedarf an separatem Reranking in einigen Arbeitslasten verringern, während stärkere Late-Interaction- oder gelernte Sparse-Methoden traditionelle Dense-\u002FLexikalisch-Kategorien verwischen können. Die Architektur sollte dennoch fragen, welche Stufe Repräsentationen erzeugt, welche Stufe Kandidaten generiert und welche Stufe das Ranking verfeinert.",{},{"id":1008,"data":1009,"type":217,"tunes":1011},"p-change-3",{"text":1010},"Das beste Design ändert sich auch mit Korpusgröße, Abfragemix, Sprache, Domänenterminologie, Aktualisierungsfrequenz, Quellenautorität, Latenzbudget und Evaluierungsergebnissen.",{},{"id":1013,"data":1014,"type":41,"tunes":1016},"h-related",{"text":1015,"level":246},"Verwandtes kanonisches Wissen",{},{"id":1018,"data":1019,"type":217,"tunes":1021},"p-related-1",{"text":1020},"R01 setzt voraus, dass das grundlegende RAG-Konzept bereits verstanden ist. RAG ist das übergeordnete Muster, bei dem abgerufene externe Informationen einem Modell zugeführt werden; Embeddings, Vektorsuche und Reranking sind optionale Retrieval-Komponenten innerhalb dieses Musters.",{},{"id":1023,"data":1024,"type":1029,"tunes":1030},"ref-rag",{"url":1025,"title":1026,"excerpt":1027,"ctaLabel":1028},"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works","Was ist RAG? Die einfachste Erklärung, wie es funktioniert","Eine verständliche Grundlage dafür, wie Retrieval externes Wissen in den Modellkontext einbringt.","Die RAG-Grundlagen lesen","referralArticle",{},{"id":1032,"data":1033,"type":217,"tunes":1035},"p-related-2",{"text":1034},"Wenn das Retrieval fehlschlägt, diagnostizieren Sie Quellenabdeckung, Retrieval, Ranking, Kontextzusammenstellung und Generierung getrennt, anstatt das gesamte System als einen einzigen „RAG-Fehler“ zu behandeln.",{},{"id":1037,"data":1038,"type":1029,"tunes":1043},"ref-rag-failed",{"url":1039,"title":1040,"excerpt":1041,"ctaLabel":1042},"https:\u002F\u002Fstajic.de\u002Fde\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method","RAG fehlgeschlagen — aber welche Ebene ist tatsächlich fehlgeschlagen? Eine diagnostische Methode","Eine schichtweise Methode zur Isolierung von Fehlern bei Quellenabdeckung, Retrieval, Ranking, Kontextzusammenstellung, Generierung, Evidenzzuordnung und Aktualität.","Die RAG-Diagnosemethode lesen",{},{"id":1045,"data":1046,"type":217,"tunes":1048},"p-related-3",{"text":1047},"Die Source-of-Truth-Architektur ist die Autoritätsschicht rund um das Retrieval: Sie entscheidet, welche Quelle eine Aussage belegen kann, während Embeddings und Ranking nur entscheiden, welche Kandidaten relevant erscheinen.",{},{"id":1050,"data":1051,"type":41,"tunes":1053},"h-faq",{"text":1052,"level":246},"Häufig gestellte Fragen",{},{"id":1055,"data":1056,"type":1055,"tunes":1091},"faq",{"items":1057,"title":1090},[1058,1062,1066,1070,1074,1078,1082,1086],{"id":1059,"answer":1060,"question":1061},"faq1","Embeddings sind numerische Darstellungen, die von einem Modell erzeugt werden. Eine Vektordatenbank oder ein Vektorindex speichert und durchsucht diese Darstellungen zusammen mit IDs und Metadaten.","Was ist der Unterschied zwischen Embeddings und einer Vektordatenbank?",{"id":1063,"answer":1064,"question":1065},"faq2","Ein Reranker nimmt eine bereits abgerufene Kandidatenmenge und bewertet oder ordnet diese Kandidaten mithilfe eines stärkeren Relevanzmodells oder einer Bewertungsmethode neu.","Was macht ein Reranker?",{"id":1067,"answer":1068,"question":1069},"faq3","Nein. RAG erfordert den Abruf externer Informationen. Der Abruf kann lexikalische Suche, SQL, APIs, Graphen, Vektorsuche, hybride Suche oder Kombinationen davon verwenden.","Erfordert RAG eine Vektordatenbank?",{"id":1071,"answer":1072,"question":1073},"faq4","Reranker führen häufig eine teurere Query-Dokument-Interaktion durch, weshalb sie normalerweise auf eine kleine Top-k-Kandidatenmenge nach einem schnelleren Erststufen-Retriever angewendet werden.","Warum nicht den Reranker auf den gesamten Korpus anwenden?",{"id":1075,"answer":1076,"question":1077},"faq5","Nein. Wenn das relevante Dokument nicht in die Kandidatenmenge abgerufen wurde, hat das Reranking nichts, was es nach vorne bringen könnte.","Kann Reranking ein fehlendes Dokument beheben?",{"id":1079,"answer":1080,"question":1081},"faq6","Nein. Sie ist ein Ähnlichkeitsmaß, dessen numerische Bedeutung vom Embedding-Modell und Korpus abhängt. Sie sollte nicht als universelle Wahrscheinlichkeit der Relevanz behandelt werden.","Ist die Kosinusähnlichkeit eine Relevanzwahrscheinlichkeit?",{"id":1083,"answer":1084,"question":1085},"faq7","Verwenden Sie hybrides Retrieval, wenn die Evaluierung zeigt, dass lexikalische und semantische Signale komplementäre relevante Dokumente auffinden. Es ist nicht automatisch für jeden Korpus besser.","Sollte ich BM25 und Vektorsuche zusammen verwenden?",{"id":1087,"answer":1088,"question":1089},"faq8","Wenn Vektorindizierung, Filterung, Skalierung, Aktualisierungen, verteilter Betrieb oder andere vektorspezifische Anforderungen ein spezialisiertes System rechtfertigen. Kleine Arbeitslasten benötigen möglicherweise keine.","Wann brauche ich eine dedizierte Vektordatenbank?","Embeddings, Vektordatenbanken und Reranking",{},{"id":1093,"data":1094,"type":41,"tunes":1096},"h-glossary",{"text":1095,"level":246},"Glossar",{},{"id":1098,"data":1099,"type":1098,"tunes":1154},"glossary",{"title":1100,"entries":1101},"Wichtige Retrieval-Begriffe",[1102,1104,1108,1112,1116,1120,1124,1128,1132,1136,1139,1143,1147,1150],{"term":365,"anchor":364,"definition":1103},"Eine numerische Darstellung von Inhalten, die von einem Embedding-Modell für Ähnlichkeit, Clustering, Retrieval oder verwandte Aufgaben erzeugt wird.",{"term":1105,"anchor":1106,"definition":1107},"Dichter Vektor","dense-vector","Eine Vektordarstellung, bei der viele Dimensionen Werte ungleich null tragen, die üblicherweise im semantischen Retrieval verwendet wird.",{"term":1109,"anchor":1110,"definition":1111},"Sparse-Vektor","sparse-vector","Eine hochdimensionale Darstellung, bei der die meisten Dimensionen null sind und die oft eine stärkere token- oder termähnliche Struktur bewahrt.",{"term":1113,"anchor":1114,"definition":1115},"Vektorindex","vector-index","Eine Datenstruktur, die Vektoren für effizientes Ähnlichkeits- oder Nächste-Nachbarn-Retrieval organisiert.",{"term":1117,"anchor":1118,"definition":1119},"Vektordatenbank","vector-database","Ein Speicher-\u002FSuchsystem, das dafür ausgelegt ist, Vektoren, zugehörige Metadaten und Vektor-Retrieval-Arbeitslasten zu verwalten.",{"term":1121,"anchor":1122,"definition":1123},"ANN","ann","Approximate Nearest Neighbor Search, die exakten erschöpfenden Vergleich gegen schnelleres Retrieval in großem Maßstab eintauscht.",{"term":1125,"anchor":1126,"definition":1127},"HNSW","hnsw","Hierarchical Navigable Small World, ein graphbasierter Ansatz zur approximativen Nächste-Nachbarn-Indizierung, der häufig für Vektor-Retrieval verwendet wird.",{"term":1129,"anchor":1130,"definition":1131},"BM25","bm25","Eine lexikalische Methode zur Relevanzbewertung, die auf Termvorkommen und Korpusstatistiken basiert und in der Volltextsuche weit verbreitet ist.",{"term":1133,"anchor":1134,"definition":1135},"Hybride Suche","hybrid-search","Retrieval, das Ergebnisse oder Scores aus mehreren Retrieval-Methoden wie lexikalischer und Vektorsuche kombiniert.",{"term":686,"anchor":1137,"definition":1138},"reranking","Eine spätere Retrieval-Stufe, die eine bereits erzeugte Kandidatenmenge neu bewertet und neu ordnet.",{"term":1140,"anchor":1141,"definition":1142},"Bi-Encoder","bi-encoder","Eine Architektur, die Query und Kandidat unabhängig kodiert und dadurch Vorberechnung und skalierbare Ähnlichkeitssuche ermöglicht.",{"term":1144,"anchor":1145,"definition":1146},"Cross-Encoder","cross-encoder","Ein Modell, das einen Query- und Kandidatentext gemeinsam verarbeitet und oft die Relevanzbeurteilung zu höheren Rechenkosten verbessert.",{"term":680,"anchor":1148,"definition":1149},"recall-at-k","Der Anteil relevanter Elemente, die innerhalb der obersten k abgerufenen Kandidaten gefunden werden.",{"term":1151,"anchor":1152,"definition":1153},"nDCG","ndcg","Normalized Discounted Cumulative Gain, eine Ranking-Metrik, die relevante Ergebnisse belohnt, die höher in einer geordneten Liste erscheinen.",{},{"id":1156,"data":1157,"type":41,"tunes":1159},"h-conclusion",{"text":1158,"level":246},"Fazit",{},{"id":1161,"data":1162,"type":217,"tunes":1164},"p-conclusion-1",{"text":1163},"Das klare Retrieval-Modell ist einfach: Embeddings repräsentieren Bedeutung, Vektorsuche ruft Kandidaten ab und Reranker verfeinern die Reihenfolge der Kandidaten.",{},{"id":1166,"data":1167,"type":217,"tunes":1169},"p-conclusion-2",{"text":1168},"Sobald diese Grenzen explizit sind, lassen sich Architekturentscheidungen leichter diagnostizieren. Fehlende Kandidaten deuten auf Quellenabdeckung, Chunking, Embeddings, Filter oder Erststufen-Retrieval hin. Schlechte Reihenfolge deutet auf Ranking, Fusion oder Reranking hin. Falsche endgültige Antworten können dann getrennt auf Kontext- und Generierungsebene untersucht werden.",{},{"id":1171,"data":1172,"type":217,"tunes":1174},"p-conclusion-3",{"text":1173},"Das wichtigste Ergebnis ist nicht die Wahl der modischsten Retrieval-Komponente. Es ist der Aufbau einer Retrieval-Pipeline, deren Stufen, Autoritätsgrenzen, Metriken und Fehlermodi unabhängig gemessen werden können.",{},{"id":1176,"data":1177,"type":41,"tunes":1179},"h-sources",{"text":1178,"level":246},"Primärquellen und Implementierungsnachweise",{},{"id":1181,"data":1182,"type":217,"tunes":1184},"p-sources-note",{"text":1183},"Die folgenden externen Referenzen dokumentieren die in diesem Artikel verwendeten Mechanismen für Repräsentation, Vektorsuche und Reranking. Projektspezifische Abschnitte sind originale Implementierungsnachweise und absichtlich enger gefasst als Aussagen über vollständige Produktionsreife von RAG.",{},{"id":1186,"data":1187,"type":1193,"tunes":1194},"src-sbert",{"link":1188,"meta":1189},"https:\u002F\u002Farxiv.org\u002Fabs\u002F1908.10084",{"image":1190,"title":1191,"description":1192},{"url":343},"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","Grundlegende Arbeit, die unabhängig berechenbare Satz-Embeddings für effiziente semantische Ähnlichkeitssuche demonstriert.","linkTool",{},{"id":1196,"data":1197,"type":1193,"tunes":1203},"src-qdrant-overview",{"link":1198,"meta":1199},"https:\u002F\u002Fqdrant.tech\u002Fdocumentation\u002Foverview\u002F",{"image":1200,"title":1201,"description":1202},{"url":343},"Qdrant — Überblick über Architektur und Datenstruktur","Offizielle Dokumentation, die Collections, Points, Vektoren, Payload-Metadaten und HNSW-basierte Ähnlichkeitsindizierung beschreibt.",{},{"id":1205,"data":1206,"type":1193,"tunes":1212},"src-qdrant-search",{"link":1207,"meta":1208},"https:\u002F\u002Fqdrant.tech\u002Fdocumentation\u002Fsearch\u002Fsearch\u002F",{"image":1209,"title":1210,"description":1211},{"url":343},"Qdrant — Suche","Offizielle Vektorsuchdokumentation zu Ähnlichkeitsabfragen, Filterung, exakter versus approximativer Suche und dichtem\u002Fsparsem Verhalten.",{},{"id":1214,"data":1215,"type":1193,"tunes":1221},"src-elastic-vector",{"link":1216,"meta":1217},"https:\u002F\u002Fwww.elastic.co\u002Fdocs\u002Fsolutions\u002Fsearch\u002Fvector",{"image":1218,"title":1219,"description":1220},{"url":343},"Elastic — Vektorsuche","Aktuelle Dokumentation zu dichtem\u002Fsparsem Vektor-Retrieval, lexikalischen\u002FVektor-Kombinationen und mehrstufigen Suchpipelines.",{},{"id":1223,"data":1224,"type":1193,"tunes":1230},"src-elastic-rerank",{"link":1225,"meta":1226},"https:\u002F\u002Fwww.elastic.co\u002Fdocs\u002Fsolutions\u002Fsearch\u002Franking\u002Fsemantic-reranking",{"image":1227,"title":1228,"description":1229},{"url":343},"Elastic — Semantisches Reranking","Aktuelle Anleitung, die semantisches Reranking als nachgelagerten Relevanzvorgang über eine kleinere Kandidatenmenge definiert.",{},{"id":1232,"data":1233,"type":1193,"tunes":1239},"src-cohere-rerank",{"link":1234,"meta":1235},"https:\u002F\u002Fdocs.cohere.com\u002Fdocs\u002Freranking-with-cohere",{"image":1236,"title":1237,"description":1238},{"url":343},"Cohere — Reranking mit Cohere","Aktuelle Dokumentation, die Reranking als zweistufige Verbesserung gegenüber lexikalischer oder semantischer Erststufen-Retrieval zeigt.",{},{"id":1241,"data":1242,"type":1193,"tunes":1248},"src-sqlite-fts5",{"link":1243,"meta":1244},"https:\u002F\u002Fwww.sqlite.org\u002Ffts5.html",{"image":1245,"title":1246,"description":1247},{"url":343},"SQLite FTS5","Offizielle SQLite-Dokumentation für Volltextsuche und die integrierte BM25-Rangfunktion, die als lexikalischer Retrieval-Nachweis dient.",{},"2.31","Embeddings repräsentieren Bedeutung, Vektordatenbanken rufen Kandidaten ab und Reranker verfeinern Ergebnisse. Erfahren Sie, wie sich diese drei Retrieval-Ebenen unterscheiden und in RAG zusammenwirken.","\u002Fuploads\u002F2026\u002F10\u002Fvector-databases-embeddings-and-reranking-three-different-parts-of-retrieval-1791480129884-9dtasz.webp","vector-databases-embeddings-and-reranking-three-different-parts-of-retrieval-1791480129884-9dtasz","PUBLISHED","2026-10-08T11:21:00.000Z","2026-10-08T17:21:30.174Z","2026-10-08T20:06:31.300Z",{"en":1258,"de":1259,"sr":1260,"es":1261,"fr":1262,"it":1263,"ru":1264,"zh":1265},"\u002Fblog\u002Fvector-databases-embeddings-and-reranking-three-different-parts-of-retrieval","\u002Fde\u002Fblog\u002Fvector-databases-embeddings-and-reranking-three-different-parts-of-retrieval","\u002Fsr\u002Fblog\u002Fvector-databases-embeddings-and-reranking-three-different-parts-of-retrieval","\u002Fes\u002Fblog\u002Fvector-databases-embeddings-and-reranking-three-different-parts-of-retrieval","\u002Ffr\u002Fblog\u002Fvector-databases-embeddings-and-reranking-three-different-parts-of-retrieval","\u002Fit\u002Fblog\u002Fvector-databases-embeddings-and-reranking-three-different-parts-of-retrieval","\u002Fru\u002Fblog\u002Fvector-databases-embeddings-and-reranking-three-different-parts-of-retrieval","\u002Fzh\u002Fblog\u002Fvector-databases-embeddings-and-reranking-three-different-parts-of-retrieval",[1267,1271,1275],{"id":1268,"name":1269,"slug":1270},64,"Informationsarchitektur","information-architecture",{"id":1272,"name":1273,"slug":1274},60,"Kosten- & Latenz-Kontrollen","cost-and-latency",{"id":1276,"name":1277,"slug":1278},57,"Daten-Grenzen","data-boundaries",{"id":1280,"login":1281,"email":1282,"displayName":1283},"20","rooth8233","aleksandar@stajic.de","Aleksandar Stajić",[1285,1807],{"lang":7,"title":207,"content":209,"contentJson":1286,"excerpt":1250},{"time":211,"blocks":1287,"version":1249},[1288,1291,1294,1297,1300,1303,1306,1309,1312,1315,1318,1321,1324,1327,1337,1340,1343,1346,1349,1367,1370,1373,1376,1379,1382,1385,1388,1391,1394,1397,1400,1403,1406,1409,1412,1415,1418,1421,1424,1427,1430,1433,1436,1439,1442,1445,1448,1451,1454,1457,1460,1463,1466,1476,1479,1482,1485,1488,1491,1494,1497,1500,1503,1506,1509,1512,1515,1518,1521,1524,1527,1530,1542,1545,1548,1566,1569,1572,1575,1578,1581,1584,1587,1590,1593,1596,1599,1602,1605,1616,1619,1622,1635,1638,1652,1655,1670,1673,1676,1679,1682,1685,1688,1691,1694,1697,1700,1703,1706,1709,1712,1715,1718,1721,1733,1736,1754,1757,1760,1763,1766,1769,1772,1777,1782,1787,1792,1797,1802],{"id":214,"data":1289,"type":217,"tunes":1290},{"text":216},{},{"id":220,"data":1292,"type":225,"tunes":1293},{"body":222,"title":223,"variant":224},{},{"id":228,"data":1295,"type":225,"tunes":1296},{"body":230,"title":231,"variant":232},{},{"id":235,"data":1298,"type":225,"tunes":1299},{"body":237,"title":238,"variant":239},{},{"id":242,"data":1301,"type":247,"tunes":1302},{"title":244,"maxLevel":245,"minLevel":246},{},{"id":250,"data":1304,"type":41,"tunes":1305},{"text":252,"level":246},{},{"id":255,"data":1307,"type":217,"tunes":1308},{"text":257},{},{"id":260,"data":1310,"type":217,"tunes":1311},{"text":262},{},{"id":265,"data":1313,"type":217,"tunes":1314},{"text":267},{},{"id":270,"data":1316,"type":41,"tunes":1317},{"text":272,"level":246},{},{"id":275,"data":1319,"type":217,"tunes":1320},{"text":277},{},{"id":280,"data":1322,"type":217,"tunes":1323},{"text":282},{},{"id":285,"data":1325,"type":217,"tunes":1326},{"text":287},{},{"id":290,"data":1328,"type":313,"tunes":1336},{"steps":1329,"title":311,"orientation":312},[1330,1331,1332,1333,1334,1335],{"label":294,"description":295},{"label":297,"description":298},{"label":300,"description":301},{"label":303,"description":304},{"label":306,"description":307},{"label":309,"description":310},{},{"id":316,"data":1338,"type":41,"tunes":1339},{"text":318,"level":246},{},{"id":321,"data":1341,"type":217,"tunes":1342},{"text":323},{},{"id":326,"data":1344,"type":217,"tunes":1345},{"text":328},{},{"id":331,"data":1347,"type":217,"tunes":1348},{"text":333},{},{"id":336,"data":1350,"type":372,"tunes":1366},{"rows":1351,"title":360,"layout":361,"columns":1362},[1352,1354,1356,1358,1360],{"id":340,"label":341,"values":1353},[343,343,343],{"id":345,"label":346,"values":1355},[343,343,343],{"id":349,"label":350,"values":1357},[343,343,343],{"id":353,"label":354,"values":1359},[343,343,343],{"id":357,"label":358,"values":1361},[343,343,343],[1363,1364,1365],{"id":364,"label":365},{"id":367,"label":368},{"id":370,"label":371},{},{"id":375,"data":1368,"type":41,"tunes":1369},{"text":377,"level":246},{},{"id":380,"data":1371,"type":217,"tunes":1372},{"text":382},{},{"id":385,"data":1374,"type":217,"tunes":1375},{"text":387},{},{"id":390,"data":1377,"type":217,"tunes":1378},{"text":392},{},{"id":395,"data":1380,"type":41,"tunes":1381},{"text":397,"level":245},{},{"id":400,"data":1383,"type":217,"tunes":1384},{"text":402},{},{"id":405,"data":1386,"type":217,"tunes":1387},{"text":407},{},{"id":410,"data":1389,"type":41,"tunes":1390},{"text":412,"level":245},{},{"id":415,"data":1392,"type":217,"tunes":1393},{"text":417},{},{"id":420,"data":1395,"type":217,"tunes":1396},{"text":422},{},{"id":425,"data":1398,"type":41,"tunes":1399},{"text":427,"level":245},{},{"id":430,"data":1401,"type":217,"tunes":1402},{"text":432},{},{"id":435,"data":1404,"type":217,"tunes":1405},{"text":437},{},{"id":440,"data":1407,"type":225,"tunes":1408},{"body":442,"title":443,"variant":232},{},{"id":446,"data":1410,"type":41,"tunes":1411},{"text":448,"level":246},{},{"id":451,"data":1413,"type":217,"tunes":1414},{"text":453},{},{"id":456,"data":1416,"type":217,"tunes":1417},{"text":458},{},{"id":461,"data":1419,"type":217,"tunes":1420},{"text":463},{},{"id":466,"data":1422,"type":41,"tunes":1423},{"text":468,"level":245},{},{"id":471,"data":1425,"type":217,"tunes":1426},{"text":473},{},{"id":476,"data":1428,"type":217,"tunes":1429},{"text":478},{},{"id":481,"data":1431,"type":217,"tunes":1432},{"text":483},{},{"id":486,"data":1434,"type":41,"tunes":1435},{"text":488,"level":245},{},{"id":491,"data":1437,"type":217,"tunes":1438},{"text":493},{},{"id":496,"data":1440,"type":217,"tunes":1441},{"text":498},{},{"id":501,"data":1443,"type":41,"tunes":1444},{"text":503,"level":245},{},{"id":506,"data":1446,"type":217,"tunes":1447},{"text":508},{},{"id":511,"data":1449,"type":217,"tunes":1450},{"text":513},{},{"id":516,"data":1452,"type":41,"tunes":1453},{"text":518,"level":246},{},{"id":521,"data":1455,"type":217,"tunes":1456},{"text":523},{},{"id":526,"data":1458,"type":217,"tunes":1459},{"text":528},{},{"id":531,"data":1461,"type":217,"tunes":1462},{"text":533},{},{"id":536,"data":1464,"type":41,"tunes":1465},{"text":538,"level":245},{},{"id":541,"data":1467,"type":361,"tunes":1475},{"content":1468,"stretched":42,"withHeadings":13},[1469,1470,1471,1472,1473,1474],[545,546,547],[549,550,551],[553,554,555],[557,558,559],[561,562,563],[565,566,567],{},{"id":570,"data":1477,"type":41,"tunes":1478},{"text":572,"level":245},{},{"id":575,"data":1480,"type":217,"tunes":1481},{"text":577},{},{"id":580,"data":1483,"type":217,"tunes":1484},{"text":582},{},{"id":585,"data":1486,"type":225,"tunes":1487},{"body":587,"title":588,"variant":589},{},{"id":592,"data":1489,"type":41,"tunes":1490},{"text":594,"level":246},{},{"id":597,"data":1492,"type":217,"tunes":1493},{"text":599},{},{"id":602,"data":1495,"type":217,"tunes":1496},{"text":604},{},{"id":607,"data":1498,"type":217,"tunes":1499},{"text":609},{},{"id":612,"data":1501,"type":41,"tunes":1502},{"text":614,"level":245},{},{"id":617,"data":1504,"type":217,"tunes":1505},{"text":619},{},{"id":622,"data":1507,"type":217,"tunes":1508},{"text":624},{},{"id":627,"data":1510,"type":41,"tunes":1511},{"text":629,"level":246},{},{"id":632,"data":1513,"type":217,"tunes":1514},{"text":634},{},{"id":637,"data":1516,"type":217,"tunes":1517},{"text":639},{},{"id":642,"data":1519,"type":41,"tunes":1520},{"text":644,"level":246},{},{"id":647,"data":1522,"type":217,"tunes":1523},{"text":649},{},{"id":652,"data":1525,"type":217,"tunes":1526},{"text":654},{},{"id":657,"data":1528,"type":41,"tunes":1529},{"text":659,"level":246},{},{"id":662,"data":1531,"type":361,"tunes":1541},{"content":1532,"stretched":42,"withHeadings":13},[1533,1534,1535,1536,1537,1538,1539,1540],[666,667,668],[670,671,672],[674,675,676],[678,679,680],[682,683,684],[686,687,688],[690,691,692],[694,695,696],{},{"id":699,"data":1543,"type":217,"tunes":1544},{"text":701},{},{"id":704,"data":1546,"type":41,"tunes":1547},{"text":706,"level":246},{},{"id":709,"data":1549,"type":372,"tunes":1565},{"rows":1550,"title":732,"layout":361,"columns":1561},[1551,1553,1555,1557,1559],{"id":713,"label":714,"values":1552},[343,343,343],{"id":717,"label":718,"values":1554},[343,343,343],{"id":721,"label":722,"values":1556},[343,343,343],{"id":725,"label":726,"values":1558},[343,343,343],{"id":729,"label":730,"values":1560},[343,343,343],[1562,1563,1564],{"id":735,"label":736},{"id":738,"label":739},{"id":741,"label":742},{},{"id":745,"data":1567,"type":41,"tunes":1568},{"text":747,"level":246},{},{"id":750,"data":1570,"type":217,"tunes":1571},{"text":752},{},{"id":755,"data":1573,"type":217,"tunes":1574},{"text":757},{},{"id":760,"data":1576,"type":225,"tunes":1577},{"body":762,"title":763,"variant":232},{},{"id":766,"data":1579,"type":41,"tunes":1580},{"text":768,"level":246},{},{"id":771,"data":1582,"type":41,"tunes":1583},{"text":773,"level":245},{},{"id":776,"data":1585,"type":217,"tunes":1586},{"text":778},{},{"id":781,"data":1588,"type":217,"tunes":1589},{"text":783},{},{"id":786,"data":1591,"type":217,"tunes":1592},{"text":788},{},{"id":791,"data":1594,"type":41,"tunes":1595},{"text":793,"level":245},{},{"id":796,"data":1597,"type":217,"tunes":1598},{"text":798},{},{"id":801,"data":1600,"type":217,"tunes":1601},{"text":803},{},{"id":806,"data":1603,"type":217,"tunes":1604},{"text":808},{},{"id":811,"data":1606,"type":361,"tunes":1615},{"content":1607,"stretched":42,"withHeadings":13},[1608,1609,1610,1611,1612,1613,1614],[815,816],[818,819],[821,822],[824,825],[827,828],[830,831],[833,834],{},{"id":837,"data":1617,"type":225,"tunes":1618},{"body":839,"title":840,"variant":239},{},{"id":843,"data":1620,"type":41,"tunes":1621},{"text":845,"level":246},{},{"id":848,"data":1623,"type":361,"tunes":1634},{"content":1624,"stretched":42,"withHeadings":13},[1625,1626,1627,1628,1629,1630,1631,1632,1633],[852,853],[855,856],[858,859],[861,862],[864,865],[867,371],[869,870],[872,873],[875,876],{},{"id":879,"data":1636,"type":41,"tunes":1637},{"text":881,"level":246},{},{"id":884,"data":1639,"type":313,"tunes":1651},{"steps":1640,"title":917,"orientation":312},[1641,1642,1643,1644,1645,1646,1647,1648,1649,1650],{"label":888,"description":889},{"label":891,"description":892},{"label":894,"description":895},{"label":897,"description":898},{"label":900,"description":901},{"label":903,"description":904},{"label":906,"description":907},{"label":909,"description":910},{"label":912,"description":913},{"label":915,"description":916},{},{"id":920,"data":1653,"type":41,"tunes":1654},{"text":922,"level":246},{},{"id":925,"data":1656,"type":361,"tunes":1669},{"content":1657,"stretched":42,"withHeadings":13},[1658,1659,1660,1661,1662,1663,1664,1665,1666,1667,1668],[929,930],[932,933],[935,936],[938,939],[941,942],[944,945],[947,948],[950,951],[953,954],[956,957],[959,960],{},{"id":963,"data":1671,"type":41,"tunes":1672},{"text":965,"level":246},{},{"id":968,"data":1674,"type":217,"tunes":1675},{"text":970},{},{"id":973,"data":1677,"type":217,"tunes":1678},{"text":975},{},{"id":978,"data":1680,"type":217,"tunes":1681},{"text":980},{},{"id":983,"data":1683,"type":217,"tunes":1684},{"text":985},{},{"id":988,"data":1686,"type":217,"tunes":1687},{"text":990},{},{"id":993,"data":1689,"type":41,"tunes":1690},{"text":995,"level":246},{},{"id":998,"data":1692,"type":217,"tunes":1693},{"text":1000},{},{"id":1003,"data":1695,"type":217,"tunes":1696},{"text":1005},{},{"id":1008,"data":1698,"type":217,"tunes":1699},{"text":1010},{},{"id":1013,"data":1701,"type":41,"tunes":1702},{"text":1015,"level":246},{},{"id":1018,"data":1704,"type":217,"tunes":1705},{"text":1020},{},{"id":1023,"data":1707,"type":1029,"tunes":1708},{"url":1025,"title":1026,"excerpt":1027,"ctaLabel":1028},{},{"id":1032,"data":1710,"type":217,"tunes":1711},{"text":1034},{},{"id":1037,"data":1713,"type":1029,"tunes":1714},{"url":1039,"title":1040,"excerpt":1041,"ctaLabel":1042},{},{"id":1045,"data":1716,"type":217,"tunes":1717},{"text":1047},{},{"id":1050,"data":1719,"type":41,"tunes":1720},{"text":1052,"level":246},{},{"id":1055,"data":1722,"type":1055,"tunes":1732},{"items":1723,"title":1090},[1724,1725,1726,1727,1728,1729,1730,1731],{"id":1059,"answer":1060,"question":1061},{"id":1063,"answer":1064,"question":1065},{"id":1067,"answer":1068,"question":1069},{"id":1071,"answer":1072,"question":1073},{"id":1075,"answer":1076,"question":1077},{"id":1079,"answer":1080,"question":1081},{"id":1083,"answer":1084,"question":1085},{"id":1087,"answer":1088,"question":1089},{},{"id":1093,"data":1734,"type":41,"tunes":1735},{"text":1095,"level":246},{},{"id":1098,"data":1737,"type":1098,"tunes":1753},{"title":1100,"entries":1738},[1739,1740,1741,1742,1743,1744,1745,1746,1747,1748,1749,1750,1751,1752],{"term":365,"anchor":364,"definition":1103},{"term":1105,"anchor":1106,"definition":1107},{"term":1109,"anchor":1110,"definition":1111},{"term":1113,"anchor":1114,"definition":1115},{"term":1117,"anchor":1118,"definition":1119},{"term":1121,"anchor":1122,"definition":1123},{"term":1125,"anchor":1126,"definition":1127},{"term":1129,"anchor":1130,"definition":1131},{"term":1133,"anchor":1134,"definition":1135},{"term":686,"anchor":1137,"definition":1138},{"term":1140,"anchor":1141,"definition":1142},{"term":1144,"anchor":1145,"definition":1146},{"term":680,"anchor":1148,"definition":1149},{"term":1151,"anchor":1152,"definition":1153},{},{"id":1156,"data":1755,"type":41,"tunes":1756},{"text":1158,"level":246},{},{"id":1161,"data":1758,"type":217,"tunes":1759},{"text":1163},{},{"id":1166,"data":1761,"type":217,"tunes":1762},{"text":1168},{},{"id":1171,"data":1764,"type":217,"tunes":1765},{"text":1173},{},{"id":1176,"data":1767,"type":41,"tunes":1768},{"text":1178,"level":246},{},{"id":1181,"data":1770,"type":217,"tunes":1771},{"text":1183},{},{"id":1186,"data":1773,"type":1193,"tunes":1776},{"link":1188,"meta":1774},{"image":1775,"title":1191,"description":1192},{"url":343},{},{"id":1196,"data":1778,"type":1193,"tunes":1781},{"link":1198,"meta":1779},{"image":1780,"title":1201,"description":1202},{"url":343},{},{"id":1205,"data":1783,"type":1193,"tunes":1786},{"link":1207,"meta":1784},{"image":1785,"title":1210,"description":1211},{"url":343},{},{"id":1214,"data":1788,"type":1193,"tunes":1791},{"link":1216,"meta":1789},{"image":1790,"title":1219,"description":1220},{"url":343},{},{"id":1223,"data":1793,"type":1193,"tunes":1796},{"link":1225,"meta":1794},{"image":1795,"title":1228,"description":1229},{"url":343},{},{"id":1232,"data":1798,"type":1193,"tunes":1801},{"link":1234,"meta":1799},{"image":1800,"title":1237,"description":1238},{"url":343},{},{"id":1241,"data":1803,"type":1193,"tunes":1806},{"link":1243,"meta":1804},{"image":1805,"title":1246,"description":1247},{"url":343},{},{"lang":1808,"title":1809,"content":1810,"contentJson":1811,"excerpt":2649},"en","Vector Databases, Embeddings and Reranking: Three Different Parts of Retrieval","{\"time\":1791489989811,\"blocks\":[{\"id\":\"intro\",\"type\":\"paragraph\",\"data\":{\"text\":\"Embeddings, vector databases and rerankers are three different parts of retrieval. An embedding model converts text or other data into numerical representations; a vector database or vector index stores and searches those representations to retrieve candidate items; a reranker takes a smaller candidate set and reorders it using a more expensive relevance model or scoring method. They often appear together in RAG, but none of them is the same thing as RAG, and none is mandatory in every retrieval system.\"},\"tunes\":{}},{\"id\":\"direct\",\"type\":\"callout\",\"data\":{\"variant\":\"info\",\"title\":\"Direct answer\",\"body\":\"\u003Cstrong>Embeddings represent. Vector search retrieves. Reranking refines.\u003C\u002Fstrong>\u003Cbr>\u003Cbr>A useful mental model is:\u003Cbr>\u003Cstrong>content → embedding → candidate retrieval → reranking → selected context → model\u003C\u002Fstrong>.\u003Cbr>\u003Cbr>The boundaries matter because each layer fails differently. Bad embeddings distort semantic similarity. A weak retrieval index misses useful candidates. A reranker can reorder candidates, but it cannot recover a relevant document that was never retrieved.\"},\"tunes\":{}},{\"id\":\"boundary\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Do not collapse the retrieval stack\",\"body\":\"A vector database is not an embedding model. An embedding is not a search result. A reranker is not a vector database. RAG is the wider pattern that can use any of these components to retrieve external information before generation.\"},\"tunes\":{}},{\"id\":\"current\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"Current-source note — 8 October 2026\",\"body\":\"The basic architecture is stable even though products evolve rapidly. Current Qdrant documentation separates vectors, payload metadata, collections and vector indexes; current Elastic guidance treats semantic reranking as a later-stage operation over a small candidate set; current Cohere documentation likewise describes reranking as a second-stage improvement over lexical or semantic search.\"},\"tunes\":{}},{\"id\":\"toc\",\"type\":\"tableOfContents\",\"data\":{\"title\":\"Contents\",\"minLevel\":2,\"maxLevel\":3},\"tunes\":{}},{\"id\":\"h-meaning\",\"type\":\"header\",\"data\":{\"text\":\"What this really means\",\"level\":2},\"tunes\":{}},{\"id\":\"p-meaning-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Search systems have two competing goals: find enough potentially relevant material and put the best material near the top. Fast first-stage retrieval usually optimizes candidate generation. A stronger second-stage model can then spend more computation distinguishing the best candidates.\"},\"tunes\":{}},{\"id\":\"p-meaning-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Embeddings, vector indexes and rerankers occupy different positions in that process. Treating them as one feature hides important design choices about recall, precision, latency, storage, metadata filtering and model cost.\"},\"tunes\":{}},{\"id\":\"p-meaning-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The distinction also prevents a common RAG mistake: assuming that storing document embeddings in a vector database automatically creates high-quality retrieval. Retrieval quality depends on the embedding model, chunking, metadata, query construction, index configuration, candidate count, hybrid retrieval, reranking and the authority of the underlying sources.\"},\"tunes\":{}},{\"id\":\"h-simple\",\"type\":\"header\",\"data\":{\"text\":\"The simplest example\",\"level\":2},\"tunes\":{}},{\"id\":\"p-simple-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Suppose a knowledge base contains 100,000 document chunks. A user asks: “How do I revoke an API token?”\"},\"tunes\":{}},{\"id\":\"p-simple-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"First, an embedding model can encode the query into a vector. Document chunks may already have their own stored embeddings. A vector search then compares the query vector to the indexed document vectors and returns, for example, 30 likely candidates.\"},\"tunes\":{}},{\"id\":\"p-simple-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Those 30 candidates can then be passed to a reranker. The reranker compares the query more directly with each candidate and produces a new relevance ordering. The application might keep the best five for the model context.\"},\"tunes\":{}},{\"id\":\"simple-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"A basic two-stage semantic retrieval pipeline\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Embed documents\",\"description\":\"Convert each searchable chunk into a numerical representation, usually at ingest time.\"},{\"label\":\"2. Store\u002Findex vectors\",\"description\":\"Associate vectors with document IDs and metadata in a searchable vector index or database.\"},{\"label\":\"3. Embed the query\",\"description\":\"Encode the user's query using the compatible embedding model and query configuration.\"},{\"label\":\"4. Retrieve candidates\",\"description\":\"Run vector similarity search, often with metadata filters, to produce a larger top-k candidate set.\"},{\"label\":\"5. Rerank candidates\",\"description\":\"Apply a stronger relevance model to the query and the small candidate set.\"},{\"label\":\"6. Select context\",\"description\":\"Keep the most useful passages for the downstream answer, agent step or search result.\"}]},\"tunes\":{}},{\"id\":\"h-stops\",\"type\":\"header\",\"data\":{\"text\":\"Where the simple example stops\",\"level\":2},\"tunes\":{}},{\"id\":\"p-stops-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Real retrieval systems do not have to use dense embeddings at all. Keyword search such as BM25 can be the first-stage retriever. Sparse learned retrieval, SQL filters, graph traversal or application APIs can also generate candidates.\"},\"tunes\":{}},{\"id\":\"p-stops-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"A reranker also does not care that the candidates came from a vector database. It can rerank BM25 results, hybrid results, hand-selected documents or candidates from multiple retrievers.\"},\"tunes\":{}},{\"id\":\"p-stops-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Likewise, embeddings do not require a specialized vector database. Small datasets can be compared in memory or with general-purpose databases and vector extensions. Specialized vector systems become useful when indexing, approximate nearest-neighbor search, filtering, scale, update behavior or operational requirements justify them.\"},\"tunes\":{}},{\"id\":\"core-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Three different retrieval components\",\"layout\":\"table\",\"columns\":[{\"id\":\"embedding\",\"label\":\"Embedding\"},{\"id\":\"vector\",\"label\":\"Vector database \u002F index\"},{\"id\":\"reranker\",\"label\":\"Reranker\"}],\"rows\":[{\"id\":\"job\",\"label\":\"Primary job\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"input\",\"label\":\"Typical input\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"output\",\"label\":\"Typical output\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"cost\",\"label\":\"Cost profile\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"can-miss\",\"label\":\"Typical failure\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-embeddings\",\"type\":\"header\",\"data\":{\"text\":\"Embeddings: representation, not retrieval\",\"level\":2},\"tunes\":{}},{\"id\":\"p-emb-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"An embedding is a numerical representation produced by a model. For semantic retrieval, texts with related meaning are intended to occupy useful positions in a vector space so that a similarity or distance function can compare them.\"},\"tunes\":{}},{\"id\":\"p-emb-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Sentence-BERT was an influential step in making sentence-level semantic similarity practical with bi-encoder-style representations that can be computed independently and compared efficiently. The general idea remains central to modern dense retrieval: precompute document representations, compute the query representation at search time, then compare them.\"},\"tunes\":{}},{\"id\":\"p-emb-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The embedding itself does not search a corpus. It is data produced by an embedding model. Retrieval begins when the system compares the query representation against stored candidates.\"},\"tunes\":{}},{\"id\":\"h-embedding-model\",\"type\":\"header\",\"data\":{\"text\":\"The embedding model defines the representation space\",\"level\":3},\"tunes\":{}},{\"id\":\"p-emodel-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Document and query vectors must be compatible with the model and configuration used to create them. Replacing an embedding model can change dimensionality, similarity behavior, language coverage and domain performance.\"},\"tunes\":{}},{\"id\":\"p-emodel-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"That is why an embedding-model migration is not merely an API-name change. Existing documents may need to be re-embedded and the index rebuilt or versioned.\"},\"tunes\":{}},{\"id\":\"h-dense-sparse\",\"type\":\"header\",\"data\":{\"text\":\"Dense and sparse representations are different\",\"level\":3},\"tunes\":{}},{\"id\":\"p-dense-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Dense embeddings usually contain many non-zero dimensions and are commonly used for semantic similarity. Sparse representations contain many zeros and can preserve stronger token- or term-like structure.\"},\"tunes\":{}},{\"id\":\"p-dense-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Both can support semantic retrieval, and modern search systems can combine dense, sparse and lexical signals. “Vector search” therefore does not always mean one dense cosine-similarity pipeline.\"},\"tunes\":{}},{\"id\":\"h-distance\",\"type\":\"header\",\"data\":{\"text\":\"Similarity functions are part of the representation contract\",\"level\":3},\"tunes\":{}},{\"id\":\"p-distance-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Cosine similarity, dot product and Euclidean distance do not mean the same thing. The correct metric depends on how the embedding model was trained and normalized.\"},\"tunes\":{}},{\"id\":\"p-distance-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Current Qdrant documentation, for example, requires a distance metric as part of vector configuration and documents cosine, dot-product and Euclidean-style choices. The important architectural rule is to treat the metric as part of the embedding\u002Findex contract rather than choose one arbitrarily.\"},\"tunes\":{}},{\"id\":\"embedding-not-truth\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Embedding similarity is not factual support\",\"body\":\"Two passages can be semantically close while one is stale, unauthorized or wrong. Embeddings estimate representational similarity; they do not determine Source-of-Truth authority, freshness or evidentiary validity.\"},\"tunes\":{}},{\"id\":\"h-vector-db\",\"type\":\"header\",\"data\":{\"text\":\"Vector databases and indexes: candidate retrieval\",\"level\":2},\"tunes\":{}},{\"id\":\"p-vdb-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A vector database or vector-capable search system organizes vector representations so the application can retrieve nearby candidates efficiently. Practical systems usually associate vectors with IDs and payload metadata such as source, language, tenant, document type, timestamp or access scope.\"},\"tunes\":{}},{\"id\":\"p-vdb-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Qdrant, for example, organizes data into collections of points where a point contains a vector and optional payload metadata. Its documentation describes HNSW-based similarity search and metadata filtering as separate capabilities of the retrieval layer.\"},\"tunes\":{}},{\"id\":\"p-vdb-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"That distinction matters: the vector index answers a nearest-neighbor problem, while payload filters enforce structural constraints such as tenant, document class or language.\"},\"tunes\":{}},{\"id\":\"h-ann\",\"type\":\"header\",\"data\":{\"text\":\"Approximate nearest-neighbor search trades exactness for efficiency\",\"level\":3},\"tunes\":{}},{\"id\":\"p-ann-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Comparing one query vector against every vector can be practical for small collections but expensive at large scale. Approximate nearest-neighbor indexes such as HNSW reduce search cost by navigating an index structure instead of exhaustively scanning every vector.\"},\"tunes\":{}},{\"id\":\"p-ann-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Approximate search introduces a recall\u002Flatency trade-off. Faster search can miss candidates that exact search would return. Index parameters therefore affect retrieval quality, not just infrastructure performance.\"},\"tunes\":{}},{\"id\":\"p-ann-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Qdrant exposes both HNSW-related parameters and an exact-search option, illustrating that vector storage and approximate retrieval policy are separate decisions.\"},\"tunes\":{}},{\"id\":\"h-filtering\",\"type\":\"header\",\"data\":{\"text\":\"Metadata filtering belongs before or during candidate retrieval\",\"level\":3},\"tunes\":{}},{\"id\":\"p-filter-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"If the user may only access tenant A, retrieving semantically similar chunks from tenant B and attempting to remove them later is the wrong security boundary. Authorization and hard eligibility filters should constrain the candidate space before those candidates can influence downstream processing.\"},\"tunes\":{}},{\"id\":\"p-filter-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The same principle applies to locale, document status, source class, date, product version and other deterministic constraints. Similarity should rank eligible candidates; it should not override eligibility.\"},\"tunes\":{}},{\"id\":\"h-vector-not-required\",\"type\":\"header\",\"data\":{\"text\":\"A vector database is optional\",\"level\":3},\"tunes\":{}},{\"id\":\"p-optional-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"For a small corpus, brute-force cosine comparison may be simple and sufficient. A relational database with vector support may also be adequate. A dedicated vector database becomes valuable when its indexing, filtering, distributed storage, update behavior or operational features solve a real requirement.\"},\"tunes\":{}},{\"id\":\"p-optional-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Choosing a vector database because “RAG needs one” reverses the architecture process. Start with retrieval requirements and scale, then select the storage\u002Findex technology.\"},\"tunes\":{}},{\"id\":\"h-rerank\",\"type\":\"header\",\"data\":{\"text\":\"Reranking: second-stage relevance refinement\",\"level\":2},\"tunes\":{}},{\"id\":\"p-rerank-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A reranker receives a query and a smaller set of already retrieved candidates, then assigns stronger relevance scores or a new ordering. It is normally more computationally expensive than first-stage retrieval, which is why it is applied after candidate generation rather than to the entire corpus.\"},\"tunes\":{}},{\"id\":\"p-rerank-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Current Elastic guidance describes semantic reranking as a final-stage technique over a small top-k set and notes that it can refine lexical, semantic or hybrid retrieval. Cohere documents the same architecture: first-stage lexical or semantic search followed by a reranking stage.\"},\"tunes\":{}},{\"id\":\"p-rerank-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"A common implementation uses a cross-encoder-like model that examines the query and each candidate together. That richer interaction can distinguish relevance more precisely than independent embedding similarity, but it is much more expensive at corpus scale.\"},\"tunes\":{}},{\"id\":\"h-bi-cross\",\"type\":\"header\",\"data\":{\"text\":\"Bi-encoder retrieval and cross-encoder reranking solve different cost problems\",\"level\":3},\"tunes\":{}},{\"id\":\"encoder-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Property\",\"Bi-encoder \u002F embedding retrieval\",\"Cross-encoder-style reranking\"],[\"Encoding\",\"Query and documents represented independently\",\"Query and candidate processed jointly\"],[\"Document computation\",\"Can be precomputed at ingest\",\"Normally recomputed per query-candidate pair\"],[\"Corpus-scale search\",\"Suitable with vector indexes\",\"Usually too expensive across the entire corpus\"],[\"Typical role\",\"High-recall candidate generation\",\"High-precision ordering of a small candidate set\"],[\"Main trade-off\",\"Fast and scalable but relevance interaction is compressed into vectors\",\"Richer relevance judgment but higher latency\u002Fcost\"]]},\"tunes\":{}},{\"id\":\"h-rerank-limit\",\"type\":\"header\",\"data\":{\"text\":\"A reranker cannot recover what retrieval missed\",\"level\":3},\"tunes\":{}},{\"id\":\"p-rerank-limit-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"If the relevant document is absent from the candidate set, reranking has nothing to promote. This is the central reason to evaluate retrieval and reranking separately.\"},\"tunes\":{}},{\"id\":\"p-rerank-limit-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"A pipeline can have excellent reranker precision and still fail because first-stage recall is poor. Increasing reranker quality will not repair missing source coverage, bad chunking, restrictive filters or a weak candidate retriever.\"},\"tunes\":{}},{\"id\":\"recall-precision\",\"type\":\"callout\",\"data\":{\"variant\":\"success\",\"title\":\"Useful retrieval objective\",\"body\":\"First stage: \u003Cstrong>do not miss the useful candidates.\u003C\u002Fstrong>\u003Cbr>Second stage: \u003Cstrong>put the best candidates first.\u003C\u002Fstrong>\u003Cbr>\u003Cbr>This is not a universal mathematical rule, but it is a useful engineering model for two-stage retrieval.\"},\"tunes\":{}},{\"id\":\"h-hybrid\",\"type\":\"header\",\"data\":{\"text\":\"Hybrid retrieval is a separate design choice\",\"level\":2},\"tunes\":{}},{\"id\":\"p-hybrid-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Dense semantic retrieval is strong when query and document use different wording but express related meaning. Lexical retrieval is strong when exact terms, identifiers, names, codes or rare phrases matter.\"},\"tunes\":{}},{\"id\":\"p-hybrid-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Hybrid retrieval combines multiple candidate signals, often lexical BM25 and vector similarity, then merges rankings using a method such as Reciprocal Rank Fusion or a weighted score combination.\"},\"tunes\":{}},{\"id\":\"p-hybrid-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Reranking can then operate on the fused candidate set. Hybrid retrieval and reranking are therefore complementary but distinct stages.\"},\"tunes\":{}},{\"id\":\"h-bm25\",\"type\":\"header\",\"data\":{\"text\":\"BM25 is not obsolete because embeddings exist\",\"level\":3},\"tunes\":{}},{\"id\":\"p-bm25-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Keyword search can outperform dense retrieval for exact identifiers, version numbers, error messages, product codes and specialized vocabulary. SQLite FTS5, for example, includes a BM25 ranking function for full-text search.\"},\"tunes\":{}},{\"id\":\"p-bm25-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"A strong retrieval architecture can use lexical retrieval as the only first stage, vector retrieval as the only first stage, or combine both depending on the corpus and query distribution.\"},\"tunes\":{}},{\"id\":\"h-chunking\",\"type\":\"header\",\"data\":{\"text\":\"Chunking changes what embeddings and rerankers can see\",\"level\":2},\"tunes\":{}},{\"id\":\"p-chunk-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"If a document is split poorly, no later retrieval component can fully reconstruct the missing semantic unit. A chunk that cuts a condition away from its exception may embed misleadingly and may also be reranked incorrectly because the candidate text is incomplete.\"},\"tunes\":{}},{\"id\":\"p-chunk-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Chunk size, overlap, structural boundaries and metadata therefore affect both candidate recall and reranker judgment. Retrieval evaluation should test the complete ingestion-to-ranking pipeline, not only the embedding model.\"},\"tunes\":{}},{\"id\":\"h-scores\",\"type\":\"header\",\"data\":{\"text\":\"Do not compare retrieval scores as if they were universal probabilities\",\"level\":2},\"tunes\":{}},{\"id\":\"p-scores-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Cosine similarity, BM25 scores, sparse-vector scores, RRF ranks and reranker scores have different meanings. A score of 0.82 from one embedding model is not automatically comparable with 0.82 from another model or with a reranker score.\"},\"tunes\":{}},{\"id\":\"p-scores-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Thresholds should be calibrated for the actual model, corpus and task. Current Elastic guidance also notes that embedding similarity scores can be query-dependent, which makes universal cutoffs risky.\"},\"tunes\":{}},{\"id\":\"h-eval\",\"type\":\"header\",\"data\":{\"text\":\"Evaluate retrieval stages separately\",\"level\":2},\"tunes\":{}},{\"id\":\"eval-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Layer\",\"Useful question\",\"Example metric or test\"],[\"Source coverage\",\"Does the corpus contain the needed information?\",\"Coverage audit \u002F known-answer source set\"],[\"Chunking\",\"Is the needed evidence retrievable as a coherent unit?\",\"Chunk-level support review\"],[\"First-stage retrieval\",\"Does the relevant item enter the candidate set?\",\"Recall@k\"],[\"Ranking\",\"How high does relevant evidence appear?\",\"MRR, nDCG, precision@k\"],[\"Reranking\",\"Does second-stage scoring improve ordering?\",\"Delta nDCG \u002F MRR \u002F precision\"],[\"Context selection\",\"Do the final selected passages contain sufficient support?\",\"Context relevance \u002F coverage\"],[\"Answer stage\",\"Does the model use the selected evidence correctly?\",\"Faithfulness \u002F claim-evidence evaluation\"]]},\"tunes\":{}},{\"id\":\"p-eval-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"This separation is operationally important. If Recall@50 is poor, the reranker is not the first component to fix. If Recall@50 is strong but the best passage remains at rank 38, reranking or ranking fusion becomes a plausible target.\"},\"tunes\":{}},{\"id\":\"h-failure-map\",\"type\":\"header\",\"data\":{\"text\":\"Which layer actually failed?\",\"level\":2},\"tunes\":{}},{\"id\":\"failure-comparison\",\"type\":\"comparison\",\"data\":{\"title\":\"Symptoms and likely retrieval layer\",\"layout\":\"table\",\"columns\":[{\"id\":\"symptom\",\"label\":\"Observed symptom\"},{\"id\":\"likely\",\"label\":\"Likely layer\"},{\"id\":\"test\",\"label\":\"First diagnostic\"}],\"rows\":[{\"id\":\"missed\",\"label\":\"Relevant document never appears\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"lowrank\",\"label\":\"Relevant document appears too low\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"wrongtenant\",\"label\":\"Semantically good but forbidden result\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"stale\",\"label\":\"Relevant but outdated result\",\"values\":[\"\",\"\",\"\"]},{\"id\":\"context\",\"label\":\"Correct result retrieved but omitted from prompt\",\"values\":[\"\",\"\",\"\"]}]},\"tunes\":{}},{\"id\":\"h-authority\",\"type\":\"header\",\"data\":{\"text\":\"Relevance and Source of Truth are different\",\"level\":2},\"tunes\":{}},{\"id\":\"p-authority-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"A reranker can make a stale document look extremely relevant. A vector index can retrieve a secondary summary that is semantically closer than the primary source. Retrieval quality therefore cannot replace authority rules.\"},\"tunes\":{}},{\"id\":\"p-authority-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Where source authority matters, metadata filters, source classes, version rules and provenance should constrain retrieval before the result becomes model context.\"},\"tunes\":{}},{\"id\":\"authority-callout\",\"type\":\"callout\",\"data\":{\"variant\":\"warning\",\"title\":\"Reranking cannot make a non-authoritative source authoritative\",\"body\":\"Relevance answers whether a candidate fits the query. Source-of-Truth architecture answers whether that candidate is allowed to establish the claim.\"},\"tunes\":{}},{\"id\":\"h-impl\",\"type\":\"header\",\"data\":{\"text\":\"Original implementation evidence\",\"level\":2},\"tunes\":{}},{\"id\":\"h-sot-engine\",\"type\":\"header\",\"data\":{\"text\":\"Source of Truth Research Engine: lexical and semantic retrieval are separate\",\"level\":3},\"tunes\":{}},{\"id\":\"p-sot-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The Source of Truth Research Engine contains a local lexical retrieval path using SQLite FTS5\u002FBM25 and a separate optional semantic retrieval path using locally generated embeddings.\"},\"tunes\":{}},{\"id\":\"p-sot-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Its semantic search implementation computes a query vector and compares it with stored chunk vectors using cosine similarity. The project deliberately treats semantic similarity as a discovery signal rather than evidence: a candidate must still be traced back to a concrete source and locator before it supports a claim.\"},\"tunes\":{}},{\"id\":\"p-sot-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"This is useful implementation evidence for R01 because the same corpus can support lexical ranking and vector similarity without confusing either mechanism with evidentiary authority.\"},\"tunes\":{}},{\"id\":\"h-client\",\"type\":\"header\",\"data\":{\"text\":\"Aaasaasa AI Client: Qdrant is a vector infrastructure component\",\"level\":3},\"tunes\":{}},{\"id\":\"p-client-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Aaasaasa AI Client includes Qdrant\u002Fvector infrastructure as a separate local resource. The Electron architecture exposes Qdrant services from the trusted main-process side rather than treating vector search as part of the model itself.\"},\"tunes\":{}},{\"id\":\"p-client-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"The repository contains a Qdrant client adapter, Qdrant service configuration and Docker-based Qdrant infrastructure. This demonstrates the architectural separation between AI provider\u002Fmodel execution and vector storage\u002Fsearch.\"},\"tunes\":{}},{\"id\":\"p-client-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The existence of Qdrant support should not be overstated as a complete production RAG pipeline. The evidence here is narrower: vector infrastructure is implemented as its own component boundary.\"},\"tunes\":{}},{\"id\":\"impl-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Implementation evidence\",\"What it demonstrates\"],[\"SQLite FTS5\u002FBM25 in Source of Truth Research Engine\",\"Lexical retrieval can exist independently of embeddings.\"],[\"Local Ollama embeddings\",\"Representation generation is its own stage.\"],[\"Stored semantic vectors + cosine comparison\",\"Semantic retrieval consumes embeddings after they have been produced.\"],[\"Qdrant support in Aaasaasa AI Client\",\"Vector storage\u002Fsearch is an infrastructure capability separate from the model provider.\"],[\"Evidence\u002Fprovenance rules in Source of Truth Research Engine\",\"Retrieved similarity does not equal authority or proof.\"],[\"No claimed custom reranker in these implementations\",\"Reranking is explained as an architectural stage, not falsely claimed as already implemented evidence.\"]]},\"tunes\":{}},{\"id\":\"impl-discipline\",\"type\":\"callout\",\"data\":{\"variant\":\"note\",\"title\":\"Evidence boundary\",\"body\":\"The current implementation evidence confirms lexical retrieval, embeddings, vector search infrastructure and provenance-aware retrieval. This article does \u003Cstrong>not\u003C\u002Fstrong> claim that a production cross-encoder reranking service is already implemented in these projects.\"},\"tunes\":{}},{\"id\":\"h-decisions\",\"type\":\"header\",\"data\":{\"text\":\"When do you need each component?\",\"level\":2},\"tunes\":{}},{\"id\":\"decision-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Need\",\"Likely component\"],[\"Semantic similarity across different wording\",\"Embedding model + vector similarity search\"],[\"Efficient search over a large vector corpus\",\"Vector index\u002Fdatabase or vector-capable search engine\"],[\"Exact identifiers, error codes or rare terms\",\"Lexical\u002Ffull-text retrieval such as BM25\"],[\"Both exact terminology and semantic meaning\",\"Hybrid lexical + semantic retrieval\"],[\"Candidate set is good but ordering is weak\",\"Reranker\"],[\"Relevant items are absent from candidate set\",\"Improve source coverage, chunking, retriever, filters or candidate count before reranking\"],[\"Hard tenant\u002Fsource\u002Fversion constraints\",\"Deterministic metadata\u002Fauthorization filtering\"],[\"Small corpus\",\"Potentially simple brute-force similarity or general-purpose database rather than dedicated vector DB\"]]},\"tunes\":{}},{\"id\":\"h-sequence\",\"type\":\"header\",\"data\":{\"text\":\"A practical retrieval design sequence\",\"level\":2},\"tunes\":{}},{\"id\":\"design-flow\",\"type\":\"processFlow\",\"data\":{\"title\":\"Design retrieval from requirements, not from product names\",\"orientation\":\"auto\",\"steps\":[{\"label\":\"1. Define the query types\",\"description\":\"Identify semantic questions, exact lookups, identifiers, current-state reads and domain-specific patterns.\"},{\"label\":\"2. Define eligible sources\",\"description\":\"Apply tenant, authorization, locale, version, source class and freshness constraints.\"},{\"label\":\"3. Establish lexical baseline\",\"description\":\"Measure whether simple full-text\u002FBM25 retrieval already solves much of the workload.\"},{\"label\":\"4. Add embeddings where semantic recall is needed\",\"description\":\"Choose and evaluate an embedding model against representative domain queries.\"},{\"label\":\"5. Choose vector storage\u002Findexing based on scale\",\"description\":\"Use brute force, database vector support or a dedicated vector engine according to requirements.\"},{\"label\":\"6. Evaluate first-stage recall\",\"description\":\"Confirm that relevant evidence enters a sufficiently large candidate set.\"},{\"label\":\"7. Add hybrid retrieval if signals are complementary\",\"description\":\"Fuse lexical and semantic rankings when both materially improve candidate generation.\"},{\"label\":\"8. Add reranking if ordering remains the bottleneck\",\"description\":\"Apply the stronger model only to the candidate set where its cost is justified.\"},{\"label\":\"9. Tune final context selection\",\"description\":\"Control redundancy, context budget, authority, diversity and evidence coverage before generation.\"},{\"label\":\"10. Evaluate end-to-end\",\"description\":\"Measure retrieval, context and answer quality separately so failures can be localized.\"}]},\"tunes\":{}},{\"id\":\"h-misconceptions\",\"type\":\"header\",\"data\":{\"text\":\"Common misconceptions\",\"level\":2},\"tunes\":{}},{\"id\":\"misconceptions-table\",\"type\":\"table\",\"data\":{\"withHeadings\":true,\"stretched\":false,\"content\":[[\"Misconception\",\"Correction\"],[\"“An embedding is a vector database.”\",\"An embedding is a representation; the database\u002Findex stores and searches representations.\"],[\"“A vector database creates semantic meaning.”\",\"The embedding model creates the representation; the vector system indexes and compares it.\"],[\"“RAG requires a vector database.”\",\"RAG requires retrieval, not a specific retrieval technology.\"],[\"“Reranking is the same as vector search.”\",\"Vector search generates candidates; reranking reorders a candidate set.\"],[\"“Rerankers fix poor recall.”\",\"They cannot promote a document that was never retrieved.\"],[\"“Dense search replaces BM25.”\",\"Lexical search remains valuable for exact terms, identifiers and specialized vocabulary.\"],[\"“Higher similarity means more authoritative.”\",\"Similarity and source authority are different dimensions.\"],[\"“More top-k always improves RAG.”\",\"Larger candidate sets can improve recall but add latency, noise and context-selection burden.\"],[\"“One score threshold works everywhere.”\",\"Scores depend on model, query, corpus and retrieval method and must be calibrated.\"],[\"“A dedicated vector DB is always more advanced.”\",\"It is only justified when its operational and retrieval capabilities match the requirements.\"]]},\"tunes\":{}},{\"id\":\"h-edge\",\"type\":\"header\",\"data\":{\"text\":\"Edge cases and limitations\",\"level\":2},\"tunes\":{}},{\"id\":\"p-edge-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"Some applications do not need semantic search. Exact database lookup or structured SQL can be more correct, faster and easier to audit than embedding retrieval.\"},\"tunes\":{}},{\"id\":\"p-edge-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Some corpora are so small that a full vector scan is acceptable. Approximate indexing adds complexity without meaningful benefit.\"},\"tunes\":{}},{\"id\":\"p-edge-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Some queries require high recall before any precision optimization. Legal discovery, research and compliance review may prefer broad candidate retrieval followed by transparent filtering and human review.\"},\"tunes\":{}},{\"id\":\"p-edge-4\",\"type\":\"paragraph\",\"data\":{\"text\":\"Multilingual and domain-specific retrieval can behave very differently across embedding models. Benchmark claims from public datasets should not be treated as proof for a private corpus.\"},\"tunes\":{}},{\"id\":\"p-edge-5\",\"type\":\"paragraph\",\"data\":{\"text\":\"Reranking latency grows with the number and length of candidates. Candidate size should therefore be tuned as an accuracy\u002Fcost\u002Flatency variable rather than copied from a tutorial.\"},\"tunes\":{}},{\"id\":\"h-change\",\"type\":\"header\",\"data\":{\"text\":\"What would change this answer?\",\"level\":2},\"tunes\":{}},{\"id\":\"p-change-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The component boundaries would not change if a vendor packages embedding generation, vector indexing and reranking behind one API. The product may hide the stages, but they remain conceptually different responsibilities with different failure modes.\"},\"tunes\":{}},{\"id\":\"p-change-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Future embedding or retrieval models may reduce the need for separate reranking in some workloads, while stronger late-interaction or learned sparse methods can blur traditional dense\u002Flexical categories. The architecture should still ask which stage produces representations, which stage generates candidates and which stage refines ranking.\"},\"tunes\":{}},{\"id\":\"p-change-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The best design also changes with corpus size, query mix, language, domain terminology, update frequency, source authority, latency budget and evaluation results.\"},\"tunes\":{}},{\"id\":\"h-related\",\"type\":\"header\",\"data\":{\"text\":\"Related canonical knowledge\",\"level\":2},\"tunes\":{}},{\"id\":\"p-related-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"R01 assumes the basic RAG concept is already understood. RAG is the wider pattern in which retrieved external information is supplied to a model; embeddings, vector search and reranking are optional retrieval components inside that pattern.\"},\"tunes\":{}},{\"id\":\"ref-rag\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works\",\"title\":\"What Is RAG? The Simplest Explanation of How It Works\",\"excerpt\":\"A plain-English foundation for how retrieval brings external knowledge into the model context.\",\"ctaLabel\":\"Read the RAG foundation\"},\"tunes\":{}},{\"id\":\"p-related-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"When retrieval fails, diagnose source coverage, retrieval, ranking, context assembly and generation separately rather than treating the whole system as one “RAG failure.”\"},\"tunes\":{}},{\"id\":\"ref-rag-failed\",\"type\":\"referralArticle\",\"data\":{\"url\":\"https:\u002F\u002Fstajic.de\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method\",\"title\":\"RAG Failed — But Which Layer Actually Failed? A Diagnostic Method\",\"excerpt\":\"A layer-by-layer method for isolating source coverage, retrieval, ranking, context assembly, generation, evidence attribution and freshness failures.\",\"ctaLabel\":\"Read the RAG diagnostic method\"},\"tunes\":{}},{\"id\":\"p-related-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"Source-of-Truth architecture is the authority layer around retrieval: it decides which source can establish a claim, while embeddings and ranking only decide which candidates appear relevant.\"},\"tunes\":{}},{\"id\":\"h-faq\",\"type\":\"header\",\"data\":{\"text\":\"Frequently asked questions\",\"level\":2},\"tunes\":{}},{\"id\":\"faq\",\"type\":\"faq\",\"data\":{\"title\":\"Embeddings, vector databases and reranking\",\"items\":[{\"id\":\"faq1\",\"question\":\"What is the difference between embeddings and a vector database?\",\"answer\":\"Embeddings are numerical representations produced by a model. A vector database or vector index stores and searches those representations together with IDs and metadata.\"},{\"id\":\"faq2\",\"question\":\"What does a reranker do?\",\"answer\":\"A reranker takes an already retrieved candidate set and re-scores or reorders those candidates using a stronger relevance model or scoring method.\"},{\"id\":\"faq3\",\"question\":\"Does RAG require a vector database?\",\"answer\":\"No. RAG requires retrieval of external information. Retrieval can use lexical search, SQL, APIs, graphs, vector search, hybrid search or combinations of these.\"},{\"id\":\"faq4\",\"question\":\"Why not use the reranker on the whole corpus?\",\"answer\":\"Rerankers commonly perform more expensive query-document interaction, so they are usually applied to a small top-k candidate set after a faster first-stage retriever.\"},{\"id\":\"faq5\",\"question\":\"Can reranking fix a missing document?\",\"answer\":\"No. If the relevant document was not retrieved into the candidate set, reranking has nothing to promote.\"},{\"id\":\"faq6\",\"question\":\"Is cosine similarity a relevance probability?\",\"answer\":\"No. It is a similarity measure whose numeric meaning depends on the embedding model and corpus. It should not be treated as a universal probability of relevance.\"},{\"id\":\"faq7\",\"question\":\"Should I use BM25 and vector search together?\",\"answer\":\"Use hybrid retrieval when evaluation shows that lexical and semantic signals recover complementary relevant documents. It is not automatically better for every corpus.\"},{\"id\":\"faq8\",\"question\":\"When do I need a dedicated vector database?\",\"answer\":\"When vector indexing, filtering, scale, updates, distributed operation or other vector-specific requirements justify a specialized system. Small workloads may not need one.\"}]},\"tunes\":{}},{\"id\":\"h-glossary\",\"type\":\"header\",\"data\":{\"text\":\"Glossary\",\"level\":2},\"tunes\":{}},{\"id\":\"glossary\",\"type\":\"glossary\",\"data\":{\"title\":\"Key retrieval terms\",\"entries\":[{\"term\":\"Embedding\",\"definition\":\"A numerical representation of content produced by an embedding model for similarity, clustering, retrieval or related tasks.\",\"anchor\":\"embedding\"},{\"term\":\"Dense vector\",\"definition\":\"A vector representation in which many dimensions carry non-zero values, commonly used in semantic retrieval.\",\"anchor\":\"dense-vector\"},{\"term\":\"Sparse vector\",\"definition\":\"A high-dimensional representation in which most dimensions are zero, often preserving stronger token- or term-like structure.\",\"anchor\":\"sparse-vector\"},{\"term\":\"Vector index\",\"definition\":\"A data structure that organizes vectors for efficient similarity or nearest-neighbor retrieval.\",\"anchor\":\"vector-index\"},{\"term\":\"Vector database\",\"definition\":\"A storage\u002Fsearch system designed to manage vectors, associated metadata and vector retrieval workloads.\",\"anchor\":\"vector-database\"},{\"term\":\"ANN\",\"definition\":\"Approximate nearest-neighbor search, which trades exact exhaustive comparison for faster retrieval at scale.\",\"anchor\":\"ann\"},{\"term\":\"HNSW\",\"definition\":\"Hierarchical Navigable Small World, a graph-based approximate nearest-neighbor indexing approach widely used for vector retrieval.\",\"anchor\":\"hnsw\"},{\"term\":\"BM25\",\"definition\":\"A lexical relevance-ranking method based on term occurrence and corpus statistics, widely used in full-text search.\",\"anchor\":\"bm25\"},{\"term\":\"Hybrid search\",\"definition\":\"Retrieval that combines results or scores from multiple retrieval methods such as lexical and vector search.\",\"anchor\":\"hybrid-search\"},{\"term\":\"Reranking\",\"definition\":\"A later retrieval stage that re-scores and reorders an already generated candidate set.\",\"anchor\":\"reranking\"},{\"term\":\"Bi-encoder\",\"definition\":\"An architecture that encodes query and candidate independently, enabling precomputation and scalable similarity search.\",\"anchor\":\"bi-encoder\"},{\"term\":\"Cross-encoder\",\"definition\":\"A model that jointly processes a query and candidate text, often improving relevance judgment at higher computational cost.\",\"anchor\":\"cross-encoder\"},{\"term\":\"Recall@k\",\"definition\":\"The fraction of relevant items recovered within the top k retrieved candidates.\",\"anchor\":\"recall-at-k\"},{\"term\":\"nDCG\",\"definition\":\"Normalized Discounted Cumulative Gain, a ranking metric that rewards relevant results appearing higher in an ordered list.\",\"anchor\":\"ndcg\"}]},\"tunes\":{}},{\"id\":\"h-conclusion\",\"type\":\"header\",\"data\":{\"text\":\"Conclusion\",\"level\":2},\"tunes\":{}},{\"id\":\"p-conclusion-1\",\"type\":\"paragraph\",\"data\":{\"text\":\"The clean retrieval model is simple: embeddings represent meaning, vector search retrieves candidates, and rerankers refine candidate ordering.\"},\"tunes\":{}},{\"id\":\"p-conclusion-2\",\"type\":\"paragraph\",\"data\":{\"text\":\"Once those boundaries are explicit, architecture decisions become easier to diagnose. Missing candidates point toward source coverage, chunking, embeddings, filters or first-stage retrieval. Poor ordering points toward ranking, fusion or reranking. Incorrect final answers can then be investigated separately at context and generation layers.\"},\"tunes\":{}},{\"id\":\"p-conclusion-3\",\"type\":\"paragraph\",\"data\":{\"text\":\"The most important result is not choosing the most fashionable retrieval component. It is building a retrieval pipeline whose stages, authority boundaries, metrics and failure modes can be measured independently.\"},\"tunes\":{}},{\"id\":\"h-sources\",\"type\":\"header\",\"data\":{\"text\":\"Primary sources and implementation evidence\",\"level\":2},\"tunes\":{}},{\"id\":\"p-sources-note\",\"type\":\"paragraph\",\"data\":{\"text\":\"The external references below document the representation, vector-search and reranking mechanisms used in this article. Project-specific sections are original implementation evidence and are intentionally narrower than claims about complete production RAG maturity.\"},\"tunes\":{}},{\"id\":\"src-sbert\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Farxiv.org\u002Fabs\u002F1908.10084\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks\",\"description\":\"Foundational paper demonstrating independently computable sentence embeddings for efficient semantic similarity search.\"}},\"tunes\":{}},{\"id\":\"src-qdrant-overview\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fqdrant.tech\u002Fdocumentation\u002Foverview\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Qdrant — Architecture and data structure overview\",\"description\":\"Official documentation describing collections, points, vectors, payload metadata and HNSW-based similarity indexing.\"}},\"tunes\":{}},{\"id\":\"src-qdrant-search\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fqdrant.tech\u002Fdocumentation\u002Fsearch\u002Fsearch\u002F\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Qdrant — Search\",\"description\":\"Official vector-search documentation covering similarity queries, filtering, exact versus approximate search and dense\u002Fsparse behavior.\"}},\"tunes\":{}},{\"id\":\"src-elastic-vector\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.elastic.co\u002Fdocs\u002Fsolutions\u002Fsearch\u002Fvector\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Elastic — Vector search\",\"description\":\"Current documentation on dense\u002Fsparse vector retrieval, lexical\u002Fvector combinations and multi-stage search pipelines.\"}},\"tunes\":{}},{\"id\":\"src-elastic-rerank\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.elastic.co\u002Fdocs\u002Fsolutions\u002Fsearch\u002Franking\u002Fsemantic-reranking\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Elastic — Semantic reranking\",\"description\":\"Current guidance defining semantic reranking as a later-stage relevance operation over a smaller candidate set.\"}},\"tunes\":{}},{\"id\":\"src-cohere-rerank\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fdocs.cohere.com\u002Fdocs\u002Freranking-with-cohere\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"Cohere — Reranking with Cohere\",\"description\":\"Current documentation showing reranking as a second-stage improvement over lexical or semantic first-stage retrieval.\"}},\"tunes\":{}},{\"id\":\"src-sqlite-fts5\",\"type\":\"linkTool\",\"data\":{\"link\":\"https:\u002F\u002Fwww.sqlite.org\u002Ffts5.html\",\"meta\":{\"image\":{\"url\":\"\"},\"title\":\"SQLite FTS5\",\"description\":\"Official SQLite documentation for full-text search and the built-in BM25 ranking function used as lexical retrieval evidence.\"}},\"tunes\":{}}],\"version\":\"2.31.6\"}",{"time":1812,"blocks":1813,"version":2648},1791489989811,[1814,1818,1823,1828,1833,1837,1841,1845,1849,1853,1857,1861,1865,1869,1892,1896,1900,1904,1908,1933,1937,1941,1945,1949,1953,1957,1961,1965,1969,1973,1977,1981,1985,1990,1994,1998,2002,2006,2010,2014,2018,2022,2026,2030,2034,2038,2042,2046,2050,2054,2058,2062,2066,2094,2098,2102,2106,2111,2115,2119,2123,2127,2131,2135,2139,2143,2147,2151,2155,2159,2163,2167,2199,2203,2207,2234,2238,2242,2246,2251,2255,2259,2263,2267,2271,2275,2279,2283,2287,2311,2316,2320,2350,2354,2389,2393,2430,2434,2438,2442,2446,2450,2454,2458,2462,2466,2470,2474,2478,2485,2489,2496,2500,2504,2533,2537,2577,2581,2585,2589,2593,2597,2601,2607,2614,2621,2628,2635,2642],{"id":214,"data":1815,"type":217,"tunes":1817},{"text":1816},"Embeddings, vector databases and rerankers are three different parts of retrieval. An embedding model converts text or other data into numerical representations; a vector database or vector index stores and searches those representations to retrieve candidate items; a reranker takes a smaller candidate set and reorders it using a more expensive relevance model or scoring method. They often appear together in RAG, but none of them is the same thing as RAG, and none is mandatory in every retrieval system.",{},{"id":220,"data":1819,"type":225,"tunes":1822},{"body":1820,"title":1821,"variant":224},"\u003Cstrong>Embeddings represent. Vector search retrieves. Reranking refines.\u003C\u002Fstrong>\u003Cbr>\u003Cbr>A useful mental model is:\u003Cbr>\u003Cstrong>content → embedding → candidate retrieval → reranking → selected context → model\u003C\u002Fstrong>.\u003Cbr>\u003Cbr>The boundaries matter because each layer fails differently. Bad embeddings distort semantic similarity. A weak retrieval index misses useful candidates. A reranker can reorder candidates, but it cannot recover a relevant document that was never retrieved.","Direct answer",{},{"id":228,"data":1824,"type":225,"tunes":1827},{"body":1825,"title":1826,"variant":232},"A vector database is not an embedding model. An embedding is not a search result. A reranker is not a vector database. RAG is the wider pattern that can use any of these components to retrieve external information before generation.","Do not collapse the retrieval stack",{},{"id":235,"data":1829,"type":225,"tunes":1832},{"body":1830,"title":1831,"variant":239},"The basic architecture is stable even though products evolve rapidly. Current Qdrant documentation separates vectors, payload metadata, collections and vector indexes; current Elastic guidance treats semantic reranking as a later-stage operation over a small candidate set; current Cohere documentation likewise describes reranking as a second-stage improvement over lexical or semantic search.","Current-source note — 8 October 2026",{},{"id":242,"data":1834,"type":247,"tunes":1836},{"title":1835,"maxLevel":245,"minLevel":246},"Contents",{},{"id":250,"data":1838,"type":41,"tunes":1840},{"text":1839,"level":246},"What this really means",{},{"id":255,"data":1842,"type":217,"tunes":1844},{"text":1843},"Search systems have two competing goals: find enough potentially relevant material and put the best material near the top. Fast first-stage retrieval usually optimizes candidate generation. A stronger second-stage model can then spend more computation distinguishing the best candidates.",{},{"id":260,"data":1846,"type":217,"tunes":1848},{"text":1847},"Embeddings, vector indexes and rerankers occupy different positions in that process. Treating them as one feature hides important design choices about recall, precision, latency, storage, metadata filtering and model cost.",{},{"id":265,"data":1850,"type":217,"tunes":1852},{"text":1851},"The distinction also prevents a common RAG mistake: assuming that storing document embeddings in a vector database automatically creates high-quality retrieval. Retrieval quality depends on the embedding model, chunking, metadata, query construction, index configuration, candidate count, hybrid retrieval, reranking and the authority of the underlying sources.",{},{"id":270,"data":1854,"type":41,"tunes":1856},{"text":1855,"level":246},"The simplest example",{},{"id":275,"data":1858,"type":217,"tunes":1860},{"text":1859},"Suppose a knowledge base contains 100,000 document chunks. A user asks: “How do I revoke an API token?”",{},{"id":280,"data":1862,"type":217,"tunes":1864},{"text":1863},"First, an embedding model can encode the query into a vector. Document chunks may already have their own stored embeddings. A vector search then compares the query vector to the indexed document vectors and returns, for example, 30 likely candidates.",{},{"id":285,"data":1866,"type":217,"tunes":1868},{"text":1867},"Those 30 candidates can then be passed to a reranker. The reranker compares the query more directly with each candidate and produces a new relevance ordering. The application might keep the best five for the model context.",{},{"id":290,"data":1870,"type":313,"tunes":1891},{"steps":1871,"title":1890,"orientation":312},[1872,1875,1878,1881,1884,1887],{"label":1873,"description":1874},"1. Embed documents","Convert each searchable chunk into a numerical representation, usually at ingest time.",{"label":1876,"description":1877},"2. Store\u002Findex vectors","Associate vectors with document IDs and metadata in a searchable vector index or database.",{"label":1879,"description":1880},"3. Embed the query","Encode the user's query using the compatible embedding model and query configuration.",{"label":1882,"description":1883},"4. Retrieve candidates","Run vector similarity search, often with metadata filters, to produce a larger top-k candidate set.",{"label":1885,"description":1886},"5. Rerank candidates","Apply a stronger relevance model to the query and the small candidate set.",{"label":1888,"description":1889},"6. Select context","Keep the most useful passages for the downstream answer, agent step or search result.","A basic two-stage semantic retrieval pipeline",{},{"id":316,"data":1893,"type":41,"tunes":1895},{"text":1894,"level":246},"Where the simple example stops",{},{"id":321,"data":1897,"type":217,"tunes":1899},{"text":1898},"Real retrieval systems do not have to use dense embeddings at all. Keyword search such as BM25 can be the first-stage retriever. Sparse learned retrieval, SQL filters, graph traversal or application APIs can also generate candidates.",{},{"id":326,"data":1901,"type":217,"tunes":1903},{"text":1902},"A reranker also does not care that the candidates came from a vector database. It can rerank BM25 results, hybrid results, hand-selected documents or candidates from multiple retrievers.",{},{"id":331,"data":1905,"type":217,"tunes":1907},{"text":1906},"Likewise, embeddings do not require a specialized vector database. Small datasets can be compared in memory or with general-purpose databases and vector extensions. Specialized vector systems become useful when indexing, approximate nearest-neighbor search, filtering, scale, update behavior or operational requirements justify them.",{},{"id":336,"data":1909,"type":372,"tunes":1932},{"rows":1910,"title":1926,"layout":361,"columns":1927},[1911,1914,1917,1920,1923],{"id":340,"label":1912,"values":1913},"Primary job",[343,343,343],{"id":345,"label":1915,"values":1916},"Typical input",[343,343,343],{"id":349,"label":1918,"values":1919},"Typical output",[343,343,343],{"id":353,"label":1921,"values":1922},"Cost profile",[343,343,343],{"id":357,"label":1924,"values":1925},"Typical failure",[343,343,343],"Three different retrieval components",[1928,1929,1931],{"id":364,"label":365},{"id":367,"label":1930},"Vector database \u002F index",{"id":370,"label":371},{},{"id":375,"data":1934,"type":41,"tunes":1936},{"text":1935,"level":246},"Embeddings: representation, not retrieval",{},{"id":380,"data":1938,"type":217,"tunes":1940},{"text":1939},"An embedding is a numerical representation produced by a model. For semantic retrieval, texts with related meaning are intended to occupy useful positions in a vector space so that a similarity or distance function can compare them.",{},{"id":385,"data":1942,"type":217,"tunes":1944},{"text":1943},"Sentence-BERT was an influential step in making sentence-level semantic similarity practical with bi-encoder-style representations that can be computed independently and compared efficiently. The general idea remains central to modern dense retrieval: precompute document representations, compute the query representation at search time, then compare them.",{},{"id":390,"data":1946,"type":217,"tunes":1948},{"text":1947},"The embedding itself does not search a corpus. It is data produced by an embedding model. Retrieval begins when the system compares the query representation against stored candidates.",{},{"id":395,"data":1950,"type":41,"tunes":1952},{"text":1951,"level":245},"The embedding model defines the representation space",{},{"id":400,"data":1954,"type":217,"tunes":1956},{"text":1955},"Document and query vectors must be compatible with the model and configuration used to create them. Replacing an embedding model can change dimensionality, similarity behavior, language coverage and domain performance.",{},{"id":405,"data":1958,"type":217,"tunes":1960},{"text":1959},"That is why an embedding-model migration is not merely an API-name change. Existing documents may need to be re-embedded and the index rebuilt or versioned.",{},{"id":410,"data":1962,"type":41,"tunes":1964},{"text":1963,"level":245},"Dense and sparse representations are different",{},{"id":415,"data":1966,"type":217,"tunes":1968},{"text":1967},"Dense embeddings usually contain many non-zero dimensions and are commonly used for semantic similarity. Sparse representations contain many zeros and can preserve stronger token- or term-like structure.",{},{"id":420,"data":1970,"type":217,"tunes":1972},{"text":1971},"Both can support semantic retrieval, and modern search systems can combine dense, sparse and lexical signals. “Vector search” therefore does not always mean one dense cosine-similarity pipeline.",{},{"id":425,"data":1974,"type":41,"tunes":1976},{"text":1975,"level":245},"Similarity functions are part of the representation contract",{},{"id":430,"data":1978,"type":217,"tunes":1980},{"text":1979},"Cosine similarity, dot product and Euclidean distance do not mean the same thing. The correct metric depends on how the embedding model was trained and normalized.",{},{"id":435,"data":1982,"type":217,"tunes":1984},{"text":1983},"Current Qdrant documentation, for example, requires a distance metric as part of vector configuration and documents cosine, dot-product and Euclidean-style choices. The important architectural rule is to treat the metric as part of the embedding\u002Findex contract rather than choose one arbitrarily.",{},{"id":440,"data":1986,"type":225,"tunes":1989},{"body":1987,"title":1988,"variant":232},"Two passages can be semantically close while one is stale, unauthorized or wrong. Embeddings estimate representational similarity; they do not determine Source-of-Truth authority, freshness or evidentiary validity.","Embedding similarity is not factual support",{},{"id":446,"data":1991,"type":41,"tunes":1993},{"text":1992,"level":246},"Vector databases and indexes: candidate retrieval",{},{"id":451,"data":1995,"type":217,"tunes":1997},{"text":1996},"A vector database or vector-capable search system organizes vector representations so the application can retrieve nearby candidates efficiently. Practical systems usually associate vectors with IDs and payload metadata such as source, language, tenant, document type, timestamp or access scope.",{},{"id":456,"data":1999,"type":217,"tunes":2001},{"text":2000},"Qdrant, for example, organizes data into collections of points where a point contains a vector and optional payload metadata. Its documentation describes HNSW-based similarity search and metadata filtering as separate capabilities of the retrieval layer.",{},{"id":461,"data":2003,"type":217,"tunes":2005},{"text":2004},"That distinction matters: the vector index answers a nearest-neighbor problem, while payload filters enforce structural constraints such as tenant, document class or language.",{},{"id":466,"data":2007,"type":41,"tunes":2009},{"text":2008,"level":245},"Approximate nearest-neighbor search trades exactness for efficiency",{},{"id":471,"data":2011,"type":217,"tunes":2013},{"text":2012},"Comparing one query vector against every vector can be practical for small collections but expensive at large scale. Approximate nearest-neighbor indexes such as HNSW reduce search cost by navigating an index structure instead of exhaustively scanning every vector.",{},{"id":476,"data":2015,"type":217,"tunes":2017},{"text":2016},"Approximate search introduces a recall\u002Flatency trade-off. Faster search can miss candidates that exact search would return. Index parameters therefore affect retrieval quality, not just infrastructure performance.",{},{"id":481,"data":2019,"type":217,"tunes":2021},{"text":2020},"Qdrant exposes both HNSW-related parameters and an exact-search option, illustrating that vector storage and approximate retrieval policy are separate decisions.",{},{"id":486,"data":2023,"type":41,"tunes":2025},{"text":2024,"level":245},"Metadata filtering belongs before or during candidate retrieval",{},{"id":491,"data":2027,"type":217,"tunes":2029},{"text":2028},"If the user may only access tenant A, retrieving semantically similar chunks from tenant B and attempting to remove them later is the wrong security boundary. Authorization and hard eligibility filters should constrain the candidate space before those candidates can influence downstream processing.",{},{"id":496,"data":2031,"type":217,"tunes":2033},{"text":2032},"The same principle applies to locale, document status, source class, date, product version and other deterministic constraints. Similarity should rank eligible candidates; it should not override eligibility.",{},{"id":501,"data":2035,"type":41,"tunes":2037},{"text":2036,"level":245},"A vector database is optional",{},{"id":506,"data":2039,"type":217,"tunes":2041},{"text":2040},"For a small corpus, brute-force cosine comparison may be simple and sufficient. A relational database with vector support may also be adequate. A dedicated vector database becomes valuable when its indexing, filtering, distributed storage, update behavior or operational features solve a real requirement.",{},{"id":511,"data":2043,"type":217,"tunes":2045},{"text":2044},"Choosing a vector database because “RAG needs one” reverses the architecture process. Start with retrieval requirements and scale, then select the storage\u002Findex technology.",{},{"id":516,"data":2047,"type":41,"tunes":2049},{"text":2048,"level":246},"Reranking: second-stage relevance refinement",{},{"id":521,"data":2051,"type":217,"tunes":2053},{"text":2052},"A reranker receives a query and a smaller set of already retrieved candidates, then assigns stronger relevance scores or a new ordering. It is normally more computationally expensive than first-stage retrieval, which is why it is applied after candidate generation rather than to the entire corpus.",{},{"id":526,"data":2055,"type":217,"tunes":2057},{"text":2056},"Current Elastic guidance describes semantic reranking as a final-stage technique over a small top-k set and notes that it can refine lexical, semantic or hybrid retrieval. Cohere documents the same architecture: first-stage lexical or semantic search followed by a reranking stage.",{},{"id":531,"data":2059,"type":217,"tunes":2061},{"text":2060},"A common implementation uses a cross-encoder-like model that examines the query and each candidate together. That richer interaction can distinguish relevance more precisely than independent embedding similarity, but it is much more expensive at corpus scale.",{},{"id":536,"data":2063,"type":41,"tunes":2065},{"text":2064,"level":245},"Bi-encoder retrieval and cross-encoder reranking solve different cost problems",{},{"id":541,"data":2067,"type":361,"tunes":2093},{"content":2068,"stretched":42,"withHeadings":13},[2069,2073,2077,2081,2085,2089],[2070,2071,2072],"Property","Bi-encoder \u002F embedding retrieval","Cross-encoder-style reranking",[2074,2075,2076],"Encoding","Query and documents represented independently","Query and candidate processed jointly",[2078,2079,2080],"Document computation","Can be precomputed at ingest","Normally recomputed per query-candidate pair",[2082,2083,2084],"Corpus-scale search","Suitable with vector indexes","Usually too expensive across the entire corpus",[2086,2087,2088],"Typical role","High-recall candidate generation","High-precision ordering of a small candidate set",[2090,2091,2092],"Main trade-off","Fast and scalable but relevance interaction is compressed into vectors","Richer relevance judgment but higher latency\u002Fcost",{},{"id":570,"data":2095,"type":41,"tunes":2097},{"text":2096,"level":245},"A reranker cannot recover what retrieval missed",{},{"id":575,"data":2099,"type":217,"tunes":2101},{"text":2100},"If the relevant document is absent from the candidate set, reranking has nothing to promote. This is the central reason to evaluate retrieval and reranking separately.",{},{"id":580,"data":2103,"type":217,"tunes":2105},{"text":2104},"A pipeline can have excellent reranker precision and still fail because first-stage recall is poor. Increasing reranker quality will not repair missing source coverage, bad chunking, restrictive filters or a weak candidate retriever.",{},{"id":585,"data":2107,"type":225,"tunes":2110},{"body":2108,"title":2109,"variant":589},"First stage: \u003Cstrong>do not miss the useful candidates.\u003C\u002Fstrong>\u003Cbr>Second stage: \u003Cstrong>put the best candidates first.\u003C\u002Fstrong>\u003Cbr>\u003Cbr>This is not a universal mathematical rule, but it is a useful engineering model for two-stage retrieval.","Useful retrieval objective",{},{"id":592,"data":2112,"type":41,"tunes":2114},{"text":2113,"level":246},"Hybrid retrieval is a separate design choice",{},{"id":597,"data":2116,"type":217,"tunes":2118},{"text":2117},"Dense semantic retrieval is strong when query and document use different wording but express related meaning. Lexical retrieval is strong when exact terms, identifiers, names, codes or rare phrases matter.",{},{"id":602,"data":2120,"type":217,"tunes":2122},{"text":2121},"Hybrid retrieval combines multiple candidate signals, often lexical BM25 and vector similarity, then merges rankings using a method such as Reciprocal Rank Fusion or a weighted score combination.",{},{"id":607,"data":2124,"type":217,"tunes":2126},{"text":2125},"Reranking can then operate on the fused candidate set. Hybrid retrieval and reranking are therefore complementary but distinct stages.",{},{"id":612,"data":2128,"type":41,"tunes":2130},{"text":2129,"level":245},"BM25 is not obsolete because embeddings exist",{},{"id":617,"data":2132,"type":217,"tunes":2134},{"text":2133},"Keyword search can outperform dense retrieval for exact identifiers, version numbers, error messages, product codes and specialized vocabulary. SQLite FTS5, for example, includes a BM25 ranking function for full-text search.",{},{"id":622,"data":2136,"type":217,"tunes":2138},{"text":2137},"A strong retrieval architecture can use lexical retrieval as the only first stage, vector retrieval as the only first stage, or combine both depending on the corpus and query distribution.",{},{"id":627,"data":2140,"type":41,"tunes":2142},{"text":2141,"level":246},"Chunking changes what embeddings and rerankers can see",{},{"id":632,"data":2144,"type":217,"tunes":2146},{"text":2145},"If a document is split poorly, no later retrieval component can fully reconstruct the missing semantic unit. A chunk that cuts a condition away from its exception may embed misleadingly and may also be reranked incorrectly because the candidate text is incomplete.",{},{"id":637,"data":2148,"type":217,"tunes":2150},{"text":2149},"Chunk size, overlap, structural boundaries and metadata therefore affect both candidate recall and reranker judgment. Retrieval evaluation should test the complete ingestion-to-ranking pipeline, not only the embedding model.",{},{"id":642,"data":2152,"type":41,"tunes":2154},{"text":2153,"level":246},"Do not compare retrieval scores as if they were universal probabilities",{},{"id":647,"data":2156,"type":217,"tunes":2158},{"text":2157},"Cosine similarity, BM25 scores, sparse-vector scores, RRF ranks and reranker scores have different meanings. A score of 0.82 from one embedding model is not automatically comparable with 0.82 from another model or with a reranker score.",{},{"id":652,"data":2160,"type":217,"tunes":2162},{"text":2161},"Thresholds should be calibrated for the actual model, corpus and task. Current Elastic guidance also notes that embedding similarity scores can be query-dependent, which makes universal cutoffs risky.",{},{"id":657,"data":2164,"type":41,"tunes":2166},{"text":2165,"level":246},"Evaluate retrieval stages separately",{},{"id":662,"data":2168,"type":361,"tunes":2198},{"content":2169,"stretched":42,"withHeadings":13},[2170,2174,2178,2181,2184,2187,2190,2194],[2171,2172,2173],"Layer","Useful question","Example metric or test",[2175,2176,2177],"Source coverage","Does the corpus contain the needed information?","Coverage audit \u002F known-answer source set",[674,2179,2180],"Is the needed evidence retrievable as a coherent unit?","Chunk-level support review",[2182,2183,680],"First-stage retrieval","Does the relevant item enter the candidate set?",[682,2185,2186],"How high does relevant evidence appear?","MRR, nDCG, precision@k",[686,2188,2189],"Does second-stage scoring improve ordering?","Delta nDCG \u002F MRR \u002F precision",[2191,2192,2193],"Context selection","Do the final selected passages contain sufficient support?","Context relevance \u002F coverage",[2195,2196,2197],"Answer stage","Does the model use the selected evidence correctly?","Faithfulness \u002F claim-evidence evaluation",{},{"id":699,"data":2200,"type":217,"tunes":2202},{"text":2201},"This separation is operationally important. If Recall@50 is poor, the reranker is not the first component to fix. If Recall@50 is strong but the best passage remains at rank 38, reranking or ranking fusion becomes a plausible target.",{},{"id":704,"data":2204,"type":41,"tunes":2206},{"text":2205,"level":246},"Which layer actually failed?",{},{"id":709,"data":2208,"type":372,"tunes":2233},{"rows":2209,"title":2225,"layout":361,"columns":2226},[2210,2213,2216,2219,2222],{"id":713,"label":2211,"values":2212},"Relevant document never appears",[343,343,343],{"id":717,"label":2214,"values":2215},"Relevant document appears too low",[343,343,343],{"id":721,"label":2217,"values":2218},"Semantically good but forbidden result",[343,343,343],{"id":725,"label":2220,"values":2221},"Relevant but outdated result",[343,343,343],{"id":729,"label":2223,"values":2224},"Correct result retrieved but omitted from prompt",[343,343,343],"Symptoms and likely retrieval layer",[2227,2229,2231],{"id":735,"label":2228},"Observed symptom",{"id":738,"label":2230},"Likely layer",{"id":741,"label":2232},"First diagnostic",{},{"id":745,"data":2235,"type":41,"tunes":2237},{"text":2236,"level":246},"Relevance and Source of Truth are different",{},{"id":750,"data":2239,"type":217,"tunes":2241},{"text":2240},"A reranker can make a stale document look extremely relevant. A vector index can retrieve a secondary summary that is semantically closer than the primary source. Retrieval quality therefore cannot replace authority rules.",{},{"id":755,"data":2243,"type":217,"tunes":2245},{"text":2244},"Where source authority matters, metadata filters, source classes, version rules and provenance should constrain retrieval before the result becomes model context.",{},{"id":760,"data":2247,"type":225,"tunes":2250},{"body":2248,"title":2249,"variant":232},"Relevance answers whether a candidate fits the query. Source-of-Truth architecture answers whether that candidate is allowed to establish the claim.","Reranking cannot make a non-authoritative source authoritative",{},{"id":766,"data":2252,"type":41,"tunes":2254},{"text":2253,"level":246},"Original implementation evidence",{},{"id":771,"data":2256,"type":41,"tunes":2258},{"text":2257,"level":245},"Source of Truth Research Engine: lexical and semantic retrieval are separate",{},{"id":776,"data":2260,"type":217,"tunes":2262},{"text":2261},"The Source of Truth Research Engine contains a local lexical retrieval path using SQLite FTS5\u002FBM25 and a separate optional semantic retrieval path using locally generated embeddings.",{},{"id":781,"data":2264,"type":217,"tunes":2266},{"text":2265},"Its semantic search implementation computes a query vector and compares it with stored chunk vectors using cosine similarity. The project deliberately treats semantic similarity as a discovery signal rather than evidence: a candidate must still be traced back to a concrete source and locator before it supports a claim.",{},{"id":786,"data":2268,"type":217,"tunes":2270},{"text":2269},"This is useful implementation evidence for R01 because the same corpus can support lexical ranking and vector similarity without confusing either mechanism with evidentiary authority.",{},{"id":791,"data":2272,"type":41,"tunes":2274},{"text":2273,"level":245},"Aaasaasa AI Client: Qdrant is a vector infrastructure component",{},{"id":796,"data":2276,"type":217,"tunes":2278},{"text":2277},"Aaasaasa AI Client includes Qdrant\u002Fvector infrastructure as a separate local resource. The Electron architecture exposes Qdrant services from the trusted main-process side rather than treating vector search as part of the model itself.",{},{"id":801,"data":2280,"type":217,"tunes":2282},{"text":2281},"The repository contains a Qdrant client adapter, Qdrant service configuration and Docker-based Qdrant infrastructure. This demonstrates the architectural separation between AI provider\u002Fmodel execution and vector storage\u002Fsearch.",{},{"id":806,"data":2284,"type":217,"tunes":2286},{"text":2285},"The existence of Qdrant support should not be overstated as a complete production RAG pipeline. The evidence here is narrower: vector infrastructure is implemented as its own component boundary.",{},{"id":811,"data":2288,"type":361,"tunes":2310},{"content":2289,"stretched":42,"withHeadings":13},[2290,2293,2295,2298,2301,2304,2307],[2291,2292],"Implementation evidence","What it demonstrates",[818,2294],"Lexical retrieval can exist independently of embeddings.",[2296,2297],"Local Ollama embeddings","Representation generation is its own stage.",[2299,2300],"Stored semantic vectors + cosine comparison","Semantic retrieval consumes embeddings after they have been produced.",[2302,2303],"Qdrant support in Aaasaasa AI Client","Vector storage\u002Fsearch is an infrastructure capability separate from the model provider.",[2305,2306],"Evidence\u002Fprovenance rules in Source of Truth Research Engine","Retrieved similarity does not equal authority or proof.",[2308,2309],"No claimed custom reranker in these implementations","Reranking is explained as an architectural stage, not falsely claimed as already implemented evidence.",{},{"id":837,"data":2312,"type":225,"tunes":2315},{"body":2313,"title":2314,"variant":239},"The current implementation evidence confirms lexical retrieval, embeddings, vector search infrastructure and provenance-aware retrieval. This article does \u003Cstrong>not\u003C\u002Fstrong> claim that a production cross-encoder reranking service is already implemented in these projects.","Evidence boundary",{},{"id":843,"data":2317,"type":41,"tunes":2319},{"text":2318,"level":246},"When do you need each component?",{},{"id":848,"data":2321,"type":361,"tunes":2349},{"content":2322,"stretched":42,"withHeadings":13},[2323,2326,2329,2332,2335,2338,2340,2343,2346],[2324,2325],"Need","Likely component",[2327,2328],"Semantic similarity across different wording","Embedding model + vector similarity search",[2330,2331],"Efficient search over a large vector corpus","Vector index\u002Fdatabase or vector-capable search engine",[2333,2334],"Exact identifiers, error codes or rare terms","Lexical\u002Ffull-text retrieval such as BM25",[2336,2337],"Both exact terminology and semantic meaning","Hybrid lexical + semantic retrieval",[2339,371],"Candidate set is good but ordering is weak",[2341,2342],"Relevant items are absent from candidate set","Improve source coverage, chunking, retriever, filters or candidate count before reranking",[2344,2345],"Hard tenant\u002Fsource\u002Fversion constraints","Deterministic metadata\u002Fauthorization filtering",[2347,2348],"Small corpus","Potentially simple brute-force similarity or general-purpose database rather than dedicated vector DB",{},{"id":879,"data":2351,"type":41,"tunes":2353},{"text":2352,"level":246},"A practical retrieval design sequence",{},{"id":884,"data":2355,"type":313,"tunes":2388},{"steps":2356,"title":2387,"orientation":312},[2357,2360,2363,2366,2369,2372,2375,2378,2381,2384],{"label":2358,"description":2359},"1. Define the query types","Identify semantic questions, exact lookups, identifiers, current-state reads and domain-specific patterns.",{"label":2361,"description":2362},"2. Define eligible sources","Apply tenant, authorization, locale, version, source class and freshness constraints.",{"label":2364,"description":2365},"3. Establish lexical baseline","Measure whether simple full-text\u002FBM25 retrieval already solves much of the workload.",{"label":2367,"description":2368},"4. Add embeddings where semantic recall is needed","Choose and evaluate an embedding model against representative domain queries.",{"label":2370,"description":2371},"5. Choose vector storage\u002Findexing based on scale","Use brute force, database vector support or a dedicated vector engine according to requirements.",{"label":2373,"description":2374},"6. Evaluate first-stage recall","Confirm that relevant evidence enters a sufficiently large candidate set.",{"label":2376,"description":2377},"7. Add hybrid retrieval if signals are complementary","Fuse lexical and semantic rankings when both materially improve candidate generation.",{"label":2379,"description":2380},"8. Add reranking if ordering remains the bottleneck","Apply the stronger model only to the candidate set where its cost is justified.",{"label":2382,"description":2383},"9. Tune final context selection","Control redundancy, context budget, authority, diversity and evidence coverage before generation.",{"label":2385,"description":2386},"10. Evaluate end-to-end","Measure retrieval, context and answer quality separately so failures can be localized.","Design retrieval from requirements, not from product names",{},{"id":920,"data":2390,"type":41,"tunes":2392},{"text":2391,"level":246},"Common misconceptions",{},{"id":925,"data":2394,"type":361,"tunes":2429},{"content":2395,"stretched":42,"withHeadings":13},[2396,2399,2402,2405,2408,2411,2414,2417,2420,2423,2426],[2397,2398],"Misconception","Correction",[2400,2401],"“An embedding is a vector database.”","An embedding is a representation; the database\u002Findex stores and searches representations.",[2403,2404],"“A vector database creates semantic meaning.”","The embedding model creates the representation; the vector system indexes and compares it.",[2406,2407],"“RAG requires a vector database.”","RAG requires retrieval, not a specific retrieval technology.",[2409,2410],"“Reranking is the same as vector search.”","Vector search generates candidates; reranking reorders a candidate set.",[2412,2413],"“Rerankers fix poor recall.”","They cannot promote a document that was never retrieved.",[2415,2416],"“Dense search replaces BM25.”","Lexical search remains valuable for exact terms, identifiers and specialized vocabulary.",[2418,2419],"“Higher similarity means more authoritative.”","Similarity and source authority are different dimensions.",[2421,2422],"“More top-k always improves RAG.”","Larger candidate sets can improve recall but add latency, noise and context-selection burden.",[2424,2425],"“One score threshold works everywhere.”","Scores depend on model, query, corpus and retrieval method and must be calibrated.",[2427,2428],"“A dedicated vector DB is always more advanced.”","It is only justified when its operational and retrieval capabilities match the requirements.",{},{"id":963,"data":2431,"type":41,"tunes":2433},{"text":2432,"level":246},"Edge cases and limitations",{},{"id":968,"data":2435,"type":217,"tunes":2437},{"text":2436},"Some applications do not need semantic search. Exact database lookup or structured SQL can be more correct, faster and easier to audit than embedding retrieval.",{},{"id":973,"data":2439,"type":217,"tunes":2441},{"text":2440},"Some corpora are so small that a full vector scan is acceptable. Approximate indexing adds complexity without meaningful benefit.",{},{"id":978,"data":2443,"type":217,"tunes":2445},{"text":2444},"Some queries require high recall before any precision optimization. Legal discovery, research and compliance review may prefer broad candidate retrieval followed by transparent filtering and human review.",{},{"id":983,"data":2447,"type":217,"tunes":2449},{"text":2448},"Multilingual and domain-specific retrieval can behave very differently across embedding models. Benchmark claims from public datasets should not be treated as proof for a private corpus.",{},{"id":988,"data":2451,"type":217,"tunes":2453},{"text":2452},"Reranking latency grows with the number and length of candidates. Candidate size should therefore be tuned as an accuracy\u002Fcost\u002Flatency variable rather than copied from a tutorial.",{},{"id":993,"data":2455,"type":41,"tunes":2457},{"text":2456,"level":246},"What would change this answer?",{},{"id":998,"data":2459,"type":217,"tunes":2461},{"text":2460},"The component boundaries would not change if a vendor packages embedding generation, vector indexing and reranking behind one API. The product may hide the stages, but they remain conceptually different responsibilities with different failure modes.",{},{"id":1003,"data":2463,"type":217,"tunes":2465},{"text":2464},"Future embedding or retrieval models may reduce the need for separate reranking in some workloads, while stronger late-interaction or learned sparse methods can blur traditional dense\u002Flexical categories. The architecture should still ask which stage produces representations, which stage generates candidates and which stage refines ranking.",{},{"id":1008,"data":2467,"type":217,"tunes":2469},{"text":2468},"The best design also changes with corpus size, query mix, language, domain terminology, update frequency, source authority, latency budget and evaluation results.",{},{"id":1013,"data":2471,"type":41,"tunes":2473},{"text":2472,"level":246},"Related canonical knowledge",{},{"id":1018,"data":2475,"type":217,"tunes":2477},{"text":2476},"R01 assumes the basic RAG concept is already understood. RAG is the wider pattern in which retrieved external information is supplied to a model; embeddings, vector search and reranking are optional retrieval components inside that pattern.",{},{"id":1023,"data":2479,"type":1029,"tunes":2484},{"url":2480,"title":2481,"excerpt":2482,"ctaLabel":2483},"https:\u002F\u002Fstajic.de\u002Fblog\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works","What Is RAG? The Simplest Explanation of How It Works","A plain-English foundation for how retrieval brings external knowledge into the model context.","Read the RAG foundation",{},{"id":1032,"data":2486,"type":217,"tunes":2488},{"text":2487},"When retrieval fails, diagnose source coverage, retrieval, ranking, context assembly and generation separately rather than treating the whole system as one “RAG failure.”",{},{"id":1037,"data":2490,"type":1029,"tunes":2495},{"url":2491,"title":2492,"excerpt":2493,"ctaLabel":2494},"https:\u002F\u002Fstajic.de\u002Fblog\u002Frag-failed-but-which-layer-actually-failed-a-diagnostic-method","RAG Failed — But Which Layer Actually Failed? A Diagnostic Method","A layer-by-layer method for isolating source coverage, retrieval, ranking, context assembly, generation, evidence attribution and freshness failures.","Read the RAG diagnostic method",{},{"id":1045,"data":2497,"type":217,"tunes":2499},{"text":2498},"Source-of-Truth architecture is the authority layer around retrieval: it decides which source can establish a claim, while embeddings and ranking only decide which candidates appear relevant.",{},{"id":1050,"data":2501,"type":41,"tunes":2503},{"text":2502,"level":246},"Frequently asked questions",{},{"id":1055,"data":2505,"type":1055,"tunes":2532},{"items":2506,"title":2531},[2507,2510,2513,2516,2519,2522,2525,2528],{"id":1059,"answer":2508,"question":2509},"Embeddings are numerical representations produced by a model. A vector database or vector index stores and searches those representations together with IDs and metadata.","What is the difference between embeddings and a vector database?",{"id":1063,"answer":2511,"question":2512},"A reranker takes an already retrieved candidate set and re-scores or reorders those candidates using a stronger relevance model or scoring method.","What does a reranker do?",{"id":1067,"answer":2514,"question":2515},"No. RAG requires retrieval of external information. Retrieval can use lexical search, SQL, APIs, graphs, vector search, hybrid search or combinations of these.","Does RAG require a vector database?",{"id":1071,"answer":2517,"question":2518},"Rerankers commonly perform more expensive query-document interaction, so they are usually applied to a small top-k candidate set after a faster first-stage retriever.","Why not use the reranker on the whole corpus?",{"id":1075,"answer":2520,"question":2521},"No. If the relevant document was not retrieved into the candidate set, reranking has nothing to promote.","Can reranking fix a missing document?",{"id":1079,"answer":2523,"question":2524},"No. It is a similarity measure whose numeric meaning depends on the embedding model and corpus. It should not be treated as a universal probability of relevance.","Is cosine similarity a relevance probability?",{"id":1083,"answer":2526,"question":2527},"Use hybrid retrieval when evaluation shows that lexical and semantic signals recover complementary relevant documents. It is not automatically better for every corpus.","Should I use BM25 and vector search together?",{"id":1087,"answer":2529,"question":2530},"When vector indexing, filtering, scale, updates, distributed operation or other vector-specific requirements justify a specialized system. Small workloads may not need one.","When do I need a dedicated vector database?","Embeddings, vector databases and reranking",{},{"id":1093,"data":2534,"type":41,"tunes":2536},{"text":2535,"level":246},"Glossary",{},{"id":1098,"data":2538,"type":1098,"tunes":2576},{"title":2539,"entries":2540},"Key retrieval terms",[2541,2543,2546,2549,2552,2555,2557,2559,2561,2564,2566,2569,2572,2574],{"term":365,"anchor":364,"definition":2542},"A numerical representation of content produced by an embedding model for similarity, clustering, retrieval or related tasks.",{"term":2544,"anchor":1106,"definition":2545},"Dense vector","A vector representation in which many dimensions carry non-zero values, commonly used in semantic retrieval.",{"term":2547,"anchor":1110,"definition":2548},"Sparse vector","A high-dimensional representation in which most dimensions are zero, often preserving stronger token- or term-like structure.",{"term":2550,"anchor":1114,"definition":2551},"Vector index","A data structure that organizes vectors for efficient similarity or nearest-neighbor retrieval.",{"term":2553,"anchor":1118,"definition":2554},"Vector database","A storage\u002Fsearch system designed to manage vectors, associated metadata and vector retrieval workloads.",{"term":1121,"anchor":1122,"definition":2556},"Approximate nearest-neighbor search, which trades exact exhaustive comparison for faster retrieval at scale.",{"term":1125,"anchor":1126,"definition":2558},"Hierarchical Navigable Small World, a graph-based approximate nearest-neighbor indexing approach widely used for vector retrieval.",{"term":1129,"anchor":1130,"definition":2560},"A lexical relevance-ranking method based on term occurrence and corpus statistics, widely used in full-text search.",{"term":2562,"anchor":1134,"definition":2563},"Hybrid search","Retrieval that combines results or scores from multiple retrieval methods such as lexical and vector search.",{"term":686,"anchor":1137,"definition":2565},"A later retrieval stage that re-scores and reorders an already generated candidate set.",{"term":2567,"anchor":1141,"definition":2568},"Bi-encoder","An architecture that encodes query and candidate independently, enabling precomputation and scalable similarity search.",{"term":2570,"anchor":1145,"definition":2571},"Cross-encoder","A model that jointly processes a query and candidate text, often improving relevance judgment at higher computational cost.",{"term":680,"anchor":1148,"definition":2573},"The fraction of relevant items recovered within the top k retrieved candidates.",{"term":1151,"anchor":1152,"definition":2575},"Normalized Discounted Cumulative Gain, a ranking metric that rewards relevant results appearing higher in an ordered list.",{},{"id":1156,"data":2578,"type":41,"tunes":2580},{"text":2579,"level":246},"Conclusion",{},{"id":1161,"data":2582,"type":217,"tunes":2584},{"text":2583},"The clean retrieval model is simple: embeddings represent meaning, vector search retrieves candidates, and rerankers refine candidate ordering.",{},{"id":1166,"data":2586,"type":217,"tunes":2588},{"text":2587},"Once those boundaries are explicit, architecture decisions become easier to diagnose. Missing candidates point toward source coverage, chunking, embeddings, filters or first-stage retrieval. Poor ordering points toward ranking, fusion or reranking. Incorrect final answers can then be investigated separately at context and generation layers.",{},{"id":1171,"data":2590,"type":217,"tunes":2592},{"text":2591},"The most important result is not choosing the most fashionable retrieval component. It is building a retrieval pipeline whose stages, authority boundaries, metrics and failure modes can be measured independently.",{},{"id":1176,"data":2594,"type":41,"tunes":2596},{"text":2595,"level":246},"Primary sources and implementation evidence",{},{"id":1181,"data":2598,"type":217,"tunes":2600},{"text":2599},"The external references below document the representation, vector-search and reranking mechanisms used in this article. Project-specific sections are original implementation evidence and are intentionally narrower than claims about complete production RAG maturity.",{},{"id":1186,"data":2602,"type":1193,"tunes":2606},{"link":1188,"meta":2603},{"image":2604,"title":1191,"description":2605},{"url":343},"Foundational paper demonstrating independently computable sentence embeddings for efficient semantic similarity search.",{},{"id":1196,"data":2608,"type":1193,"tunes":2613},{"link":1198,"meta":2609},{"image":2610,"title":2611,"description":2612},{"url":343},"Qdrant — Architecture and data structure overview","Official documentation describing collections, points, vectors, payload metadata and HNSW-based similarity indexing.",{},{"id":1205,"data":2615,"type":1193,"tunes":2620},{"link":1207,"meta":2616},{"image":2617,"title":2618,"description":2619},{"url":343},"Qdrant — Search","Official vector-search documentation covering similarity queries, filtering, exact versus approximate search and dense\u002Fsparse behavior.",{},{"id":1214,"data":2622,"type":1193,"tunes":2627},{"link":1216,"meta":2623},{"image":2624,"title":2625,"description":2626},{"url":343},"Elastic — Vector search","Current documentation on dense\u002Fsparse vector retrieval, lexical\u002Fvector combinations and multi-stage search pipelines.",{},{"id":1223,"data":2629,"type":1193,"tunes":2634},{"link":1225,"meta":2630},{"image":2631,"title":2632,"description":2633},{"url":343},"Elastic — Semantic reranking","Current guidance defining semantic reranking as a later-stage relevance operation over a smaller candidate set.",{},{"id":1232,"data":2636,"type":1193,"tunes":2641},{"link":1234,"meta":2637},{"image":2638,"title":2639,"description":2640},{"url":343},"Cohere — Reranking with Cohere","Current documentation showing reranking as a second-stage improvement over lexical or semantic first-stage retrieval.",{},{"id":1241,"data":2643,"type":1193,"tunes":2647},{"link":1243,"meta":2644},{"image":2645,"title":1246,"description":2646},{"url":343},"Official SQLite documentation for full-text search and the built-in BM25 ranking function used as lexical retrieval evidence.",{},"2.31.6","Embeddings represent meaning, vector databases retrieve candidates, and rerankers refine results. Learn how these three retrieval layers differ and work together in RAG.","Post erfolgreich abgerufen",{"items":2652,"source":2736,"manualIds":2737,"manualMatchedIds":2738},[2653,2660,2667,2674,2681,2687,2694,2701,2708,2715,2722,2729],{"id":2654,"slug":2655,"title":2656,"excerpt":2657,"featuredImage":2658,"publishedAt":2659},"483","what-is-an-ai-solution-architect-system-boundaries-responsibilities-and-trade-offs","Was ist ein KI-Lösungsarchitekt? Systemgrenzen, Verantwortlichkeiten und Kompromisse","Ein KI-Lösungsarchitekt verwandelt Geschäftsanforderungen in ein produktionsreifes KI-System über Daten, Modelle, Tools, Sicherheit, Laufzeit, Evaluierung und Betrieb hinweg.","\u002Fuploads\u002F2026\u002F10\u002Fwhat-is-an-ai-solution-architect-system-boundaries-responsibilities-and-trade-offs-1791476643267-1st5xz.webp","2026-10-08T12:23:00.000Z",{"id":2661,"slug":2662,"title":2663,"excerpt":2664,"featuredImage":2665,"publishedAt":2666},"470","what-should-an-ai-agent-remember-forget-recompute-or-retrieve-again","Was sollte ein KI-Agent behalten, vergessen, neu berechnen oder erneut abrufen?","Langlaufende Agenten sollten sich nicht alles merken. Dieser Artikel bietet ein praktisches Lebenszyklusmodell für die Entscheidung, was in den dauerhaften Speicher gehört, was erneut abgerufen werden sollte, was sicherer neu zu berechnen ist und was ablaufen oder ersetzt werden sollte.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-should-an-ai-agent-remember-forget-recompute-or-retrieve-again-1790351131087-iehz28.webp","2026-09-25T09:43:00.000Z",{"id":2668,"slug":2669,"title":2670,"excerpt":2671,"featuredImage":2672,"publishedAt":2673},"363","front-und-backend-entwicklung","Frontend- und Backend-Entwicklung","Front-End- und Back-End-Entwicklung ist ein wesentlicher Bestandteil der Webentwicklung und umfasst die Erstellung von Webanwendungen und Websites. Die Front-End-Entwicklung konzentriert sich auf die Benutzeroberfläche, während die Back-End-Entwicklung für die Programmierung und Verwaltung der Serverseite verantwortlich ist.","\u002Fuploads\u002F2026\u002F03\u002Ffront-und-backend-entwicklung-1774872219531-wyu4i1.webp","2023-04-12T11:11:00.000Z",{"id":2675,"slug":2676,"title":2677,"excerpt":2678,"featuredImage":2679,"publishedAt":2680},"488","what-is-context-engineering-what-the-model-receives-before-it-answers","Was ist Context Engineering? Was das Modell erhält, bevor es antwortet","Context Engineering gestaltet, welche Informationen ein KI-Modell vor der Inferenz erhält, einschließlich Prompts, Retrieval, Speicher, Anwendungszustand, Tool-Ergebnissen und Konversationsverlauf.","\u002Fuploads\u002F2026\u002F10\u002Fwhat-is-context-engineering-what-the-model-receives-before-it-answers-1791480653258-018kcv.webp","2026-10-08T13:29:00.000Z",{"id":2682,"slug":2683,"title":1026,"excerpt":2684,"featuredImage":2685,"publishedAt":2686},"478","what-is-rag-the-simplest-explanation-of-how-it-works","RAG klingt kompliziert, aber die Idee ist einfach: Bevor eine KI antwortet, sucht sie zunächst nützliche Informationen aus einer Wissensquelle und gibt diese Informationen an das Sprachmodell weiter. Dieser Leitfaden erklärt RAG, LLMs, Zustand, Gedächtnis und Werkzeuge anhand eines einfachen mentalen Modells.","\u002Fuploads\u002F2026\u002F09\u002Fwhat-is-rag-the-simplest-explanation-of-how-it-works-1790377492124-khjagt.webp","2026-09-25T19:03:00.000Z",{"id":2688,"slug":2689,"title":2690,"excerpt":2691,"featuredImage":2692,"publishedAt":2693},"467","the-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers","Die Antwortgültigkeitsgrenze: Die fehlende Schicht zwischen Relevanz und zuverlässigen KI-Antworten","Eine Quelle kann relevant und maßgeblich sein und dennoch falsch für die gestellte Frage. Die fehlende Ebene ist die Anwendbarkeit: die Bedingungen, unter denen eine Antwort gilt, und die Veränderungen, die erzwingen, dass sie überdacht werden muss. Dieser Artikel führt die Answer Validity Boundary als ein Quellendesign-Muster für Menschen, KI-Suche und RAG-Systeme ein.","\u002Fuploads\u002F2026\u002F09\u002Fthe-answer-validity-boundary-the-missing-layer-between-relevance-and-reliable-ai-answers-1790272901306-1g5jly.webp","2026-09-24T11:59:00.000Z",{"id":2695,"slug":2696,"title":2697,"excerpt":2698,"featuredImage":2699,"publishedAt":2700},"479","where-does-an-llm-get-its-data-rag-data-sources-in-python","Woher bezieht ein LLM seine Daten? RAG-Datenquellen in Python","Ein LLM kennt deine Dateien, Datenbanken oder APIs nicht auf magische Weise. Diese praktische Fortsetzung der RAG-Reihe zeigt mit einfachem Python, wie externe Daten zu abrufbaren Belegen werden: von Textdateien und SQL bis hin zu Volltextsuche, Embeddings, Kontextzusammenstellung und dem abschließenden LLM-Aufruf.","\u002Fuploads\u002F2026\u002F09\u002Fwhere-does-an-llm-get-its-data-rag-data-sources-in-python-1790517200521-nfsi5i.webp","2026-09-27T05:51:00.000Z",{"id":2702,"slug":2703,"title":2704,"excerpt":2705,"featuredImage":2706,"publishedAt":2707},"481","generative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing","Generative KI erklärt: Modelle, Retrieval, Tools und Anwendungen sind nicht dasselbe","Generative KI ist mehr als ein Modell. Erfahren Sie, wie Modelle, Retrieval, Tools, Kontext, Runtimes und Anwendungen in Produktions-KI-Systemen zusammenwirken.","\u002Fuploads\u002F2026\u002F10\u002Fgenerative-ai-explained-models-retrieval-tools-and-applications-are-not-the-same-thing-1791475411822-pp0dvz.webp","2026-10-08T12:00:00.000Z",{"id":2709,"slug":2710,"title":2711,"excerpt":2712,"featuredImage":2713,"publishedAt":2714},"492","mcp-explained-what-it-connects-what-it-does-not-do-and-where-it-fits","MCP erklärt: Was es verbindet, was es nicht tut und wo es passt","Das Model Context Protocol verbindet KI-Anwendungen über eine standardisierte Client-Server-Grenze mit externen Tools, Ressourcen und Prompts. Erfahren Sie, was MCP tut, was es nicht tut und wo es in der Agentenarchitektur einzuordnen ist.","\u002Fuploads\u002F2026\u002F10\u002Fmcp-explained-what-it-connects-what-it-does-not-do-and-where-it-fits-1791486640275-7ub1cq.webp","2026-10-08T15:09:00.000Z",{"id":2716,"slug":2717,"title":2718,"excerpt":2719,"featuredImage":2720,"publishedAt":2721},"466","the-gpu-is-not-the-product-future-proof-private-ai-architecture","Die GPU ist nicht das Produkt: Zukunftssichere private KI-Architektur","Private KI-Infrastruktur sollte nicht um eine einzige GPU oder ein einziges Modell herum konzipiert werden. Ein resilienterer Ansatz kombiniert schnelle Inferenz-GPUs, speicherstarke KI-Systeme, physische KI-Knoten und optionale Frontier-Cloud-Modelle hinter einer fähigkeitsbewussten Routing-Schicht.","\u002Fuploads\u002F2026\u002F09\u002Fthe-gpu-is-not-the-product-future-proof-private-ai-architecture-1790140878812-8hsl39.webp","2026-09-23T01:19:00.000Z",{"id":2723,"slug":2724,"title":2725,"excerpt":2726,"featuredImage":2727,"publishedAt":2728},"494","air-gapped-ai-how-ai-systems-work-without-internet-or-cloud-access","Luftgetrennte KI: Wie KI-Systeme ohne Internet- oder Cloud-Zugriff funktionieren","Air-gapped AI führt Modelle, RAG und KI-Anwendungen innerhalb einer isolierten Sicherheitsdomäne ohne Internet- oder Cloud-Abhängigkeiten aus. Erfahren Sie, wie Modelle, Daten, Updates und Tools offline funktionieren.","\u002Fuploads\u002F2026\u002F10\u002Fair-gapped-ai-how-ai-systems-work-without-internet-or-cloud-access-1791487983978-e6xqf0.webp","2026-10-08T11:32:00.000Z",{"id":2730,"slug":2731,"title":2732,"excerpt":2733,"featuredImage":2734,"publishedAt":2735},"476","mcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained","MCP vs A2A vs UCP vs AP2 vs A2UI: Der Agenten-Protokoll-Stack erklärt","MCP, A2A, UCP, AP2 und A2UI werden oft als konkurrierende Agentenstandards dargestellt. Sie lösen größtenteils unterschiedliche Interoperabilitätsprobleme. Dieser Leitfaden ordnet jedes Protokoll der Grenze zu, die es tatsächlich standardisiert—und zeigt, wie sie in einem Produktionssystem zusammenarbeiten können.","\u002Fuploads\u002F2026\u002F09\u002Fmcp-vs-a2a-vs-ucp-vs-ap2-vs-a2ui-the-agent-protocol-stack-explained-1790352625869-2ezle0.webp","2026-09-25T12:09:00.000Z","fallback",[],[]]