Retrieval-Augmented Generation (kurz RAG) kombiniert ein Large Language Model (LLM) mit einer Informationsabruf-Komponente. Das System holt vor der Antworterzeugung passende Dokumente aus einer Wissensquelle und reicht sie dem Modell als Kontext mit — so entstehen aktuelle, belegbare Antworten statt reiner Textvorhersage.
Ursprung und Grundidee
Der Begriff geht auf das Papier „Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks" von Lewis et al. zurück, das 2020 auf der NeurIPS veröffentlicht wurde. Die Autoren kombinierten parametrisches Wissen (das in den Gewichten des Modells gespeicherte Wissen) mit nicht-parametrischem Wissen (eine externe Dokumentensammlung). Dadurch lässt sich Wissen aktualisieren und korrigieren, ohne das Modell neu zu trainieren.
Wie eine RAG-Pipeline arbeitet
- Indexierung: Dokumente werden in Abschnitte (Chunks) zerlegt und über ein Embedding-Modell in numerische Vektoren umgewandelt.
- Speicherung: Die Vektoren landen in einer Vektordatenbank, die per semantischer Suche nach Ähnlichkeit abgefragt wird.
- Retrieval: Eine Nutzerfrage wird ebenfalls in einen Vektor umgewandelt; die Datenbank liefert die ähnlichsten Dokumente (Top-k).
- Generation: Das LLM erhält Frage plus gefundene Dokumente im Prompt und formuliert die Antwort.
Vorteile und Varianten
- Reduzierte Halluzinationen, weil die Antwort auf echten Quellen fußt.
- Aktuelle Fakten ohne Modell-Neutraining, ideal für private oder dynamische Datenbestände.
- Quellenangaben möglich — der Abruf kann belegen, woher eine Aussage stammt.
- Varianten: Naive RAG (einfachste Kette), Advanced RAG (optimierte Vor- und Nachbereitung des Retrievals) und Modular RAG (flexibel kombinierbare Module).
Verwandte Grundlagen: RAG in der Praxis, Feinabstimmung versus RAG, Embedding, Künstliche Intelligenz.