8 Minuten

RAG erklärt: Wie KI auf eigenes und aktuelles Wissen zugreift

Dieser Text wurde mit Hilfe von KI erstellt.

Deine KI kennt die Antwort. Nur leider nicht die richtige.

Sie kennt vielleicht tausende Bücher. Sie kann programmieren, Texte schreiben und Zusammenhänge erklären. Doch fragst du sie nach der aktuellen Reisekostenrichtlinie deines Unternehmens, sieht es anders aus.

Diese Information steht nicht in ihrem Modell.

RAG löst genau dieses Problem. Die KI sucht zuerst nach passenden Informationen und nutzt sie dann für ihre Antwort.

Das klingt unspektakulär. Dahinter steckt aber eine wichtige Idee:

Eine KI muss nicht alles wissen. Sie muss wissen, wo sie nachschauen kann.

I. Warum ein LLM allein nicht reicht

Ein Large Language Model, kurz LLM, erzeugt Antworten aus dem Wissen und den Mustern, die es während seines Trainings gelernt hat.

Das reicht für viele Aufgaben.

Du kannst es bitten, einen Text zu schreiben, einen Begriff zu erklären oder Code zu erzeugen. Schwieriger wird es bei Wissen, das sich ständig ändert oder nur für eine bestimmte Organisation gilt.

Zum Beispiel:

  • Welche Produkte sind heute auf Lager?

  • Was steht in unserem aktuellen Arbeitsvertrag?

  • Warum hat Kunde Müller eine Gutschrift erhalten?

  • Wie funktioniert unsere interne API?

  • Welche Regel gilt seit der letzten Änderung?

Das Modell kennt diese Antworten nicht automatisch.

Du könntest das Wissen zwar in das Modell trainieren. Das wäre aber oft umständlich. Neue Informationen würden ein neues Training erfordern. Außerdem willst du nicht jedes Dokument in die Modellparameter schreiben.

RAG verfolgt deshalb einen anderen Weg: Die KI holt sich Wissen erst dann, wenn sie es braucht.

II. Was bedeutet RAG?

RAG steht für Retrieval-Augmented Generation.

Der Begriff beschreibt drei Schritte:

Retrieval: Informationen suchen.

Augmented: Die gefundenen Informationen als Kontext hinzufügen.

Generation: Mit diesem Kontext eine Antwort erzeugen.

Der Ablauf sieht so aus:

Nutzerfrage
     ↓
Informationen suchen
     ↓
relevante Textstellen finden
     ↓
Kontext an das LLM geben
     ↓
Antwort erzeugen

Das Sprachmodell beantwortet die Frage also nicht nur aus seinem eigenen Wissen.

Es bekommt zusätzliche Informationen.

Damit wird aus einem allgemeinen Sprachmodell ein Modell, das auf eine eigene Wissensbasis zugreifen kann.

III. Die kleine Idee hinter RAG

Die Grundidee lässt sich an einem einfachen Beispiel zeigen.

Du fragst:

„Wie viele Urlaubstage stehen Mitarbeitern bei uns zu?“

Das RAG-System durchsucht die internen Dokumente.

Es findet:

„Mitarbeiter erhalten 30 Urlaubstage pro Kalenderjahr.“

Diese Information gibt das System zusammen mit deiner Frage an das LLM.

Das Modell antwortet:

„Mitarbeiter erhalten 30 Urlaubstage pro Kalenderjahr.“

Mehr steckt hinter dem Grundprinzip zunächst nicht.

RAG sucht Wissen und reicht es an die KI weiter.

Doch genau daraus entsteht eine viel größere Idee.

IV. Die große Idee: Wissen und Denken trennen

Ein Mensch muss nicht alles wissen.

Ein guter Mitarbeiter weiß oft etwas viel Wichtigeres: Er weiß, wo er nachsehen muss.

Bei einer Frage zur Reisekostenabrechnung öffnet er das Intranet. Bei einem technischen Problem schaut er in die Dokumentation. Bei Kundendaten öffnet er das CRM.

Warum sollte eine KI anders arbeiten?

Genau hier setzt die große Idee von RAG an:

Das LLM muss nicht jedes Wissen selbst speichern. Es braucht Zugriff auf das Wissen, das es für eine Aufgabe benötigt.

Damit trennst du zwei Dinge:

LLM
→ verstehen, schlussfolgern und formulieren

Wissensquellen
→ Informationen liefern

Das LLM denkt also über Informationen nach, die außerhalb des Modells liegen.

Diese Trennung macht RAG so interessant.

V. Wie funktioniert ein RAG-System?

Ein RAG-System besteht aus zwei großen Teilen.

Zuerst bereitest du das Wissen vor. Danach suchst du bei jeder Frage nach passenden Informationen.

Der erste Teil läuft meist im Hintergrund:

Dokumente
   ↓
Text extrahieren
   ↓
Dokumente aufteilen
   ↓
Embeddings erzeugen
   ↓
Suchindex speichern

Bei einer Frage passiert dann:

Frage
   ↓
Suchanfrage
   ↓
passende Inhalte suchen
   ↓
relevante Inhalte auswählen
   ↓
LLM
   ↓
Antwort

Die Qualität der Antwort hängt deshalb nicht nur vom LLM ab.

Die Suche entscheidet mit darüber, was die KI weiß.

VI. Was sind Embeddings?

Jetzt wird es technisch.

Damit ein RAG-System nach Bedeutung suchen kann, muss es Texte in eine Form bringen, die ein Computer vergleichen kann.

Dafür nutzt man Embeddings.

Ein Embedding übersetzt einen Text in eine Zahlenfolge.

Vereinfacht sieht das so aus:

„Wie viele Urlaubstage habe ich?“
              ↓
        Embedding-Modell
              ↓
[0.12, -0.43, 0.87, ...]

Auch die Dokumente erhalten solche Zahlenfolgen.

Texte mit ähnlicher Bedeutung liegen im mathematischen Raum näher zusammen.

Das ermöglicht eine semantische Suche.

Nehmen wir zwei Sätze:

„Wie viele Urlaubstage bekomme ich?“

und:

„Mitarbeiter erhalten 30 Tage Jahresurlaub.“

Beide Sätze verwenden andere Wörter. Trotzdem behandeln sie dasselbe Thema.

Eine semantische Suche kann diese Verbindung erkennen.

Sie sucht also nicht nur nach gleichen Wörtern. Sie sucht nach ähnlicher Bedeutung.

VII. Warum RAG Dokumente in Chunks zerlegt

Ein 200-seitiges Handbuch willst du nicht bei jeder Frage komplett an das LLM schicken.

Das wäre teuer. Es würde die Antwort mit unnötigem Text belasten. Und die wichtige Information könnte zwischen vielen anderen Absätzen untergehen.

Deshalb zerlegt ein RAG-System Dokumente in kleinere Abschnitte.

Diese Abschnitte heißen Chunks.

Handbuch
│
├── Chunk 1
├── Chunk 2
├── Chunk 3
├── Chunk 4
└── ...

Stell dir das wie ein Buch mit vielen Karteikarten vor.

Auf jeder Karte steht ein Teil des Wissens.

Fragt der Nutzer nach der Garantie, muss das System nicht das ganze Handbuch durchsuchen. Es sucht nach den Karten, die zur Frage passen.

Dabei lauert eine wichtige Falle:

Zu kleine Chunks verlieren Zusammenhang. Zu große Chunks enthalten zu viel Ballast.

Gutes Chunking ist deshalb eine der wichtigsten Aufgaben beim Aufbau eines RAG-Systems.

VIII. Wie findet RAG die richtigen Informationen?

Die einfachste Lösung nutzt eine Vektorsuche.

Das ist aber nicht immer die beste Lösung.

Nehmen wir diese Frage:

„Welche Artikel haben die Nummer AX-4711?“

Hier ist der konkrete Begriff entscheidend. Eine klassische Stichwortsuche kann besser funktionieren.

Bei dieser Frage sieht es anders aus:

„Welche Produkte eignen sich für Menschen mit wenig Platz in der Küche?“

Hier zählt die Bedeutung. Eine semantische Suche kann ihre Stärke ausspielen.

Deshalb kombinieren moderne RAG-Systeme oft mehrere Suchverfahren.

Stichwortsuche

Sie sucht nach konkreten Begriffen.

Semantische Suche

Sie sucht nach ähnlichen Bedeutungen.

Hybride Suche

Sie kombiniert beide Ansätze.

Reranking

Danach kann ein weiteres Modell die Treffer neu bewerten.

Der Ablauf sieht dann so aus:

Nutzerfrage
     ↓
Stichwortsuche ───┐
                  ├──→ Treffer
Vektorsuche ──────┘
                     ↓
                  Reranking
                     ↓
             beste Textstellen
                     ↓
                    LLM

Das Ziel ist immer gleich:

Das LLM soll möglichst genau die Informationen bekommen, die es für die Frage braucht.

IX. Warum schlechtes Retrieval gute KI schlecht aussehen lässt

Hier liegt eine der wichtigsten Erkenntnisse beim Bau von RAG-Systemen.

Stell dir vor, deine Wissensbasis enthält die richtige Antwort.

Das System findet sie aber nicht.

Was passiert?

Das LLM bekommt die Information nicht. Es muss mit dem arbeiten, was ihm vorliegt. Es kann dann eine falsche Antwort geben oder etwas erfinden.

Das Problem liegt in diesem Fall nicht beim Sprachmodell.

Das Problem liegt bei der Suche.

Der Zusammenhang ist einfach:

schlechte Daten
     ↓
schlechte Suche
     ↓
falscher Kontext
     ↓
schlechte Antwort

Deshalb reicht es nicht, Dokumente in eine Vektordatenbank zu laden und ein LLM anzuschließen.

Ein gutes RAG-System braucht:

  • gute Daten

  • sinnvolle Chunks

  • passende Metadaten

  • eine gute Suchstrategie

  • gutes Ranking

  • passende Prompts

  • eine zuverlässige Evaluation

RAG ist eine Kette. Schwächelt ein Glied, leidet die Antwort.

X. Verhindert RAG Halluzinationen?

RAG kann Halluzinationen reduzieren. Es beseitigt sie aber nicht.

Auch ein RAG-System kann eine falsche Antwort erzeugen.

Dafür gibt es mehrere Gründe.

Vielleicht findet die Suche die falschen Dokumente. Vielleicht sind die Dokumente veraltet. Vielleicht widersprechen sich zwei Quellen. Oder das LLM zieht aus den richtigen Informationen eine falsche Schlussfolgerung.

Deshalb solltest du einem RAG-System nicht blind vertrauen.

Hilfreich sind zum Beispiel:

  • Quellen in der Antwort

  • klare Vorgaben für fehlende Informationen

  • Zugriff auf aktuelle Daten

  • Rechteprüfung

  • Tests mit echten Fragen

  • Messung der Trefferqualität

  • regelmäßige Prüfung der Antworten

Eine wichtige Regel lautet:

Wenn das System keine passende Information findet, sollte es lieber „Ich weiß es nicht“ sagen als eine Antwort zu erfinden.

XI. RAG ist mehr als eine Vektordatenbank

RAG wird oft auf ein einfaches Bild reduziert:

Dokumente → Vektordatenbank → LLM

Das ist zu kurz gedacht.

Die Wissensquelle kann ganz unterschiedlich aussehen.

Zum Beispiel:

  • PDF-Dokumente

  • Webseiten

  • Wikis

  • Produktdaten

  • Support-Tickets

  • Code

  • CRM-Daten

  • ERP-Daten

  • SQL-Datenbanken

  • APIs

Auch strukturierte Daten können Teil eines RAG-Systems sein.

Eine Frage wie:

„Wie viele Bestellungen hat Kunde Müller diesen Monat aufgegeben?“

beantwortest du nicht sinnvoll, indem du ein PDF mit Bestelldaten durchsuchst.

Hier passt eine Datenbankabfrage besser.

Ein modernes RAG-System kann deshalb verschiedene Quellen verbinden:

                    Nutzerfrage
                         ↓
                    KI-System
                         ↓
          ┌──────────────┼──────────────┐
          ↓              ↓              ↓
        Wiki           CRM            ERP
          ↓              ↓              ↓
          └──────────────┼──────────────┘
                         ↓
                    Informationen
                         ↓
                        LLM
                         ↓
                      Antwort

RAG bedeutet deshalb nicht „Vektordatenbank“. RAG bedeutet, Wissen zur richtigen Zeit abzurufen und für die Antwort zu nutzen.

XII. RAG oder Fine-Tuning?

RAG und Fine-Tuning lösen unterschiedliche Probleme.

Beim Fine-Tuning trainierst du ein Modell mit zusätzlichen Beispielen. Du willst damit vor allem sein Verhalten verändern.

RAG verfolgt einen anderen Ansatz.

Das Wissen bleibt außerhalb des Modells. Das System holt es bei Bedarf.

RAG

Fine-Tuning

Holt Wissen zur Laufzeit

Trainiert das Modell weiter

Geeignet für aktuelles Wissen

Geeignet für Verhalten und bestimmte Aufgaben

Daten lassen sich leicht ändern

Änderungen erfordern neues Training

Quellen lassen sich anzeigen

Quellen sind nicht automatisch sichtbar

Gut für Unternehmenswissen

Gut für Stil, Format und Verhalten

Eine einfache Faustregel hilft:

Willst du der KI neues Wissen geben, prüfe zuerst RAG. Willst du ihr Verhalten ändern, prüfe Fine-Tuning.

Beide Verfahren können sich auch ergänzen.

XIII. Wann lohnt sich RAG?

RAG lohnt sich vor allem dann, wenn ein LLM auf Informationen zugreifen soll, die es nicht zuverlässig aus seinem eigenen Wissen kennt.

Unternehmenswissen

Ein interner Assistent kann auf Richtlinien, Handbücher und Prozessbeschreibungen zugreifen.

Mitarbeiter fragen dann:

„Wie beantrage ich eine Dienstreise?“

Die KI sucht die passende interne Regel und erklärt den Prozess.

Kundenservice

Ein Support-Assistent kann Produktdokumentation, FAQs und bekannte Fehler durchsuchen.

Der Kunde muss nicht selbst zehn Seiten Dokumentation lesen.

E-Commerce

Ein Einkaufsassistent kann Produktdaten nutzen und Fragen beantworten wie:

„Welche Laptops haben mindestens 16 GB RAM und wiegen weniger als 1,5 kg?“

Softwareentwicklung

Ein Entwicklungsassistent kann Code, Dokumentation und Tickets durchsuchen.

Dann kannst du fragen:

„Warum verwendet dieser Service diese API?“

Die Antwort kann auf dem tatsächlichen Projektwissen beruhen.

Immer wenn Wissen außerhalb des LLM liegt und für eine Antwort gebraucht wird, wird RAG interessant.

XIV. Von RAG zu Agentic RAG

Ein klassisches RAG-System arbeitet oft nach einem festen Muster:

Frage
 ↓
Suche
 ↓
Kontext
 ↓
Antwort

Ein KI-Agent geht einen Schritt weiter.

Er kann selbst entscheiden, welche Informationen er braucht.

Nehmen wir diese Frage:

„Warum wurde Bestellung 4711 noch nicht geliefert?“

Ein Agent könnte mehrere Systeme prüfen:

Bestellung prüfen
       ↓
Versandstatus prüfen
       ↓
Support-Ticket prüfen
       ↓
Lieferant prüfen
       ↓
Informationen vergleichen
       ↓
Ursache ermitteln
       ↓
Antwort geben

Vielleicht reicht die erste Suche. Vielleicht braucht der Agent drei weitere Abfragen.

Er entscheidet selbst über den nächsten Schritt.

Das führt zu einer interessanten Entwicklung:

LLM
 ↓
RAG
 ↓
Tool Use
 ↓
Agent
 ↓
Agentic RAG

RAG wird dabei zu einem Teil eines größeren Systems.

Die KI sucht nicht mehr nur nach einem passenden Absatz.

Sie entscheidet, welches Wissen sie für ihre Aufgabe braucht.

XV. Die große Idee hinter RAG

Damit kommen wir zum wichtigsten Punkt.

Die kleine Idee hinter RAG lautet:

Suche Informationen und gib sie dem LLM.

Die große Idee lautet:

Trenne Wissen von Denken.

Das verändert die Rolle eines Sprachmodells.

Es muss nicht jede Unternehmensrichtlinie kennen. Es muss nicht jede Produktänderung speichern. Es muss nicht jede interne Datenbank im Training enthalten.

Es braucht Zugriff.

                    LLM
                     │
             versteht und denkt
                     │
                     ↓
              Wissenszugriff
                     │
       ┌─────────────┼─────────────┐
       ↓             ↓             ↓
      Wiki          CRM           ERP
       ↓             ↓             ↓
       └─────────────┼─────────────┘
                     ↓
                 Daten

Das LLM wird damit zu einer Schnittstelle zwischen Mensch und Wissen.

Du musst nicht mehr wissen, wo eine Information liegt.

Du stellst eine Frage.

Die KI sucht.

Sie liest.

Sie verbindet Informationen.

Und sie formuliert eine Antwort.

XVI. Was RAG für die Zukunft der KI bedeutet

Vielleicht liegt genau hier die wichtigere Entwicklung.

Wir denken bei KI oft darüber nach, wie viel ein Modell weiß.

RAG verschiebt diese Frage:

Wie gut kann ein Modell auf Wissen zugreifen?

Das ist ein großer Unterschied.

Ein Mensch mit einer guten Bibliothek muss nicht jedes Buch auswendig kennen. Er muss wissen, welches Buch er aufschlagen muss.

Eine KI mit Zugriff auf Unternehmenswissen funktioniert ähnlich.

Sie kann auf unterschiedliche Quellen zugreifen:

Dokumente
Webseiten
Datenbanken
APIs
Code
CRM
ERP
Wikis

Daraus entsteht eine neue Rolle für das LLM.

Es ist nicht mehr nur ein Wissensspeicher.

Es wird zum Denk- und Sprachsystem über einem Netz aus Wissensquellen.

Genau hier trifft RAG auf die Entwicklung zu agentischer KI.

XVII. Fazit: RAG macht Wissen für KI abrufbar

RAG klingt zunächst nach einer technischen Methode für die Suche in Dokumenten.

Seine Bedeutung reicht weiter.

Ein RAG-System verbindet ein Sprachmodell mit externem Wissen. Es sucht passende Informationen, gibt sie an das Modell und lässt daraus eine Antwort entstehen.

Die wichtigsten Bausteine sind:

  • Dokumente und Daten: Sie liefern das Wissen.

  • Chunking: Es zerlegt große Inhalte in passende Abschnitte.

  • Embeddings: Sie machen Bedeutungen vergleichbar.

  • Retrieval: Es sucht passende Informationen.

  • Reranking: Es sortiert die Treffer.

  • LLM: Es versteht den Kontext und formuliert die Antwort.

  • Evaluation: Sie zeigt, ob das System zuverlässig arbeitet.

Die kleine Idee ist simpel:

Hole das Wissen, das die KI gerade braucht.

Die große Idee ist spannender:

Die KI muss nicht alles wissen. Sie muss auf das richtige Wissen zugreifen können.

Und vielleicht ist genau das der nächste Schritt bei KI: Nicht Modelle, die alles in sich tragen, sondern Modelle, die wissen, wo sie nachsehen müssen.