Ein Modell weiß nur, was in seinen Trainingsdaten stand, und die enden an einem festen Datum und enthielten nie deine Verträge, deine Produktdokumentation oder die Zahlen des letzten Quartals. RAG schließt diese Lücke, ohne irgendetwas neu zu trainieren: Kommt eine Frage, findet ein Suchschritt die wenigen Passagen, die die Antwort am ehesten enthalten, diese Passagen wandern zusammen mit der Frage in den Prompt, und das Modell antwortet daraus.
Am Retrieval-Schritt entscheidet sich, ob so ein System taugt, und genau er bekommt meist die geringste Aufmerksamkeit. Liefert die Suche die falschen drei Absätze, rettet auch ein besseres Modell die Antwort nicht — es produziert eine flüssige, selbstsichere Antwort auf falscher Grundlage. Die meisten enttäuschenden RAG-Projekte sind Retrieval-Probleme im Generierungskostüm.
Es ist außerdem der ehrliche Weg zu Quellenangaben. Weil das System weiß, welche Dokumente es in den Prompt gelegt hat, kann es sie zeigen, und ein Leser kann nachprüfen. Ein Modell, das allein aus Trainingsdaten antwortet, kann das nicht — weshalb Antworten ohne Quelle eher Behauptungen als Fakten sind.
Verwandte Begriffe
Embedding
Eine Zahlenliste, die einen Text repräsentiert — so angeordnet, dass Texte über Ähnliches nahe beieinander landen.
Vektordatenbank
Eine Datenbank, die schnell die gespeicherten Einträge findet, deren Embeddings dem einer Anfrage am nächsten sind — über Millionen Zeilen hinweg.
Halluzination
Eine selbstsichere, flüssige, vollständig erfundene Antwort — eine Quelle, eine Zahl oder eine API, die es nicht gibt.
Kontextfenster
Die maximale Textmenge, die ein Modell auf einmal berücksichtigen kann — Anweisungen, Gespräch und Antwort zusammengerechnet.
Die zugehörige Werkbank
KI-AutomatisierungDie repetitive Hälfte deiner Woche, übergeben an Software, der nicht langweilig wird. Posteingang sortieren, Nachfassen, Reporting, Datenpflege zwischen Tools, die nie zum Zusammenspiel gedacht waren.
