Computer vergleichen Zahlen, keine Bedeutung. Ein Embedding-Modell verwandelt einen Satz in ein paar hundert oder ein paar tausend Zahlen und ist so trainiert, dass der Abstand zwischen zwei solchen Listen widerspiegelt, wie verwandt die beiden Sätze sind. „Wie kündige ich mein Abo“ landet nahe bei „wo ist der Abmeldelink“, obwohl sie kaum ein Wort teilen.
Das lässt semantische Suche funktionieren, und deshalb scheitern Stichwortsuche und Embedding-Suche auf entgegengesetzte Weise. Die Stichwortsuche verfehlt den Kunden, der andere Wörter benutzt hat. Die Embedding-Suche findet ihn und liefert gelegentlich etwas, das nur zum selben Thema gehört, die Frage aber nicht beantwortet. Produktivsysteme fahren meist beides und kombinieren die Ergebnisse.
Verwandte Begriffe
RAG (Retrieval-Augmented Generation)
Erst die passenden Dokumente heraussuchen und in den Prompt legen, damit das Modell aus deinem Material antwortet statt aus dem Gedächtnis.
Vektordatenbank
Eine Datenbank, die schnell die gespeicherten Einträge findet, deren Embeddings dem einer Anfrage am nächsten sind — über Millionen Zeilen hinweg.
Großes Sprachmodell (LLM)
Ein auf riesigen Textmengen trainiertes Modell, das vorhersagt, was als Nächstes kommt — was genügt, um zu schreiben, zusammenzufassen, zu übersetzen und viele Aufgaben durchzudenken.
Die zugehörige Werkbank
KI-AutomatisierungDie repetitive Hälfte deiner Woche, übergeben an Software, der nicht langweilig wird. Posteingang sortieren, Nachfassen, Reporting, Datenpflege zwischen Tools, die nie zum Zusammenspiel gedacht waren.
