Modellausgaben sind nicht deterministisch, und „wirkt besser“ übersteht keine zweite Meinung. Ein Eval-Satz ist eine feste Sammlung realistischer Eingaben mit bekannten guten Antworten oder Bewertungskriterien, automatisch ausgeführt — sodass die Änderung eines Prompts, einer Retrieval-Strategie oder eines Modells eine Zahl liefert, die sich mit der von gestern vergleichen lässt.
Das wegzulassen ist der Unterschied zwischen einem KI-Feature, das besser wird, und einem, das abdriftet. Ohne Basiswert merkt niemand, dass die Prompt-Änderung, die eine Beschwerde behob, still drei andere Fälle zerschossen hat, und ein Modellwechsel lässt sich nur mit Begeisterung begründen. Ein bescheidener Eval-Satz aus echten Tickets schlägt einen kunstvollen aus der Fantasie.
Verwandte Begriffe
Halluzination
Eine selbstsichere, flüssige, vollständig erfundene Antwort — eine Quelle, eine Zahl oder eine API, die es nicht gibt.
Großes Sprachmodell (LLM)
Ein auf riesigen Textmengen trainiertes Modell, das vorhersagt, was als Nächstes kommt — was genügt, um zu schreiben, zusammenzufassen, zu übersetzen und viele Aufgaben durchzudenken.
RAG (Retrieval-Augmented Generation)
Erst die passenden Dokumente heraussuchen und in den Prompt legen, damit das Modell aus deinem Material antwortet statt aus dem Gedächtnis.
Die zugehörige Werkbank
KI-AutomatisierungDie repetitive Hälfte deiner Woche, übergeben an Software, der nicht langweilig wird. Posteingang sortieren, Nachfassen, Reporting, Datenpflege zwischen Tools, die nie zum Zusammenspiel gedacht waren.
