DFIELDSOLUTIONS

KI und Sprachmodelle

GlossarEvaluation (Evals)

Ein wiederholbarer Testsatz, der misst, ob eine Änderung an einem KI-System es besser oder schlechter gemacht hat statt nur anders.

Modellausgaben sind nicht deterministisch, und „wirkt besser“ übersteht keine zweite Meinung. Ein Eval-Satz ist eine feste Sammlung realistischer Eingaben mit bekannten guten Antworten oder Bewertungskriterien, automatisch ausgeführt — sodass die Änderung eines Prompts, einer Retrieval-Strategie oder eines Modells eine Zahl liefert, die sich mit der von gestern vergleichen lässt.

Das wegzulassen ist der Unterschied zwischen einem KI-Feature, das besser wird, und einem, das abdriftet. Ohne Basiswert merkt niemand, dass die Prompt-Änderung, die eine Beschwerde behob, still drei andere Fälle zerschossen hat, und ein Modellwechsel lässt sich nur mit Begeisterung begründen. Ein bescheidener Eval-Satz aus echten Tickets schlägt einen kunstvollen aus der Fantasie.

Verwandte Begriffe

Die zugehörige Werkbank

KI-Automatisierung

Die repetitive Hälfte deiner Woche, übergeben an Software, der nicht langweilig wird. Posteingang sortieren, Nachfassen, Reporting, Datenpflege zwischen Tools, die nie zum Zusammenspiel gedacht waren.

Alle BegriffeGespräch beginnenMarkdown-Version

DField Bt. · Dunakeszi · dezso@dfieldsolutions.com
5,0
“Von der LinkedIn-Nachricht zur Live-Seite. Zwei winzige Änderungen, dann online.”Michael J Ringer · Vilya ProtectionGründer · Spanien