# Evaluation (Evals)

> Ein wiederholbarer Testsatz, der misst, ob eine Änderung an einem KI-System es besser oder schlechter gemacht hat statt nur anders.

Modellausgaben sind nicht deterministisch, und „wirkt besser“ übersteht keine zweite Meinung. Ein Eval-Satz ist eine feste Sammlung realistischer Eingaben mit bekannten guten Antworten oder Bewertungskriterien, automatisch ausgeführt — sodass die Änderung eines Prompts, einer Retrieval-Strategie oder eines Modells eine Zahl liefert, die sich mit der von gestern vergleichen lässt.

Das wegzulassen ist der Unterschied zwischen einem KI-Feature, das besser wird, und einem, das abdriftet. Ohne Basiswert merkt niemand, dass die Prompt-Änderung, die eine Beschwerde behob, still drei andere Fälle zerschossen hat, und ein Modellwechsel lässt sich nur mit Begeisterung begründen. Ein bescheidener Eval-Satz aus echten Tickets schlägt einen kunstvollen aus der Fantasie.

## Verwandte Begriffe

- https://dfieldsolutions.com/de/glossar/hallucination.md
- https://dfieldsolutions.com/de/glossar/llm.md
- https://dfieldsolutions.com/de/glossar/rag.md

---

Source: https://dfieldsolutions.com/de/glossar/llm-evaluation
DField Solutions — Dunakeszi, Hungary — dezso@dfieldsolutions.com
Booking: see https://dfieldsolutions.com/en/contact
