
Werkstattnotizen3 Abschnitte · 2 Min. LesezeitVon Dezső Mező · Veröffentlicht 3. Oktober 2026.mdLLMEvalsCIPrompting
Einen Agenten zu shippen heißt, den Prompt jede Woche zu ändern. Ohne Eval-Harness ist jede Änderung ein Münzwurf — der Fix für einen Fehler bricht still zwei Verhaltensweisen, die niemand geprüft hat.
01Das Eval-Set ist der Vertrag
Fünfzig bis zweihundert repräsentative Inputs mit erwarteten Outputs — oder zumindest erwarteten Eigenschaften — machen aus 'wirkt besser' eine Zahl. Aus echten Transkripten bauen, nicht aus dem, was sich das Team vorstellt.
02Mit einem Judge bewerten, mit Augen stichproben
Ein LLM-as-Judge bewertet jeden Lauf gegen Rubrik-Kriterien und skaliert mit jeder Änderung; ein wöchentliches menschliches Lesen von zehn zufälligen Outputs fängt, was die Rubrik zu fragen vergaß. Keines allein genügt.
03Den Prompt versionieren wie den Code
Prompt-Text in der Versionskontrolle, Eval-Scores in der CI bei jeder Änderung, und ein Rollback, der Minuten statt ein Meeting braucht. Der Prompt ist ein deploytes Artefakt und verdient dieselbe Hygiene.
Was bleibt
- Das Eval-Set aus echten Transkripten bauen, nicht aus Vermutungen.
- LLM-Judge im großen Maßstab, wöchentliche menschliche Stichprobe.
- Prompt-Änderungen gehen durch die CI wie jeder andere Code.
- Rollback trivial halten — Prompts deployen auch.
Mehr aus dem Lab
Alle Beiträge ansehen
RAG, das keinen falschen Preis nennen kann
Self-hosted n8n oder Zapier — wo die Rechnung wirklich abweicht
MCP-Server in Produktion, nicht in der Demo
Die Rechnungs-Pipeline, die den Freitagnachmittag-Admin beendete
Sollen wir das an Ihrem System ansehen?Gespräch beginnen
