DFIELDSOLUTIONS

Werkstattnotizen

LaborPrompts sind Code: evaluiere sie wie Code

Ein Prompt, der nicht regressionsgetestet werden kann, ist ein Skript, das niemand zu refactoren wagt. Versioniert, evaluiert, gediffed — dieselbe Hygiene wie jedes deployte Artefakt.

Prompts sind Code: evaluiere sie wie Code

Werkstattnotizen3 Abschnitte · 2 Min. LesezeitVon Dezső Mező · Veröffentlicht 3. Oktober 2026.mdLLMEvalsCIPrompting

Einen Agenten zu shippen heißt, den Prompt jede Woche zu ändern. Ohne Eval-Harness ist jede Änderung ein Münzwurf — der Fix für einen Fehler bricht still zwei Verhaltensweisen, die niemand geprüft hat.

01Das Eval-Set ist der Vertrag

Fünfzig bis zweihundert repräsentative Inputs mit erwarteten Outputs — oder zumindest erwarteten Eigenschaften — machen aus 'wirkt besser' eine Zahl. Aus echten Transkripten bauen, nicht aus dem, was sich das Team vorstellt.

02Mit einem Judge bewerten, mit Augen stichproben

Ein LLM-as-Judge bewertet jeden Lauf gegen Rubrik-Kriterien und skaliert mit jeder Änderung; ein wöchentliches menschliches Lesen von zehn zufälligen Outputs fängt, was die Rubrik zu fragen vergaß. Keines allein genügt.

03Den Prompt versionieren wie den Code

Prompt-Text in der Versionskontrolle, Eval-Scores in der CI bei jeder Änderung, und ein Rollback, der Minuten statt ein Meeting braucht. Der Prompt ist ein deploytes Artefakt und verdient dieselbe Hygiene.

Was bleibt

  • Das Eval-Set aus echten Transkripten bauen, nicht aus Vermutungen.
  • LLM-Judge im großen Maßstab, wöchentliche menschliche Stichprobe.
  • Prompt-Änderungen gehen durch die CI wie jeder andere Code.
  • Rollback trivial halten — Prompts deployen auch.
Das bauen wir auchKI-Automatisierung

Mehr aus dem Lab

Alle Beiträge ansehen

Sollen wir das an Ihrem System ansehen?Gespräch beginnen

DField Bt. · Dunakeszi · dezso@dfieldsolutions.com
5,0
“Von der LinkedIn-Nachricht zur Live-Seite. Zwei winzige Änderungen, dann online.”Michael J Ringer · Vilya ProtectionGründer · Spanien