Eine Prompt-Anweisung ist eine Bitte, keine Grenze: Ein entschlossener Nutzer kann ein Modell über 'verrate das nie' hinwegreden. Guardrails sind Durchsetzung — Code, der das Prompt-Injection-Muster blockiert, bevor es das Modell erreicht, prüft, dass die Antwort aus erlaubten Quellen stammt, und Werkzeugaufrufe wie 'E-Mail senden' oder 'erstatten' hinter echte Berechtigungen legt.
Das ehrliche Modell eines Sprachmodells ist ein schneller, selbstsicherer, gelegentlich falscher Mitarbeiter: Dem würde man das Datenbankpasswort auch nicht ohne Prüfung geben. Guardrails sind diese Prüfung, dort implementiert, wo das Modell nicht daran vorbeireden kann.
Verwandte Begriffe
Prompt Injection
Ein Angriff, bei dem Text, den das Modell als Daten lesen sollte, von ihm stattdessen als Anweisung behandelt wird.
Tool Calling
Der Mechanismus, mit dem ein Modell die umgebende Anwendung bittet, eine benannte Funktion auszuführen, und das Ergebnis als Text zurückbekommt.
Evaluation (Evals)
Ein wiederholbarer Testsatz, der misst, ob eine Änderung an einem KI-System es besser oder schlechter gemacht hat statt nur anders.
Die zugehörige Werkbank
CybersecurityPurple Team: dieselbe Person schreibt den Exploit und schließt die Lücke. Die meisten Agenturen härten nur, also gegen eine Bedrohung, die niemand getestet hat.
