DFIELDSOLUTIONS

KI und Sprachmodelle

GlossarKI-Guardrails

Die Prüfungen rund um ein Modell, die begrenzen, was es sagen und tun kann — Eingabefilter, Ausgabevalidierung, berechtigte Werkzeuge — damit eine schlechte Antwort sicher scheitert.

Eine Prompt-Anweisung ist eine Bitte, keine Grenze: Ein entschlossener Nutzer kann ein Modell über 'verrate das nie' hinwegreden. Guardrails sind Durchsetzung — Code, der das Prompt-Injection-Muster blockiert, bevor es das Modell erreicht, prüft, dass die Antwort aus erlaubten Quellen stammt, und Werkzeugaufrufe wie 'E-Mail senden' oder 'erstatten' hinter echte Berechtigungen legt.

Das ehrliche Modell eines Sprachmodells ist ein schneller, selbstsicherer, gelegentlich falscher Mitarbeiter: Dem würde man das Datenbankpasswort auch nicht ohne Prüfung geben. Guardrails sind diese Prüfung, dort implementiert, wo das Modell nicht daran vorbeireden kann.

Verwandte Begriffe

Die zugehörige Werkbank

Cybersecurity

Purple Team: dieselbe Person schreibt den Exploit und schließt die Lücke. Die meisten Agenturen härten nur, also gegen eine Bedrohung, die niemand getestet hat.

Alle BegriffeGespräch beginnenMarkdown-Version

DField Bt. · Dunakeszi · dezso@dfieldsolutions.com
5,0
“Von der LinkedIn-Nachricht zur Live-Seite. Zwei winzige Änderungen, dann online.”Michael J Ringer · Vilya ProtectionGründer · Spanien