DFIELDSOLUTIONS

KI und Sprachmodelle

GlossarTransformer

Die neuronale Netzarchitektur hinter modernen Sprachmodellen — Attention-Schichten, die abwägen, welche früheren Wörter bei der Vorhersage des nächsten zählen.

Im Paper 'Attention Is All You Need' von 2017 vorgestellt, ersetzte der Transformer sequentielles Lesen durch Attention: Jedes Token betrachtet alle früheren gleichzeitig und entscheidet, welche relevant sind. Diese Parallelität machte Training auf Text im Internetmaßstab erst möglich.

Fast alles, was die Branche LLM nennt — die GPT-Reihe, Claude, Gemini, Llama — ist ein Transformer, trainiert auf die Vorhersage des nächsten Tokens. Die Grenzen der Architektur sind die Grenzen des Feldes: festes Kontextfenster, kein eingebautes Gedächtnis und mit der Länge wachsende Kosten.

Verwandte Begriffe

Alle BegriffeGespräch beginnenMarkdown-Version

DField Bt. · Dunakeszi · dezso@dfieldsolutions.com
5,0
“Von der LinkedIn-Nachricht zur Live-Seite. Zwei winzige Änderungen, dann online.”Michael J Ringer · Vilya ProtectionGründer · Spanien