# Transformer

> Die neuronale Netzarchitektur hinter modernen Sprachmodellen — Attention-Schichten, die abwägen, welche früheren Wörter bei der Vorhersage des nächsten zählen.

Im Paper 'Attention Is All You Need' von 2017 vorgestellt, ersetzte der Transformer sequentielles Lesen durch Attention: Jedes Token betrachtet alle früheren gleichzeitig und entscheidet, welche relevant sind. Diese Parallelität machte Training auf Text im Internetmaßstab erst möglich.

Fast alles, was die Branche LLM nennt — die GPT-Reihe, Claude, Gemini, Llama — ist ein Transformer, trainiert auf die Vorhersage des nächsten Tokens. Die Grenzen der Architektur sind die Grenzen des Feldes: festes Kontextfenster, kein eingebautes Gedächtnis und mit der Länge wachsende Kosten.

## Verwandte Begriffe

- https://dfieldsolutions.com/de/glossar/llm.md
- https://dfieldsolutions.com/de/glossar/context-window.md
- https://dfieldsolutions.com/de/glossar/token.md

---

Source: https://dfieldsolutions.com/de/glossar/transformer
DField Solutions — Dunakeszi, Hungary — dezso@dfieldsolutions.com
Booking: see https://dfieldsolutions.com/en/contact
