Im Paper 'Attention Is All You Need' von 2017 vorgestellt, ersetzte der Transformer sequentielles Lesen durch Attention: Jedes Token betrachtet alle früheren gleichzeitig und entscheidet, welche relevant sind. Diese Parallelität machte Training auf Text im Internetmaßstab erst möglich.
Fast alles, was die Branche LLM nennt — die GPT-Reihe, Claude, Gemini, Llama — ist ein Transformer, trainiert auf die Vorhersage des nächsten Tokens. Die Grenzen der Architektur sind die Grenzen des Feldes: festes Kontextfenster, kein eingebautes Gedächtnis und mit der Länge wachsende Kosten.
Verwandte Begriffe
Großes Sprachmodell (LLM)
Ein auf riesigen Textmengen trainiertes Modell, das vorhersagt, was als Nächstes kommt — was genügt, um zu schreiben, zusammenzufassen, zu übersetzen und viele Aufgaben durchzudenken.
Kontextfenster
Die maximale Textmenge, die ein Modell auf einmal berücksichtigen kann — Anweisungen, Gespräch und Antwort zusammengerechnet.
Token
Die Einheit, die ein Sprachmodell liest und schreibt — Wortfragment, Wort oder Satzzeichen — und die Einheit, in der Kosten und Kontextlimits gezählt werden.
