Modelle sehen keinen Text, sie sehen Tokens: häufige Wörter werden ein Token, seltene zerfallen in mehrere, und hundert Tokens sind grob fünfundsiebzig englische Wörter. Jeder Modellaufruf wird in Eingabe- und Ausgabetokens abgerechnet — deshalb wird ein Chatbot teuer, der bei jeder Nachricht ein langes Dokument mitschleppt.
Die praktische Folge ist Budgetierung: Prompt-Länge, Verlauf und die Antwort selbst teilen sich dasselbe Kontextfenster, und der Preis gilt pro Million Tokens, nicht pro Anfrage. Techniken wie RAG existieren vor allem, um Tokens nur für die Fragmente auszugeben, die zählen.
Verwandte Begriffe
Kontextfenster
Die maximale Textmenge, die ein Modell auf einmal berücksichtigen kann — Anweisungen, Gespräch und Antwort zusammengerechnet.
RAG (Retrieval-Augmented Generation)
Erst die passenden Dokumente heraussuchen und in den Prompt legen, damit das Modell aus deinem Material antwortet statt aus dem Gedächtnis.
Großes Sprachmodell (LLM)
Ein auf riesigen Textmengen trainiertes Modell, das vorhersagt, was als Nächstes kommt — was genügt, um zu schreiben, zusammenzufassen, zu übersetzen und viele Aufgaben durchzudenken.
Die zugehörige Werkbank
KI-AutomatisierungDie repetitive Hälfte deiner Woche, übergeben an Software, der nicht langweilig wird. Posteingang sortieren, Nachfassen, Reporting, Datenpflege zwischen Tools, die nie zum Zusammenspiel gedacht waren.
