Frühe Chatbots waren Text rein, Text raus; multimodale Modelle bekommen Augen und Ohren. Dieselbe Architektur, die das nächste Token vorhersagt, verarbeitet Bild-Patches oder Audio-Frames, sodass ein Nutzer ein defektes Teil, einen Beleg oder einen Screenshot fotografieren kann und eine Antwort bekommt, die im tatsächlich Sichtbaren gründet.
In der Praxis kollabieren Pipelines, die früher OCR plus Regeln plus einen Menschen brauchten: Dokumenteneingang, Schadensmeldungen, Barrierefreiheits-Beschreibungen. Die Vorbehalte skalieren mit der Eingabe — Bilder kosten mehr Tokens, als sie aussehen, und ein Modell, das Ihre Rechnung lesen kann, kann auch lesen, was es nicht sehen sollte.
Verwandte Begriffe
Großes Sprachmodell (LLM)
Ein auf riesigen Textmengen trainiertes Modell, das vorhersagt, was als Nächstes kommt — was genügt, um zu schreiben, zusammenzufassen, zu übersetzen und viele Aufgaben durchzudenken.
OCR
Optische Zeichenerkennung — Text in Bildern in echten Text verwandeln, damit gescannte Rechnungen, Belege und Formulare Daten werden statt Bilder.
Sprache zu Text
Gesprochenes Audio mit einem Modell in geschriebenen Text übertragen — das Frontend von Sprachnotizen, Anrufzusammenfassungen und 'sprich mit dem Computer'-Oberflächen.
Die zugehörige Werkbank
Generative KIStable Diffusion und ComfyUI eingebunden dort, wo deine Inhalte tatsächlich entstehen, mit einem feinabgestimmten Modell, damit alles nach dir aussieht.
