DFIELDSOLUTIONS

KI und Sprachmodelle

GlossarMultimodales Modell

Ein Modell, das mehr als Text verarbeitet und erzeugt — Bilder, Audio, Dokumente —, sodass 'was stimmt auf diesem Foto nicht' oder 'lies diese Rechnung' ein einziger Aufruf ist.

Frühe Chatbots waren Text rein, Text raus; multimodale Modelle bekommen Augen und Ohren. Dieselbe Architektur, die das nächste Token vorhersagt, verarbeitet Bild-Patches oder Audio-Frames, sodass ein Nutzer ein defektes Teil, einen Beleg oder einen Screenshot fotografieren kann und eine Antwort bekommt, die im tatsächlich Sichtbaren gründet.

In der Praxis kollabieren Pipelines, die früher OCR plus Regeln plus einen Menschen brauchten: Dokumenteneingang, Schadensmeldungen, Barrierefreiheits-Beschreibungen. Die Vorbehalte skalieren mit der Eingabe — Bilder kosten mehr Tokens, als sie aussehen, und ein Modell, das Ihre Rechnung lesen kann, kann auch lesen, was es nicht sehen sollte.

Verwandte Begriffe

Die zugehörige Werkbank

Generative KI

Stable Diffusion und ComfyUI eingebunden dort, wo deine Inhalte tatsächlich entstehen, mit einem feinabgestimmten Modell, damit alles nach dir aussieht.

Alle BegriffeGespräch beginnenMarkdown-Version

DField Bt. · Dunakeszi · dezso@dfieldsolutions.com
5,0
“Von der LinkedIn-Nachricht zur Live-Seite. Zwei winzige Änderungen, dann online.”Michael J Ringer · Vilya ProtectionGründer · Spanien