Ein Diffusionsmodell wird auf Entrauschen trainiert: Es sieht ein zunehmend verrauschtes Bild und lernt, das sauberere wiederherzustellen. Rückwärts aus reinem Rauschen laufend, von einem Text-Prompt geführt, wird daraus Bildgenerierung — das Modell 'findet' im Rauschen ein Bild, das zur Beschreibung passt.
Weil sie lokal und offen laufen, sind Diffusionsmodelle das praktische Rückgrat kommerzieller Bildarbeit: stilkonsistente Illustrationen, Produkt-Mockups, Inpainting und Reparatur. Kontrollmechanismen — Tiefenkarten, Kantenführung, Referenzbilder — machen aus 'hübsches Bild' 'verwendbares Asset'.
Verwandte Begriffe
Stable Diffusion
Eine Familie von Bildmodellen mit offenen Gewichten, die ein Bild erzeugen, indem sie aus einem zufälligen Start wiederholt Rauschen entfernen, geleitet von einer Textbeschreibung.
ComfyUI
Eine knotenbasierte Oberfläche für Bildgenerierung, in der die Pipeline ein expliziter Graph ist statt eines Textfelds mit versteckten Voreinstellungen.
Multimodales Modell
Ein Modell, das mehr als Text verarbeitet und erzeugt — Bilder, Audio, Dokumente —, sodass 'was stimmt auf diesem Foto nicht' oder 'lies diese Rechnung' ein einziger Aufruf ist.
Die zugehörige Werkbank
Generative KIStable Diffusion und ComfyUI eingebunden dort, wo deine Inhalte tatsächlich entstehen, mit einem feinabgestimmten Modell, damit alles nach dir aussieht.
