Startseite/Technologien/Diffusionsmodelle einfach erklärt: So generieren neuronale Netzwerke Bilder aus Rauschen
Technologien

Diffusionsmodelle einfach erklärt: So generieren neuronale Netzwerke Bilder aus Rauschen

Diffusionsmodelle ermöglichen es neuronalen Netzwerken, aus reinem Rauschen beeindruckende Bilder zu erzeugen - nur anhand einer Textbeschreibung. Dieser Beitrag erklärt Schritt für Schritt, wie der Prozess funktioniert, warum Stable Diffusion so effizient ist und wie Textprompts gezielt die Bildgestaltung beeinflussen.

10. Sept. 2026
12 Min
Diffusionsmodelle einfach erklärt: So generieren neuronale Netzwerke Bilder aus Rauschen

Diffusionsmodelle sind eine der Schlüsseltechnologien, mit denen moderne neuronale Netzwerke Bilder anhand von Textbeschreibungen generieren können. Das Besondere daran: Die Erzeugung beginnt nicht mit einer Skizze oder einer Vorlage, sondern mit fast völlig zufälligem Rauschen - ähnlich wie das Bildrauschen auf alten Fernsehern.

Anschließend wandelt das neuronale Netzwerk dieses Rauschen Schritt für Schritt um, wobei allmählich Formen, Objekte, Farben und Details entstehen. In den ersten Phasen sieht das Bild wie ein chaotisches Muster aus, aber mit jedem weiteren Schritt nimmt die Struktur an Bedeutung zu und entspricht immer mehr der Texterklärung des Nutzers.

Genau dieses Prinzip steckt hinter vielen populären Bildgeneratoren wie Stable Diffusion. Um zu verstehen, wie aus zufälligem Rauschen ein realistisches Bild entstehen kann, sollte man wissen, wie Diffusionsmodelle trainiert werden, was sie mit dem Rauschen machen und wie der Textprompt das Ergebnis beeinflusst.

Was sind Diffusionsmodelle einfach erklärt?

Diffusionsmodelle sind generative neuronale Netzwerke, die lernen, neue Daten zu erzeugen, indem sie schrittweise Rauschen hinzufügen und entfernen. Bei Bildern lernt das Modell zunächst, wie sich ein Bild durch Hinzufügen von Rauschen verändert, und anschließend, wie es diese Veränderungen rückgängig machen kann - also die Struktur aus Rauschen rekonstruiert.

Vereinfacht sieht das Training so aus: Ein normales Bild wird genommen und nach und nach mit zufälligem Rauschen versehen, bis das ursprüngliche Bild nahezu verschwindet. Das neuronale Netzwerk erhält Bilder mit unterschiedlich starkem Rauschen und lernt, wie viel Rauschen entfernt werden muss, um dem Original wieder näher zu kommen.

Bei der Generierung läuft der Prozess in umgekehrter Richtung ab. Anstatt ein fertiges Foto zu bekommen, startet das Modell mit zufälligem Rauschen und verwandelt es schrittweise in ein sinnvolles Bild. Das Ergebnis ist keine Rekonstruktion eines Trainingsbildes, sondern eine neue Kombination von Merkmalen, die das Netzwerk im Training gelernt hat.

Für ein besseres Verständnis der Grundlagen - Schichten, Parameter, Training und Verarbeitung von Eingabedaten - finden Sie weitere Informationen im Beitrag Wie neuronale Netzwerke funktionieren: Von Mathematik zu Praxis.

Warum spricht man von Diffusionsmodellen?

Die Bezeichnung stammt vom Begriff Diffusion - einem Prozess, bei dem eine Struktur allmählich chaotischer wird. In der Physik sieht man das beispielsweise, wenn sich Partikel in einem Raum verteilen. In Diffusionsmodellen übernimmt das zufällige Rauschen diese Rolle.

Mit jedem Schritt wird dem Bild etwas Rauschen hinzugefügt. Zunächst verschwimmen Details, dann verschwinden Konturen, Farben vermischen sich, und nach vielen Schritten bleibt nur noch ein zufälliges Muster.

Für das Netzwerk ist der schrittweise Verlauf entscheidend. Würde das Bild sofort komplett durch Rauschen ersetzt, wäre es nahezu unmöglich, Zusammenhänge zwischen dem Original und dem Ergebnis zu lernen. Durch die Aufteilung in viele kleine Schritte kann das Modell hingegen die Umkehrung lernen.

Wie unterscheidet sich ein Diffusionsmodell von klassischen neuronalen Netzen?

Ein Diffusionsmodell ist keine bestimmte Netzarchitektur, sondern eine Methode zur Organisation des generativen Prozesses. Es nutzt neuronale Netze, die verrauschte Daten analysieren und bestimmen, wie sie im nächsten Schritt verändert werden sollen.

Ein klassisches Modell zur Klassifikation bekommt z. B. ein Foto und erkennt, was darauf zu sehen ist. Ein Diffusionsmodell hingegen soll neue Daten erzeugen, die einer gelernten Verteilung von Bildern entsprechen.

Das Modell beantwortet also nicht nur, ob auf dem Bild ein Auto oder Mensch ist. Es lernt im Training viele visuelle Muster: Objektformen, Texturen, Licht, Perspektiven, Farbkombinationen und Anordnungen. Diese Kenntnisse werden später genutzt, um aus Rauschen ein neues Bild zu formen.

Wie wird ein Diffusionsmodell mit Bildern und Rauschen trainiert?

Damit ein Diffusionsmodell Bilder generieren kann, wird es zunächst mit vielen Beispielen trainiert. Dabei betrachtet das Netzwerk nicht einfach fertige Bilder, sondern bekommt Versionen mit unterschiedlichem Rauschgrad und lernt, wie es aus verrauschten Zuständen zurück zum klareren Bild kommt.

So lässt sich die komplexe Aufgabe in viele kleine Schritte zerlegen. Anstatt eine ganze Szene auf einmal zu erzeugen, lernt das Modell lokale Verbesserungen: Es erkennt, welcher Teil des Signals Rauschen ist und wie er entfernt werden kann.

Vorwärtsprozess: Wie ein Bild zu Rauschen wird

Das Training beginnt mit einem normalen Bild. Schrittweise wird zufälliges Rauschen hinzugefügt - mit jedem Schritt wird es mehr. Zunächst bleibt das Bild fast unverändert, dann verschwinden Details, später die Konturen, bis am Ende fast nur noch Rauschen übrig ist.

Dieser Vorgang heißt Vorwärtsdiffusion. Man kann ihn sich als festgelegte Abfolge vorstellen, bei der jedes neue Bild etwas verrauschter ist als das vorherige.

Das Modell erhält nicht nur das verrauschte Bild, sondern auch die Information, wie weit es im Prozess fortgeschritten ist. Dadurch lernt das Netzwerk, mit leicht beschädigten wie auch mit fast komplett verrauschten Bildern umzugehen.

Was lernt das neuronale Netzwerk eigentlich?

Die Hauptaufgabe des Modells ist, das dem Bild hinzugefügte Rauschen vorherzusagen. Wenn das Netzwerk dies genau schafft, kann das Rauschen entfernt werden - so entsteht eine klarere Bildversion.

Diese Operation wird im Training zig Millionen Mal mit unterschiedlichen Bildern und Rauschgraden wiederholt. Allmählich erkennt das Modell typische Muster realer Bilder: Objektkanten, Formen, Texturen, Licht und räumliche Beziehungen.

Wichtig ist, dass das Netzwerk keine Anleitungen für jedes einzelne Bild speichert. Es lernt allgemeine Regeln: Wie sieht ein glaubwürdiges Bild aus und wie kann das aktuelle Rauschen verändert werden, um diesem Ergebnis näher zu kommen.

Warum braucht das Training so viele Bilder?

Um vielfältige Szenen erzeugen zu können, muss das Modell zahlreiche Objekte, Stile, Perspektiven, Texturen und Lichtverhältnisse gesehen haben. Je breiter der Datensatz, desto mehr visuelle Muster kann das Netzwerk lernen.

Dasselbe Bild kann im Training mit verschiedenen Rauschgraden genutzt werden: Mal sieht das Modell fast das Original, mal nur schwache Konturen, mal nur Rauschen. So lernt es, auf allen Stufen zu arbeiten.

Der Trainingsprozess ist extrem rechenintensiv, da das Modell Millionen Male seine Vorhersagen mit dem bekannten Rauschen abgleicht und die Parameter anpasst. Diese Parameter speichern letztlich die Fähigkeit, Strukturen wiederherzustellen und neue Bilder zu erzeugen.

Wie erzeugt das neuronale Netzwerk ein Bild aus Rauschen?

Nach dem Training kann das Diffusionsmodell den Prozess umkehren. Es braucht kein Ausgangsbild mehr - die Generierung beginnt mit zufälligem Rauschen, das das Netzwerk Schritt für Schritt in ein Bild verwandelt.

Das Modell analysiert bei jedem Schritt den aktuellen Zustand und schätzt, welcher Anteil des Rauschens entfernt oder verändert werden muss. So entsteht ein immer strukturierteres Bild, das erneut ins Modell eingespeist wird. Dieser Vorgang wiederholt sich viele Male, bis aus dem Zufallsmuster ein fertiges Bild entsteht.

Der Start: reines Rauschen

Der Anfangszustand ist ein chaotisches Pixelmuster ohne erkennbare Objekte. Es gibt kein "verstecktes Foto", das das Netzwerk aufdeckt - der Start ist wirklich zufällig.

Dann sucht das Modell eine Richtung, in die es das Rauschen so verändern kann, dass das Ergebnis dem gelernten Bildverteilungsmuster ähnelt. Erst entstehen grobe Flächen und Komposition, später werden Formen, Licht, Farben und Details verfeinert.

Wegen dieses Zufalls ist die Generierung nicht komplett deterministisch. Selbst identische Textprompts führen zu unterschiedlichen Kompositionen, Posen, Hintergründen und Details.

Wie wird das Rauschen Schritt für Schritt entfernt?

Der Rückprozess ist eine Abfolge kleiner Korrekturen. Das Modell kennt das Endergebnis nicht, sondern nähert sich bei jedem Schritt ein Stück weit einem glaubwürdigen Bild.

Am Anfang sind die Änderungen grob: Das Netzwerk erkennt die Grundstruktur der Szene - wo ist das Hauptobjekt, wie groß soll es sein, wo sind helle und dunkle Bereiche? Mit jedem weiteren Schritt werden die Anpassungen feiner.

Im weiteren Verlauf entstehen Konturen, Texturen, Gesichtszüge, Materialien, Reflexionen und weitere Details. Je näher das Ende, desto weniger Rauschen bleibt und desto präziser werden die Korrekturen.

Vereinfacht sieht der Weg so aus:
zufälliges Rauschen → grobe Flächen → Grundformen → erkennbare Objekte → Texturen und Details → fertiges Bild.

Deshalb braucht die Generierung mehrere Schritte. Würde das Modell aus komplettem Rauschen in einem einzigen Schritt ein Bild erzeugen, wäre es sehr schwierig, eine stimmige Komposition und glaubwürdige Details zu schaffen.

Warum entstehen aus einem Prompt verschiedene Bilder?

Das liegt daran, dass der Prozess meist mit neuem Zufallsrauschen startet. Dieses legt die Ausgangskonfiguration fest, sodass bei gleichem Prompt jedes Mal eine andere Startposition entsteht.

Diese Zufälligkeit lässt sich mit dem Seed-Parameter steuern. Diese Zahl erzeugt reproduzierbares Anfangsrauschen. Mit gleichem Seed und identischen Einstellungen kann das Modell sehr ähnliche oder sogar identische Ergebnisse liefern.

Ein anderer Seed erlaubt es, verschiedene Varianten einer Idee zu erkunden. Beispielsweise führt ein Prompt für eine futuristische Stadt jedes Mal zu anderen Straßenlayouts, Gebäudeanordnungen, Lichtverhältnissen und Perspektiven, obwohl die Textbeschreibung gleich bleibt.

Wie steuert der Textprompt die Bildgenerierung?

Allein das Entfernen von Rauschen erklärt noch nicht, warum das Netzwerk genau das erzeugt, was im Text steht. Damit die Generierung der Textbeschreibung entspricht, muss das Diffusionsmodell Wörter mit visuellen Merkmalen verknüpfen und diese Information bei jedem Generierungsschritt nutzen.

Wird zum Beispiel "rotes Sportauto nachts im Regen" eingegeben, muss das Modell mehrere Bedingungen berücksichtigen: Objekttyp, Farbe, Umgebung, Licht und Atmosphäre. All diese Parameter beeinflussen, wie das Anfangsrauschen verändert wird.

Wie wird Text für das Modell verständlich?

Das neuronale Netzwerk arbeitet nicht direkt mit Text wie wir Menschen. Der Prompt wird zunächst in Bestandteile zerlegt und in eine Zahlenrepräsentation umgewandelt, die Informationen über die Bedeutung der Wörter und deren Zusammenhänge enthält.

Diese Darstellung nennt man Embedding. Sie ermöglicht es dem Modell, ähnliche Wörter, Begriffe und visuelle Merkmale zu assoziieren. Mehr dazu finden Sie im Beitrag Embeddings in neuronalen Netzen: Bedeutung, Anwendung, Funktionsweise.

Der erzeugte Textvektor wird während der Generierung verwendet. Bei jedem Schritt berücksichtigt das Modell nicht nur den Bildzustand, sondern prüft auch, wie gut er zum Prompt passt.

Wie verbindet das Modell Wörter mit Bildmerkmalen?

Im Training erhält das Netzwerk Bilder samt Textbeschreibungen. Nach und nach erkennt es statistische Zusammenhänge zwischen Wörtern und visuellen Eigenschaften.

Taucht das Wort "Auto" häufig mit Fahrzeugbildern auf, lernt das Modell, dieses Konzept mit Karosserien, Rädern, Scheinwerfern und weiteren Merkmalen zu verbinden. Ebenso werden Begriffe wie "Nacht", "Regen" oder "Neon" mit bestimmten Lichtsituationen, Farben und Texturen assoziiert.

Bei der Generierung lenken diese Verknüpfungen den Prozess der Rauschentfernung. Das Modell verstärkt Strukturen, die zum Prompt passen, und schwächt solche, die widersprechen.

Der Prompt gibt also nicht exakt vor, wo ein Objekt gemalt wird, sondern legt die Richtung fest, in die das Netzwerk das Rauschen verändert, damit das Ergebnis möglichst gut zum Textinhalt passt.

Warum versteht das Netzwerk den Prompt manchmal falsch?

Auch moderne Diffusionsmodelle erfassen Text nicht so exakt wie Menschen. Ist der Prompt zu lang, widersprüchlich oder enthält er viele Objekte, können Bedingungen ignoriert oder missinterpretiert werden.

Besonders schwierig sind räumliche Beziehungen und genaue Objektzahlen. Sätze wie "drei Menschen links vom Auto, ein Hund rechts" erfordern, dass das Modell Anzahl, Position und Beziehungen mehrerer Elemente korrekt erkennt.

Probleme treten auch bei seltenen Begriffen, ungewöhnlichen Objektkombinationen oder schlecht repräsentierten Wörtern im Training auf. Dann ersetzt das Modell Unbekanntes durch Ähnliches oder mischt Merkmale verschiedener Konzepte.

Die Qualität des Ergebnisses hängt also nicht nur vom Modell, sondern auch von der Eindeutigkeit des Prompts und der Repräsentation der Begriffe im Training ab.

Wie funktioniert Stable Diffusion und warum arbeitet es im latenten Raum?

Stable Diffusion basiert auf dem gleichen Prinzip des schrittweisen Rauschentfernens, arbeitet jedoch nicht direkt mit dem vollständigen Bild. Der Hauptprozess läuft in einem latenten Raum ab - einer kompakteren Darstellung des Bildes.

Diese Methode nennt sich Latent Diffusion. Sie reduziert den Rechenaufwand, da das Modell nicht in jedem Schritt Millionen Bildpunkte verarbeiten muss.

Warum verarbeitet Stable Diffusion nicht das ganze Bild?

Ein vollauflösendes Bild enthält riesige Datenmengen. Ein 1024 × 1024 Pixel großes Bild besteht aus mehr als einer Million Pixeln, jedes mit mehreren Farbwerten.

Würde man viele Diffusionsschritte direkt auf dieser Ebene ausführen, wäre der Speicher- und Rechenbedarf enorm.

Stable Diffusion löst das mit einem speziellen Encoder. Dieser wandelt das Bild in ein kompaktes latentes Format um, das die wichtigsten visuellen Eigenschaften erhält, aber viel weniger Speicher benötigt.

Im latenten Raum fügt das Modell Rauschen hinzu und entfernt es wieder. Nach Abschluss der Generierung übersetzt ein Decoder das Ergebnis zurück in ein sichtbares Bild.

Vom Prompt zum fertigen Bild: Die Schritte in Stable Diffusion

Vereinfacht läuft die Generierung in Stable Diffusion folgendermaßen ab:

  1. Der Textprompt des Nutzers wird in eine Zahlenrepräsentation umgewandelt, die Informationen zu Objekten, Eigenschaften und Bildmerkmalen enthält.
  2. Es wird zufälliges Rauschen im latenten Raum erzeugt - noch ohne fertiges Bild, nur ein Wertemuster.
  3. Das Modell entfernt in mehreren Schritten Rauschen. Bei jedem Schritt analysiert es den aktuellen Latent-Zustand und den Prompt und steuert das Ergebnis in Richtung Vorgabe.
  4. Am Ende enthält das latente Format die Struktur des Bildes. Der Decoder wandelt es zurück in ein sichtbares Bild.

Zusammengefasst:
Textprompt → Textrepräsentation → zufälliger Latent → schrittweise Rauschentfernung → fertiger Latent → Decodierung → Bild.

Warum ist dieses Vorgehen sinnvoll?

Der große Vorteil des latenten Raums ist die Ressourceneinsparung. Das Modell arbeitet mit weniger Daten, sodass die Generierung weniger Grafikspeicher und Zeit kostet als bei vollständiger Bildverarbeitung.

So lassen sich Diffusionsmodelle nicht nur auf Servern, sondern auch auf normalen Grafikkarten mit ausreichend Speicher betreiben.

Die Grundidee bleibt: Das Netzwerk "malt" kein Bild auf einen Schlag, sondern wandelt zufälliges Rauschen Schritt für Schritt in eine Struktur um, die dem Textprompt entspricht. Stable Diffusion unterscheidet sich vor allem dadurch, dass es im komprimierten internen Format arbeitet, nicht direkt mit Millionen Pixeln.

Fazit

Diffusionsmodelle haben die Bildgenerierung revolutioniert. Ihr Prinzip: Das neuronale Netzwerk lernt, die Struktur von Rauschen zu verstehen und diese allmählich in ein sinnvolles Bild zu verwandeln. Statt ein Bild in einem Schritt zu erzeugen, erfolgt eine Serie kleiner Anpassungen, die das Ergebnis immer näher an das Gelernte und den Textprompt bringen.

Der größte Vorteil: Hohe Steuerbarkeit und Qualität. Die Textbeschreibung gibt die Richtung vor, das zufällige Rauschen sorgt für Vielfalt, und das schrittweise Entfernen von Rauschen ermöglicht die präzise Ausgestaltung von Komposition, Objekten, Farben und Details.

Stable Diffusion hat dieses Prinzip durch die Arbeit im latenten Raum noch effizienter gemacht. So benötigt die Generierung weniger Ressourcen und ist auch für normale Nutzer zugänglich.

Das Verständnis dieses Mechanismus hilft, moderne Bildgeneratoren besser einzuordnen: Sie "malen" nicht wie ein Mensch und rufen keine fertigen Bilder aus dem Gedächtnis ab - sie verwandeln schrittweise einen Zufallszustand in ein neues Ergebnis, basierend auf gelernten Mustern aus dem Training.

Tags:

diffusionsmodell
neuronale-netzwerke
stable-diffusion
bildgenerierung
kuenstliche-intelligenz
latent-diffusion
textprompt
rauschen

Ähnliche Artikel