Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenGrundkursKapitel 14von 16 im Pfad

Ein Bild, das es vorher nicht gab

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Bis hierhin handelte der Kurs von einem einzigen Vorgang: Ein Modell bewertet Token und wählt eines aus (Kapitel 12). Ein Bild entsteht auf einem anderen Weg, und der lässt sich in zwei Sätzen sagen.

Erst kaputtmachen, dann den Rückweg lernen

Die Arbeit, auf der Stable Diffusion und seine Linie stehen, ist von 2015 und nennt den Trick beim Namen:

The essential idea, inspired by non-equilibrium statistical physics, is to systematically and slowly destroy structure in a data distribution through an iterative forward diffusion process (externe Seite, arxiv.org)

Ein Bild wird also Schritt für Schritt in Rauschen verwandelt, bis nichts mehr davon übrig ist. Das ist die leichte Hälfte, denn kaputtmachen kann man ohne zu lernen. Gelernt wird die andere Richtung:

We then learn a reverse diffusion process that restores structure in data, yielding a highly flexible and tractable generative model of the data. (externe Seite, arxiv.org)

Wer den Rückweg beherrscht, braucht kein zerstörtes Bild mehr als Ausgangspunkt. Es genügt ein zufälliges Rauschmuster. Daraus entsteht Schritt für Schritt etwas, das aussieht wie ein Bild, und der eingegebene Text lenkt dabei, wohin die Schritte führen.

Zwei Reihen zu je fünf Feldern. Oben zerfällt ein Bild schrittweise zu Rauschen, das ist das Training. Unten klärt sich Rauschen schrittweise zu einem Bild, das ist die Benutzung. In beiden Reihen dasselbe Motiv aus Sonne und Bergzug. Oben steht es links klar und löst sich nach rechts in kurze Striche auf. Unten beginnt links reines Rauschen, ab der dritten Stufe zeichnet sich das Motiv gestrichelt ab, rechts steht es fertig. Unter jeder Reihe ein Pfeil mit der Richtung. BEIM TRAINIEREN STRUKTUR WIRD ZERSTÖRT BEIM BENUTZEN STRUKTUR WIRD WIEDERHERGESTELLT

seitlich verschiebbar

Oben der Weg, den das Training geht, unten der Weg, den die Benutzung geht. Wie viele Stufen ein Modell wirklich rechnet, ist von Modell zu Modell verschieden und hier nicht dargestellt.

eigene Darstellung nach dem Verfahren aus diffusion-2015, Stand 07.08.2026

Seit 2025 ein zweites Verfahren

So arbeiten die Forschungslinie und die 2022 freigegebene Umsetzung. Seit März 2025 gibt es beim bekanntesten Anbieter eine zweite Bauform: OpenAIs Bilderzeugung sitzt im Sprachmodell selbst und baut ein Bild Stück für Stück auf, so wie das Modell einen Text schreibt. Die Modellkarte begründet damit, was das neue Modell kann:

because it is embedded natively, deep in the architecture of our omnimodal GPT-4o model, 4o image generation can use everything it knows (externe Seite, openai.com)

Was sich dadurch ändert und was gleich bleibt, steht in Ebene 2. Die drei Folgen im nächsten Abschnitt gelten für beide Verfahren.

Was daraus für den Alltag folgt

Es wird nichts nachgeschlagen. In den Gewichten liegt kein Bildarchiv, aus dem etwas herausgesucht wird. Was entsteht, entsteht in diesem Moment.

Zweimal derselbe Auftrag gibt zwei Bilder. Beim Entrauschen ist der Ausgangspunkt ein Zufallsmuster, und ein anderes Muster führt zu einem anderen Ergebnis; beim zweiten Verfahren wird jedes Stück gezogen wie ein Token. Dieselbe Beobachtung wie beim Text, aus demselben Grund (Kapitel 12).

Ein Bild kommt fertig heraus. Es gibt darin keine Ebenen, keine Textfelder und keine Formen, die sich verschieben ließen. Wer ein Ergebnis braucht, das sich später ändern lässt, ist mit einem erzeugten Bild schlecht bedient.

Und was daraus für das Vertrauen folgt

Ein Bild zu erzeugen, kostet heute Sekunden und Cent. Damit verschiebt sich die Frage, die man vor einem Foto stellt. Bisher lautete sie, ob jemand die Aufnahme verändert hat. Jetzt kommt die Frage davor: ob es überhaupt eine gab.

Die naheliegende Hoffnung, ein anderes Modell könne das erkennen, erfüllt sich nicht. Kapitel 13 zitiert die Herstellerdokumentation dazu im Wortlaut: Ob ein Bild von einer Maschine stammt, kann das ansehende Modell nicht sagen.

Deshalb setzen die Anbieter das Zeichen beim Erzeugen. Wie das aussieht, was es aushält und was seit dem 2. August 2026 rechtlich verlangt wird, steht in Ebene 3.

Quellen

11 Einträge, davon 2 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    Deep Unsupervised Learning using Nonequilibrium Thermodynamics (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Sohl-Dickstein und Mitautoren beschreiben am 12.03.2015 das Verfahren, auf dem die bekannten Bildmodelle der folgenden Jahre stehen: Struktur in den Daten wird schrittweise zerstört, und ein Netz lernt den Rückweg. Wer den Rückweg kann, fängt bei Rauschen an und bekommt ein Bild. Brauchbare Bildqualität brachte erst der Umbau der Trainingsvorschrift gut fünf Jahre später, siehe ddpm-2020.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Guidelines on the implementation of the transparency obligations for certain AI systems under Article 50 of the AI Act (externe Seite, digital-strategy.ec.europa.eu)

    digital-strategy.ec.europa.eugeprüft 24.09.2026

    Die Auslegung der Kommission zu Artikel 50, angenommen am 20.07.2026, zwölf Tage vor der Geltung. 51 Seiten mit Randnummern und praktischen Beispielen in beide Richtungen: was erfasst ist und was nicht. Nicht bindend, aber der Maßstab, an dem die Marktaufsicht prüft. Die Adresse zeigt auf die Seite mit dem Dokument, nicht auf die PDF-Datei selbst, damit der Prüflauf lesbaren Text vorfindet.

  • Originalarbeiterreichbar

    Addendum to GPT-4o System Card: 4o image generation (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    OpenAIs Ergänzung zur Modellkarte von GPT-4o vom 25.03.2025, mit der die Bilderzeugung im Modell selbst eingeführt wurde. Sie ist der Beleg dafür, dass hinter einem erzeugten Bild bei OpenAI kein Diffusionsmodell rechnet: Abschnitt 2.1 der Druckfassung sagt, anders als DALL-E, das als Diffusionsmodell arbeite, sei die 4o-Bilderzeugung ein autoregressives Modell, das nativ in ChatGPT eingebettet ist. Dieser Satz steht nur im PDF, weshalb er hier nicht als Zitat geführt wird; die Seite selbst nennt die Einbettung in das Modell und die Fähigkeit, Text in Bilder zu setzen. Die GPT-Image-Modelle der Schnittstelle sind die Fortführung dieser Linie.

  • Originalarbeiterreichbar

    Denoising Diffusion Probabilistic Models (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Ho, Jain und Abbeel bauen am 19.06.2020 die Trainingsvorschrift des Diffusionsverfahrens um und erreichen auf dem Datensatz CIFAR10 den damaligen Höchststand beim FID-Wert. Die Arbeit ist der Schritt zwischen diffusion-2015 und den Bildmodellen ab 2022, Stable Diffusion eingeschlossen.

  • Originalarbeiterreichbar

    High-Resolution Image Synthesis with Latent Diffusion Models (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser und Björn Ommer reichen am 20.12.2021 den Schritt ein, der die Bilderzeugung aus dem Rechenzentrum auf eine einzelne Grafikkarte holte: Das Entrauschen findet in einem verdichteten Zwischenraum statt, in den ein zweites Netz das Bild zuvor übersetzt. Auf den Bildpunkten selbst rechnet dabei niemand mehr. Aus derselben Arbeit stammt die Kreuz-Aufmerksamkeit, über die ein Text die Erzeugung steuert. Die Umsetzung dieser Arbeit ist Stable Diffusion.

  • Ankündigung des Herstellerserreichbar

    Stable Diffusion Public Release (externe Seite, stability.ai)

    stability.aigeprüft 24.09.2026

    Die Freigabe eines Bildmodells samt Gewichten am 22.08.2022, drei Monate vor ChatGPT. Ab hier lässt sich Bilderzeugung auf eigener Hardware betreiben, und die Auseinandersetzung über Trainingsdaten und Urheberrecht beginnt beim Bild.

  • Dokumentationerreichbar

    Image generation (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Anleitung zum erzeugten Bild bei OpenAI, mit dem Stand vom 16.09.2026 und den beiden Modellen gpt-image-2.5-sunburst und gpt-image-2.5-flare. Zwei Angaben stehen darin, die man von außen nicht sieht: Abgerechnet wird in Ausgabe-Token, deren Zahl sich aus Güte und Bildgröße ergibt, und der Abschnitt zu den Grenzen nennt genau die zwei Schwächen, die jeder kennt, der solche Bilder benutzt hat, nämlich Schrift im Bild und wiederkehrende Figuren.

  • Dokumentationerreichbar

    Image generation with Gemini (externe Seite, ai.google.dev)

    ai.google.devgeprüft 24.09.2026

    Googles Anleitung zum erzeugten Bild, und der Beleg für eine Zusage, die kein anderer Anbieter in dieser Form gibt: In jedem erzeugten Bild steckt ein Wasserzeichen. Der Satz steht zweimal auf der Seite, einmal bei den Modellen und einmal bei den Grenzen, und er kennt keine Ausnahme. Dieselbe Seite nennt auch den Weg um die Schriftschwäche herum, nämlich den Text zuerst erzeugen zu lassen und ihn dann ins Bild zu bestellen.

  • Dokumentationerreichbar

    Google DeepMind, SynthID (externe Seite, deepmind.google)

    deepmind.googlegeprüft 24.09.2026

    Ein Wasserzeichen, das beim Erzeugen in den Inhalt selbst eingebettet wird, für Bild, Ton, Text und Video, dazu ein Portal zum Nachprüfen. Die Reichweite ist dabei enger, als der Name vermuten lässt: Der Anbieter beschreibt sie als seine eigenen Endkundenprodukte. Über den Sprachagenten eines Dritten sagt das Verfahren nichts.

  • Originalarbeiterreichbar

    C2PA, Content Credentials Specification (externe Seite, spec.c2pa.org)

    spec.c2pa.orggeprüft 24.09.2026

    Die offene Spezifikation für den Herkunftsnachweis an einer Mediendatei, mit Ton ausdrücklich unter den Trägerformaten. Der Nachweis hängt an der Datei und beschreibt, womit sie erzeugt und was daran verändert wurde. Er sagt damit etwas über den Weg einer Aufnahme und nichts über die Stimme darin. Die Spezifikation benennt zugleich die Schwäche dieses Wegs: Ein Bild kann von seinem Nachweis getrennt werden, wenn die Metadaten verlorengehen.

  • Dokumentationerreichbar

    Gemini API changelog (externe Seite, ai.google.dev)

    ai.google.devgeprüft 24.09.2026

    Die Änderungsliste der Gemini-Schnittstelle. Sie führt unter dem 15.06.2026 die Ankündigung, drei Bildmodelle der Imagen-Reihe am 17.08.2026 abzuschalten, und ist damit der Beleg dafür, dass auch ein Bildwerkzeug ein Ablaufdatum hat. Der Eintrag nennt keinen Nachfolger und verweist auf eine eigene Seite dafür.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.