GrundlagenGrundkursKapitel 14von 16 im Pfad
Ein Bild, das es vorher nicht gab
Bis hierhin handelte der Kurs von einem einzigen Vorgang: Ein Modell bewertet Token und wählt eines aus (Kapitel 12). Ein Bild entsteht auf einem anderen Weg, und der lässt sich in zwei Sätzen sagen.
Erst kaputtmachen, dann den Rückweg lernen
Die Arbeit, auf der Stable Diffusion und seine Linie stehen, ist von 2015 und nennt den Trick beim Namen:
Ein Bild wird also Schritt für Schritt in Rauschen verwandelt, bis nichts mehr davon übrig ist. Das ist die leichte Hälfte, denn kaputtmachen kann man ohne zu lernen. Gelernt wird die andere Richtung:
Wer den Rückweg beherrscht, braucht kein zerstörtes Bild mehr als Ausgangspunkt. Es genügt ein zufälliges Rauschmuster. Daraus entsteht Schritt für Schritt etwas, das aussieht wie ein Bild, und der eingegebene Text lenkt dabei, wohin die Schritte führen.
seitlich verschiebbar
eigene Darstellung nach dem Verfahren aus diffusion-2015, Stand 07.08.2026
Seit 2025 ein zweites Verfahren
So arbeiten die Forschungslinie und die 2022 freigegebene Umsetzung. Seit März 2025 gibt es beim bekanntesten Anbieter eine zweite Bauform: OpenAIs Bilderzeugung sitzt im Sprachmodell selbst und baut ein Bild Stück für Stück auf, so wie das Modell einen Text schreibt. Die Modellkarte begründet damit, was das neue Modell kann:
Was sich dadurch ändert und was gleich bleibt, steht in Ebene 2. Die drei Folgen im nächsten Abschnitt gelten für beide Verfahren.
Was daraus für den Alltag folgt
Es wird nichts nachgeschlagen. In den Gewichten liegt kein Bildarchiv, aus dem etwas herausgesucht wird. Was entsteht, entsteht in diesem Moment.
Zweimal derselbe Auftrag gibt zwei Bilder. Beim Entrauschen ist der Ausgangspunkt ein Zufallsmuster, und ein anderes Muster führt zu einem anderen Ergebnis; beim zweiten Verfahren wird jedes Stück gezogen wie ein Token. Dieselbe Beobachtung wie beim Text, aus demselben Grund (Kapitel 12).
Ein Bild kommt fertig heraus. Es gibt darin keine Ebenen, keine Textfelder und keine Formen, die sich verschieben ließen. Wer ein Ergebnis braucht, das sich später ändern lässt, ist mit einem erzeugten Bild schlecht bedient.
Und was daraus für das Vertrauen folgt
Ein Bild zu erzeugen, kostet heute Sekunden und Cent. Damit verschiebt sich die Frage, die man vor einem Foto stellt. Bisher lautete sie, ob jemand die Aufnahme verändert hat. Jetzt kommt die Frage davor: ob es überhaupt eine gab.
Die naheliegende Hoffnung, ein anderes Modell könne das erkennen, erfüllt sich nicht. Kapitel 13 zitiert die Herstellerdokumentation dazu im Wortlaut: Ob ein Bild von einer Maschine stammt, kann das ansehende Modell nicht sagen.
Deshalb setzen die Anbieter das Zeichen beim Erzeugen. Wie das aussieht, was es aushält und was seit dem 2. August 2026 rechtlich verlangt wird, steht in Ebene 3.
Zwischen der Arbeit von 2015 und dem Bildgenerator im Browser liegen sieben Jahre und vier Stationen, die alle datiert sind.
Vier Stationen
2015, das Verfahren. Sohl-Dickstein und Mitautoren beschreiben den Vorwärts- und den Rückweg, beide Sätze stehen in Ebene 1 dieses Kapitels. Es ist eine Arbeit über eine Idee, und die Bilder darin sind klein.
2020, die brauchbare Trainingsvorschrift. Ho, Jain und Abbeel bauen das Training um und liefern die erste Zahl, die aufhorchen lässt:
Beides sind Maße für die Qualität erzeugter Bilder, gemessen auf einem Standarddatensatz aus Fotos von 32 mal 32 Bildpunkten. Der Bestwert von 2020 sagt nichts über heutige Bilder. Er sagt, dass das Verfahren ab hier konkurrenzfähig war.
Dezember 2021, der Schritt, der es bezahlbar machte. Bis dahin fand jeder Entrauschungsschritt auf den Bildpunkten selbst statt, und bei einem großen Bild sind das Millionen Zahlen je Schritt. Rombach und vier Mitautoren verlegen die Arbeit in einen verdichteten Zwischenraum:
we apply them in the latent space of powerful pretrained autoencoders (externe Seite, arxiv.org)
Ein zweites Netz übersetzt das Bild vorher in diese kleinere Darstellung und hinterher zurück. Was ein solches Netz ist, steht in KI-Wissen, Kapitel 03. Die Arbeit beschreibt den Gewinn als Gratwanderung, die aufgeht:
Aus derselben Arbeit stammt auch der Weg, über den ein Text die Erzeugung lenkt, und zwar ohne dass dafür neu trainiert werden muss:
August 2022, die Freigabe. Die Umsetzung dieser Arbeit erscheint samt Gewichten (externe Seite, stability.ai), drei Monate vor ChatGPT. Ab diesem Tag lässt sich Bilderzeugung auf einer einzelnen Grafikkarte betreiben, und die Auseinandersetzung über die Trainingsdaten beginnt. Sie ist bis heute nicht abgeschlossen und steht deshalb in diesem Kapitel als offene Frage, ohne Antwort.
Belegt ist das Verfahren damit für die Forschungslinie und für die 2022 freigegebene Umsetzung. Für die Produkte von heute gilt es nur zum Teil.
Ein zweites Verfahren, seit März 2025
Für sein eigenes Bildmodell nennt OpenAI seit dem 25.03.2025 eine andere Bauform. Die Ergänzung zur Modellkarte von GPT-4o sagt, anders als DALL·E, das als Diffusionsmodell arbeite, sei die neue Bilderzeugung ein autoregressives Modell, das im Chatprogramm selbst eingebettet ist. Autoregressiv heißt: Das Bild entsteht wie ein Text, Stück für Stück, jedes aus dem, was schon da ist (Kapitel 02). Als Folge nennt die Modellkarte unter anderem die Schrift im Bild:
Wie weit das reicht, steht zwei Abschnitte weiter unten, aus derselben Hand: Die Anleitung zur Schnittstelle führt die genaue Platzierung von Text weiterhin als Schwäche. Die GPT-Image-Modelle, mit denen dort abgerechnet wird, sind die Fortführung dieser Linie. Googles Anleitung zur Bilderzeugung nennt das Verfahren hinter Gemini nicht; für dieses Modell bleibt die Frage offen.
Wie es heute abgerechnet wird
Bei den großen Anbietern läuft die Bilderzeugung über dieselbe Schnittstelle wie der Text (Kapitel 11):
Bezahlt wird ebenfalls in Token, und zwar in Ausgabe-Token. Wie viele es sind, ergibt sich aus zwei Angaben, die der Aufrufende selbst wählt: der gewünschten Güte und der Bildgröße. Ein festes Stückgeld je Bild gibt es also nicht, und ein Preisvergleich braucht beide Angaben.
Zur Dauer nennt dieselbe Seite eine Hausnummer, die man beim Bauen einplanen sollte:
Complex prompts may take up to 2 minutes to process (externe Seite, developers.openai.com)
Für ein Gespräch ist das zu lang. Wer Bilderzeugung in einen Ablauf einbaut, in dem jemand wartet, braucht dafür eine eigene Antwort (Conversational AI, Kapitel 03).
Was diese Modelle weiterhin schlecht können
Die Dokumentation ist an dieser Stelle offen, und beide Punkte kennt jeder, der solche Bilder schon benutzt hat.
Schrift im Bild.
Google beschreibt für dieselbe Schwäche einen Umweg, der sie zugleich erklärt: erst den Text erzeugen lassen, dann das Bild dazu bestellen.
Dieselbe Figur zweimal.
Für eine Reihe von Bildern mit derselben Person oder demselben Logo ist das die entscheidende Grenze. Sie ist der Grund, warum solche Reihen in der Praxis mehr Anläufe brauchen als ein Einzelbild. Bei bewegten Bildern wird aus dieser Nebenfrage die Hauptfrage, und was daran hängt, steht in KI-Wissen, Kapitel 13.
Wo ein Programm die bessere Antwort ist
Aus dem eigenen Bestand ein Fall, der beide Grenzen zusammenführt. Für eine Schulung sollten zwanzig Folien entstehen, aus vorhandenem Material und für eine andere Zielgruppe zugeschnitten. Naheliegend wäre gewesen, die Folien erzeugen zu lassen.
Gemacht wurde es anders: Ein Programm schrieb die Präsentationsdatei, Folie für Folie, über eine Bibliothek. Das Ergebnis blieb bearbeitbar, ließ sich wiederholen und stand unter Versionskontrolle (Vibe-Coding / Agentic Engineering, Kapitel 04). Der eigene Zeitaufwand lag bei 15 bis 20 Minuten für Auftrag, Durchsicht und Rückmeldung.
Vor jedem erzeugten Bild steht deshalb die Frage, ob am Ende wirklich ein Bild gebraucht wird. Ein Diagramm, eine Folie und ein Formular sind Dinge mit Struktur, und die entsteht besser aus Code als aus Rauschen.
Ein erzeugtes Bild lässt sich hinterher nicht als solches erkennen. Daraus folgt alles, was in diesem Abschnitt steht: Soll die Herkunft überhaupt sichtbar sein, muss sie beim Erzeugen angebracht werden. Dafür gibt es zwei Wege, und sie sind verschieden haltbar.
Weg eins, das Zeichen im Bild
Google hinterlegt ein Wasserzeichen in den Bildpunkten selbst, und die Zusage dazu kennt keine Ausnahme:
All generated images include a SynthID watermark. (externe Seite, ai.google.dev)
Das Verfahren ist auf Bilder nicht beschränkt:
Und es gibt eine Stelle zum Nachprüfen:
Die Reichweite ist dabei enger, als der Name nahelegt. Der Anbieter beschreibt sie als seine eigenen Endkundenprodukte, ein Bild aus einem anderen Haus hat also kein solches Zeichen.
Weg zwei, der Nachweis an der Datei
Der zweite Weg hängt einen signierten Nachweis an die Datei, in dem steht, womit sie erzeugt und was daran verändert wurde. Die Spezifikation dafür ist offen und benennt ihre eigene Schwachstelle:
Genau das passiert im Alltag ständig. Ein Bildschirmfoto, ein erneutes Speichern oder ein Dienst, der beim Hochladen aufräumt, und der Nachweis ist weg. Die Spezifikation beschreibt dafür ein Gegenmittel über einen Fingerabdruck des Inhalts:
Dazu braucht es allerdings eine Datenbank, die jemand betreibt. Und eine zweite Frist läuft unabhängig davon:
Ein Nachweis ohne Zeitstempel altert also mit dem Zertifikat, mit dem er unterschrieben wurde.
Was daraus für den Leser folgt
Zwei Schlüsse, die sich aus dem Bisherigen ergeben und die man leicht falsch zieht.
Ein fehlendes Zeichen beweist nichts. Es kann heißen, dass ein Mensch das Bild aufgenommen hat. Es kann ebenso heißen, dass der Anbieter keines setzt, dass der Nachweis unterwegs abgefallen ist oder dass jemand ihn entfernt hat.
Ein vorhandenes Zeichen beweist etwas. Wer es findet, weiß, womit das Bild erzeugt wurde. Beweiskraft hat also nur die positive Richtung.
Beim Ansehen des Bildes durch ein Modell hilft beides nicht weiter, und der Grund steht in Kapitel 13: Ein Modell bekommt die Metadaten einer Bilddatei nicht einmal übergeben.
Was das Gesetz verlangt
Seit dem 2. August 2026 gelten die Transparenzpflichten der KI-Verordnung. Artikel 50 verpflichtet Anbieter, erzeugte Bild-, Ton-, Video- und Textinhalte maschinenlesbar zu kennzeichnen, und Betreiber, offenzulegen, wenn ein Deepfake im Spiel ist. Der Wortlaut beider Absätze und die Ausnahmen dazu stehen in Conversational AI, Kapitel 09, wo derselbe Artikel für die Stimme aufgeschlagen wird.
Für dieses Kapitel zählt die technische Folge: Die Pflicht zur maschinenlesbaren Kennzeichnung meint genau die beiden Wege oben. Die Kommission hat am 20.07.2026 praktische Leitlinien dazu (externe Seite, digital-strategy.ec.europa.eu) veröffentlicht, zwölf Tage vor der Geltung.
Ein Werkzeug hat ein Ablaufdatum
Zum Schluss eine Beobachtung, die für den ganzen Bereich gilt und die man beim Bauen einplanen sollte. Google hat am 15.06.2026 angekündigt, drei seiner Bildmodelle abzuschalten:
Zwischen Ankündigung und Abschaltung liegen gut zwei Monate. Wer ein Modell namentlich in seinem Code stehen hat, hat damit ein Datum im Kalender, das er selbst nicht gesetzt hat. Dieselbe Bewegung gibt es beim Fine-Tuning, wo gleich zwei Anbieter ihr Angebot zurückgezogen haben (Beurteilen und Einordnen, Kapitel 02).
Quellen
11 Einträge, davon 2 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
Deep Unsupervised Learning using Nonequilibrium Thermodynamics (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Sohl-Dickstein und Mitautoren beschreiben am 12.03.2015 das Verfahren, auf dem die bekannten Bildmodelle der folgenden Jahre stehen: Struktur in den Daten wird schrittweise zerstört, und ein Netz lernt den Rückweg. Wer den Rückweg kann, fängt bei Rauschen an und bekommt ein Bild. Brauchbare Bildqualität brachte erst der Umbau der Trainingsvorschrift gut fünf Jahre später, siehe ddpm-2020.
SchlüsselarbeitOriginalarbeiterreichbar
digital-strategy.ec.europa.eugeprüft 24.09.2026
Die Auslegung der Kommission zu Artikel 50, angenommen am 20.07.2026, zwölf Tage vor der Geltung. 51 Seiten mit Randnummern und praktischen Beispielen in beide Richtungen: was erfasst ist und was nicht. Nicht bindend, aber der Maßstab, an dem die Marktaufsicht prüft. Die Adresse zeigt auf die Seite mit dem Dokument, nicht auf die PDF-Datei selbst, damit der Prüflauf lesbaren Text vorfindet.
Originalarbeiterreichbar
Addendum to GPT-4o System Card: 4o image generation (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
OpenAIs Ergänzung zur Modellkarte von GPT-4o vom 25.03.2025, mit der die Bilderzeugung im Modell selbst eingeführt wurde. Sie ist der Beleg dafür, dass hinter einem erzeugten Bild bei OpenAI kein Diffusionsmodell rechnet: Abschnitt 2.1 der Druckfassung sagt, anders als DALL-E, das als Diffusionsmodell arbeite, sei die 4o-Bilderzeugung ein autoregressives Modell, das nativ in ChatGPT eingebettet ist. Dieser Satz steht nur im PDF, weshalb er hier nicht als Zitat geführt wird; die Seite selbst nennt die Einbettung in das Modell und die Fähigkeit, Text in Bilder zu setzen. Die GPT-Image-Modelle der Schnittstelle sind die Fortführung dieser Linie.
Originalarbeiterreichbar
Denoising Diffusion Probabilistic Models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Ho, Jain und Abbeel bauen am 19.06.2020 die Trainingsvorschrift des Diffusionsverfahrens um und erreichen auf dem Datensatz CIFAR10 den damaligen Höchststand beim FID-Wert. Die Arbeit ist der Schritt zwischen diffusion-2015 und den Bildmodellen ab 2022, Stable Diffusion eingeschlossen.
Originalarbeiterreichbar
High-Resolution Image Synthesis with Latent Diffusion Models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser und Björn Ommer reichen am 20.12.2021 den Schritt ein, der die Bilderzeugung aus dem Rechenzentrum auf eine einzelne Grafikkarte holte: Das Entrauschen findet in einem verdichteten Zwischenraum statt, in den ein zweites Netz das Bild zuvor übersetzt. Auf den Bildpunkten selbst rechnet dabei niemand mehr. Aus derselben Arbeit stammt die Kreuz-Aufmerksamkeit, über die ein Text die Erzeugung steuert. Die Umsetzung dieser Arbeit ist Stable Diffusion.
Ankündigung des Herstellerserreichbar
Stable Diffusion Public Release (externe Seite, stability.ai)
stability.aigeprüft 24.09.2026
Die Freigabe eines Bildmodells samt Gewichten am 22.08.2022, drei Monate vor ChatGPT. Ab hier lässt sich Bilderzeugung auf eigener Hardware betreiben, und die Auseinandersetzung über Trainingsdaten und Urheberrecht beginnt beim Bild.
Dokumentationerreichbar
Image generation (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Anleitung zum erzeugten Bild bei OpenAI, mit dem Stand vom 16.09.2026 und den beiden Modellen gpt-image-2.5-sunburst und gpt-image-2.5-flare. Zwei Angaben stehen darin, die man von außen nicht sieht: Abgerechnet wird in Ausgabe-Token, deren Zahl sich aus Güte und Bildgröße ergibt, und der Abschnitt zu den Grenzen nennt genau die zwei Schwächen, die jeder kennt, der solche Bilder benutzt hat, nämlich Schrift im Bild und wiederkehrende Figuren.
Dokumentationerreichbar
Image generation with Gemini (externe Seite, ai.google.dev)
ai.google.devgeprüft 24.09.2026
Googles Anleitung zum erzeugten Bild, und der Beleg für eine Zusage, die kein anderer Anbieter in dieser Form gibt: In jedem erzeugten Bild steckt ein Wasserzeichen. Der Satz steht zweimal auf der Seite, einmal bei den Modellen und einmal bei den Grenzen, und er kennt keine Ausnahme. Dieselbe Seite nennt auch den Weg um die Schriftschwäche herum, nämlich den Text zuerst erzeugen zu lassen und ihn dann ins Bild zu bestellen.
Dokumentationerreichbar
Google DeepMind, SynthID (externe Seite, deepmind.google)
deepmind.googlegeprüft 24.09.2026
Ein Wasserzeichen, das beim Erzeugen in den Inhalt selbst eingebettet wird, für Bild, Ton, Text und Video, dazu ein Portal zum Nachprüfen. Die Reichweite ist dabei enger, als der Name vermuten lässt: Der Anbieter beschreibt sie als seine eigenen Endkundenprodukte. Über den Sprachagenten eines Dritten sagt das Verfahren nichts.
Originalarbeiterreichbar
C2PA, Content Credentials Specification (externe Seite, spec.c2pa.org)
spec.c2pa.orggeprüft 24.09.2026
Die offene Spezifikation für den Herkunftsnachweis an einer Mediendatei, mit Ton ausdrücklich unter den Trägerformaten. Der Nachweis hängt an der Datei und beschreibt, womit sie erzeugt und was daran verändert wurde. Er sagt damit etwas über den Weg einer Aufnahme und nichts über die Stimme darin. Die Spezifikation benennt zugleich die Schwäche dieses Wegs: Ein Bild kann von seinem Nachweis getrennt werden, wenn die Metadaten verlorengehen.
Dokumentationerreichbar
Gemini API changelog (externe Seite, ai.google.dev)
ai.google.devgeprüft 24.09.2026
Die Änderungsliste der Gemini-Schnittstelle. Sie führt unter dem 15.06.2026 die Ankündigung, drei Bildmodelle der Imagen-Reihe am 17.08.2026 abzuschalten, und ist damit der Beleg dafür, dass auch ein Bildwerkzeug ein Ablaufdatum hat. Der Eintrag nennt keinen Nachfolger und verweist auf eine eigene Seite dafür.