Originalarbeiterreichbar
High-Resolution Image Synthesis with Latent Diffusion Models
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser und Björn Ommer reichen am 20.12.2021 den Schritt ein, der die Bilderzeugung aus dem Rechenzentrum auf eine einzelne Grafikkarte holte: Das Entrauschen findet in einem verdichteten Zwischenraum statt, in den ein zweites Netz das Bild zuvor übersetzt. Auf den Bildpunkten selbst rechnet dabei niemand mehr. Aus derselben Arbeit stammt die Kreuz-Aufmerksamkeit, über die ein Text die Erzeugung steuert. Die Umsetzung dieser Arbeit ist Stable Diffusion.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:
By decomposing the image formation process into a sequential application of denoising autoencoders, diffusion models (DMs) achieve state-of-the-art synthesis results on image data and beyond.
bestätigt 24.09.2026we apply them in the latent space of powerful pretrained autoencoders
bestätigt 24.09.2026training diffusion models on such a representation allows for the first time to reach a near-optimal point between complexity reduction and detail preservation
bestätigt 24.09.2026their formulation allows for a guiding mechanism to control the image generation process without retraining
bestätigt 24.09.2026