NachschlagenModellkarten

Was die Anbieter über ihre Modelle sagen

Zwei Wörter, und OpenAI benutzt beide: Seine offenen Gewichte bekamen eine Modellkarte, das selbst betriebene System eine Systemkarte. Die Grenze verläuft dort, wo ein Anbieter die Auslieferung aus der Hand gibt, und mit ihr die Schutzschichten, die im Betrieb greifen. Hier stehen die Modelle mit dem, was ihre Karten hergeben, und darüber, wer überhaupt ein Verzeichnis führt.

48 Modelle25 Anbieter32 zum Herunterladen5 ohne eigene Karteältester Blick 06.09.2026

Was hier hineinkommt. Anbieter, deren Modelle in einem Kapitel, einem Beitrag oder der Zeitleiste vorkommen, dazu die Anbieter hinter den führenden offenen Gewichten. Je Modell steht, was in seiner Karte steht, und sonst nichts: Ein leeres Feld heißt, dass die Karte dazu schweigt. Genau dafür stehen die Modelle untereinander statt in Kästen: Anthropic und OpenAI sagen zu Größe, Aufbau und Kontext nichts, Kimi sagt alles.

Was fehlt. Eine Rangfolge. Welcher Anbieter besser dokumentiert, gibt diese Erhebung nicht her: Sie zählt das Veröffentlichte und misst weder Tiefe noch Wahrheitsgehalt. Preise fehlen ebenfalls, die veralten schneller als jede Liste. Wie man eine Karte liest, was darin gemessen ist und was ein Urteil des Hauses, steht im Kapitel Die Systemkarte lesen.

Zugang

Ordnen

Sortieren

Sprachmodelle 269512

Text hinein, Text heraus, bei den meisten auch Bilder

AFM 3AppleNur als Dienst06/26
Zugang
  • nur als Dienst

Nennt Aufbau, Parameterzahl, Herkunft des Trainingsmaterials und die Prüfungen der ganzen Reihe. Eine Modellkarte ist es nicht: Apple führt keine, und der für den Sommer angekündigte technische Bericht ist bis heute nicht erschienen.

Karte auf machinelearning.apple.com (externe Seite)08.06.2026nur eine Ankündigungangesehen 06.09.2026

Belegt in10 Small Language ModelsOn-Device im Glossar

Amazon Nova 2 LiteAmazonNur als DienstText, Bild, Video → Text1 Mio.12/25
Zugang
  • nur als Dienst
Kann
  • Text, Bild, Video → Text
Technik
  • 1 Mio. Token Kontext

Nennt Red Teaming durch Dritte samt CBRN und Cybersicherheit, beziffert die Sicherheitsmessung und gruppiert die Herkunft der Trainingsdaten.

Karte auf docs.aws.amazon.com (externe Seite)02.12.2025angesehen 06.09.2026

Claude Fable 5.1 und Mythos 5.1im EinsatzAnthropicNur als Dienst09/26
Einsatz
  • Schreibmodell in der Werkstatt hinter dieser Seite
Zugang
  • nur als Dienst

Nennt Sicherheitsprüfungen samt externem Prüfer und die Herkunft der Trainingsdaten samt dem Namen des eigenen Sammlers.

Karte auf anthropic.com (externe Seite)01.09.2026angesehen 06.09.2026

Belegt in07 Die Systemkarte lesen

Claude Opus 5im EinsatzAnthropicNur als Dienst07/26
Einsatz
  • führt die Umbauten und Prüfläufe dieser Seite aus
Zugang
  • nur als Dienst

Nennt Sicherheitsevaluierungen samt Einstufung und misst in Abschnitt 6.5 Ehrlichkeit und Halluzination.

Karte auf anthropic.com (externe Seite)24.07.2026angesehen 06.09.2026

Belegt in07 Halluzinationen erkennen07 Die Systemkarte lesen

DeepSeek-V4-FlashDeepSeekOffen07/26
Zugang
  • offene Gewichte
  • MIT
Technik
  • Mixture of Experts
  • 6 von 256 Experten je Token, dazu ein geteilter (config.json des Repos); eine Parameterzahl nennt die Karte nicht

Nennt Architektur und Einsatzzweck. Zu Sicherheitsprüfungen und Trainingsdaten steht nichts darin.

Karte auf huggingface.co (externe Seite)31.07.2026angesehen 06.09.2026

Belegt inDeepSeek veröffentlicht mit V4 Flash 0731 ein Modell zu einem Bruchteil der üblichen Kosten

DeepSeek-V4-Flash-Vision-ExpDeepSeekOffenText, Bild → Text08/26
Zugang
  • offene Gewichte
  • MIT
Kann
  • Text, Bild → Text
Technik
  • Mixture of Experts
  • 304 Mrd im Gewichtsindex des Repos; die Karte nennt keine Zahl

Benennt, worauf das Modell aufsetzt und was sich dadurch an den Textaufgaben ändert. Zu Trainingsdaten und Sicherheitsprüfungen steht nichts darin.

Karte auf huggingface.co (externe Seite)31.08.2026angesehen 06.09.2026

DeepSeek-V4-ProDeepSeekOffenText → Text08/26
Zugang
  • offene Gewichte
  • MIT
Kann
  • Text → Text
Technik
  • Mixture of Experts
  • 1,65 Bio im Gewichtsindex des Repos; die Karte nennt keine Zahl

Nennt den Bauunterschied zur Vorabfassung und eine empfohlene Ausgabelänge. Zu Trainingsdaten und Sicherheitsprüfungen steht nichts darin.

Karte auf huggingface.co (externe Seite)13.08.2026angesehen 06.09.2026

Gemini 3 ProGoogle DeepMindNur als DienstText, Bild, Ton, Video → Text1 Mio.11/25
Zugang
  • nur als Dienst
Kann
  • Text, Bild, Ton, Video → Text
  • versteht Ton selbst
Technik
  • 1 Mio. Token Kontext

Die Basiskarte des Pro-Zweigs. Sie zählt sieben Herkünfte der Trainingsdaten einzeln auf, und die jüngeren Gemini-Karten verweisen für diese Angabe hierher.

Karte auf storage.googleapis.com (externe Seite)18.11.2025angesehen 06.09.2026

Belegt in08 Was ein Modell weiß, und woherTrainingsdaten im Glossar

Gemini 3.1 Proim EinsatzGoogle DeepMindNur als DienstText, Bild, Ton, Video → Text1 Mio.02/26
Einsatz
  • Gegenstimme im eigenen Vergleich mehrerer Modelle
Zugang
  • nur als Dienst
Kann
  • Text, Bild, Ton, Video → Text
  • versteht Ton selbst
Technik
  • 1 Mio. Token Kontext

Nennt fünf Arten von Sicherheitsevaluierungen. Für die Trainingsdaten verweist sie auf die Basiskarte von Gemini 3 Pro.

Karte auf deepmind.google (externe Seite)19.02.2026angesehen 06.09.2026

Belegt in07 Die Systemkarte lesenRed Teaming im Glossar

Gemini 3.6 FlashGoogle DeepMindNur als DienstText, Bild, Ton, Video → Text1 Mio.07/26
Zugang
  • nur als Dienst
Kann
  • Text, Bild, Ton, Video → Text
  • versteht Ton selbst
Technik
  • 1 Mio. Token Kontext

Nennt den Wissensstichtag und schränkt im selben Satz ein, dass er nicht für alle Themengebiete gilt.

Karte auf deepmind.google (externe Seite)21.07.2026angesehen 06.09.2026

Belegt in08 Was ein Modell weiß, und woherKnowledge Cutoff im Glossar

Gemini 3.8 FlashGoogle DeepMindNur als DienstText, Bild, Ton, Video → Text1 Mio.09/26
Zugang
  • nur als Dienst
Kann
  • Text, Bild, Ton, Video → Text
  • versteht Ton selbst
Technik
  • 1 Mio. Token Kontext

Berichtet Red Teaming von außerhalb und die Bewertung nach dem Frontier-Safety-Rahmen. Die Trainingsdaten reicht sie an die Vorgängerkarte weiter.

Karte auf deepmind.google (externe Seite)02.09.2026angesehen 06.09.2026

GLM-5.3Z.aiMit AuflagenText → Text08/26
Zugang
  • Gewichte mit Auflagen
  • GLM-5.3
  • eigene Lizenz mit Größenklausel für den Betrieb als Dienst
Kann
  • Text → Text

Benchmark-Werte und Betriebsanleitung. Zu Sicherheitsprüfungen und Trainingsdaten steht nichts darin.

Karte auf huggingface.co (externe Seite)25.08.2026angesehen 06.09.2026

GPT-5OpenAINur als Dienst08/25
Zugang
  • nur als Dienst

Nennt die Sicherheitsprüfungen zum Modell und fasst die Herkunft der Trainingsdaten in einem Satz mit drei Quellen zusammen.

Karte auf arxiv.org (externe Seite)13.08.2025angesehen 06.09.2026

Belegt in07 Guardrails07 Halluzinationen erkennen08 Was ein Modell weiß, und woherund 1 weitere

GPT-6 Astraim EinsatzOpenAINur als Dienst09/26
Einsatz
  • Zweitmeinung bei der Einstufung der Meldungen dieser Seite
Zugang
  • nur als Dienst

Nennt Umgehungsversuche, CBRN, Cybersicherheit und zwei externe Prüfer. Zur Herkunft der Trainingsdaten nennt sie keine Quelle mehr.

Karte auf deploymentsafety.openai.com (externe Seite)03.09.2026angesehen 06.09.2026

Belegt in07 Die Systemkarte lesenWer die Prüfer bezahlt: was „unabhängig geprüft“ jetzt heißtRed Teaming im Glossar

gpt-oss-120b und gpt-oss-20bOpenAIOffen08/25
Zugang
  • offene Gewichte
  • Apache 2.0

OpenAIs Karte zu offenen Gewichten. Sie heißt Model Card, weil das Haus hier nur das Modell abgibt und den Betrieb nicht in der Hand hat.

Karte auf openai.com (externe Seite)05.08.2025angesehen 06.09.2026

Belegt in07 Die Systemkarte lesenModellkarte im Glossar

Grok 4.6xAINur als DienstText, Bild → Text08/26
Zugang
  • nur als Dienst
Kann
  • Text, Bild → Text

Sechs Sicherheitskapitel samt Cyber und CBRN. Zur Herkunft der Trainingsdaten nennt sie eine einzige Quelle namentlich, in einer Fußnote.

Karte auf media.x.ai (externe Seite)12.08.2026angesehen 06.09.2026

Kimi K3MoonshotMit AuflagenText, Bild → Text1 Mio.07/26
Zugang
  • Gewichte mit Auflagen
  • Kimi K3
  • frei bis 100 Mio. Nutzer oder 20 Mio. USD Monatsumsatz, darüber muss der Modellname sichtbar sein
Kann
  • Text, Bild → Text
  • Werkzeuge
Technik
  • Mixture of Experts
  • 2,8 Bio gesamt, 104 Mrd aktiv, 16 von 896 Experten je Token
  • 1 Mio. Token Kontext

Nennt Aufbau, Kontextfenster, Quantisierung und Lizenz. Das Wort Sicherheit steht einmal darin, und zwar als Aufgabenkategorie einer Fähigkeitsmessung.

Karte auf huggingface.co (externe Seite)27.07.2026angesehen 06.09.2026

Belegt in01 Wo Modelle betrieben werden10 Small Language ModelsKimi K3, die Gewichte sind draußenund 3 weitere

Llama 4 ScoutMetaMit Auflagen04/25
Zugang
  • Gewichte mit Auflagen
  • Llama 4
  • Freigabe erst nach einem Formular mit vollem Rechtsnamen, Geburtsdatum und Organisation

Nennt Red Teaming und kritische Risiken und beziffert die Trainingsdaten mit Menge, Herkunft und Stichtag.

Karte auf huggingface.co (externe Seite)05.04.2025angesehen 06.09.2026

Muse Glimmer 30BMetaOffenText, Bild → Text128k08/26
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Text, Bild → Text
  • Werkzeuge
Technik
  • dicht
  • 29,6 Mrd, Sprachmodell und Wahrnehmungsteil zusammen
  • 128k Token Kontext
  • Wissensstand 4. Januar 2026

Nennt Aufbau, Kontextfenster, Wissensstichtag, Herkunft des Trainingsmaterials und vier Prüfachsen, darunter das Verhalten des Modells als Agent.

Karte auf huggingface.co (externe Seite)August 2026angesehen 06.09.2026

Muse SparkMetaNur als Dienst05/26
Zugang
  • nur als Dienst

Legt die Prüfungen vor der Freigabe offen. Eine Modellkarte ersetzt er nicht: Aufbau, Kontextfenster und Herkunft des Trainingsmaterials stehen nicht darin.

Karte auf ai.meta.com (externe Seite)26.05.2026Bericht statt Karteangesehen 06.09.2026

Belegt in07 Die Systemkarte lesen

Nemotron 3.5 Lightning 30BNVIDIAOffenText → Text1 Mio.08/26
Zugang
  • offene Gewichte
  • OpenMDW-1.1
Kann
  • Text → Text
  • Werkzeuge
Technik
  • Mixture of Experts
  • 30 Mrd gesamt, 3 Mrd aktiv
  • 1 Mio. Token Kontext

Nennt die Herkunft der Trainingsdaten in Gruppen samt Stichtag. Durchgeführte Sicherheitsprüfungen führt sie nicht auf.

Karte auf huggingface.co (externe Seite)11.08.2026angesehen 06.09.2026

Belegt in10 Small Language ModelsNvidia veröffentlicht mit Nemotron 3.5 Lightning ein offenes 30-Milliarden-Modell für Agenten

North Micro Vision InstructCohereOffenText, Bild → Text128k08/26
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Text, Bild → Text
Technik
  • 2,4 Mrd
  • 128k Token Kontext

Nennt Aufbau, Einsatzzweck und Benchmark-Werte. Zu Sicherheitsprüfungen und Trainingsdaten steht nichts darin.

Karte auf huggingface.co (externe Seite)August 2026angesehen 06.09.2026

Olmo 3.1 32B InstructAi2OffenText → Text12/25
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Text → Text
Technik
  • 32 Mrd

Nennt die Trainingsdaten namentlich und verlinkt sie. Zu durchgeführten Sicherheitsprüfungen sagt sie nichts.

Karte auf huggingface.co (externe Seite)10.12.2025angesehen 06.09.2026

Qwen3.8-Flash-NextQwenMit AuflagenText08/26
Zugang
  • Gewichte mit Auflagen
  • Qwen Community 1.0
  • dieselbe Größenklausel wie bei Qwen3.8-Max
Technik
  • Mixture of Experts
  • 125 Mrd gesamt, 6 Mrd aktiv, dazu 51 Mrd für die N-Gramm-Einbettung

Nennt die Benchmark-Werte im Vergleich zu zwei fremden Modellen. Zu Sicherheitsprüfungen und Trainingsdaten steht nichts darin.

Karte auf huggingface.co (externe Seite)24.08.2026angesehen 06.09.2026

Belegt inAlibaba veröffentlicht mit Qwen3.8-Flash-Next eine Architektur-Vorschau auf Qwen4 zum Neuntel der Trainingskosten

Qwen3.8-MaxQwenMit AuflagenText, Bild → Text256k08/26
Zugang
  • Gewichte mit Auflagen
  • Qwen3.8-Max
  • frei bis 100 Mio. Nutzer oder 20 Mio. USD Monatsumsatz, darüber muss der Modellname sichtbar sein
Kann
  • Text, Bild → Text
Technik
  • Mixture of Experts
  • 2,4 Bio gesamt, 95 Mrd aktiv, 512 Experten
  • 256k Token Kontext

Nennt Aufbau, Kontextlänge und Lizenz und trennt ausdrücklich die offenen Gewichte von der Fassung hinter der Schnittstelle.

Karte auf huggingface.co (externe Seite)08.08.2026angesehen 06.09.2026

Belegt inAlibaba veröffentlicht mit Qwen3.8 2.4T A95B eines der größten offenen Modelle

Shieldstral 1.0 3BMistralOffenText, Bild → Text32k08/26
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Text, Bild → Text
Technik
  • 3 Mrd
  • 32k Token Kontext

Nennt Grenzen und Einstufungswerte des Wächtermodells. Zur Herkunft der Trainingsdaten steht nur ein Nebensatz.

Karte auf huggingface.co (externe Seite)August 2026angesehen 06.09.2026

Spracherkennung 6501

Ton wird zu Text

Cohere TranscribeCohereOffen03/26
Zugang
  • offene Gewichte
  • Apache 2.0

Benennt zwei Grenzen der Spracherkennung: erfundener Text aus Grundrauschen und schwankende Leistung bei Sprachwechsel.

Karte auf huggingface.co (externe Seite)26.03.2026angesehen 06.09.2026

Parakeet TDT 0.6B v3im EinsatzNVIDIAOffenTon → Text08/25
Einsatz
  • Standard-Erkenner im eigenen Diktatwerkzeug für den Mac
Zugang
  • offene Gewichte
  • CC-BY-4.0
Kann
  • Ton → Text
  • braucht eine Transkription
Technik
  • 600 Mio

Nennt die Trainingsdaten namentlich, darunter zwei Bestände mit Stundenzahl und Einzelquellen.

Karte auf huggingface.co (externe Seite)14.08.2025angesehen 06.09.2026

Belegt in02 Sprache und Audio07 SpracherkennungWarum ich eine eigene Diktier-App gebaut habeund 1 weitere

Qwen3-ASR-1.7BQwenOffenTon → Text01/26
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Ton → Text
  • braucht eine Transkription
Technik
  • 1,7 Mrd

Führt die Sprachliste vollständig und weist die Fehlerraten je Datensatz aus.

Karte auf huggingface.co (externe Seite)Januar 2026angesehen 06.09.2026

SpeechTranscriberim EinsatzAppleNur als DienstTon → Text09/25
Einsatz
  • dritte Erkenner-Wahl im eigenen Diktatwerkzeug, gemessen und verworfen
Zugang
  • nur als Dienst
Kann
  • Ton → Text
  • braucht eine Transkription

Nennt weder Modellnamen noch Größe noch Trainingsmaterial. Beschrieben ist der Aufruf, nicht das Modell.

Karte auf developer.apple.com (externe Seite)September 2025nur die Schnittstellendokuangesehen 06.09.2026

Belegt inWarum ich eine eigene Diktier-App gebaut habe

Whisper large-v3im EinsatzOpenAIOffenTon → Text11/23
Einsatz
  • wählbar im eigenen Diktatwerkzeug, wenn Fachbegriffe wichtiger sind als Tempo
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Ton → Text
  • braucht eine Transkription
Technik
  • 1,55 Mrd

Beziffert die Trainingsmenge in Stunden und trennt dabei schwach beschriftetes von maschinell beschriftetem Material.

Karte auf huggingface.co (externe Seite)November 2023angesehen 06.09.2026

Belegt inWarum ich eine eigene Diktier-App gebaut habe

Whisper large-v3-turboOpenAIOffenTon → Text10/24
Zugang
  • offene Gewichte
  • MIT
Kann
  • Ton → Text
  • braucht eine Transkription
Technik
  • 809 Mio

Benennt den Eingriff am Vorgängermodell und seinen Preis, und sagt, wer den Text geschrieben hat.

Karte auf huggingface.co (externe Seite)01.10.2024angesehen 06.09.2026

Sprachsynthese 6402

Text wird zu Ton

Chatterbox Multilingual V3Resemble AIOffenText → Ton04/25
Zugang
  • offene Gewichte
  • MIT
Kann
  • Text → Ton
Technik
  • 0,5 Mrd

Beziffert die Trainingsmenge, benennt den Llama-Rumpf und beschreibt das Wasserzeichen in der Ausgabe.

Karte auf huggingface.co (externe Seite)24.04.2025angesehen 06.09.2026

Chatterbox-TurboResemble AIOffenText → Ton12/25
Zugang
  • offene Gewichte
  • MIT
Kann
  • Text → Ton
Technik
  • 350 Mio

Beziffert den Eingriff am Decoder und benennt die Zeichen, die im Text mitgesprochen werden.

Karte auf huggingface.co (externe Seite)02.12.2025angesehen 06.09.2026

Eleven v3ElevenLabsNur als DienstText → Ton06/25
Zugang
  • nur als Dienst
Kann
  • Text → Ton

Nennt Sprachen und Steuerungsmöglichkeiten. Größe, Aufbau und Trainingsmaterial bleiben offen.

Karte auf elevenlabs.io (externe Seite)03.06.2025nur eine Ankündigungangesehen 06.09.2026

gpt-4o-mini-ttsOpenAINur als DienstText → Ton03/25
Zugang
  • nur als Dienst
Kann
  • Text → Ton

Führt Stimmen, Formate und die Steuerung des Vortrags. Größe, Trainingsmaterial und Sprachliste des Modells stehen nirgends.

Karte auf developers.openai.com (externe Seite)März 2025nur die Schnittstellendokuangesehen 06.09.2026

Belegt in01 Was Conversational AI ist03 Wenn das Gespräch nicht in Runden läuft08 Sprachsyntheseund 2 weitere

Kokoro-82MhexgradOffenText → Ton01/25
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Text → Ton
Technik
  • 82 Mio

Nennt Datenherkunft, Datenmenge und Trainingskosten, jede mit Zahl, dazu den Aufbau als StyleTTS 2 mit ISTFTNet-Decoder.

Karte auf huggingface.co (externe Seite)27.01.2025angesehen 06.09.2026

Qwen3-TTS 1.7Bim EinsatzQwenOffenText → Ton01/26
Einsatz
  • erzeugt die Sprachausgabe der eigenen Werkzeuge, lokal auf dem Rechner
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Text → Ton
Technik
  • 1,7 Mrd

Nennt Sprachen, Stimmprofile und die Verdichtungsrate des Tonzerlegers.

Karte auf huggingface.co (externe Seite)Januar 2026angesehen 06.09.2026

Embedding-Modelle 5320

Alles wird zu Zahlen im selben Raum

all-MiniLM-L6-v2sentence-transformersOffenText → Vektor03/22
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Text → Vektor
Technik
  • 23 Mio

Nennt Trainingsmenge, Verfahren und Hyperparameter und benennt die Grenzen der Anwendung.

Karte auf huggingface.co (externe Seite)02.03.2022angesehen 06.09.2026

BGE-M3BAAIOffenText → Vektor8k01/24
Zugang
  • offene Gewichte
  • MIT
Kann
  • Text → Vektor
Technik
  • 568 Mio
  • 8k Token Kontext

Trennt drei Suchverfahren und belegt die Zahlen über die zugehörige Arbeit.

Karte auf huggingface.co (externe Seite)27.01.2024angesehen 06.09.2026

EmbeddingGemma-300Mim EinsatzGoogle DeepMindMit AuflagenText → Vektor07/25
Einsatz
  • rechnet die Vektoren der eigenen Wissensbasen, lokal auf dem Rechner
Zugang
  • Gewichte mit Auflagen
  • Gemma Terms of Use
  • Liste verbotener Verwendungen, die auch für abgeleitete Modelle gilt
Kann
  • Text → Vektor
Technik
  • 300 Mio

Beziffert das Trainingsmaterial in Token und misst den Verlust bei gekürzten Vektoren.

Karte auf huggingface.co (externe Seite)17.07.2025angesehen 06.09.2026

jina-embeddings-v3Jina AIMit AuflagenText → Vektor8k09/24
Zugang
  • Gewichte mit Auflagen
  • CC BY-NC 4.0
  • geschäftlicher Eigenbetrieb nur nach Vereinbarung
Kann
  • Text → Vektor
Technik
  • 572 Mio
  • 8k Token Kontext

Beschreibt fünf aufsteckbare Anpassungen und nennt die Lizenzgrenze im Klartext.

Karte auf huggingface.co (externe Seite)05.09.2024angesehen 06.09.2026

nomic-embed-text-v1.5Nomic AIOffenText → Vektor8k02/24
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Text → Vektor
Technik
  • 137 Mio
  • 8k Token Kontext

Veröffentlicht die Trainingsdaten vollständig und den Code zum Nachbau dazu.

Karte auf huggingface.co (externe Seite)10.02.2024angesehen 06.09.2026

Bilderzeugung 5221

Text wird zu Bild

FLUX.2 [dev]Black Forest LabsMit AuflagenText, Bild → Bild11/25
Zugang
  • Gewichte mit Auflagen
  • FLUX Non-Commercial License
  • kommerzielle Nutzung nur mit eigener Lizenz, die Dateien erst nach einer Zustimmung
Kann
  • Text, Bild → Bild
Technik
  • 32 Mrd

Beziffert eine Drittprüfung vor der Freigabe, beschreibt die Filter davor und den Aufbau als Rectified Flow Transformer.

Karte auf huggingface.co (externe Seite)22.11.2025angesehen 06.09.2026

FLUX.2 [klein] 4BBlack Forest LabsOffenText, Bild → Bild01/26
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Text, Bild → Bild
Technik
  • 4 Mrd

Nennt die Freigabeentscheidung samt Lizenz je Größe, die Prüfungen davor und den Aufbau als Rectified Flow Transformer.

Karte auf huggingface.co (externe Seite)14.01.2026angesehen 06.09.2026

MAI-Image-2.6MicrosoftNur als DienstText, Bild → Bild32k09/26
Zugang
  • nur als Dienst
Kann
  • Text, Bild → Bild
Technik
  • 20 Mrd ohne die Einbettungsschicht
  • 32k Token Kontext

Nennt eine Sicherheitsprüfung ohne Zahl und Verfahren und beschreibt die Trainingsdaten samt Zeitraum.

Karte auf microsoft.ai (externe Seite)04.09.2026angesehen 06.09.2026

Qwen-Image-2512QwenOffenText, Bild → Bild12/25
Zugang
  • offene Gewichte
  • Apache 2.0
Kann
  • Text, Bild → Bild
Technik
  • 20 Mrd

Vergleicht die Fassung mit ihrer Vorgängerin an benannten Eigenschaften statt an einer Gesamtnote.

Karte auf huggingface.co (externe Seite)31.12.2025angesehen 06.09.2026

Stable Diffusion 3.5 MediumStability AIMit AuflagenText → Bild10/24
Zugang
  • Gewichte mit Auflagen
  • Stability Community License
  • frei bis 1 Mio. USD Jahresumsatz, die Dateien erst nach einer Zustimmung
Kann
  • Text → Bild
Technik
  • 2,5 Mrd

Beschreibt den Aufbau als MMDiT-X mit drei festen Textcodierern und die Herkunft der Trainingsdaten gar nicht.

Karte auf huggingface.co (externe Seite)29.10.2024angesehen 06.09.2026

Ai2Vereinigte Staatenneinkein eigenes Verzeichnisjafrühere Dokumente bleiben erreichbarneinohne Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten1100
AmazonVereinigte Staatenteilseigenes Verzeichnis, ohne Datum je Dokumentjafrühere Dokumente bleiben erreichbarjanennt Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten1001
AnthropicVereinigte Staatenjaeigenes Verzeichnis mit Datum je Dokumentjafrühere Dokumente bleiben erreichbarjanennt Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten2002
AppleVereinigte Staatenneinkein eigenes Verzeichnisjafrühere Dokumente bleiben erreichbarjanennt Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten2002
BAAIChinaneinkein eigenes Verzeichnisneinnur das aktuelle Dokumentneinohne Sicherheitsprüfungenneinohne Herkunft der Trainingsdaten1100

keine Übersicht

Black Forest LabsEuropateilseigenes Verzeichnis, ohne Datum je Dokumentjafrühere Dokumente bleiben erreichbarjanennt Sicherheitsprüfungenneinohne Herkunft der Trainingsdaten2110

keine Übersicht

CohereKanadaneinkein eigenes Verzeichnisjafrühere Dokumente bleiben erreichbarteilsSicherheitsprüfungen: keine AngabeteilsHerkunft der Trainingsdaten: keine Angabe2200
DeepSeekChinaneinkein eigenes Verzeichnisjafrühere Dokumente bleiben erreichbarneinohne Sicherheitsprüfungenneinohne Herkunft der Trainingsdaten3300
ElevenLabsVereinigte Staatenteilseigenes Verzeichnis, ohne Datum je Dokumentjafrühere Dokumente bleiben erreichbarneinohne Sicherheitsprüfungenneinohne Herkunft der Trainingsdaten1001

keine Übersicht

Google DeepMindVereinigte Staatenjaeigenes Verzeichnis mit Datum je Dokumentjafrühere Dokumente bleiben erreichbarjanennt Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten5014

deepmind.google (externe Seite)

hexgradkein Sitz feststellbarneinkein eigenes Verzeichnisneinnur das aktuelle Dokumentneinohne Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten1100

keine Übersicht

Jina AIEuropateilseigenes Verzeichnis, ohne Datum je Dokumentjafrühere Dokumente bleiben erreichbarneinohne Sicherheitsprüfungenneinohne Herkunft der Trainingsdaten1010

keine Übersicht

MetaVereinigte Staatenteilseigenes Verzeichnis, ohne Datum je Dokumentjafrühere Dokumente bleiben erreichbarjanennt Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten3111
MicrosoftVereinigte Staatenneinkein eigenes Verzeichnisneinnur das aktuelle Dokumentjanennt Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten1001

keine Übersicht

MistralEuropaneinkein eigenes Verzeichnisjafrühere Dokumente bleiben erreichbarteilsSicherheitsprüfungen: keine Angabejanennt die Herkunft der Trainingsdaten1100
MoonshotChinaneinkein eigenes Verzeichnisjafrühere Dokumente bleiben erreichbarneinohne Sicherheitsprüfungenneinohne Herkunft der Trainingsdaten1010
Nomic AIVereinigte Staatenneinkein eigenes Verzeichnisjafrühere Dokumente bleiben erreichbarneinohne Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten1100

keine Übersicht

NVIDIAVereinigte Staatenteilseigenes Verzeichnis, ohne Datum je Dokumentjafrühere Dokumente bleiben erreichbarneinohne Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten2200
OpenAIVereinigte Staatenjaeigenes Verzeichnis mit Datum je Dokumentjafrühere Dokumente bleiben erreichbarjanennt Sicherheitsprüfungenneinohne Herkunft der Trainingsdaten6303
QwenChinaneinkein eigenes Verzeichnisjafrühere Dokumente bleiben erreichbarneinohne Sicherheitsprüfungenneinohne Herkunft der Trainingsdaten5320
Resemble AIKanadateilseigenes Verzeichnis, ohne Datum je Dokumentneinnur das aktuelle Dokumentneinohne Sicherheitsprüfungenneinohne Herkunft der Trainingsdaten2200
sentence-transformerskein Sitz feststellbarneinkein eigenes Verzeichnisjafrühere Dokumente bleiben erreichbarneinohne Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten1100

keine Übersicht

Stability AIEuropateilseigenes Verzeichnis, ohne Datum je Dokumentjafrühere Dokumente bleiben erreichbarneinohne Sicherheitsprüfungenneinohne Herkunft der Trainingsdaten1010

keine Übersicht

xAIVereinigte Staatenteilseigenes Verzeichnis, ohne Datum je Dokumentjafrühere Dokumente bleiben erreichbarjanennt Sicherheitsprüfungenjanennt die Herkunft der Trainingsdaten1001
Z.aiChinaneinkein eigenes Verzeichnisjafrühere Dokumente bleiben erreichbarneinohne Sicherheitsprüfungenneinohne Herkunft der Trainingsdaten1010

Wo Bild zu Text geblieben ist. Diese Richtung war einmal eine Gattung für sich. Heute ist es eine Eigenschaft der Sprachmodelle: Das Bild wird in Token zerlegt und geht denselben Weg wie geschriebener Text. Anthropic rechnet in Blöcken von 28 mal 28 Pixeln, Google in Kacheln zu 768 Pixeln, und OpenAI schreibt die Bildeingabe der Token-Abrechnung zu. Auf dieser Seite steht das Bild deshalb als Eingabe am Modell, in der Spalte „Ein → Aus“. Eine eigene Rubrik bekommt es nicht.

Nachgemessen am 06.09.2026. Hugging Face führt für diese Richtung eine eigene Aufgabe, „image-text-to-text“. Von ihren zwölf meistbeachteten Einträgen sind alle zwölf Sprachmodelle, angeführt von DeepSeek-V4-Flash-Vision, Qwen3.8 und GLM-5.3. Als eigene Gattung bleiben die Encoder übrig, CLIP und seine Nachfolger. Die stecken in anderen Modellen und werden nie einzeln benutzt, weshalb sie hier nicht stehen.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.