GrundlagenGrundkursKapitel 13von 16 im Pfad
Was ein Modell auf einem Bild erkennt
Wer ein Foto in ein Chatfenster zieht, hat etwas anderes getan, als eine Datei anzuhängen. Das Bild geht als Bild an das Modell. Dort wird es zu Token, so wie Text zu Token wird (Kapitel 03), und gezählt wird dabei die Fläche.
Ein Bild kostet Fläche
Anthropic schreibt die Regel als einziger der drei großen Anbieter aus:
Über das Bild wird also ein Raster gelegt, und jedes Feld darin zählt wie ein Token. Ein Feld ist 28 Bildpunkte breit und 28 hoch.
Der Rest ist Rechnen. Ein quadratisches Bild von 1000 mal 1000 Bildpunkten ergibt 36 Felder in der Breite, denn 1000 geteilt durch 28 sind 35,7, und ein angefangenes Feld zählt ganz. In der Höhe ebenso viele. 36 mal 36 sind 1296 sichtbare Token, und genau diese Zahl steht in der Beispieltabelle des Herstellers.
Nach der Faustzahl aus Kapitel 03, ein Token je vier Zeichen englischen Fließtexts, sind das gut fünftausend Zeichen. Ein Bildschirmfoto ist damit keine Beigabe zur Frage. Es ist der größere Teil davon.
Ein PDF ist ein Stapel Bilder
Die Folge daraus fällt den meisten erst an der Rechnung auf. Ein PDF wirkt wie eine Textdatei, und für ein Sprachmodell ist es keine. Die Dokumentation nennt den Grund in einem Nebensatz, in dem es eigentlich um etwas anderes geht:
because each page is processed as an image (externe Seite, platform.claude.com)
Jede Seite wird also gerastert und nach Fläche abgerechnet, ob dort nun ein Diagramm steht oder ein einzelner Satz. Das ist zugleich der Grund, warum es überhaupt funktioniert: Das Modell sieht die Tabelle, die Unterschrift und den Stempel, statt nur den Text, den ein Auslesewerkzeug herausgezogen hätte.
Für die Planung heißt das: Der Platz wird knapp, bevor die Seitenzahl es tut.
Was man vorher wissen sollte
Die Herstellerdokumentation führt einen eigenen Abschnitt mit Grenzen. Drei davon betreffen den Alltag sofort.
Personen werden nicht benannt. Das Modell cannot be used to name people in images and refuses to do so (externe Seite, platform.claude.com). Die Grenze steht in den Nutzungsbedingungen des Anbieters. Sie ist damit eine Festlegung, die er jederzeit ändern könnte.
Gezählt wird ungefähr. Wer Objekte in einem Bild zählen lässt, bekommt eine Schätzung. Verfahren, die stattdessen messen, stehen in KI-Wissen, Kapitel 05:
Ob ein Bild von einer Maschine stammt, sieht das Modell nicht. Diese Grenze ist die überraschendste, weil man das Gegenteil erwartet:
Wie ein solches Bild entsteht und woran es sich trotzdem erkennen lässt, steht in Kapitel 14.
Alle drei großen Anbieter rechnen ein Bild in Token um, und alle drei tun es verschieden. Die gemeinsame Grundlage steht bei OpenAI in einem Satz:
Danach trennen sich die Wege.
Anthropic zählt Felder, Google zählt Kacheln
Bei Anthropic ist die Kachel fest: 28 Bildpunkte, immer. Der Preis wächst deshalb mit der Fläche.
Bei Google hängt die Kachelgröße am Bild selbst. Kleine Bilder kosten eine Pauschale, größere werden zerlegt:
Wie viele Kacheln entstehen, beschreibt die Dokumentation als Näherung:
Die Kachel richtet sich also nach der kürzeren Bildkante, und dann wird jede Seite durch diese Größe geteilt. Das Beispiel der Dokumentation selbst: Ein Bild von 960 mal 540 ergibt sechs Kacheln.
Daraus folgt etwas Unerwartetes. Weil die Kachel mit dem Bild mitwächst, kostet ein quadratisches Bild bei Google immer dasselbe, sobald es die Pauschale überschreitet: vier Kacheln, also 1032 Token, bei 1000 Bildpunkten Kantenlänge wie bei 4000.
Dasselbe Bild, zwei Rechnungen
Gerechnet nach den beiden Formeln, für vier Bildgrößen:
| Bild | Anthropic | |
|---|---|---|
| 200 × 200 | 64 | 258 |
| 960 × 540 | 700 | 1.548 |
| 1000 × 1000 | 1.296 | 1.032 |
| 2000 × 1500 | 3.888 | 1.032 |
Es gibt also keine Reihenfolge. Bei einem kleinen Bild rechnet Anthropic günstiger, bei einem großen Google, und der Wechsel liegt irgendwo dazwischen. Wer die Zahlen für einen Preisvergleich benutzen will, muss zweimal aufpassen: Ein Token kostet bei den beiden Anbietern verschieden viel, und Googles Formel bezeichnet sich selbst als Näherung.
seitlich verschiebbar
eigene Darstellung nach den Angaben von Anthropic und Google, Stand 07.08.2026
Was passiert, wenn das Bild zu groß ist
Bei Anthropic wächst die Zahl nicht ins Unendliche. Jede Modellstufe hat eine Obergrenze an sichtbaren Token, 1568 für die ältere und 4784 für die neuere, und darüber greift eine Verkleinerung:
Das deckelt den Preis und kostet Auflösung. Bei einem Foto fällt es kaum auf, bei einem Bildschirmfoto mit kleiner Schrift schon: Was nach der Verkleinerung unleserlich ist, bleibt unleserlich.
Zwischen den beiden Stufen liegt dabei ein Vielfaches:
Dieselbe Datei kostet also je nach Modell verschieden viel, ohne dass sich an ihr etwas geändert hat. Wer den Preis drücken will, verkleinert das Bild vor dem Absenden und behält damit die Kontrolle darüber, was verlorengeht.
Wie viele Bilder in eine Anfrage passen
Auch hier gehen die Zahlen weit auseinander. Anthropic nennt 100 je Anfrage für Modelle mit einem Fenster von 200.000 Token und 600 für die übrigen, dazu 8000 mal 8000 Bildpunkte als Höchstmaß je Bild. Google nennt eine andere Größenordnung:
Gemini models support a maximum of 3,600 image files per request (externe Seite, ai.google.dev)
In der Praxis ist diese Zahl selten die bindende Grenze. Vorher ist das Kontextfenster voll, und das gilt für Bilder genauso wie für Text (Kapitel 03).
Die Dokumentation von Anthropic führt sieben Grenzen auf, und sie sind ungewöhnlich konkret formuliert. Drei davon stehen in Ebene 1, drei weitere hier. Die siebte ist eine Nutzungsregel: Anstößiges verarbeitet das Modell gar nicht erst. Zwei weitere Grenzen kommen von OpenAI, das sie als einziger benennt.
Wo die Genauigkeit endet
Kleine, schiefe oder schlechte Bilder.
Die Zahl ist nützlich: Unter 200 Bildpunkten Kantenlänge wird es unzuverlässig. Das betrifft ausgeschnittene Bildausschnitte häufiger als ganze Aufnahmen.
Koordinaten sind Näherungen.
Claude’s coordinate and localization outputs are approximate. (externe Seite, platform.claude.com)
OpenAI sagt dazu dasselbe, mit anderen Worten:
Wer ein Modell fragt, wo in einem Bild etwas liegt, bekommt also eine Angabe, die für eine Beschreibung reicht und für eine automatische Weiterverarbeitung nachgemessen gehört.
Schrift außerhalb des lateinischen Alphabets. Diese Grenze nennt nur OpenAI:
Medizinische Aufnahmen. Beide Anbieter grenzen denselben Fall aus, und Anthropic zieht die Linie genauer:
Ein Röntgenbild ansehen zu lassen und sich auf die Auskunft zu verlassen, sind damit zwei verschiedene Dinge.
Zwei Eigenheiten, die niemand erwartet
Eine Animation ist ein Einzelbild. Wer ein bewegtes GIF hochlädt, schickt genau ein Bild:
Animations are unsupported, and only the first frame is used. (externe Seite, platform.claude.com)
Die Reihenfolge im Prompt zählt. Zu den Positionseffekten aus Kapitel 05 kommt für Bilder eine eigene Empfehlung:
Claude works best when images come before text. (externe Seite, platform.claude.com)
Das ist derselbe Gedanke wie beim langen Dokument vor der Frage, angewendet auf ein Bild, das der Frage vorausgeht.
Was das Modell nicht mitbekommt
Zwei Aussagen der Dokumentation stehen in aufklappbaren Feldern, die der Prüflauf dieses Projekts nicht lesen kann. Sie stehen deshalb hier in indirekter Rede und ohne Zitat, mit der Belegstelle im Quelleneintrag.
Anthropic beantwortet die Frage, ob Bild-Metadaten gelesen werden, mit Nein: Sie werden weder ausgewertet noch überhaupt übergeben. Für die Praxis heißt das, dass Aufnahmezeit, Ort und Kameramodell dem Modell unbekannt bleiben, selbst wenn sie in der Datei stehen. Wer damit arbeiten will, liest sie vorher aus und legt sie als Text dazu. Für Kapitel 14 hat dieselbe Auskunft eine zweite Folge: Ein Herkunftsnachweis, der als Metadatum an der Datei hängt, hilft dem Modell beim Ansehen kein Stück.
Die zweite Auskunft ist die Grenze dieses Kapitels. Auf die Frage, ob dieses Modell Bilder erzeugen oder bearbeiten kann, antwortet die Dokumentation, es sei ausschließlich ein Modell zum Verstehen von Bildern: Es könne sie deuten und auswerten, und es könne keine erzeugen, verändern oder bearbeiten.
Das ist keine Lücke im Angebot. Beide Fähigkeiten stecken in verschiedenen Modellen, die verschieden gebaut und verschieden trainiert sind. Wie das andere funktioniert, steht im nächsten Kapitel, und wie das Feld daneben aufgeteilt ist, in KI-Wissen, Kapitel 01.
Quellen
4 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Dokumentationerreichbar
Vision (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Die Herstellerdokumentation zum Bild als Eingabe, und die einzige der drei, die ihre Abrechnung als Formel ausschreibt: Ein Bild wird in Blöcke von 28 mal 28 Pixeln zerlegt, und jeder Block ist ein sichtbares Token. Daraus folgt die Zahl über die Fläche, aufgerundet in beide Richtungen, gedeckelt bei 1568 sichtbaren Token für die ältere Stufe und 4784 für die neuere. Der Abschnitt Limitations zählt sieben Grenzen auf, darunter die für dieses Projekt wichtigste: Ob ein Bild von einer Maschine stammt, kann das Modell nicht sagen.
Dokumentationerreichbar
PDF support (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Der Beleg dafür, dass ein PDF für ein Sprachmodell keine Textdatei ist. Die Seite nennt den Grund in einem Nebensatz: Jede Seite wird als Bild verarbeitet. Damit gilt für ein Dokument dieselbe Abrechnung nach Fläche wie für ein Foto, und die Obergrenze liegt bei 600 Seiten je Anfrage, bei 100 unterhalb eines Kontextfensters von einer Million Token.
Dokumentationerreichbar
Image understanding (externe Seite, ai.google.dev)
ai.google.devgeprüft 24.09.2026
Googles Seite zum Bild als Eingabe, mit einer Abrechnung, die von der bei Anthropic abweicht: Ein kleines Bild kostet pauschal 258 Token, ein größeres wird in Kacheln zerlegt, und jede Kachel kostet wieder 258. Die Kachelgröße folgt der kürzeren Bildkante und ist damit vom Seitenverhältnis abhängig. Als Obergrenze nennt die Seite 3.600 Bilddateien je Anfrage.
Dokumentationerreichbar
Images and vision (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die dritte Art, dieselbe Sache abzurechnen. Statt einer Formel gibt es hier eine Stufe, die der Aufrufende selbst wählt, und die Seite sagt zugleich den gemeinsamen Nenner aller drei Anbieter: Ein Bild wird wie Text in Token gemessen und wie Text bezahlt. Die Grenzenliste nennt dabei zwei, die bei Anthropic fehlen: nicht-lateinische Schriften und die genaue Verortung im Bild.