NachschlagenQuellenregister

Dokumentationerreichbar

Images and vision

developers.openai.com (externe Seite)

Die dritte Art, dieselbe Sache abzurechnen. Statt einer Formel gibt es hier eine Stufe, die der Aufrufende selbst wählt, und die Seite sagt zugleich den gemeinsamen Nenner aller drei Anbieter: Ein Bild wird wie Text in Token gemessen und wie Text bezahlt. Die Grenzenliste nennt dabei zwei, die bei Anthropic fehlen: nicht-lateinische Schriften und die genaue Verortung im Bild.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 26.08.2026:

  • Vision models convert image inputs into billable input tokens.bestätigt 24.09.2026
  • The model may not perform optimally when handling images with text of non-Latin alphabetsbestätigt 24.09.2026
  • The model struggles with tasks requiring precise spatial localizationbestätigt 24.09.2026
  • The model is not suitable for interpreting specialized medical images like CT scansbestätigt 24.09.2026

13 Was ein Modell auf einem Bild erkennt

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.