Dokumentationerreichbar
Images and vision
developers.openai.com (externe Seite)
Die dritte Art, dieselbe Sache abzurechnen. Statt einer Formel gibt es hier eine Stufe, die der Aufrufende selbst wählt, und die Seite sagt zugleich den gemeinsamen Nenner aller drei Anbieter: Ein Bild wird wie Text in Token gemessen und wie Text bezahlt. Die Grenzenliste nennt dabei zwei, die bei Anthropic fehlen: nicht-lateinische Schriften und die genaue Verortung im Bild.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 26.08.2026:
Vision models convert image inputs into billable input tokens.
bestätigt 24.09.2026The model may not perform optimally when handling images with text of non-Latin alphabets
bestätigt 24.09.2026The model struggles with tasks requiring precise spatial localization
bestätigt 24.09.2026The model is not suitable for interpreting specialized medical images like CT scans
bestätigt 24.09.2026