SchlüsselarbeitDokumentationerreichbar
OpenAI, Kosten der Echtzeit-Schnittstelle
developers.openai.com (externe Seite)
Die Seite, die den Preis eines Sprachgesprächs erklärt, und sie nennt zwei Größen. Erstens die Umrechnung von Ton in Token nach Dauer, mit unterschiedlichen Raten für Zuhören und Sprechen. Zweitens den Grund, warum ein langes Gespräch überproportional teuer wird: Bei jedem Zug geht der gesamte bisherige Verlauf erneut an das Modell. Dazu die zwei Gegenmittel, das Abschneiden des Verlaufs und der Cache, letzterer ausdrücklich ohne Zusage.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:
Audio tokens in user messages are 1 token per 100 ms of audio, while audio tokens in assistant messages are 1 token per 50ms of audio.
bestätigt 24.09.2026The entire conversation is sent to the model for each Response.
bestätigt 24.09.2026The output from a turn will be added as Items to the server Conversation and become the input to subsequent turns, thus turns later in the session will be more expensive.
bestätigt 24.09.2026Caching applies when the input tokens of a Response match tokens from a previous Response, though this is best-effort and not guaranteed.
bestätigt 24.09.2026