Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenConversational AIKapitel 11von 12 im Pfad

Ton wird nach Zeit bezahlt

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Bei einem Textmodell hängt der Preis an der Textmenge. Wer eine lange Datei mitschickt, zahlt mehr als wer eine Frage stellt, und wer eine lange Antwort bekommt, zahlt für jedes Wort darin. Welche Modellstufe was kostet und warum die Ausgabespalte die teure ist, steht in Grundkurs, Kapitel 10.

Bei einem Sprachgespräch verschiebt sich die Rechengröße. Ton hat keine Wortzahl, er hat eine Dauer, und die wird in Token umgerechnet.

Audio tokens in user messages are 1 token per 100 ms of audio, while audio tokens in assistant messages are 1 token per 50ms of audio. (externe Seite, developers.openai.com)

Zwei Raten in einem Satz, und sie unterscheiden sich um den Faktor zwei.

Was das je Minute bedeutet

Ein Token je 100 Millisekunden sind zehn Token in der Sekunde und 600 in der Minute. So wird gezählt, was der Anrufer sagt.

Ein Token je 50 Millisekunden sind zwanzig in der Sekunde und 1.200 in der Minute. So wird gezählt, was der Agent sagt.

Sprechen die beiden gleich viel, erzeugt der Agent doppelt so viele Token wie der Anrufer, bei identischer Sprechdauer. Das ist der erste von zwei Faktoren.

Der zweite steht in Grundkurs, Kapitel 10: Ein Ausgabe-Token kostet mehr als ein Eingabe-Token, bei einem Sprachmodell dort mit 32 gegen 64 beziffert, also zwei zu eins.

Beide Faktoren gelten gleichzeitig, und sie multiplizieren sich. Doppelt so viele Token bei doppeltem Preis je Token macht das Vierfache: Eine Minute, in der der Agent redet, kostet so viel wie vier Minuten, in denen er zuhört.

Die Zahl 32 gegen 64 gilt dabei für ein bestimmtes Modell, die Token-Raten oben für die Echtzeit-Schnittstelle von OpenAI. Andere Anbieter zählen Ton anders, und wie weit das auseinandergeht, steht in Tiefe 2. Wer rechnet, prüft die Preisspalte an der Zeile, um die es geht. Was bleibt, ist die Richtung: Ein Sprachagent, der seine Antworten kurz hält, spart an der Stelle, an der doppelt gezählt und doppelt bezahlt wird.

Warum das nicht die ganze Rechnung ist

Die zweite Größe ist unauffälliger und wirkt stärker. Bei jedem Zug geht das ganze bisherige Gespräch erneut an das Modell.

The entire conversation is sent to the model for each Response. (externe Seite, developers.openai.com)

Das ist bei einem Chatfenster genauso, fällt dort aber weniger auf, weil ein Chat selten fünfzig Züge hat. Ein Telefonat hat sie.

Quellen

5 Einträge, davon 1 Schlüsselarbeitalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitDokumentationerreichbar

    OpenAI, Kosten der Echtzeit-Schnittstelle (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Seite, die den Preis eines Sprachgesprächs erklärt, und sie nennt zwei Größen. Erstens die Umrechnung von Ton in Token nach Dauer, mit unterschiedlichen Raten für Zuhören und Sprechen. Zweitens den Grund, warum ein langes Gespräch überproportional teuer wird: Bei jedem Zug geht der gesamte bisherige Verlauf erneut an das Modell. Dazu die zwei Gegenmittel, das Abschneiden des Verlaufs und der Cache, letzterer ausdrücklich ohne Zusage.

  • Dokumentationerreichbar

    Google, Live API, Anleitung (externe Seite, ai.google.dev)

    ai.google.devgeprüft 24.09.2026

    Nennt die Betriebsgrenzen einer Sprachsitzung in Zahlen: eine Viertelstunde für reinen Ton, zwei Minuten sobald Video dazukommt, dazu ein Kontextfenster von 128k oder 32k Token je nach Modellart. Im selben Absatz steht, dass sich die Dauer über eine andere Sitzungsführung beliebig verlängern lässt. Die Zahl ist damit eine Voreinstellung.

  • Dokumentationerreichbar

    Google, Live API, Sitzungsführung (externe Seite, ai.google.dev)

    ai.google.devgeprüft 24.09.2026

    Trennt zwei Größen, die man leicht verwechselt: die Sitzung als Gesprächszusammenhang und die Verbindung als technische Leitung darunter. Die Verbindung hält etwa zehn Minuten und kündigt ihr Ende vorher an, die Sitzung kann über mehrere Verbindungen hinweg bestehen bleiben. Der Weg zu längeren Sitzungen ist ein gleitendes Fenster über den Verlauf, und damit steht der Preis daneben: Was hinausfällt, ist weg.

  • Dokumentationerreichbar

    Google, Understanding and counting tokens (externe Seite, ai.google.dev)

    ai.google.devgeprüft 24.09.2026

    Die Seite, die sagt, wie Gemini seine Eingaben in Token zählt, und zwar für alle Gattungen an einer Stelle. Für Ton nennt sie eine feste Rate je Sekunde, dieselbe für Zuhören und Sprechen. Damit ist sie die Gegenstelle zu OpenAIs Kostenseite, die zwei verschiedene Raten führt: Wer zwei Anbieter nebeneinanderstellt, vergleicht zuerst ihre Zählweise und dann ihre Grenzen.

  • Dokumentationerreichbar

    OpenAI, Data controls in the OpenAI platform (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Seite, auf der OpenAI für die Schnittstelle Speicherort, Verarbeitungsort und Aufbewahrung getrennt aufführt: den Speicher zur Missbrauchsprüfung mit bis zu 30 Tagen, eine Tabelle je Endpunkt, die Datenresidenz mit ihren Ausnahmen (Systemdaten, Regionen ohne eigene Verarbeitung) und die Bedingungen für eine Region außerhalb der USA samt Aufschlag.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.