GrundlagenConversational AIKapitel 11von 12 im Pfad
Ton wird nach Zeit bezahlt
Bei einem Textmodell hängt der Preis an der Textmenge. Wer eine lange Datei mitschickt, zahlt mehr als wer eine Frage stellt, und wer eine lange Antwort bekommt, zahlt für jedes Wort darin. Welche Modellstufe was kostet und warum die Ausgabespalte die teure ist, steht in Grundkurs, Kapitel 10.
Bei einem Sprachgespräch verschiebt sich die Rechengröße. Ton hat keine Wortzahl, er hat eine Dauer, und die wird in Token umgerechnet.
Zwei Raten in einem Satz, und sie unterscheiden sich um den Faktor zwei.
Was das je Minute bedeutet
Ein Token je 100 Millisekunden sind zehn Token in der Sekunde und 600 in der Minute. So wird gezählt, was der Anrufer sagt.
Ein Token je 50 Millisekunden sind zwanzig in der Sekunde und 1.200 in der Minute. So wird gezählt, was der Agent sagt.
Sprechen die beiden gleich viel, erzeugt der Agent doppelt so viele Token wie der Anrufer, bei identischer Sprechdauer. Das ist der erste von zwei Faktoren.
Der zweite steht in Grundkurs, Kapitel 10: Ein Ausgabe-Token kostet mehr als ein Eingabe-Token, bei einem Sprachmodell dort mit 32 gegen 64 beziffert, also zwei zu eins.
Beide Faktoren gelten gleichzeitig, und sie multiplizieren sich. Doppelt so viele Token bei doppeltem Preis je Token macht das Vierfache: Eine Minute, in der der Agent redet, kostet so viel wie vier Minuten, in denen er zuhört.
Die Zahl 32 gegen 64 gilt dabei für ein bestimmtes Modell, die Token-Raten oben für die Echtzeit-Schnittstelle von OpenAI. Andere Anbieter zählen Ton anders, und wie weit das auseinandergeht, steht in Tiefe 2. Wer rechnet, prüft die Preisspalte an der Zeile, um die es geht. Was bleibt, ist die Richtung: Ein Sprachagent, der seine Antworten kurz hält, spart an der Stelle, an der doppelt gezählt und doppelt bezahlt wird.
Warum das nicht die ganze Rechnung ist
Die zweite Größe ist unauffälliger und wirkt stärker. Bei jedem Zug geht das ganze bisherige Gespräch erneut an das Modell.
Das ist bei einem Chatfenster genauso, fällt dort aber weniger auf, weil ein Chat selten fünfzig Züge hat. Ein Telefonat hat sie.
Der Satz aus der Herstellerdokumentation zieht die Folgerung selbst:
Was das kostet, lässt sich ausrechnen. Angenommen, jeder Zug fügt gleich viel hinzu, Frage und Antwort zusammen 200 Token, und es gibt keinen Cache. Dann sendet Zug 1 zweihundert Token, Zug 2 vierhundert, Zug 10 zweitausend.
seitlich verschiebbar
gerechnet aus den Token-Raten der OpenAI-Dokumentation, gleich lange Züge angenommen, Stand 07.08.2026
| Züge | Endstand des Verlaufs | über die Sitzung gesendet |
|---|---|---|
| 5 | 1.000 Token | 3.000 Token |
| 10 | 2.000 Token | 11.000 Token |
| 20 | 4.000 Token | 42.000 Token |
Die rechte Spalte ist die Rechnung, die linke das, was am Ende dasteht. Bei zwanzig Zügen liegen zwischen beiden der Faktor zehn.
Der Grund ist eine Summe: Über n Züge wird das (n mal (n plus 1) geteilt durch 2)-fache eines einzelnen Zuwachses gesendet. Bei doppelter Gesprächslänge steht also grob die vierfache Menge auf der Rechnung. Die Annahmen dahinter stehen oben: gleich lange Züge, gerechnet ohne Cache. In der Praxis fällt es günstiger aus, und um wie viel, steht in der nächsten Tiefe.
Die Uhr läuft auch ohne Rechnung
Neben dem Preis gibt es harte Grenzen, und sie stehen bei Google in Zahlen.
Eine Viertelstunde für ein Telefonat ist knapp bemessen, sobald jemand ein Anliegen erklärt. Der nächste Satz der Doku nimmt der Zahl allerdings ihre Härte:
Die 15 Minuten sind also eine Voreinstellung. Was sie verlängert, steht in der nächsten Tiefe, und es kostet etwas.
Darunter liegt eine zweite Uhr, die man leicht mit der ersten verwechselt:
Die Verbindung ist die technische Leitung, die Sitzung der Gesprächszusammenhang darüber. Die Leitung hält kürzer als das Gespräch darüber, und wenn sie abreißt, reißt beides:
When the connection terminates, the session terminates as well. (externe Seite, ai.google.dev)
Was eine offene Verbindung im Sprachdialog überhaupt leistet, steht in Kapitel 03.
Das dritte Limit ist der Platz
32.000 Token klingen nach viel. Wie schnell sie voll sind, hängt an der Zählweise, und dafür nennt Google eine eigene Zahl:
Zweiunddreißig Token je Sekunde sind 1.920 in der Minute. Allein das Zuhören füllt das kleinere Fenster damit nach gut einer Viertelstunde, und dann steht dieselbe Frage wie bei jedem Kontextfenster: was hinausfällt.
Diese Zahl steht hier mit Absicht neben denen aus Tiefe 1, denn sie zeigt, wie wenig zwei Angaben miteinander zu tun haben, solange die Zählweise daneben fehlt: Dieselbe Minute Zuhören zählt an der Schnittstelle von OpenAI 600 Token und an der von Google 1.920. Wer zwei Anbieter nebeneinanderstellt, vergleicht zuerst ihre Zählweise und dann ihre Grenzen.
Drei Gegenmittel, alle in derselben Dokumentation, alle mit einem Preis.
Den Verlauf abschneiden. Wenn der Anfang eines Gesprächs nicht mehr mitgeschickt wird, hört die quadratische Rechnung auf. Google beschreibt das als gleitendes Fenster und nennt es als den Weg zu längeren Sitzungen:
Was das kostet, steckt in der Sache selbst. Was hinausfällt, ist weg. Ein Anrufer, der zu Beginn seinen Namen genannt hat, hat ihn nach vierzig Minuten nicht mehr genannt, jedenfalls nicht für das Modell.
Den Cache nutzen. Wiederholte Anfänge werden günstiger abgerechnet, und in einem Gespräch ist der Anfang jedes Zuges die Wiederholung des vorigen.
Der Nachsatz ist das Entscheidende. Es gibt keine Zusage. Wer mit dem Cache rechnet, rechnet mit einem Verhalten, das der Anbieter ausdrücklich offen lässt. Und er gilt nur, solange der Anfang gleich bleibt: Ein System, das seine Anweisungen mitten im Gespräch ändert, macht sich die Ersparnis selbst kaputt.
Kürzer antworten lassen. Das ist das einzige Mittel, das an der Rate angreift statt an der Menge. Eine Anweisung, die den Agenten zu knappen Antworten anhält, senkt die Zahl der Token, die mit der doppelten Rate gezählt werden. Die kürzere Wartezeit für den Anrufer kommt gratis dazu. Wie eine solche Anweisung aussieht, steht in Grundkurs, Kapitel 06.
Die Zahl, die niemand kennt
Aus einem eigenen Projekt, einem Sprachagenten am Kiosk-Terminal: Die Schnittstelle liefert am Ende jeder Antwort ein Ereignis mit dem Token-Verbrauch. Es war bekannt, es war protokolliert, und es war in der Sitzungsverwaltung als Feld vorgesehen.
Ausgewertet wurde es nie. In vier Monaten Entwicklung findet sich in den Projektnotizen kein einziger Betrag, kein Kosten je Gespräch, kein Token-Verbrauch je Minute. Die Frage, was passiert, wenn das Guthaben beim Anbieter aufgebraucht ist, steht dort als offene Frage und blieb unbeantwortet.
Das ist die naheliegende Reihenfolge: Erst soll es funktionieren, dann soll es gut sein, und die Rechnung kommt am Monatsende von allein. Bei einem Sprachagenten ist das riskanter als bei einem Chatfenster, weil die Kosten hier an einer Größe hängen, die der Anrufer bestimmt. Wer lange redet, kostet lange.
Was hier offen bleibt
Zu gleichzeitigen Gesprächen nennt keine der geprüften Quellen eine Zahl. Wie viele Sprachsitzungen ein Konto parallel führen darf, steht weder bei OpenAI noch bei Google in der Dokumentation, auf die dieses Kapitel sich stützt. Für einen Betreiber, der eine Hotline plant, ist das die erste Frage.
Zur Aufbewahrung nennt OpenAI eine Zahl. Die Seite mit den Datenkontrollen der Schnittstelle (externe Seite, developers.openai.com) führt eine Tabelle je Endpunkt, und für die Sprachschnittstelle in Echtzeit stehen dort bis zu 30 Tage im Speicher zur Missbrauchsprüfung und kein darüber hinaus gehaltener Gesprächszustand (Stand 23.09.2026). Die Seite zur Live-Sitzung bei Google nennt keine Frist. Was bei einem Gespräch überhaupt anfällt, steht in Kapitel 12.
Quellen
5 Einträge, davon 1 Schlüsselarbeitalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitDokumentationerreichbar
OpenAI, Kosten der Echtzeit-Schnittstelle (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Seite, die den Preis eines Sprachgesprächs erklärt, und sie nennt zwei Größen. Erstens die Umrechnung von Ton in Token nach Dauer, mit unterschiedlichen Raten für Zuhören und Sprechen. Zweitens den Grund, warum ein langes Gespräch überproportional teuer wird: Bei jedem Zug geht der gesamte bisherige Verlauf erneut an das Modell. Dazu die zwei Gegenmittel, das Abschneiden des Verlaufs und der Cache, letzterer ausdrücklich ohne Zusage.
Dokumentationerreichbar
Google, Live API, Anleitung (externe Seite, ai.google.dev)
ai.google.devgeprüft 24.09.2026
Nennt die Betriebsgrenzen einer Sprachsitzung in Zahlen: eine Viertelstunde für reinen Ton, zwei Minuten sobald Video dazukommt, dazu ein Kontextfenster von 128k oder 32k Token je nach Modellart. Im selben Absatz steht, dass sich die Dauer über eine andere Sitzungsführung beliebig verlängern lässt. Die Zahl ist damit eine Voreinstellung.
Dokumentationerreichbar
Google, Live API, Sitzungsführung (externe Seite, ai.google.dev)
ai.google.devgeprüft 24.09.2026
Trennt zwei Größen, die man leicht verwechselt: die Sitzung als Gesprächszusammenhang und die Verbindung als technische Leitung darunter. Die Verbindung hält etwa zehn Minuten und kündigt ihr Ende vorher an, die Sitzung kann über mehrere Verbindungen hinweg bestehen bleiben. Der Weg zu längeren Sitzungen ist ein gleitendes Fenster über den Verlauf, und damit steht der Preis daneben: Was hinausfällt, ist weg.
Dokumentationerreichbar
Google, Understanding and counting tokens (externe Seite, ai.google.dev)
ai.google.devgeprüft 24.09.2026
Die Seite, die sagt, wie Gemini seine Eingaben in Token zählt, und zwar für alle Gattungen an einer Stelle. Für Ton nennt sie eine feste Rate je Sekunde, dieselbe für Zuhören und Sprechen. Damit ist sie die Gegenstelle zu OpenAIs Kostenseite, die zwei verschiedene Raten führt: Wer zwei Anbieter nebeneinanderstellt, vergleicht zuerst ihre Zählweise und dann ihre Grenzen.
Dokumentationerreichbar
OpenAI, Data controls in the OpenAI platform (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Seite, auf der OpenAI für die Schnittstelle Speicherort, Verarbeitungsort und Aufbewahrung getrennt aufführt: den Speicher zur Missbrauchsprüfung mit bis zu 30 Tagen, eine Tabelle je Endpunkt, die Datenresidenz mit ihren Ausnahmen (Systemdaten, Regionen ohne eigene Verarbeitung) und die Bedingungen für eine Region außerhalb der USA samt Aufschlag.