Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenConversational AIKapitel 04von 12 im Pfad

Über das Telefon

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Ein Sprachagent, den man anrufen kann, braucht keine App, keine Anmeldung und keine Webseite. Er braucht eine Rufnummer. Das ist der Zugang, den auch die haben, die mit alldem sonst nichts zu tun haben wollen.

Der Anruf kommt als Ereignis an

Zwischen dem Telefonnetz und einem Sprachmodell steht ein Protokoll, das älter ist als alles andere in diesem Pfad:

SIP is a protocol used to make phone calls over the internet. (externe Seite, developers.openai.com)

Was danach passiert, sieht aus wie ein Klingeln und ist eine Nachricht. Der Anbieter meldet den eingehenden Anruf an eine Adresse, die man ihm vorher genannt hat, und wartet:

From this webhook, you can accept or reject the call, using the call_id value from the webhook. (externe Seite, developers.openai.com)

Annehmen und Ablehnen sind zwei getrennte Aufrufe. Die Dokumentation nennt beim Ablehnen sogar ein Beispiel dafür, wann man es tut: bei einer Länderkennzahl, die man nicht bedienen möchte. Das Telefon bringt also eine Entscheidung mit, die es im Chatfenster gar nicht gibt. Dort betritt niemand den Raum, den man nicht hereingelassen hätte.

Was die Leitung wegnimmt

Ton im Telefonnetz ist meistens grob. Das verbreitete Format misst achttausend Mal in der Sekunde, mit acht Bit je Messung; es geht auf eine Empfehlung aus der Zeit vor dem Internet zurück, und vieles, was daran hängt, richtet sich weiter danach.

Festgelegt ist das allerdings nur für dieses eine Format. Derselbe Standard führt daneben eines mit der doppelten Auflösung, und er sagt das ausdrücklich:

Even though the actual sampling rate for G.722 audio is 16,000 Hz, the RTP clock rate for the G722 payload format is 8,000 Hz because that value was erroneously assigned in RFC 1890 and must remain unchanged for backward compatibility. (externe Seite, rfc-editor.org)

Welche der beiden Auflösungen an einem Gespräch ankommt, handeln die Endpunkte beim Verbindungsaufbau aus. Die Einzelheiten stehen in Tiefe 2.

Die Spracherkennung richtet sich nach einer anderen Zahl. Whisper rechnet auf 16.000 Messungen je Sekunde (externe Seite, arxiv.org) und bringt jede Aufnahme vorher auf diesen Wert. Über die schmale Leitung bekommt es die Hälfte davon, über die breite genau so viel.

Was das für die Erkennungsqualität bedeutet, steht hier bewusst nicht. Es gibt dazu keine Erhebung, die man ohne eigene Messung übernehmen könnte, und eine Vermutung mit einer Prozentzahl wäre schlechter als gar keine Zahl. Sicher ist die Richtung: Weniger Signal bleibt weniger Signal.

Und was er sonst noch wegnimmt

Das Zweite fällt erst auf, wenn man danach sucht. Am Telefon gibt es keinen Bildschirm.

Damit fällt eine ganze Klasse von Bedienelementen weg, die man beim Bauen einer Sprachanwendung im Browser unbewusst voraussetzt. Keine Liste zum Auswählen, keine Fußnote unter einer Auskunft, kein Bestätigungsdialog vor einer Buchung. Was in Agenten und Harness, Kapitel 02 ein Klick auf „Ja, ausführen“ ist, muss hier ein Satz werden, den jemand versteht und beantwortet.

Der Auskunft aus eigenen Unterlagen ist Kapitel 05 gewidmet, dem Tool Call Kapitel 06.

Quellen

5 Einträge, davon 1 Schlüsselarbeitalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    Robust Speech Recognition via Large-Scale Weak Supervision (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Radford und Mitautoren stellen am 06.12.2022 das Modell vor, mit dem die Spracherkennung ohne Nachschulung für den eigenen Fall auskommt. Der Weg dahin war Menge, allerdings sortierte Menge: 680.000 Stunden Ton aus dem Netz mit den zugehörigen Abschriften, dazu ein Apparat (Abschnitt 3.1), der maschinell erzeugte Abschriften wieder aussortiert, die gesprochene Sprache gegen die geschriebene prüft und Dubletten entfernt. Eingetauscht wurden geprüfte Abschriften gegen mehr Material. Das Ergebnis wurde samt Gewichten und Ableitungscode veröffentlicht und ist damit ohne eigenes Training benutzbar.

  • Dokumentationerreichbar

    OpenAI, Realtime API with SIP (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Der Weg, auf dem ein Sprachagent ans öffentliche Telefonnetz kommt. Der eingehende Anruf ist dort ein Ereignis: Der Anbieter meldet ihn an eine hinterlegte Adresse, und die Anwendung entscheidet über zwei getrennte Endpunkte, ob sie ihn annimmt oder ablehnt. Dazu die Anforderungen an das eigene Netz, Signalisierung über TLS auf Port 5061 und der Medienpfad über SRTP. Zu Abtastraten und Tonformaten sagt die Seite nichts, dafür stehen RFC 3551 und RFC 4733.

  • Originalarbeiterreichbar

    RFC 3551, RTP Profile for Audio and Video Conferences with Minimal Control (externe Seite, rfc-editor.org)

    rfc-editor.orggeprüft 24.09.2026

    Der Standard, der festlegt, wie Ton in einem Telefongespräch über das Netz übertragen wird. Die beiden verbreiteten Formate der Telefonie heißen dort PCMU und PCMA, gehen auf die Empfehlung ITU-T G.711 zurück und arbeiten mit acht Bit je Abtastung; Tabelle 4 nennt für beide eine Taktrate von 8.000. Derselbe Standard führt daneben G.722 mit einer Abtastrate von 16.000 und L16 mit 44.100. Welche Auflösung an einem Gespräch ankommt, entscheidet damit die Aushandlung zwischen den Endpunkten.

  • Originalarbeiterreichbar

    RFC 4733, RTP Payload for DTMF Digits, Telephony Tones, and Telephony Signals (externe Seite, rfc-editor.org)

    rfc-editor.orggeprüft 24.09.2026

    Wie eine gedrückte Taste im Telefonnetz übertragen wird, nämlich als benanntes Ereignis. Der Grund steht in der Einleitung: Sprachcodecs mit niedriger Bitrate geben solche Töne nicht zuverlässig genug wieder, damit eine Maschine sie erkennt. Die Empfehlung an die Vermittlungsstelle geht weiter, denn die Kompression kann selbst Töne erzeugen, die niemand gedrückt hat.

  • Dokumentationerreichbar

    OpenAI, Realtime conversations (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Beschreibung dessen, was in einer laufenden Sprachsitzung passiert, und der Ort, an dem der Anbieter den Preis einer Prüfung vor der Antwort selbst benennt: Wer die automatische Antwort abschaltet, um Eingaben zu moderieren, zu prüfen oder erst etwas nachzuschlagen, bezahlt das mit Wartezeit. Dieselbe Seite nennt die Obergrenze einer Sitzung und beschreibt den Ablauf eines Tool Calls.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.