OpenAIs neues Sprachsystem hört und spricht gleichzeitig, der Rundenerkenner entfällt
OpenAIs neues Sprachsystem GPT-Live streicht den separaten Rundenerkenner aus dem Audiopfad, weil das Modell selbst gleichzeitig hört und spricht, während die beiden Vorgänger noch auf eine Kette aus Spracherkennung, Sprachmodell und Sprachsynthese sowie einen eigenen Erkennungsschritt für den Sprecherwechsel angewiesen waren.
OpenAI hat mit GPT-Live ein neues Sprachsystem vorgestellt, nach eigener Zählung das dritte in der Reihe, und in einem technischen Bericht beschrieben, was sich dabei grundlegend ändert: Ein Bauteil, das bisher vor jedem Modellaufruf stand, fällt weg. „Its voice model is full-duplex, which means it can listen and speak at the same time“, heißt es im Bericht, und genau diese Eigenschaft macht den bisherigen Zwischenschritt überflüssig.
Warum ein Rundenerkenner nötig war
In den beiden vorigen Generationen musste vor jeder Antwort erst ein kleines, separates Modell entscheiden, ob der Mensch fertig gesprochen hat. Der Bericht beschreibt die Aufgabe als kaum lösbar: „guess too soon, and the user gets cut off; guess too late, and the response feels sluggish“, heißt es dort. Erst nachdem dieser Detektor sein Urteil gefällt hatte, kam das eigentliche Sprachmodell zum Zug. Bei kaskadierten Systemen lag davor zusätzlich eine dreiteilige Kette, „In cascaded systems, speech-to-text, the LLM, and text-to-speech each ran in series“, wie der Bericht festhält: Spracherkennung, Sprachmodell und Sprachsynthese liefen nacheinander statt gleichzeitig.
Was GPT-Live stattdessen tut
GPT-Live hört und spricht laut Bericht gleichzeitig, wodurch der separate Erkennungsschritt entfällt und die Antwort unmittelbarer wirkt. Für tiefere Überlegungen oder Tool-Nutzung zieht das System bei Bedarf ein größeres Modell wie GPT-5.5 hinzu, ohne dass das laufende Gespräch dafür unterbrochen wird. Die Umstellung reicht bis in die technische Basis: Der Bericht nennt den Wechsel von einer bisherigen Python-Implementierung auf eine neue Fassung in Go sowie ein eigens entwickeltes Protokoll namens WARP, das den Verbindungsaufbau über WebRTC von sechs Netzwerk-Umläufen auf einen einzigen reduziert. Vor der Auslieferung an Nutzer lief das System zudem im Schattenbetrieb mit echtem Datenverkehr aus laufenden Sitzungen mit, ohne dass davon etwas hörbar wurde.
Welche Annahme kippt
Der naheliegende Schluss wäre, hier nur ein schnelleres Modell zu sehen, austauschbar gegen das vorige. Das greift zu kurz. Bisher ließ sich ein Sprachassistent als Kette beschreiben: Eingabe wird zu Text, Text geht an ein Sprachmodell, die Antwort wird wieder zu Sprache, und ein separates Bauteil regelt den Sprecherwechsel. Diese Beschreibung trifft auf GPT-Live nicht mehr zu, weder die Kette noch das separate Bauteil für den Sprecherwechsel kommen in der Architektur noch vor. Ein einziger gegenläufiger Prozess, dem bei Bedarf ein zweites, langsameres Modell im Hintergrund zuarbeitet, ersetzt die Vorstellung aufeinanderfolgender Stationen, die durchlaufen werden.
Was der Bericht nicht zeigt
Der Bericht stammt von OpenAI selbst und enthält keinen Vergleich mit den Sprachsystemen anderer Anbieter. Konkrete Zahlen zur Antwortzeit von GPT-Live im Vergleich zur vorigen Advanced Voice Mode nennt der Text nicht, belegt sind nur einzelne technische Verbesserungen wie der Wechsel der Medienverarbeitung auf Go. Zur für Entwickler angekündigten GPT-Live-API liefert der Bericht ebenfalls keine Angaben zu Verfügbarkeit oder Zeitpunkt, dort heißt es lediglich, das System werde sie künftig unterstützen. Was im Alltag mit echten Nutzern jenseits der ChatGPT-Sprachfunktion passiert, bleibt damit offen.
Quellen
1 Eintragalle erreichbar
Erreichbarkeit automatisch geprüft
Ankündigung des Herstellerserreichbar
How we built a realtime system for responsive voice AI in six months (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
Beleg zu „OpenAIs neues Sprachsystem hört und spricht gleichzeitig, der Rundenerkenner entfällt“, eingetragen vom News-Lauf am 2026-08-07.