Aktuelles

OpenAIs neues Sprachsystem hört und spricht gleichzeitig, der Rundenerkenner entfällt

OpenAIs neues Sprachsystem GPT-Live streicht den separaten Rundenerkenner aus dem Audiopfad, weil das Modell selbst gleichzeitig hört und spricht, während die beiden Vorgänger noch auf eine Kette aus Spracherkennung, Sprachmodell und Sprachsynthese sowie einen eigenen Erkennungsschritt für den Sprecherwechsel angewiesen waren.

MeldungModelle

OpenAI hat mit GPT-Live ein neues Sprachsystem vorgestellt, nach eigener Zählung das dritte in der Reihe, und in einem technischen Bericht beschrieben, was sich dabei grundlegend ändert: Ein Bauteil, das bisher vor jedem Modellaufruf stand, fällt weg. „Its voice model is full-duplex, which means it can listen and speak at the same time“, heißt es im Bericht, und genau diese Eigenschaft macht den bisherigen Zwischenschritt überflüssig.

Warum ein Rundenerkenner nötig war

In den beiden vorigen Generationen musste vor jeder Antwort erst ein kleines, separates Modell entscheiden, ob der Mensch fertig gesprochen hat. Der Bericht beschreibt die Aufgabe als kaum lösbar: „guess too soon, and the user gets cut off; guess too late, and the response feels sluggish“, heißt es dort. Erst nachdem dieser Detektor sein Urteil gefällt hatte, kam das eigentliche Sprachmodell zum Zug. Bei kaskadierten Systemen lag davor zusätzlich eine dreiteilige Kette, „In cascaded systems, speech-to-text, the LLM, and text-to-speech each ran in series“, wie der Bericht festhält: Spracherkennung, Sprachmodell und Sprachsynthese liefen nacheinander statt gleichzeitig.

Was GPT-Live stattdessen tut

GPT-Live hört und spricht laut Bericht gleichzeitig, wodurch der separate Erkennungsschritt entfällt und die Antwort unmittelbarer wirkt. Für tiefere Überlegungen oder Tool-Nutzung zieht das System bei Bedarf ein größeres Modell wie GPT-5.5 hinzu, ohne dass das laufende Gespräch dafür unterbrochen wird. Die Umstellung reicht bis in die technische Basis: Der Bericht nennt den Wechsel von einer bisherigen Python-Implementierung auf eine neue Fassung in Go sowie ein eigens entwickeltes Protokoll namens WARP, das den Verbindungsaufbau über WebRTC von sechs Netzwerk-Umläufen auf einen einzigen reduziert. Vor der Auslieferung an Nutzer lief das System zudem im Schattenbetrieb mit echtem Datenverkehr aus laufenden Sitzungen mit, ohne dass davon etwas hörbar wurde.

Welche Annahme kippt

Der naheliegende Schluss wäre, hier nur ein schnelleres Modell zu sehen, austauschbar gegen das vorige. Das greift zu kurz. Bisher ließ sich ein Sprachassistent als Kette beschreiben: Eingabe wird zu Text, Text geht an ein Sprachmodell, die Antwort wird wieder zu Sprache, und ein separates Bauteil regelt den Sprecherwechsel. Diese Beschreibung trifft auf GPT-Live nicht mehr zu, weder die Kette noch das separate Bauteil für den Sprecherwechsel kommen in der Architektur noch vor. Ein einziger gegenläufiger Prozess, dem bei Bedarf ein zweites, langsameres Modell im Hintergrund zuarbeitet, ersetzt die Vorstellung aufeinanderfolgender Stationen, die durchlaufen werden.

Was der Bericht nicht zeigt

Der Bericht stammt von OpenAI selbst und enthält keinen Vergleich mit den Sprachsystemen anderer Anbieter. Konkrete Zahlen zur Antwortzeit von GPT-Live im Vergleich zur vorigen Advanced Voice Mode nennt der Text nicht, belegt sind nur einzelne technische Verbesserungen wie der Wechsel der Medienverarbeitung auf Go. Zur für Entwickler angekündigten GPT-Live-API liefert der Bericht ebenfalls keine Angaben zu Verfügbarkeit oder Zeitpunkt, dort heißt es lediglich, das System werde sie künftig unterstützen. Was im Alltag mit echten Nutzern jenseits der ChatGPT-Sprachfunktion passiert, bleibt damit offen.

Quellen

1 Eintragalle erreichbar

Erreichbarkeit automatisch geprüft

Alle Meldungen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.