Dokumentationerreichbar
OpenAI, Transcribing User Audio with a Separate Realtime Request
developers.openai.com (externe Seite)
Die Anleitung, die den Nebenkanal einer Sprachsitzung als Problem behandelt und dafür ein Beispiel des Herstellers mitliefert: verstanden wird ein Unfall mit dem Auto, mitgeschrieben eine Lautfolge. Sie beschreibt den Ausweg, die Abschrift vom selben Modell erzeugen zu lassen, nennt sein Ergebnis eine Verringerung der Abweichung und beziffert seinen Preis, gemessen am getrennten Erkennungsmodell: drei- bis fünffach für den letzten Redebeitrag, sechzehn- bis zweiundzwanzigfach mit der ganzen Sitzung im Kontext.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.08.2026:
this relies on a separate ASR model
bestätigt 24.09.2026Using different models for transcription and response generation can lead to discrepancies.
bestätigt 24.09.2026Reduced Mismatch: The same model is used for both transcription and generation, minimizing inconsistencies between what the user says and how the agent responds.
bestätigt 24.09.2026Using only latest user turn: 3-5x
bestätigt 24.09.2026Using full session context: 16-22x
bestätigt 24.09.2026