GrundlagenKI-WissenKapitel 07von 14 im Pfad
Spracherkennung
Gesprochene Sprache ist eine Druckschwankung in der Luft. Ein Mikrofon misst sie, tausende Male je Sekunde, und schreibt eine lange Reihe von Zahlen. Am Ende soll ein Satz dastehen. Zwischen beiden liegt ein Fach mit siebzig Jahren Geschichte.
Conversational AI, Kapitel 02 beschreibt, wie diese Erkennung in einem Sprachagenten eingesetzt wird, und misst ihre Fehler. Dieses Kapitel beschreibt, wie sie gebaut ist.
Aus Schall wird eine Zahlenreihe
Vor jedem Erkennungsmodell steht eine Umrechnung, und sie ist Handwerk. Gelernt wird daran nichts. Die Aufnahme wird in kurze Abschnitte zerlegt, jeder etwa 25 Millisekunden lang, und für jeden Abschnitt wird gefragt, welche Frequenzen darin stecken. Die Programmbibliothek nennt das Ergebnis knapp:
Das Ergebnis heißt Spektrogramm und lässt sich als Bild ansehen: Zeit nach rechts, Tonhöhe nach oben, Helligkeit für die Lautstärke. Aus einer Zahlenreihe ist damit eine Fläche geworden, und Flächen sind das, womit die Verfahren aus Kapitel 05 umgehen können.
Ein zweiter Schritt kommt fast immer dazu. Die Frequenzbänder werden auf die Mel-Skala umgerechnet, die untere Tonlagen fein und obere grob auflöst, ungefähr so, wie ein Ohr sie unterscheidet. Der Bau ist zwei Zeilen Code:
Was danach ins Modell geht, ist also schon eine Auswahl. Alles, was oberhalb der letzten Frequenzstufe liegt, ist weg, bevor irgendetwas erkannt wird.
Warum Sprache kein Text mit Ton ist
Eine Abschrift hat vielleicht dreißig Zeichen, die zugehörige Aufnahme zweihundert Abschnitte. Beide beschreiben dasselbe, und niemand hat aufgemalt, welcher Abschnitt zu welchem Zeichen gehört. Genau das war jahrzehntelang das schwierigste Stück.
Dazu kommt, dass die Grenzen im Schall nicht existieren. Wer „ein Eis“ sagt und wer „ein Ei“ sagt, erzeugt fast dieselbe Welle. Die Lücken zwischen Wörtern, die auf Papier selbstverständlich sind, hört ein Mikrofon nicht.
Die drei Teile des klassischen Verfahrens
Bis etwa 2015 bestand jedes Erkennungssystem aus drei Bauteilen, die getrennt gebaut und getrennt gemessen wurden.
Das akustische Modell ordnet Schallabschnitten Laute zu. Es beantwortet die Frage, wie wahrscheinlich dieser Abschnitt ein „a“ ist.
Das Lexikon sagt, aus welchen Lauten ein Wort besteht. Es ist eine Liste, von Hand gepflegt, und ein Wort, das nicht darin steht, kann nicht erkannt werden.
Das Sprachmodell sagt, welche Wortfolgen üblich sind. Es entscheidet zwischen „ein Eis“ und „ein Ei“, wenn der Schall beides zulässt.
Der verbreitetste Werkzeugkasten dafür ist bis heute abrufbar:
Seine Dokumentation zeigt die Bauform an einer Nebenbemerkung. Ein Dekodierer werde eben
GMM steht für Gaußsche Mischverteilung, das Rechenverfahren hinter dem akustischen Modell jener Jahre. Wer die Modellart wechselte, brauchte einen neuen Dekodierer.
Was das Verfahren nie wusste
Die drei Teile waren getrennt, also konnte jeder für sich richtig liegen und das Ganze trotzdem falsch. Das Lexikon kannte den Nachnamen nicht, also war er unerreichbar, gleich wie deutlich er gesprochen wurde. Das Sprachmodell kannte die Wortfolge nicht, also drückte es die richtige Erkennung wieder weg.
Es gab auch keinen Weg zurück. Hatte das akustische Modell sich für einen Laut entschieden, arbeiteten die Stufen danach mit dieser Entscheidung weiter. Die gleiche Bauform und ihr gleiches Problem stehen in Kapitel 06, dort für geschriebenen Text.
Wo es heute noch so läuft
Der Dreiteil ist nicht verschwunden. Er läuft dort weiter, wo ein festes Vokabular gebraucht wird und eine Erkennung ohne Netzverbindung: in Diktiergeräten für Fachsprache, in Steuergeräten mit einer Handvoll Befehle, in Ansagesystemen am Telefon.
Das Argument dafür ist dasselbe wie in Kapitel 10: Ein Verfahren, das tausend Wörter sicher erkennt, braucht kein Modell, das eine Million kennt.
Woran Sie ein Erkennungssystem festmachen
Fragen Sie nach dem Vokabular. Ein System mit Lexikon kann nur erkennen, was darin steht. Ein durchgehendes Modell hat diese Grenze nicht, dafür schreibt es seltene Wörter falsch.
Fragen Sie nach dem Material, an dem gemessen wurde. Vorgelesene Texte und Telefongespräche sind zwei verschiedene Aufgaben, und der Abstand zwischen ihren Werten ist groß.
Achten Sie darauf, was vor dem Modell passiert. Abtastrate, Frequenzumfang und die Umrechnung auf die Mel-Skala entscheiden mit, und alle drei liegen außerhalb des Modells.
Trennen Sie Erkennung von Verstehen. Ein Erkenner liefert Text. Ob der Satz Sinn ergibt, hat ihn nie interessiert.
Das Fenster und das Spektrogramm
Eine Aufnahme mit 16.000 Abtastwerten je Sekunde liefert für zehn Sekunden 160.000 Zahlen. Damit lässt sich schlecht rechnen, und vor allem steht in einer einzelnen Zahl nichts drin: Ein Abtastwert allein sagt nichts über den Laut.
Deshalb wird gefenstert. Ein Abschnitt von etwa 25 Millisekunden wird herausgeschnitten, eine Fouriertransformation zerlegt ihn in seine Frequenzen, dann rückt das Fenster um etwa 10 Millisekunden weiter. Die Fenster überlappen sich also, und aus zehn Sekunden werden rund tausend Spalten. Der Grund für die Überlappung ist praktisch: An der Grenze zwischen zwei Fenstern soll kein Laut verlorengehen.
Die Fensterlänge ist eine Abwägung, und sie hat einen Namen in der Signalverarbeitung. Ein kurzes Fenster trennt Zeitpunkte genau und Frequenzen grob, ein langes umgekehrt. 25 Millisekunden ist der Wert, bei dem beide gerade ausreichen.
Die Mel-Skala rechnet wie ein Ohr
Ein rohes Spektrogramm verteilt seine Auflösung gleichmäßig über alle Frequenzen. Das menschliche Gehör tut das nicht: Zwischen 100 und 200 Hertz liegt ein hörbarer Unterschied, zwischen 8.000 und 8.100 Hertz kaum einer.
Die Mel-Skala bildet das nach. Sie fasst die oberen Frequenzen zu breiten Bändern zusammen und lässt die unteren fein. Die Umrechnung ist eine Matrix:
Typisch sind 80 Mel-Bänder statt einiger hundert Frequenzstufen. Das ist ein Zehntel der Daten, und der verlorene Teil ist der, den ein Ohr ohnehin nicht auseinanderhält. Diese Vorstufe steht bis heute vor den meisten Erkennungsmodellen, auch vor den durchgehenden.
Was dabei gerade nicht übrig bleibt, ist ebenso wichtig. Ein Mel-Spektrogramm kennt keine Phase, also ist der Schall daraus nicht mehr rekonstruierbar. Für die Erkennung reicht es, und für die Erzeugung ist genau das der Grund, warum in Kapitel 08 hinter dem Mel-Spektrogramm noch ein zweites Bauteil steht.
Akustisches Modell, Lexikon, Sprachmodell
Im klassischen Aufbau lief die Erkennung als Suche durch einen Graphen, und alle drei Bauteile waren Kanten darin. Kaldi nennt das Bauprinzip:
Code-level integration with Finite State Transducers (FSTs) (externe Seite, kaldi-asr.org)
Ein endlicher Transduktor ist ein Automat, der eine Eingabefolge in eine Ausgabefolge übersetzt. Das Lexikon wird zu einem: Lautfolge hinein, Wort heraus. Das Sprachmodell wird zu einem: Wortfolge hinein, Wahrscheinlichkeit heraus. Beide werden zu einem einzigen Graphen verrechnet, und der Dekodierer sucht darin den günstigsten Weg.
Das war mathematisch sauber und praktisch aufwendig. Für jede neue Sprache brauchte es ein Aussprachelexikon, und das schrieben Fachleute von Hand.
Das Ausrichtungsproblem
Zum Trainieren eines akustischen Modells braucht man Paare: dieser Abschnitt ist ein „a“, jener ein „t“. Vorhanden ist aber nur die Abschrift des ganzen Satzes. Wer die Zuordnung von Hand macht, sitzt an einer Minute Ton mehrere Stunden.
Der übliche Ausweg war ein Kreislauf. Ein grobes Modell rät eine Zuordnung, mit dieser Zuordnung wird ein besseres Modell trainiert, das eine bessere Zuordnung liefert. Das läuft, konvergiert aber langsam und hängt davon ab, womit man anfängt.
Wie CTC es auflöst
2006 stellten Graves, Fernández, Gómez und Schmidhuber ein Verfahren vor, das die Zuordnung überflüssig macht. Die Idee steht in Abschnitt 3 ihrer Arbeit (Beleg (externe Seite, cs.toronto.edu)) und hat zwei Teile.
Erstens bekommt das Modell ein zusätzliches Ausgabesymbol, das für „hier steht nichts“ steht. Damit darf es für jeden Zeitabschnitt entweder einen Buchstaben ausgeben oder schweigen.
Zweitens wird über alle Wege summiert, die dieselbe Abschrift ergeben. Ob das Modell „h a a l l o“ oder „h a l l o schweigen“ ausgibt, ist gleichgültig, solange nach dem Zusammenfassen „hallo“ dasteht. Trainiert wird auf die Summe dieser Wege, und die lässt sich schrittweise ausrechnen, ohne jeden Weg einzeln durchzugehen.
Damit fiel eine der drei Stufen weg: Aus Schall wurden direkt Buchstaben, ohne Lautlexikon dazwischen. Das Verfahren heißt Connectionist Temporal Classification, und sein Kürzel CTC steht bis heute in den Namen vieler Erkennungsmodelle.
Vom Dreiteil zum einen Modell
Der zweite Schritt kam mit den Modellen, die Ton und Text als eine einzige Folge behandeln. Das Repository zum bekanntesten von ihnen beschreibt das in einem Satz:
Damit sind akustisches Modell, Lexikon und Sprachmodell in einem Netz aufgegangen. Dasselbe Modell erkennt nebenbei die Sprache und markiert, wo gesprochen wird:
Ein Rest der alten Bauform ist geblieben, und er fällt im Betrieb auf. Das Modell arbeitet in festen Blöcken:
Dreißig Sekunden sind der Zuschnitt, und ein Satz, der über eine Blockgrenze läuft, ist der Fall, in dem solche Systeme am ehesten straucheln.
Was die Datensätze festlegten
Zwei Sammlungen haben das Fach über zwanzig Jahre geprägt, und sie sind so verschieden, dass die Zahlen daraus nichts miteinander zu tun haben.
Die eine besteht aus vorgelesenen Büchern:
Die Herkunft steht daneben und ist die wichtigere Angabe:
Vorgelesene Sprache ist deutlich artikuliert, vollständig in Sätzen, ohne Zwischenrufe, in Studioqualität. Die andere Sammlung ist das Gegenteil:
Der Aufbau dahinter ist der Grund für ihren Wert:
Fremde Menschen reden über ein vorgegebenes Thema, in Telefonqualität mit 8.000 Abtastwerten je Sekunde. Es gibt Versprecher, Überlappungen, halbe Sätze. Wer eine Fehlerrate von vorgelesenem Material auf ein Telefonat überträgt, wechselt die Gattung, und das ist derselbe Fehler wie der in Beurteilen und Einordnen, Kapitel 04 beschriebene.
Was daraus für die Praxis folgt
Fragen Sie, mit welcher Abtastrate aufgenommen wurde. Ein Telefonkanal liefert 8.000 Werte je Sekunde und schneidet oberhalb von 3,4 Kilohertz ab. Zischlaute liegen darüber, und deshalb sind sie am Telefon schwerer zu unterscheiden.
Rechnen Sie mit dem Blockschnitt. Wo ein System in Blöcken arbeitet, ist die Blockgrenze eine Fehlerquelle, und lange Aufnahmen haben viele davon.
Ein eigenes Vokabular ist im alten Aufbau billiger. Ein Wort ins Lexikon einzutragen kostet nichts. Bei einem durchgehenden Modell gibt es diese Stellschraube nicht, dafür die Wortlisten aus Conversational AI, Kapitel 02.
Wo der Fehler entsteht, den die Fehlerrate nicht trennt
Die Wortfehlerrate zählt Ersetzungen, Auslassungen und Einfügungen und teilt durch die Zahl der Wörter. Was sie nicht sagt, ist, an welcher Stufe der Fehler entstanden ist, und im klassischen Aufbau gab es dafür drei Kandidaten mit verschiedenen Gegenmitteln.
Ein Fehler im akustischen Modell heißt, dass der Laut falsch erkannt wurde. Er hängt an Aufnahmequalität, Sprechgeschwindigkeit und Akzent, und man bekämpft ihn mit mehr passendem Trainingsmaterial.
Ein Fehler im Lexikon heißt, dass es das Wort nicht gibt. Das Verfahren erkennt dann etwas anderes, das ähnlich klingt und im Lexikon steht, und die Aufnahme war völlig in Ordnung.
Ein Fehler im Sprachmodell heißt, dass die richtige Wortfolge als unwahrscheinlich verworfen wurde. Hier ist die Erkennung an der falschen Stelle klug gewesen.
Bei einem durchgehenden Modell fallen die drei zusammen, und damit auch die Diagnose. Es bleibt eine Zahl, und der Ort zum Ansetzen fehlt. Die Zahl selbst und was sie über Fachbegriffe verschweigt, steht mit einer eigenen Messung in Conversational AI, Kapitel 02.
Eine feinere Kennzahl gibt es, und sie misst näher am Schall:
Die Lautfehlerrate trennt damit die akustische Leistung von der sprachlichen. Sie steht in kaum einer Produktangabe.
Ein Sprachmodell steckte immer schon darin
Der Begriff Sprachmodell ist älter als die Sprachmodelle, um die es auf dieser Seite sonst geht. Im klassischen Erkenner bezeichnete er ein Zählmodell über Wortfolgen, meist ein n-Gramm, gebaut wie in Kapitel 06 beschrieben. Seine Aufgabe war dieselbe wie heute: entscheiden, welche Fortsetzung wahrscheinlich ist.
Das erklärt eine Beobachtung, die sonst überrascht. Ein Erkennungssystem hat nie nur gehört, es hat immer auch geraten. Wenn ein Diktat einen Fachbegriff durch ein häufiges Alltagswort ersetzt, ist das eine Entscheidung der Sprachstufe, und sie war jahrzehntelang ausdrücklich dafür gebaut. Gehört hat das System richtig.
Der Unterschied zu heute liegt im Gewicht. Ein n-Gramm-Modell kannte drei bis fünf Wörter Kontext. Ein durchgehendes Modell hält den ganzen Block, und seine Neigung, Lücken plausibel zu füllen, ist die Kehrseite derselben Fähigkeit. Was daraus im Betrieb wird, wenn gar nichts gesprochen wurde, steht in Conversational AI, Kapitel 02, und der Mechanismus dahinter in Grundkurs, Kapitel 07.
Warum eine Bestenliste die Aufnahme misst
Im August 2026 haben Forschende von Hugging Face und Hume AI elf offene Erkennungsmodelle daraufhin geprüft, ob ihre Werte die Aufgabe messen oder den Test. Der Ausgangspunkt:
Ihr Verfahren nutzt eine Eigenheit der bekannten Sammlungen: Ihre Abschriften enthalten Fehler. Sechs der elf Modelle gaben an einer VoxPopuli-Aufnahme die fehlerhafte Referenzabschrift wieder, obwohl die Aufnahme etwas anderes sagte. Als dieselben Sätze mit neuen Stimmen vorgelegt wurden, verschwand das Verhalten bei fast allen.
Das ist die Kontamination aus Beurteilen und Einordnen, Kapitel 04 an einem Fach, in dem sie besonders leicht entsteht: Die Testaufnahmen sind seit Jahren dieselben Dateien, und ein Modell kann sie an ihrer Aufnahmecharakteristik wiedererkennen.
Daraus folgt für die eigene Auswahl dasselbe wie dort. Eine Rangliste ordnet Modelle nach ihrer Leistung auf bekanntem Material. Wer wissen will, welches Modell die eigenen Aufnahmen erkennt, misst an eigenen Aufnahmen, und die gehören nirgendwohin, wo sie in ein Training geraten können.
Die Sprachen, für die es kein Material gibt
Die Menge, die ein durchgehendes Modell braucht, verschiebt das Problem statt es zu lösen. Für Englisch gibt es hunderttausende Stunden mit Abschrift, für die meisten Sprachen der Welt gibt es das nicht, und in der Menge steckt der größte Teil der Leistung:
Der Halbsatz am Ende ist die Neuerung: kein Nachtrainieren für den eigenen Bestand mehr. Er gilt für die Sprachen, in denen genug Material vorlag.
Die Gegenbewegung dazu sind kleine Modelle mit ausgewähltem Sprachumfang:
Sechshundert Millionen Parameter für 25 Sprachen ist eine andere Rechnung als Vollständigkeit, und sie folgt derselben Überlegung wie Kapitel 10: Der Zuschnitt ist die Entscheidung, nicht die Größe.
Was daraus nicht folgt
Der alte Aufbau war teurer. Ein Lexikon, das ein Fachgebiet abdeckt, erkennt dessen Begriffe zuverlässig. Diese Zusage gibt kein durchgehendes Modell.
Aus einer niedrigen Fehlerrate folgt keine brauchbare Abschrift. Die Verteilung entscheidet: Zehn Prozent gleichmäßig über Füllwörter ist etwas anderes als zehn Prozent konzentriert auf Namen und Zahlen.
Die Vorstufe ist nicht neutral. Fensterlänge, Abtastrate und Zahl der Mel-Bänder legen fest, was das Modell überhaupt sehen kann. Sie stehen in keiner Modellkarte an prominenter Stelle und wirken auf jedes Ergebnis.
Und die Erkennung sagt nichts über den Inhalt. Sie liefert Wörter. Ob der Satz stimmt, ob er höflich ist, ob er eine Handlung auslösen soll, entscheidet alles, was danach kommt.
Quellen
9 Einträge, davon 1 Schlüsselarbeitalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
Robust Speech Recognition via Large-Scale Weak Supervision (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Radford und Mitautoren stellen am 06.12.2022 das Modell vor, mit dem die Spracherkennung ohne Nachschulung für den eigenen Fall auskommt. Der Weg dahin war Menge, allerdings sortierte Menge: 680.000 Stunden Ton aus dem Netz mit den zugehörigen Abschriften, dazu ein Apparat (Abschnitt 3.1), der maschinell erzeugte Abschriften wieder aussortiert, die gesprochene Sprache gegen die geschriebene prüft und Dubletten entfernt. Eingetauscht wurden geprüfte Abschriften gegen mehr Material. Das Ergebnis wurde samt Gewichten und Ableitungscode veröffentlicht und ist damit ohne eigenes Training benutzbar.
Dokumentationerreichbar
torchaudio, Audio Feature Extractions (externe Seite, docs.pytorch.org)
docs.pytorch.orggeprüft 24.09.2026
Die Doku der Programmbibliothek zeigt die Vorstufe jeder Erkennung als Rechenschritte: Fouriertransformation über kurze Abschnitte, dann eine Umrechnung der Frequenzbänder auf die Mel-Skala. Sie belegt damit, dass das Mel-Spektrogramm ein Rechenschritt vor dem Modell ist.
Dokumentationerreichbar
About the Kaldi project (externe Seite, kaldi-asr.org)
kaldi-asr.orggeprüft 24.09.2026
Die Beschreibung des Werkzeugkastens, mit dem die Spracherkennung vor den durchgehenden Modellen gebaut wurde. Zwei Angaben zeigen die Bauform von damals: die Verzahnung mit endlichen Transduktoren, in denen Lexikon und Sprachmodell als Graph zusammenlaufen, und der Umstand, dass ein Dekodierer je Modellart gebaut wird. Die Doku sagt selbst, dass sie sich an Fachleute richtet.
Datenerreichbar
LibriSpeech ASR corpus (externe Seite, openslr.org)
openslr.orggeprüft 24.09.2026
Der Datensatz, an dem die Spracherkennung über Jahre gemessen wurde, beim Herausgeber selbst beschrieben. Die Angabe zur Herkunft ist die wichtigere von beiden: Das Material sind vorgelesene Hörbücher aus dem LibriVox-Projekt, also sauber artikulierte Sprache ohne Zwischenrufe und ohne Nebengeräusche. Wer eine Zahl aus dieser Erhebung auf ein Gespräch überträgt, wechselt die Gattung.
Datenerreichbar
Switchboard-1 Release 2 (externe Seite, catalog.ldc.upenn.edu)
catalog.ldc.upenn.edugeprüft 24.09.2026
Der Gegenpol zu LibriSpeech, aufgenommen 1990 und 1991 bei Texas Instruments: 260 Stunden echter Telefongespräche zwischen Fremden, in Telefonqualität mit 8000 Abtastwerten je Sekunde. An dieser Sammlung hat sich die Spracherkennung zwei Jahrzehnte lang gemessen, und der Abstand zwischen ihren Werten und denen auf vorgelesenem Material sagt mehr über das Fach als jede einzelne Zahl.
Dokumentationerreichbar
OpenAI Whisper, Repository (externe Seite, github.com)
github.comgeprüft 24.09.2026
Das Repository zum Erkennungsmodell, und die knappste Beschreibung des Bruchs zwischen alter und neuer Bauform: Ein einziges Modell übernimmt Aufgaben, für die früher mehrere Stufen hintereinander standen. Daneben stehen zwei Angaben zum Betrieb, das Fenster von 30 Sekunden und die Mel-Stufe davor.
Originalarbeiterreichbar
cs.toronto.edugeprüft 24.09.2026
Graves, Fernandez, Gomez und Schmidhuber lösen 2006 das Problem, an dem die Erkennung bis dahin hängt: Eine Aufnahme und ihre Abschrift sind verschieden lang, und niemand weiß, welcher Zeitabschnitt zu welchem Buchstaben gehört. Ihr Verfahren führt ein Leerzeichen-Symbol ein und summiert über alle Zuordnungen, die dieselbe Abschrift ergeben. Belegstelle ist Abschnitt 3 der Arbeit. Kein Zitat hinterlegt: Die Quelle ist ein PDF, und der Prüfstand liest den sichtbaren Seitentext.
Originalarbeiterreichbar
Measuring benchmark optimization in speech recognition (externe Seite, huggingface.co)
huggingface.cogeprüft 24.09.2026
Blogbeitrag der beteiligten Forschenden mit Beschreibung der drei Testverfahren und den Befunden zu elf ASR-Modellen.
Originalarbeiterreichbar
NVIDIA, Modellkarte Parakeet TDT 0.6B v3 (externe Seite, huggingface.co)
huggingface.cogeprüft 24.09.2026
Die Modellkarte eines Erkennungsmodells mit 600 Millionen Parametern, das 25 europäische Sprachen abdeckt und die Sprache selbst erkennt. Es ist der Gegenentwurf zur Größe: klein genug für einen Laptop, und in den ausgewiesenen Auswertungen liegt es bei der Wortfehlerrate im Bereich deutlich größerer Modelle. Die Tabellen weisen die Werte je Datensatz aus, dazu Zeitmarken auf Wort- und Abschnittsebene und eine Messung der Rauschfestigkeit: Bei Musik und Störgeräusch so laut wie die Stimme steigt die mittlere Wortfehlerrate über acht Datensätze von 6,34 auf 11,66 Prozent.