Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenKI-WissenKapitel 07von 14 im Pfad

Spracherkennung

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Gesprochene Sprache ist eine Druckschwankung in der Luft. Ein Mikrofon misst sie, tausende Male je Sekunde, und schreibt eine lange Reihe von Zahlen. Am Ende soll ein Satz dastehen. Zwischen beiden liegt ein Fach mit siebzig Jahren Geschichte.

Conversational AI, Kapitel 02 beschreibt, wie diese Erkennung in einem Sprachagenten eingesetzt wird, und misst ihre Fehler. Dieses Kapitel beschreibt, wie sie gebaut ist.

Aus Schall wird eine Zahlenreihe

Vor jedem Erkennungsmodell steht eine Umrechnung, und sie ist Handwerk. Gelernt wird daran nichts. Die Aufnahme wird in kurze Abschnitte zerlegt, jeder etwa 25 Millisekunden lang, und für jeden Abschnitt wird gefragt, welche Frequenzen darin stecken. Die Programmbibliothek nennt das Ergebnis knapp:

To get the frequency make-up of an audio signal as it varies with time, you can use torchaudio.transforms.Spectrogram(). (externe Seite, docs.pytorch.org)

Das Ergebnis heißt Spektrogramm und lässt sich als Bild ansehen: Zeit nach rechts, Tonhöhe nach oben, Helligkeit für die Lautstärke. Aus einer Zahlenreihe ist damit eine Fläche geworden, und Flächen sind das, womit die Verfahren aus Kapitel 05 umgehen können.

Ein zweiter Schritt kommt fast immer dazu. Die Frequenzbänder werden auf die Mel-Skala umgerechnet, die untere Tonlagen fein und obere grob auflöst, ungefähr so, wie ein Ohr sie unterscheidet. Der Bau ist zwei Zeilen Code:

Generating a mel-scale spectrogram involves generating a spectrogram and performing mel-scale conversion. (externe Seite, docs.pytorch.org)

Was danach ins Modell geht, ist also schon eine Auswahl. Alles, was oberhalb der letzten Frequenzstufe liegt, ist weg, bevor irgendetwas erkannt wird.

Warum Sprache kein Text mit Ton ist

Eine Abschrift hat vielleicht dreißig Zeichen, die zugehörige Aufnahme zweihundert Abschnitte. Beide beschreiben dasselbe, und niemand hat aufgemalt, welcher Abschnitt zu welchem Zeichen gehört. Genau das war jahrzehntelang das schwierigste Stück.

Dazu kommt, dass die Grenzen im Schall nicht existieren. Wer „ein Eis“ sagt und wer „ein Ei“ sagt, erzeugt fast dieselbe Welle. Die Lücken zwischen Wörtern, die auf Papier selbstverständlich sind, hört ein Mikrofon nicht.

Die drei Teile des klassischen Verfahrens

Bis etwa 2015 bestand jedes Erkennungssystem aus drei Bauteilen, die getrennt gebaut und getrennt gemessen wurden.

Das akustische Modell ordnet Schallabschnitten Laute zu. Es beantwortet die Frage, wie wahrscheinlich dieser Abschnitt ein „a“ ist.

Das Lexikon sagt, aus welchen Lauten ein Wort besteht. Es ist eine Liste, von Hand gepflegt, und ein Wort, das nicht darin steht, kann nicht erkannt werden.

Das Sprachmodell sagt, welche Wortfolgen üblich sind. Es entscheidet zwischen „ein Eis“ und „ein Ei“, wenn der Schall beides zulässt.

Der verbreitetste Werkzeugkasten dafür ist bis heute abrufbar:

Kaldi is a toolkit for speech recognition written in C++ and licensed under the Apache License v2.0. (externe Seite, kaldi-asr.org)

Seine Dokumentation zeigt die Bauform an einer Nebenbemerkung. Ein Dekodierer werde eben

Each command-line program generally works for a limited set of cases (e.g. a decoder might just work for GMMs). (externe Seite, kaldi-asr.org)

GMM steht für Gaußsche Mischverteilung, das Rechenverfahren hinter dem akustischen Modell jener Jahre. Wer die Modellart wechselte, brauchte einen neuen Dekodierer.

Was das Verfahren nie wusste

Die drei Teile waren getrennt, also konnte jeder für sich richtig liegen und das Ganze trotzdem falsch. Das Lexikon kannte den Nachnamen nicht, also war er unerreichbar, gleich wie deutlich er gesprochen wurde. Das Sprachmodell kannte die Wortfolge nicht, also drückte es die richtige Erkennung wieder weg.

Es gab auch keinen Weg zurück. Hatte das akustische Modell sich für einen Laut entschieden, arbeiteten die Stufen danach mit dieser Entscheidung weiter. Die gleiche Bauform und ihr gleiches Problem stehen in Kapitel 06, dort für geschriebenen Text.

Wo es heute noch so läuft

Der Dreiteil ist nicht verschwunden. Er läuft dort weiter, wo ein festes Vokabular gebraucht wird und eine Erkennung ohne Netzverbindung: in Diktiergeräten für Fachsprache, in Steuergeräten mit einer Handvoll Befehle, in Ansagesystemen am Telefon.

Das Argument dafür ist dasselbe wie in Kapitel 10: Ein Verfahren, das tausend Wörter sicher erkennt, braucht kein Modell, das eine Million kennt.

Woran Sie ein Erkennungssystem festmachen

Fragen Sie nach dem Vokabular. Ein System mit Lexikon kann nur erkennen, was darin steht. Ein durchgehendes Modell hat diese Grenze nicht, dafür schreibt es seltene Wörter falsch.

Fragen Sie nach dem Material, an dem gemessen wurde. Vorgelesene Texte und Telefongespräche sind zwei verschiedene Aufgaben, und der Abstand zwischen ihren Werten ist groß.

Achten Sie darauf, was vor dem Modell passiert. Abtastrate, Frequenzumfang und die Umrechnung auf die Mel-Skala entscheiden mit, und alle drei liegen außerhalb des Modells.

Trennen Sie Erkennung von Verstehen. Ein Erkenner liefert Text. Ob der Satz Sinn ergibt, hat ihn nie interessiert.

Quellen

9 Einträge, davon 1 Schlüsselarbeitalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    Robust Speech Recognition via Large-Scale Weak Supervision (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Radford und Mitautoren stellen am 06.12.2022 das Modell vor, mit dem die Spracherkennung ohne Nachschulung für den eigenen Fall auskommt. Der Weg dahin war Menge, allerdings sortierte Menge: 680.000 Stunden Ton aus dem Netz mit den zugehörigen Abschriften, dazu ein Apparat (Abschnitt 3.1), der maschinell erzeugte Abschriften wieder aussortiert, die gesprochene Sprache gegen die geschriebene prüft und Dubletten entfernt. Eingetauscht wurden geprüfte Abschriften gegen mehr Material. Das Ergebnis wurde samt Gewichten und Ableitungscode veröffentlicht und ist damit ohne eigenes Training benutzbar.

  • Dokumentationerreichbar

    torchaudio, Audio Feature Extractions (externe Seite, docs.pytorch.org)

    docs.pytorch.orggeprüft 24.09.2026

    Die Doku der Programmbibliothek zeigt die Vorstufe jeder Erkennung als Rechenschritte: Fouriertransformation über kurze Abschnitte, dann eine Umrechnung der Frequenzbänder auf die Mel-Skala. Sie belegt damit, dass das Mel-Spektrogramm ein Rechenschritt vor dem Modell ist.

  • Dokumentationerreichbar

    About the Kaldi project (externe Seite, kaldi-asr.org)

    kaldi-asr.orggeprüft 24.09.2026

    Die Beschreibung des Werkzeugkastens, mit dem die Spracherkennung vor den durchgehenden Modellen gebaut wurde. Zwei Angaben zeigen die Bauform von damals: die Verzahnung mit endlichen Transduktoren, in denen Lexikon und Sprachmodell als Graph zusammenlaufen, und der Umstand, dass ein Dekodierer je Modellart gebaut wird. Die Doku sagt selbst, dass sie sich an Fachleute richtet.

  • Datenerreichbar

    LibriSpeech ASR corpus (externe Seite, openslr.org)

    openslr.orggeprüft 24.09.2026

    Der Datensatz, an dem die Spracherkennung über Jahre gemessen wurde, beim Herausgeber selbst beschrieben. Die Angabe zur Herkunft ist die wichtigere von beiden: Das Material sind vorgelesene Hörbücher aus dem LibriVox-Projekt, also sauber artikulierte Sprache ohne Zwischenrufe und ohne Nebengeräusche. Wer eine Zahl aus dieser Erhebung auf ein Gespräch überträgt, wechselt die Gattung.

  • Datenerreichbar

    Switchboard-1 Release 2 (externe Seite, catalog.ldc.upenn.edu)

    catalog.ldc.upenn.edugeprüft 24.09.2026

    Der Gegenpol zu LibriSpeech, aufgenommen 1990 und 1991 bei Texas Instruments: 260 Stunden echter Telefongespräche zwischen Fremden, in Telefonqualität mit 8000 Abtastwerten je Sekunde. An dieser Sammlung hat sich die Spracherkennung zwei Jahrzehnte lang gemessen, und der Abstand zwischen ihren Werten und denen auf vorgelesenem Material sagt mehr über das Fach als jede einzelne Zahl.

  • Dokumentationerreichbar

    OpenAI Whisper, Repository (externe Seite, github.com)

    github.comgeprüft 24.09.2026

    Das Repository zum Erkennungsmodell, und die knappste Beschreibung des Bruchs zwischen alter und neuer Bauform: Ein einziges Modell übernimmt Aufgaben, für die früher mehrere Stufen hintereinander standen. Daneben stehen zwei Angaben zum Betrieb, das Fenster von 30 Sekunden und die Mel-Stufe davor.

  • Originalarbeiterreichbar

    Connectionist Temporal Classification: Labelling Unsegmented Sequence Data with Recurrent Neural Networks (externe Seite, cs.toronto.edu)

    cs.toronto.edugeprüft 24.09.2026

    Graves, Fernandez, Gomez und Schmidhuber lösen 2006 das Problem, an dem die Erkennung bis dahin hängt: Eine Aufnahme und ihre Abschrift sind verschieden lang, und niemand weiß, welcher Zeitabschnitt zu welchem Buchstaben gehört. Ihr Verfahren führt ein Leerzeichen-Symbol ein und summiert über alle Zuordnungen, die dieselbe Abschrift ergeben. Belegstelle ist Abschnitt 3 der Arbeit. Kein Zitat hinterlegt: Die Quelle ist ein PDF, und der Prüfstand liest den sichtbaren Seitentext.

  • Originalarbeiterreichbar

    Measuring benchmark optimization in speech recognition (externe Seite, huggingface.co)

    huggingface.cogeprüft 24.09.2026

    Blogbeitrag der beteiligten Forschenden mit Beschreibung der drei Testverfahren und den Befunden zu elf ASR-Modellen.

  • Originalarbeiterreichbar

    NVIDIA, Modellkarte Parakeet TDT 0.6B v3 (externe Seite, huggingface.co)

    huggingface.cogeprüft 24.09.2026

    Die Modellkarte eines Erkennungsmodells mit 600 Millionen Parametern, das 25 europäische Sprachen abdeckt und die Sprache selbst erkennt. Es ist der Gegenentwurf zur Größe: klein genug für einen Laptop, und in den ausgewiesenen Auswertungen liegt es bei der Wortfehlerrate im Bereich deutlich größerer Modelle. Die Tabellen weisen die Werte je Datensatz aus, dazu Zeitmarken auf Wort- und Abschnittsebene und eine Messung der Rauschfestigkeit: Bei Musik und Störgeräusch so laut wie die Stimme steigt die mittlere Wortfehlerrate über acht Datensätze von 6,34 auf 11,66 Prozent.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.