Datenerreichbar
LibriSpeech ASR corpus
Der Datensatz, an dem die Spracherkennung über Jahre gemessen wurde, beim Herausgeber selbst beschrieben. Die Angabe zur Herkunft ist die wichtigere von beiden: Das Material sind vorgelesene Hörbücher aus dem LibriVox-Projekt, also sauber artikulierte Sprache ohne Zwischenrufe und ohne Nebengeräusche. Wer eine Zahl aus dieser Erhebung auf ein Gespräch überträgt, wechselt die Gattung.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:
LibriSpeech is a corpus of approximately 1000 hours of 16kHz read English speech
bestätigt 24.09.2026The data is derived from read audiobooks from the LibriVox project, and has been carefully segmented and aligned.
bestätigt 24.09.2026