NachschlagenQuellenregister

Originalarbeiterreichbar

Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions

arxiv.org (externe Seite)

Shen und Mitautoren beschreiben am 16.12.2017 die Bauform, die bis heute unter den meisten Sprachausgaben steht: erst ein Netz, das aus Zeichen ein Mel-Spektrogramm vorhersagt, dann ein zweites, das daraus die Schallwelle macht. Der Kurztext nennt die Bewertung mit 4,53 gegen 4,58 für aufgenommene Sprache; diese Zahlen stehen dort in Formelschreibweise und sind deshalb nicht als Zitat hinterlegt.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:

  • This paper describes Tacotron 2, a neural network architecture for speech synthesis directly from text.bestätigt 24.09.2026
  • The system is composed of a recurrent sequence-to-sequence feature prediction network that maps character embeddings to mel-scale spectrograms, followed by a modified WaveNet model acting as a vocoder to synthesize timedomain waveforms from those spectrograms.bestätigt 24.09.2026
  • We further demonstrate that using a compact acoustic intermediate representation enables significant simplification of the WaveNet architecture.bestätigt 24.09.2026

Vocoder im Glossar08 Sprachsynthese

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.