Originalarbeiterreichbar
Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions
Shen und Mitautoren beschreiben am 16.12.2017 die Bauform, die bis heute unter den meisten Sprachausgaben steht: erst ein Netz, das aus Zeichen ein Mel-Spektrogramm vorhersagt, dann ein zweites, das daraus die Schallwelle macht. Der Kurztext nennt die Bewertung mit 4,53 gegen 4,58 für aufgenommene Sprache; diese Zahlen stehen dort in Formelschreibweise und sind deshalb nicht als Zitat hinterlegt.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:
This paper describes Tacotron 2, a neural network architecture for speech synthesis directly from text.
bestätigt 24.09.2026The system is composed of a recurrent sequence-to-sequence feature prediction network that maps character embeddings to mel-scale spectrograms, followed by a modified WaveNet model acting as a vocoder to synthesize timedomain waveforms from those spectrograms.
bestätigt 24.09.2026We further demonstrate that using a compact acoustic intermediate representation enables significant simplification of the WaveNet architecture.
bestätigt 24.09.2026