GrundlagenKI-WissenKapitel 08von 14 im Pfad
Sprachsynthese
Der Weg von Text zu Schall ist der umgekehrte zu dem aus Kapitel 07, und er ist schwerer. Bei der Erkennung gibt es eine richtige Antwort, nämlich das gesprochene Wort. Bei der Erzeugung gibt es unendlich viele: Jeder Satz lässt sich in tausend Tonlagen, Tempi und Betonungen sagen, und alle sind richtig.
Conversational AI, Kapitel 01 führt den Begriff ein und nennt die Abkürzung TTS. Dieses Kapitel beschreibt, wie das Bauteil dahinter arbeitet.
Zwei Wege, aus Text Ton zu machen
Bis 2016 gab es zwei Bauformen, und der Hersteller, der beide ablöste, hat sie in seiner Ankündigung nebeneinandergestellt.
Der erste Weg setzt aufgenommene Sprache neu zusammen:
Der zweite Weg speichert stattdessen Kennwerte und rechnet daraus:
Beide haben je eine Schwäche, und beide Schwächen sind gut belegt.
Das Zusammensetzen aus Schnipseln
Wer Sprachschnipsel zusammensetzt, hört echte menschliche Laute, und das klingt in guten Fällen sehr natürlich. Was das kostet, steht direkt daneben:
Eine neue Stimme heißt also: neue Aufnahmen, tagelang, mit derselben Person. Eine andere Betonung heißt dasselbe. Solche Systeme waren an ihre Sprecherin gebunden, und die Übergänge zwischen zwei Schnipseln waren der Ort, an dem man die Naht hörte.
Der Bruch, das Netz erzeugt die Welle selbst
Der parametrische Weg war beweglich und klang schlechter, weil am Ende ein Bauteil stand, das aus Kennwerten Schall macht:
2016 wurde dieses Bauteil durch ein neuronales Netz ersetzt, das die Schallwelle direkt erzeugt:
Die Autoren beziffern den Abstand zu beiden alten Bauformen:
Damit war die Frage entschieden. Was heute in einem Sprachagenten spricht, steht in dieser Linie.
Was eine Stimme ausmacht
Der Text sagt, welche Wörter fallen. Alles andere muss das System erfinden, und es ist mehr, als man beim Zuhören merkt.
Die Tonhöhe und ihr Verlauf über den Satz. Eine Frage endet oben, eine Feststellung unten.
Die Länge jedes Lautes. Wer betont, dehnt.
Die Pausen, und zwar an Stellen, an denen kein Satzzeichen steht.
Die Klangfarbe, an der wir eine Person wiedererkennen.
Die ersten drei zusammen heißen Prosodie, und die Bedeutung hängt an ihnen mit. „Das hast du gut gemacht“ ist je nach Betonung ein Lob oder das Gegenteil, und im Text steht beides gleich.
Was das Gesetz an dieser Stelle verlangt
Seit dem 02.08.2026 gilt Artikel 50 der KI-Verordnung. Anbieter müssen erzeugte Inhalte maschinenlesbar markieren:
Was daraus für eine Sprachanwendung folgt, welche Ausnahmen es gibt und wie die Kennzeichnung technisch aussieht, steht in Conversational AI, Kapitel 09. Dort geht es um die Pflichten, hier um das Verfahren.
Woran Sie eine erzeugte Stimme festmachen
Hören Sie auf die Pausen. Ein System, das nach Satzzeichen atmet, klingt regelmäßiger als ein Mensch.
Achten Sie auf seltene Wörter. Namen, Fachbegriffe und Abkürzungen sind die Stelle, an der die Aussprache geraten wird.
Fragen Sie, wo die Stimme herkommt. Eine nachgebildete Stimme braucht die Zustimmung der Person, der sie gehört, und beide großen Anbieter verlangen dafür einen Nachweis.
Verwechseln Sie Natürlichkeit nicht mit Richtigkeit. Eine Stimme, die gut klingt, kann einen falschen Satz sprechen. Was vor ihr steht, entscheidet darüber.
Vom Text zur Lautfolge
Bevor irgendetwas klingt, muss aus Schrift eine Aussprache werden, und das ist keine Übersetzung Zeichen für Zeichen. „Sie“ und „sie“ klingen gleich, „umfahren“ und „umfahren“ nicht. Eine Zahl wie 1994 kann Jahreszahl, Hausnummer oder Betrag sein, und jede Lesart klingt anders.
Diese Stufe heißt Textaufbereitung und war im klassischen Aufbau ein eigenes Bauteil mit Regeln, Abkürzungslisten und einem Aussprachewörterbuch. Sie entscheidet über Dinge, die kein Netz danach mehr korrigieren kann: Wer 1994 als Zahl vorliest statt als Jahr, hat den Satz falsch gesagt, obwohl jeder Laut sauber klingt.
Das Mel-Spektrogramm als Zwischenschritt
Die Bauform, die bis heute unter den meisten Systemen steht, wurde 2017 beschrieben, und ihr Kurztext nennt beide Hälften in einem Satz:
Vorn steht ein Netz, das aus Zeichen ein Mel-Spektrogramm vorhersagt, also genau die Darstellung, die in Kapitel 07 am Anfang der Erkennung steht. Der Weg läuft hier rückwärts durch dieselbe Repräsentation.
Warum steht dort eine Zwischenstufe? Weil sie klein ist. Ein Mel-Spektrogramm hat 80 Werte je Zeitschritt und einen Zeitschritt je 10 Millisekunden, das sind 8.000 Zahlen für eine Sekunde. Die Schallwelle hat für dieselbe Sekunde 16.000 oder 24.000. Die Autoren beziffern den Gewinn:
Der Vocoder macht daraus Schall
Ein Mel-Spektrogramm sagt, welche Frequenzen wann wie laut sind. Es sagt nicht, wie die Schwingungen zueinander stehen, denn die Phase geht bei der Umrechnung verloren. Genau deshalb braucht es hinten ein zweites Bauteil.
Der Begriff Vocoder ist älter als die neuronalen Verfahren und bezeichnete zunächst ein Signalverarbeitungsprogramm:
Seit 2016 sitzt an dieser Stelle ein Netz. Es erzeugt die Welle Wert für Wert:
Daraus folgt die Rechenlast, die diese Bauform in den ersten Jahren unbrauchbar für Gespräche machte. Die Menge steht in der Ankündigung:
16.000 Vorhersagen für eine Sekunde Ton, jede abhängig von allen vorherigen. Die späteren Vocoder haben genau daran gearbeitet, und heute läuft die Erzeugung schneller als in Echtzeit.
Wie eine Stimme nachgebildet wird
Dass ein Modell mehrere Stimmen führen kann, stand schon 2016 im Kurztext:
Die Stimme ist also eine zusätzliche Eingabe in dasselbe Modell. Heute genügen wenige Minuten Material, um eine neue hinzuzufügen. Beide großen Anbieter haben dafür eine Sperre eingebaut, und sie ist bei beiden dieselbe:
Der andere verlangt einen gesprochenen Satz, wortwörtlich:
Was daraus rechtlich folgt und warum eine Stimme mehr ist als ein Klang, steht in Conversational AI, Kapitel 09.
Was sich steuern lässt und was nicht
Die Prosodie ist die offene Flanke. Ein Netz, das nur den Text sieht, muss raten, wo betont wird, und es rät den Durchschnitt seines Trainingsmaterials.
Der jüngere Weg dafür ist eine Anweisung in Prosa:
You can prompt the model to control aspects of speech (externe Seite, developers.openai.com)
Das ist bequem und ungenau. Man beschreibt eine Stimmung, und das Modell setzt sie um oder auch nicht. Der ältere Weg waren Auszeichnungssprachen, in denen Pausenlängen und Tonhöhen im Text stehen: genauer, aufwendiger und für lange Texte unpraktisch.
Ein Punkt fällt in Gesprächen besonders auf. Die Ausgabe kommt stückweise, sonst käme die Antwort erst nach der letzten Silbe:
Wer stückweise ausgibt, hat allerdings die Betonung des Satzendes noch nicht berechnet, als er den Satzanfang schon spricht. Das ist der Grund, warum gesprochene Fragen manchmal wie Feststellungen klingen.
Warum die Aussprache das schwerste Stück bleibt
Fehler in der Prosodie hört man und versteht den Satz trotzdem. Fehler in der Aussprache eines Namens sind etwas anderes: Der Zuhörer weiß nicht, wer gemeint ist.
Die schwierigen Fälle sind an drei Stellen dieselben wie bei der Erkennung. Eigennamen folgen keiner Regel. Abkürzungen können Wort oder Buchstabenfolge sein. Und Fremdwörter bringen die Ausspracheregeln ihrer Herkunftssprache mit, sofern der Sprecher sie kennt.
Ein Aussprachewörterbuch löst das, und deshalb führen die Anbieter eines, auch wenn die Bauform davor kein eigenes Bauteil mehr dafür hat.
Was daraus für die Praxis folgt
Prüfen Sie an Ihren eigenen Namen. Firmenname, Produktname, Ortsname: Wenn die falsch klingen, ist das im Betrieb der teuerste Fehler.
Rechnen Sie das Vorlesen von Zahlen gesondert nach. Beträge, Uhrzeiten, Aktenzeichen und Telefonnummern haben je eigene Leseregeln.
Die Stimme wählt man vor der Anwendung. Ein Wechsel mitten im Betrieb irritiert Zuhörer stärker, als es sich beim Bauen anfühlt.
Und die Erzeugung ist die letzte Stufe. Was falsch ankam, spricht auch die beste Stimme falsch aus. Das steht in Conversational AI, Kapitel 02 mit einer eigenen Messung.
Die Zwischenstufe ist wieder das Nadelöhr
Die zweistufige Bauform hat dieselbe Eigenschaft wie die Ketten aus Kapitel 06: Zwischen den Stufen steht eine feste Darstellung, und was dort nicht hineinpasst, ist danach nicht mehr da.
Ein Mel-Spektrogramm hält Frequenz und Lautstärke über die Zeit fest. Die Phase fehlt darin, also entscheidet der Vocoder selbst, wie die Schwingungen zueinander stehen. Bei einer Stimme fällt das kaum auf. Bei Geräuschen, Hall und mehreren Sprechern gleichzeitig fällt es auf.
Die Autoren von 2017 haben die Zwischenstufe ausdrücklich als Vorteil geführt, und sie hatten recht:
Der Preis daran ist derselbe wie überall bei diesem Muster. Eine Stufe legt sich fest, die nächste kann die Festlegung nicht mehr aufheben. Sagt das Vorhersagenetz die Betonung falsch voraus, erzeugt der Vocoder eine einwandfreie Welle mit falscher Betonung.
Die jüngeren Systeme umgehen das, indem sie beide Stufen zusammen trainieren oder ganz ohne Zwischenstufe arbeiten. Damit ist der Fehler nicht weg, aber er ist nicht mehr an einer Stelle festgeschrieben.
Was eine Bewertung von Stimmqualität misst
Die übliche Kennzahl heißt Mean Opinion Score, und der Herstellerbeitrag von 2016 sagt sauber, was dahintersteht:
Fünfhundert Bewertungen zu hundert Sätzen. Menschen hören und vergeben eine Note von eins bis fünf. Das ist eine Befragung. Am Signal gemessen wird dabei nichts, und daraus folgen drei Einschränkungen.
Der Wert hängt an den Sätzen. Hundert Testsätze sind hundert Testsätze. Namen, Zahlenkolonnen und Fachbegriffe sind darin selten, und genau dort scheitern die Systeme.
Der Wert hängt an den Hörenden. Wer Deutsch als Muttersprache spricht, bewertet eine deutsche Stimme anders als jemand, der die Sprache gelernt hat.
Und der Abstand zur Aufnahme ist klein geworden. Tacotron 2 gibt 4,53 an gegen 4,58 für professionell aufgenommene Sprache. Der Kurztext nennt diese Zahlen in Formelschreibweise, deshalb stehen sie hier ohne Zitat (Beleg (externe Seite, arxiv.org)). Wenn zwei Werte so nah beieinanderliegen, misst die Skala kaum noch etwas: Sie hat oben kein Papier mehr.
Für die eigene Auswahl folgt daraus dasselbe wie in Beurteilen und Einordnen, Kapitel 04. Eine fremde Note sagt, dass ein System im Durchschnitt gut klingt. Ob es Ihre Texte richtig spricht, sagt nur ein Versuch mit Ihren Texten.
Die Stimme als Merkmal einer Person
Ab dem Moment, in dem eine Stimme aus Material nachgebildet werden kann, verlässt das Thema die Technik. Die Anbieter haben das früh gesehen und in ihre Bedingungen geschrieben. Der eine verlangt einen gesprochenen Satz mit festem Wortlaut, der andere ein Prüfverfahren vor der Freischaltung.
Beide Sperren stehen in den Bedingungen der Anbieter. Ein Modell, dessen Gewichte offen liegen, hat sie nicht, und der Aufwand für eine nachgebildete Stimme ist inzwischen Minuten.
Der Anbieter deckelt außerdem die Zahl:
At most 20 voices can be created per organization. (externe Seite, developers.openai.com)
Das ist eine Betriebsgrenze. Als Schutz taugt sie nicht. Was rechtlich gilt, unter welchen Bedingungen eine Stimme ein biometrisches Merkmal ist und was Artikel 50 dazu verlangt, steht vollständig in Conversational AI, Kapitel 09.
Was daraus nicht folgt
Aus natürlichem Klang folgt keine natürliche Sprechweise. Die Laute können einwandfrei sein und der Satz trotzdem falsch betont. Das eine misst der Vocoder, das andere die Stufe davor.
Die alten Bauformen sind nicht wertlos. Wer zehn feste Ansagen braucht, nimmt zehn Aufnahmen. Das klingt besser als jedes erzeugte Verfahren und kostet einen Nachmittag.
Eine hohe Bewertung sagt nichts über seltene Wörter. Die Testsätze enthalten sie nicht, und genau sie entscheiden im Betrieb.
Und die Kennzeichnungspflicht ist keine Frage der Qualität. Sie hängt allein daran, dass der Inhalt erzeugt wurde.
Quellen
8 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Ankündigung des Herstellerserreichbar
WaveNet: A generative model for raw audio (externe Seite, deepmind.google)
deepmind.googlegeprüft 24.09.2026
Die Ankündigung vom 08.09.2016 beim Hersteller, vier Tage vor der Arbeit dazu, und der Ort, an dem die beiden alten Bauformen der Sprachausgabe erklärt werden. Sie definiert nebenbei den Vocoder als das Bauteil, durch das die parametrischen Verfahren ihre Ausgabe schicken, und nennt die Zahl, an der die Aufgabe hängt: 16.000 Abtastwerte je Sekunde.
Originalarbeiterreichbar
WaveNet: A Generative Model for Raw Audio (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Van den Oord und Mitautoren stellen am 12.09.2016 das Verfahren vor, das den Schall Abtastwert für Abtastwert erzeugt statt ihn aus Bausteinen zusammenzusetzen. Der Kurztext nennt beide Bauformen, die es damit überholt, und er nennt auch die Grenze des Verfahrens: Jeder Wert hängt von allen vorherigen ab, also entsteht die Ausgabe streng nacheinander.
Dokumentationerreichbar
OpenAI, Text to speech (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Seite zur Sprachausgabe, mit zwei Angaben, die für ein Gespräch zählen. Der Ton kommt stückweise und lässt sich abspielen, bevor die Datei fertig ist; ohne das käme die Antwort erst nach der letzten Silbe. Und die Stimme wird über eine Anweisung in Prosa geführt, mit einer Liste dessen, was sich damit erreichen lässt: Akzent, Gefühlsspanne, Betonung, Nachahmung, Tempo, Klangfarbe, Flüstern.
Originalarbeiterreichbar
Verordnung (EU) 2024/1689 über künstliche Intelligenz (externe Seite, eur-lex.europa.eu)
eur-lex.europa.eugeprüft 24.09.2026
Der Rechtstext selbst, veröffentlicht am 12.07.2024 und in Kraft getreten am 01.08.2024. Er ordnet Anwendungen nach Risiko und legt die Pflichten je Stufe fest. Die Anwendbarkeit beginnt gestaffelt, nicht mit dem Inkrafttreten. Die Adresse zeigt seit dem 29.07.2026 auf die deutsche Fassung: Die Zitate unten stehen im Text so, wie er hier zitiert wird, und die Fassung ohne Sprachangabe liefert die englische.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Shen und Mitautoren beschreiben am 16.12.2017 die Bauform, die bis heute unter den meisten Sprachausgaben steht: erst ein Netz, das aus Zeichen ein Mel-Spektrogramm vorhersagt, dann ein zweites, das daraus die Schallwelle macht. Der Kurztext nennt die Bewertung mit 4,53 gegen 4,58 für aufgenommene Sprache; diese Zahlen stehen dort in Formelschreibweise und sind deshalb nicht als Zitat hinterlegt.
Dokumentationerreichbar
OpenAI, Custom voices (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Seite zum Nachbilden einer eigenen Stimme aus einer Tonprobe, bis zum 11.09.2026 Teil der Seite zur Sprachausgabe (openai-tts-doku), seitdem ausgelagert. Sie führt den gesprochenen Zustimmungssatz als Prüfschritt, die Regel, dass die Aufnahme nur eine von mehreren vorgegebenen Phrasen enthalten darf, und die Obergrenze von zwanzig selbst erzeugten Stimmen je Organisation.
Dokumentationerreichbar
ElevenLabs, Professional voice cloning (externe Seite, elevenlabs.io)
elevenlabs.iogeprüft 24.09.2026
Wie eine Stimme nachgebildet wird, beim Anbieter selbst beschrieben. Zwei Bedingungen stehen im Fließtext: Erlaubt ist nur die eigene Stimme, und vor der Freischaltung steht ein Nachweis, dass sie einem gehört.
Dokumentationerreichbar
torchaudio, Audio Feature Extractions (externe Seite, docs.pytorch.org)
docs.pytorch.orggeprüft 24.09.2026
Die Doku der Programmbibliothek zeigt die Vorstufe jeder Erkennung als Rechenschritte: Fouriertransformation über kurze Abschnitte, dann eine Umrechnung der Frequenzbänder auf die Mel-Skala. Sie belegt damit, dass das Mel-Spektrogramm ein Rechenschritt vor dem Modell ist.