GrundlagenConversational AIKapitel 09von 12 im Pfad
Was die Stimme noch beweist
Wer ans Telefon geht, zieht zwei Schlüsse, ohne darüber nachzudenken. Am anderen Ende ist ein Mensch. Und wenn die Stimme bekannt klingt, ist es die Person, zu der sie gehört. Beide Schlüsse gelten nicht mehr.
Für den ersten gibt es seit Kurzem eine Rechtspflicht.
Der Satz, um den es geht
Artikel 50 Absatz 1 der KI-Verordnung ist seit dem 02.08.2026 anwendbar. Er lautet:
„Direkte Interaktion mit natürlichen Personen“ beschreibt genau das, wovon dieser Lernpfad handelt. Ein Sprachagent am Telefon ist der Musterfall, und ein Chatfenster auf einer Webseite ebenso.
Die Pflicht trifft die Anbieter, also diejenigen, die das System entwickeln und unter eigenem Namen bereitstellen. Sie ist eine Bauvorgabe: Das System soll so entworfen sein, dass die Information ankommt. Wer ein solches System nur einsetzt, ist Betreiber und hat andere Pflichten. Die Unterscheidung führt der Beitrag Wen die Kennzeichnungspflicht für KI-Texte trifft aus.
Die Ausnahme gehört dazu
Im Absatz steht außerdem eine Einschränkung, und ein Zitat ohne sie wäre abgeschnitten:
Der Maßstab ist also eine gedachte Person, die aufmerksam ist und sich auskennt. Für ein Chatfenster mit einem Roboterbild und der Aufschrift „Assistent“ lässt sich argumentieren, dass es offensichtlich ist. Für eine Stimme am Telefon, die klingt wie ein Mensch, wird dieselbe Argumentation schwer.
Damit dreht die Ausnahme sich gegen das eigentliche Ziel der Entwicklung. Je besser eine synthetische Stimme wird, desto weniger ist offensichtlich, was sie ist. Ein System, das an dieser Stelle gut arbeitet, verliert seine Ausnahme.
Wann die Ansage fällig ist
Der Zeitpunkt steht weiter unten im selben Artikel:
Der Wortlaut nennt den spätesten Zeitpunkt, die erste Interaktion. Für ein Telefonat folgt daraus die Ansage vor dem ersten inhaltlichen Satz, denn ab da läuft die Interaktion. Diese Übertragung auf den Kanal ist eine Auslegung dieser Seite, die Verordnung bleibt bei der allgemeinen Formulierung.
Wie sie auszusehen hat, sagt die Verordnung selbst nicht. Die Leitlinien der Europäischen Kommission werden konkreter und behandeln den Sprachkanal eigens, mit gesprochenen Ansagen zu Beginn und einer Wiederholung in langen Gesprächen. Ein Signalton allein genügt ihnen nicht. Diese Passagen stehen in einem Dokument, das nur als PDF vorliegt, deshalb steht hier keines ihrer Zitate; die Belegstelle ist die Randnummer 37 der Leitlinien (externe Seite, digital-strategy.ec.europa.eu).
Was das für den Bau bedeutet
Die Ansage am Anfang trifft auf einen Kanal, in dem der Anfang teuer ist. Was Kapitel 06 über die Ansage vor einer Wartezeit sagt, gilt hier sinngemäß: Ein Satz, der die Sache nicht voranbringt, verlängert das Warten.
Der Unterschied ist, dass dieser Satz gesetzlich verlangt wird. Damit wird aus einer Abwägung eine Vorgabe, und die Gestaltungsfrage verschiebt sich. Sie lautet jetzt, wie kurz die Ansage ausfallen kann.
Der zweite Schluss, den man beim Telefonieren zieht, betrifft die Stimme selbst: Wer so klingt, ist die Person, die so klingt. Dieser Schluss ist jünger unter Druck geraten als der erste, und die Anbieter gehen damit bemerkenswert offen um.
Die Zustimmung als Tonaufnahme
Voice Cloning heißt das Nachbilden einer Stimme aus Aufnahmen. Wie das technisch geht, steht in KI-Wissen, Kapitel 08. Wer es bei OpenAI benutzen will, liefert dafür zwei Aufnahmen, und eine davon ist die Zustimmung des Sprechers. Der Wortlaut steht auf Deutsch in der Dokumentation:
Der Satz muss gesprochen werden, und zwar genau so:
Daran hängt die Bauform. Die Zustimmung ist hier ein Prüfschritt im Ablauf, und wer sie falsch aufsagt, kommt nicht weiter. Damit wird aus einer rechtlichen Bedingung eine technische, und die lässt sich schwerer übergehen als ein Häkchen in einem Formular.
Beim Anbieter ElevenLabs steht daneben eine zweite Einschränkung:
Hier stehen zwei Zusagen: die Beschränkung auf die eigene Stimme und ein Nachweisverfahren dafür. Der Zusatz „for now“ sagt dabei am meisten: Diese Regel beruht auf einer Entscheidung des Anbieters und könnte jederzeit anders lauten.
Wer weiterlesen möchte, findet in demselben Hilfebereich die schärfere Aussage, dass auch mit Zustimmung keine fremde Stimme geklont werden darf. Sie steht in einem eingeklappten Abschnitt und ist deshalb hier nicht zitiert.
Der Umkehrschluss, den viele ziehen
Wenn eine Stimme sich nachbilden lässt, taugt sie dann noch als Ausweis? Die Frage ist alt, sie hat einen Namen, und es gibt seit Jahren einen Wettbewerb, der sie beantwortet.
ASV steht für Automatic Speaker Verification, also für die maschinelle Prüfung, ob eine Stimme zu einer hinterlegten Person gehört. Die Reihe ASVspoof misst, wie gut sich diese Prüfung täuschen lässt:
Die fünfte Auflage bedeutet, dass diese Frage lange vor den heutigen Sprachagenten aktuell war. Das Ergebnis fasst die Arbeit in einem Satz zusammen:
Beide Hälften zählen. Die Angriffe setzen den Grundsystemen erheblich zu, und die eingereichten Gegenmaßnahmen bessern deutlich nach. Das ist der Stand eines Wettlaufs, und ein Wettlauf hat kein Ende.
Genauere Zahlen stehen im Volltext der Arbeit, der als PDF vorliegt. Der Prüflauf dieser Seite kann darin nichts nachschlagen, deshalb steht hier keine. Für die Einordnung reicht die Richtung: Die Fälschbarkeit einer Stimme ist Gegenstand einer eigenen Forschungsreihe, und wer eine Stimme als alleinigen Ausweis benutzt, sollte das wissen.
Was daraus für eine Sprachanwendung folgt
Zwei Dinge, und sie zeigen in verschiedene Richtungen.
Auf der eigenen Seite ist die Stimme des Systems eine Gestaltungsfrage mit Rechtsfolgen. Die Sprachsynthese, englisch Text-to-Speech und abgekürzt TTS, bringt bei jedem Anbieter einen Satz fertiger Stimmen mit. Wer eine davon nimmt, hat die Frage der Zustimmung ausgelagert. Wer eine eigene nachbilden lässt, führt sie selbst und braucht die Aufnahme, von der oben die Rede war.
Auf der Seite des Anrufers ist die Stimme ein schwaches Erkennungsmerkmal geworden. Kapitel 02 beschreibt, was in einer Aufnahme über den Inhalt hinaus steckt, und die Diarisierung, also das Auseinanderhalten mehrerer Sprecher. Beides bleibt technisch nützlich. Als Nachweis, dass jemand die Person ist, für die er sich ausgibt, taugt es weniger als früher.
Für den Bau heißt das: Wo eine Auskunft davon abhängt, wer fragt, gehört ein zweiter Faktor dazu. Was das im Einzelnen ist, hängt an der Anwendung und liegt außerhalb dieses Kapitels.
Die Ansage am Gesprächsanfang richtet sich an einen Menschen. Daneben steht eine zweite Pflicht, die sich an Maschinen richtet, und sie trifft jede erzeugte Tonaufnahme.
Die Kennzeichnung, die niemand hört
Artikel 50 Absatz 2 verlangt von den Anbietern etwas anderes als Absatz 1:
Audio steht an erster Stelle der Aufzählung. Verlangt ist eine Kennzeichnung, die eine Maschine lesen kann, und dazu die Erkennbarkeit als erzeugter Inhalt. Der Absatz enthält im nächsten Satz eine Einschränkung, die den Aufwand ins Verhältnis setzt, und knüpft die technischen Anforderungen an das, was jeweils möglich ist. Zitiert wird sie hier nicht, weil ihr Wortlaut einen Gedankenstrich enthält, der auf dieser Seite ausgeschlossen ist.
Die Pflicht steht damit da, und die Frage ist, womit man sie erfüllt. Zwei Verfahren sind im Umlauf, und beide haben eine Grenze, die man kennen sollte, bevor man sich auf sie verlässt.
Erstes Verfahren, das Wasserzeichen
Google DeepMind betreibt eines unter dem Namen SynthID:
Das Zeichen liegt also im Inhalt selbst, unhörbar, und übersteht das Kopieren einer Datei. Zum Nachprüfen gibt es eine eigene Stelle:
Die Grenze steht auf derselben Seite. Der Anbieter beschreibt die Reichweite als seine eigenen Endkundenprodukte. Ein Wasserzeichen ist damit eine Aussage über die Werkstatt, in der etwas entstanden ist. Wer einen Sprachagenten bei einem anderen Anbieter baut, hat es nicht, und wer eine Aufnahme prüft und kein Zeichen findet, weiß daraus wenig: Sie kann von einem Menschen stammen oder von einem Werkzeug, das keines setzt.
Das ist die übliche Falle bei Nachweisverfahren. Ein gefundenes Zeichen ist ein Befund. Ein fehlendes Zeichen ist keiner.
Zweites Verfahren, der Herkunftsnachweis
Der andere Weg hängt die Auskunft an die Datei. Die Spezifikation der Initiative C2PA nennt die Trägerformate:
Ton ist ausdrücklich dabei. Was in einem solchen Nachweis steht, beschreibt die Spezifikation so:
Entstehung, Bearbeitungsschritte, Aufnahmegerät. Das ist mehr als ein Wasserzeichen hergibt, und es hat eine andere Grenze: Der Nachweis beschreibt den Weg einer Datei. Über die Stimme darin sagt er nichts. Eine Aufnahme mit lückenlosem Herkunftsnachweis kann eine perfekt nachgebildete Stimme enthalten, und der Nachweis bestätigt dann wahrheitsgemäß, womit sie erzeugt wurde.
Für den laufenden Sprachdialog kommt eine praktische Schwierigkeit dazu. Beide Verfahren setzen an einer Datei an. Ein Telefongespräch ist ein Strom, der Kapitel 04 zufolge in acht Bit je Abtastung durch das Netz geht und unterwegs umgerechnet wird. Was davon ein Wasserzeichen übersteht, ist eine eigene Frage, und die geprüften Quellen beantworten sie nicht.
Was hier offen bleibt
Zwei Lücken, und beide sind Aussagen über die Recherche zu diesem Kapitel.
Zur Wirksamkeit im Telefonnetz gibt es in den geprüften Quellen keine Messung. Ob ein Wasserzeichen die Umrechnung auf ein Telefonformat übersteht, steht weder bei den Anbietern noch in der Spezifikation.
Zur Frage, wessen Stimme ein Sprachagent benutzen darf, findet sich keine zitierbare Herstelleraussage. Die Nutzungsrichtlinien, in denen so etwas stünde, antworten auf einen Abruf mit einer Fehlermeldung und sind deshalb in der Quellensammlung dieser Seite nicht geführt. Was die beiden Anbieter aus der vorigen Tiefe für nachgebildete Stimmen verlangen, ist belegt; ob dieselbe Regel für die vorgefertigten Stimmen eines Sprachagenten gilt, steht hier offen.
Quellen
7 Einträge, davon 1 Schlüsselarbeitalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
digital-strategy.ec.europa.eugeprüft 24.09.2026
Die Auslegung der Kommission zu Artikel 50, angenommen am 20.07.2026, zwölf Tage vor der Geltung. 51 Seiten mit Randnummern und praktischen Beispielen in beide Richtungen: was erfasst ist und was nicht. Nicht bindend, aber der Maßstab, an dem die Marktaufsicht prüft. Die Adresse zeigt auf die Seite mit dem Dokument, nicht auf die PDF-Datei selbst, damit der Prüflauf lesbaren Text vorfindet.
Originalarbeiterreichbar
Verordnung (EU) 2024/1689 über künstliche Intelligenz (externe Seite, eur-lex.europa.eu)
eur-lex.europa.eugeprüft 24.09.2026
Der Rechtstext selbst, veröffentlicht am 12.07.2024 und in Kraft getreten am 01.08.2024. Er ordnet Anwendungen nach Risiko und legt die Pflichten je Stufe fest. Die Anwendbarkeit beginnt gestaffelt, nicht mit dem Inkrafttreten. Die Adresse zeigt seit dem 29.07.2026 auf die deutsche Fassung: Die Zitate unten stehen im Text so, wie er hier zitiert wird, und die Fassung ohne Sprachangabe liefert die englische.
Dokumentationerreichbar
OpenAI, Custom voices (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Seite zum Nachbilden einer eigenen Stimme aus einer Tonprobe, bis zum 11.09.2026 Teil der Seite zur Sprachausgabe (openai-tts-doku), seitdem ausgelagert. Sie führt den gesprochenen Zustimmungssatz als Prüfschritt, die Regel, dass die Aufnahme nur eine von mehreren vorgegebenen Phrasen enthalten darf, und die Obergrenze von zwanzig selbst erzeugten Stimmen je Organisation.
Dokumentationerreichbar
ElevenLabs, Professional voice cloning (externe Seite, elevenlabs.io)
elevenlabs.iogeprüft 24.09.2026
Wie eine Stimme nachgebildet wird, beim Anbieter selbst beschrieben. Zwei Bedingungen stehen im Fließtext: Erlaubt ist nur die eigene Stimme, und vor der Freischaltung steht ein Nachweis, dass sie einem gehört.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Die fünfte Auflage eines Wettbewerbs, in dem gemessen wird, wie gut sich die automatische Sprecherverifikation täuschen lässt und wie gut die Gegenmaßnahmen halten. Das Ergebnis der Auflage ist der Befund, der zählt: Die Angriffe setzen den Prüfsystemen erheblich zu, und die eingereichten Verfahren verbessern die Lage deutlich.
Dokumentationerreichbar
Google DeepMind, SynthID (externe Seite, deepmind.google)
deepmind.googlegeprüft 24.09.2026
Ein Wasserzeichen, das beim Erzeugen in den Inhalt selbst eingebettet wird, für Bild, Ton, Text und Video, dazu ein Portal zum Nachprüfen. Die Reichweite ist dabei enger, als der Name vermuten lässt: Der Anbieter beschreibt sie als seine eigenen Endkundenprodukte. Über den Sprachagenten eines Dritten sagt das Verfahren nichts.
Originalarbeiterreichbar
C2PA, Content Credentials Specification (externe Seite, spec.c2pa.org)
spec.c2pa.orggeprüft 24.09.2026
Die offene Spezifikation für den Herkunftsnachweis an einer Mediendatei, mit Ton ausdrücklich unter den Trägerformaten. Der Nachweis hängt an der Datei und beschreibt, womit sie erzeugt und was daran verändert wurde. Er sagt damit etwas über den Weg einer Aufnahme und nichts über die Stimme darin. Die Spezifikation benennt zugleich die Schwäche dieses Wegs: Ein Bild kann von seinem Nachweis getrennt werden, wenn die Metadaten verlorengehen.