Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenConversational AIKapitel 09von 12 im Pfad

Was die Stimme noch beweist

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Wer ans Telefon geht, zieht zwei Schlüsse, ohne darüber nachzudenken. Am anderen Ende ist ein Mensch. Und wenn die Stimme bekannt klingt, ist es die Person, zu der sie gehört. Beide Schlüsse gelten nicht mehr.

Für den ersten gibt es seit Kurzem eine Rechtspflicht.

Der Satz, um den es geht

Artikel 50 Absatz 1 der KI-Verordnung ist seit dem 02.08.2026 anwendbar. Er lautet:

Die Anbieter stellen sicher, dass KI-Systeme, die für die direkte Interaktion mit natürlichen Personen bestimmt sind, so konzipiert und entwickelt werden, dass die betreffenden natürlichen Personen informiert werden, dass sie mit einem KI-System interagieren (externe Seite, eur-lex.europa.eu)

„Direkte Interaktion mit natürlichen Personen“ beschreibt genau das, wovon dieser Lernpfad handelt. Ein Sprachagent am Telefon ist der Musterfall, und ein Chatfenster auf einer Webseite ebenso.

Die Pflicht trifft die Anbieter, also diejenigen, die das System entwickeln und unter eigenem Namen bereitstellen. Sie ist eine Bauvorgabe: Das System soll so entworfen sein, dass die Information ankommt. Wer ein solches System nur einsetzt, ist Betreiber und hat andere Pflichten. Die Unterscheidung führt der Beitrag Wen die Kennzeichnungspflicht für KI-Texte trifft aus.

Die Ausnahme gehört dazu

Im Absatz steht außerdem eine Einschränkung, und ein Zitat ohne sie wäre abgeschnitten:

es sei denn, dies ist aus Sicht einer angemessen informierten, aufmerksamen und verständigen natürlichen Person aufgrund der Umstände und des Kontexts der Nutzung offensichtlich (externe Seite, eur-lex.europa.eu)

Der Maßstab ist also eine gedachte Person, die aufmerksam ist und sich auskennt. Für ein Chatfenster mit einem Roboterbild und der Aufschrift „Assistent“ lässt sich argumentieren, dass es offensichtlich ist. Für eine Stimme am Telefon, die klingt wie ein Mensch, wird dieselbe Argumentation schwer.

Damit dreht die Ausnahme sich gegen das eigentliche Ziel der Entwicklung. Je besser eine synthetische Stimme wird, desto weniger ist offensichtlich, was sie ist. Ein System, das an dieser Stelle gut arbeitet, verliert seine Ausnahme.

Wann die Ansage fällig ist

Der Zeitpunkt steht weiter unten im selben Artikel:

Die in den Absätzen 1 bis 4 genannten Informationen werden den betreffenden natürlichen Personen spätestens zum Zeitpunkt der ersten Interaktion oder Aussetzung in klarer und eindeutiger Weise bereitgestellt. (externe Seite, eur-lex.europa.eu)

Der Wortlaut nennt den spätesten Zeitpunkt, die erste Interaktion. Für ein Telefonat folgt daraus die Ansage vor dem ersten inhaltlichen Satz, denn ab da läuft die Interaktion. Diese Übertragung auf den Kanal ist eine Auslegung dieser Seite, die Verordnung bleibt bei der allgemeinen Formulierung.

Wie sie auszusehen hat, sagt die Verordnung selbst nicht. Die Leitlinien der Europäischen Kommission werden konkreter und behandeln den Sprachkanal eigens, mit gesprochenen Ansagen zu Beginn und einer Wiederholung in langen Gesprächen. Ein Signalton allein genügt ihnen nicht. Diese Passagen stehen in einem Dokument, das nur als PDF vorliegt, deshalb steht hier keines ihrer Zitate; die Belegstelle ist die Randnummer 37 der Leitlinien (externe Seite, digital-strategy.ec.europa.eu).

Was das für den Bau bedeutet

Die Ansage am Anfang trifft auf einen Kanal, in dem der Anfang teuer ist. Was Kapitel 06 über die Ansage vor einer Wartezeit sagt, gilt hier sinngemäß: Ein Satz, der die Sache nicht voranbringt, verlängert das Warten.

Der Unterschied ist, dass dieser Satz gesetzlich verlangt wird. Damit wird aus einer Abwägung eine Vorgabe, und die Gestaltungsfrage verschiebt sich. Sie lautet jetzt, wie kurz die Ansage ausfallen kann.

Quellen

7 Einträge, davon 1 Schlüsselarbeitalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    Guidelines on the implementation of the transparency obligations for certain AI systems under Article 50 of the AI Act (externe Seite, digital-strategy.ec.europa.eu)

    digital-strategy.ec.europa.eugeprüft 24.09.2026

    Die Auslegung der Kommission zu Artikel 50, angenommen am 20.07.2026, zwölf Tage vor der Geltung. 51 Seiten mit Randnummern und praktischen Beispielen in beide Richtungen: was erfasst ist und was nicht. Nicht bindend, aber der Maßstab, an dem die Marktaufsicht prüft. Die Adresse zeigt auf die Seite mit dem Dokument, nicht auf die PDF-Datei selbst, damit der Prüflauf lesbaren Text vorfindet.

  • Originalarbeiterreichbar

    Verordnung (EU) 2024/1689 über künstliche Intelligenz (externe Seite, eur-lex.europa.eu)

    eur-lex.europa.eugeprüft 24.09.2026

    Der Rechtstext selbst, veröffentlicht am 12.07.2024 und in Kraft getreten am 01.08.2024. Er ordnet Anwendungen nach Risiko und legt die Pflichten je Stufe fest. Die Anwendbarkeit beginnt gestaffelt, nicht mit dem Inkrafttreten. Die Adresse zeigt seit dem 29.07.2026 auf die deutsche Fassung: Die Zitate unten stehen im Text so, wie er hier zitiert wird, und die Fassung ohne Sprachangabe liefert die englische.

  • Dokumentationerreichbar

    OpenAI, Custom voices (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Seite zum Nachbilden einer eigenen Stimme aus einer Tonprobe, bis zum 11.09.2026 Teil der Seite zur Sprachausgabe (openai-tts-doku), seitdem ausgelagert. Sie führt den gesprochenen Zustimmungssatz als Prüfschritt, die Regel, dass die Aufnahme nur eine von mehreren vorgegebenen Phrasen enthalten darf, und die Obergrenze von zwanzig selbst erzeugten Stimmen je Organisation.

  • Dokumentationerreichbar

    ElevenLabs, Professional voice cloning (externe Seite, elevenlabs.io)

    elevenlabs.iogeprüft 24.09.2026

    Wie eine Stimme nachgebildet wird, beim Anbieter selbst beschrieben. Zwei Bedingungen stehen im Fließtext: Erlaubt ist nur die eigene Stimme, und vor der Freischaltung steht ein Nachweis, dass sie einem gehört.

  • Originalarbeiterreichbar

    ASVspoof 5, Crowdsourced Speech Data, Deepfakes, and Adversarial Attacks at Scale (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die fünfte Auflage eines Wettbewerbs, in dem gemessen wird, wie gut sich die automatische Sprecherverifikation täuschen lässt und wie gut die Gegenmaßnahmen halten. Das Ergebnis der Auflage ist der Befund, der zählt: Die Angriffe setzen den Prüfsystemen erheblich zu, und die eingereichten Verfahren verbessern die Lage deutlich.

  • Dokumentationerreichbar

    Google DeepMind, SynthID (externe Seite, deepmind.google)

    deepmind.googlegeprüft 24.09.2026

    Ein Wasserzeichen, das beim Erzeugen in den Inhalt selbst eingebettet wird, für Bild, Ton, Text und Video, dazu ein Portal zum Nachprüfen. Die Reichweite ist dabei enger, als der Name vermuten lässt: Der Anbieter beschreibt sie als seine eigenen Endkundenprodukte. Über den Sprachagenten eines Dritten sagt das Verfahren nichts.

  • Originalarbeiterreichbar

    C2PA, Content Credentials Specification (externe Seite, spec.c2pa.org)

    spec.c2pa.orggeprüft 24.09.2026

    Die offene Spezifikation für den Herkunftsnachweis an einer Mediendatei, mit Ton ausdrücklich unter den Trägerformaten. Der Nachweis hängt an der Datei und beschreibt, womit sie erzeugt und was daran verändert wurde. Er sagt damit etwas über den Weg einer Aufnahme und nichts über die Stimme darin. Die Spezifikation benennt zugleich die Schwäche dieses Wegs: Ein Bild kann von seinem Nachweis getrennt werden, wenn die Metadaten verlorengehen.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.