Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenConversational AIKapitel 01von 12 im Pfad

Was Conversational AI ist

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Der Begriff sammelt Systeme, die man bedient, indem man mit ihnen redet. Das Chatfenster gehört dazu, die Assistenz im Auto, und die Stimme in der Warteschleife, die auf einen ganzen Satz antwortet statt auf eine Taste.

Ein Kern, zwei Enden

So ist die verbreitete Bauform gebaut: In der Mitte ein Sprachmodell, das Text bekommt und Text zurückgibt. Wer tippt, schickt seinen Text direkt hinein. Wer spricht, braucht an beiden Enden einen Übersetzer, vorn einen von Ton nach Text und hinten einen zurück.

Dieses Kapitel beschreibt durchweg diese Kette, weil sich an ihr die Begriffe auseinanderhalten lassen. Daneben steht eine zweite Bauform, in der ein einziges Modell den Ton unmittelbar verarbeitet; sie kommt in Kapitel 02 an die Reihe, zusammen mit dem, was jede der beiden kostet.

Dass die Bedienung selbst zu Text wurde, ist keine alte Sache. Die Arbeit, die 2020 GPT-3 vorstellte, beschreibt es als das Neue an diesem Modell:

For all tasks, GPT-3 is applied without any gradient updates or fine-tuning, with tasks and few-shot demonstrations specified purely via text interaction with the model. (externe Seite, arxiv.org)

Vorher war die Bedienung eines Sprachsystems eine Sache für Entwickler. Seither ist sie der Text selbst, und deshalb sieht ein Chatfenster aus wie ein Chatfenster.

Die drei Stufen und ihre Namen

Spracherkennung, englisch Speech-to-Text, abgekürzt STT. Sie macht aus Ton Text. Was sie dabei verliert und wie gut sie inzwischen ist, steht im nächsten Kapitel.

Das Sprachmodell. Es bekommt den Text und erzeugt die Antwort, genau wie im Chatfenster.

Sprachsynthese, englisch Text-to-Speech, abgekürzt TTS. Sie macht aus Text Ton. Auch sie arbeitet in Stücken, damit die Antwort anfangen kann, bevor sie fertig ist:

The Speech API provides support for realtime audio streaming using chunk transfer encoding. This means the audio can be played before the full file is generated and made accessible. (externe Seite, developers.openai.com)

Wer die Namen einmal auseinanderhält, liest jede Produktbeschreibung anders. Wie die beiden Bauteile innen arbeiten, steht in KI-Wissen, Kapitel 07 und KI-Wissen, Kapitel 08. STT und TTS stehen dort als Bausteine, die sich einzeln austauschen lassen, solange die Bauform das hergibt. Welche zwei es davon gibt, steht in Kapitel 02.

Wo Reden aufhört und Handeln anfängt

Ein System, das Fragen zur Bestellung beantwortet, und eines, das die Bestellung storniert, klingen im Gespräch gleich. Der Unterschied liegt am Ende: Beim einen entsteht ein Satz, beim anderen eine Buchung.

Damit ist auch gesagt, worin er nicht liegt. Die Stimme macht aus einem Auskunftssystem keinen Agenten, und ein Tastaturchat kann sehr wohl einer sein. Die Linie verläuft bei der Frage, wer die Reihenfolge der Schritte bestimmt, und die ist in Agenten und Harness, Kapitel 01 gezogen.

Für dieses Kapitel reicht die Staffelung:

Was es tutWomit man es baut
antwortet auf FragenModell, Anweisung
antwortet aus eigenen Unterlagendazu eine Suche, siehe Agenten und Harness, Kapitel 03
löst etwas ausdazu Tools, siehe Agenten und Harness, Kapitel 02
entscheidet die Reihenfolge selbstein Agent, siehe Agenten und Harness, Kapitel 01

Jede Zeile setzt die darüber voraus. Der Sprung, der zählt, liegt zwischen Zeile zwei und drei: Ab dort kann etwas passieren, das sich nicht durch Nachfragen zurücknehmen lässt.

Was die beiden mittleren Zeilen im Gespräch kosten, steht in Kapitel 05 und Kapitel 06.

Warum die Zeit hier zählt

Ein Chatfenster darf drei Sekunden überlegen. Der Cursor blinkt, das ist eine bekannte Form des Wartens, und wer die Antwort dann bekommt, empfindet nichts Besonderes dabei.

Im Gespräch ist dieselbe Pause eine Störung. Nach etwa einer Sekunde Stille fragen Menschen nach, ob die Gegenseite noch da ist. Das gilt am Telefon seit Jahrzehnten und ändert sich nicht dadurch, dass am anderen Ende eine Maschine sitzt. Was dieser Kanal sonst noch mitbringt, steht in Kapitel 04.

Daraus folgt fast alles, was diesen Bereich von der getippten Anwendung unterscheidet: Die Erkennung darf nicht auf das Satzende warten, die Antwort muss anfangen, bevor sie fertig gedacht ist, und jede Suche unterwegs kostet Zeit, die hörbar ist.

Wer entscheidet, wann jemand zu Ende geredet hat, und was passiert, wenn mittendrin jemand dazwischenredet: Das nimmt sich Kapitel 03 vor.

Quellen

5 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Originalarbeiterreichbar

    Language Models are Few-Shot Learners (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    GPT-3, eingereicht am 28.05.2020. Zeigt, dass ein ausreichend großes Modell Aufgaben löst, für die es nie eigens trainiert wurde, wenn man ihm im Text ein paar Beispiele vorlegt. Das ist der Grund, warum Prompting überhaupt funktioniert. Die Zusammenfassung beschreibt außerdem, was vorher galt: Ein Sprachverarbeitungssystem brauchte für jede Aufgabe eigens gesammelte Beispiele, Tausende bis Zehntausende.

    Archivfassung (externe Seite, web.archive.org)

  • Dokumentationerreichbar

    OpenAI, Text to speech (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Seite zur Sprachausgabe, mit zwei Angaben, die für ein Gespräch zählen. Der Ton kommt stückweise und lässt sich abspielen, bevor die Datei fertig ist; ohne das käme die Antwort erst nach der letzten Silbe. Und die Stimme wird über eine Anweisung in Prosa geführt, mit einer Liste dessen, was sich damit erreichen lässt: Akzent, Gefühlsspanne, Betonung, Nachahmung, Tempo, Klangfarbe, Flüstern.

  • Dokumentationerreichbar

    Rasa, Architecture Overview (externe Seite, legacy-docs-oss.rasa.com)

    legacy-docs-oss.rasa.comgeprüft 24.09.2026

    Der Bauplan eines Dialogsystems aus der Zeit vor den Sprachmodellen, in zwei getrennten Stufen: eine für das Verstehen der Äußerung, eine für die Entscheidung über den nächsten Schritt. Beleg dafür, dass die beiden mittleren Stufen der Kette einmal eigene Bauteile mit eigenen Namen waren. In der Adresse steht das Wort Legacy, der Anbieter führt die Seite als Altbestand, deshalb liegt eine Archivfassung dabei.

    Archivfassung (externe Seite, web.archive.org)

  • Dokumentationerreichbar

    Rasa, NLU Components (externe Seite, rasa.com)

    rasa.comgeprüft 24.09.2026

    Die Bauteilliste der Verstehensstufe, und damit die Erklärung zweier Begriffe, die in jeder Beschreibung eines Dialogsystems vorkommen: Die Absicht ordnet die Äußerung einer von mehreren vorher festgelegten Klassen zu, die Merkmalserkennung zieht Namen, Orte und Zahlen heraus. Eine feste Liste von Absichten ist der Unterschied zum Sprachmodell, das keine braucht.

  • Dokumentationerreichbar

    Rasa, NLG Servers (externe Seite, legacy-docs-oss.rasa.com)

    legacy-docs-oss.rasa.comgeprüft 24.09.2026

    Der Beleg dafür, dass die Formulierungsstufe eines Dialogsystems ein eigener Dienst sein konnte, ansprechbar über eine Schnittstelle und austauschbar, ohne die Dialogführung anzufassen. Die Seite zeigt zugleich, was an dieser Stelle übergeben wurde: der Gesprächszustand mit seinen Feldern, der erkannten Absicht und deren Zahlenwert. Legacy-Adresse, deshalb mit Archivfassung.

    Archivfassung (externe Seite, web.archive.org)

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.