GrundlagenConversational AIKapitel 05von 12 im Pfad
Wissen anbinden
Ein Sprachagent, der aus eigenen Unterlagen antwortet, macht dasselbe wie im Chatfenster: Er sucht, bevor er antwortet. Wie das funktioniert, steht in Agenten und Harness, Kapitel 03. Was sich ändert, ist eine einzige Sache, und sie ändert alles Weitere: Man hört ihm beim Suchen zu.
Die vier Schritte, mit einer Uhr daneben
Im Chatfenster laufen sie unsichtbar ab. Die Frage geht hinein, die Suche läuft, die Fundstellen werden an die Frage gehängt, das Modell antwortet. Wer davorsitzt, sieht drei Sekunden lang einen blinkenden Cursor.
Im Gespräch ist derselbe Ablauf eine Stille. Und Stille bedeutet im Gespräch etwas: Nach etwa einer Sekunde fragen Menschen nach, ob die Gegenseite noch da ist.
Daraus folgt die Regel für den Rest dieses Kapitels: Jeder Schritt zwischen Frage und Antwort muss sich rechtfertigen. Im Chatfenster kostet ein zusätzlicher Suchdurchgang Rechenzeit. Im Gespräch kostet er Glaubwürdigkeit.
Was das System sagt, während es sucht
Die einfachste Antwort darauf ist, die Stille zu füllen. Der Hersteller hat dafür einen Namen und eine Empfehlung:
Was dabei zu sagen ist und was besser nicht, steht in Kapitel 06, denn es gilt für jede Art von Arbeit im Hintergrund. Für dieses Kapitel zählt der mittlere Teil des Satzes: looks something up. Das Nachschlagen ist als Wartefall ausdrücklich mitgemeint.
Was passiert, wenn nichts gefunden wird
Im Chatfenster sieht man eine leere Trefferliste und weiß Bescheid. Im Gespräch gibt es keine Liste. Der Unterschied zwischen „ich habe nichts gefunden“ und „dazu gibt es nichts“ muss also gesagt werden, und zwar von einem System, dem beides gleich aussieht, solange ihm niemand beibringt, die leere Suche zu melden.
Das ist derselbe Fall wie in Grundkurs, Kapitel 07, nur ohne die Möglichkeit, es nachzulesen.
Die Frage, an der sich in einer Sprachanwendung alles entscheidet: Wie viel Prüfung passt zwischen die Frage und den ersten Ton der Antwort.
Der Anbieter beziffert den Preis selbst
In der Voreinstellung antwortet das Modell, sobald die Erkennung das Ende eines Beitrags meldet. Wer dazwischen etwas prüfen will, schaltet das ab. Die Dokumentation sagt geradeheraus, was das kostet: Sie nennt drei Fälle, für die sich der Griff lohnt, Moderation, Prüfung der Eingabe und das Nachschlagen, und schreibt dazu, man bezahle dafür mit
Das ist eine ungewöhnlich offene Stelle in einer Herstellerdokumentation. Sie gibt die Kontrolle nicht umsonst her, und sie stellt beide Größen nebeneinander, zwischen denen zu wählen ist.
Was ein zweiter Suchdurchgang wert ist
Agenten und Harness, Kapitel 03 beschreibt eine Stufe, die die Trefferqualität deutlich hebt: Man holt weit mehr Stellen als gebraucht und lässt ein zweites Modell Frage und Text gemeinsam bewerten. Die Zahlen dazu stehen dort, ebenso der Hinweis auf den hohen Rechenaufwand.
Was dort nicht steht, weil es dort nicht hingehört, ist die Frage nach der Uhr. Ein zweiter Durchgang über hundert Textstellen ist ein Modellaufruf, und ein Modellaufruf dauert. In einer Anwendung, in der die Antwort nach etwa einer Sekunde anfangen soll, konkurriert diese Stufe unmittelbar mit dem Sprechen.
Damit steht die Entscheidung anders als im Chatfenster. Dort lautet sie: bessere Treffer gegen Rechenkosten. Hier lautet sie: bessere Treffer gegen eine Pause, die der Anrufer hört.
Drei Wege, die Rechnung zu ändern
Wer beides will, verschiebt die Arbeit, statt sie wegzulassen.
Vorher suchen. Steht die wahrscheinliche Frage früh genug fest, etwa nach dem ersten Satz eines Anrufers, lässt sich die Suche anstoßen, bevor er ausgeredet hat. Der Preis sind Suchläufe, die niemand braucht.
Weniger holen. Fünf Stellen statt zwanzig kürzen jeden nachgelagerten Schritt. Was dabei verlorengeht, steht in Agenten und Harness, Kapitel 03 unter der Frage, wie ein Abschnitt zugeschnitten wird.
Während des Sprechens weitersuchen. Die Antwort fängt mit dem an, was sicher ist, und die genaue Auskunft kommt nach. Das setzt voraus, dass die Anwendung eine laufende Ausgabe ergänzen kann, und führt geradewegs zu Kapitel 06.
Alle drei sind Bauentscheidungen. Einen Schalter dafür gibt es in keiner Schnittstelle. Sie stehen hier auch ohne Messwerte, weil es dazu keine Herstellerangabe gibt, die man ohne eigene Erhebung übernehmen könnte.
Zwei Dinge sind an einer gesprochenen Auskunft anders, und beide haben mit Geschwindigkeit nichts zu tun: die Quellenangabe und die Frage, wer mithört.
Eine Quelle, die niemand sehen kann
Belegte Auskünfte sind der Grund, warum man überhaupt sucht, statt das Modell antworten zu lassen. Der Anbieter nennt das als eigenen Zweck:
Cite verifiable sources. Auf einer Seite ist das eine Fußnote, die man anklicken kann oder auch nicht. Im Gespräch entfällt diese Wahl: Was gesagt wird, hört jeder, und was ungesagt bleibt, existiert nicht.
Daraus wird eine Entscheidung, die man auf einer Webseite nie treffen muss. Eine vollständige Quellenangabe nach jedem Satz macht die Auskunft unbrauchbar. Gar keine macht sie unprüfbar. Drei Formen, die dazwischen liegen:
| Form | Was sie leistet |
|---|---|
| Herkunft im Satz | „Laut der Hausordnung von 2024“, kostet fünf Wörter |
| Angebot am Ende | „Soll ich Ihnen die Fundstelle nennen?“, kostet einen Zug |
| Nachlieferung | Verweis per Nachricht oder Mail, verlässt den Kanal |
Die dritte Form ist die einzige, die eine anklickbare Adresse liefert, und sie setzt einen zweiten Kanal voraus. Am Telefon ist das eine Rufnummer, siehe Kapitel 04.
Diese Aufstellung ist eine eigene Ordnung und steht so in keiner Quelle. Sie nennt deshalb keine Zahlen, sie sortiert nur, was möglich ist.
Wer darf hören, was gefunden wird
Agenten und Harness, Kapitel 03 beschreibt, wie eine Suche auf das eingeschränkt wird, was jemand sehen darf, und hält die Grenze des Verfahrens fest: Der Filter bildet eine Rechteprüfung nach, er ist keine.
Im Gespräch kommt eine zweite Frage dazu, die es am Bildschirm nicht gibt. Ein Bildschirm zeigt einer Person etwas. Ein Lautsprecher zeigt es allen im Raum. Wer eine Auskunft aus Personalunterlagen vorliest, hat die Zugriffsfrage zwar richtig beantwortet und trotzdem ein Problem, sobald jemand danebensteht.
Die Sprechertrennung wäre der technische Ansatz dafür. Sie steht in Kapitel 03 als benannte Lücke, weil ein Beleg dafür fehlt, wie zuverlässig sie arbeitet. Was bleibt, ist eine Bauentscheidung ohne Messung: welche Auskünfte ein Sprachkanal überhaupt geben darf.
Warum ein Fehler im Kontext hier schwerer wiegt
Ein Modell liest die Mitte eines langen Kontextes schlechter als Anfang und Ende. Das gilt am Bildschirm genauso, und Grundkurs, Kapitel 02 beschreibt es.
Der Unterschied liegt in der Korrekturmöglichkeit. Wer eine falsche Antwort auf dem Bildschirm liest, hat die zitierte Stelle daneben und merkt es. Wer sie hört, hat den Satz und sonst nichts. Die Sorgfalt beim Zusammenstellen des Kontextes ist im Sprachkanal deshalb keine Feinheit. Sie ist die letzte Stelle, an der überhaupt jemand etwas merken kann.
Quellen
3 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Dokumentationerreichbar
OpenAI, Using realtime models (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Anleitung zum Anweisen eines Sprachmodells, das rohen Ton verarbeitet. Sie belegt nebenbei, was ein solches Modell auseinanderhalten kann: Stille, Hintergrundgeräusch, Wartemusik, Fernsehton und ein Gespräch, das jemand anderem gilt. Dieselbe Seite führt die Ansage vor einer Wartezeit als eigenes Bauteil mit Namen und benennt ihre Kehrseite: Schlecht gemacht erhöht sie die gefühlte Wartezeit. Die Anweisungen stehen dort für zwei Modellfassungen nebeneinander und lauten verschieden; zitiert ist hier die neuere.
Dokumentationerreichbar
OpenAI, Realtime conversations (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Beschreibung dessen, was in einer laufenden Sprachsitzung passiert, und der Ort, an dem der Anbieter den Preis einer Prüfung vor der Antwort selbst benennt: Wer die automatische Antwort abschaltet, um Eingaben zu moderieren, zu prüfen oder erst etwas nachzuschlagen, bezahlt das mit Wartezeit. Dieselbe Seite nennt die Obergrenze einer Sitzung und beschreibt den Ablauf eines Tool Calls.
Dokumentationerreichbar
Google, Grounding with Google Search (externe Seite, ai.google.dev)
ai.google.devgeprüft 24.09.2026
Googles Dokumentation zur Verankerung von Antworten in Suchergebnissen. Sie benennt den Knowledge Cutoff ausdrücklich als das, was damit überschritten wird, und beschreibt den ganzen Ablauf aus Suchen, Verarbeiten und Belegen als Sache der Umgebung.