GrundlagenConversational AIKapitel 06von 12 im Pfad
Tools anbinden
Ein Sprachagent, der etwas auslöst, ruft dafür ein Tool auf. Die Mechanik dahinter steht in Agenten und Harness, Kapitel 02 und Grundkurs, Kapitel 09. Hier geht es um die eine Sekunde, in der niemand etwas sagt.
Der Aufruf hält das Gespräch an
In der Voreinstellung gehört das zur Bauart. Die Dokumentation von Google sagt es für die Sprachschnittstelle ausdrücklich:
Bei OpenAI steht dieselbe Reihenfolge in der Beschreibung des Ablaufs. Das Modell legt die Argumente in den Gesprächsverlauf, und dann:
Danach schickt die Anwendung das Ergebnis zurück und bittet um eine Antwort. Alles daran geht der Reihe nach.
Im Chatfenster ist das unauffällig. Wer eine Buchung anstößt, sieht einen Ladebalken. Im Gespräch entsteht an derselben Stelle Stille, und je nachdem, was das Tool tut, dauert sie eine halbe Sekunde oder zehn.
Die Ansage davor
Der einfachste Griff ist, die Wartezeit anzukündigen. Der Hersteller führt das als eigenes Bauteil und nennt es Preamble, also Vorspann. Beide Seiten davon stehen in einem Satz:
Der zweite Satz ist der wichtigere. Eine Ansage, die nichts sagt, macht das Warten länger, weil sie es benennt, ohne es zu verkürzen. Die Dokumentation wird deshalb konkret. Angesagt wird, wenn
you are about to call a tool that may take noticeable time (externe Seite, developers.openai.com),
wenn Unterlagen geprüft werden, oder wenn eine Übergabe ansteht. Weggelassen wird die Ansage, wenn die Antwort ohnehin sofort kommt, wenn jemand nur bestätigt oder widerspricht, und wenn der Aufruf schnell ist.
Auch die Formulierungen stehen dort. Zu vermeiden sind „Let me think…“ und „One moment while I process that…“. Empfohlen sind Sätze, die die Handlung nennen: „I’ll check that order now.“ Der Unterschied liegt im Bezug. Das eine beschreibt den Zustand der Maschine, das andere die Sache, um die es geht.
Was sich dadurch nicht ändert
Die Kosten aus Agenten und Harness, Kapitel 02 gelten weiter. Im Normalfall steht jede Tool-Beschreibung in jeder Anfrage im Kontextfenster, und fünf Server mit je acht Tools sind vierzig Beschreibungen. Am Sprachkanal ändert das nichts. Was dazukommt, ist eine zweite Rechnung in einer zweiten Währung.
Es gibt einen Weg, das Gespräch während eines Aufrufs weiterlaufen zu lassen. Er kostet etwas, und er ist noch nicht überall zu haben.
Der nicht blockierende Aufruf
Google führt für die Live-Schnittstelle eine Einstellung, mit der ein Tool im Hintergrund arbeitet, während das Gespräch weitergeht. Die Voreinstellung bleibt die andere, und die Dokumentation sagt das im selben Absatz.
Was dabei zu entscheiden ist, verschiebt sich damit von der Technik in die Anwendung. Ein Ergebnis, das eintrifft, während jemand redet, ist eine Aufgabe für sich: Es kann veraltet sein, es kann zu einer Frage gehören, die inzwischen zurückgezogen wurde, und es kommt mitten in einen Satz.
seitlich verschiebbar
eigene Darstellung, Stand 07.08.2026
Die Einschränkung steht unter der Einstellung
An dieser Stelle lohnt es sich, die Dokumentation zu Ende zu lesen. Unter der Beschreibung des nicht blockierenden Aufrufs steht:
Das ist die neueste Fassung des Live-Modells. Wer die Bauform wählt, weil sie in der Dokumentation steht, und dann das aktuellste Modell nimmt, bekommt das Verhalten nicht. Der Satz steht für eine ganze Klasse: Eine Herstellerdokumentation belegt, dass es eine Fähigkeit gibt. Ob das Modell davor sie hat, ist eine zweite Frage.
Was das für die Ansage bedeutet
Wenn das Gespräch während des Aufrufs weiterläuft, wird die Ansage trotzdem gebraucht. Sie ändert nur ihre Aufgabe. Vorher überbrückte sie eine Stille, jetzt kündigt sie an, dass gleich etwas nachkommt, das zum vorherigen Thema gehört.
Aus einem Leitfaden für ein Textmodell ist dieselbe Regel notiert, und sie liest sich für den Sprachfall unverändert:
States the first step. Gemeint ist der erste Handgriff. Wer sagt, was er als Nächstes tut, hat eine Ansage gemacht, die auch dann noch stimmt, wenn der Rest anders läuft.
Die Spezifikation, auf der die meisten Tool-Anbindungen stehen, macht eine Vorgabe, die in einem Kanal ohne Bildschirm zur offenen Frage wird.
Zustimmung ohne Bildschirm
Der Satz steht in den Sicherheitsgrundsätzen von MCP und ist eindeutig:
Agenten und Harness, Kapitel 02 beschreibt, wie das aussieht: ein Dialog, ein Klick, gegebenenfalls ein Haken für „nicht mehr fragen“, und die Ermüdung, die daraus entsteht. Jeder Teil dieser Beschreibung setzt einen Bildschirm voraus.
Im Gespräch wird daraus eine Rückfrage, und damit ändern sich drei Dinge auf einmal.
Die Zustimmung kostet einen Zug. Fragen, antworten, bestätigen: Das sind drei Wechsel statt eines Klicks, jeder mit dem vollen Latenzbudget aus Kapitel 03.
Die Zustimmung ist nicht schriftlich. Was jemand am Bildschirm angeklickt hat, steht als Ereignis im Protokoll. Was jemand gesagt hat, steht als Abschrift darin, und eine Abschrift ist eine Erkennungsleistung. „Ja“ und „Nein“ sind kurze Wörter, und Kapitel 02 zeigt, woran die Erkennung scheitert.
Die Ermüdung wirkt schneller. Wer dreimal hintereinander gefragt wird, ob er wirklich möchte, sagt beim vierten Mal ja, ohne zuzuhören. Am Bildschirm gibt es dagegen den Haken, der die Frage abschaltet. Im Gespräch verschiebt derselbe Wunsch die Grenze zwischen dem, was ohne Rückfrage passiert, und dem, was gar nicht passiert.
Daraus folgt eine Bauregel, die es am Bildschirm so nicht braucht: Die Liste der Tools, die ein Sprachagent ohne Rückfrage benutzen darf, muss vorher feststehen. Wer sie zur Laufzeit entscheidet, entscheidet sie über eine Rückfrage, die niemand mehr ernst nimmt.
An derselben Stelle im Ablauf sitzt eine zweite Vorkehrung, bei der niemand gefragt wird: Ein Guardrail am Tool Call kann ihn überspringen, seine Ausgabe ersetzen oder den Lauf abbrechen. Der Unterschied liegt in der entscheidenden Instanz, hier ein Mensch, dort eine Regel. Kapitel 07 nimmt beides auseinander.
Was beim Hineinreden mit einem laufenden Aufruf passiert
Kapitel 03 beschreibt, was beim Barge-in geschieht: Das Modell wirft seine angefangene Erzeugung weg, und die Anwendung muss ihren Abspielpuffer selbst leeren.
Ein laufender Tool Call ist davon nicht erfasst. Er läuft in der Anwendung. Das Modell weiß nichts von ihm, und der Abbruch der Erzeugung hält ihn nicht an. Wer eine Buchung angestoßen hat und dann unterbrochen wird, hat die Buchung trotzdem angestoßen.
Damit steht dieselbe Frage wie beim Abspielpuffer, eine Ebene tiefer. Die Anwendung führt einen Zustand, den das Modell nicht kennt, und sie muss entscheiden, was mit ihm geschieht, wenn das Gespräch die Richtung wechselt. Drei Antworten sind vertretbar: den Aufruf zu Ende laufen lassen und das Ergebnis wegwerfen, ihn abbrechen, wo das möglich ist, oder ihn erst gar nicht starten, solange keine Bestätigung da ist.
Welche davon richtig ist, hängt daran, ob der Aufruf etwas verändert. Das ist dieselbe Grenze, die Kapitel 01 zwischen Antworten und Handeln zieht, und sie fällt hier zum zweiten Mal ins Gewicht.
Eine Beschreibung, die jemand anderes geschrieben hat
Der letzte Punkt ist der, den man im Sprachkanal am ehesten übersieht. Agenten und Harness, Kapitel 02 hält fest, dass eine Tool-Beschreibung fremder Text im eigenen Kontextfenster ist und als unvertrauenswürdig gilt.
Am Bildschirm kann man sie ansehen. Im Gespräch entscheidet das Modell allein anhand dieser Beschreibung, welches Tool es aufruft, und der Anrufer bekommt davon nichts mit. Ihm bleibt das Ergebnis, vorgelesen. Der Weg dorthin ist an keiner Stelle sichtbar.
Quellen
5 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Dokumentationerreichbar
Google, Tool use with Live API (externe Seite, ai.google.dev)
ai.google.devgeprüft 24.09.2026
Die Doku zum Tool Call in einer laufenden Sprachsitzung, und der einzige Ort im Bestand, an dem ein Anbieter die Voreinstellung ausspricht: Der Aufruf läuft der Reihe nach, und die Verarbeitung hält an, bis das Ergebnis da ist. Es gibt eine Einstellung dagegen, und dieselbe Seite vermerkt unter ihr, dass das neueste Live-Modell sie nicht beherrscht.
Dokumentationerreichbar
OpenAI, Realtime conversations (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Beschreibung dessen, was in einer laufenden Sprachsitzung passiert, und der Ort, an dem der Anbieter den Preis einer Prüfung vor der Antwort selbst benennt: Wer die automatische Antwort abschaltet, um Eingaben zu moderieren, zu prüfen oder erst etwas nachzuschlagen, bezahlt das mit Wartezeit. Dieselbe Seite nennt die Obergrenze einer Sitzung und beschreibt den Ablauf eines Tool Calls.
Dokumentationerreichbar
OpenAI, Using realtime models (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Anleitung zum Anweisen eines Sprachmodells, das rohen Ton verarbeitet. Sie belegt nebenbei, was ein solches Modell auseinanderhalten kann: Stille, Hintergrundgeräusch, Wartemusik, Fernsehton und ein Gespräch, das jemand anderem gilt. Dieselbe Seite führt die Ansage vor einer Wartezeit als eigenes Bauteil mit Namen und benennt ihre Kehrseite: Schlecht gemacht erhöht sie die gefühlte Wartezeit. Die Anweisungen stehen dort für zwei Modellfassungen nebeneinander und lauten verschieden; zitiert ist hier die neuere.
Artikelerreichbar
Simon Willison, GPT-5.5 prompting guide (externe Seite, simonwillison.net)
simonwillison.netgeprüft 24.09.2026
Datiert den Erscheinungstag des GPT-5.5-Leitfadens auf den 25.04.2026 und zitiert die Kernsätze wörtlich. Wird hier nur als Datumsbeleg geführt: Die Herstellerseite selbst nennt keinen Zeitpunkt, an dem sie geschrieben wurde.
Dokumentationerreichbar
Model Context Protocol, Spezifikation (externe Seite, modelcontextprotocol.io)
modelcontextprotocol.iogeprüft 24.09.2026
Die jeweils maßgebliche Fassung des Standards, über den ein Sprachmodell an fremde Tools und Datenquellen kommt. Die Adresse leitet auf die aktuelle Fassung weiter, seit dem 28.07.2026 auf 2026-07-28.