GrundlagenGrundkursKapitel 16von 16 im Pfad
Das Gesamtbild
Vierzehn Kapitel haben je ein Stück erklärt. Hier laufen sie an einem einzigen Vorgang zusammen: Jemand tippt eine Frage in ein Chatfenster, das im Netz nachschlagen darf, und bekommt eine Antwort. Neun Stationen liegen dazwischen.
seitlich verschiebbar
eigene Darstellung, Stand 29.08.2026
1. Aus Text werden Token
Die Frage wird zerlegt, bevor irgendetwas rechnet. Die Stücke heißen Token, und sie folgen keiner Silbenregel: Ein deutsches Fachwort zerfällt in mehr Stücke als ein englisches Alltagswort (Kapitel 03).
2. Die Frage ist nicht allein
Mitgeschickt wird erheblich mehr, als jemand tippt. Eine Anweisung des Anbieters, die Regeln der Anwendung, der bisherige Gesprächsverlauf, und eine Beschreibung jedes Tools, das zur Verfügung steht. Zusammen ergibt das den Prompt (Kapitel 05), und der Platz dafür ist begrenzt.
3. Das Modell sagt das nächste Token voraus
Was jetzt passiert, ist ein einziger Vorgang, viele Male wiederholt: Aus allem, was dasteht, entsteht eine Rangliste möglicher Fortsetzungen (Kapitel 02). Die Bedeutung der Wörter steckt dabei in Zahlenreihen, und Nähe darin heißt Ähnlichkeit (Kapitel 04).
4. Eines davon wird gezogen
Aus der Rangliste wird ausgewählt, und dabei ist Zufall im Spiel. Deshalb liefert dieselbe Frage zweimal zwei verschiedene Antworten (Kapitel 12).
5. Das Modell bittet um einen Tool Call
Statt zu antworten, kann es etwas anderes ausgeben: die Bitte, im Netz nachzuschlagen. Ausgeführt wird sie vom Programm daneben, nicht vom Modell (Kapitel 09). Das Modell wartet so lange.
6. Das Ergebnis kommt zurück, und alles läuft erneut
Der Suchtreffer wird an den Prompt angehängt. Dann beginnt Station 3 von vorn, mit einem längeren Text. Diese Schleife ist der Unterschied zwischen einem Chatfenster und einem Agenten (Agenten und Harness, Kapitel 01).
7. Die Antwort entsteht Wort für Wort
Sie wird nicht als Ganzes geplant. Jedes Token entsteht aus dem, was davor steht, und das erklärt, warum ein Modell mitten in einer Aufzählung eine Zahl erfinden kann, die niemand geprüft hat (Kapitel 07).
8. Abgerechnet wird nach Token
Alles, was mitgeschickt wurde, zählt, und alles, was zurückkam, ebenfalls. Der Verlauf wächst mit jedem Zug, und damit auch der Preis jeder weiteren Frage (Kapitel 10, Kapitel 11).
9. Danach ist alles weg
Das Modell hat sich nichts gemerkt. Was beim nächsten Mal noch da ist, hat jemand anders wieder hineingeschrieben (Kapitel 08). Sein Wissen aus dem Training hat einen Stichtag, den es selbst nicht kennt.
Was dieser Ablauf erklärt
Fast jede Eigenart, über die man beim Arbeiten stolpert, hat hier ihre Station. Warum deutsche Texte teurer sind als englische: Station 1. Warum dieselbe Frage zwei Antworten gibt: Station 4. Warum ein langes Gespräch teurer wird: Station 8. Warum das Modell den eigenen Namen des neuesten Produkts nicht kennt: Station 9.
Wer den Ablauf einmal im Kopf hat, kann die nächste Beobachtung selbst einordnen, statt sie nachzuschlagen.
Der Ablauf aus Ebene 1 stimmt. Vier Stellen darin verdienen einen zweiten Blick, weil dort die meisten Überraschungen im Alltag entstehen.
Was der Prompt wirklich enthält
Die getippte Frage ist oft der kleinste Teil. Davor steht eine Anweisung des Anbieters, dann die der Anwendung, dann der bisherige Verlauf. Dahinter oder davor stehen die Beschreibungen aller angebundenen Tools, und die zahlt man bei jeder Anfrage, auch bei denen, die kein Tool brauchen (Kapitel 09).
Die Reihenfolge ist dabei ein eigener Faktor. Was in der Mitte eines langen Textes steht, wird schlechter genutzt als das, was am Anfang oder am Ende steht; die Arbeiten dazu stehen in Kapitel 05.
Praktisch heißt das: Wer eine Anwendung baut und sich über den Verbrauch wundert, sollte zuerst zählen, was er ungefragt mitschickt.
Was zwischengespeichert wird
Ein Gesprächsverlauf wächst, und der unveränderte Anfang wird bei jeder Anfrage erneut geschickt. Genau dafür gibt es das Caching: Der Anbieter behält den vorderen Teil und rechnet ihn nicht neu, was ihn billiger macht als frisch geschickte Token (Kapitel 11).
Das erklärt eine Beobachtung, die zunächst widersinnig wirkt. Ein langes Gespräch kann je Frage günstiger sein als ein kurzes, wenn der lange Teil davon unverändert bleibt. Sobald jemand mittendrin etwas ändert, fällt der Vorteil weg.
Was beim vollen Fenster passiert
Der Platz ist begrenzt, und beim Erreichen der Grenze passiert etwas, das niemand ankündigt. Eine Anwendung kann den ältesten Teil abschneiden oder ihn zusammenfassen. Der Unterschied ist erheblich: Das eine verliert Inhalt, das andere verliert Genauigkeit.
Was dabei überlebt und was verschwindet, behandelt der Vibe-Coding-Pfad in Vibe-Coding / Agentic Engineering, Kapitel 05 am Beispiel eines Agenten. Für ein Chatfenster gilt dasselbe in kleiner Form.
Chatfenster und Schnittstelle sind derselbe Vorgang
Der Ablauf aus Ebene 1 beschreibt beides. Der Unterschied liegt darin, wer die Stationen 2 und 6 ausfüllt.
Im Chatfenster macht das der Anbieter. Er entscheidet, welche Systemanweisung gilt, welche Tools es gibt, wie lange der Verlauf mitläuft, und was beim vollen Fenster passiert. Über die Schnittstelle machen Sie das selbst (Kapitel 11), und jede Anfrage steht für sich: Es gibt dort kein Gespräch, das der Anbieter für Sie mitführt.
Deshalb sehen dieselben Fragen im Chatfenster und über die Schnittstelle oft verschieden aus. Verglichen werden dann zwei verschiedene Aufbauten mit demselben Modell darin, und wie viel das ausmacht, steht in Agenten und Harness, Kapitel 04.
Wo im Ablauf welcher Fehler entsteht
| Beobachtung | Station | Kapitel |
|---|---|---|
| Deutscher Text kostet mehr als englischer | 1 | Kapitel 03 |
| Das Modell überliest eine Regel in der Mitte | 2 | Kapitel 05 |
| Zweimal dieselbe Frage, zwei Antworten | 4 | Kapitel 12 |
| Es behauptet, nachgeschlagen zu haben | 5 | Kapitel 07 |
| Eine erfundene Zahl mitten im Fließtext | 7 | Kapitel 07 |
| Das lange Gespräch wird teuer | 8 | Kapitel 10 |
| Es kennt das neueste Produkt nicht | 9 | Kapitel 08 |
Die Tabelle ist der eigentliche Nutzen dieses Kapitels. Wer eine Beobachtung einer Station zuordnen kann, sucht die Ursache am richtigen Ort.
Ein Ablauf ist zugleich eine Liste von Stellen, an denen jemand eingreifen kann. Aus den neun Stationen wird damit eine Übersicht darüber, was in der eigenen Hand liegt.
Die Stationen als Stellschrauben
Station 1, die Zerlegung. Hier greift niemand ein, das Vokabular gehört zum Modell. Was Sie ändern können, ist die Sprache: Derselbe Inhalt auf Englisch kostet weniger Token (Kapitel 03).
Station 2, der Prompt. Die größte Stellfläche des ganzen Ablaufs. Was mitgeschickt wird, in welcher Reihenfolge, wie viele Tools angebunden sind. Wer hier misst, findet fast immer etwas.
Station 3 und 4, Vorhersage und Auswahl. Über die Schnittstelle stellbar (Temperatur und verwandte Regler, Kapitel 12), im Chatfenster meistens nicht.
Station 5, der Tool Call. Welche Tools es gibt, wie sie beschrieben sind, und was sie zurückgeben. Die Beschreibung entscheidet, ob ein Tool überhaupt gewählt wird (Kapitel 09).
Station 6, die Schleife. Wie oft sie sich dreht, wann sie abbricht, was bei einem Fehlschlag passiert (Agenten und Harness, Kapitel 01).
Station 7, die Ausgabe. Format, Länge, ob ein Schema erzwungen wird.
Station 8, die Abrechnung. Modellstufe, Reasoning Effort, Caching (Kapitel 10).
Station 9, das Gedächtnis. Ausschließlich Ihre Sache. Was beim nächsten Mal dasteht, hat jemand hineingeschrieben.
Sieben von neun Stationen sind damit gestaltbar, und alle sieben liegen außerhalb des Modells. Der Sammelbegriff dafür ist der Harness, und was er gemessen ausmacht, steht in Agenten und Harness, Kapitel 04.
Was der Ablauf erklärt
Drei häufige Missverständnisse lösen sich auf, wenn man ihn kennt.
Das Modell lernt aus unseren Gesprächen. Im Ablauf gibt es keine Station, an der etwas zurückfließt. Ob ein Anbieter Gespräche später für ein Training verwendet, ist eine Frage seiner Zusagen und seiner Einstellungen (Beurteilen und Einordnen, Kapitel 01); für den laufenden Vorgang ändert es nichts.
Das Modell hat nachgeschlagen, weil es eine Quelle nennt. Eine Quellenangabe ist Text wie jeder andere, entstanden an Station 7. Ob Station 5 wirklich stattgefunden hat, sagt nur das Protokoll (Kapitel 07).
Ein besseres Modell löst das Problem. Bei sieben von neun Stationen entscheidet der Aufbau. Was das gemessen bedeutet, steht in Agenten und Harness, Kapitel 04, und wo trotzdem die Grenze liegt, in Beurteilen und Einordnen, Kapitel 03.
Was der Ablauf offenlässt
Drei Fragen beantwortet er nicht, und sie sind die interessanten.
Warum diese Rangliste? Der Ablauf sagt, dass an Station 3 eine Rangliste entsteht. Warum sie so ausfällt, wie sie ausfällt, sagt er nicht. Das ist die Frage nach dem Innenleben, und sie ist auch für die Hersteller nur zum Teil beantwortet. Welcher Teil das ist, steht in Beurteilen und Einordnen, Kapitel 06.
Wann wird es richtig? Der Ablauf ist derselbe für eine korrekte und eine erfundene Antwort. Woran man sie unterscheidet, ist eine Frage der Prüfung (Kapitel 07), und im Betrieb eine der Messung (Beurteilen und Einordnen, Kapitel 04).
Wie weit reicht das? Der Ablauf beschreibt einen Zug. Was über viele Züge und viele Schritte hinweg gilt, ist eine eigene Rechnung (Beurteilen und Einordnen, Kapitel 03).
Der Anschluss
Wer bis hierher gelesen hat, kennt einen vollständigen Vorgang und weiß, wo seine Teile stehen. Drei Wege führen weiter, je nachdem, was ansteht.
- Ein Modell handeln lassen. Der Pfad Agenten und Harness setzt bei Station 6 an (Agenten und Harness, Kapitel 01).
- Einordnen und beurteilen. Wo ein Modell läuft, was es kann, was eine Zahl darüber sagt (Beurteilen und Einordnen, Kapitel 01).
- Selbst etwas bauen. Der Vibe-Coding-Pfad beschreibt die Arbeitsweise dahinter (Vibe-Coding / Agentic Engineering, Kapitel 01).