GrundlagenGrundkursKapitel 12von 16 im Pfad
Wie zufällig die Antwort ist
In Kapitel 02 steht, dass ein Sprachmodell das nächste Token vorhersagt. Der Satz beschreibt einen Vorgang, der aus zwei Schritten besteht, und der zweite davon gehört gar nicht mehr zum Modell.
Das Modell liefert eine Rangliste
Gefragt, wie der Satz „Der Kaffee ist“ weitergeht, bewertet ein Modell jedes
Token seines Vokabulars und gibt eine Rangliste zurück: heiß mit hoher
Bewertung, kalt mit einer niedrigeren, fertig, alle, bitter, und so
weiter bis hinunter zu Zeichenfolgen, die an dieser Stelle keinen Sinn ergeben.
Wie lang die Liste ist, hängt am Vokabular des Modells: Bei dem der
GPT-4o-Familie sind es rund zweihunderttausend Einträge, andere Modelle kommen
auf andere Zahlen (Kapitel 03).
Diese Rangliste ist das Ergebnis der Rechnung. Mit dem letzten Rechenschritt ist die Arbeit des Modells getan, und was danach kommt, steht in keinem seiner Gewichte.
Ziehen tut ein anderer
Aus der Rangliste muss ein einzelnes Token werden, und diesen Schritt macht das Programm, das das Modell ausführt. In Kapitel 01 steht es bereits in einer Aufzählung dessen, was zur Umgebung gehört. Dort ist es eine Randnotiz, hier ist es die Hauptsache.
Am deutlichsten sieht man das bei einem Programm, das ein Modell auf dem eigenen Rechner ausführt. Dort steht die Einstellung in einer Datei neben dem Modell:
Dieselben Modelldateien, ein anderes Programm davor, andere Einstellungen. Und umgekehrt: Wer ein Modell über die Adresse eines Anbieters benutzt (Kapitel 11), bekommt die Regler, die dieser Anbieter anbietet. Welche das sind, ist eine Entscheidung des Anbieters.
seitlich verschiebbar
eigene Darstellung, Stand 05.08.2026
Wo dieses Programm läuft
Die Frage stellt sich sofort, wenn man das Bild ernst nimmt: Bekommt das eigene Programm die Rangliste zu sehen und zieht daraus?
Bei einem Modell auf dem eigenen Rechner ist es genau so. Wer über einen
Anbieter geht, für den erledigt der Anbieter diesen Schritt, und dessen
Beschreibung der Schnittstelle (externe Seite, platform.claude.com) sagt es in der
ersten Person Mehrzahl: Unter top_p steht, wir berechneten die
aufsummierte Verteilung über alle Möglichkeiten je Token in absteigender
Wahrscheinlichkeit und schnitten sie an der eingestellten Stelle ab.
Das „wir“ ist der Anbieter. Bei Ihnen kommt der fertige Text an, und für die Rangliste führt die Beschreibung kein Feld. Sie stellen über die Parameter also ein, wie dort drüben gezogen wird.
An der Aufteilung, um die es in diesem Kapitel geht, ändert das nichts: Das Modell endet bei der Bewertung, die Ziehung ist ein Schritt danach. Es sagt nur, wo dieser Schritt stattfindet. Wer eine Rangliste wirklich sehen will, braucht einen Zugang, der sie herausgibt, oder ein Modell auf der eigenen Maschine.
Was die Temperatur einstellt
Die bekannteste dieser Einstellungen ist die Temperatur. Sie regelt, wie weit die Bewertungen für die Ziehung auseinandergezogen werden. Die Beschreibung im Modelfile fasst die Wirkung zusammen:
Bei einem niedrigen Wert rückt der erste Eintrag so weit nach vorn, dass fast immer er genommen wird. Bei einem hohen rücken die Plätze dahinter heran und kommen zum Zug. Der Vorgabewert liegt dort bei 0,8, also bewusst über der reinen Spitzenwahl.
Die Bezeichnung ist eine Anleihe aus der Physik. Praktisch merken Sie den Unterschied daran, ob eine Antwort vorhersehbar wirkt oder überraschend, und ob eine Aufzählung immer dieselben fünf Punkte bringt.
Warum zweimal dieselbe Frage zwei Antworten ergibt
Genau hier liegt der häufigste Grund für eine Alltagsbeobachtung, die viele für einen Mangel halten. Dieselbe Frage zweimal gestellt bringt zwei verschiedene Antworten, weil zweimal gezogen wurde. Zwei weitere Gründe kommen bei einem Anbieter dazu: eine neue Modellfassung hinter derselben Adresse und eine Automatik, die die Frage an ein anderes Modell gibt (Kapitel 10).
Wer die Ziehung festhalten will, findet dafür beim lokalen Betrieb einen Schalter. Ein fester Startwert wiederholt dieselbe Zufallsfolge:
Die Zusage gilt der Ziehung. Ob am Ende wirklich derselbe Text herauskommt, hängt zusätzlich daran, ob die Bewertungen davor jedes Mal dieselben sind, und das ist selbst auf dem eigenen Rechner nicht gesetzt. Nachgemessen ist es in Ebene 3.
Bei einem Anbieter steht die Einschränkung von vornherein dabei. Anthropic schreibt zur Temperatur ausdrücklich dazu, dass die Ergebnisse auch beim niedrigsten Wert nicht vollständig wiederholbar sind.
Die Temperatur aus Ebene 1 ist der bekannteste Regler und der grobste. Daneben stehen mehrere Verfahren, die vor der Ziehung entscheiden, welche Einträge der Rangliste überhaupt in Frage kommen. Sie unterscheiden sich darin, wo sie den Schnitt setzen.
Drei Arten, die Rangliste zu beschneiden
Top-K schneidet nach Anzahl. Nur die besten K Einträge bleiben übrig, der Rest fällt weg, unabhängig davon, wie gut er war. Die Beschreibung nennt den Zweck beim Namen:
Top-P schneidet nach Summe. Die Einträge werden von oben aufsummiert, bis ein Anteil erreicht ist, und dort fällt der Schnitt. Wie viele Einträge das sind, hängt von der Lage ab: Bei einer klaren Spitze bleiben wenige übrig, bei einer flachen Verteilung viele.
Min-P schneidet relativ zur Spitze. Alles, was gemessen am besten Eintrag zu unwahrscheinlich ist, fällt weg. Die Doku beschreibt es als
und rechnet ein Beispiel vor: Bei einem Wert von 0,05 und einem besten Eintrag mit 0,9 fliegt alles unterhalb von 0,045 heraus.
seitlich verschiebbar
eigene Darstellung, Stand 05.08.2026
Der Unterschied wird an zwei Situationen greifbar. Steht die Antwort praktisch fest, etwa beim Schlusszeichen eines Satzes, dann behält Top-K mit dem Wert 40 seine vierzig Kandidaten, während Top-P und Min-P auf eine Handvoll zusammenschrumpfen. Im Ergebnis macht das wenig aus, denn hinter einer scharfen Spitze bleibt für die übrigen kaum Wahrscheinlichkeit übrig. Ist die Lage dagegen offen, etwa bei der Wortwahl in einer Beschreibung, dann öffnen Top-P und Min-P das Feld, während Top-K bei seiner festen Zahl bleibt. Hier fällt die feste Zahl ins Gewicht: Der einundvierzigste Kandidat kann fast so gut sein wie der vierzigste und kommt trotzdem nie vor.
Zwei Strafen gegen Wiederholung
Eine zweite Gruppe greift woanders an. Sie verändert die Bewertung von Token, die vor kurzem schon vorkamen, um Schleifen zu vermeiden.
Sets how strongly to penalize repetitions (externe Seite, docs.ollama.com)
Dazu gehört eine zweite Einstellung, die festlegt, wie weit zurück dabei geschaut wird:
Sets how far back for the model to look back to prevent repetition (externe Seite, docs.ollama.com)
Beide zusammen erklären eine Beobachtung aus dem lokalen Betrieb: Ein kleines Modell, das in eine Wiederholungsschleife gerät, lässt sich damit oft herausholen. Die Kehrseite steht in derselben Zeile, denn die Strafe unterscheidet nicht zwischen einer sinnlosen Wiederholung und einem Fachbegriff, der in einem technischen Text nun einmal zwanzigmal vorkommen muss.
Wem die Regler gehören
Damit zur Frage, die im Alltag am häufigsten falsch beantwortet wird. Wer in einer Oberfläche wie LM Studio eine Handvoll Schieber sieht und sich fragt, ob das Einstellungen des Modells sind: Es sind Einstellungen des Programms, das das Modell ausführt.
Der Beleg steht im Aufbau. Die Parameter werden in der Datei gesetzt, mit der die Ausführung eingerichtet wird, und gelten für jedes Modell, das dieses Programm lädt. Am selben Modell in einem anderen Programm stehen andere Regler.
Der Vergleich macht es deutlich. Ollamas Parameterliste führt sieben Einstellungen, die auf die Auswahl wirken, darunter Min-P und die beiden Strafen. Anthropic beschreibt an derselben Stelle die Temperatur und Top-P, und zu Top-P steht dort ausdrücklich, es sei nur für fortgeschrittene Fälle empfohlen. Dasselbe Modell hinter beiden Zugängen hätte verschiedene Regler, weil die Regler zu den Zugängen gehören.
Praktisch folgt daraus dreierlei. Eine Anleitung, die Werte für Top-K und Min-P nennt, ist eine Anleitung für ein bestimmtes Programm. Ein Vergleich zweier Modelle über zwei verschiedene Zugänge vergleicht auch deren Voreinstellungen mit. Und wer die Ziehung kontrolliert, hat damit erst einen Teil dessen in der Hand, was für eine wiederholbare Ausgabe nötig ist; der Rest steht in Ebene 3.
Was beim Stapeln passiert
Zwei der drei Schnitte sind ab Werk gesetzt: Top-K auf 40, Top-P auf 0,9. Der dritte steht auf null, und die Liste sagt auch, warum. Sie führt Min-P als Alternative zu Top-P (externe Seite, docs.ollama.com). Gedacht ist es also als Ersatz für einen Schnitt.
Wer trotzdem alle drei setzt und zusätzlich die Temperatur senkt, filtert viermal hintereinander. Wie viel das ausmacht, hängt am Modell und an der Aufgabe; gemessen ist es hier nicht. Die Richtung steht fest: Je kürzer die Liste, aus der gezogen wird, desto ähnlicher werden sich die Antworten, und irgendwann arbeitet die Wiederholungsstrafe gegen eine Gleichförmigkeit, die erst die Filter erzeugt haben.
Wer messen will, ob eine Einstellung hilft, ändert genau eine und vergleicht mit demselben Startwert für den Zufall. Ohne diesen Festwert vergleicht man zwei Ziehungen und keine zwei Einstellungen. Und die Vorgabewerte gehören ins Protokoll: Sie filtern mit, auch wenn niemand sie angefasst hat.
Zwei Annahmen über die Ziehung halten der Praxis nicht stand. Die erste ist, dass sich Zufall abschalten lässt. Die zweite ist, dass diese Regler bei jedem Modell dieselbe Rolle spielen.
Der niedrigste Wert verspricht keine Wiederholbarkeit
Anthropic schreibt zur Temperatur ausdrücklich hinzu, dass die Ergebnisse auch bei 0,0 nicht vollständig wiederholbar sind. Der Satz steht in der Beschreibung des Parameters selbst, also an der Stelle, an der man ihn am ehesten überliest.
Einen Grund nennt der Anbieter nicht. Bekannt ist er trotzdem, und er sitzt eine Stufe vor der Ziehung. Bei 0,0 wird immer der oberste Eintrag genommen, da ist nichts mehr zu ziehen. Was sich ändert, sind die Bewertungen davor.
Eine Untersuchung von Thinking Machines hat das 2025 auseinandergenommen. Der naheliegende Verdacht, die Parallelität der Grafikkarte mische die Rechenreihenfolge auf, trifft es nicht: Derselbe Rechenschritt auf denselben Daten liefert wiederholt dasselbe Ergebnis. Der Unterschied entsteht eine Ebene höher. Ein Rechenschritt liefert je nach Größe des Stapels, in dem er mitläuft, leicht verschiedene Zahlen, und wie groß dieser Stapel ist, hängt daran, wie viele fremde Anfragen im selben Moment bearbeitet werden:
Die Messung dazu ist unbequem für jeden, der mit Wiederholbarkeit plant. Tausend Läufe derselben Frage an ein offenes Modell, Temperatur 0, tausend Token je Antwort: achtzig verschiedene Ergebnisse. Bis zum 102. Token waren alle tausend gleich, die erste Abweichung fiel beim 103. Ein solcher Lauf sieht hundert Token lang wiederholbar aus.
Der eigene Rechner ist davon nicht ausgenommen, auch wenn dort ein Startwert für den Zufall bereitsteht:
Die Zusage gilt der Ziehung. Dieselbe Untersuchung hält fest, dass es darunter weitergeht:
Beheben lässt es sich, und was es kostet, steht daneben. Mit Rechenschritten, die von der Stapelgröße unabhängig sind, waren alle tausend Läufe gleich, und derselbe Testlauf brauchte statt 26 Sekunden 42. Diese Rechenschritte stammen von denselben Autoren; die Untersuchung stellt also zugleich ihre eigene Lösung vor.
Für die Praxis heißt das: Wiederholbarkeit ist eine Eigenschaft des Aufbaus, und wer sie braucht, baut sie ein und misst sie nach. Bei allem anderen wird über mehrere Läufe gemittelt, und die Streuung ist Teil des Ergebnisses.
Die Steuerung wandert von der Ziehung zum Aufwand
Über Jahre war die Ziehung der einzige Ort, an dem sich das Verhalten eines Modells von außen einstellen ließ. Bei den Modellen, die vor der Antwort nachdenken, kommt ein zweiter Ort dazu, und dort wiederholt sich dieselbe Entwicklung im Zeitraffer.
Anfangs stand dort ebenfalls eine Zahl von Hand, ein Denkbudget in Token. Bei Anthropic ist dieser Weg inzwischen versperrt:
Claude 4.7 and later models have removed extended thinking (externe Seite, platform.claude.com)
An seine Stelle tritt eine Stufe. Bei OpenAI ist es dieselbe Bauform, und die Anleitung beschreibt sie als Parameter, der
guides the model on how much to think when performing a task (externe Seite, platform.openai.com)
samt der Abwägung dahinter:
Welche Stufen zur Wahl stehen, sagt derselbe Absatz, und er sagt es mit einer Einschränkung:
Sieben Namen also, von denen jedes Modell seine eigene Auswahl annimmt. Eine Anleitung, die eine Stufe nennt, nennt sie für ein bestimmtes Modell.
seitlich verschiebbar
eigene Darstellung, Stand 05.08.2026
Die Bewegung ist in beiden Fällen dieselbe: von einer Zahl, die ein Mensch setzt, zu einer Stufe, innerhalb derer das Modell selbst entscheidet. Die Anleitung schreibt diese Selbstregelung ausdrücklich hin:
Wer Anleitungen aus verschiedenen Jahren nebeneinanderlegt, sollte deshalb prüfen, ob der genannte Regler beim eigenen Modell noch existiert. Was ein bestimmtes Modell annimmt, steht in dessen Modellkarte, und die Anbieter gehen dabei auseinander.
Der Denkregler selbst gehört in Kapitel 10, zusammen mit dem, was er kostet. Hier zählt die Beobachtung: Die Zahl der Schrauben von Hand nimmt ab, und was übrig bleibt, wirkt gröber und trifft dafür seltener daneben.
Speculative Decoding ändert das Tempo
Eine Einstellung in derselben Liste gehört in eine andere Familie, und sie wird regelmäßig für einen Qualitätsregler gehalten. Sie steuert, wie viele Token ein kleineres Entwurfsmodell je Schritt vorschlägt:
Der Gedanke dahinter ist, dass die einfachen Stellen eines Textes ein kleines Modell genauso gut trifft. Es schlägt mehrere Token auf einmal vor, das große prüft sie in einem Durchgang und übernimmt, was es übernehmen darf. Der Rest wird verworfen und neu gerechnet.
Hinter diesem „darf“ steckt der eigentliche Kunstgriff. Bei der reinen Spitzenwahl wäre es ein Vergleich: Hätte das große Modell dasselbe Token genommen, ist der Vorschlag gut. Sobald gezogen wird, reicht das nicht, denn dann hat auch der zweitbeste Vorschlag ein Anrecht darauf, gelegentlich durchzukommen. Die Arbeit von Leviathan, Kalman und Matias, die das Verfahren 2022 vorgestellt hat, nimmt einen Vorschlag deshalb mit einer berechneten Wahrscheinlichkeit an und gleicht die Ablehnungen aus. Zugesagt ist damit die Verteilung, aus der die Token stammen:
Auf dem Modell ihrer Vorführung lief die Ausgabe zwei- bis dreimal schneller und fiel dabei gleich aus. Für den einzelnen Text bleibt das ein Messergebnis. Zugesagt hat das Verfahren die Verteilung, und die zweite Ziehung daraus darf anders ausfallen.
Für die Steuerung heißt das: An dieser Schraube dreht, wer Wartezeit sparen will. Wer an der Ausgabe etwas ändern will, dreht woanders. Und wer einen Vergleich zweier Aufbauten misst, sollte wissen, ob auf einer Seite ein Entwurfsmodell mitläuft, weil die Geschwindigkeitszahlen sonst zwei verschiedene Dinge messen.
Ein zweites Modell ist dabei eine von inzwischen drei Herkünften des Vorschlags. Manche Modelle bringen einen eigenen Kopf dafür mit, und ein dritter Weg zieht seine Vorschläge aus Wortfolgen, die im schon geschriebenen Text vorgekommen sind, also ganz ohne Modell. Welcher davon etwas bringt, hängt an der Textsorte und daran, wie oft sich der Text wiederholt. Ein eigener Werkstattbericht misst sieben dieser Verfahren an einem Arbeitsrechner über vier Textsorten: Was davon ankommt. Von 40 gemessenen Kombinationen blieben acht übrig, bei den anderen war die Streuung größer als die Wirkung.
Was eine Messung über Einstellungen braucht
Aus dem Vorigen ergibt sich eine kurze Liste von Bedingungen, ohne die ein Vergleich zweier Einstellungen wenig aussagt.
Mehrere Läufe, und der Startwert für den Zufall dazu. Der Startwert hält die Ziehung fest, die Bewertungen davor hält er nicht fest. Wer eine Einstellung beurteilen will, misst sie deshalb über mehrere Läufe, und die Streuung gehört ins Ergebnis.
Eine Änderung je Messung. Vier gleichzeitig gedrehte Filter ergeben ein Ergebnis, das sich keiner Ursache zuordnen lässt.
Die Voreinstellungen mitprotokollieren. Sie unterscheiden sich zwischen Programmen und ändern sich mit deren Fassungen. Eine Messung ohne diese Angabe ist später nicht nachvollziehbar.
Das ganze Umfeld notieren. Modell, Fassung, Programm, Einstellungen und Datum. Wie schnell so eine Angabe veraltet, zeigt der Abschnitt oben: Ein Regler, der 2025 in jeder Anleitung stand, wird von den Modellen von 2026 mit einem Fehler beantwortet.
Quellen
6 Einträge, davon 2 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitDokumentationerreichbar
Ollama, Modelfile reference (externe Seite, docs.ollama.com)
docs.ollama.comgeprüft 24.09.2026
Die Parameterliste des Programms, das ein Modell auf dem eigenen Rechner ausführt. Sie beantwortet die Frage, wem die Regler gehören: Sie stehen in der Datei, mit der die Ausführung eingerichtet wird. Im Modell stehen sie nicht. Von den elf Einträgen der Tabelle wirken sieben auf die Auswahl des nächsten Token, dazu einer auf das Tempo und drei auf Umfang und Abbruch. Zu Min-P steht dort „Alternative to the top_p“, es ersetzt also einen Schnitt. Der Unterstrich geht beim Abruf verloren, weil die Seite ihn als Auszeichnung liest; deshalb ist diese Stelle ohne hinterlegtes Zitat.
SchlüsselarbeitDokumentationerreichbar
Anthropic, Messages API reference (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Die Beschreibung der Regler, die dieser Anbieter für die Ziehung anbietet. Unter `temperature` steht dort „Amount of randomness injected into the response“ und der Zusatz, dass die Ergebnisse auch bei 0,0 nicht vollständig wiederholbar sind; An `top_p` steht der Hinweis „Recommended for advanced use cases only“. Unter `top_p` steht außerdem, wie die Auswahl zustande kommt, und zwar in der ersten Person Mehrzahl: „we compute the cumulative distribution over all the options for each subsequent token in decreasing probability order and cut it off once it reaches a particular probability specified by `top_p`“. Das belegt, wo die Ziehung stattfindet: beim Anbieter. Dieselbe Seite belegt zweitens, wie dieser Anbieter die Rollen führt. Zu den Nachrichten steht dort „Our models are trained to operate on alternating `user` and `assistant` conversational turns“, die Trennung kommt also aus dem Training. Die Systemanweisung steht dabei außerhalb der Nachrichtenliste: Zum Feld `system` heißt es dort, für Eingabenachrichten gebe es in dieser Schnittstelle keine Rolle dieses Namens. Abgerufen am 06.08.2026. Wie viele Regler die Seite insgesamt führt, ist von hier aus nicht zu messen: Sie lädt ihre Parameterliste nicht in den sichtbaren Text, siehe die Notiz.
Dokumentationerreichbar
Anthropic, Claude API errors (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Die Liste der Fehlercodes samt der Frage, welcher davon einen zweiten Versuch verdient. Dieselbe Seite führt die Kennung, die jede Antwort mitbringt, und belegt, dass die neueren Modelle das von Hand gesetzte Denkbudget abweisen.
Dokumentationerreichbar
OpenAI, Reasoning models (externe Seite, platform.openai.com)
platform.openai.comgeprüft 24.09.2026
Die Anleitung zu den Modellen, die vor der Antwort nachdenken. Gesteuert wird dort über einen Aufwandswert an derselben Stelle, an der früher die Ziehung eingestellt wurde. Die Anleitung nennt sieben Namen von none bis max und sagt im selben Satz dazu, welche davon gelten, sei modellabhängig. Sie belegt außerdem, dass das Modell innerhalb einer Stufe selbst entscheidet, wie viel Aufwand eine Aufgabe bekommt.
Artikelerreichbar
Defeating Nondeterminism in LLM Inference (externe Seite, thinkingmachines.ai)
thinkingmachines.aigeprüft 24.09.2026
Die Untersuchung, die den verbreiteten Verdacht ausräumt, die Parallelität der Grafikkarte mische die Rechenreihenfolge auf. Der einzelne Rechenschritt ist wiederholbar, der Unterschied entsteht eine Ebene höher: Ein Schritt liefert je nach Größe des Stapels, in dem er mitläuft, leicht verschiedene Zahlen, und die Stapelgröße hängt an den fremden Anfragen im selben Moment. Gemessen an einem offenen Modell bei Temperatur 0 und tausend Token je Antwort: achtzig verschiedene Ergebnisse aus tausend Läufen, alle gleich bis zum 102. Token. Zu lesen ist der Text mit einer Einschränkung, die er selbst nennt: Die Lösung, mit der danach alle tausend Läufe gleich ausfallen, stammt von denselben Autoren.
Originalarbeiterreichbar
Fast Inference from Transformers via Speculative Decoding (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Die Arbeit von Leviathan, Kalman und Matias vom 30.11.2022, die das spekulative Entwerfen vorgestellt hat. Wichtig für dieses Kapitel ist die Reichweite ihrer Zusage: Erhalten bleibt die Verteilung, aus der gezogen wird. Bei der reinen Spitzenwahl fällt das mit dem einzelnen Text zusammen. Sobald gezogen wird, ist es zweierlei. Die gemessene zwei- bis dreifache Beschleunigung bei gleichen Ausgaben stammt von einem einzigen Modell ihrer Erhebung, T5-XXL.