Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenGrundkursKapitel 12von 16 im Pfad

Wie zufällig die Antwort ist

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

In Kapitel 02 steht, dass ein Sprachmodell das nächste Token vorhersagt. Der Satz beschreibt einen Vorgang, der aus zwei Schritten besteht, und der zweite davon gehört gar nicht mehr zum Modell.

Das Modell liefert eine Rangliste

Gefragt, wie der Satz „Der Kaffee ist“ weitergeht, bewertet ein Modell jedes Token seines Vokabulars und gibt eine Rangliste zurück: heiß mit hoher Bewertung, kalt mit einer niedrigeren, fertig, alle, bitter, und so weiter bis hinunter zu Zeichenfolgen, die an dieser Stelle keinen Sinn ergeben. Wie lang die Liste ist, hängt am Vokabular des Modells: Bei dem der GPT-4o-Familie sind es rund zweihunderttausend Einträge, andere Modelle kommen auf andere Zahlen (Kapitel 03).

Diese Rangliste ist das Ergebnis der Rechnung. Mit dem letzten Rechenschritt ist die Arbeit des Modells getan, und was danach kommt, steht in keinem seiner Gewichte.

Ziehen tut ein anderer

Aus der Rangliste muss ein einzelnes Token werden, und diesen Schritt macht das Programm, das das Modell ausführt. In Kapitel 01 steht es bereits in einer Aufzählung dessen, was zur Umgebung gehört. Dort ist es eine Randnotiz, hier ist es die Hauptsache.

Am deutlichsten sieht man das bei einem Programm, das ein Modell auf dem eigenen Rechner ausführt. Dort steht die Einstellung in einer Datei neben dem Modell:

The PARAMETER instruction defines a parameter that can be set when the model is run (externe Seite, docs.ollama.com)

Dieselben Modelldateien, ein anderes Programm davor, andere Einstellungen. Und umgekehrt: Wer ein Modell über die Adresse eines Anbieters benutzt (Kapitel 11), bekommt die Regler, die dieser Anbieter anbietet. Welche das sind, ist eine Entscheidung des Anbieters.

Dieselbe Rangliste liegt zwei Programmen vor, die daraus verschiedene Wörter ziehen. In der Mitte steht eine Rangliste aus vier Wörtern als unterschiedlich lange Balken, erzeugt von einem Modell. Nach oben und nach unten führt je ein Weg zu einem anderen ausführenden Programm mit anderen Einstellungen; das obere zieht das oberste Wort, das untere ein weiter hinten stehendes. Beide Wege gehen von derselben Rangliste aus. Die Balkenlängen sind ein erfundenes Beispiel. Gemessen ist hier nichts. EIN MODELL eine Rechnung DIE RANGLISTE heiß kalt fertig bitter Programm A, niedrige Temperatur gibt aus: heiß Programm B, hohe Temperatur gibt aus: bitter Gleiche Rangliste, andere Ziehung.

seitlich verschiebbar

Das Modell endet bei der Rangliste. Erst der Schritt danach macht daraus ein Wort, und dieser Schritt gehört dem Programm davor.

eigene Darstellung, Stand 05.08.2026

Wo dieses Programm läuft

Die Frage stellt sich sofort, wenn man das Bild ernst nimmt: Bekommt das eigene Programm die Rangliste zu sehen und zieht daraus?

Bei einem Modell auf dem eigenen Rechner ist es genau so. Wer über einen Anbieter geht, für den erledigt der Anbieter diesen Schritt, und dessen Beschreibung der Schnittstelle (externe Seite, platform.claude.com) sagt es in der ersten Person Mehrzahl: Unter top_p steht, wir berechneten die aufsummierte Verteilung über alle Möglichkeiten je Token in absteigender Wahrscheinlichkeit und schnitten sie an der eingestellten Stelle ab.

Das „wir“ ist der Anbieter. Bei Ihnen kommt der fertige Text an, und für die Rangliste führt die Beschreibung kein Feld. Sie stellen über die Parameter also ein, wie dort drüben gezogen wird.

An der Aufteilung, um die es in diesem Kapitel geht, ändert das nichts: Das Modell endet bei der Bewertung, die Ziehung ist ein Schritt danach. Es sagt nur, wo dieser Schritt stattfindet. Wer eine Rangliste wirklich sehen will, braucht einen Zugang, der sie herausgibt, oder ein Modell auf der eigenen Maschine.

Was die Temperatur einstellt

Die bekannteste dieser Einstellungen ist die Temperatur. Sie regelt, wie weit die Bewertungen für die Ziehung auseinandergezogen werden. Die Beschreibung im Modelfile fasst die Wirkung zusammen:

The temperature of the model. Increasing the temperature will make the model answer more creatively (externe Seite, docs.ollama.com)

Bei einem niedrigen Wert rückt der erste Eintrag so weit nach vorn, dass fast immer er genommen wird. Bei einem hohen rücken die Plätze dahinter heran und kommen zum Zug. Der Vorgabewert liegt dort bei 0,8, also bewusst über der reinen Spitzenwahl.

Die Bezeichnung ist eine Anleihe aus der Physik. Praktisch merken Sie den Unterschied daran, ob eine Antwort vorhersehbar wirkt oder überraschend, und ob eine Aufzählung immer dieselben fünf Punkte bringt.

Warum zweimal dieselbe Frage zwei Antworten ergibt

Genau hier liegt der häufigste Grund für eine Alltagsbeobachtung, die viele für einen Mangel halten. Dieselbe Frage zweimal gestellt bringt zwei verschiedene Antworten, weil zweimal gezogen wurde. Zwei weitere Gründe kommen bei einem Anbieter dazu: eine neue Modellfassung hinter derselben Adresse und eine Automatik, die die Frage an ein anderes Modell gibt (Kapitel 10).

Wer die Ziehung festhalten will, findet dafür beim lokalen Betrieb einen Schalter. Ein fester Startwert wiederholt dieselbe Zufallsfolge:

Setting this to a specific number will make the model generate the same text for the same prompt (externe Seite, docs.ollama.com)

Die Zusage gilt der Ziehung. Ob am Ende wirklich derselbe Text herauskommt, hängt zusätzlich daran, ob die Bewertungen davor jedes Mal dieselben sind, und das ist selbst auf dem eigenen Rechner nicht gesetzt. Nachgemessen ist es in Ebene 3.

Bei einem Anbieter steht die Einschränkung von vornherein dabei. Anthropic schreibt zur Temperatur ausdrücklich dazu, dass die Ergebnisse auch beim niedrigsten Wert nicht vollständig wiederholbar sind.

Quellen

6 Einträge, davon 2 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitDokumentationerreichbar

    Ollama, Modelfile reference (externe Seite, docs.ollama.com)

    docs.ollama.comgeprüft 24.09.2026

    Die Parameterliste des Programms, das ein Modell auf dem eigenen Rechner ausführt. Sie beantwortet die Frage, wem die Regler gehören: Sie stehen in der Datei, mit der die Ausführung eingerichtet wird. Im Modell stehen sie nicht. Von den elf Einträgen der Tabelle wirken sieben auf die Auswahl des nächsten Token, dazu einer auf das Tempo und drei auf Umfang und Abbruch. Zu Min-P steht dort „Alternative to the top_p“, es ersetzt also einen Schnitt. Der Unterstrich geht beim Abruf verloren, weil die Seite ihn als Auszeichnung liest; deshalb ist diese Stelle ohne hinterlegtes Zitat.

  • SchlüsselarbeitDokumentationerreichbar

    Anthropic, Messages API reference (externe Seite, platform.claude.com)

    platform.claude.comgeprüft 24.09.2026

    Die Beschreibung der Regler, die dieser Anbieter für die Ziehung anbietet. Unter `temperature` steht dort „Amount of randomness injected into the response“ und der Zusatz, dass die Ergebnisse auch bei 0,0 nicht vollständig wiederholbar sind; An `top_p` steht der Hinweis „Recommended for advanced use cases only“. Unter `top_p` steht außerdem, wie die Auswahl zustande kommt, und zwar in der ersten Person Mehrzahl: „we compute the cumulative distribution over all the options for each subsequent token in decreasing probability order and cut it off once it reaches a particular probability specified by `top_p`“. Das belegt, wo die Ziehung stattfindet: beim Anbieter. Dieselbe Seite belegt zweitens, wie dieser Anbieter die Rollen führt. Zu den Nachrichten steht dort „Our models are trained to operate on alternating `user` and `assistant` conversational turns“, die Trennung kommt also aus dem Training. Die Systemanweisung steht dabei außerhalb der Nachrichtenliste: Zum Feld `system` heißt es dort, für Eingabenachrichten gebe es in dieser Schnittstelle keine Rolle dieses Namens. Abgerufen am 06.08.2026. Wie viele Regler die Seite insgesamt führt, ist von hier aus nicht zu messen: Sie lädt ihre Parameterliste nicht in den sichtbaren Text, siehe die Notiz.

  • Dokumentationerreichbar

    Anthropic, Claude API errors (externe Seite, platform.claude.com)

    platform.claude.comgeprüft 24.09.2026

    Die Liste der Fehlercodes samt der Frage, welcher davon einen zweiten Versuch verdient. Dieselbe Seite führt die Kennung, die jede Antwort mitbringt, und belegt, dass die neueren Modelle das von Hand gesetzte Denkbudget abweisen.

  • Dokumentationerreichbar

    OpenAI, Reasoning models (externe Seite, platform.openai.com)

    platform.openai.comgeprüft 24.09.2026

    Die Anleitung zu den Modellen, die vor der Antwort nachdenken. Gesteuert wird dort über einen Aufwandswert an derselben Stelle, an der früher die Ziehung eingestellt wurde. Die Anleitung nennt sieben Namen von none bis max und sagt im selben Satz dazu, welche davon gelten, sei modellabhängig. Sie belegt außerdem, dass das Modell innerhalb einer Stufe selbst entscheidet, wie viel Aufwand eine Aufgabe bekommt.

  • Artikelerreichbar

    Defeating Nondeterminism in LLM Inference (externe Seite, thinkingmachines.ai)

    thinkingmachines.aigeprüft 24.09.2026

    Die Untersuchung, die den verbreiteten Verdacht ausräumt, die Parallelität der Grafikkarte mische die Rechenreihenfolge auf. Der einzelne Rechenschritt ist wiederholbar, der Unterschied entsteht eine Ebene höher: Ein Schritt liefert je nach Größe des Stapels, in dem er mitläuft, leicht verschiedene Zahlen, und die Stapelgröße hängt an den fremden Anfragen im selben Moment. Gemessen an einem offenen Modell bei Temperatur 0 und tausend Token je Antwort: achtzig verschiedene Ergebnisse aus tausend Läufen, alle gleich bis zum 102. Token. Zu lesen ist der Text mit einer Einschränkung, die er selbst nennt: Die Lösung, mit der danach alle tausend Läufe gleich ausfallen, stammt von denselben Autoren.

  • Originalarbeiterreichbar

    Fast Inference from Transformers via Speculative Decoding (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Arbeit von Leviathan, Kalman und Matias vom 30.11.2022, die das spekulative Entwerfen vorgestellt hat. Wichtig für dieses Kapitel ist die Reichweite ihrer Zusage: Erhalten bleibt die Verteilung, aus der gezogen wird. Bei der reinen Spitzenwahl fällt das mit dem einzelnen Text zusammen. Sobald gezogen wird, ist es zweierlei. Die gemessene zwei- bis dreifache Beschleunigung bei gleichen Ausgaben stammt von einem einzigen Modell ihrer Erhebung, T5-XXL.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.