GrundlagenGrundkursKapitel 02von 16 im Pfad
Was ein Sprachmodell tut
Stellen Sie sich jemanden vor, der unzählige Texte gelesen hat. Millionen Bücher, Foren, Anleitungen, Zeitungsartikel. Diese Person kann in keinem davon nachschlagen, es gibt kein Regal und kein Verzeichnis. Geblieben ist ein Gefühl dafür, was in einem gegebenen Zusammenhang als Nächstes kommt.
Genau das ist ein Sprachmodell.
Es rät das nächste Stück
Wenn Sie schreiben „Die Hauptstadt von Frankreich ist“, dann hat das Modell keine Landkarte im Kopf. Frankreich, Hauptstadt und Paris standen in seinen Texten tausendfach beieinander, daraus ist eine sehr starke Verbindung geworden. Also schreibt es „Paris“.
Die Verbindung hängt an der Sache selbst. Fragen Sie nach dem Regierungssitz, fragen Sie auf Englisch oder in einem verschachtelten Satz: Sie bekommen dieselbe Antwort. Eine auswendig gelernte Satzfortsetzung könnte das nicht.
Danach hängt es das nächste Stück an. Und das nächste. Ein Wort nach dem anderen, immer auf Basis von allem, was bisher dasteht.
seitlich verschiebbar
eigene Darstellung zur Veranschaulichung, keine gemessenen Werte
Wichtig an dieser Darstellung ist, was nicht darin vorkommt: keine Landkarte, kein Nachschlagewerk, keine Prüfung. Nur eine Rangfolge möglicher nächster Wörter. Nachschlagen und Rechnen kommen später hinzu, als eigener Schritt außerhalb des Modells, siehe Kapitel 09.
Warum das trotzdem klug wirkt
Weil Sprache und Wissen eng zusammenhängen. Wer weiß, welche Wörter zusammen vorkommen, wirkt so, als wüsste er, wovon er redet. Für die meisten Alltagsfragen reicht das erstaunlich weit.
Und warum es manchmal danebengeht
Weil dasselbe Verfahren auch dann eine Antwort erzeugt, wenn es die Antwort nicht gibt. Sagen, dass ihm etwas fehlt, kann ein Modell durchaus. Von allein tut es das selten, und der Ton bleibt derselbe: Es schreibt weiter, so flüssig wie vorher. Erfundenes klingt genauso überzeugend wie Richtiges.
Woran Sie es erkennen, steht in Kapitel 07. Dort steht auch, warum das Zurückhalten so selten vorkommt, denn mit der Bauweise hat es wenig zu tun.
Woran Sie sich halten können
Ein Sprachmodell ist ein sehr guter Formulierer und ein unzuverlässiger Zeuge. Nutzen Sie es für alles, wo Sie das Ergebnis selbst beurteilen können. Bei allem anderen prüfen Sie nach.
Wie es weitergeht
Bisher war von „Wörtern“ die Rede, weil sich das leichter liest. Genau genommen arbeitet ein Modell mit Token statt mit Wörtern, und diese Unterscheidung erklärt eine ganze Reihe von Eigenheiten: warum deutscher Text mehr kostet als englischer, warum Modelle Buchstaben nicht zuverlässig zählen können, und warum irgendwann der Anfang eines langen Gesprächs verloren geht.
Darum geht es in Kapitel 03.
Sie haben schon mit einem Chatprogramm gearbeitet und wollen wissen, was tiefer darunter passiert. Wichtig ist dabei die Trennung: Ein Chatprogramm ist eine Anwendung, das Sprachmodell ist ein Bauteil darin. Was gleich beschrieben wird, betrifft das Bauteil.
Der Kern ist schlichter, als die meisten erwarten: Ein Sprachmodell berechnet für jedes mögliche nächste Token eine Wahrscheinlichkeit und wählt eines davon aus.
Token statt Wörter
Text wird vor der Verarbeitung zerlegt, und zwar in Stücke, die zwischen Wort
und Buchstabe liegen. Häufige Wörter sind ein Token, seltene zerfallen in
mehrere. Maßgeblich ist also die Häufigkeit im Vokabular, und die trifft
deutsche Fachwörter und Komposita härter als englische: „Künstliche Intelligenz“
braucht im Vokabular o200k_base sechs Token, „artificial intelligence“ zwei.
Am Umlaut liegt das entgegen der verbreiteten Annahme nicht. Im selben Vokabular sind „verändert“, „fährt“ und „Gerät“ je ein einziges Token, und ein deutscher Alltagssatz liegt mit seiner englischen Entsprechung gleichauf. Wie groß der Aufschlag im eigenen Text ausfällt, zeigt das Werkzeug in Kapitel 03.
Die Auswahl ist nicht immer dieselbe
Das Modell liefert eine Rangliste über alle möglichen nächsten Token, und damit ist seine Arbeit getan. Welcher Eintrag daraus genommen wird, entscheidet das Programm davor: immer der Spitzenreiter, oder mit etwas Streuung darunter. Über einen Parameter lässt sich das einstellen. Deshalb bekommen Sie auf dieselbe Frage zweimal unterschiedliche Antworten. Dahinter steckt eine Einstellung, kein Fehler.
Der Kontext ist der ganze Zustand
Ein Modell hat kein Gedächtnis zwischen zwei Aufrufen. Was es zu wissen scheint, steht entweder in seinen Gewichten oder im Kontext, den es gerade mitbekommt: Systemanweisung, bisheriger Verlauf, Ihre Eingabe, Ergebnisse von Tools. Was weder in den Gewichten noch im Kontext steht, existiert für das Modell nicht.
Der Unterschied zwischen beiden Quellen ist der Zeitpunkt. Die Gewichte stehen seit dem Training fest und haben einen Stichtag, siehe Kapitel 08. Alles Neuere, alles Betriebsinterne und alles Persönliche muss bei jedem Aufruf jemand hineinlegen, und das ist die Aufgabe der Anwendung.
Halluzination ist die Kehrseite des Verfahrens
Ein Modell, das immer das plausibel nächste Token erzeugt, produziert auch dann weiter, wenn die Grundlage fehlt. Ein „ich weiß es nicht“ wäre ihm dabei durchaus möglich, denn Modelle können sich enthalten, wenn sie unsicher sind (externe Seite, openai.com). Warum sie es selten tun, hat zwei Antworten auf zwei Ebenen.
Ein Sockel bleibt immer. Kalai und Vempala haben eine statistische Untergrenze hergeleitet: Für Tatsachen, deren Wahrheit sich aus den Trainingsdaten nicht ermitteln lässt, ist eine gewisse Fehlerrate unvermeidlich. Die Herleitung hat ausdrücklich nichts mit der Transformer-Architektur oder der Datenqualität zu tun (externe Seite, arxiv.org), es geht also weder mit einer anderen Bauart weg noch mit besseren Daten.
Alles darüber ist eine Frage der Anreize. Dieselben Autoren zeigen ein Jahr später, dass Modelle halluzinieren, weil Training und Prüfverfahren das Raten belohnen (externe Seite, arxiv.org) und das Eingeständnis von Unsicherheit bestrafen. Wie viel des Ganzen darauf entfällt, ist offen. Fest steht, dass sich auf dieser Ebene etwas ändern lässt.
Wegpatchen lässt sich beides nicht. Deshalb wird von außen dagegen gearbeitet: mit nachgeschlagenen Belegen, mit Tools, die rechnen statt zu schätzen, und mit Prüfungen, die das Ergebnis gegen die Realität halten. Wie das im Einzelnen aussieht und was sich davon im Prompt einstellen lässt, steht in Kapitel 07.
Was daraus folgt
Wer ein Sprachmodell einsetzt, baut ein System um einen Textgenerator herum. Die Qualität entsteht überwiegend in diesem System, nicht im Modell.
Der Kern ist autoregressive Modellierung: Das Modell schätzt
P(token_t | token_1..t-1) über ein festes Vokabular und zieht daraus. Alles,
was nach Verstehen aussieht, ist eine Eigenschaft dieser Verteilung, nicht ein
zusätzlicher Mechanismus.
Was der Transformer beigetragen hat
Was ein neuronales Netz überhaupt ist und welche Bauformen es daneben gibt, steht in KI-Wissen, Kapitel 03.
Der Verzicht auf Rekurrenz macht die Verarbeitung einer Sequenz beim Training parallelisierbar, und das war eine der Voraussetzungen für Läufe dieser Größenordnung. Für die Ausgabe gilt es nicht. Jedes erzeugte Token hängt an den zuvor erzeugten, die Antwort entsteht also seriell, ein Schritt je Token. Der Unterschied erklärt, warum ein Modell einen vorliegenden Text in einem Zug verarbeitet und seine Antwort trotzdem tröpfelnd ausgibt.
Die Architektur selbst ist seit 2017 erstaunlich stabil; skaliert wurden vor allem Parameterzahl, Datenmenge und Kontextlänge.
Sampling ist eine Produktentscheidung
Temperatur, Top-p und Top-k bestimmen, wie weit die Ziehung von der Spitze abweicht. Bei Temperatur 0 fällt die Streuung der Ziehung weg und es bleibt der Spitzenreiter, was bei Aufgaben mit einer richtigen Antwort erwünscht ist. Höhere Werte kaufen Vielfalt mit Fehlerrisiko. Wer Reproduzierbarkeit braucht, schreibt Anweisung und Regler fest und protokolliert sie, dazu den Modellstand: Wechselt der Anbieter ihn, ist der Vergleich mit einem früheren Lauf hinfällig. Für zeichengleiche Ausgaben genügt selbst das nicht, die Gründe stehen in Kapitel 12.
Das Kontextfenster ist eine harte Grenze
Gemeint ist die maximale Sequenzlänge. Mit einem Gedächtnis im menschlichen Sinn hat das nichts zu tun. Alles, was hineinsoll, konkurriert um denselben Platz: Systemanweisung, Historie, abgerufene Dokumente, Tool-Ausgaben. Große Fenster verschieben das Problem. Dabei verteilt sich die Aufmerksamkeit U-förmig über die Eingabe, unabhängig von der Wichtigkeit der Stelle (externe Seite, aclanthology.org): Anfang und Ende bekommen mehr davon als die Mitte. Gemessen wurde das, indem dieselbe Angabe an verschiedene Stellen desselben Kontexts geschoben wurde, mit dem Ergebnis, dass Modelle Information in langen Eingaben nicht verlässlich nutzen (externe Seite, aclanthology.org). Was daraus für den Aufbau eines Prompts folgt, steht in Kapitel 05.
Wo Skalierung aufhört zu helfen
Größere Modelle verbessern breite Fähigkeiten. Ob eines sich bei Unsicherheit zurückhält, hängt daneben am Nachtraining und an der Einstellung, und zwei Modelle desselben Hauses können sich darin stärker unterscheiden als in ihrer Trefferquote. Die Zahlen dazu stehen in Kapitel 07. Der zweite Skalierungspfad verlagert Rechenzeit von der Trainings- in die Antwortzeit, indem das Modell Zwischenschritte erzeugt, bevor es antwortet. Auch das erzeugt nur mehr Gelegenheiten, einen Fehler zu bemerken, keine Gewissheit.
Konsequenz für die Architektur
Verlässlichkeit entsteht außerhalb des Modells: durch Tool Calls für alles Berechenbare, durch Grounding für alles Faktische, durch Prüfstrecken mit bekannter Soll-Ausgabe für alles Wiederkehrende.
Quellen
8 Einträge, davon 5 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitAnkündigung des Herstellerserreichbar
Introducing ChatGPT (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
Die Ankündigung vom 30.11.2022, mit der Sprachmodelle aus der Fachwelt heraustraten. Aufschlussreich ist der Wortlaut: Statt eines Modells mit Versionsnummer nennt OpenAI nur eine Herkunft, ChatGPT sei aus einem Modell der GPT-3.5-Serie einem Fine-Tuning unterzogen worden. Die Anwendung bekam einen Namen, das Modell dahinter blieb ungenannt. Diese Trennung besteht bis heute.
SchlüsselarbeitOriginalarbeiterreichbar
Attention Is All You Need (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Die Arbeit, mit der alles anfing. Vaswani und sieben Mitautoren stellen am 12.06.2017 die Transformer-Architektur vor und zeigen, dass ein Netz allein über den Mechanismus der Aufmerksamkeit auskommt, ohne die bis dahin übliche schrittweise Verarbeitung. Erst dadurch ließen sich Modelle sinnvoll auf viele Rechenkerne verteilen. Jedes GPT, jedes Claude und jedes Gemini steht auf dieser Arbeit. Abschnitt 3.2.3 hält die Einschränkung fest, die für alle fortsetzenden Modelle gilt: „self-attention layers in the decoder allow each position in the decoder to attend to all positions in the decoder up to and including that position“, dazu die Begründung „We need to prevent leftward information flow in the decoder to preserve the auto-regressive property“. Beide Stellen stehen im Volltext und sind deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.
SchlüsselarbeitOriginalarbeiterreichbar
Calibrated Language Models Must Hallucinate (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Adam Tauman Kalai und Santosh S. Vempala, erschienen auf dem Symposium on Theory of Computing 2024. Die Arbeit zeigt eine statistische Untergrenze: Für Tatsachen, deren Wahrheit sich aus den Trainingsdaten nicht ermitteln lässt, muss ein Modell, das seine Sicherheit ehrlich abbildet, mit einer bestimmten Rate danebenliegen. Das hängt weder an der Architektur noch an der Datenqualität, ist also nicht wegzutrainieren.
SchlüsselarbeitOriginalarbeiterreichbar
Why Language Models Hallucinate (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala und Edwin Zhang, 04.09.2025. Die Arbeit verschiebt die Frage von der Bauart auf die Bewertung. Ihre These: Training und Prüfverfahren belohnen das Raten und bestrafen das Eingeständnis von Unsicherheit, und Halluzination ist die erwartbare Folge davon. Unter einer Benotung, die nur richtig und falsch kennt, ist Enthaltung nie die bessere Wahl.
SchlüsselarbeitOriginalarbeiterreichbar
Lost in the Middle: How Language Models Use Long Contexts (externe Seite, aclanthology.org)
aclanthology.orggeprüft 24.09.2026
Die Arbeit von Nelson F. Liu und sechs weiteren, aus der der Ausdruck stammt. Sie misst, wie sich die Antwortgüte ändert, wenn dieselbe Information an verschiedenen Stellen eines langen Kontexts steht, und findet einen U-förmigen Verlauf: Anfang und Ende werden zuverlässig genutzt, die Mitte nicht. Erschienen in den Transactions of the Association for Computational Linguistics 2024, DOI 10.1162/tacl_a_00638.
Originalarbeiterreichbar
Language Models are Few-Shot Learners (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
GPT-3, eingereicht am 28.05.2020. Zeigt, dass ein ausreichend großes Modell Aufgaben löst, für die es nie eigens trainiert wurde, wenn man ihm im Text ein paar Beispiele vorlegt. Das ist der Grund, warum Prompting überhaupt funktioniert. Die Zusammenfassung beschreibt außerdem, was vorher galt: Ein Sprachverarbeitungssystem brauchte für jede Aufgabe eigens gesammelte Beispiele, Tausende bis Zehntausende.
Ankündigung des Herstellerserreichbar
Why language models hallucinate (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
OpenAIs eigene Darstellung der Arbeit vom Vortag, 05.09.2025. Sie enthält den Vergleich mit dem Multiple-Choice-Bogen und die Tabelle, die zeigt, was Enthaltung kostet: Ein Modell, das bei jeder zweiten Frage schweigt, kommt auf 26 Prozent Falschauskunft, eines, das fast immer antwortet, auf 75 Prozent, bei fast gleicher Trefferquote. Beleg auch für die Gegenthese zur behaupteten Unvermeidbarkeit.
Originalarbeiterreichbar
aclanthology.orggeprüft 24.09.2026
Cheng-Yu Hsieh und zehn weitere liefern die Erklärung hinter dem Befund: Die Aufmerksamkeit verteilt sich U-förmig über die Eingabe, Anfang und Ende bekommen mehr davon, und zwar unabhängig davon, wie wichtig die Stelle ist. Damit hängt der Effekt an der Position statt am Inhalt. Erschienen in den Findings of the ACL 2024.