Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenGrundkursKapitel 02von 16 im Pfad

Was ein Sprachmodell tut

Tiefe 1: Ganz von vorn · Lesezeit 7 Min. · Stand

Stellen Sie sich jemanden vor, der unzählige Texte gelesen hat. Millionen Bücher, Foren, Anleitungen, Zeitungsartikel. Diese Person kann in keinem davon nachschlagen, es gibt kein Regal und kein Verzeichnis. Geblieben ist ein Gefühl dafür, was in einem gegebenen Zusammenhang als Nächstes kommt.

Genau das ist ein Sprachmodell.

Es rät das nächste Stück

Wenn Sie schreiben „Die Hauptstadt von Frankreich ist“, dann hat das Modell keine Landkarte im Kopf. Frankreich, Hauptstadt und Paris standen in seinen Texten tausendfach beieinander, daraus ist eine sehr starke Verbindung geworden. Also schreibt es „Paris“.

Die Verbindung hängt an der Sache selbst. Fragen Sie nach dem Regierungssitz, fragen Sie auf Englisch oder in einem verschachtelten Satz: Sie bekommen dieselbe Antwort. Eine auswendig gelernte Satzfortsetzung könnte das nicht.

Danach hängt es das nächste Stück an. Und das nächste. Ein Wort nach dem anderen, immer auf Basis von allem, was bisher dasteht.

Ein angefangener Satz und die Wahrscheinlichkeiten, mit denen ein Modell das nächste Wort wählt. WAS DASTEHT Die Hauptstadt von Frankreich ist Das Modell füllt nur diese Lücke. WAS ES FÜR MÖGLICH HÄLT Paris sehr wahrscheinlich die möglich, etwa „die Stadt Paris“ seit selten, etwa „seit 987 Paris“ weitere zehntausende Möglichkeiten, jede fast bei null VERANSCHAULICHUNG Die Balken zeigen das Prinzip, keine gemessenen Werte. Echte Zahlen hängen vom Modell ab.

seitlich verschiebbar

Gewählt wird das nächste Wort, nicht die Antwort.

eigene Darstellung zur Veranschaulichung, keine gemessenen Werte

Wichtig an dieser Darstellung ist, was nicht darin vorkommt: keine Landkarte, kein Nachschlagewerk, keine Prüfung. Nur eine Rangfolge möglicher nächster Wörter. Nachschlagen und Rechnen kommen später hinzu, als eigener Schritt außerhalb des Modells, siehe Kapitel 09.

Warum das trotzdem klug wirkt

Weil Sprache und Wissen eng zusammenhängen. Wer weiß, welche Wörter zusammen vorkommen, wirkt so, als wüsste er, wovon er redet. Für die meisten Alltagsfragen reicht das erstaunlich weit.

Und warum es manchmal danebengeht

Weil dasselbe Verfahren auch dann eine Antwort erzeugt, wenn es die Antwort nicht gibt. Sagen, dass ihm etwas fehlt, kann ein Modell durchaus. Von allein tut es das selten, und der Ton bleibt derselbe: Es schreibt weiter, so flüssig wie vorher. Erfundenes klingt genauso überzeugend wie Richtiges.

Woran Sie es erkennen, steht in Kapitel 07. Dort steht auch, warum das Zurückhalten so selten vorkommt, denn mit der Bauweise hat es wenig zu tun.

Woran Sie sich halten können

Ein Sprachmodell ist ein sehr guter Formulierer und ein unzuverlässiger Zeuge. Nutzen Sie es für alles, wo Sie das Ergebnis selbst beurteilen können. Bei allem anderen prüfen Sie nach.

Wie es weitergeht

Bisher war von „Wörtern“ die Rede, weil sich das leichter liest. Genau genommen arbeitet ein Modell mit Token statt mit Wörtern, und diese Unterscheidung erklärt eine ganze Reihe von Eigenheiten: warum deutscher Text mehr kostet als englischer, warum Modelle Buchstaben nicht zuverlässig zählen können, und warum irgendwann der Anfang eines langen Gesprächs verloren geht.

Darum geht es in Kapitel 03.

Quellen

8 Einträge, davon 5 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitAnkündigung des Herstellerserreichbar

    Introducing ChatGPT (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    Die Ankündigung vom 30.11.2022, mit der Sprachmodelle aus der Fachwelt heraustraten. Aufschlussreich ist der Wortlaut: Statt eines Modells mit Versionsnummer nennt OpenAI nur eine Herkunft, ChatGPT sei aus einem Modell der GPT-3.5-Serie einem Fine-Tuning unterzogen worden. Die Anwendung bekam einen Namen, das Modell dahinter blieb ungenannt. Diese Trennung besteht bis heute.

    Archivfassung (externe Seite, web.archive.org)

  • SchlüsselarbeitOriginalarbeiterreichbar

    Attention Is All You Need (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Arbeit, mit der alles anfing. Vaswani und sieben Mitautoren stellen am 12.06.2017 die Transformer-Architektur vor und zeigen, dass ein Netz allein über den Mechanismus der Aufmerksamkeit auskommt, ohne die bis dahin übliche schrittweise Verarbeitung. Erst dadurch ließen sich Modelle sinnvoll auf viele Rechenkerne verteilen. Jedes GPT, jedes Claude und jedes Gemini steht auf dieser Arbeit. Abschnitt 3.2.3 hält die Einschränkung fest, die für alle fortsetzenden Modelle gilt: „self-attention layers in the decoder allow each position in the decoder to attend to all positions in the decoder up to and including that position“, dazu die Begründung „We need to prevent leftward information flow in the decoder to preserve the auto-regressive property“. Beide Stellen stehen im Volltext und sind deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.

    Archivfassung (externe Seite, web.archive.org)

  • SchlüsselarbeitOriginalarbeiterreichbar

    Calibrated Language Models Must Hallucinate (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Adam Tauman Kalai und Santosh S. Vempala, erschienen auf dem Symposium on Theory of Computing 2024. Die Arbeit zeigt eine statistische Untergrenze: Für Tatsachen, deren Wahrheit sich aus den Trainingsdaten nicht ermitteln lässt, muss ein Modell, das seine Sicherheit ehrlich abbildet, mit einer bestimmten Rate danebenliegen. Das hängt weder an der Architektur noch an der Datenqualität, ist also nicht wegzutrainieren.

    Archivfassung (externe Seite, web.archive.org)

  • SchlüsselarbeitOriginalarbeiterreichbar

    Why Language Models Hallucinate (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala und Edwin Zhang, 04.09.2025. Die Arbeit verschiebt die Frage von der Bauart auf die Bewertung. Ihre These: Training und Prüfverfahren belohnen das Raten und bestrafen das Eingeständnis von Unsicherheit, und Halluzination ist die erwartbare Folge davon. Unter einer Benotung, die nur richtig und falsch kennt, ist Enthaltung nie die bessere Wahl.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Lost in the Middle: How Language Models Use Long Contexts (externe Seite, aclanthology.org)

    aclanthology.orggeprüft 24.09.2026

    Die Arbeit von Nelson F. Liu und sechs weiteren, aus der der Ausdruck stammt. Sie misst, wie sich die Antwortgüte ändert, wenn dieselbe Information an verschiedenen Stellen eines langen Kontexts steht, und findet einen U-förmigen Verlauf: Anfang und Ende werden zuverlässig genutzt, die Mitte nicht. Erschienen in den Transactions of the Association for Computational Linguistics 2024, DOI 10.1162/tacl_a_00638.

  • Originalarbeiterreichbar

    Language Models are Few-Shot Learners (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    GPT-3, eingereicht am 28.05.2020. Zeigt, dass ein ausreichend großes Modell Aufgaben löst, für die es nie eigens trainiert wurde, wenn man ihm im Text ein paar Beispiele vorlegt. Das ist der Grund, warum Prompting überhaupt funktioniert. Die Zusammenfassung beschreibt außerdem, was vorher galt: Ein Sprachverarbeitungssystem brauchte für jede Aufgabe eigens gesammelte Beispiele, Tausende bis Zehntausende.

    Archivfassung (externe Seite, web.archive.org)

  • Ankündigung des Herstellerserreichbar

    Why language models hallucinate (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    OpenAIs eigene Darstellung der Arbeit vom Vortag, 05.09.2025. Sie enthält den Vergleich mit dem Multiple-Choice-Bogen und die Tabelle, die zeigt, was Enthaltung kostet: Ein Modell, das bei jeder zweiten Frage schweigt, kommt auf 26 Prozent Falschauskunft, eines, das fast immer antwortet, auf 75 Prozent, bei fast gleicher Trefferquote. Beleg auch für die Gegenthese zur behaupteten Unvermeidbarkeit.

    Archivfassung (externe Seite, web.archive.org)

  • Originalarbeiterreichbar

    Found in the Middle: Calibrating Positional Attention Bias Improves Long Context Utilization (externe Seite, aclanthology.org)

    aclanthology.orggeprüft 24.09.2026

    Cheng-Yu Hsieh und zehn weitere liefern die Erklärung hinter dem Befund: Die Aufmerksamkeit verteilt sich U-förmig über die Eingabe, Anfang und Ende bekommen mehr davon, und zwar unabhängig davon, wie wichtig die Stelle ist. Damit hängt der Effekt an der Position statt am Inhalt. Erschienen in den Findings of the ACL 2024.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.