NachschlagenGlossar
Die Wörter, die hier vorkommen
Jeder Begriff in einem Satz, danach in einem Absatz. Wo ein Kapitel ihn ausführlich erklärt, steht der Verweis dabei. Die Zeile „auch" ist kein Beiwerk: Diese Zweitwörter stehen im Suchindex und sind der Grund, warum die Suche auch dann etwas findet, wenn im Text ein anderes Wort steht als in der Frage.
30 Begriffe16 mit Kapitelverweis100 Zweitwörter im Index
Agent
Ein System, das ein Ziel in mehreren Schritten verfolgt: planen, Werkzeug wählen, Ergebnis prüfen, weitermachen.
Der Unterschied zum Assistenten ist die Schleife. Ein Assistent antwortet einmal, ein Agent arbeitet weiter, bis ein Abbruchkriterium greift. Die schwierigen Fragen sind deshalb nicht die Fähigkeiten, sondern die Grenzen: Wann hört er auf, was darf er anfassen, und wer merkt es, wenn er sich verrennt.
auchAgenten · Agentic · KI-Agent · Agentensystem
Anwendung
Das Programm, das Sie bedienen. Es benutzt im Inneren ein Sprachmodell.
Oberfläche, Gesprächsverlauf, Systemanweisung, Dateiverarbeitung, Suche, Rechteverwaltung. Hier entsteht der weitaus größte Teil dessen, was Menschen als Verhalten wahrnehmen. ChatGPT ist eine Anwendung, GPT-4o ist ein Modell.
auchChatprogramm · Chatbot · App · Assistent
Kapitel 01 · Was ein Sprachmodell istIntroducing ChatGPT (externe Seite, openai.com)siehe Sprachmodellsiehe Laufzeitumgebung
Byte Pair EncodingBPE
Das Verfahren, mit dem fast alle heutigen Tokenizer arbeiten. Häufige Zeichenfolgen werden zu einem Token zusammengefasst.
Ursprünglich ein Verfahren zur Datenkompression, 2015 auf Sprache übertragen. Damit war das Problem seltener Wörter gelöst: Ein unbekanntes Wort gilt nicht mehr als unbekannt, sondern zerfällt in bekannte Teile.
auchBPE · Subword-Verfahren · Subword Units
Kapitel 03 · Token, die Bausteine der SpracheNeural Machine Translation of Rare Words with Subword Units (externe Seite, arxiv.org)siehe Tokenizersiehe Vokabular
Embedding
Die Darstellung eines Textstücks als Zahlenreihe, in der ähnliche Bedeutungen nah beieinander liegen.
Embeddings sind die Grundlage der Ähnlichkeitssuche: Statt nach denselben Wörtern zu suchen, sucht man nach nahen Zahlenreihen. Deshalb findet eine Suche über Embeddings auch dann etwas, wenn im Text ein anderes Wort steht als in der Frage.
auchVektor · Einbettung · Vektorraum
Feinjustierung
Nachtraining eines fertigen Modells auf ein engeres Ziel, etwa auf hilfreiche Antworten in Gesprächsform.
Verglichen mit dem Vortraining ein kleiner Eingriff, der das Verhalten trotzdem stark verändert. ChatGPT entstand aus einem feinjustierten Modell der GPT-3.5-Serie. Wer heute von einem Chatmodell spricht, meint fast immer ein feinjustiertes Modell, nicht das rohe Vortrainingsergebnis.
auchFine-Tuning · Finetuning · Nachtraining · RLHF
Introducing ChatGPT (externe Seite, openai.com)siehe Vortrainingsiehe GPT
Gewichte
Die gelernten Zahlen im Inneren eines Modells. Sie sind das Ergebnis des Trainings.
Ein Modell besteht aus Architektur und Gewichten. Die Architektur ist der Bauplan, die Gewichte sind das Gelernte. Offene Modelle geben die Gewichte frei, geschlossene nicht. Die Zahl der Gewichte wird als Parameterzahl angegeben und sagt für sich genommen wenig über die Qualität.
auchWeights · Parameter · Parameterzahl
GPT
Generative Pre-trained Transformer. Eine Bauart von Sprachmodellen, oft als Name für einzelne Modelle verwendet.
Generative heißt, es erzeugt Text. Pre-trained heißt, es wurde erst auf sehr viel unbeschriftetem Text vortrainiert und danach für einzelne Aufgaben nachjustiert. Transformer ist die Bauform. GPT ist damit weder ein Produkt noch ein Hersteller, sondern eine Beschreibung.
auchGPT-3 · GPT-4 · GPT-4o · Generative Pre-trained Transformer
Kapitel 01 · Was ein Sprachmodell istImproving Language Understanding by Generative Pre-Training (externe Seite, openai.com)siehe Transformersiehe Vortrainingsiehe Sprachmodell
Guardrails
Regeln und Prüfungen um ein Modell herum, die verhindern sollen, dass es Schaden anrichtet.
Guardrails sitzen vor der Eingabe, hinter der Ausgabe oder um die Werkzeuge herum. Sie sind Teil des Systems, nicht des Modells, und lassen sich deshalb ändern, ohne das Modell anzufassen. Umgekehrt heißt das: Zwei Anwendungen mit demselben Modell können sich sehr unterschiedlich verhalten.
auchLeitplanken · Sicherheitsfilter · Schutzmechanismen
Halluzination
Eine flüssig formulierte, aber falsche Angabe. Kein Fehler im Betrieb, sondern die Kehrseite des Verfahrens.
Ein Modell wählt das wahrscheinlichste nächste Token, nicht das wahre. Wo es nichts Passendes gelernt hat, erzeugt es trotzdem etwas Plausibles. Warnsignale sind sehr genaue Zahlen ohne Quelle, erfundene Zitate und auffällig glatte Antworten auf schwierige Fragen.
auchHalluzinieren · Konfabulation · erfundene Angaben · Hallucination
Harness
Das Gerüst um ein Modell herum: Anweisungen, Werkzeuge, Schleifen, Grenzen, Protokolle.
Bei gleichbleibendem Modell entscheidet das Gerüst oft mehr über die Qualität des Ergebnisses als die Wahl des Modells. Dazu gehören auch die unspektakulären Teile: Zeitlimits, Anbieter-Fallback, Verbrauchsprotokollierung, Freigabelisten, Watchdogs.
auchGerüst · Agentengerüst · Scaffolding
Inferenz
Der laufende Betrieb eines fertigen Modells: rechnen, um eine Antwort zu erzeugen.
Training findet einmal statt, Inferenz bei jeder Anfrage. Deshalb entscheidet die Inferenz über die laufenden Kosten. Ein Modell wird nicht klüger, wenn man es öfter aufruft; es rechnet nur öfter dasselbe Verfahren durch.
auchInference · Ausführung · Laufzeit
Kontext
Alles, was dem Modell bei einer Anfrage mitgegeben wird. Was nicht darin steht, existiert für das Modell nicht.
Der Kontext ist der Arbeitsspeicher des Modells und kein Gedächtnis: Er wird bei jeder Anfrage neu zusammengesetzt und mitgeschickt. Dass ein Chatprogramm sich an gestern erinnert, liegt nicht am Modell, sondern daran, dass die Anwendung Gespeichertes erneut in den Kontext legt.
auchContext · Arbeitsspeicher · Gesprächsverlauf
Kapitel 01 · Was ein Sprachmodell istKapitel 02 · Was ein Sprachmodell tutKapitel 04 · Der Promptsiehe Kontextfenstersiehe Promptsiehe RAG
Kontextfenster
Die Obergrenze an Token, die ein Modell in einem Durchgang gleichzeitig berücksichtigen kann.
Ist das Fenster voll, muss etwas weichen, und was weicht, ist für das Modell nicht mehr vorhanden. Ein größeres Fenster ist deshalb kein besseres Gedächtnis, sondern nur ein größerer Tisch. Ein Gespräch je Thema ist meist wirksamer als ein sehr langes Gespräch über alles.
auchContext Window · Fenstergröße · Kontextlänge
Kapitel 03 · Token, die Bausteine der SpracheKapitel 04 · Der Promptsiehe Kontextsiehe Token
Laufzeitumgebung
Die Schicht zwischen Modellkern und Anwendung: lädt das Modell, nimmt Anfragen an, setzt Grenzen, ruft Werkzeuge auf.
Sie beeinflusst Antwortzeit und Kosten stärker als die Modellwahl und ist der Grund, warum dieselben Gewichte bei zwei Anbietern unterschiedlich teuer und unterschiedlich schnell sind. Stapelverarbeitung mehrerer Anfragen, Wiederverwendung berechneter Zustände, gestreamte Ausgabe, Kontingente.
auchServing · Serving-Schicht · Inference-Server · Runtime
Kapitel 01 · Was ein Sprachmodell istsiehe Modellkernsiehe Inferenz
Model Context ProtocolMCP
Ein offener Standard dafür, wie ein Modell an fremde Werkzeuge und Datenquellen angebunden wird.
Vor MCP war jede Anbindung eine Einzellösung für ein bestimmtes Programm. Mit einem gemeinsamen Protokoll lässt sich ein Werkzeug einmal bereitstellen und von verschiedenen Anwendungen nutzen. Das ist weniger eine technische als eine ökonomische Änderung.
auchMCP · Model Context Protocol · Werkzeuganbindung
Model Context Protocol, Spezifikation (externe Seite, modelcontextprotocol.io)siehe Werkzeugsiehe Agent
Modellkern
Architektur, gelernte Werte und Tokenizer. Der Teil, der ausgetauscht wird, wenn ein Modell erneuert wird.
Zum Kern gehören die Architektur, die Gewichte, das Vokabular und der Tokenizer. Nicht dazu gehören Systemanweisung, Sampling-Einstellungen, Kontextverwaltung, Werkzeuge, Sicherheitsfilter und Zwischenspeicher. Alles davon verändert das beobachtbare Verhalten erheblich, ohne ein einziges Gewicht anzufassen.
auchKern · Modellgewichte · Basismodell
Kapitel 01 · Was ein Sprachmodell istsiehe Gewichtesiehe Laufzeitumgebungsiehe Tokenizer
Multimodal
Ein Modell, das nicht nur Text verarbeitet, sondern auch Bild, Ton oder Video.
Zwei Bauformen werden oft verwechselt: mehrere hintereinandergeschaltete Modelle, von denen eines Bilder beschreibt und ein zweites den Text verarbeitet, oder ein einziges Modell, das alle Formen gemeinsam gelernt hat. Nur das Zweite ist im engeren Sinn multimodal.
auchMultimodalität · Bildverstehen · Vision
GPT-4 (externe Seite, openai.com)Hello GPT-4o (externe Seite, openai.com)siehe Sprachmodell
Prompt
Die Eingabe an ein Sprachmodell. Nicht nur die getippte Frage, sondern alles, was das Modell zu sehen bekommt.
Zum Prompt gehören die Systemanweisung, die Nutzereingabe, der bisherige Gesprächsverlauf und die Ergebnisse aufgerufener Werkzeuge. Wer nur die getippte Zeile für den Prompt hält, wundert sich über Antworten, die auf etwas Bezug nehmen, das nirgends sichtbar steht.
auchEingabe · Anweisung · Systemprompt · Prompting
Prompt Injection
Ein Angriff, bei dem Anweisungen in Daten versteckt werden, die das Modell verarbeitet.
Ein Modell unterscheidet nicht zuverlässig zwischen dem, was es tun soll, und dem, was es lesen soll. Steht in einer eingelesenen Webseite oder Datei eine Anweisung, kann sie befolgt werden. Das ist kein Bedienfehler, sondern eine Eigenschaft des Verfahrens, und der Grund, warum Werkzeugrechte eng gesetzt gehören.
auchInjection · Prompt-Angriff · Indirect Prompt Injection
RAG
Nachschlagen statt erinnern: Passende Textstellen werden gesucht und dem Modell in den Kontext gelegt.
Retrieval Augmented Generation. Das Modell lernt dabei nichts dazu, es bekommt nur die richtigen Belege vorgelegt. Das ist der übliche Weg, um Antworten aus eigenen Dokumenten zu erhalten, und der Grund, warum ein schlechtes Suchergebnis eine falsche Antwort erzeugt, obwohl das Modell fehlerfrei arbeitet.
auchRetrieval Augmented Generation · Wissensbasis · Vektordatenbank · Embedding-Suche
Reasoning-Modell
Ein Modell, das vor der Antwort sichtbare oder unsichtbare Zwischenschritte erzeugt und dafür mehr Rechenzeit verbraucht.
Der Zugewinn entsteht zur Antwortzeit, nicht beim Training. Ob dieses Verhalten im Modell trainiert ist oder von der Umgebung erzwungen wird, lässt sich von außen nicht sicher unterscheiden. Damit verwischt die saubere Trennung zwischen Modell und System.
auchReasoning · Chain-of-Thought · Denkschritte · Schlussfolgern
Kapitel 01 · Was ein Sprachmodell istsiehe Inferenzsiehe Modellkern
SprachmodellLLM
Eine sehr große Datei mit gelernten Zahlen, die aus Text weiteren Text erzeugen kann.
Ein Bauteil, kein Programm. Es nimmt eine Folge von Token entgegen und gibt eine Wahrscheinlichkeitsverteilung für das nächste Token zurück. Es hat kein Gedächtnis, keine Uhr und keinen Netzzugang. Alles, was darüber hinausgeht, macht die Anwendung drumherum.
auchLarge Language Model · LLM · großes Sprachmodell · Modell
Kapitel 01 · Was ein Sprachmodell istAttention Is All You Need (externe Seite, arxiv.org)siehe Anwendungsiehe Modellkernsiehe Token
Temperatur
Eine Einstellung, die bestimmt, wie stark das Modell vom wahrscheinlichsten Token abweichen darf.
Niedrige Temperatur führt zu vorhersagbaren, gleichförmigen Antworten, hohe zu abwechslungsreichen und riskanteren. Dass dieselbe Frage zweimal unterschiedlich beantwortet wird, ist deshalb meist keine Fehlfunktion, sondern eine Einstellung.
auchTemperature · Sampling · top_p
Token
Die Recheneinheit von Text. Nicht Wort, nicht Buchstabe, sondern ein Stück dazwischen.
Ein Sprachmodell liest keine Wörter, sondern Token aus einem festen Vokabular. Häufige Wörter sind ein Token, seltene zerfallen in mehrere Teile. Deutsche Texte brauchen für dieselbe Aussage mehr Token als englische, und weil nach Token abgerechnet wird, schlägt das direkt auf die Kosten durch.
auchTokens · Recheneinheit
Kapitel 03 · Token, die Bausteine der SpracheNeural Machine Translation of Rare Words with Subword Units (externe Seite, arxiv.org)siehe Tokenizersiehe Vokabularsiehe Kontextfenster
Tokenizer
Das Programmstück, das Text in Token zerlegt und Token wieder zu Text zusammensetzt.
Der Tokenizer gehört zwingend zum Modell: Dieselben Gewichte mit einem anderen Vokabular ergeben ein anderes Modell. Er wird beim Reden über Modelle gern vergessen, entscheidet aber darüber, wie sparsam eine Sprache verarbeitet wird.
auchZerleger · Textzerlegung
Kapitel 03 · Token, die Bausteine der SpracheTiktokenizer (externe Seite, tiktokenizer.vercel.app)Tokenizer von OpenAI (externe Seite, platform.openai.com)siehe Tokensiehe Byte Pair Encodingsiehe Vokabular
Transformer
Die Bauform, auf der heutige Sprachmodelle beruhen. Sie kommt allein über den Mechanismus der Aufmerksamkeit aus.
Vorgestellt 2017. Der entscheidende Punkt war nicht nur die Qualität, sondern die Parallelisierbarkeit: Ohne die bis dahin übliche schrittweise Verarbeitung lassen sich Modelle auf viele Rechenkerne verteilen und damit deutlich größer bauen. Das T in GPT steht dafür.
auchTransformer-Architektur · Attention · Aufmerksamkeit · Self-Attention
Kapitel 01 · Was ein Sprachmodell istAttention Is All You Need (externe Seite, arxiv.org)siehe Sprachmodellsiehe GPT
Vibe Coding
Programmieren, bei dem der Schwerpunkt vom Schreiben des Codes auf das Beschreiben und Prüfen verschiebt.
Der Begriff kam 2025 auf. Er beschreibt weniger ein Werkzeug als eine Arbeitsteilung: Absicht formulieren, Ergebnis prüfen, nachsteuern. Die Schwierigkeit wandert damit vom Tippen zum Beurteilen, und die Prüfung wird zum Engpass.
auchVibecoding · KI-gestütztes Programmieren
Vokabular
Die feste Liste aller Token, die ein Modell kennt. Jedes Token trägt darin eine Nummer.
Die Größe des Vokabulars ist eine Bauentscheidung: Ein größeres Vokabular braucht weniger Token je Satz, macht das Modell aber an anderer Stelle teurer. Modelle derselben Familie teilen sich oft ein Vokabular, verschiedene Familien fast nie.
auchVocabulary · Vokabular-Größe · o200k_base · cl100k_base
Kapitel 03 · Token, die Bausteine der Sprachesiehe Tokensiehe Tokenizer
Vortraining
Der erste und teuerste Schritt: Ein Modell lernt aus sehr viel Text, das jeweils nächste Token vorherzusagen.
Hier entsteht das meiste von dem, was ein Modell kann. Das Vortraining findet einmal statt, dauert Wochen bis Monate und kostet den überwiegenden Teil der Rechenzeit. Alles danach justiert nur noch nach.
auchPre-Training · Pretraining · Training
Improving Language Understanding by Generative Pre-Training (externe Seite, openai.com)siehe Feinjustierungsiehe Gewichte
Werkzeug
Ein Programm, das ein Modell aufrufen darf, um etwas zu tun, was es selbst nicht kann.
Ein Modell kann nicht rechnen, nicht im Netz nachsehen und keine Datei speichern. Es kann aber äußern, dass es genau das möchte, und die Umgebung führt es aus und legt das Ergebnis in den Kontext. Ab diesem Punkt handelt ein System, statt nur zu antworten.
auchTool · Tool-Use · Funktionsaufruf · Function Calling
Das Glossar wächst mit den Kapiteln. Ein Begriff kommt hinein, wenn er auf der Seite vorkommt und nicht selbsterklärend ist, nicht weil er gerade oft genannt wird.