NachschlagenGlossar

Die Wörter, die hier vorkommen

Jeder Begriff in einem Satz, danach in einem Absatz. Wo ein Kapitel ihn ausführlich erklärt, steht der Verweis dabei. Die Zeile „auch" ist kein Beiwerk: Diese Zweitwörter stehen im Suchindex und sind der Grund, warum die Suche auch dann etwas findet, wenn im Text ein anderes Wort steht als in der Frage.

30 Begriffe16 mit Kapitelverweis100 Zweitwörter im Index

Agent

Agenten

Ein System, das ein Ziel in mehreren Schritten verfolgt: planen, Werkzeug wählen, Ergebnis prüfen, weitermachen.

Der Unterschied zum Assistenten ist die Schleife. Ein Assistent antwortet einmal, ein Agent arbeitet weiter, bis ein Abbruchkriterium greift. Die schwierigen Fragen sind deshalb nicht die Fähigkeiten, sondern die Grenzen: Wann hört er auf, was darf er anfassen, und wer merkt es, wenn er sich verrennt.

auchAgenten · Agentic · KI-Agent · Agentensystem

siehe Werkzeugsiehe Harnesssiehe Model Context Protocol

Anwendung

Grundlagen

Das Programm, das Sie bedienen. Es benutzt im Inneren ein Sprachmodell.

Oberfläche, Gesprächsverlauf, Systemanweisung, Dateiverarbeitung, Suche, Rechteverwaltung. Hier entsteht der weitaus größte Teil dessen, was Menschen als Verhalten wahrnehmen. ChatGPT ist eine Anwendung, GPT-4o ist ein Modell.

auchChatprogramm · Chatbot · App · Assistent

Kapitel 01 · Was ein Sprachmodell istIntroducing ChatGPT (externe Seite, openai.com)siehe Sprachmodellsiehe Laufzeitumgebung

Byte Pair EncodingBPE

Grundlagen

Das Verfahren, mit dem fast alle heutigen Tokenizer arbeiten. Häufige Zeichenfolgen werden zu einem Token zusammengefasst.

Ursprünglich ein Verfahren zur Datenkompression, 2015 auf Sprache übertragen. Damit war das Problem seltener Wörter gelöst: Ein unbekanntes Wort gilt nicht mehr als unbekannt, sondern zerfällt in bekannte Teile.

auchBPE · Subword-Verfahren · Subword Units

Kapitel 03 · Token, die Bausteine der SpracheNeural Machine Translation of Rare Words with Subword Units (externe Seite, arxiv.org)siehe Tokenizersiehe Vokabular

Embedding

Agenten

Die Darstellung eines Textstücks als Zahlenreihe, in der ähnliche Bedeutungen nah beieinander liegen.

Embeddings sind die Grundlage der Ähnlichkeitssuche: Statt nach denselben Wörtern zu suchen, sucht man nach nahen Zahlenreihen. Deshalb findet eine Suche über Embeddings auch dann etwas, wenn im Text ein anderes Wort steht als in der Frage.

auchVektor · Einbettung · Vektorraum

siehe RAGsiehe Token

Feinjustierung

Modell

Nachtraining eines fertigen Modells auf ein engeres Ziel, etwa auf hilfreiche Antworten in Gesprächsform.

Verglichen mit dem Vortraining ein kleiner Eingriff, der das Verhalten trotzdem stark verändert. ChatGPT entstand aus einem feinjustierten Modell der GPT-3.5-Serie. Wer heute von einem Chatmodell spricht, meint fast immer ein feinjustiertes Modell, nicht das rohe Vortrainingsergebnis.

auchFine-Tuning · Finetuning · Nachtraining · RLHF

Introducing ChatGPT (externe Seite, openai.com)siehe Vortrainingsiehe GPT

Gewichte

Modell

Die gelernten Zahlen im Inneren eines Modells. Sie sind das Ergebnis des Trainings.

Ein Modell besteht aus Architektur und Gewichten. Die Architektur ist der Bauplan, die Gewichte sind das Gelernte. Offene Modelle geben die Gewichte frei, geschlossene nicht. Die Zahl der Gewichte wird als Parameterzahl angegeben und sagt für sich genommen wenig über die Qualität.

auchWeights · Parameter · Parameterzahl

siehe Modellkernsiehe Vortraining

GPT

Modell

Generative Pre-trained Transformer. Eine Bauart von Sprachmodellen, oft als Name für einzelne Modelle verwendet.

Generative heißt, es erzeugt Text. Pre-trained heißt, es wurde erst auf sehr viel unbeschriftetem Text vortrainiert und danach für einzelne Aufgaben nachjustiert. Transformer ist die Bauform. GPT ist damit weder ein Produkt noch ein Hersteller, sondern eine Beschreibung.

auchGPT-3 · GPT-4 · GPT-4o · Generative Pre-trained Transformer

Kapitel 01 · Was ein Sprachmodell istImproving Language Understanding by Generative Pre-Training (externe Seite, openai.com)siehe Transformersiehe Vortrainingsiehe Sprachmodell

Guardrails

Betrieb

Regeln und Prüfungen um ein Modell herum, die verhindern sollen, dass es Schaden anrichtet.

Guardrails sitzen vor der Eingabe, hinter der Ausgabe oder um die Werkzeuge herum. Sie sind Teil des Systems, nicht des Modells, und lassen sich deshalb ändern, ohne das Modell anzufassen. Umgekehrt heißt das: Zwei Anwendungen mit demselben Modell können sich sehr unterschiedlich verhalten.

auchLeitplanken · Sicherheitsfilter · Schutzmechanismen

siehe Harnesssiehe Prompt Injection

Halluzination

Grundlagen

Eine flüssig formulierte, aber falsche Angabe. Kein Fehler im Betrieb, sondern die Kehrseite des Verfahrens.

Ein Modell wählt das wahrscheinlichste nächste Token, nicht das wahre. Wo es nichts Passendes gelernt hat, erzeugt es trotzdem etwas Plausibles. Warnsignale sind sehr genaue Zahlen ohne Quelle, erfundene Zitate und auffällig glatte Antworten auf schwierige Fragen.

auchHalluzinieren · Konfabulation · erfundene Angaben · Hallucination

Kapitel 02 · Was ein Sprachmodell tutsiehe Kontextsiehe RAG

Harness

Agenten

Das Gerüst um ein Modell herum: Anweisungen, Werkzeuge, Schleifen, Grenzen, Protokolle.

Bei gleichbleibendem Modell entscheidet das Gerüst oft mehr über die Qualität des Ergebnisses als die Wahl des Modells. Dazu gehören auch die unspektakulären Teile: Zeitlimits, Anbieter-Fallback, Verbrauchsprotokollierung, Freigabelisten, Watchdogs.

auchGerüst · Agentengerüst · Scaffolding

siehe Agentsiehe Werkzeug

Inferenz

Betrieb

Der laufende Betrieb eines fertigen Modells: rechnen, um eine Antwort zu erzeugen.

Training findet einmal statt, Inferenz bei jeder Anfrage. Deshalb entscheidet die Inferenz über die laufenden Kosten. Ein Modell wird nicht klüger, wenn man es öfter aufruft; es rechnet nur öfter dasselbe Verfahren durch.

auchInference · Ausführung · Laufzeit

siehe Laufzeitumgebungsiehe Gewichte

Kontext

Anwendung

Alles, was dem Modell bei einer Anfrage mitgegeben wird. Was nicht darin steht, existiert für das Modell nicht.

Der Kontext ist der Arbeitsspeicher des Modells und kein Gedächtnis: Er wird bei jeder Anfrage neu zusammengesetzt und mitgeschickt. Dass ein Chatprogramm sich an gestern erinnert, liegt nicht am Modell, sondern daran, dass die Anwendung Gespeichertes erneut in den Kontext legt.

auchContext · Arbeitsspeicher · Gesprächsverlauf

Kapitel 01 · Was ein Sprachmodell istKapitel 02 · Was ein Sprachmodell tutKapitel 04 · Der Promptsiehe Kontextfenstersiehe Promptsiehe RAG

Kontextfenster

Anwendung

Die Obergrenze an Token, die ein Modell in einem Durchgang gleichzeitig berücksichtigen kann.

Ist das Fenster voll, muss etwas weichen, und was weicht, ist für das Modell nicht mehr vorhanden. Ein größeres Fenster ist deshalb kein besseres Gedächtnis, sondern nur ein größerer Tisch. Ein Gespräch je Thema ist meist wirksamer als ein sehr langes Gespräch über alles.

auchContext Window · Fenstergröße · Kontextlänge

Kapitel 03 · Token, die Bausteine der SpracheKapitel 04 · Der Promptsiehe Kontextsiehe Token

Laufzeitumgebung

Betrieb

Die Schicht zwischen Modellkern und Anwendung: lädt das Modell, nimmt Anfragen an, setzt Grenzen, ruft Werkzeuge auf.

Sie beeinflusst Antwortzeit und Kosten stärker als die Modellwahl und ist der Grund, warum dieselben Gewichte bei zwei Anbietern unterschiedlich teuer und unterschiedlich schnell sind. Stapelverarbeitung mehrerer Anfragen, Wiederverwendung berechneter Zustände, gestreamte Ausgabe, Kontingente.

auchServing · Serving-Schicht · Inference-Server · Runtime

Kapitel 01 · Was ein Sprachmodell istsiehe Modellkernsiehe Inferenz

Model Context ProtocolMCP

Agenten

Ein offener Standard dafür, wie ein Modell an fremde Werkzeuge und Datenquellen angebunden wird.

Vor MCP war jede Anbindung eine Einzellösung für ein bestimmtes Programm. Mit einem gemeinsamen Protokoll lässt sich ein Werkzeug einmal bereitstellen und von verschiedenen Anwendungen nutzen. Das ist weniger eine technische als eine ökonomische Änderung.

auchMCP · Model Context Protocol · Werkzeuganbindung

Model Context Protocol, Spezifikation (externe Seite, modelcontextprotocol.io)siehe Werkzeugsiehe Agent

Modellkern

Grundlagen

Architektur, gelernte Werte und Tokenizer. Der Teil, der ausgetauscht wird, wenn ein Modell erneuert wird.

Zum Kern gehören die Architektur, die Gewichte, das Vokabular und der Tokenizer. Nicht dazu gehören Systemanweisung, Sampling-Einstellungen, Kontextverwaltung, Werkzeuge, Sicherheitsfilter und Zwischenspeicher. Alles davon verändert das beobachtbare Verhalten erheblich, ohne ein einziges Gewicht anzufassen.

auchKern · Modellgewichte · Basismodell

Kapitel 01 · Was ein Sprachmodell istsiehe Gewichtesiehe Laufzeitumgebungsiehe Tokenizer

Multimodal

Modell

Ein Modell, das nicht nur Text verarbeitet, sondern auch Bild, Ton oder Video.

Zwei Bauformen werden oft verwechselt: mehrere hintereinandergeschaltete Modelle, von denen eines Bilder beschreibt und ein zweites den Text verarbeitet, oder ein einziges Modell, das alle Formen gemeinsam gelernt hat. Nur das Zweite ist im engeren Sinn multimodal.

auchMultimodalität · Bildverstehen · Vision

GPT-4 (externe Seite, openai.com)Hello GPT-4o (externe Seite, openai.com)siehe Sprachmodell

Prompt

Anwendung

Die Eingabe an ein Sprachmodell. Nicht nur die getippte Frage, sondern alles, was das Modell zu sehen bekommt.

Zum Prompt gehören die Systemanweisung, die Nutzereingabe, der bisherige Gesprächsverlauf und die Ergebnisse aufgerufener Werkzeuge. Wer nur die getippte Zeile für den Prompt hält, wundert sich über Antworten, die auf etwas Bezug nehmen, das nirgends sichtbar steht.

auchEingabe · Anweisung · Systemprompt · Prompting

Kapitel 04 · Der Promptsiehe Kontextsiehe Kontextfenster

Prompt Injection

Betrieb

Ein Angriff, bei dem Anweisungen in Daten versteckt werden, die das Modell verarbeitet.

Ein Modell unterscheidet nicht zuverlässig zwischen dem, was es tun soll, und dem, was es lesen soll. Steht in einer eingelesenen Webseite oder Datei eine Anweisung, kann sie befolgt werden. Das ist kein Bedienfehler, sondern eine Eigenschaft des Verfahrens, und der Grund, warum Werkzeugrechte eng gesetzt gehören.

auchInjection · Prompt-Angriff · Indirect Prompt Injection

siehe Guardrailssiehe Werkzeugsiehe Agent

RAG

Agenten

Nachschlagen statt erinnern: Passende Textstellen werden gesucht und dem Modell in den Kontext gelegt.

Retrieval Augmented Generation. Das Modell lernt dabei nichts dazu, es bekommt nur die richtigen Belege vorgelegt. Das ist der übliche Weg, um Antworten aus eigenen Dokumenten zu erhalten, und der Grund, warum ein schlechtes Suchergebnis eine falsche Antwort erzeugt, obwohl das Modell fehlerfrei arbeitet.

auchRetrieval Augmented Generation · Wissensbasis · Vektordatenbank · Embedding-Suche

siehe Kontextsiehe Halluzinationsiehe Embedding

Reasoning-Modell

Modell

Ein Modell, das vor der Antwort sichtbare oder unsichtbare Zwischenschritte erzeugt und dafür mehr Rechenzeit verbraucht.

Der Zugewinn entsteht zur Antwortzeit, nicht beim Training. Ob dieses Verhalten im Modell trainiert ist oder von der Umgebung erzwungen wird, lässt sich von außen nicht sicher unterscheiden. Damit verwischt die saubere Trennung zwischen Modell und System.

auchReasoning · Chain-of-Thought · Denkschritte · Schlussfolgern

Kapitel 01 · Was ein Sprachmodell istsiehe Inferenzsiehe Modellkern

SprachmodellLLM

Grundlagen

Eine sehr große Datei mit gelernten Zahlen, die aus Text weiteren Text erzeugen kann.

Ein Bauteil, kein Programm. Es nimmt eine Folge von Token entgegen und gibt eine Wahrscheinlichkeitsverteilung für das nächste Token zurück. Es hat kein Gedächtnis, keine Uhr und keinen Netzzugang. Alles, was darüber hinausgeht, macht die Anwendung drumherum.

auchLarge Language Model · LLM · großes Sprachmodell · Modell

Kapitel 01 · Was ein Sprachmodell istAttention Is All You Need (externe Seite, arxiv.org)siehe Anwendungsiehe Modellkernsiehe Token

Temperatur

Anwendung

Eine Einstellung, die bestimmt, wie stark das Modell vom wahrscheinlichsten Token abweichen darf.

Niedrige Temperatur führt zu vorhersagbaren, gleichförmigen Antworten, hohe zu abwechslungsreichen und riskanteren. Dass dieselbe Frage zweimal unterschiedlich beantwortet wird, ist deshalb meist keine Fehlfunktion, sondern eine Einstellung.

auchTemperature · Sampling · top_p

Kapitel 02 · Was ein Sprachmodell tutsiehe Inferenz

Token

Grundlagen

Die Recheneinheit von Text. Nicht Wort, nicht Buchstabe, sondern ein Stück dazwischen.

Ein Sprachmodell liest keine Wörter, sondern Token aus einem festen Vokabular. Häufige Wörter sind ein Token, seltene zerfallen in mehrere Teile. Deutsche Texte brauchen für dieselbe Aussage mehr Token als englische, und weil nach Token abgerechnet wird, schlägt das direkt auf die Kosten durch.

auchTokens · Recheneinheit

Kapitel 03 · Token, die Bausteine der SpracheNeural Machine Translation of Rare Words with Subword Units (externe Seite, arxiv.org)siehe Tokenizersiehe Vokabularsiehe Kontextfenster

Tokenizer

Grundlagen

Das Programmstück, das Text in Token zerlegt und Token wieder zu Text zusammensetzt.

Der Tokenizer gehört zwingend zum Modell: Dieselben Gewichte mit einem anderen Vokabular ergeben ein anderes Modell. Er wird beim Reden über Modelle gern vergessen, entscheidet aber darüber, wie sparsam eine Sprache verarbeitet wird.

auchZerleger · Textzerlegung

Kapitel 03 · Token, die Bausteine der SpracheTiktokenizer (externe Seite, tiktokenizer.vercel.app)Tokenizer von OpenAI (externe Seite, platform.openai.com)siehe Tokensiehe Byte Pair Encodingsiehe Vokabular

Transformer

Grundlagen

Die Bauform, auf der heutige Sprachmodelle beruhen. Sie kommt allein über den Mechanismus der Aufmerksamkeit aus.

Vorgestellt 2017. Der entscheidende Punkt war nicht nur die Qualität, sondern die Parallelisierbarkeit: Ohne die bis dahin übliche schrittweise Verarbeitung lassen sich Modelle auf viele Rechenkerne verteilen und damit deutlich größer bauen. Das T in GPT steht dafür.

auchTransformer-Architektur · Attention · Aufmerksamkeit · Self-Attention

Kapitel 01 · Was ein Sprachmodell istAttention Is All You Need (externe Seite, arxiv.org)siehe Sprachmodellsiehe GPT

Vibe Coding

Anwendung

Programmieren, bei dem der Schwerpunkt vom Schreiben des Codes auf das Beschreiben und Prüfen verschiebt.

Der Begriff kam 2025 auf. Er beschreibt weniger ein Werkzeug als eine Arbeitsteilung: Absicht formulieren, Ergebnis prüfen, nachsteuern. Die Schwierigkeit wandert damit vom Tippen zum Beurteilen, und die Prüfung wird zum Engpass.

auchVibecoding · KI-gestütztes Programmieren

siehe Agentsiehe Harness

Vokabular

Grundlagen

Die feste Liste aller Token, die ein Modell kennt. Jedes Token trägt darin eine Nummer.

Die Größe des Vokabulars ist eine Bauentscheidung: Ein größeres Vokabular braucht weniger Token je Satz, macht das Modell aber an anderer Stelle teurer. Modelle derselben Familie teilen sich oft ein Vokabular, verschiedene Familien fast nie.

auchVocabulary · Vokabular-Größe · o200k_base · cl100k_base

Kapitel 03 · Token, die Bausteine der Sprachesiehe Tokensiehe Tokenizer

Vortraining

Modell

Der erste und teuerste Schritt: Ein Modell lernt aus sehr viel Text, das jeweils nächste Token vorherzusagen.

Hier entsteht das meiste von dem, was ein Modell kann. Das Vortraining findet einmal statt, dauert Wochen bis Monate und kostet den überwiegenden Teil der Rechenzeit. Alles danach justiert nur noch nach.

auchPre-Training · Pretraining · Training

Improving Language Understanding by Generative Pre-Training (externe Seite, openai.com)siehe Feinjustierungsiehe Gewichte

Werkzeug

Agenten

Ein Programm, das ein Modell aufrufen darf, um etwas zu tun, was es selbst nicht kann.

Ein Modell kann nicht rechnen, nicht im Netz nachsehen und keine Datei speichern. Es kann aber äußern, dass es genau das möchte, und die Umgebung führt es aus und legt das Ergebnis in den Kontext. Ab diesem Punkt handelt ein System, statt nur zu antworten.

auchTool · Tool-Use · Funktionsaufruf · Function Calling

siehe Agentsiehe Model Context Protocolsiehe Kontext

Das Glossar wächst mit den Kapiteln. Ein Begriff kommt hinein, wenn er auf der Seite vorkommt und nicht selbsterklärend ist, nicht weil er gerade oft genannt wird.

Tippen Sie los.

auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.