NachschlagenGlossarAnwendung

Anwendung

Was mit einem Modell gemacht wird, sobald es steht. Von der Suche über Belege bis zur Spracheingabe.

24 Begriffe21 mit Kapitelverweis65 Zweitwörter im Indexalle 158 im Verzeichnis

Agentic Engineering

Die berufliche Gegenseite zum Vibe-Coding: mehrere fehlbare Agenten führen, ohne Richtigkeit, Sicherheit und Wartbarkeit aufzugeben.

Andrej Karpathy stellte den Begriff am 30.04.2026 neben seinen eigenen von 2025 und zog damit selbst die Grenze, die dem ersten Begriff seither fehlte. Vibe-Coding hebt den Boden: Es bringt Menschen zu einem Ergebnis, die sonst keines bekommen hätten. Agentic Engineering hebt die Decke und bleibt eine berufliche Disziplin, bei der jemand für das Ergebnis geradesteht. Eine deutsche Entsprechung hat sich bisher nicht durchgesetzt.

Kapitel 01 · Was Vibe-Coding istSequoia Ascent 2026 summarysiehe Vibe Codingsiehe Agentsiehe Harness

Anrufweitergabe

Das Umlegen eines laufenden Anrufs an eine andere Gegenstelle.

Seit 2009 spezifiziert, in drei Formen: ohne Ankündigung, mit Rückfrage und mit Ankündigung. Der Unterschied hat eine praktische Folge, denn bei der angekündigten Form besteht die Verbindung zum Anrufer fort. Ist das Ziel unerreichbar, lässt sich der Anruf zurückholen.

auchTransfer · Call Transfer · REFER

Kapitel 08 · Eskalation an einen MenschenRFC 5589, SIP Call Control, TransferRFC 3515, The Session Initiation Protocol (SIP) Refer Methodsiehe Session Initiation Protocolsiehe Eskalation

Barge-in

Ins Wort fallen: Jemand redet, während das System noch spricht.

Meldet die Erkennung eine Unterbrechung, bricht das Modell seine laufende Erzeugung ab und verwirft sie. Damit ist die halbe Arbeit getan. Der bereits gesendete Ton liegt im Abspielpuffer der Anwendung und läuft weiter, bis diese ihn selbst leert; ein System, das nur auf das Signal reagiert, redet nach der Unterbrechung noch sekundenlang.

auchHineinreden · Unterbrechung

Kapitel 03 · Wenn das Gespräch nicht in Runden läuftGoogle, Live API capabilities guidesiehe Voice Activity Detectionsiehe Sprachsynthese

Blocking Tool Call

Die Voreinstellung: Das Gespräch hält an, bis das Ergebnis da ist.

Ein Tool Call läuft der Reihe nach. Das Modell legt die Argumente ab, die Anwendung führt aus, schickt das Ergebnis zurück und bittet dann um eine Antwort. Im Chatfenster ist das ein Ladebalken, im Gespräch eine Stille. Es gibt eine Einstellung, mit der der Aufruf im Hintergrund läuft; sie verschiebt die Aufgabe in die Anwendung, denn ein Ergebnis kann dann zu einem Zeitpunkt eintreffen, an dem das Gespräch längst woanders steht.

auchBlockierender Werkzeugaufruf · Sequential Function Calling · Blocking Tool Use

Kapitel 06 · Tools anbindenGoogle, Tool use with Live APIsiehe Latenzsiehe Preamble

Chain-of-ThoughtCoT

Eine Prompt-Technik: Das Modell schreibt vor der Antwort seinen Lösungsweg aus und kommt dadurch bei Rechen- und Textaufgaben öfter zum richtigen Ergebnis.

Jason Wei und Mitautoren bei Google zeigten am 28.01.2022, dass dafür wenige Beispiele in der Eingabe genügen, in denen der Weg ausgeschrieben ist. Acht solcher Beispiele brachten ein Modell mit 540 Milliarden Parametern bei Textaufgaben auf den damaligen Höchststand. Die Technik wirkt allein über die Eingabe. Reasoning-Modelle holen denselben Gedanken seit 2024 ins Training und erzeugen ihre Zwischenschritte von selbst.

auchCoT · Chain of Thought · Gedankenkette · Lösungsweg im Prompt

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models2022 · Zwischenschritte im Promptsiehe Reasoning-Modellsiehe Few Shotsiehe Prompt

Computer Vision

Das Fachgebiet, das aus Bildpunkten nachrechenbare Aussagen macht: Klassen, Koordinaten, Flächen.

Vier Aufgaben stehen dahinter, und sie liefern verschiedene Antwortformen: eine Klasse für das ganze Bild, ein Rechteck um ein einzelnes Ding, eine Klasse je Bildpunkt, oder ein Abstand zwischen zwei Aufnahmen. Ein Sprachmodell mit Bildeingang beantwortet die erste Frage in Prosa und misst dabei nichts; dafür steht der eigene Begriff multimodal.

auchBilderkennung · maschinelles Sehen · Bildverarbeitung

Kapitel 05 · Computer VisionMicrosoft COCO: Common Objects in Contextsiehe Objekterkennungsiehe Multimodalsiehe Neuronales Netz

Conversational AICAI

Sammelbegriff für Systeme, die man bedient, indem man mit ihnen redet.

Dazu gehören das Chatfenster, die Assistenz im Auto und der Sprachagent am Telefon. In der Mitte steht in allen Fällen ein Sprachmodell mit Text auf beiden Seiten; wo gesprochen wird, kommen vorn die Erkennung und hinten die Sprachsynthese dazu. Der Begriff beschreibt die Bedienform und sagt nichts darüber, wie viel das System selbst entscheidet.

auchCAI · Dialogsystem · Sprachdialogsystem · Chatbot

Kapitel 01 · Was Conversational AI istsiehe Sprachagentsiehe Natural Language Processingsiehe Sprachmodell

Dual-Tone Multi-FrequencyDTMF

Der zweite Eingabekanal am Telefon, der an der Stimme vorbeiläuft.

„Drücken Sie die Eins“ überträgt keinen Ton, sondern ein benanntes Ereignis. Der Grund steht in der Spezifikation: Sprachcodecs mit niedriger Bitrate geben solche Doppeltöne nicht zuverlässig genug wieder, damit eine Maschine sie erkennt. Die Empfehlung geht weiter und rät der Vermittlungsstelle, den mitgelieferten Ton gar nicht erst auszuwerten, weil die Kompression selbst Töne erzeugen kann, die niemand gedrückt hat.

auchTastenwahl · Mehrfrequenzwahlverfahren

Kapitel 04 · Über das TelefonRFC 4733, RTP Payload for DTMF Digits, Telephony Tones, and Telephony Signalssiehe Session Initiation Protocol

Eskalation

Die Übergabe eines laufenden Gesprächs an einen Menschen.

Eine der zwei Formen von Human in the Loop. Beim Tastenmenü war der Auslöser eine Taste und stand damit fest; bei einem Sprachagenten muss eigens entschieden werden, wo das System aufhört. Was dabei an Zusammenhang mitgeht, gibt kein Protokoll vor.

auchÜbergabe an einen Menschen · Handoff · Human Handoff

Kapitel 08 · Eskalation an einen MenschenRasa, Fallback and Human HandoffRasa, Patternssiehe Human in the Loopsiehe Sprachagentsiehe Interactive Voice Response

Few Shot

Ein paar Beispiele in der Eingabe, an denen das Modell erkennt, was es tun soll, ohne dafür trainiert zu sein.

Vor GPT-3 brauchte jede neue Aufgabe ein eigenes Nachtraining mit beschrifteten Daten. Seither genügt es oft, zwei oder drei gelöste Fälle in die Eingabe zu schreiben. Ohne Beispiel heißt es Zero Shot, mit einem einzigen One Shot. Das Modell lernt dabei nichts dazu: Nach der Antwort ist der Zusammenhang wieder weg, und beim nächsten Aufruf muss er erneut mitgegeben werden. Am stärksten wirken Beispiele, die das Format zeigen, in dem die Antwort stehen soll.

auchFew-Shot · Zero Shot · One Shot · Beispiele in der Eingabe · In-Context Learning

Kapitel 15 · Wofür man ein Sprachmodell benutztLanguage Models are Few-Shot Learners2020 · GPT-3siehe Promptsiehe Kontextsiehe Fine-Tuning

Interactive Voice ResponseIVR

Das Telefonmenü, das Ansagen vorliest und auf Tastendrücke wartet.

Der Vorgänger des Sprachagenten. Der Ablauf war abzählbar, und genau darin lag seine Stärke: Der Ausstieg zu einem Menschen stand als Menüpunkt fest. Ein System, das ganze Sätze versteht, hat diese Stelle nicht mehr von selbst.

auchSprachdialogsystem · Telefonmenü

Kapitel 08 · Eskalation an einen Menschensiehe Dual-Tone Multi-Frequencysiehe Eskalation

Kontext

Alles, was dem Modell bei einer Anfrage mitgegeben wird. Was nicht darin steht, existiert für das Modell nicht.

Der Kontext ist der Arbeitsspeicher des Modells: Er wird bei jeder Anfrage neu zusammengesetzt und mitgeschickt. Dass ein Chatprogramm sich an gestern erinnert, leistet die Anwendung, indem sie das Gespeicherte jedes Mal erneut hineinlegt.

auchContext · Arbeitsspeicher · Gesprächsverlauf

Kapitel 01 · Was ein Sprachmodell istKapitel 02 · Was ein Sprachmodell tutKapitel 05 · Der Promptsiehe Kontextfenstersiehe Promptsiehe RAG

Kontextfenster

Die Obergrenze an Token, die ein Modell in einem Durchgang gleichzeitig berücksichtigen kann.

Ist das Fenster voll, muss etwas weichen, und was weicht, ist für das Modell nicht mehr vorhanden. Ein größeres Fenster ist deshalb kein besseres Gedächtnis, sondern nur ein größerer Tisch. Ein Gespräch je Thema ist meist wirksamer als ein sehr langes Gespräch über alles.

auchContext Window · Fenstergröße · Kontextlänge

Kapitel 03 · Token, die Bausteine der SpracheKapitel 05 · Der Prompt2024 · Eine Million Token2023 · 100.000 Token, ein Dokument passt hineinsiehe Kontextsiehe Token

Objekterkennung

Die Aufgabe, Dinge im Bild zu finden und je Fund ein Rechteck mit einer Klasse auszugeben.

Die Antwort besteht aus vier Zahlen und einem Etikett, und beide Teile können einzeln falsch sein. Gemessen wird über die Überlappung zwischen vorhergesagtem und hinterlegtem Rechteck: Ab einem festgelegten Anteil gilt der Fund als Treffer. Diese Schwelle ist eine Festlegung des Messprotokolls, weshalb sich Erkennungszahlen aus zwei Quellen selten vergleichen lassen.

auchBounding Box · Detektion · Objektdetektion · IoU

Kapitel 05 · Computer VisionYou Only Look Once: Unified, Real-Time Object DetectionMicrosoft COCO: Common Objects in Contextsiehe Computer Visionsiehe Klassifikationsiehe Benchmark

Physical AI

KI-Systeme, bei denen am Ausgang eine Bewegung steht: Roboter, Fahrzeuge, Laborgeräte.

Der Sammelbegriff für Modelle, die in der physischen Welt handeln statt auf einem Bildschirm. Populär gemacht hat ihn NVIDIA, das auf Deutsch von physischer KI spricht. Das Nadelöhr sind die Daten: Für Text liegt das Netz bereit, für Bewegung muss jede Fähigkeit mit genau dem Roboter und für genau die Aufgabe erhoben werden. Deshalb wird viel in Simulationen und in Weltmodellen geübt. Die übliche Bauform ist das VLA-Modell.

auchPhysische KI · Embodied AI · verkörperte KI · Robotik-Grundmodell

Kapitel 14 · Physical AINVIDIA Releases New Physical AI Models as Global Partners Unveil Next-Generation Robotsπ0: Our First Generalist PolicyPreviewing the Model Hardware Standardsiehe VLA-Modellsiehe Weltmodellsiehe Computer Visionsiehe Multimodal

Preamble

Der kurze Satz, mit dem ein Sprachagent ankündigt, dass er gleich arbeitet.

Ein Tool Call oder eine Suche hält das Gespräch an, und Stille ist im Gespräch eine Aussage. Der Hersteller führt die Ansage deshalb als eigenes Bauteil und nennt beide Seiten: Gut gemacht beruhigt sie, schlecht gemacht erhöht sie die gefühlte Wartezeit, weil sie das Warten benennt, ohne es zu verkürzen. Empfohlen sind Sätze, die die Handlung nennen; abgeraten wird von Formeln, die den Zustand der Maschine beschreiben.

auchAnsage vor der Wartezeit · Füllsatz

Kapitel 05 · Wissen anbindenKapitel 06 · Tools anbindenOpenAI, Using realtime modelssiehe Latenzsiehe Sprachagent

Prompt

Die Eingabe an ein Sprachmodell. Nicht nur die getippte Frage, sondern alles, was das Modell zu sehen bekommt.

Zum Prompt gehören die Systemanweisung, die Nutzereingabe, der bisherige Gesprächsverlauf und die Ergebnisse aufgerufener Tools. Wer nur die getippte Zeile für den Prompt hält, wundert sich über Antworten, die auf etwas Bezug nehmen, das nirgends sichtbar steht.

auchEingabe · Anweisung · Systemprompt · Prompting

Kapitel 05 · Der PromptBeitrag · Warum ich eine eigene Diktier-App gebaut habe2020 · GPT-3siehe Kontextsiehe Kontextfenstersiehe Few Shot

Prompt Engineering

Die Arbeit an der Eingabe, damit ein Modell verlässlich das liefert, was gebraucht wird: Aufgabe, Ziel, Kontext, Beispiele, Ausgabeform.

In den Ratgebern stand der Begriff lange für eine Trickkiste: Rollenzuweisungen, Zauberformeln, Denkanweisungen. Davon hat wenig einen Modellwechsel überstanden. Was bleibt, ist unspektakulär und hält seit Jahren: eine Aufgabe je Prompt, ein überprüfbares Ziel, der Kontext, den das Modell nicht wissen kann, Beispiele für die Form der Antwort, und eine Messung, ob es funktioniert. Dass ein Modell aus wenigen Beispielen in der Eingabe eine Aufgabe übernimmt, war 2020 der Befund, mit dem diese Arbeit anfing. Die Hersteller führen dazu Leitfäden, die sie mit jeder Modellfassung überarbeiten; der zu GPT-5.6 rät, wiederholte Anweisungen und Beispiele wieder herauszunehmen und nur zu behalten, was eine Produktanforderung festhält oder eine gemessene Lücke schließt. Ein Prompt ist damit ein Artefakt mit Ablaufdatum, und die Arbeit daran endet nicht mit dem ersten, der funktioniert.

auchPrompt-Engineering · Prompting-Technik · Prompt Design

Kapitel 06 · Gute Prompts schreibenAnthropic, Prompting best practicesOpenAI, Model guidance für GPT-5.6Language Models are Few-Shot Learnerssiehe Promptsiehe Few Shotsiehe Kontext

Session Initiation ProtocolSIP

Das Protokoll, über das ein Anruf zustande kommt, auch der bei einem Sprachagenten.

Session Initiation Protocol regelt das Klingeln, das Annehmen und das Auflegen. Der Ton läuft daneben über einen eigenen Weg. Für einen Sprachagenten heißt das: Der eingehende Anruf erreicht die Anwendung als Nachricht an eine hinterlegte Adresse, und erst beim Annehmen wird die Sitzung eingerichtet, mit Anweisung, Stimme und Tools. Das Ablehnen ist ein eigener Aufruf und damit eine Entscheidung, die es im Chatfenster nicht gibt.

auchSIP

Kapitel 04 · Über das TelefonOpenAI, Realtime API with SIPsiehe Abtastratesiehe Conversational AI

Strukturierte Ausgabe

Ein Schema, an das ein Modell seine Antwort halten muss, damit ein Programm sie weiterverarbeiten kann.

Seit 2023 lässt sich einem Aufruf ein Schema mitgeben, inzwischen ist die Einhaltung erzwingbar. Gesichert ist damit die Form: Die Ausgabe ist gültiges JSON mit den verlangten Feldern. Ob der herausgezogene Betrag der richtige ist, sagt das Schema nicht, und diese Trennung ist die wichtigste Auskunft dazu. Von allen Aufgabenformen ist diese am billigsten zu prüfen, weil ein Programm über die Gültigkeit entscheiden kann.

auchStructured Output · JSON-Modus · Schema-Zwang

Kapitel 15 · Wofür man ein Sprachmodell benutztKapitel 11 · Über die APIFunction calling and other API updatessiehe Toolsiehe API Key

Temperatur

Eine Einstellung, die bestimmt, wie weit die Bewertungen für die Ziehung auseinandergezogen werden.

Niedrige Temperatur führt zu vorhersagbaren, gleichförmigen Antworten, hohe zu abwechslungsreichen und riskanteren. Dass dieselbe Frage zweimal unterschiedlich beantwortet wird, ist deshalb im Normalfall eine Einstellung und selten eine Fehlfunktion. Auch der niedrigste Wert verspricht keine Wiederholbarkeit, denn er hält nur die Ziehung fest; die Bewertungen davor hängen daran, wie viele fremde Anfragen im selben Moment mitlaufen.

auchTemperature

Kapitel 12 · Wie zufällig die Antwort istsiehe Inferenzsiehe Sampling

Vibe Coding

Programmieren, bei dem der Schwerpunkt vom Schreiben des Codes auf das Beschreiben und Prüfen verschiebt.

Der Begriff kam 2025 auf. Er beschreibt weniger ein Werkzeug als eine Arbeitsteilung: Absicht formulieren, Ergebnis prüfen, nachsteuern. Die Schwierigkeit wandert damit vom Tippen zum Beurteilen, und die Prüfung wird zum Engpass.

auchVibecoding · KI-gestütztes Programmieren

Beitrag · Warum ich eine eigene Diktier-App gebaut habe2025 · „Vibe Coding“ bekommt einen Namen2024 · Cursor Composer, der Editor baut selbst umsiehe Agentsiehe Harnesssiehe Test-Driven Development

Work IQ

Microsofts Schicht zwischen einem Sprachmodell und den Inhalten einer Organisation. Sie entscheidet, was ein Copilot von Postfächern, Dateien und Besprechungen zu sehen bekommt.

Die Schicht liest fortlaufend mit, was in einem Mandanten geschieht, und baut daraus eine durchsuchbare Ordnung über Microsoft 365 und angebundene Fremdsysteme. Jede Antwort ist dabei auf die Rechte des fragenden Kontos beschnitten, was einen doppelten Boden hat: Eine zu weit gefasste Freigabe bleibt unauffällig, solange sich niemand durch die Ordner klickt, und wird durch eine Suche über den gesamten Bestand an einem Nachmittag sichtbar. In der Oberfläche erscheint die Schicht als Schalter, mit dem sich die Verankerung in den Firmendaten zu- und abschalten lässt. Der Zugang zur Schnittstelle hängt am Verbrauch. Für Lizenzierte ist er in allen Copilot-Anwendungen enthalten, für alle anderen wird er nach Nutzung abgerechnet.

auchWorkIQ · Microsoft Work IQ · Work-IQ-Schalter

Beitrag · Welcher Copilot in welchem Microsoft-365-Paket stecktBeitrag · Welchen Copilot habe ich?Beitrag · Was vor der Copilot-Einführung zu klären istWork IQ overviewMicrosoft Copilot overviewsiehe RAGsiehe Groundingsiehe Mandant

Zero-Shot

Eine Aufgabe ohne jedes Beispiel im Prompt lösen, allein aus der Anweisung.

Der Gegenbegriff zu Few-Shot, wo einige Beispiele mitgegeben werden. Dass beides überhaupt geht, war der Befund von 2020 und der Grund, warum ein einzelnes Modell viele Aufgabenformen bedienen kann: Vorher brauchte jede Aufgabe ihr eigenes Training und ihre eigene Datensammlung. Ob Beispiele nützen, hängt von der Form ab; beim Einordnen helfen sie meist, beim Umformen selten.

auchohne Beispiel

Kapitel 15 · Wofür man ein Sprachmodell benutztLanguage Models are Few-Shot Learnerssiehe Few Shotsiehe Prompt

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.