GrundlagenGrundkursKapitel 05von 16 im Pfad
Der Prompt
Zuerst die einfache Antwort
Ein Prompt ist das, was Sie eintippen. „Fasse mir diesen Text zusammen“, „Schreib mir eine Antwort auf diese E-Mail“, „Erklär mir das für ein Kind“. Sie schreiben etwas, das Modell antwortet darauf. So begegnet einem der Begriff zuerst, und für den Anfang reicht das.
Warum die einfache Antwort zu kurz greift
Wenn Sie in ChatGPT eine Frage stellen, kommt beim Modell mehr an als Ihre Frage. Davor steht, für Sie unsichtbar, noch einiges:
- SystemanweisungRolle, Grenzen, TonAnbieter
- Tool-Beschreibungenwas das Modell aufrufen darfAnbieter
- Gesprächsverlaufalles bisher Gesagteentsteht
- Dokumente und KontextMaterial zur AufgabeSie oder eine Suche
- Ihre Nachrichtdie eigentliche AnweisungSie
Für das Modell ist das ein einziger Text, nicht fünf Felder.
Ihre Nachricht steht ganz unten. Sie heißt Nutzereingabe oder User-Prompt und ist der Teil, den Sie beeinflussen. Sie ist nicht der ganze Prompt.
Die genaue Antwort
Ein Prompt ist alles, was das Modell sieht, bevor es das nächste Token wählt. Alle Bausteine von oben zusammen, hintereinander in einem Fenster. Der Teil, den Sie tippen, ist einer davon:
- SystemanweisungRolle, Grenzen, TonAnbieter
- Tool-Beschreibungenwas das Modell aufrufen darfAnbieter
- Gesprächsverlaufalles bisher Gesagteentsteht
- Dokumente und KontextMaterial zur AufgabeSie oder eine Suche
- Ihre Nachrichtdie eigentliche AnweisungSie
Hervorgehoben: Ihre Nachricht.
Dabei hilft es, zwei Ebenen auseinanderzuhalten. Das Programm, über das Sie gehen, hat durchaus Regler, und wo die sitzen, steht in Kapitel 12. Das Modell selbst hat keine: keine Schalter, keine Befehle, keine Einstellungen, die man irgendwo hinterlegt. Es hat ein Kontextfenster, und da liegt Text drin.
Was daraus folgt, gilt für jedes Modell und jeden Anbieter:
Es gibt eine Rangordnung, und sie ist weich. Die Teile sind unterschiedlich beschriftet, und die Beschriftung hat eine vorgesehene Ordnung: Was der Anbieter vorn hineinschreibt, geht dem vor, was Sie tippen. Eingehalten wird sie vom Modell, weil es darauf trainiert wurde, und aus demselben Grund kann es sie im Einzelfall übergehen. Ein eingefügtes Dokument hat dabei dieselbe Beschriftung wie Ihre Anweisung daneben, seine Sätze können also als Anweisung gelesen werden. Daher die Angriffsform, die später im Kapitel über Agenten vorkommt.
Was weder im Fenster noch in den Gewichten steht, existiert nicht. Aus dem Training weiß ein Modell eine Menge. Es weiß aber nicht, was Sie im letzten Chat besprochen haben, welche Datei auf Ihrem Schreibtisch liegt oder welchen Ton Ihre Firma verwendet. Das muss ins Fenster.
Der Platz ist begrenzt und kostet. Gemessen wird in Token, wie in Kapitel 03 beschrieben. Jede Zeile Anweisung nimmt Platz weg, den der eigentliche Inhalt braucht.
Diese drei Sätze beschreiben die Bauform und halten länger als jede Modellversion. Alles Weitere ist Kalibrierung, und Kalibrierung ändert sich. Wie schnell, zeigt der nächste Abschnitt.
Und wie schreibt man nun einen guten?
Das ist eine andere Frage, und sie hat ein eigenes Kapitel bekommen. Der Grund steht schon in diesem: Was ein Prompt ist, ändert sich nicht. Was man sinnvollerweise hineinschreibt, ändert sich mit jeder Modellversion, und zwar schneller, als die meisten Ratgeber nachkommen.
Weiter geht es in Kapitel 06.
Ein Prompt hat eine Anatomie. Sie ähnelt sich bei allen Anbietern, weil alle dieselbe Aufgabe lösen. Wie die Teile beschriftet werden, ist dann aber sehr wohl eine Entscheidung des Anbieters: Bei Anthropic liegt die Systemanweisung als eigenes Feld neben der Nachrichtenliste, bei OpenAI als eine von mehreren Ebenen darin.
Die Teile
Systemanweisung. Steht ganz vorn und beschreibt Rolle, Grenzen und Ton. Bei Chatoberflächen setzt sie der Anbieter, bei eigenen Anwendungen setzen Sie sie. Technisch ist sie ein eigener Teil der Anfrage, der vor den Nachrichten liegt.
Kontext. Alles, was das Modell für die Aufgabe braucht und von sich aus nicht hat: Auszüge aus Dokumenten, Daten, der bisherige Verlauf. Der mit Abstand größte Hebel für Qualität, und der am häufigsten unterschätzte.
Anweisung. Die eigentliche Aufgabe. Je konkreter das Ziel, desto weniger Ablauf muss beschrieben werden.
Beispiele. Ein Beispiel für die gewünschte Ausgabe hilft bei Formatfragen oft mehr als eine Beschreibung. Bei inhaltlichen Fragen verengen Beispiele auch das, was das Modell für zulässig hält, und neuere Leitfäden raten dazu, wiederholte Beispiele wieder herauszunehmen. Der Stand dazu in Kapitel 06.
Ausgabeform. Länge, Struktur, Format. Der Teil, der sich zwischen Modellversionen am stärksten verschoben hat, siehe unten.
Wer welchen Teil setzt
Die Anatomie sagt noch nichts darüber, wer schreibt. Das ist die Frage, an der sich entscheidet, worauf Sie überhaupt Einfluss haben.
| Teil | In einer Chatoberfläche | In einer eigenen Anwendung |
|---|---|---|
| Systemanweisung | der Anbieter | Sie, einmal, für alle Aufrufe |
| Tool-Beschreibungen | der Anbieter | Sie, je Tool |
| Kontext | teils Sie, teils eine Suche im Hintergrund | Sie, programmgesteuert |
| Anweisung | Sie, jedes Mal neu | oft der Anwender Ihrer Anwendung |
| Ausgabeform | Sie, in Worten | besser über Parameter, siehe Kapitel 06 |
- SystemanweisungRolle, Grenzen, TonAnbieter
- Tool-Beschreibungenwas das Modell aufrufen darfAnbieter
- Gesprächsverlaufalles bisher Gesagteentsteht
- Dokumente und KontextMaterial zur AufgabeSie oder eine Suche
- Ihre Nachrichtdie eigentliche AnweisungSie
Hervorgehoben: Systemanweisung.
Daraus folgt eine Unterscheidung, die im Alltag oft verwischt: Systemprompt und Nutzereingabe gehören zu derselben Anfrage und haben verschiedene Beschriftungen. Wer eine Anwendung baut, schreibt den Systemprompt einmal und lebt lange damit. Wer im Chat sitzt, schreibt nur den letzten Teil, dafür jedes Mal neu.
Was jeder Teil an Platz kostet
Alles im Fenster wird in Token gemessen, wie in Kapitel 03 beschrieben, und bei jedem Aufruf steht wieder das ganze Fenster da. Neu berechnet wird deshalb noch lange nicht alles: Wiederkehrende Anfänge halten die Anbieter in einem Cache, siehe Kapitel 11. Am belegten Platz ändert das nichts, an Preis und Durchsatz viel. Die Folgen sieht man, sobald eine Anwendung länger läuft:
- Die Systemanweisung liegt bei jedem Aufruf im Fenster. Ein Absatz mehr klingt harmlos und ist bei zehntausend Anfragen im Monat eine Position auf der Rechnung. Weil sie sich selten ändert, ist sie zugleich der beste Kandidat für den Cache.
- Tool-Beschreibungen ebenso. Zwanzig angebundene Tools mit je zehn Zeilen Beschreibung sind ein beachtlicher Sockel, bevor der Anwender ein Wort geschrieben hat.
- Der Gesprächsverlauf wächst. Irgendwann passt er nicht mehr, und dann entscheidet die Anwendung, was geschieht: abweisen, den Anfang weglassen oder ihn zusammenfassen. Fällt der Anfang weg, weiß das Modell nicht mehr, was dort vereinbart wurde, und sagt das nicht.
Für den Betrieb reicht die Vorstellung „ein langer Text“ nicht ganz. Drei Eigenschaften dieses Textes haben Folgen, die man kennen sollte, bevor sie im Betrieb auffallen. Dass überhaupt Text ankommt, ist dabei selbst eine Annahme: Ton nimmt einen eigenen Weg (Conversational AI, Kapitel 02), ein Bild geht als Bild in die Anfrage und wird nach Fläche in Token umgerechnet (Kapitel 13).
Position zählt, nicht nur Inhalt
Ein Modell verarbeitet das Fenster nicht wie eine Liste, in der jeder Eintrag gleich viel wiegt. Anfang und Ende werden zuverlässiger berücksichtigt als die Mitte. Der Ausdruck dafür stammt aus einer Arbeit, die genau das gemessen hat: dieselbe Information, verschoben an eine andere Stelle desselben Kontexts. Sie erschien im Juli 2023 als Vorabdruck und 2024 in einer Fachzeitschrift.
Der Nachsatz ist der wichtige. Ein Fenster, das für lange Eingaben gebaut wurde, hebt den Effekt nicht auf. Dieselbe Arbeit fasst das Ergebnis so zusammen, dass die Modelle Information in langen Eingaben nicht verlässlich nutzen (externe Seite, aclanthology.org).
Drei Dinge sind seither dazugekommen, und sie beantworten die Fragen, die man an so einen Befund stellt.
Woran es liegt. An der Verteilung der Aufmerksamkeit. Sie verläuft U-förmig über die Eingabe, unabhängig von der Wichtigkeit der Stelle (externe Seite, aclanthology.org), hängt also an der Position und nicht am Inhalt.
Ob es nur schwache Modelle trifft. Eine Untersuchung vom Juli 2024 hat es an den damals stärksten gemessen und nennt sie beim Namen: auch GPT-4 und Claude 3 Opus verlieren, wenn die Angabe in der Mitte steht (externe Seite, arxiv.org). Es liegt damit weder an einem Hersteller noch an der Modellgröße.
Ob größere Fenster es erledigt haben. Sie haben nicht. Auch Modelle, die ausdrücklich für lange Kontexte gebaut sind, zeigen den Positionsbias weiterhin (externe Seite, aclanthology.org), Stand 2025.
Praktisch heißt das:
- Die Aufgabe gehört ans Ende, nicht vor ein langes Dokument. Wer erst vierzig Seiten einfügt und danach fragt, bekommt bessere Antworten als umgekehrt.
- Das Wichtigste aus einem langen Kontext nach vorn oder nach hinten. Was in der Mitte eines großen Dokuments steht, wird am ehesten übersehen.
- Wiederholung am Ende ist kein Stilfehler. Eine Anforderung, die vor 30.000 Token stand, noch einmal zu nennen, ist billiger als eine falsche Antwort.
Was beim Überlaufen passiert
Wichtig ist zuerst, wer hier überhaupt handelt. Das Modell kürzt nichts und fasst nichts zusammen, es weist eine zu große Anfrage schlicht ab. Alles andere entscheidet die Anwendung, und zwar bevor sie abschickt. Die üblichen Verfahren:
| Verfahren | Was passiert | Was man merkt |
|---|---|---|
| Anfrage wird abgewiesen | die Anwendung schickt mehr, als hineinpasst | ein Fehler statt einer Antwort, dafür sofort sichtbar |
| Ältestes fällt heraus | der Anfang des Gesprächs verschwindet | Vereinbarungen vom Anfang gelten plötzlich nicht mehr |
| Zusammenfassen | ein Modell fasst den alten Teil zusammen | Details gehen verloren, ohne dass es auffällt |
| Fenster leeren | das Gespräch beginnt neu | offensichtlich, der Bruch ist sofort sichtbar |
Die mittleren beiden sind die gefährlichen, weil sie still geschehen. Eine Anwendung, die zusammenfasst, hat einen zweiten Modellaufruf im Rücken, der eigene Fehler machen kann, und niemand sieht die Zusammenfassung.
Anweisung und Inhalt sind schwach getrennt
Das ist die Eigenschaft mit den weitreichendsten Folgen, und sie wird meistens zu einfach erzählt. Eine Trennung gibt es durchaus: Die Anbieter beschriften die Teile der Anfrage und staffeln sie nach Vorrang. Einer schreibt die Staffelung sogar aus:
Eingehalten wird diese Ordnung allerdings vom Modell selbst, das sie im Training gelernt hat. Sie verhält sich damit wie eine feste Gewohnheit, die im Einzelfall bricht. Für die Praxis heißt das zweierlei.
Fremder Text kann Anweisungen enthalten. Eine Webseite, ein Dokument, eine E-Mail, die ins Fenster gerät, kann Sätze enthalten, die das Modell als Anweisung liest. Der Grund ist die Beschriftung: Angehängtes Material bekommt dieselbe wie die Anweisung, in die es eingefügt wurde, es steht also auf derselben Stufe. Das ist die Grundform der Prompt Injection. Eindämmen lässt sie sich, abstellen nicht, denn eine trainierte Gewohnheit ist keine Schranke. Was hilft, steht im Kapitel über Agenten: Grenzen außerhalb des Modells, keine besseren Formulierungen.
Ihre eigenen Beispiele wirken wie Anweisungen. Ein Ausgabebeispiel im Prompt zeigt nicht nur das Format, es setzt auch inhaltlich einen Rahmen. Wer drei Beispiele mit jeweils kurzen Antworten einfügt, bekommt kurze Antworten, auch wo eine lange richtig wäre.
Grenzen, die kein Prompt verschiebt
Zum Schluss drei Dinge, die sich hartnäckig als Prompting-Problem tarnen:
Fehlende Information. Wenn die Antwort eine Zahl braucht, die nirgends im Fenster steht, hilft keine Formulierung. Das ist der Fall für das Nachschlagen aus einer Wissensbasis, das Kapitel 08 behandelt.
Vermischung von Anweisung und Inhalt. Sobald fremder Text ins Fenster gerät, etwa eine Webseite oder eine Datei, kann darin eine Anweisung stehen. Das Modell unterscheidet unzuverlässig, weil das Material dieselbe Beschriftung hat wie die Anweisung, in der es steckt. Kein Prompt löst das vollständig, das gehört in den Aufbau des Systems und ins Kapitel über Agenten.
Nicht entscheidbare Aufgaben. Wenn zwei Fachleute die richtige Antwort unterschiedlich beurteilen, wird ein Modell sie nicht besser treffen. Ordnen und begründen kann es die Positionen durchaus. Welche davon gelten soll, muss jemand festlegen, und genau diese Festlegung fehlt.
Quellen
7 Einträge, davon 4 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitDokumentationerreichbar
Anthropic, Messages API reference (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Die Beschreibung der Regler, die dieser Anbieter für die Ziehung anbietet. Unter `temperature` steht dort „Amount of randomness injected into the response“ und der Zusatz, dass die Ergebnisse auch bei 0,0 nicht vollständig wiederholbar sind; An `top_p` steht der Hinweis „Recommended for advanced use cases only“. Unter `top_p` steht außerdem, wie die Auswahl zustande kommt, und zwar in der ersten Person Mehrzahl: „we compute the cumulative distribution over all the options for each subsequent token in decreasing probability order and cut it off once it reaches a particular probability specified by `top_p`“. Das belegt, wo die Ziehung stattfindet: beim Anbieter. Dieselbe Seite belegt zweitens, wie dieser Anbieter die Rollen führt. Zu den Nachrichten steht dort „Our models are trained to operate on alternating `user` and `assistant` conversational turns“, die Trennung kommt also aus dem Training. Die Systemanweisung steht dabei außerhalb der Nachrichtenliste: Zum Feld `system` heißt es dort, für Eingabenachrichten gebe es in dieser Schnittstelle keine Rolle dieses Namens. Abgerufen am 06.08.2026. Wie viele Regler die Seite insgesamt führt, ist von hier aus nicht zu messen: Sie lädt ihre Parameterliste nicht in den sichtbaren Text, siehe die Notiz.
SchlüsselarbeitOriginalarbeiterreichbar
OpenAI, Model Spec (externe Seite, model-spec.openai.com)
model-spec.openai.comgeprüft 24.09.2026
Die veröffentlichte Verhaltensspezifikation eines Anbieters. Sie belegt, dass Anweisungen aus verschiedenen Rollen eine vorgesehene Rangfolge haben: Der Abschnitt „chain of command“ staffelt Root, System, Developer, User und Guideline und regelt, welche Ebene sich bei einem Konflikt durchsetzt. Verlinkt ist die datierte Fassung vom 18.12.2025, weil eine spätere den Wortlaut ändern kann und ein Zitat dann als fehlend gemeldet würde. Abgerufen am 06.08.2026.
SchlüsselarbeitOriginalarbeiterreichbar
Training language models to follow instructions with human feedback (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Ouyang und Mitautoren zeigen am 04.03.2022, dass ein deutlich kleineres, mit menschlicher Rückmeldung nachtrainiertes Modell hilfreicher antwortet als ein sehr viel größeres ohne. Das ist der Schritt, der aus einem Textfortsetzer einen Assistenten macht, und die Voraussetzung für ChatGPT acht Monate später.
SchlüsselarbeitOriginalarbeiterreichbar
Lost in the Middle: How Language Models Use Long Contexts (externe Seite, aclanthology.org)
aclanthology.orggeprüft 24.09.2026
Die Arbeit von Nelson F. Liu und sechs weiteren, aus der der Ausdruck stammt. Sie misst, wie sich die Antwortgüte ändert, wenn dieselbe Information an verschiedenen Stellen eines langen Kontexts steht, und findet einen U-förmigen Verlauf: Anfang und Ende werden zuverlässig genutzt, die Mitte nicht. Erschienen in den Transactions of the Association for Computational Linguistics 2024, DOI 10.1162/tacl_a_00638.
Originalarbeiterreichbar
aclanthology.orggeprüft 24.09.2026
Cheng-Yu Hsieh und zehn weitere liefern die Erklärung hinter dem Befund: Die Aufmerksamkeit verteilt sich U-förmig über die Eingabe, Anfang und Ende bekommen mehr davon, und zwar unabhängig davon, wie wichtig die Stelle ist. Damit hängt der Effekt an der Position statt am Inhalt. Erschienen in den Findings of the ACL 2024.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Amanda Dsouza, Christopher Glaze, Changho Shin und Frederic Sala prüfen den Effekt am 04.07.2024 an den damals stärksten Modellen und nennen sie beim Namen: Auch GPT-4 und Claude 3 Opus verlieren, wenn die gesuchte Angabe in der Mitte steht. Damit ist belegt, dass es weder an einem Hersteller noch an einer schwachen Modellklasse liegt.
Originalarbeiterreichbar
aclanthology.orggeprüft 24.09.2026
Yijiong Yu und acht weitere zeigen 2025, dass der Effekt bei Modellen mit langem Kontextfenster fortbesteht, und führen ihn auf bestimmte Kanäle in den verborgenen Zuständen zurück. Der Beleg dafür, dass ein größeres Fenster die Sache nicht erledigt. Erschienen in den Findings of the ACL 2025.