GrundlagenGrundkursKapitel 06von 16 im Pfad
Gute Prompts schreiben
Dieses Kapitel setzt voraus, dass Sie wissen, was ein Prompt ist. Falls nicht, steht das nebenan in Kapitel 05: Gemeint ist alles, was das Modell vor seiner Antwort sieht, nicht nur Ihre Nachricht.
Hier geht es um den Teil, den Sie selbst schreiben.
Warum Ratgeber dazu ständig veralten
Im April 2026 empfahl OpenAI, in Anweisungen an das eigene Modell auf kurze Antworten zu drängen. Im Juli 2026 empfahl OpenAI, genau diese Anweisung wieder zu entfernen: Sie sei „unnötig oder kontraproduktiv“.
Beide Empfehlungen stehen unter derselben Adresse. Zwischen ihnen liegen elf Wochen. Was in dieser Zeit als „richtiges“ Prompten gelernt wurde, galt schon nicht mehr.
Drei Empfehlungen in fünfzehn Monaten
OpenAI führt eine Seite mit Prompting-Hinweisen, die sich je Modell umschaltet. Was dort steht, hat sich zwischen drei Versionen erheblich verschoben.
| Leitfaden | Der Rat, in einem Satz |
|---|---|
| Zu GPT-5.4 (externe Seite, developers.openai.com) | Ausführlich anweisen. Ausgabeform festlegen, Prüfschleifen einbauen, für kleinere Modelle länger und expliziter schreiben. |
| Zu GPT-5.5 (externe Seite, developers.openai.com), 25.04.2026 | Ziele statt Schritte. Mit einem leeren Blatt anfangen statt den alten Prompt zu übernehmen. Ausführliche Ablaufvorgaben streichen. |
| Zu GPT-5.6 (externe Seite, developers.openai.com), 09.07.2026 | Wieder herausnehmen. Wiederholungen und Beispiele kürzen, Tool-Beschreibungen vereinfachen. Bei pauschalen Kürzungsanweisungen wie „Be concise“ nachsehen, ob sie noch etwas leisten. |
Ein sorgfältiger Prompt vom März 2026 hatte im April eine Empfehlung gegen sich und im Juli eine zweite.
Was Sie stattdessen lernen sollten
Das Prinzip hinter den Rezepten.
Was das Modell mit Ihrem Text macht. Es sagt Token für Token voraus, was als Nächstes plausibel ist, gegeben alles, was im Fenster steht. Ihr Text setzt die Bedingungen für diese Vorhersage: Er verschiebt, was wahrscheinlich wird. Wie aus dieser Verschiebung ein einzelnes Wort wird, steht in Kapitel 12.
Woran Sie merken, dass etwas nicht passt. Antworten zu lang, zu allgemein, am Thema vorbei, oder das Modell fragt nach, statt zu handeln. Bei einem gewachsenen Prompt lohnt zuerst das Weglassen, denn eine Zeile herauszunehmen ist billiger, als drei hinzuzufügen.
Manche Ursachen liegen allerdings außerhalb des Fensters, und dort sucht man sonst lange: Zwei verschiedene Antworten auf dieselbe Frage entstehen beim Ziehen (Kapitel 12), eine erfundene Zahl kann an der Bauform hängen (Kapitel 07), und was im Fenster fehlt, muss erst einmal jemand hineinlegen (Kapitel 08).
Dass Ihr Prompt ein Datum hat. Er wurde für ein bestimmtes Modell geschrieben. Wechselt das Modell, wird er zur Annahme statt zur Einstellung mehr.
seitlich verschiebbar
eigene Darstellung, Stand 29.07.2026
Das betrifft nicht nur Entwickler. Die meisten Anwendungen lassen Sie das Modell in einem Auswahlfeld umstellen, und Ihre gespeicherte Vorlage daneben bleibt dieselbe. In diesem Moment ist aus der Einstellung eine Annahme geworden, ohne dass Sie etwas geändert hätten.
Der Nebenbefund, der eigentlich der Hauptbefund ist
Die drei Empfehlungen oben stehen auf einer Seite mit einem Auswahlfeld für das Modell. Wer den Stand zu GPT-5.4 sehen will, hängt einen Parameter an die Adresse und bekommt ihn, bis heute. Der Widerspruch ist also nachlesbar, und für dieses Kapitel war genau das die Voraussetzung: Ohne die drei getrennten Adressen gäbe es die Tabelle oben nicht.
Was fehlt, ist die Zeitachse. Keine der drei Fassungen nennt ein Veröffentlichungsdatum. Das Datum für den 5.5-Stand steht in diesem Kapitel, weil ein Dritter es notiert hat. Beim Hersteller lässt sich ablesen, was heute dort steht. Seit wann, steht nirgends.
Und die Auskunft hat ein Verfallsdatum. Wird ein Modell abgekündigt, geht üblicherweise auch die Seite dazu, und dann fehlt der Vergleichspunkt. Auf dieser Seite gibt es dafür einen belegten Fall: Die Ankündigung, mit der OpenAI das Ende der ChatGPT-Plugins mitteilte, ist heute nur noch in einer Archivfassung (externe Seite, help.openai.com) zu lesen. Wer sich in einer Entscheidungsvorlage auf eine Herstellerseite beruft, beruft sich damit auf etwas, das heute nachprüfbar ist und in einem Jahr vielleicht verschwunden.
Deshalb steht auf dieser Seite an jeder Quelle ein Prüfdatum, nachzulesen im Quellenregister. Bei diesem Kapitel war das der Anlass zum Schreiben.
Ratschläge zum Prompting zerfallen in zwei Gruppen. Die eine steht seit Jahren unverändert in jedem Leitfaden. Die andere wurde in den letzten fünfzehn Monaten zweimal umgeschrieben. Die Trennlinie zu kennen ist nützlicher als jede Sammlung von Vorlagen.
Was stabil ist
Diese Punkte stehen seit Jahren in jedem Leitfaden und haben keinen Versionswechsel verloren:
- Eine Aufgabe je Prompt, oder eine erkennbare Reihenfolge. Zwei unabhängige Aufgaben in einem Text konkurrieren um dieselbe Antwort. Was zusammengehört, gehört dagegen zusammen: Teilschritte auf demselben Material bündelt man besser, dann aber mit Reihenfolge und einer Angabe, wie das Ergebnis auszusehen hat.
- Keine Widersprüche. „Fasse dich kurz“ und „gehe auf alle Punkte ein“ im selben Prompt zwingen das Modell zu einer Wahl, die Sie nicht treffen. Auflösbar ist das durch eine Rangfolge: alle fünf Punkte, jeder in höchstens zwei Sätzen.
- Überprüfbares Ziel. „Schreibe eine gute Zusammenfassung“ ist nicht prüfbar. „Fünf Stichpunkte, jeder mit einer Zahl aus dem Text“ ist es.
- Kontext vor Formulierung. Bevor Sie an der Formulierung feilen, sehen Sie nach, ob dem Modell überhaupt vorliegt, was die Antwort braucht. Ein fehlendes Dokument holt keine Wortwahl herein.
- Was das Modell nicht wissen kann, muss ins Fenster. Auch das, was Ihnen selbstverständlich vorkommt. Getippt haben müssen Sie es deshalb nicht: In einer Anwendung legen ein Tool (Kapitel 09) oder eine Suche (Kapitel 08) es dort ab.
- SystemanweisungRolle, Grenzen, TonAnbieter
- Tool-Beschreibungenwas das Modell aufrufen darfAnbieter
- Gesprächsverlaufalles bisher Gesagteentsteht
- Dokumente und KontextMaterial zur AufgabeSie oder eine Suche
- Ihre Nachrichtdie eigentliche AnweisungSie
Hervorgehoben: Dokumente und Kontext.
Was nicht stabil ist
Die Herstellerempfehlungen zur Ausführlichkeit haben sich innerhalb von fünfzehn Monaten zweimal gedreht.
Der Leitfaden zu GPT-5.4: ausführlich anweisen
Dieser Leitfaden (externe Seite, developers.openai.com) rät zu vertraglich gefassten Ausgaben („Keep outputs compact and structured“), zu klaren Vorgaben, wann das Modell handelt und wann es nachfragt („Set clear defaults for follow-through“), und zu einer Prüfschleife vor folgenreichen Schritten. Für kleinere Modelle gilt: „Prompts for smaller models are often a bit longer and more explicit.“
Ein weiterer Satz gilt bis heute: Rechenzeit sei „a last-mile knob“, also die letzte Stellschraube. Erst am Prompt arbeiten, dann am Aufwand.
Der Leitfaden zu GPT-5.5, 25.04.2026: Ziele statt Schritte
Hier (externe Seite, developers.openai.com) kippt die Richtung. Das Modell sei „a new model family to tune for, not a drop-in replacement“. Und deutlicher:
- „Begin migration with a fresh baseline instead of carrying over every instruction from an older prompt.“
- „Reduce or remove detailed step-by-step process guidance.“
- Zur Ausführlichkeit:
mediumsei die Voreinstellung,lowoft der bessere Startwert.
Der Grund steht zwischen den Zeilen: Die alten Prompts waren prozessorientiert, weil frühere Modelle diese Führung brauchten. Sie brauchen sie nicht mehr, und die Führung wird zur Fessel.
Der Leitfaden zu GPT-5.6, 09.07.2026: wieder herausnehmen
Der nächste Stand (externe Seite, developers.openai.com) geht einen Schritt weiter. Wiederholte Anweisungen und Beispiele zu entfernen und Tool-Beschreibungen zu vereinfachen verbessere sowohl das Ergebnis als auch den Verbrauch. Das Modell antworte von sich aus knapper als sein Vorgänger, weshalb bei pauschalen Kürzungsanweisungen wie „Be concise“ oder „Keep it short“ zu prüfen sei, ob sie noch etwas leisten. Sie könnten überflüssig sein und die Antwort zu knapp geraten lassen.
Damit ist die Anweisung, die man ein Vierteljahr zuvor einbauen sollte, ein Vierteljahr später der Prüfung wert. Der Hersteller hängt dabei eine Bedingung an: behalten, wenn sie liefert. Als Verbot gelesen, ersetzt sie ein veraltetes Rezept durch ein neues.
Ein zweiter Fall: nicht die Länge, das Verhalten
Die drei Stände oben drehen sich um eine einzige Frage: wie ausführlich ein Prompt sein soll. Der Leitfaden zu GPT-6 Astra (externe Seite, developers.openai.com), dem Nachfolger von GPT-5.6 Sol, zeigt eine zweite Achse, auf der sich ein Modellwechsel bemerkbar macht: das Verhalten selbst.
OpenAI beschreibt Astra als vorsichtiger im Umgang mit Unklarheit als seinen Vorgänger: „The model is designed to be a more effective collaborator and is thus more likely to ask the user a question when additional input could materially change the result. This can cause it to stop when the user may expect it to make reasonable assumptions and persist.“ Wer mit dem alten Modell keine Rückfragen gewohnt war, bekommt mit demselben Prompt plötzlich mehr davon.
Als Gegengewicht schlägt der Leitfaden vor, Formulierungen wie ‚can you’, ‚I want to’ oder ‚help me’ ausdrücklich als Handlungsaufforderung zu lesen, wo das Modell sonst zurückfragen würde: „treat these as instructions to do the work and take action“. Das ist eine Anweisung gegen eine neue Eigenschaft des Modells. Mit der Länge des Prompts hat sie nichts zu tun.
Zweite Stelle: Dateien wie AGENTS.md, in denen Werkzeuge oder Skills eigene Anweisungen hinterlegen. Astra reagiert nach Angaben von OpenAI empfindlicher darauf, auch wenn sie der eigentlichen Nutzeranweisung widersprechen: „It can be more sensitive to instructions contained in skills and other files, such as AGENTS.md.“ Empfohlen wird ein ausdrücklicher Vorrang: „The user’s instructions take precedence over guidelines provided in a skill.“
Dritte Stelle, ohne Bezug zum Verhalten: eine Liste englischer Füllwörter, die das Modell in eigenen Texten vermeiden soll, darunter ‚delve’, ‚foster’ und ‚leverage’.
Für dieses Kapitel zählt der Befund mehr als die einzelne Zeile: Ein neues Modell kann eine Eigenschaft mitbringen, die einen eigenen Gegen-Prompt braucht, unabhängig von der Ausführlichkeit. Die Lehre von oben gilt auch hier: Ein Prompt gehört zu dem Modell, für das er geschrieben wurde. Diesmal betrifft der Wechsel das Verhalten.
Was aus den Techniken wurde, die man einmal gelernt hat
Vor drei Jahren gehörte zum Prompting eine Handvoll Kniffe. Die meisten davon sind eingebaut worden statt falsch zu werden. Das ist der Unterschied, der zählt: Eine Technik, die das Modell von sich aus anwendet, muss man nicht mehr anweisen, und die Anweisung addiert sich dann zu etwas, das ohnehin geschieht.
| Technik | Wozu sie gedacht war | Was davon bleibt |
|---|---|---|
| „Denke Schritt für Schritt“ | Zwischenschritte erzwingen, statt sofort zu antworten | Bei Reasoning-Modellen überflüssig, die rechnen vor der Antwort ohnehin. Die Anweisung kostet Kontext und kann die Antwort in eine Form drängen, die nicht passt. Ein fachlich vorgeschriebener Ablauf ist etwas anderes und gehört weiterhin in den Prompt |
| Beispiele mitgeben | dem Modell Aufgabe und Ausgabeform zeigen | Weiter nützlich, für Form, Grenzfälle und eigenwillige Entscheidungsregeln. Dass ein Modell aus wenigen Beispielen im Text eine Aufgabe übernimmt (externe Seite, arxiv.org), war der Befund, mit dem Prompting anfing. Der Leitfaden zu GPT-5.6 rät, wiederholte Beispiele zu entfernen, und im selben Atemzug, die zu behalten, die eine Produktanforderung festhalten oder eine gemessene Lücke schließen (externe Seite, developers.openai.com) |
| Rollenzuweisung („Du bist ein erfahrener …“) | Fachlichkeit und Ton setzen | Wirkt auf Ton, Begriffe und Schwerpunkt. Wissen bringt sie keines mit: Ein Rollensatz ersetzt kein Dokument |
| Höflichkeit, Druck, Belohnung | angeblich bessere Ergebnisse | Als verlässliche Stellschraube hat sich davon nichts durchgesetzt. Höflichkeit kostet nichts und schadet nichts; Druck und Belohnungsversprechen ersetzen kein klares Ziel |
Was übrig bleibt, ist unspektakulär und hält seit Jahren: eine Aufgabe je Prompt, ein überprüfbares Ziel, und alles an Kontext, was das Modell nicht wissen kann.
Die Stellschrauben, die kein Prompt sind
Zwei Dinge werden oft in den Prompt geschrieben, obwohl sie danebenliegen und dort besser aufgehoben sind:
Ausführlichkeit. Bei OpenAI gibt es dafür einen eigenen Parameter
(text.verbosity). Ihn zu setzen ist zuverlässiger, als es dem Modell in Worten
mitzuteilen, und es kostet keine Token.
Rechenaufwand. Reasoning-Modelle nehmen sich vor der Antwort Zeit für Zwischenschritte, siehe o1, September 2024. Auch das ist ein Parameter. Der Rat aus dem Leitfaden zu GPT-5.4 gilt weiter: erst der Prompt, dann der Aufwand. Mehr Rechenzeit repariert keine fehlende Information.
Vorgehen, das den nächsten Modellwechsel übersteht
- Mit dem einfachsten Prompt anfangen, der die Aufgabe löst. Vollständigkeit ist hier kein Ziel.
- Fehler genauer ansehen als Erfolge, beide aber messen. Wo die Antwort schiefging, fehlt meistens Kontext. Wo sie stimmte, steht das, was Ihre nächste Änderung kaputt machen kann, und das merkt sonst niemand.
- Eine Zeile nach der anderen hinzufügen und jeweils prüfen, ob sie etwas ändert. Zeilen ohne nachweisbare Wirkung fliegen raus.
- Datum und Modell danebenschreiben. Ein Prompt ohne diese Angabe ist in sechs Monaten nicht mehr bewertbar.
- Beim Modellwechsel zwei Fassungen messen, den bisherigen Prompt am neuen Modell und einen frisch geschriebenen. Welche gewinnt, sagt Ihnen der Fallsatz.
Der fünfte Punkt ist selbst ein Beispiel für das Thema dieses Kapitels. Der Leitfaden zu GPT-5.5 rät zum leeren Blatt. Der zu GPT-5.6 rät, von einem Prompt auszugehen, der bereits funktioniert, und jeweils eine Gruppe von Anweisungen, Beispielen oder Tools zu entfernen (externe Seite, developers.openai.com). Das sind zwei verschiedene Wege, und wer nur den älteren gelesen hat, hält ihn für „den Rat des Herstellers“. Genau deshalb misst man beide gegen dieselben Fälle, statt sich für einen zu entscheiden.
Wie das an einem gewachsenen Aufbau in Claude Code aussieht, mit Anthropics Prüfbefehl für veraltete Anweisungen und einer Messung davor und danach, steht im Werkstattbericht Neues Modell, alte Anweisungen.
seitlich verschiebbar
eigene Darstellung, Stand 29.07.2026
Das Verfahren steht und fällt mit dem Prüfen, und Prüfen heißt hier nicht „einmal ausprobiert“. Es braucht einen festen Satz von Fällen: eine Eingabe und das, was herauskommen soll. Wer den hat, kann ihn maschinell laufen lassen und sieht nach jeder Änderung, was sich verschoben hat. Wer ihn nicht hat, streicht nie eine Zeile, weil Streichen eine Behauptung ist.
Für den Hausgebrauch fängt das klein an: eine Handvoll Eingaben, die Sie ohnehin ständig tippen, jeweils mit einem Satz dazu, woran Sie eine gute Antwort erkennen würden. Wichtiger als ihre Zahl ist ihre Streuung. Ein kurzer und ein langer Fall sollten dabei sein, einer mit fehlenden Angaben und einer, bei dem eine falsche Antwort wirklich wehtut. Diesen Satz Fälle nehmen Sie beim nächsten Modellwechsel wieder hervor. Er ist die einzige Möglichkeit, den Wechsel zu beurteilen, statt ihn zu spüren.
Was das über Prompting-Ratgeber sagt
Ein Ratgeber, der keine Modellversion und kein Datum nennt, ist nicht prüfbar. Er kann für den Stand von vor einem Jahr geschrieben sein, und man sieht es ihm nicht an. Das gilt für Blogbeiträge, für Kurse, für Vorlagensammlungen und für die Herstellerdokumentation selbst: Die Seite, aus der die drei Stände oben stammen, nennt keines von beidem im Text. Die Modellangabe steckt in der Adresse, das Datum fehlt ganz.
Im Betrieb stellt sich eine andere Frage als beim gelegentlichen Schreiben. Der Prompt ist dann ein Bauteil mit Lebenszyklus, Abhängigkeiten und Verfallsdatum, kein bloßer Text.
Prompt-Narben
Ein produktiver Systemprompt wächst nach einem erkennbaren Muster. Etwas geht schief, jemand fügt eine Zeile hinzu, das Problem verschwindet. Die Zeile bleibt. Ein halbes Jahr später steht dort ein Absatz, dessen Anlass niemand mehr kennt und den niemand zu löschen wagt.
Beispiele, die man in fast jedem gewachsenen Prompt findet:
- „Antworte immer auf Deutsch“, eingefügt, als das Modell noch häufig ins Englische rutschte.
- „Erfinde keine Fakten“, eingefügt nach einer peinlichen Halluzination.
- „Denke Schritt für Schritt“, eingefügt, als das noch messbar half.
- Ein Ausgabebeispiel, das ein Feld enthält, das es seit zwei Umbauten nicht mehr gibt.
seitlich verschiebbar
eigene Darstellung, Stand 29.07.2026
Jede dieser Zeilen war einmal richtig. Zusammen ergeben sie einen Text, der dem Modell mehr über die Vergangenheit des Projekts erzählt als über die Aufgabe. Genau darauf zielt der Rat aus dem Leitfaden zu GPT-5.5 (externe Seite, developers.openai.com): mit einem leeren Blatt anfangen statt jede Anweisung mitzuschleppen.
Migration als eigener Vorgang
Ein Modellwechsel ist kein Austausch einer Bibliothek. Der Hersteller sagt das im Leitfaden zu GPT-5.5 (externe Seite, developers.openai.com) selbst: „treat it as a new model family to tune for, not a drop-in replacement“. Worauf man bei der Auswahl sonst noch sieht, steht in Kapitel 10; hier geht es um den Text, der beim Wechsel mitkommt.
Ein Ablauf, der sich bewährt:
- Den alten Prompt am neuen Modell messen, unverändert. Das ist der Nullpunkt. Ohne ihn lässt sich später nicht sagen, ob eine Verbesserung vom Modell kommt oder vom neu geschriebenen Text.
- Die Aufgabe neu beschreiben, ohne den alten Prompt danebenzulegen. Fünf Sätze, die das Ziel und die Grenzen benennen.
- Beide gegen dieselben Fälle laufen lassen. Ohne einen festen Satz von Testfällen ist der Rest Geschmackssache.
- Erst die Abweichungen ansehen, nicht die Trefferquote. Wo der neue Prompt schlechter ist, steht in der Regel eine der alten Zeilen dahinter, die tatsächlich etwas leistete.
- Diese Zeilen einzeln zurückholen, jeweils mit einer Messung.
- Den alten Prompt aufheben, mit Modellangabe und Datum, nicht überschreiben.
Schritt 1 ist am 06.08.2026 dazugekommen, und der Anlass ist derselbe, von dem dieses Kapitel handelt. Der Leitfaden zu GPT-5.5 rät zum leeren Blatt, der zu GPT-5.6 rät, von einem Prompt und Tool-Bestand auszugehen, der bereits funktioniert, und jeweils eine Gruppe herauszunehmen und dieselben Prüfungen erneut zu fahren (externe Seite, developers.openai.com). Beides sind vernünftige Wege, und sie widersprechen einander nur, solange man einen von beiden für die Lehre des Hauses hält. Wer den alten Prompt als Nullpunkt mitmisst, hat beide Arme im Vergleich und muss sich vorher für keinen entscheiden.
Der Aufwand ist der Grund, warum es kaum jemand tut. Er ist auch der Grund, warum viele Anwendungen mit einem Modell laufen, dessen Empfehlungen zwei Stände alt sind.
Was sich davon automatisieren lässt
Schritt 3 ist Maschinenarbeit, sobald zwei Dinge vorliegen: eine Eingabe und ein Kriterium für die Ausgabe. Dann läuft der Vergleich alt gegen neu ohne Zutun, und der Wechsel wird zu einer Zahl statt zu einem Gefühl. Nötig ist dafür ein Zugang, über den sich derselbe Aufruf hundertmal wiederholen lässt, siehe Kapitel 11.
Die Einschränkung steckt im Wort Kriterium. Bei einer Klassifikation oder einer Ausgabe in fester Form ist es die erwartete Antwort, und der Vergleich läuft über das Feld oder das Etikett, nach Möglichkeit vereinheitlicht: Ein roher Zeichenvergleich macht aus „Ja“ und „ja“ zwei verschiedene Antworten.
Bei freiem Text gibt es keine Musterlösung, die wörtlich stimmen müsste. Dort prüft man Eigenschaften, und die zerfallen in zwei ungleiche Gruppen. Sind die drei geforderten Zahlen enthalten? Ist die Antwort kürzer als N Zeichen? Steht das Aktenzeichen im Kopf? Das ist maschinell entscheidbar, und zusammen ergibt es ein brauchbares Netz.
Die zweite Gruppe sieht genauso aus und ist es nicht. „Steht nichts drin, was nicht in der Vorlage stand“ verlangt ein Urteil darüber, ob eine Aussage von einer anderen gedeckt ist, und dafür gibt es keinen Textvergleich. Diese Seite hat dazu eine eigene Messung: Ein Prüflauf ruft jede Quelle ab und sucht die hinterlegten Zitate darin, und das läuft seit Wochen ohne Zutun. Ob ein Satz im Kapitel durch das gefundene Zitat auch belegt ist, entscheidet weiterhin ein Mensch. Ein zweites Modell als Prüfer verwischt diese Grenze und handelt sich dessen Fehler zusätzlich ein.
Wer eine Anwendung baut, in der Anwender das Modell selbst umstellen können, sollte diesen Satz Fälle mitliefern und den Vergleich anbieten. Sonst verlagert die Auswahlliste eine Entscheidung auf jemanden, der sie nicht bewerten kann. Wie das in einem eigenen Projekt aussieht, steht im Werkstattbericht zur Diktier-App: Jedes Modell, das in Frage kam, lief durch dieselben Aufnahmen, bevor es Standard wurde.
Zahlen, denen man nicht folgen sollte
Im Leitfaden für GPT-5.6 (externe Seite, developers.openai.com) stehen Zahlen aus internen Messungen des Herstellers an Coding-Agenten: 10 bis 15 Prozent bessere Bewertungen, 41 bis 66 Prozent weniger Token, 33 bis 67 Prozent geringere Kosten.
Diese Zahlen sind ein gutes Übungsstück, weil sie fast alles falsch machen, was man an einer Zahl falsch machen kann:
- Der Urheber hat ein Interesse. Der Hersteller misst die Wirkung seiner eigenen Empfehlung.
- Die Messung ist nicht offengelegt. Weder die Aufgaben noch die Prompts noch die Bewertungsverfahren sind einsehbar.
- Die Spanne ist riesig. 41 bis 66 Prozent ergibt einen Wertebereich.
- Der Hersteller selbst schränkt ein. Die Werte seien „directional“, Ergebnisse hingen von der Arbeitslast ab.
- Die Aufgabe ist eng. Gemessen wurde an Coding-Agenten. Wer Texte zusammenfasst, hat einen anderen Fall.
Nichts davon macht die Zahlen falsch. Es macht sie unbrauchbar als Grundlage für eine Entscheidung im eigenen Haus. Die Richtung stimmt vermutlich, die Größe ist unbekannt, und die eigene Größe muss man selbst messen.
Undatierte Dokumentation
Der Befund, der diesem Kapitel zugrunde liegt, betrifft das Belegen statt das Prompting.
Die drei Stände aus Kapitel und Tabelle stehen auf einer Seite, die sich über einen Parameter in der Adresse umschaltet. Das ist die gute Nachricht: Alle drei sind heute abrufbar, und der Prüflauf dieser Seite bestätigt jeden Morgen, dass die zitierten Sätze dort noch stehen. Ohne diese Trennung gäbe es das Kapitel nicht.
Die Schwäche liegt woanders, und sie ist leicht zu übersehen:
- Keine der Fassungen nennt ein Datum. Ablesbar ist, was heute dort steht. Seit wann, steht nirgends, und beim 5.5-Stand musste ein Dritter aushelfen.
- Was sich innerhalb eines Standes ändert, hinterlässt keine Spur. Der Umschalter trennt Modelle. Zwei Fassungen desselben Modell-Leitfadens trennt er nicht, und ein Änderungsprotokoll an der Seite gibt es nicht.
- Der Vergleichspunkt hat ein Verfallsdatum. Mit einem abgekündigten Modell verschwindet üblicherweise auch die Seite dazu. Das ist keine Vermutung: Die Ankündigung zum Ende der ChatGPT-Plugins steht heute nur noch im Archiv (externe Seite, help.openai.com).
- Eine Fußnote auf diese Seite belegt damit den heutigen Stand, auch wenn sie vor einem Jahr geschrieben wurde. Was damals dort stand, belegt sie nie.
Der Umgang damit ist unspektakulär und funktioniert:
Abbild sichern. Beim ersten Berufen eine Archivkopie anlegen und diese verlinken, nicht die Originaladresse allein.
Datum und Version notieren. Wenn der Hersteller keines liefert, das eigene Abrufdatum. Es ist schwächer, aber es ist eine Angabe.
Im eigenen Repo festhalten, welcher Prompt zu welchem Modell und welchem Dokumentationsstand gehört. Prompts gehören unter Versionskontrolle, nicht in ein Wiki, in dem die letzte Fassung die einzige ist.
Auf dieser Seite ist genau das der Grund, warum an jeder Quelle ein Prüfdatum steht und sie im Quellenregister geführt wird. Beim Kapitel über Token war das Formsache. Hier ist es der Anlass gewesen.
Quellen
9 Einträge, davon 1 Schlüsselarbeit8 erreichbar · 1 abgeschaltet
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
Training language models to follow instructions with human feedback (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Ouyang und Mitautoren zeigen am 04.03.2022, dass ein deutlich kleineres, mit menschlicher Rückmeldung nachtrainiertes Modell hilfreicher antwortet als ein sehr viel größeres ohne. Das ist der Schritt, der aus einem Textfortsetzer einen Assistenten macht, und die Voraussetzung für ChatGPT acht Monate später.
Dokumentationerreichbar
OpenAI, Model guidance für GPT-5.4 (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Der Prompting-Leitfaden des Herstellers zum Stand GPT-5.4. Er rät zu ausführlicher Anweisung: knappe, strukturierte Ausgaben vertraglich festlegen, Prüfschleifen vor folgenreichen Schritten einbauen, für kleinere Modelle länger und expliziter schreiben. Rechenzeit gilt als letzte Stellschraube, nicht als erste.
Dokumentationerreichbar
OpenAI, Model guidance für GPT-5.5 (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Derselbe Leitfaden zum Stand GPT-5.5, veröffentlicht am 25.04.2026. Er nimmt den vorherigen Rat in Teilen zurück: das Modell als neue Familie behandeln statt als Ersatz, mit einem leeren Blatt beginnen statt alte Anweisungen zu übernehmen, ausführliche Schritt-für-Schritt-Vorgaben verringern oder streichen.
Dokumentationerreichbar
OpenAI, Model guidance für GPT-5.6 (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Der Leitfaden zum Stand GPT-5.6, Entwicklerfassung vom 09.07.2026. Wiederholte Anweisungen und Beispiele wieder herausnehmen, Tool-Beschreibungen vereinfachen. Bei pauschalen Kürzungsanweisungen wie „Be concise“ ist zu prüfen, ob sie noch etwas leisten, weil das Modell von sich aus knapper antwortet. Er hängt an beide Empfehlungen eine Bedingung: behalten, was eine Produktanforderung festhält oder eine gemessene Lücke schließt.
Artikelerreichbar
Simon Willison, GPT-5.5 prompting guide (externe Seite, simonwillison.net)
simonwillison.netgeprüft 24.09.2026
Datiert den Erscheinungstag des GPT-5.5-Leitfadens auf den 25.04.2026 und zitiert die Kernsätze wörtlich. Wird hier nur als Datumsbeleg geführt: Die Herstellerseite selbst nennt keinen Zeitpunkt, an dem sie geschrieben wurde.
Ankündigung des Herstellersabgeschaltet
Winding down the ChatGPT plugins beta (externe Seite, help.openai.com)
help.openai.comgeprüft 29.07.2026
Die Abkündigung der ChatGPT-Erweiterungen mit beiden Stichtagen: Ab dem 19.03.2024 keine neuen Gespräche mehr, am 09.04.2024 Schluss. Nachfolger sind die GPTs mit Aktionen. Nennt nebenbei die Größenordnung des Verzeichnisses, gut tausend Erweiterungen.
Ankündigung des Herstellerserreichbar
Learning to reason with LLMs (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
OpenAI stellt am 12.09.2024 ein Modell vor, das vor der Antwort Zwischenschritte erzeugt und dafür mehr Rechenzeit zur Antwortzeit verbraucht. Der Zugewinn entsteht damit auch beim Antworten und nicht mehr nur beim Training. Das eröffnet einen zweiten Weg, Modelle besser zu machen.
Originalarbeiterreichbar
Language Models are Few-Shot Learners (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
GPT-3, eingereicht am 28.05.2020. Zeigt, dass ein ausreichend großes Modell Aufgaben löst, für die es nie eigens trainiert wurde, wenn man ihm im Text ein paar Beispiele vorlegt. Das ist der Grund, warum Prompting überhaupt funktioniert. Die Zusammenfassung beschreibt außerdem, was vorher galt: Ein Sprachverarbeitungssystem brauchte für jede Aufgabe eigens gesammelte Beispiele, Tausende bis Zehntausende.
Dokumentationerreichbar
Using GPT-6 Astra (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
OpenAIs Modell-Dokumentation zu GPT-6 Astra mit Prompt-Beispielen zu Rückfrageverhalten, Eigeninitiative, dem Vorrang von Nutzeranweisungen vor Skill-Dateien wie AGENTS.md und einer Liste zu vermeidender Füllwörter.