Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenGrundkursKapitel 10von 16 im Pfad

Welches Modell, welche Stufe

Tiefe 1: Überblick · Lesezeit 7 Min. · Stand

Kapitel 09 zeigt, wie ein Modell etwas anstellt, was es selbst nicht kann. Danach kommt die Frage, die jeder stellt, der über die Voreinstellung hinausgeht: Womit arbeite ich eigentlich, und ist das das richtige.

Der Versuch, die Frage abzuschaffen

Am 7. August 2025 hat OpenAI sie abgeschafft. Mit GPT-5 verschwand die Modellauswahl aus ChatGPT, und an ihre Stelle trat ein einziges umschaltendes System (externe Seite, help.openai.com), das selbst entscheiden sollte, welche Frage welches Modell bekommt.

Fünf Tage später stand die Auswahl wieder da:

4o is back in the model picker for all paid users by default (externe Seite, help.openai.com)

Am 11. Dezember 2025 fiel auch die zweite Automatik, die Umschaltung auf das nachdenkende Modell. Der Eintrag sagt im ersten Satz, für wen:

Update for free and Go users: We’re removing automatic model switching for reasoning in ChatGPT. (externe Seite, help.openai.com)

Gut drei Monate später stand sie wieder da, diesmal als Einstellung, die man ausmachen kann:

Turn automatic switching between Instant and Thinking on or off (externe Seite, help.openai.com)

Sieben Monate, vier Änderungen an derselben Frage, beim Anbieter mit den meisten Nutzern. Einen Sieger hat das nicht hervorgebracht. Am Ende stehen die Stufen sichtbar im Wähler und ein Schalter daneben, und genau das ist der beste verfügbare Beleg dafür, dass diese Wahl bei Ihnen bleibt.

Drei Stufen, grob gesagt

Die Anbieter führen ihre Modelle in Stufen, von der billigen und schnellen bis zur teuersten. Wie viele es sind und wie sie heißen, geht auseinander, und warum sich daraus keine gemeinsame Tabelle bauen lässt, steht in Tiefe 2. Für den Anfang genügen drei. Anthropic schreibt die Zuordnung selbst hin:

Choose Haiku for simple tasks, Sonnet for most production workloads, and Opus for the most complex reasoning (externe Seite, platform.claude.com)

Klein heißt schnell und billig, und es reicht für alles, was hauptsächlich Umformung ist, etwa zusammenfassen oder ein Feld aus einem Text herausziehen. Welche Formen von Aufgaben es überhaupt gibt, steht in Kapitel 15.

Mittel ist der Arbeitsplatz für den Alltag, und die Anbieter empfehlen ihn für den Regelfall.

Groß lohnt sich, wo eine Aufgabe über mehrere Schritte geht und ein Fehler am Anfang alles danach verdirbt.

Was die Anbieter dabei offenlassen, ist die Größe im Wortsinn. Wie viele Gewichte in einem dieser Modelle stecken, veröffentlicht keiner von ihnen; die Stufen sind Preis- und Leistungsklassen. Bei den offenen Modellen steht die Zahl im Namen, dazu Beurteilen und Einordnen, Kapitel 01 und KI-Wissen, Kapitel 10.

Die Faustregel dazu ist unspektakulär und reicht weit: Fangen Sie in der Mitte an. Nach oben gehen Sie, wenn das Ergebnis nicht taugt, nach unten, wenn es immer taugt.

Der zweite Regler

Neben der Stufe gibt es seit 2024 eine zweite Stellschraube. Ein Modell kann vor der Antwort Zwischenschritte erzeugen, also gewissermaßen nachdenken, und wie lange es das tut, lässt sich einstellen. Bei Claude Opus 5 reicht der Regler von low bis max, bei den anderen Anbietern heißt er anders und steuert dieselbe Sache. Bei seiner Einführung verschob er eine Entscheidung, die bis dahin bei der Modellwahl lag: Wer sparen wollte, nahm vorher ein kleineres Modell und dreht heute die Stufe herunter.

Stufe und Reasoning Effort spannen eine Fläche auf. Dieselbe Antwortgüte lässt sich an zwei Stellen erreichen. Der Raum, den beide Regler aufspannen: waagerecht die Modellstufe, senkrecht der Reasoning Effort. Zwei Punkte auf verschiedenen Wegen liegen gleich weit oben rechts, was zeigt, dass die Regler aufeinander wirken. Ohne Skala, weil es keine Messung gibt. REASONING EFFORT klein mittel groß MODELLSTUFE wenig viel mittel, viel Denkzeit groß, wenig Denkzeit Wer nur nach rechts geht, hat die Hälfte probiert.

seitlich verschiebbar

Zwei Stellschrauben, nicht eine: welche Stufe das Modell hat, und wie lange es vor der Antwort nachdenkt.

eigene Darstellung, Stand 07.08.2026

Wichtig daran ist, dass beide Regler auf dasselbe Ergebnis wirken. Ein mittleres Modell mit viel Denkzeit kann ein großes mit wenig schlagen, und umgekehrt. Wer die Stufe hochdreht und die Denkzeit vergisst, hat nur die Hälfte probiert. Dieselbe Wirkung heißt trotzdem noch keine Austauschbarkeit: Was mehr Denkzeit kostet und ab wann sie aufhört zu helfen, steht in Tiefe 3.

Was der Abstand ausmacht

Zwischen der kleinsten und der größten Stufe desselben Anbieters liegt beim Preis der Faktor 8 bis 25, je nachdem, wen Sie fragen; die drei Zahlen stehen in Tiefe 2. Das ist mehr, als die meisten schätzen, und es ist der Grund, warum sich die Frage überhaupt lohnt: Wer eine Aufgabe, die millionenfach anfällt, eine Stufe tiefer erledigen kann, spart nicht ein paar Prozent.

Umgekehrt ist bei einer Handvoll Anfragen am Tag jede Sparüberlegung verlorene Zeit. Dann entscheidet allein, was die Aufgabe braucht, und der Preis fällt aus der Rechnung. Die Reihenfolge bleibt dieselbe: erst die Aufgabe.

Woran Sie die Wahl festmachen

Drei Fragen genügen für den Anfang, und keine davon handelt vom Modell:

Wie oft läuft das? Einmal am Tag oder tausendmal in der Stunde. Nur im zweiten Fall lohnt das Nachrechnen.

Was passiert bei einem Fehler? Fällt er sofort auf, oder steht er anschließend in einem Bericht, den jemand für geprüft hält.

Hängt etwas daran? Eine Aufgabe mit zehn aufeinander aufbauenden Schritten verzeiht wenig, weil sich Fehler dabei fortpflanzen. Das steht ausführlicher in Kapitel 09.

Quellen

6 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Dokumentationerreichbar

    ChatGPT Release Notes (externe Seite, help.openai.com)

    help.openai.comgeprüft 24.09.2026

    Die fortlaufenden Änderungshinweise zu ChatGPT. Sie führen die Automatik und ihre Rücknahmen in derselben Liste: am 07.08.2025 ein einziges umschaltendes System, fünf Tage später der Modellwähler zurück für zahlende Kunden, am 11.12.2025 das Ende des automatischen Umschaltens auf das nachdenkende Modell für die kostenlosen Zugänge und die Go-Stufe, am 17.03.2026 dieselbe Automatik zurück als abschaltbare Einstellung. Am 10.06.2026 heißen die Stufen Instant, Medium, High und Extra High, der Schalter steht in den Einstellungen.

    Archivfassung (externe Seite, web.archive.org)

  • Dokumentationerreichbar

    Anthropic, Pricing (externe Seite, platform.claude.com)

    platform.claude.comgeprüft 24.09.2026

    Anthropics Preisverzeichnis mit den Zahlen je Modell und den Aufschlägen daneben. Zwei Angaben darin wiegen für einen Vergleich schwerer als die Preise selbst: Die Modelle ab Claude 4.7 rechnen mit einem anderen Tokenizer, der für denselben Text rund 30 Prozent mehr Token erzeugt, und Claude Sonnet 5 steht bis zum 31.08.2026 zu einem Einführungspreis von 2 und 10 statt 3 und 15 USD je Million Token. Abgerufen am 07.08.2026: Haiku 4.5 zu 1 und 5, Sonnet 5 zu 2 und 10, Opus 5 zu 5 und 25, Fable 5 zu 10 und 50.

  • Dokumentationerreichbar

    Anthropic, Pricing: Hinweis zum Sonnet-5-Einführungspreis (externe Seite, platform.claude.com)

    platform.claude.comgeprüft 24.09.2026

    Dieselbe Preisseite wie unter anthropic-preise, mit einem Hinweis, der dort nicht ergänzt werden kann: Die für Sonnet 5 zum 31.08.2026 angekündigte Erhöhung auf 3 und 15 statt 2 und 10 USD je Million Token entfällt, der Einführungspreis gilt dauerhaft weiter.

  • Dokumentationerreichbar

    OpenAI, Pricing (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    OpenAIs Preisverzeichnis der Schnittstelle. Die Generation 5.6 führt drei Stufen, abgerufen am 07.08.2026: gpt-5.6-luna zu 0,20 und 1,20 USD je Million Token, gpt-5.6-terra zu 2 und 12, gpt-5.6-sol zu 5 und 30. Zwischen kleinster und größter Stufe liegt damit der Faktor 25, der größte der drei Anbieter. Jede Stufe steht zweimal in der Tabelle, für kurzen und für langen Zusammenhang: im langen kostet sol 10 und 45, terra 4 und 18, luna 0,40 und 1,80, also doppelte Eingabe bei anderthalbfacher Ausgabe. Der Stapelbetrieb halbiert, ein zwischengespeicherter Eingabe-Token kostet ein Zehntel und das Schreiben in den Cache das 1,25-fache. Das Verhältnis fünf bis sechs zwischen Ausgabe und Eingabe gilt für die Textmodelle; gpt-realtime-2.1 rechnet für Audio 32 und 64 USD, also zwei zu eins.

  • Dokumentationerreichbar

    Google, Gemini API Pricing (externe Seite, ai.google.dev)

    ai.google.devgeprüft 24.09.2026

    Googles Preisverzeichnis für die Gemini-Schnittstelle. Es führt vier Generationen gleichzeitig und staffelt zusätzlich nach Kontextlänge und Dienstgüte. Abgerufen am 07.08.2026: Gemini 3.1 Flash-Lite zu 0,25 und 1,50 USD je Million Token, Gemini 3.5 Flash-Lite zu 0,30 und 2,50, Gemini 3.6 Flash zu 1,50 und 7,50, Gemini 3.1 Pro Preview zu 2 und 12 bis 200.000 Token und zu 4 und 18 darüber. Die höhere Nummer ist dabei nicht durchgängig die teurere: Gemini 3.5 Flash verlangt für die Ausgabe 9 USD, Gemini 3.6 Flash 7,50. Der Cache kostet hier zusätzlich nach Zeit, 1 USD je Million Token und Stunde bei den Flash-Modellen und 4,50 bei Pro. An der Ausgabespalte steht der Vermerk, dass Denk-Token darin enthalten sind.

  • Dokumentationerreichbar

    Anthropic, Extended thinking (externe Seite, platform.claude.com)

    platform.claude.comgeprüft 24.09.2026

    Die Herstellerdokumentation zum Denkregler. Sie beantwortet drei Fragen, die man sonst raten müsste: Denk-Token werden als Ausgabe abgerechnet und sind in einem eigenen Feld der Antwort nachzählbar, das eingestellte Budget wirkt als Ziel und wird nicht garantiert eingehalten, und ein größeres Budget bringt abnehmenden Ertrag bei steigender Wartezeit. Dazu der Befund, dass der von Hand gesetzte Regler bei Claude 4.7 und später einen Fehler 400 auslöst und durch ein adaptives Verfahren ersetzt ist, das selbst entscheidet, ob überhaupt gedacht wird.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.