GrundlagenGrundkursKapitel 15von 16 im Pfad
Wofür man ein Sprachmodell benutzt
Die Frage „wofür kann ich das benutzen“ bekommt meistens eine Liste zur Antwort, und Listen dieser Art veralten mit jedem Herstellerfeature. Dieses Kapitel ordnet stattdessen nach Formen von Aufgaben, weil die stabil sind.
Wie lange eine Aufgabe sein darf, ist eine andere Frage, und die beantwortet Beurteilen und Einordnen, Kapitel 03 mit einer Zeitmessung.
Ein Modell, viele Aufgaben, und warum das neu war
Bis 2020 brauchte jede Aufgabe ihr eigenes Modell und ihre eigene Datensammlung. Übersetzen war ein System, Zusammenfassen ein anderes, siehe KI-Wissen, Kapitel 06.
Was sich geändert hat, steht im Kurztext der Arbeit, die es zeigte:
Ein Modell, viele Aufgaben, ohne Training je Aufgabe. Deshalb gibt es überhaupt eine Liste, über die sich reden lässt.
Fünf Formen, in die fast alles fällt
Diese Ordnung ist meine, nicht die einer Quelle. Sie hat sich beim Sortieren bewährt und ist keine Einteilung des Fachs.
Umformen. Text hinein, Text hinaus, mit demselben Inhalt in anderer Gestalt: kürzen, umschreiben, den Ton ändern. Gegencheck: lesen. Besser kann es ein Mensch, der die Sache kennt.
Einordnen. Text hinein, eine Kategorie hinaus: Stimmung, Dringlichkeit, Zuständigkeit. Gegencheck: eine Stichprobe gegen bekannte Fälle. Besser kann es ein eigens trainierter Klassifikator, siehe KI-Wissen, Kapitel 04.
Herausziehen. Text hinein, Felder hinaus: Datum, Betrag, Name. Gegencheck: das Schema, und der ist billig. Besser kann es ein Muster im Text, wenn das Format fest ist.
Erzeugen. Wenig hinein, viel hinaus: ein Entwurf, ein Vorschlag, Code. Gegencheck: teuer, weil er die Sache selbst beurteilen muss. Besser kann es eine Vorlage, wenn es die Sache schon gibt.
Übertragen. Text hinein, derselbe Inhalt in einer anderen Sprache hinaus. Gegencheck: jemand, der beide Sprachen kann. Besser kann es ein Übersetzungssystem für dieses Sprachpaar, und ob das noch stimmt, ist gemessen.
Zwei Dinge, die es nur mit einem Werkzeug tut
Rechnen. Ein Sprachmodell sagt das nächste Token voraus, und Ziffernfolgen sind dafür ein schlechter Gegenstand. Beide großen Anbieter dokumentieren deshalb ein Werkzeug, das ein Programm schreibt und ausführt (Beleg (externe Seite, developers.openai.com), Beleg (externe Seite, platform.claude.com)). Wo die Zahl zählt, entsteht sie also außerhalb des Modells.
Nachschlagen. Was ein Modell weiß, hat es einmal gelesen, siehe Kapitel 08. Für alles Aktuelle braucht es eine Suche, und wie das angebunden wird, steht in Kapitel 09.
Wo eine Fähigkeit gemessen ist und wo nur behauptet
Für drei der fünf Formen gibt es Erhebungen mit Zahlen: Erzeugen von Code, Übertragen, und das Beantworten von Wissensfragen. Sie stehen in Beurteilen und Einordnen, Kapitel 04 mit ihren Vorbehalten.
Diesen drei ist gemeinsam, dass es ein Gegenüber gibt, an dem sich ein Ergebnis prüfen lässt: ein Testlauf, eine Referenzübersetzung, eine richtige Antwort. Beim Umformen gibt es mehr als ein richtiges Ergebnis, und beim Einordnen kommen die Kategorien aus dem Betrieb, der sie braucht. Eine fremde Zahl sagt darüber wenig.
Praktisch heißt das: Wer diese beiden Formen einsetzt, prüft am eigenen Material.
Woran Sie eine Aufgabe festmachen
Fragen Sie zuerst, was hineingeht und was herauskommt. Das entscheidet die Form, und die Form entscheidet den Rest.
Rechnen Sie den Gegencheck mit. Eine Aufgabe, deren Prüfung so teuer ist wie die Arbeit, hat wenig gewonnen.
Nennen Sie den Gegenspieler. Für jede Form gibt es etwas, das sie besser kann, und die Frage ist, ob es in Ihrem Fall vorliegt.
Trennen Sie den Weg vom Ergebnis. Dass ein Modell ein Rechenprogramm schreibt, ist belegt. Dass die Zahl darin stimmt, ist eine eigene Prüfung.
Der Überblick ordnet nach Formen. Diese Ebene sagt, warum diese Ordnung nützlich ist: Sie entscheidet, was die Prüfung kostet.
Die Form entscheidet über die Prüfung
Bei jeder Aufgabe fallen zwei Kosten an, die Arbeit selbst und die Kontrolle des Ergebnisses. Die zweite wird meistens vergessen und entscheidet häufiger.
Herausziehen ist am billigsten zu prüfen: Ein Schema sagt, ob die Ausgabe formal stimmt, und das kann ein Programm entscheiden.
Einordnen braucht eine Stichprobe gegen bekannte Fälle. Aufwand einmalig, danach billig.
Umformen braucht jemanden, der den Ausgangstext kennt. Die Prüfung dauert dann fast so lange wie das Lesen des Originals.
Erzeugen ist am teuersten, weil die Prüfung die Sache selbst beurteilen muss. Beim Code gibt es dafür eine Abkürzung, nämlich den Testlauf, und deshalb ist ausgerechnet diese Form am besten gemessen.
Herausziehen, und warum daraus ein Format wurde
Die Form mit der billigsten Prüfung hat als erste eine eigene Schnittstelle bekommen. Seit 2023 lässt sich einem Modell ein Schema mitgeben, an das es seine Ausgabe halten soll (Beleg (externe Seite, openai.com)); inzwischen ist die Einhaltung erzwingbar.
Was damit gesichert ist, gehört klar benannt: Die Ausgabe ist formal gültig. Ob der herausgezogene Betrag der richtige ist, sagt das Schema nicht. Für den Aufbau solcher Aufrufe siehe Kapitel 11.
Code, und was die beiden Messungen unterscheiden
Für die Form Erzeugen gibt es zwei Aufgabensätze, und sie schneiden verschieden zu.
Der eine misst eine Funktion. HumanEval gibt eine Beschreibung vor und prüft, ob die geschriebene Funktion das Richtige tut, also a new evaluation set we release to measure functional correctness for synthesizing programs from docstrings (externe Seite, arxiv.org). Der Ausgangswert von 2021 lautet our model solves 28.8% of the problems, while GPT-3 solves 0% and GPT-J solves 11.4%. (externe Seite, arxiv.org)
Die zweite Zahl derselben Arbeit ist die lehrreichere: we find that repeated sampling from the model is a surprisingly effective strategy for producing working solutions to difficult prompts. (externe Seite, arxiv.org) Mit hundert Versuchen je Aufgabe stieg die Quote auf über 70 Prozent. Was ein einzelner Anlauf wert ist, steht damit auch fest, und warum zwei Läufe verschieden ausfallen, erklärt Kapitel 12.
Der andere misst ein Projekt. SWE-bench nimmt echte Fehlerberichte: SWE-bench, an evaluation framework consisting of 2,294 software engineering problems drawn from real GitHub issues and corresponding pull requests (externe Seite, arxiv.org). Die Aufgabe lautet: Given a codebase along with a description of an issue to be resolved, a language model is tasked with editing the codebase to address the issue. (externe Seite, arxiv.org)
Der Unterschied ist der Zuschnitt. Eine Funktion mit Beschreibung ist eine abgeschlossene Aufgabe; ein Fehlerbericht in einem gewachsenen Projekt verlangt, erst zu finden, wo etwas zu ändern ist. Was diese Zahlen allgemein wert sind, steht in Beurteilen und Einordnen, Kapitel 04.
Übersetzen ist gemessen, und zwar jährlich
Die Form Übertragen hat als einzige eine laufende Erhebung mit menschlicher Bewertung:
Und seit 2024 stehen Sprachmodelle in derselben Erhebung wie die eigens dafür gebauten Systeme: we collected translations from 8 different large language models (LLMs) and 4 online translation providers. (externe Seite, aclanthology.org)
Für die Sprachbreite gibt es eine zweite Zahl. Eine Arbeit von 2022 hat evaluated the performance of over 40,000 different translation directions using a human-translated benchmark, Flores-200 (externe Seite, arxiv.org), also Übersetzungsrichtungen gegen von Menschen erstellte Vorlagen.
Damit ist Übersetzen die am besten belegte Form dieses Kapitels. In KI-Wissen, Kapitel 06 kommt sie nur historisch vor, als das, was vor den Sprachmodellen ein eigenes Verfahren war.
Bild und Ton sind Eingänge
Ein Modell, das ein Bild beschreibt, hat keine neue Fähigkeit. Es ordnet ein, und der Eingang ist ein anderer. Dasselbe gilt für Ton und für ein PDF.
Die Unterscheidung ist praktisch wichtig, weil sonst jede neue Eingabeart die Liste um eine Zeile verlängert. Was ein Modell auf einem Bild erkennt und wo die Genauigkeit endet, steht in Kapitel 13.
Rechnen, und der Umweg über das Programm
Die verbreitete Aussage lautet, Sprachmodelle könnten nicht rechnen. So pauschal ist sie widerlegt: Eine Messung an neu erzeugten Rechenaufgaben zeigt, dass Spitzenmodelle auch dort lösen, siehe Beurteilen und Einordnen, Kapitel 04.
Die belegte Beobachtung ist eine andere und interessanter. Wo es genau werden muss, greifen die Modelle zum Werkzeug: Sie schreiben ein Programm, lassen es laufen und benutzen dessen Ergebnis (Beleg (externe Seite, developers.openai.com)). Beide Häuser dokumentieren dieses Werkzeug, und das ist die Auskunft, die man im Alltag braucht.
Daraus folgt eine Prüfregel: Bei einer Zahl aus einem Chat lohnt die Frage, ob sie gerechnet oder geschrieben wurde. Beides sieht gleich aus.
Die Formen ohne Messung
Umformen, Einordnen und das Finden von Ideen stehen in diesem Kapitel ohne Zahl. Im Quellenbestand dieser Seite gibt es dazu keine Erhebung, die ich gefunden hätte.
Das ist kein Urteil über die Formen. Es heißt, dass die Rechtfertigung eine andere ist: Der Gegencheck ist billig genug, um am eigenen Material zu entscheiden. Wer eine Fähigkeitenliste liest, in der diese Formen mit Zahlen stehen, prüft, woher die Zahlen stammen.
Warum jede Fähigkeitenliste zur Werbung wird
Der Mechanismus ist einfach und hat nichts mit Absicht zu tun. Eine Liste entsteht aus der Frage, was geht. Jeder Eintrag beantwortet sie, und niemand fragt beim Schreiben nach dem, was besser ginge, weil das Recherche kostet und den Eintrag verkompliziert.
Nach zwanzig Einträgen steht ein Katalog da, in dem alles geht. Das ist formal richtig und praktisch wertlos, denn die Frage im Alltag lautet nie, ob etwas geht, sondern ob es der beste verfügbare Weg ist.
Dagegen hilft ein Schema mit drei Feldern, das jeder Eintrag ausfüllen muss: die Form, der Gegencheck mit seinen Kosten, und der Gegenspieler mit Namen.
Die Probe ist das dritte Feld. Streichen Sie es und lesen Sie den Eintrag noch einmal. Wird er dadurch unvollständig, war er sachlich. Liest er sich glatter, war er Werbung.
Der Zuschnitt ist die Arbeit
Beurteilen und Einordnen, Kapitel 03 misst die Länge einer Aufgabe und beschreibt, wie die Erfolgsaussicht damit fällt. Der Schluss daraus ist, Aufgaben klein zu schneiden.
Dieses Kapitel liefert die zweite Achse dazu. Ein Zuschnitt hat neben der Größe eine zweite Stellschraube, nämlich die Form: Aus einer teuer prüfbaren Aufgabe lässt sich oft eine billig prüfbare machen.
Ein Beispiel aus der Praxis. „Fasse diese Mails zusammen und sag mir, was wichtig ist“ ist Umformen plus Einordnen, und der Gegencheck verlangt, die Mails selbst zu lesen. „Ziehe aus jeder Mail Absender, Frist und geforderte Handlung“ ist Herausziehen, und der Gegencheck ist ein Blick auf drei Felder.
Der zweite Auftrag liefert weniger und ist mehr wert, weil das Ergebnis überprüfbar ist.
Was zwei Formen zusammen kosten
Werden Formen verkettet, multiplizieren sich die Fehlerquellen. Herausziehen, dann einordnen, dann formulieren sind drei Stellen, an denen etwas schiefgehen kann, und jede Stufe arbeitet auf dem Ergebnis der vorigen.
Die Rechnung dazu steht in Kapitel 09, und sie fällt schneller ab, als die meisten schätzen. Für den Zuschnitt folgt daraus: Eine Kette mit einem Prüfpunkt in der Mitte ist besser als eine ohne, auch wenn sie umständlicher aussieht.
Beim Code zeigen die beiden Aufgabensätze denselben Effekt in Zahlen. Eine Funktion mit Beschreibung ist eine Stufe; ein Fehlerbericht in einem gewachsenen Projekt verlangt vorher noch, die Stelle zu finden.
Wo die Fähigkeit an der Sprache hängt
Alle genannten Messungen sind überwiegend englisch. Für die drei Formen mit Zahlen heißt das, dass die Zahlen für deutsche Texte nur eingeschränkt gelten.
Zwei Gründe stehen dahinter, und beide sind an anderer Stelle gemessen. Der erste ist die Zerlegung: Ein deutscher Text braucht mehr Token als derselbe Inhalt auf Englisch, siehe Kapitel 03. Der zweite ist der Anteil im Trainingsmaterial.
Für das Übersetzen gibt es dazu eine Erhebung über 40.000 Richtungen (Beleg (externe Seite, arxiv.org)). Für die übrigen Formen fehlt eine vergleichbare Messung, und wer im Deutschen arbeitet, prüft deshalb am eigenen Material.
Was daraus nicht folgt
Aus einer Form folgt keine Eignung. Dass eine Aufgabe zu einer Form gehört, sagt nichts darüber, ob sie in Ihrem Fall gut ausgeht. Die Länge ist eine eigene Frage, siehe Beurteilen und Einordnen, Kapitel 03.
Aus einer fehlenden Messung folgt keine fehlende Fähigkeit. Für Umformen und Einordnen steht hier keine Erhebung. Das ist eine Aussage über die Belege dieser Seite.
Aus einem gültigen Schema folgt keine richtige Angabe. Erzwungene Struktur sichert die Form der Ausgabe, und der Inhalt bleibt zu prüfen.
Aus einem geschriebenen Programm folgt keine richtige Zahl. Der Weg ist belegt, das Ergebnis nicht.
Aus einer englischen Messung folgt keine deutsche. Die Zahlen dieses Kapitels stammen überwiegend aus englischen Aufgabensätzen.
Quellen
8 Einträge, davon 2 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Der Aufgabensatz, der die Messung des Programmierens vom Schnipsel auf das Projekt umgestellt hat: 2.294 Fehlerberichte aus zwölf echten Python-Projekten, und die Aufgabe lautet, den Bestand so zu ändern, dass der Bericht erledigt ist. Entschieden wird über den Testlauf des Projekts. Für ein Kapitel über Aufgabenformen zählt vor allem der Zuschnitt: Er verlangt, Änderungen über mehrere Dateien hinweg abzustimmen, und misst damit etwas anderes als eine einzelne Funktion.
SchlüsselarbeitOriginalarbeiterreichbar
Evaluating Large Language Models Trained on Code (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Die Arbeit von 2021, die HumanEval einführt und damit den anderen Zuschnitt der Code-Messung: eine Funktion mit Beschreibung, entschieden über die Frage, ob sie das Richtige tut. Zwei Zahlen daraus sind bis heute nützlich als Ausgangswert, nämlich 28,8 Prozent im ersten Anlauf und 70,2 Prozent bei hundert Versuchen je Aufgabe. Die zweite Zahl sagt zugleich, was ein einzelner Anlauf wert ist.
Originalarbeiterreichbar
Language Models are Few-Shot Learners (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
GPT-3, eingereicht am 28.05.2020. Zeigt, dass ein ausreichend großes Modell Aufgaben löst, für die es nie eigens trainiert wurde, wenn man ihm im Text ein paar Beispiele vorlegt. Das ist der Grund, warum Prompting überhaupt funktioniert. Die Zusammenfassung beschreibt außerdem, was vorher galt: Ein Sprachverarbeitungssystem brauchte für jede Aufgabe eigens gesammelte Beispiele, Tausende bis Zehntausende.
Dokumentationerreichbar
Code Interpreter (OpenAI API) (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Herstellerdokumentation zu dem Tool, mit dem ein Modell sich ein Programm schreibt und laufen lässt, statt selbst zu rechnen. Sie nennt auch, dass dabei Dateien entstehen dürfen.
Dokumentationerreichbar
Code execution tool (Claude Platform) (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Das Gegenstück bei Anthropic. Die Seite beschreibt eine abgeschottete Umgebung, in der das Modell Programme laufen lässt und Dateien erzeugt.
Originalarbeiterreichbar
Findings of the WMT24 General Machine Translation Shared Task (externe Seite, aclanthology.org)
aclanthology.orggeprüft 24.09.2026
Die jährliche Erhebung zur maschinellen Übersetzung, begutachtet und mit professionellen Bewertern statt einer Kennzahl allein. Für diese Seite ist sie aus zwei Gründen wertvoll: Sie ist eine der wenigen laufenden Messungen mit menschlicher Bewertung, und sie hat 2024 acht Sprachmodelle neben die eigens gebauten Übersetzungssysteme gestellt. Damit lässt sich die Fähigkeit Übersetzen belegen, statt sie zu behaupten.
Originalarbeiterreichbar
No Language Left Behind: Scaling Human-Centered Machine Translation (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Die Arbeit hinter dem Flores-200-Maßstab, mit über 40.000 gemessenen Übersetzungsrichtungen gegen von Menschen übersetzte Vorlagen. Sie liefert die Zahl, die eine Aussage über Sprachbreite belegbar macht, und sie misst ausdrücklich auch, wo eine Übersetzung schadet. Der Ausgangspunkt war die Beobachtung, dass die meisten Sprachen der Welt in der Messung gar nicht vorkommen.
Ankündigung des Herstellerserreichbar
Function calling and other API updates (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
Ab dem 13.06.2023 kann ein Programm dem Modell beschreiben, welche Funktionen es kennt, und das Modell antwortet mit einem Aufruf statt mit Fließtext. Ausgeführt wird nichts vom Modell selbst. Das ist die Grundlage, auf der Agenten und später MCP stehen.