Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenGrundkursKapitel 15von 16 im Pfad

Wofür man ein Sprachmodell benutzt

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Die Frage „wofür kann ich das benutzen“ bekommt meistens eine Liste zur Antwort, und Listen dieser Art veralten mit jedem Herstellerfeature. Dieses Kapitel ordnet stattdessen nach Formen von Aufgaben, weil die stabil sind.

Wie lange eine Aufgabe sein darf, ist eine andere Frage, und die beantwortet Beurteilen und Einordnen, Kapitel 03 mit einer Zeitmessung.

Ein Modell, viele Aufgaben, und warum das neu war

Bis 2020 brauchte jede Aufgabe ihr eigenes Modell und ihre eigene Datensammlung. Übersetzen war ein System, Zusammenfassen ein anderes, siehe KI-Wissen, Kapitel 06.

Was sich geändert hat, steht im Kurztext der Arbeit, die es zeigte:

GPT-3 achieves strong performance on many NLP datasets, including translation, question-answering, and cloze tasks, as well as several tasks that require on-the-fly reasoning or domain adaptation, such as unscrambling words, using a novel word in a sentence, or performing 3-digit arithmetic (externe Seite, arxiv.org)

Ein Modell, viele Aufgaben, ohne Training je Aufgabe. Deshalb gibt es überhaupt eine Liste, über die sich reden lässt.

Fünf Formen, in die fast alles fällt

Diese Ordnung ist meine, nicht die einer Quelle. Sie hat sich beim Sortieren bewährt und ist keine Einteilung des Fachs.

Umformen. Text hinein, Text hinaus, mit demselben Inhalt in anderer Gestalt: kürzen, umschreiben, den Ton ändern. Gegencheck: lesen. Besser kann es ein Mensch, der die Sache kennt.

Einordnen. Text hinein, eine Kategorie hinaus: Stimmung, Dringlichkeit, Zuständigkeit. Gegencheck: eine Stichprobe gegen bekannte Fälle. Besser kann es ein eigens trainierter Klassifikator, siehe KI-Wissen, Kapitel 04.

Herausziehen. Text hinein, Felder hinaus: Datum, Betrag, Name. Gegencheck: das Schema, und der ist billig. Besser kann es ein Muster im Text, wenn das Format fest ist.

Erzeugen. Wenig hinein, viel hinaus: ein Entwurf, ein Vorschlag, Code. Gegencheck: teuer, weil er die Sache selbst beurteilen muss. Besser kann es eine Vorlage, wenn es die Sache schon gibt.

Übertragen. Text hinein, derselbe Inhalt in einer anderen Sprache hinaus. Gegencheck: jemand, der beide Sprachen kann. Besser kann es ein Übersetzungssystem für dieses Sprachpaar, und ob das noch stimmt, ist gemessen.

Zwei Dinge, die es nur mit einem Werkzeug tut

Rechnen. Ein Sprachmodell sagt das nächste Token voraus, und Ziffernfolgen sind dafür ein schlechter Gegenstand. Beide großen Anbieter dokumentieren deshalb ein Werkzeug, das ein Programm schreibt und ausführt (Beleg (externe Seite, developers.openai.com), Beleg (externe Seite, platform.claude.com)). Wo die Zahl zählt, entsteht sie also außerhalb des Modells.

Nachschlagen. Was ein Modell weiß, hat es einmal gelesen, siehe Kapitel 08. Für alles Aktuelle braucht es eine Suche, und wie das angebunden wird, steht in Kapitel 09.

Wo eine Fähigkeit gemessen ist und wo nur behauptet

Für drei der fünf Formen gibt es Erhebungen mit Zahlen: Erzeugen von Code, Übertragen, und das Beantworten von Wissensfragen. Sie stehen in Beurteilen und Einordnen, Kapitel 04 mit ihren Vorbehalten.

Diesen drei ist gemeinsam, dass es ein Gegenüber gibt, an dem sich ein Ergebnis prüfen lässt: ein Testlauf, eine Referenzübersetzung, eine richtige Antwort. Beim Umformen gibt es mehr als ein richtiges Ergebnis, und beim Einordnen kommen die Kategorien aus dem Betrieb, der sie braucht. Eine fremde Zahl sagt darüber wenig.

Praktisch heißt das: Wer diese beiden Formen einsetzt, prüft am eigenen Material.

Woran Sie eine Aufgabe festmachen

Fragen Sie zuerst, was hineingeht und was herauskommt. Das entscheidet die Form, und die Form entscheidet den Rest.

Rechnen Sie den Gegencheck mit. Eine Aufgabe, deren Prüfung so teuer ist wie die Arbeit, hat wenig gewonnen.

Nennen Sie den Gegenspieler. Für jede Form gibt es etwas, das sie besser kann, und die Frage ist, ob es in Ihrem Fall vorliegt.

Trennen Sie den Weg vom Ergebnis. Dass ein Modell ein Rechenprogramm schreibt, ist belegt. Dass die Zahl darin stimmt, ist eine eigene Prüfung.

Quellen

8 Einträge, davon 2 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Der Aufgabensatz, der die Messung des Programmierens vom Schnipsel auf das Projekt umgestellt hat: 2.294 Fehlerberichte aus zwölf echten Python-Projekten, und die Aufgabe lautet, den Bestand so zu ändern, dass der Bericht erledigt ist. Entschieden wird über den Testlauf des Projekts. Für ein Kapitel über Aufgabenformen zählt vor allem der Zuschnitt: Er verlangt, Änderungen über mehrere Dateien hinweg abzustimmen, und misst damit etwas anderes als eine einzelne Funktion.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Evaluating Large Language Models Trained on Code (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Arbeit von 2021, die HumanEval einführt und damit den anderen Zuschnitt der Code-Messung: eine Funktion mit Beschreibung, entschieden über die Frage, ob sie das Richtige tut. Zwei Zahlen daraus sind bis heute nützlich als Ausgangswert, nämlich 28,8 Prozent im ersten Anlauf und 70,2 Prozent bei hundert Versuchen je Aufgabe. Die zweite Zahl sagt zugleich, was ein einzelner Anlauf wert ist.

  • Originalarbeiterreichbar

    Language Models are Few-Shot Learners (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    GPT-3, eingereicht am 28.05.2020. Zeigt, dass ein ausreichend großes Modell Aufgaben löst, für die es nie eigens trainiert wurde, wenn man ihm im Text ein paar Beispiele vorlegt. Das ist der Grund, warum Prompting überhaupt funktioniert. Die Zusammenfassung beschreibt außerdem, was vorher galt: Ein Sprachverarbeitungssystem brauchte für jede Aufgabe eigens gesammelte Beispiele, Tausende bis Zehntausende.

    Archivfassung (externe Seite, web.archive.org)

  • Dokumentationerreichbar

    Code Interpreter (OpenAI API) (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Herstellerdokumentation zu dem Tool, mit dem ein Modell sich ein Programm schreibt und laufen lässt, statt selbst zu rechnen. Sie nennt auch, dass dabei Dateien entstehen dürfen.

  • Dokumentationerreichbar

    Code execution tool (Claude Platform) (externe Seite, platform.claude.com)

    platform.claude.comgeprüft 24.09.2026

    Das Gegenstück bei Anthropic. Die Seite beschreibt eine abgeschottete Umgebung, in der das Modell Programme laufen lässt und Dateien erzeugt.

  • Originalarbeiterreichbar

    Findings of the WMT24 General Machine Translation Shared Task (externe Seite, aclanthology.org)

    aclanthology.orggeprüft 24.09.2026

    Die jährliche Erhebung zur maschinellen Übersetzung, begutachtet und mit professionellen Bewertern statt einer Kennzahl allein. Für diese Seite ist sie aus zwei Gründen wertvoll: Sie ist eine der wenigen laufenden Messungen mit menschlicher Bewertung, und sie hat 2024 acht Sprachmodelle neben die eigens gebauten Übersetzungssysteme gestellt. Damit lässt sich die Fähigkeit Übersetzen belegen, statt sie zu behaupten.

  • Originalarbeiterreichbar

    No Language Left Behind: Scaling Human-Centered Machine Translation (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Arbeit hinter dem Flores-200-Maßstab, mit über 40.000 gemessenen Übersetzungsrichtungen gegen von Menschen übersetzte Vorlagen. Sie liefert die Zahl, die eine Aussage über Sprachbreite belegbar macht, und sie misst ausdrücklich auch, wo eine Übersetzung schadet. Der Ausgangspunkt war die Beobachtung, dass die meisten Sprachen der Welt in der Messung gar nicht vorkommen.

  • Ankündigung des Herstellerserreichbar

    Function calling and other API updates (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    Ab dem 13.06.2023 kann ein Programm dem Modell beschreiben, welche Funktionen es kennt, und das Modell antwortet mit einem Aufruf statt mit Fließtext. Ausgeführt wird nichts vom Modell selbst. Das ist die Grundlage, auf der Agenten und später MCP stehen.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.