Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenBeurteilen und EinordnenKapitel 03von 8 im Pfad

Chancen und Grenzen

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

„Was kann KI?“ lässt sich als Liste von Fähigkeiten kaum beantworten, weil jede Antwort am nächsten Beispiel scheitert. Zwei andere Größen machen die Frage beantwortbar, und beide sind gemessen: wie lang eine Aufgabe ist, und wie oft sie gelingen muss.

Die Länge entscheidet mehr als das Fachgebiet

Eine Forschungsgruppe hat 2025 eine Kennzahl vorgeschlagen, die eine Modellfähigkeit in menschlicher Arbeitszeit ausdrückt:

we propose a new metric: 50%-task-completion time horizon (externe Seite, arxiv.org)

Gemeint ist damit:

This is the time humans typically take to complete tasks that AI models can complete with 50% success rate (externe Seite, arxiv.org)

Zuerst wurde also gemessen, wie lange Fachleute für 170 Aufgaben brauchen. Danach, welche davon die Modelle schaffen. Das Ergebnis ist eine klare Kurve:

current models have almost 100% success rate on tasks taking humans less than 4 minutes, but succeed <10% of the time on tasks taking more than around 4 hours (externe Seite, metr.org)

Hier stehen Chance und Grenze in einem Satz. Was ein Mensch in vier Minuten erledigt, gelingt praktisch immer. Was ihn einen halben Tag kostet, gelingt selten. Dazwischen fällt die Kurve ab.

Ein abfallender Verlauf: Aufgaben unter vier Minuten menschlicher Arbeitszeit gelingen fast immer, ab etwa vier Stunden unter zehn Prozent. Eine von links oben nach rechts unten abfallende Kurve. Der linke Punkt liegt bei vier Minuten menschlicher Arbeitszeit und nahe hundert Prozent gelöster Aufgaben, der rechte bei vier Stunden und zehn Prozent. Nur diese beiden Punkte sind belegt, der Verlauf dazwischen ist schematisch. Anteil gelöster Aufgaben 100 % 10 % 4 Minuten 4 Stunden wie lange ein Mensch dafür braucht fast immer selten Belegt sind die beiden Punkte. Der Verlauf dazwischen ist schematisch.

seitlich verschiebbar

Belegt sind die beiden Punkte: unter vier Minuten menschlicher Arbeitszeit fast immer, ab etwa vier Stunden unter zehn Prozent. Der Verlauf dazwischen ist schematisch, die Erhebung nennt ihn nicht Punkt für Punkt.

eigene Darstellung nach METR 2025, Stand 29.08.2026

Wie oft es gelingen muss

Die zweite Größe wird beim Lesen von Ranglisten fast immer übersehen. Eine Erfolgsquote von 50 Prozent klingt nach der Hälfte der Aufgaben. Für den Betrieb zählt etwas anderes: ob derselbe Vorgang morgen wieder gelingt.

Ein Test für Agenten im Kundendialog hat beides nebeneinandergestellt und kam auf:

succeed on <50% of the tasks, and are quite inconsistent (pass^8 <25% in retail) (externe Seite, arxiv.org)

Von dem, was einmal gelingt, gelingt also nur ein Teil achtmal hintereinander. Was diese Kennzahl genau misst, steht in Kapitel 04.

Dieselbe Unterscheidung steckt auch im Zeithorizont. Er wird für verschiedene Zuverlässigkeitsstufen berechnet:

the 50%-time horizon is the duration at which an agent is predicted to succeed half the time (externe Seite, metr.org)

Wer eine Aufgabe an ein System übergibt, das sie in der Hälfte der Fälle schafft, hat die Arbeit verschoben. Er prüft jetzt Ergebnisse, statt sie zu erzeugen.

Warum lange Aufgaben so schnell abfallen

Der Grund dafür ist Arithmetik und steht ausgerechnet in Grundkurs, Kapitel 09: Eine Kette aus zehn Schritten mit je 99 Prozent Zuverlässigkeit landet bei 90 Prozent, mit je 95 Prozent bei 60. Eine lange Aufgabe ist eine lange Kette, und jedes Glied multipliziert sich hinein.

Die Chancenseite, in derselben Zahl

Über Grenzen wird mehr geschrieben als über das andere Ende derselben Kurve, und das andere Ende ist deutlich. Aufgaben unter vier Minuten menschlicher Arbeitszeit gelingen nahezu immer.

Diese Klasse ist größer, als sie klingt. Vier Minuten sind: einen Absatz einordnen, drei Angaben aus einem Dokument ziehen, eine Mail zusammenfassen, einen Entwurf gegen eine Regel prüfen, eine Liste sortieren, eine Tabelle umformatieren. In einem Arbeitstag stecken hunderte solcher Vorgänge, und für sie ist die Frage nach dem Können längst beantwortet.

Damit verschiebt sich die eigentliche Arbeit. Sie besteht darin, einen Vorgang so zuzuschneiden, dass er in diese Klasse fällt.

Was daraus für die Auswahl folgt

Eine Aufgabe eignet sich, wenn drei Bedingungen zusammenkommen: Sie ist kurz genug, sie ist klar abgegrenzt, und ihr Ergebnis lässt sich prüfen. Fehlt die dritte, verschiebt sich die Arbeit nur: Aus dem Erzeugen wird ein Nachrechnen, und das kann länger dauern als die Sache selbst.

Der umgekehrte Fall ist ebenso brauchbar. Eine Aufgabe, die einen Menschen Stunden kostet, wird selten am Stück gelingen. Sie lässt sich zerlegen, und dann gilt für jedes Stück wieder die kurze Kette. Der Preis dafür steht in Ebene 3: Zerlegen heißt Übergabestellen bauen, und an jeder davon muss jemand festlegen, was als fertig gilt.

Quellen

6 Einträge, davon 3 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    Measuring AI Ability to Complete Long Software Tasks (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Kwa, West, Becker und 21 weitere Mitautoren von METR schlagen im März 2025 eine Kennzahl vor, die eine Modellfähigkeit in menschlicher Arbeitszeit ausdrückt: die Aufgabenlänge, die ein Modell mit einer bestimmten Wahrscheinlichkeit schafft. Gemessen wurde an 170 Aufgaben, für die zuerst Fachleute die Bearbeitungszeit lieferten. Die Arbeit nennt ihre eigenen Grenzen ausdrücklich, darunter die Übertragbarkeit auf Arbeit außerhalb der Testreihe.

  • SchlüsselarbeitOriginalarbeiterreichbar

    τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Yao und Mitautoren stellen einen Test vor, in dem ein Agent mit einem simulierten Kunden spricht und dabei Regeln einhalten muss. Gemessen wird am Zustand der Datenbank am Ende. Der bleibende Beitrag ist die Kennzahl pass hoch k: Sie fragt, ob derselbe Auftrag k mal hintereinander gelingt, und trennt damit Können von Verlässlichkeit.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Stop Comparing LLM Agents Without Disclosing the Harness (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Ein Positionspapier vom 07.05.2026, das die Umgebung zur eigentlichen Stellgröße erklärt. Es benennt die Bestandteile eines Harness einzeln (Kontextaufbau, Tool-Verkehr, Ablaufsteuerung, Prüfung) und hält fest, dass heutige Vergleiche Verbesserungen der Umgebung dem Modell zuschreiben. Die stärkste verfügbare Belegstelle für die Frage, wie viel der Aufbau um ein Modell herum ausmacht.

  • Originalarbeiterreichbar

    METR, Measuring AI Ability to Complete Long Software Tasks (externe Seite, metr.org)

    metr.orggeprüft 24.09.2026

    Die eigene Darstellung der Arbeit vom 19.03.2025. Sie nennt die beiden Werte, die im Abstract fehlen und die den Befund erst greifbar machen: Aufgaben unter vier Minuten gelingen fast immer, Aufgaben über etwa vier Stunden in weniger als zehn Prozent der Fälle.

  • Datenerreichbar

    Task-Completion Time Horizons of Frontier AI Models (externe Seite, metr.org)

    metr.orggeprüft 24.09.2026

    Die laufend fortgeschriebene Messreihe zu derselben Kennzahl, inzwischen in einer zweiten Fassung mit größerer Aufgabensammlung. Nennt neben den Werten die Erläuterung, was eine solche Angabe genau bedeutet, und den Hinweis, dass Zuverlässigkeitsstufen oberhalb von 80 Prozent mit dieser Aufgabensammlung nicht messbar wären.

  • Originalarbeiterreichbar

    Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Der Messaufbau zum Positionspapier, vom 27.05.2026: 106 abgeschottete Aufgaben, mehrere Umgebungen über mehrere Modelle, 5.194 Läufe. Zählt die Bestandteile einer Agentenumgebung in einer Reihe auf und liefert den Befund, dass eine Fähigkeit dem Paar aus Modell und Umgebung zuzurechnen ist. Benennt außerdem eine wiederkehrende Fehlerart, bei der die Überlegung des Modells sich von der Rückmeldung der Tools löst.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.