GrundlagenBeurteilen und EinordnenKapitel 03von 8 im Pfad
Chancen und Grenzen
„Was kann KI?“ lässt sich als Liste von Fähigkeiten kaum beantworten, weil jede Antwort am nächsten Beispiel scheitert. Zwei andere Größen machen die Frage beantwortbar, und beide sind gemessen: wie lang eine Aufgabe ist, und wie oft sie gelingen muss.
Die Länge entscheidet mehr als das Fachgebiet
Eine Forschungsgruppe hat 2025 eine Kennzahl vorgeschlagen, die eine Modellfähigkeit in menschlicher Arbeitszeit ausdrückt:
we propose a new metric: 50%-task-completion time horizon (externe Seite, arxiv.org)
Gemeint ist damit:
Zuerst wurde also gemessen, wie lange Fachleute für 170 Aufgaben brauchen. Danach, welche davon die Modelle schaffen. Das Ergebnis ist eine klare Kurve:
Hier stehen Chance und Grenze in einem Satz. Was ein Mensch in vier Minuten erledigt, gelingt praktisch immer. Was ihn einen halben Tag kostet, gelingt selten. Dazwischen fällt die Kurve ab.
seitlich verschiebbar
eigene Darstellung nach METR 2025, Stand 29.08.2026
Wie oft es gelingen muss
Die zweite Größe wird beim Lesen von Ranglisten fast immer übersehen. Eine Erfolgsquote von 50 Prozent klingt nach der Hälfte der Aufgaben. Für den Betrieb zählt etwas anderes: ob derselbe Vorgang morgen wieder gelingt.
Ein Test für Agenten im Kundendialog hat beides nebeneinandergestellt und kam auf:
Von dem, was einmal gelingt, gelingt also nur ein Teil achtmal hintereinander. Was diese Kennzahl genau misst, steht in Kapitel 04.
Dieselbe Unterscheidung steckt auch im Zeithorizont. Er wird für verschiedene Zuverlässigkeitsstufen berechnet:
Wer eine Aufgabe an ein System übergibt, das sie in der Hälfte der Fälle schafft, hat die Arbeit verschoben. Er prüft jetzt Ergebnisse, statt sie zu erzeugen.
Warum lange Aufgaben so schnell abfallen
Der Grund dafür ist Arithmetik und steht ausgerechnet in Grundkurs, Kapitel 09: Eine Kette aus zehn Schritten mit je 99 Prozent Zuverlässigkeit landet bei 90 Prozent, mit je 95 Prozent bei 60. Eine lange Aufgabe ist eine lange Kette, und jedes Glied multipliziert sich hinein.
Die Chancenseite, in derselben Zahl
Über Grenzen wird mehr geschrieben als über das andere Ende derselben Kurve, und das andere Ende ist deutlich. Aufgaben unter vier Minuten menschlicher Arbeitszeit gelingen nahezu immer.
Diese Klasse ist größer, als sie klingt. Vier Minuten sind: einen Absatz einordnen, drei Angaben aus einem Dokument ziehen, eine Mail zusammenfassen, einen Entwurf gegen eine Regel prüfen, eine Liste sortieren, eine Tabelle umformatieren. In einem Arbeitstag stecken hunderte solcher Vorgänge, und für sie ist die Frage nach dem Können längst beantwortet.
Damit verschiebt sich die eigentliche Arbeit. Sie besteht darin, einen Vorgang so zuzuschneiden, dass er in diese Klasse fällt.
Was daraus für die Auswahl folgt
Eine Aufgabe eignet sich, wenn drei Bedingungen zusammenkommen: Sie ist kurz genug, sie ist klar abgegrenzt, und ihr Ergebnis lässt sich prüfen. Fehlt die dritte, verschiebt sich die Arbeit nur: Aus dem Erzeugen wird ein Nachrechnen, und das kann länger dauern als die Sache selbst.
Der umgekehrte Fall ist ebenso brauchbar. Eine Aufgabe, die einen Menschen Stunden kostet, wird selten am Stück gelingen. Sie lässt sich zerlegen, und dann gilt für jedes Stück wieder die kurze Kette. Der Preis dafür steht in Ebene 3: Zerlegen heißt Übergabestellen bauen, und an jeder davon muss jemand festlegen, was als fertig gilt.
Die Kennzahl aus Ebene 1 ist genauer, als sie klingt, und sie sagt etwas anderes, als die meisten daraus lesen. Beides lohnt einen zweiten Blick.
Was eine Zeitangabe wirklich behauptet
Als die Arbeit erschien, lag der Wert für das damals stärkste Modell bei
Fünfzig Minuten. Die naheliegende Lesart lautet: Alles, was einen Menschen weniger als fünfzig Minuten kostet, schafft dieses Modell in der Hälfte der Fälle. Die Betreiber der Messreihe halten in ihren eigenen Erläuterungen dagegen, dass die Antwort dazwischenliegt: Der Wert stammt aus einer angepassten Kurve über Aufgaben verschiedener Länge, und bei einer einzelnen Aufgabe von fünfzig Minuten Dauer sagt er weder das eine noch das andere genau voraus.
Praktisch heißt das: Die Zahl ordnet Größenordnungen ein. Vier Minuten, fünfzig Minuten, vier Stunden sind drei verschiedene Welten. Zwischen 45 und 55 Minuten zu unterscheiden, gibt sie nicht her.
Die Zahl, die es nicht gibt
Für den Betrieb wäre eine andere Stufe interessant. Wer einen Vorgang automatisieren will, denkt an 99 Prozent, nicht an 50. Genau diese Zahl ist nicht zu haben, und die Begründung dafür ist lehrreich: Eine Messung bei 99 Prozent bräuchte sehr viel mehr Aufgaben, und zwar sehr kurze, für die sich verlässliche menschliche Vergleichszeiten kaum gewinnen lassen.
Was die Betreiber stattdessen anbieten, ist eine zweite Stufe und eine Vermutung:
Der 80-Prozent-Horizont liegt dabei deutlich unter dem 50-Prozent-Horizont. Wer also eine Aufgabe sucht, die zuverlässig gelingt, muss sie erheblich kürzer schneiden, als die bekanntere Zahl nahelegt.
Zwei Achsen, die oft verwechselt werden
Länge und Zuverlässigkeit sind zwei Größen, und sie beantworten verschiedene Fragen.
Die Länge sagt, wie viel Arbeit in einem Zug erledigt wird. Sie hängt an der Kette: Jeder Schritt multipliziert sich hinein, und die Rechnung dazu steht in Grundkurs, Kapitel 09.
Die Zuverlässigkeit sagt, wie oft dasselbe gelingt. Sie hängt am Einzelvorgang, und die Kennzahl dafür misst Wiederholungen desselben Auftrags (Kapitel 04).
Ein System kann bei der einen gut und bei der anderen schlecht sein. Ein Agent, der eine Zwei-Stunden-Aufgabe in der Hälfte der Fälle schafft, ist für eine einmalige Recherche brauchbar und für einen Nachtlauf ungeeignet, der ohne Aufsicht durchlaufen soll.
Woher die Verbesserung kommt
Die Arbeit benennt, was den Zeithorizont in den letzten Jahren gehoben hat, und die Antwort ist bemerkenswert unspektakulär:
Verlässlichkeit und der Umgang mit eigenen Fehlern. Beides sind Eigenschaften, die auch die Umgebung um das Modell herum beeinflusst, und genau darauf zielt Agenten und Harness, Kapitel 04. Ein Positionspapier vom Mai 2026 formuliert die Folge scharf:
Wer also an der Grenze steht, hat zwei Wege. Er wartet auf ein Modell mit längerem Horizont, oder er baut die Umgebung so, dass Fehler auffangbar werden.
Wie Sie den eigenen Fall einordnen
Drei Fragen genügen für eine erste Einschätzung, und alle drei lassen sich ohne Tool beantworten.
- Wie lange bräuchte ein eingearbeiteter Mensch dafür? Das ist die Größe, auf die sich die Messungen beziehen. Unter zehn Minuten liegt im günstigen Bereich, über zwei Stunden im ungünstigen.
- Wie oft läuft das? Einmal im Quartal verträgt eine Quote von 70 Prozent. Hundertmal am Tag verträgt sie nicht.
- Wer merkt einen Fehler, und wie schnell? Ein Ergebnis, das jemand ohnehin liest, darf unsicherer sein als eines, das direkt weiterverarbeitet wird.
Wer die Zahlen aus den vorigen Ebenen für eine Entscheidung benutzt, sollte wissen, worauf sie stehen. Die Verfasser sagen es selbst, und zwar deutlicher als die meisten, die sie zitieren.
Was die Messung einschränkt
Die Arbeit diskutiert ihre Grenzen ausdrücklich, unter anderem die externe Gültigkeit. Gemessen wurde an einer Zusammenstellung aus zwei Forschungssammlungen und 66 eigens gebauten kürzeren Aufgaben, alle aus der Softwareentwicklung. Für Arbeit außerhalb dieses Zuschnitts steht der Beleg aus.
Dazu kommt eine methodische Eigenheit, die man beim Zitieren leicht übergeht: Der Wert ist die Stelle, an der eine angepasste Kurve eine Schwelle schneidet, und damit selbst gemessen hat ihn niemand. Wie die Betreiber es beschreiben, wird für jedes Modell eine logistische Kurve über die menschliche Bearbeitungsdauer gelegt, und der Zeithorizont ist deren Schnittpunkt mit 50 oder 80 Prozent. Eine Kurve über hundert Aufgaben glättet, und eine einzelne Aufgabe kann weit daneben liegen.
Die Messreihe selbst benennt außerdem eine Obergrenze, ab der ihre eigenen Werte unzuverlässig werden. Für alles darüber gibt sie keine Auskunft.
Warum die Kettenformel zu freundlich rechnet
Grundkurs, Kapitel 09 rechnet die Kette aus und nennt die Annahmen dazu: dass jeder Schritt für das Ergebnis nötig ist, dass keiner wiederholt wird, und dass die Schritte einander unbeeinflusst lassen. Die dritte Annahme ist die schwächste, und Harness-Bench liefert dazu den Befund aus der Praxis:
Wenn die Überlegung des Modells sich einmal von der Wirklichkeit gelöst hat, sind die folgenden Schritte nicht unabhängig davon. Sie sind alle betroffen. Die Formel unterschätzt den Abfall dann.
In die andere Richtung wirkt die zweite Annahme. Ein Aufbau, der einen gescheiterten Schritt wiederholen darf, kommt besser weg, als die Formel sagt. Das ist der eigentliche Grund, warum die Fehlerbehandlung im Harness so viel bewegt: Sie greift genau dort ein, wo die Multiplikation stattfindet.
Die Rechnung für den eigenen Betrieb
Aus der erlaubten Fehlerzahl lässt sich die nötige Zuverlässigkeit ableiten, statt sie zu schätzen. Ein Vorgang läuft 200 mal im Monat, und Sie können zwei Fehlschläge im Monat auffangen. Dann brauchen Sie 99 Prozent je Lauf.
Besteht dieser Vorgang aus fünf Schritten, muss jeder einzelne davon 99,8 Prozent erreichen, denn 0,998 hoch 5 ergibt 0,990. Bei zehn Schritten sind es 99,9 Prozent je Schritt.
Diese Zahlen sind der Grund, warum ein Zeithorizont von 50 Prozent so weit von einem Dauerbetrieb entfernt liegt. Zwischen beiden liegen Größenordnungen. Von 50 auf 99,8 Prozent ist der Abstand nicht knapp fünfzig Prozentpunkte, er ist der Faktor 250 in der Fehlerquote.
Zwei Auswege gibt es, und beide verkürzen die Kette. Der eine zerlegt den Vorgang in Teile mit je eigener Abnahme. Der andere baut eine Prüfung ein, die den Fehler auffängt, bevor er sich fortpflanzt. Was dabei als Prüfung taugt, steht in Vibe-Coding / Agentic Engineering, Kapitel 07.
Das Zerlegen hat allerdings einen Preis, den die Rechnung nicht zeigt. Jede Trennstelle ist eine Übergabe, und an jeder muss jemand festlegen, was als fertig gilt. Fünf Teilschritte mit je eigener Abnahme brauchen fünf solcher Festlegungen, und wo sie fehlen, wandert die Unsicherheit nur an eine andere Stelle: Der Schritt gilt als gelungen, weil sein Ergebnis plausibel aussieht.
Genau das ist die Fehlerart, die Harness-Bench im Feld gemessen hat. Sie steht nicht am Ende einer Kette, sie steht an jeder Trennstelle darin.
Die Chancenseite, beziffert
Die Diskussion über Grenzen verdeckt leicht, wie deutlich die andere Seite ausfällt. Aufgaben unter vier Minuten menschlicher Arbeitszeit gelingen laut derselben Messung nahezu immer. Das ist eine große Klasse: Text einordnen, Angaben aus einem Dokument ziehen, eine Zusammenfassung anfertigen, einen Entwurf gegen eine Regel prüfen.
Für diese Klasse ist die interessante Frage nicht mehr, ob das Modell es kann. Sie lautet, ob sich der Vorgang so zuschneiden lässt, dass er in diese Klasse fällt. Genau das ist Gestaltungsarbeit, und sie liegt beim Bauenden.
Was daraus folgt
Eine Fähigkeitsangabe ohne Zuverlässigkeitsstufe ist unvollständig. 50 Prozent und 80 Prozent beschreiben verschiedene Systeme, auch wenn dasselbe Modell darin steckt.
Die eigene Kette gehört gezählt. Wie viele Schritte muss ein Vorgang wirklich nehmen, und welche davon lassen sich zusammenfassen oder wegnehmen.
Die Zerlegung ist der stärkste Hebel. Sie verkürzt die Kette und bringt die Teile in den Bereich, in dem die Messungen nahezu vollständige Erfolge zeigen.
Und die Messung bleibt eine über Software. Wer sie auf ein anderes Gebiet überträgt, übernimmt eine Annahme, für die es keinen Beleg gibt. Wie eine eigene Erhebung aussieht, steht in Kapitel 04.
Quellen
6 Einträge, davon 3 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
Measuring AI Ability to Complete Long Software Tasks (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Kwa, West, Becker und 21 weitere Mitautoren von METR schlagen im März 2025 eine Kennzahl vor, die eine Modellfähigkeit in menschlicher Arbeitszeit ausdrückt: die Aufgabenlänge, die ein Modell mit einer bestimmten Wahrscheinlichkeit schafft. Gemessen wurde an 170 Aufgaben, für die zuerst Fachleute die Bearbeitungszeit lieferten. Die Arbeit nennt ihre eigenen Grenzen ausdrücklich, darunter die Übertragbarkeit auf Arbeit außerhalb der Testreihe.
SchlüsselarbeitOriginalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Yao und Mitautoren stellen einen Test vor, in dem ein Agent mit einem simulierten Kunden spricht und dabei Regeln einhalten muss. Gemessen wird am Zustand der Datenbank am Ende. Der bleibende Beitrag ist die Kennzahl pass hoch k: Sie fragt, ob derselbe Auftrag k mal hintereinander gelingt, und trennt damit Können von Verlässlichkeit.
SchlüsselarbeitOriginalarbeiterreichbar
Stop Comparing LLM Agents Without Disclosing the Harness (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Ein Positionspapier vom 07.05.2026, das die Umgebung zur eigentlichen Stellgröße erklärt. Es benennt die Bestandteile eines Harness einzeln (Kontextaufbau, Tool-Verkehr, Ablaufsteuerung, Prüfung) und hält fest, dass heutige Vergleiche Verbesserungen der Umgebung dem Modell zuschreiben. Die stärkste verfügbare Belegstelle für die Frage, wie viel der Aufbau um ein Modell herum ausmacht.
Originalarbeiterreichbar
METR, Measuring AI Ability to Complete Long Software Tasks (externe Seite, metr.org)
metr.orggeprüft 24.09.2026
Die eigene Darstellung der Arbeit vom 19.03.2025. Sie nennt die beiden Werte, die im Abstract fehlen und die den Befund erst greifbar machen: Aufgaben unter vier Minuten gelingen fast immer, Aufgaben über etwa vier Stunden in weniger als zehn Prozent der Fälle.
Datenerreichbar
Task-Completion Time Horizons of Frontier AI Models (externe Seite, metr.org)
metr.orggeprüft 24.09.2026
Die laufend fortgeschriebene Messreihe zu derselben Kennzahl, inzwischen in einer zweiten Fassung mit größerer Aufgabensammlung. Nennt neben den Werten die Erläuterung, was eine solche Angabe genau bedeutet, und den Hinweis, dass Zuverlässigkeitsstufen oberhalb von 80 Prozent mit dieser Aufgabensammlung nicht messbar wären.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Der Messaufbau zum Positionspapier, vom 27.05.2026: 106 abgeschottete Aufgaben, mehrere Umgebungen über mehrere Modelle, 5.194 Läufe. Zählt die Bestandteile einer Agentenumgebung in einer Reihe auf und liefert den Befund, dass eine Fähigkeit dem Paar aus Modell und Umgebung zuzurechnen ist. Benennt außerdem eine wiederkehrende Fehlerart, bei der die Überlegung des Modells sich von der Rückmeldung der Tools löst.