SchlüsselarbeitOriginalarbeiterreichbar
Measuring AI Ability to Complete Long Software Tasks
Kwa, West, Becker und 21 weitere Mitautoren von METR schlagen im März 2025 eine Kennzahl vor, die eine Modellfähigkeit in menschlicher Arbeitszeit ausdrückt: die Aufgabenlänge, die ein Modell mit einer bestimmten Wahrscheinlichkeit schafft. Gemessen wurde an 170 Aufgaben, für die zuerst Fachleute die Bearbeitungszeit lieferten. Die Arbeit nennt ihre eigenen Grenzen ausdrücklich, darunter die Übertragbarkeit auf Arbeit außerhalb der Testreihe.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:
we propose a new metric: 50%-task-completion time horizon
bestätigt 24.09.2026This is the time humans typically take to complete tasks that AI models can complete with 50% success rate
bestätigt 24.09.2026current frontier AI models such as Claude 3.7 Sonnet have a 50% time horizon of around 50 minutes
bestätigt 24.09.2026seems to be primarily driven by greater reliability and ability to adapt to mistakes
bestätigt 24.09.2026frontier AI time horizon has been doubling approximately every seven months since 2019
bestätigt 24.09.2026