Originalarbeiterreichbar
MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark
Wang und Mitautoren bauen den verbreiteten Wissenstest MMLU um, weil die Spitzenmodelle darin dicht beieinanderlagen und der Test damit aufgehört hatte, sie zu unterscheiden. Vier Antwortmöglichkeiten werden zu zehn, triviale Fragen fliegen heraus. Der Beleg für zwei Sachen zugleich: dass ein Test durch Erfolg unbrauchbar wird, und wie stark eine Punktzahl allein von der Formulierung der Aufgabe abhängt.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:
their performance on these benchmarks has begun to plateau, making it increasingly difficult to discern differences in model capabilities
bestätigt 24.09.2026causing a significant drop in accuracy by 16% to 33% compared to MMLU
bestätigt 24.09.2026the sensitivity of model scores to prompt variations decreased from 4-5% in MMLU to just 2% in MMLU-Pro
bestätigt 24.09.2026expanding the choice set from four to ten options
bestätigt 24.09.2026
Massive Multitask Language Understanding im Glossar04 Was eine Benchmarkzahl sagt