Originalarbeiterreichbar
Measuring Massive Multitask Language Understanding
Hendrycks und Mitautoren stellen am 07.09.2020 den Wissenstest MMLU vor: Fragen aus 57 Fächern von Grundschulmathematik über US-Geschichte und Informatik bis Recht, mit vier Antwortmöglichkeiten je Frage. Das größte GPT-3 lag zum Start knapp 20 Prozentpunkte über dem Raten und auf keinem Gebiet auf Expertenniveau. Der Test, den in den Jahren danach jede Modellankündigung nannte, bis die Spitzenmodelle in ihm dicht beieinanderlagen.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 22.09.2026:
The test covers 57 tasks including elementary mathematics, US history, computer science, law, and more
bestätigt 24.09.2026To attain high accuracy on this test, models must possess extensive world knowledge and problem solving ability
bestätigt 24.09.2026the very largest GPT-3 model improves over random chance by almost 20 percentage points on average
bestätigt 24.09.2026on every one of the 57 tasks, the best models still need substantial improvements before they can reach expert-level accuracy
bestätigt 24.09.2026