NachschlagenQuellenregister

Originalarbeiterreichbar

Measuring Massive Multitask Language Understanding

arxiv.org (externe Seite)

Hendrycks und Mitautoren stellen am 07.09.2020 den Wissenstest MMLU vor: Fragen aus 57 Fächern von Grundschulmathematik über US-Geschichte und Informatik bis Recht, mit vier Antwortmöglichkeiten je Frage. Das größte GPT-3 lag zum Start knapp 20 Prozentpunkte über dem Raten und auf keinem Gebiet auf Expertenniveau. Der Test, den in den Jahren danach jede Modellankündigung nannte, bis die Spitzenmodelle in ihm dicht beieinanderlagen.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 22.09.2026:

  • The test covers 57 tasks including elementary mathematics, US history, computer science, law, and morebestätigt 24.09.2026
  • To attain high accuracy on this test, models must possess extensive world knowledge and problem solving abilitybestätigt 24.09.2026
  • the very largest GPT-3 model improves over random chance by almost 20 percentage points on averagebestätigt 24.09.2026
  • on every one of the 57 tasks, the best models still need substantial improvements before they can reach expert-level accuracybestätigt 24.09.2026

Massive Multitask Language Understanding im Glossar

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.