NachschlagenQuellenregister

SchlüsselarbeitOriginalarbeiterreichbar

A Careful Examination of Large Language Model Performance on Grade School Arithmetic

arxiv.org (externe Seite)

Zhang und Mitautoren lassen 1205 Rechenaufgaben neu schreiben, die dem verbreiteten Test GSM8k in Stil, Schwierigkeit und Lösungsschritten gleichen, und messen dieselben Modelle daran. Der Vergleich trennt zum ersten Mal sauber, was Können ist und was Wiedererkennen. Wichtig ist der Schlusssatz des Abstracts, der in jeder Wiedergabe fehlt: Die stärksten Modelle zeigen kaum Anzeichen von Überanpassung, und alle Modelle lösen auch die neuen Aufgaben.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:

  • data closely resembling benchmark questions leaks into the training data, instead of true reasoning abilitybestätigt 24.09.2026
  • GSM1k is designed to mirror the style and complexity of the established GSM8k benchmarkbestätigt 24.09.2026
  • we observe accuracy drops of up to 8%, with several families of models showing evidence of systematic overfitting across almost all model sizesbestätigt 24.09.2026
  • many models, especially those on the frontier, show minimal signs of overfittingbestätigt 24.09.2026

04 Was eine Benchmarkzahl sagt

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.