SchlüsselarbeitOriginalarbeiterreichbar
A Careful Examination of Large Language Model Performance on Grade School Arithmetic
Zhang und Mitautoren lassen 1205 Rechenaufgaben neu schreiben, die dem verbreiteten Test GSM8k in Stil, Schwierigkeit und Lösungsschritten gleichen, und messen dieselben Modelle daran. Der Vergleich trennt zum ersten Mal sauber, was Können ist und was Wiedererkennen. Wichtig ist der Schlusssatz des Abstracts, der in jeder Wiedergabe fehlt: Die stärksten Modelle zeigen kaum Anzeichen von Überanpassung, und alle Modelle lösen auch die neuen Aufgaben.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:
data closely resembling benchmark questions leaks into the training data, instead of true reasoning ability
bestätigt 24.09.2026GSM1k is designed to mirror the style and complexity of the established GSM8k benchmark
bestätigt 24.09.2026we observe accuracy drops of up to 8%, with several families of models showing evidence of systematic overfitting across almost all model sizes
bestätigt 24.09.2026many models, especially those on the frontier, show minimal signs of overfitting
bestätigt 24.09.2026