Originalarbeiterreichbar
Training Compute-Optimal Large Language Models
Hoffmann und Mitautoren messen am 29.03.2022 an über 400 Modellen, wie Parameterzahl und Datenmenge bei festem Rechenbudget zusammengehören, und korrigieren damit die Empfehlung von scaling-laws-2020: Bei doppelter Modellgröße gehört die doppelte Datenmenge dazu. Chinchilla mit 70 Milliarden Parametern schlägt Gopher mit 280 Milliarden. Der Beleg dafür, dass die Parameterzahl allein wenig über ein Modell sagt.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:
We find that current large language models are significantly undertrained, a consequence of the recent focus on scaling language models whilst keeping the amount of training data constant.
bestätigt 24.09.2026for every doubling of model size the number of training tokens should also be doubled
bestätigt 24.09.2026