NachschlagenQuellenregister

Originalarbeiterreichbar

Compact Language Models via Pruning and Knowledge Distillation

arxiv.org (externe Seite)

Muralidharan und Mitautoren bei NVIDIA beziffern am 19.07.2024 den Abstand zwischen den beiden Bauwegen. Ein 8- und ein 4-Milliarden-Modell aus einem vorhandenen 15-Milliarden-Modell abzuleiten kostet bis zu vierzigmal weniger Trainingstoken, als beide von Grund auf zu trainieren. Das ist der Grund, warum Modellfamilien überwiegend so entstehen, und zugleich die Zahl, gegen die ein zugeschnittenes Modell antreten muss.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 04.09.2026:

  • Deriving 8B and 4B models from an already pretrained 15B model using our approach requires up to 40x fewer training tokens per model compared to training from scratchbestätigt 24.09.2026

10 Small Language Models

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.