Originalarbeiterreichbar
Accelerating Large Language Model Decoding with Speculative Sampling
Chen und Mitautoren von DeepMind legen am 02.02.2023 die zweite grundlegende Arbeit zum spekulativen Entwerfen vor, zwei Monate nach Leviathan. Wichtig ist der Nebensatz, mit dem sie ihre Zusage begrenzen: Die Verteilung des großen Modells bleibt erhalten im Rahmen der Rechengenauigkeit der Hardware. Gemessen haben sie an Chinchilla mit 70 Milliarden Parametern, wo die Ausgabe zwei- bis zweieinhalbfach schneller lief.
geprüft 24.09.2026Archivfassung (externe Seite, web.archive.org)
Worauf sich diese Seite beruft, wörtlich, abgerufen am 19.08.2026:
preserves the distribution of the target model within hardware numerics
bestätigt 24.09.2026
Elf Wege, ein lokales Modell schneller zu machenSpeculative Decoding im Glossar