NachschlagenQuellenregister

Originalarbeiterreichbar

Accelerating Large Language Model Decoding with Speculative Sampling

arxiv.org (externe Seite)

Chen und Mitautoren von DeepMind legen am 02.02.2023 die zweite grundlegende Arbeit zum spekulativen Entwerfen vor, zwei Monate nach Leviathan. Wichtig ist der Nebensatz, mit dem sie ihre Zusage begrenzen: Die Verteilung des großen Modells bleibt erhalten im Rahmen der Rechengenauigkeit der Hardware. Gemessen haben sie an Chinchilla mit 70 Milliarden Parametern, wo die Ausgabe zwei- bis zweieinhalbfach schneller lief.

geprüft 24.09.2026Archivfassung (externe Seite, web.archive.org)

Worauf sich diese Seite beruft, wörtlich, abgerufen am 19.08.2026:

  • preserves the distribution of the target model within hardware numericsbestätigt 24.09.2026

Elf Wege, ein lokales Modell schneller zu machenSpeculative Decoding im Glossar

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.