Originalarbeiterreichbar
Fast Inference from Transformers via Speculative Decoding
Die Arbeit von Leviathan, Kalman und Matias vom 30.11.2022, die das spekulative Entwerfen vorgestellt hat. Wichtig für dieses Kapitel ist die Reichweite ihrer Zusage: Erhalten bleibt die Verteilung, aus der gezogen wird. Bei der reinen Spitzenwahl fällt das mit dem einzelnen Text zusammen. Sobald gezogen wird, ist es zweierlei. Die gemessene zwei- bis dreifache Beschleunigung bei gleichen Ausgaben stammt von einem einzigen Modell ihrer Erhebung, T5-XXL.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:
generating several tokens concurrently, and without changing the distribution
bestätigt 24.09.2026
Elf Wege, ein lokales Modell schneller zu machenSpeculative Decoding im Glossar12 Wie zufällig die Antwort ist