NachschlagenQuellenregister

Originalarbeiterreichbar

Fast Inference from Transformers via Speculative Decoding

arxiv.org (externe Seite)

Die Arbeit von Leviathan, Kalman und Matias vom 30.11.2022, die das spekulative Entwerfen vorgestellt hat. Wichtig für dieses Kapitel ist die Reichweite ihrer Zusage: Erhalten bleibt die Verteilung, aus der gezogen wird. Bei der reinen Spitzenwahl fällt das mit dem einzelnen Text zusammen. Sobald gezogen wird, ist es zweierlei. Die gemessene zwei- bis dreifache Beschleunigung bei gleichen Ausgaben stammt von einem einzigen Modell ihrer Erhebung, T5-XXL.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:

  • generating several tokens concurrently, and without changing the distributionbestätigt 24.09.2026

Elf Wege, ein lokales Modell schneller zu machenSpeculative Decoding im Glossar12 Wie zufällig die Antwort ist

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.