NachschlagenQuellenregister

Dokumentationerreichbar

llama.cpp, Dokumentation zum Speculative Decoding

github.com (externe Seite)

Der Stand vom 17.08.2026, festgehalten über den Commit, weil diese Datei sich schnell ändert. Sie führt elf Verfahren auf, von denen fünf ohne ein zweites Modell auskommen und ihre Vorschläge aus dem schon geschriebenen Text ziehen. Für jedes Verfahren steht ein eigener Abschnitt da, für die Vorhersage mehrerer Token nur eine Tabellenzeile. Der Abschnitt zur Ziehung nennt außerdem die Bedingung, unter der zwei Läufe wirklich dasselbe ergeben.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 19.08.2026:

  • An implementation with draft model can be mixed with an implementation without draft modelbestätigt 24.09.2026
  • They require no additional model but rely on patterns that have already appeared in the generated textbestätigt 24.09.2026
  • Use Multi Token Prediction (MTP) heads from the main modelbestätigt 24.09.2026
  • Use greedy sampling when exact output matching is requiredbestätigt 24.09.2026

Elf Wege, ein lokales Modell schneller zu machenMulti-Token Prediction im GlossarSpeculative Decoding im Glossar

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.