NachschlagenQuellenregister

Originalarbeiterreichbar

Efficient Memory Management for Large Language Model Serving with PagedAttention

arxiv.org (externe Seite)

Die Arbeit vom 12.09.2023, aus der der Inferenz-Server vLLM hervorging. Sie benennt den KV-Cache als den knappen Speicher beim Betrieb eines Sprachmodells mit vielen gleichzeitigen Anfragen und verwaltet ihn in Blöcken nach dem Vorbild der Speicherverwaltung eines Betriebssystems, sodass Anfragen mit gleichem Anfang sich die Einträge teilen.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 15.09.2026:

  • the key-value cache (KV cache) memory for each request is huge and grows and shrinks dynamicallybestätigt 24.09.2026
  • flexible sharing of KV cache within and across requests to further reduce memory usagebestätigt 24.09.2026
  • we build vLLM, an LLM serving system that achieves (1) near-zero waste in KV cache memorybestätigt 24.09.2026

TRL schickt beim asynchronen Training nur noch den LoRA-Adapter an vLLM, Trainer und Inferenz brauchen keine gemeinsame Maschine mehrKV-Cache im GlossarvLLM im Glossar

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.