Originalarbeiterreichbar
Efficient Memory Management for Large Language Model Serving with PagedAttention
Die Arbeit vom 12.09.2023, aus der der Inferenz-Server vLLM hervorging. Sie benennt den KV-Cache als den knappen Speicher beim Betrieb eines Sprachmodells mit vielen gleichzeitigen Anfragen und verwaltet ihn in Blöcken nach dem Vorbild der Speicherverwaltung eines Betriebssystems, sodass Anfragen mit gleichem Anfang sich die Einträge teilen.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 15.09.2026:
the key-value cache (KV cache) memory for each request is huge and grows and shrinks dynamically
bestätigt 24.09.2026flexible sharing of KV cache within and across requests to further reduce memory usage
bestätigt 24.09.2026we build vLLM, an LLM serving system that achieves (1) near-zero waste in KV cache memory
bestätigt 24.09.2026
TRL schickt beim asynchronen Training nur noch den LoRA-Adapter an vLLM, Trainer und Inferenz brauchen keine gemeinsame Maschine mehrKV-Cache im GlossarvLLM im Glossar