In einem unserer letzten Beiträge haben wir gezeigt, wie metal-stack native GPU-Unterstützung für Bare-Metal-Kubernetes-Cluster bietet: Treiber sind im OS-Image vorhanden und Workloads können selbst die GPUs anfordern.
Damit steht die Infrastruktur. Die eigentliche Frage für KI-Workloads folgt aber direkt danach: Eine GPU zugeteilt zu bekommen heißt noch lange nicht, sie auch gut auszulasten.
Das Problem: LLM-Inferenz ist kein gleichmäßiger Workload
Anders als klassische Batch-Verarbeitung ist LLM-Inferenz von Natur aus unregelmäßig. Anfragen unterscheiden sich stark bei der Länge, treffen zu unterschiedlichen Zeitpunkten ein und haben unterschiedliche Verarbeitungszeiten.
Naive Serving-Ansätze reservieren pro Anfrage feste Speicherblöcke für den KV-Cache. Das ist der Zwischenspeicher, den jedes Sprachmodell während der Generierung benötigt. Das führt zu Fragmentierung und Verschwendung da ein Teil des GPU-Speichers ungenutzt reserviert ist, während andere Anfragen auf Kapazität warten müssen.
Die Antwort: PagedAttention und Continuous Batching
Genau hier setzt vLLM an, eine quelloffene Inference-Engine für Sprachmodelle. Der zentrale Mechanismus ist PagedAttention: Der KV-Cache wird nicht mehr als ein zusammenhängender, fest reservierter Speicherblock behandelt, sondern in kleinere Seiten aufgeteilt, die dynamisch verwaltet werden. Das reduziert Fragmentierung erheblich und erlaubt es, deutlich mehr Anfragen gleichzeitig zu bedienen, ohne dass die GPU dabei stillsteht.
Ergänzt wird das durch Continuous Batching. Statt Anfragen in festen Gruppen abzuarbeiten, werden neue Requests schrittweise in laufende Batches aufgenommen, sobald Kapazität frei wird. Für ein typisches KI-Serving-Szenario mit vielen parallelen, unterschiedlich langen Sessions bedeutet das spürbar höheren Durchsatz bei gleicher Hardware.
Unsere Empfehlung, für jede Clustergröße
Ein verbreitetes Missverständnis ist, dass sich der Aufwand für eine dedizierte Inference-Engine erst bei großen Clustern lohnt. In der Praxis nutzen und empfehlen wir vLLM bewusst auch dann, wenn nur eine einzelne GPU zur Verfügung steht. Der Effizienzgewinn durch PagedAttention entsteht bereits auf einer einzelnen Karte – gerade weil ungenutzter, fragmentierter Speicher dort besonders knapp ist.
Für Organisationen, die aus Compliance- oder Datenschutzgründen auf eigene Infrastruktur statt Managed-Services setzen, ist das ein wichtiger Baustein: metal-stack liefert die souveräne, isolierte GPU-Infrastruktur, vLLM sorgt dafür, dass diese Infrastruktur auch effizient genutzt wird.