// HEISE ONLINE — HARDWARE & GADGET
heise+ | Googles TurboQuant-Verfahren: Praxistest auf einer AMD-GPU
Googles TurboQuant komprimiert den KV-Cache großer Sprachmodelle auf 3 Bit. Tests auf einer AMD-Karte zeigen: Das Kernversprechen stimmt — mit Nebeneffekten.
Wer Gemma-4-31B auf einer GPU mit 32 GByte VRAM startet, rechnet auf den ersten Blick nicht mit Platzproblemen. Das Modell belegt in der Q4-Quantisierung mit rund 17 GByte gut die Hälfte des Grafikspeichers. Allerdings fehlt hier noch der Kontext. Ein Sprachmodell erzeugt seinen Antworttext Token für Token und sagt dabei immer nur das jeweils nächste voraus; diese Phase heißt Decode, das anfängliche Einlesen des Prompts Prefill. Damit es die vorherigen Token nicht bei jedem Schritt neu durchrechnen muss, speichert es deren Key- und Value-Vektoren zwischen. Das ist der KV-Cache, und seine Größe ist abhängig von der Kontextlänge.
Allerdings reserviert llama.ccp schon beim Laden Speicher für die volle eingestellte Kontextlänge. Eine Konfiguration mit 256.000 Token belegt im voreingestellten unkomprimierten Cache mit 16-Bit-Fießkommazahlen (f16) gut 40 GByte. Das übersteigt den Platz auf der GPU, und das Betriebssystem lagert einen Teil des Cache in den geteilten GPU-Speicher aus, also ins System-RAM. Darauf greift die GPU über den PCIe-Bus zu; der liefert aber nur einen Bruchteil der Bandbreite des lokalen Grafikspeichers (rund 60 gegenüber 640 Gigabyte pro Sekunde). Sobald das Modell den ausgelagerten Teil lesen muss, bricht die Generierungsgeschwindigkeit stark ein.
Kai Bennett ist AI Software Architect bei adesso und Mitgründer des Start-ups securesight.ai. Seine Schwerpunkte sind produktive GenAI-Systeme, lokale LLM-Stacks, Benchmarking und agentische Coding-Workflows.
Die Modellgewichte nutzt man lange schon in komprimierter Form. Auch der KV-Cache lässt sich quantisieren, in llama.cpp bis hinunter zu 4 Bit, wobei sich Keys und Values getrennt und sogar unterschiedlich stark komprimieren lassen. Beim Laden mit reserviertem 256.000-Token-Kontext passen die quantisierten Varianten auf die Karte: q4_0, llama.cpps 4-Bit-Format, belegt rund 24,8 GByte. Googles Verfahren TurboQuant komprimiert den KV-Cache großer Sprachmodelle auf 3 Bit, nach Herstellerangaben fast ohne Qualitätsverlust. Damit belegt Gemma-4-31B 23,4 GByte.
Spannungen messen, Signale generieren oder Prototypen testen. Mit dem TestLab wird der Mikrocontroller zum flexiblen Werkzeugkasten für Elektronik-Experimente.
In der Schule oder im Studium kommt man ohne Notizen kaum aus. Mit Bordmitteln lassen sich Mitschriften und Transkripte effizient organisieren. Wir zeigen, wie.
USB-C-Hubs geben Apple-Geräten mehr Ports. Wir testen neun Geräte mit HDMI und Power Delivery, die sich besonders gut fürs MacBook Neo eignen – aber nicht nur.
Lange Autofahrten mit Elektroauto oder Verbrenner: Wir simulieren 1000 km quer durch Deutschland und zeigen den wahren Zeitunterschied.
Der Gardena Haus- & Gartenautomat 5000 SilentComfort bietet smarte Gießautomatiken ohne Umweg übers Internet – aber nicht so komfortabel leise wie versprochen.