GPU-VRAM-LLM-Rechner
Schätze GPU-Speicher für LLM-Inference, LoRA und vollständiges Fine-Tuning. Unterscheide GB-Herstellerangabe von berechneten GiB und plane Laufzeitreserve.
Ungefährer Gewichtsspeicher eines LLM
| Quantisierung | Byte pro Parameter | 1B Parameter, nur Gewichte |
|---|---|---|
| FP16 | 2 | 1,86 GiB |
| INT8 | 1 | 0,93 GiB |
| INT4 | 0,5 | 0,47 GiB |
Häufige Fragen
Wie schätzt der Rechner den VRAM-Bedarf eines LLM?
Die Schätzung addiert Modellgewichte, KV-Cache, Arbeitszustand und Framework-Overhead. Gewichtsspeicher hängt von Parametern und Quantisierung ab. Bei Inference kommen Kontextlänge, Batch-Größe und Aktivierungen hinzu. Das Ergebnis wird in binären GiB ausgegeben.
Wie viel VRAM braucht ein 7B-Modell für Inference?
Bei FP16, 4.096 Tokens Kontext, einer Sequenz sowie 32 Layern und Hidden Size 4.096 ergibt die Modellkonfiguration grob 20,4 GiB inklusive KV-Cache und Reserven. INT4 reduziert vor allem die Gewichte. Runtime und Architektur können den echten Bedarf verändern.
Warum verändert Quantisierung den VRAM-Bedarf so stark?
FP16 beziehungsweise BF16 verwendet zwei Byte pro Gewicht, INT8 ein Byte und INT4 ein halbes Byte. Dadurch sinkt der Gewichtsspeicher deutlich. Der KV-Cache bleibt in dieser Schätzung bei FP16, deshalb verschwinden lange Kontexte nicht durch eine Quantisierung der Gewichte.
Was ist der KV-Cache und warum zählt die Kontextlänge?
Der KV-Cache hält Schlüssel- und Wertvektoren für jede Ebene und jedes Token vor. Seine Größe steigt linear mit Layerzahl, Hidden Size, Kontextlänge und Batch-Größe. Eine Verdopplung von Kontext oder Batch verdoppelt deshalb den geschätzten KV-Cache.
Warum benötigt vollständiges Fine-Tuning mehr Speicher als Inference?
Beim vollständigen Fine-Tuning bleiben zusätzlich zu den Gewichten Gradienten und Adam-Zustände im Speicher. LoRA und QLoRA halten die Basismodelle dagegen weitgehend fest und trainieren Adapter. Im Rechner werden Kontext und KV-Cache beim Fine-Tuning deshalb nicht angesetzt.
Wie genau ist die GPU-VRAM-Schätzung?
Sie ist eine Planungsgröße, keine Laufzeitmessung. Runtime, Attention-Kernel, paginierter KV-Cache, Architektur und Gewichtsformat ändern den Bedarf. GB auf einer Herstellerkarte und binäre GiB in der Rechnung sind nicht identisch. Plane Reserve ein und prüfe das echte Runtime-Setup.
Änderungsverlauf
Aktualisierungen von GPU-VRAM-LLM-Rechner, nach Datum gruppiert.
1 Aktualisierung
GPU-VRAM-LLM-Rechner hinzugefügt
- Schätze GPU-Speicher für LLM-Inference, LoRA und vollständiges Fine-Tuning. Unterscheide GB-Herstellerangabe von berechneten GiB und plane Laufzeitreserve.
Ähnliche Rechner
Weitere geprüfte Rechner im Themenbereich „Technik“.