Calcoid

GPU-VRAM-LLM-Rechner

Schätze GPU-Speicher für LLM-Inference, LoRA und vollständiges Fine-Tuning. Unterscheide GB-Herstellerangabe von berechneten GiB und plane Laufzeitreserve.

GPU-VRAM für LLMs

Zum Beispiel 7 für ein 7B-Modell.

Das Format bestimmt die Bytezahl pro Modellgewicht.

Inference benötigt zusätzlich Kontextlänge und Batch-Größe. Fine-Tuning schätzt Trainingszustände.

Ganze Zahl der Transformer-Layer.

Ganze Modellbreite.

Die Kontextlänge dimensioniert den KV-Cache.

Anzahl gleichzeitig verarbeiteter Sequenzen.

GB Herstellerangabe. Leer lassen, um den Kartenvergleich zu überspringen.

Geschätzter VRAM-Bedarf

20,41 GiB

Inference (Modell ausführen). 2,0 Byte pro Gewicht.

Passt in eine 24-GB-Karte

1,91 GiB Reserve. Auslastung 91,5 % von 22,32 GiB nutzbarem Speicher.

Modellgewichte
13,04 GiB
KV-Cache
2,00 GiB
Aktivierungen
2,61 GiB
Framework-/CUDA-Overhead
2,76 GiB
Parameter
7.000.000.000

GB ist die Herstellerangabe der Karte. Das Ergebnis ist in binären GiB (1 GiB = 2³⁰ Byte) angegeben. Runtime, Architektur, KV-Cache und Gewichtsformat verändern den echten Bedarf. Plane 10 bis 20 % Reserve ein.

Ungefährer Gewichtsspeicher eines LLM

QuantisierungByte pro Parameter1B Parameter, nur Gewichte
FP1621,86 GiB
INT810,93 GiB
INT40,50,47 GiB

Häufige Fragen

Wie schätzt der Rechner den VRAM-Bedarf eines LLM?
Die Schätzung addiert Modellgewichte, KV-Cache, Arbeitszustand und Framework-Overhead. Gewichtsspeicher hängt von Parametern und Quantisierung ab. Bei Inference kommen Kontextlänge, Batch-Größe und Aktivierungen hinzu. Das Ergebnis wird in binären GiB ausgegeben.
Wie viel VRAM braucht ein 7B-Modell für Inference?
Bei FP16, 4.096 Tokens Kontext, einer Sequenz sowie 32 Layern und Hidden Size 4.096 ergibt die Modellkonfiguration grob 20,4 GiB inklusive KV-Cache und Reserven. INT4 reduziert vor allem die Gewichte. Runtime und Architektur können den echten Bedarf verändern.
Warum verändert Quantisierung den VRAM-Bedarf so stark?
FP16 beziehungsweise BF16 verwendet zwei Byte pro Gewicht, INT8 ein Byte und INT4 ein halbes Byte. Dadurch sinkt der Gewichtsspeicher deutlich. Der KV-Cache bleibt in dieser Schätzung bei FP16, deshalb verschwinden lange Kontexte nicht durch eine Quantisierung der Gewichte.
Was ist der KV-Cache und warum zählt die Kontextlänge?
Der KV-Cache hält Schlüssel- und Wertvektoren für jede Ebene und jedes Token vor. Seine Größe steigt linear mit Layerzahl, Hidden Size, Kontextlänge und Batch-Größe. Eine Verdopplung von Kontext oder Batch verdoppelt deshalb den geschätzten KV-Cache.
Warum benötigt vollständiges Fine-Tuning mehr Speicher als Inference?
Beim vollständigen Fine-Tuning bleiben zusätzlich zu den Gewichten Gradienten und Adam-Zustände im Speicher. LoRA und QLoRA halten die Basismodelle dagegen weitgehend fest und trainieren Adapter. Im Rechner werden Kontext und KV-Cache beim Fine-Tuning deshalb nicht angesetzt.
Wie genau ist die GPU-VRAM-Schätzung?
Sie ist eine Planungsgröße, keine Laufzeitmessung. Runtime, Attention-Kernel, paginierter KV-Cache, Architektur und Gewichtsformat ändern den Bedarf. GB auf einer Herstellerkarte und binäre GiB in der Rechnung sind nicht identisch. Plane Reserve ein und prüfe das echte Runtime-Setup.

Änderungsverlauf

Aktualisierungen von GPU-VRAM-LLM-Rechner, nach Datum gruppiert.

1 Aktualisierung
  1. GPU-VRAM-LLM-Rechner hinzugefügt

    • Schätze GPU-Speicher für LLM-Inference, LoRA und vollständiges Fine-Tuning. Unterscheide GB-Herstellerangabe von berechneten GiB und plane Laufzeitreserve.

Ähnliche Rechner

Weitere geprüfte Rechner im Themenbereich „Technik“.