Eine Modellseite auf HuggingFace nennt Ihnen acht Milliarden Parameter. Sie sagt Ihnen nicht, dass dasselbe Modell in 4 Bit keine fünf Gigabyte braucht und in voller Genauigkeit dreißig, dass der Cache Ihrer Unterhaltung bei langem Kontext größer werden kann als die Gewichte selbst, oder dass die 128-GB-Maschine auf Ihrem Schreibtisch der GPU nur etwa 96 davon überlässt. Diese drei Zahlen entscheiden, ob es läuft. Keine davon steht dort.
Dieser Rechner ermittelt sie. Wo sich die Antwort messen lässt, wird sie gemessen — bei einem GGUF-Repository liest er die echte Dateigröße jeder Quantisierung, statt aus einer Tabelle zu schätzen. Die Anfrage geht direkt von Ihrem Browser zu HuggingFace; an uns wird nichts gesendet, und es gibt nichts anzumelden.
Die Tempo-Spalte ist eine Obergrenze aus veröffentlichter Speicherbandbreite, kein Benchmark: Schneller als das kann das Speichersystem die Bytes nicht liefern, und die reale Rate liegt darunter. Gemessene Raten finden Sie hier.
Drei Dinge belegen Speicher, während ein Modell läuft — und nur das erste wird üblicherweise genannt.
Beim KV-Cache gehen die Rechner auseinander. Die Lehrbuchformel — zwei, für Keys und Values, mal Schichten, mal Key-Value-Köpfe, mal Kopfdimension, mal Kontext — stimmt für einen einfachen Transformer und ist für die meisten interessanten Modelle der letzten beiden Jahre falsch. DeepSeek komprimiert Keys und Values zu einem einzigen latenten Vektor; der Faktor zwei entfällt, und die Kopfzahl spielt gar keine Rolle mehr. Gemma 3 lässt fünf von je sechs Schichten statt des ganzen Kontexts nur ein Fenster von 1.024 Token betrachten. Qwen3-Next gibt überhaupt nur jeder vierten Schicht einen Cache. Das sind jeweils andere Formeln, und die Lehrbuchvariante trotzdem zu verwenden liefert keine konservative Antwort, sondern eine unbrauchbare.
Jede dieser Zahlen wurde am 2026-08-31 gegen die öffentliche HuggingFace-API gemessen. Die Endpunkte sind offen, alles lässt sich nachvollziehen.
| Die Abkürzung | Was daraus folgt | Gemessen |
|---|---|---|
| Bits pro Gewicht aus der Formattabelle: Q2_K hat 2,63 Bit. | Die Datei wird etwa ein Fünftel kleiner angegeben, als sie ist. | 3.17–3.24 Bit/Gew. über Llama 3.1 8B, Qwen3 8B, Gemma 3 12B — llama.cpp hält ausgewählte Tensoren genauer, das Blockformat ist also nicht die Datei |
| Eine KV-Formel für jedes Modell. | DeepSeek V3.1 bei 128k Kontext erscheint als 488 GB Cache. | 8.6 GB — 57× kleiner Latent Attention: kv_lora_rank 512 plus ein 64 breiter Rope-Anteil, einmal statt zweimal gespeichert — die 128 Key-Value-Köpfe gehen gar nicht in die Summe ein |
| Jede Schicht cached den ganzen Kontext. | Gemma 3 und Qwen3-Next wirken weit größer, als sie sind. | 5.2× und 4× Gemma 3 deckelt 40 seiner 48 Schichten bei 1.024 Token — Faktor 5,2 bei 32k Kontext, 5,8 bei 128k. Qwen3-Next gibt überhaupt nur 12 von 48 Schichten einen Cache |
| Ein Repository-Gesamtwert ist die Modellgröße. | Dasselbe 12B-Modell erscheint als 1,14 TB oder als 186 GB — je nachdem, welchen Repository-Gesamtwert man nimmt. | 6.8 GB eine Datei. Die API meldet usedStorage von 1,14 TB, die Dateiliste summiert sich auf 186 GB — das Repository enthält 29 Quantisierungen, heruntergeladen wird genau eine davon. Der Vision-Projektor kommt als eigene Datei mit weiteren 0,80 GB hinzu |
Es gibt eine fünfte, leisere. HuggingFace veröffentlicht eine Parameteraufstellung nach Datentyp, und sie zählt Elemente, nicht Bytes: gpt-oss-120b listet 2,2 Milliarden Sechzehn-Bit-Werte und 114,7 Milliarden Acht-Bit-Werte. Ausmultipliziert ergibt das 110,8 GB, während die tatsächlichen Gewichtsdateien des Repositories 121,5 GB umfassen — nah genug, um richtig auszusehen, und falsch genug, um auf einer Maschine mit 128 GB zu zählen. Es ist eine Parameterzählung, keine Downloadgröße. Wo eine Datei existiert, ist die Datei die Antwort.
Die zweite Hälfte der Frage ist, was die Maschine tatsächlich hergibt — und das ist nie die Zahl auf der Verpackung. Drei verschiedene Mechanismen nehmen sich einen Anteil, und sie verhalten sich zu unterschiedlich für eine gemeinsame Faustregel.
iogpu.wired_limit_mbDeshalb hilft eine Tabelle mit Nennkapazitäten wenig. Ein Mac mini mit 32 GB und eine RTX 5090 mit 32 GB fassen sehr unterschiedliche Modelle: Der Mac überlässt seiner GPU rund 21 dieser Gigabyte, die Karte etwa 31. Der Rechner oben verwendet durchgängig den nutzbaren Wert und nennt den Mechanismus dahinter.
| Gemessen | Größen der Quantisierungsdateien, sofern das Repository GGUF-Dateien enthält — die echten Bytes, live gelesen. Parameterzahlen aus dem Index von HuggingFace selbst. Sämtliche Architekturfelder: Schichten, Key-Value-Köpfe, Kopfdimension, Fenstergrößen, Expertenzahlen. |
|---|---|
| Exakt berechnet | Der KV-Cache. Das ist Arithmetik auf veröffentlichten Architekturfeldern, mit einer eigenen Formel für jedes der vier Attention-Designs und ohne Rundung außer in der Anzeige. |
| Geschätzt | Größen für Quantisierungen, die kein Repository bereitstellt — aus Bits pro Gewicht, gemessen an drei echten GGUF-Repositories statt aus den nominellen Formatangaben. Der Laufzeit-Overhead, der von Runner, Batchgröße und Treiber abhängt — deshalb ist er editierbar. Der aktive Anteil eines Mixture-of-Experts-Modells, aus der Schichtzerlegung. |
| Übernommen | Gerätespeicher, Bandbreite und Zuteilungsgrenzen sind Herstellerangaben und veröffentlichte Werte, gelesen am 2026-08-31. Preise sind ein grobes Richtband und gehen in keine Rechnung ein. Die Mac-Studio-M5-Zeilen sind als angekündigt gekennzeichnet, nicht als lieferbar. |
| Nicht abgedeckt | Training und Fine-Tuning, die Optimizer-Zustände und Gradienten hinzufügen und eine völlig andere Rechnung sind. Multi-GPU-Aufteilungen über eine einfache Speichersumme hinaus. Speculative Decoding und Prefix-Caching, die das Bild im Serving-Betrieb beide verändern. |
Zugangsbeschränkte Repositories — darunter Llama und Gemma — antworten auf eine anonyme Anfrage nach ihrer Konfiguration mit 401; ihre Architektur ist also nicht live lesbar. Deshalb liefert die Seite 45 aktuelle Modelle mit, ausgelesen aus deren Konfigurationen, solange diese offen waren. Ein zugangsbeschränktes Modell greift auf diese Tabelle zurück oder auf einen Community-Spiegel, der dieselbe Datei erneut veröffentlicht. Ein Token-Feld gibt es nicht und wird es nicht geben: Eine Seite, die Fremde bittet, Zugangsdaten einzufügen, hat ihnen die falsche Gewohnheit beigebracht — ganz gleich, was sie damit tut.
→ Wie schnell sich das anfühlt → Was der Betrieb kostet → Für Ihre Last dimensionieren lassen
Die KI-News, die zählen — bis 07:30 Uhr MEZ im Postfach. Kostenlos, kein Spam.