LLM open-weight · dimensionamento on-prem
Matrice di dimensionamento on-prem degli LLM
Dove stanno i modelli open-weight più recenti e a che velocità generano, da una scheda gaming da 16 GB a un nodo Blackwell da 8 GPU. La capacità di memoria decide se un modello ci sta. La banda di memoria decide quanto velocemente scrive. I modelli Mixture-of-Experts separano le due cose: i parametri totali fissano la memoria, quelli attivi fissano la velocità.
Ottobre 2026Stime, non benchmark
Margine di errore ±30–50%
| Modello attivi su totali · richiede | GPU desktop | Workstation e memoria unificata | Datacenter | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
RTX 5060 Ti16 GB448 GB/s~$450 | RTX 3090 / 409024 GB1,01 TB/s$0,8–2k | RTX 509032 GB1,79 TB/s$2,5–4k | 2× RTX 3090/409048 GB2 × 1,01 TB/s$1,6–4k | DGX Spark / Strix Halo128 GB273 GB/s$2,5–4k | RTX PRO 600096 GB1,79 TB/s~$8–9k | Mac Studio M3 Ultra512 GB819 GB/s~$10k | 4× RTX PRO 6000384 GB4 × 1,79 TB/s~$45k | 1× H100 80GB80 GB3,35 TB/s$25–31k | 1× H200141 GB4,8 TB/s$30–40k | Nodo 8× H100640 GB8 × 3,35 TB/s$250–320k | Nodo 8× H2001,1 TB8 × 4,8 TB/s$320–420k | Nodo 8× B2001,4 TB8 × 8 TB/s$400–500k | Nodo 8× B3002,3 TB8 × 8 TB/ssu preventivo | |
| 1T+ parametri | ||||||||||||||
| Kimi K3104B su 2,8T · MoEMXFP4 1,6 TB | ||||||||||||||
| Qwen3.8-2.4T-A95B95B su 2,4T · MoEFP8 2,6 TB · Q4 1,5 TB | ||||||||||||||
| DeepSeek V4 Pro49B su 1,6T · MoEFP4/FP8 923 GB | ||||||||||||||
| Kimi K2.632B su 1,1T · MoEINT4 615 GB | ||||||||||||||
| 250–800B parametri | ||||||||||||||
| GLM-5.240B su 744B · MoEFP8 783 GB · Q4 454 GB | ||||||||||||||
| DeepSeek V4.1 Flash16B su 749B · MoEFP4/FP8 527 GB · Q4 455 GB | ||||||||||||||
| Mistral Large 341B su 675B · MoEFP8 716 GB · Q4 412 GB | ||||||||||||||
| Nemotron 3 Ultra55B su 550B · MoEFP8 582 GB · Q4 334 GB | ||||||||||||||
| MiniMax M323B su 428B · MoEMXFP8 455 GB · Q4 262 GB | ||||||||||||||
| Qwen3.5-397B-A17B17B su 397B · MoEFP8 436 GB · Q4 242 GB | ||||||||||||||
| DeepSeek V4 Flash13B su 284B · MoEFP4/FP8 166 GB | ||||||||||||||
| 100–130B parametri | ||||||||||||||
| Mistral Small 46,5B su 119B · MoEFP8 133 GB · Q4 74 GB | ||||||||||||||
| Nemotron 3 Super12B su 120B · MoEFP8 133 GB · Q4 74 GB | ||||||||||||||
| gpt-oss-120b5,1B su 117B · MoEMXFP4 69 GB | ||||||||||||||
| Llama 4 Scout17B su 109B · MoEFP8 122 GB · Q4 69 GB | ||||||||||||||
| Fino a 35B parametri | ||||||||||||||
| Qwen3.6-35B-A3B3B su 35B · MoEFP8 40 GB · Q4 23 GB | ||||||||||||||
| Gemma 4 31B31B su 31B · densoFP8 38 GB · Q4 23 GB | ||||||||||||||
| Qwen3.8-27B27B su 27B · densoFP8 33 GB · Q4 19 GB | ||||||||||||||
| Gemma 4 26B-A4B4B su 26B · MoEFP8 31 GB · Q4 19 GB | ||||||||||||||
| gpt-oss-20b3,6B su 21B · MoEMXFP4 15 GB | ||||||||||||||
| Gemma 4 12B12B su 12B · densoFP8 16 GB · Q4 9,8 GB | ||||||||||||||
Le celle mostrano la velocità di decodifica stimata per un utente, in token/s, con la precisione usata sotto. Contesto: 32K token. Cliccate una cella per il dettaglio.
gpt-oss-120b su DGX Spark / Strix Halo
Ci sta in memoria a MXFP4.
OpenAI · 117B totali, 5,1B attivi · rilasciato in MXFP4Apache 2.0. MXFP4 nativo, circa 65 GB: il modello classico per le macchine da 128 GB e per le singole schede da 80–96 GB.
DGX Spark / Strix Halo · 128 GB · $2,5–4k128 GB di memoria unificata a 256–273 GB/s: ottima per i modelli MoE, lentissima per i grandi modelli densi.
Ingombro di memoria rispetto alla capacità hardware
Ogni barra va dall’ingombro a 4 bit a quello alla precisione di servizio (fino a 8 bit), inclusa la cache KV per un contesto di 32K × 1 utente. L’anello indica ~2,5 bit. Le linee tratteggiate sono la memoria utilizzabile di ciascuna fascia hardware. Scala logaritmica.
Taratura su misure reali
Le stesse formule, applicate a configurazioni con misure pubblicate su singola macchina. Stime entro circa ±30% dalle misure sono la precisione da attendersi su tutta la matrice.
| Configurazione | Hardware | Misurato | Questo modello | Concordanza | Fonte |
|---|---|---|---|---|---|
| Qwen3 32B · Q4_K_M | RTX 5090 | 61 tok/s | 57 tok/s | −7% | Hardware Corner (llama.cpp) |
| Qwen2.5 32B · Q4_K_M | RTX 3090 / 4090 | 42 tok/s | 34 tok/s | −19% | Kunal Ganglani (llama.cpp) |
| Llama 3.1 8B · Q4_K_M | RTX 5090 | 220 tok/s | 190 tok/s | −13% | Kunal Ganglani (llama.cpp) |
| gpt-oss-120b · MXFP4 | DGX Spark / Strix Halo | 61 tok/s | 54 tok/s | −12% | maintainer di llama.cpp, via LocalAIMaster |
| Llama 3.1 70B · FP8 (denso) | DGX Spark / Strix Halo | 2,7 tok/s | 2,7 tok/s | −0% | LMSYS, via LocalAIMaster |
| Llama 3.1 70B · FP8 · 64 utenti | 1× H100 80GB | 460–984 tok/s | 696 tok/s agg. | nel range | vLLM: Morph (460) e Prem AI (984) |
Come funzionano le stime
Memoria necessaria
parametri totali × bit ÷ 8 per i pesi, più la cache KV (stima per modello × contesto × utenti), più il 3% di overhead di runtime e 1 GB per GPU. La memoria utilizzabile è il 93% di quella della GPU, 110 GB sui box a memoria unificata da 128 GB e 470 GB su un Mac da 512 GB con il limite di memoria wired alzato.
Velocità di decodifica
Ogni passo legge una volta i pesi attivi (per i MoE con più utenti, l'unione degli esperti coinvolti) più la cache KV. Il tempo di passo è byte ÷ banda effettiva oppure FLOP ÷ calcolo effettivo, il maggiore dei due, più un overhead per layer. La banda effettiva è il 75% del picco (70% su Apple).
Perché 8 GPU non rendono un utente 8× più veloce
Ogni layer paga un costo fisso per il lancio dei kernel, il routing MoE e, tra più GPU, un all-reduce: circa 0,03 ms (denso) o 0,1 ms (MoE) per layer, più 0,06–0,15 ms su multi-GPU. Su un nodo questo pavimento domina, quindi un singolo utente vede decine di token al secondo. Il nodo si giustifica con la concorrenza e con la capacità.
Multi-GPU e offload
Lo scaling tensor-parallel è assunto al 60% su due GPU PCIe, al 50% su quattro e al 75% su un nodo NVLink. Con l’offload attivo, i pesi che non entrano in VRAM stanno nella RAM di sistema, letta a circa 60 GB/s: è così che i modelli MoE girano su una sola scheda desktop.
Concorrenza
Il throughput aggregato è utenti ÷ tempo di passo, scontato per scheduling e interferenza del prefill (circa il 2% per ogni utente in più). La memoria della cache KV cresce con gli utenti, quindi con contesti lunghi e molti utenti è la memoria a esaurirsi per prima.
Cosa ignora
Il tempo di elaborazione del prompt (time to first token), la quantizzazione della cache KV (la KV in FP8 dimezza quella memoria), la perdita di qualità dovuta alla quantizzazione e i kernel specifici del runtime. Il miglior adattamento non supera mai gli 8 bit perché il serving in FP8 è quasi senza perdite. Numero di layer e dimensioni della KV di diversi modelli 2026 sono stimati dalla famiglia architetturale; si assume che Mistral Large 3 e Nemotron 3 Ultra siano distribuiti in FP8.
Fonti
Specifiche dei modelli
- Kimi K3 (Vast.ai), K3 hardware (Yotta Labs)
- Qwen3.8-2.4T-A95B (vLLM recipes), Qwen3.8-27B (The Decoder)
- DeepSeek V4 Pro / Flash (NYU Shanghai RITS), V4 Pro GA weights (AI Weekly)
- DeepSeek V4.1 Flash (Yotta Labs), V4 Flash sizes (LocalAIMaster)
- Kimi K2.6, guida all’uso in locale, GLM-5.2 guide (Codersera)
- MiniMax M3 (Artificial Analysis), Nemotron 3 Ultra (Decrypt)
- Mistral Small 4 (SGLang), Mistral Large 3 (AI Weekly)
- Gemma 4 / Qwen3.6 (Unsloth)
Velocità misurate
Prezzi
- H200 pricing (Akash)
- Data center GPU prices (IntuitionLabs)
- Spark vs Strix Halo vs Mac (LocalAIMaster)
- Prezzi consumer e workstation: stime indicative di mercato, in USD.
Compilato il 10 ottobre 2026. I rilasci di modelli open-weight cambiano ogni mese: considerate ogni cifra un punto di partenza e fate un benchmark sul vostro stack prima di acquistare.
← Torna al blog