LLM open-weight · dimensionamento on-prem

Matrice di dimensionamento on-prem degli LLM

Dove stanno i modelli open-weight più recenti e a che velocità generano, da una scheda gaming da 16 GB a un nodo Blackwell da 8 GPU. La capacità di memoria decide se un modello ci sta. La banda di memoria decide quanto velocemente scrive. I modelli Mixture-of-Experts separano le due cose: i parametri totali fissano la memoria, quelli attivi fissano la velocità.

Ottobre 2026Stime, non benchmark
Margine di errore ±30–50%

Precisione
Contesto per utente
Utenti concorrenti
<55–1515–4040–100100+token/sadattamento stretto (<10% di margine)funziona con offload su RAMsolo a ~2,5 bit (perdita di qualità)non ci sta2 nodiservono tanti nodi
Modello
attivi su totali · richiede
GPU desktopWorkstation e memoria unificataDatacenter
RTX 5060 Ti16 GB448 GB/s~$450
RTX 3090 / 409024 GB1,01 TB/s$0,8–2k
RTX 509032 GB1,79 TB/s$2,5–4k
2× RTX 3090/409048 GB2 × 1,01 TB/s$1,6–4k
DGX Spark / Strix Halo128 GB273 GB/s$2,5–4k
RTX PRO 600096 GB1,79 TB/s~$8–9k
Mac Studio M3 Ultra512 GB819 GB/s~$10k
4× RTX PRO 6000384 GB4 × 1,79 TB/s~$45k
1× H100 80GB80 GB3,35 TB/s$25–31k
1× H200141 GB4,8 TB/s$30–40k
Nodo 8× H100640 GB8 × 3,35 TB/s$250–320k
Nodo 8× H2001,1 TB8 × 4,8 TB/s$320–420k
Nodo 8× B2001,4 TB8 × 8 TB/s$400–500k
Nodo 8× B3002,3 TB8 × 8 TB/ssu preventivo
1T+ parametri
Kimi K3104B su 2,8T · MoEMXFP4 1,6 TB
Qwen3.8-2.4T-A95B95B su 2,4T · MoEFP8 2,6 TB · Q4 1,5 TB
DeepSeek V4 Pro49B su 1,6T · MoEFP4/FP8 923 GB
Kimi K2.632B su 1,1T · MoEINT4 615 GB
250–800B parametri
GLM-5.240B su 744B · MoEFP8 783 GB · Q4 454 GB
DeepSeek V4.1 Flash16B su 749B · MoEFP4/FP8 527 GB · Q4 455 GB
Mistral Large 341B su 675B · MoEFP8 716 GB · Q4 412 GB
Nemotron 3 Ultra55B su 550B · MoEFP8 582 GB · Q4 334 GB
MiniMax M323B su 428B · MoEMXFP8 455 GB · Q4 262 GB
Qwen3.5-397B-A17B17B su 397B · MoEFP8 436 GB · Q4 242 GB
DeepSeek V4 Flash13B su 284B · MoEFP4/FP8 166 GB
100–130B parametri
Mistral Small 46,5B su 119B · MoEFP8 133 GB · Q4 74 GB
Nemotron 3 Super12B su 120B · MoEFP8 133 GB · Q4 74 GB
gpt-oss-120b5,1B su 117B · MoEMXFP4 69 GB
Llama 4 Scout17B su 109B · MoEFP8 122 GB · Q4 69 GB
Fino a 35B parametri
Qwen3.6-35B-A3B3B su 35B · MoEFP8 40 GB · Q4 23 GB
Gemma 4 31B31B su 31B · densoFP8 38 GB · Q4 23 GB
Qwen3.8-27B27B su 27B · densoFP8 33 GB · Q4 19 GB
Gemma 4 26B-A4B4B su 26B · MoEFP8 31 GB · Q4 19 GB
gpt-oss-20b3,6B su 21B · MoEMXFP4 15 GB
Gemma 4 12B12B su 12B · densoFP8 16 GB · Q4 9,8 GB

Le celle mostrano la velocità di decodifica stimata per un utente, in token/s, con la precisione usata sotto. Contesto: 32K token. Cliccate una cella per il dettaglio.

gpt-oss-120b su DGX Spark / Strix Halo

Ci sta in memoria a MXFP4.

47tok/s, un utente
decodifica limitata dalla banda
Pesi 65 GB + cache KV 1,1 GB (32K × 1) + runtime 2,9 GB = 69 GB · utilizzabili 110 GB

OpenAI · 117B totali, 5,1B attivi · rilasciato in MXFP4Apache 2.0. MXFP4 nativo, circa 65 GB: il modello classico per le macchine da 128 GB e per le singole schede da 80–96 GB.

DGX Spark / Strix Halo · 128 GB · $2,5–4k128 GB di memoria unificata a 256–273 GB/s: ottima per i modelli MoE, lentissima per i grandi modelli densi.

Ingombro di memoria rispetto alla capacità hardware

Ogni barra va dall’ingombro a 4 bit a quello alla precisione di servizio (fino a 8 bit), inclusa la cache KV per un contesto di 32K × 1 utente. L’anello indica ~2,5 bit. Le linee tratteggiate sono la memoria utilizzabile di ciascuna fascia hardware. Scala logaritmica.

4 GB8 GB16 GB32 GB64 GB128 GB256 GB512 GB1 TB2 TB4 TB5060 Ti409050902× 4090H100PRO 6000SparkH2004× PROMac 5128× H1008× H2008× B2008× B300Kimi K31,6 TBQwen3.8-2.4T-A95B2,6 TBDeepSeek V4 Pro923 GBKimi K2.6615 GBGLM-5.2783 GBDeepSeek V4.1 Flash527 GBMistral Large 3716 GBNemotron 3 Ultra582 GBMiniMax M3455 GBQwen3.5-397B-A17B436 GBDeepSeek V4 Flash166 GBMistral Small 4133 GBNemotron 3 Super133 GBgpt-oss-120b69 GBLlama 4 Scout122 GBQwen3.6-35B-A3B40 GBGemma 4 31B38 GBQwen3.8-27B33 GBGemma 4 26B-A4B31 GBgpt-oss-20b15 GBGemma 4 12B16 GB

Taratura su misure reali

Le stesse formule, applicate a configurazioni con misure pubblicate su singola macchina. Stime entro circa ±30% dalle misure sono la precisione da attendersi su tutta la matrice.

ConfigurazioneHardwareMisuratoQuesto modelloConcordanzaFonte
Qwen3 32B · Q4_K_MRTX 509061 tok/s57 tok/s−7%Hardware Corner (llama.cpp)
Qwen2.5 32B · Q4_K_MRTX 3090 / 409042 tok/s34 tok/s−19%Kunal Ganglani (llama.cpp)
Llama 3.1 8B · Q4_K_MRTX 5090220 tok/s190 tok/s−13%Kunal Ganglani (llama.cpp)
gpt-oss-120b · MXFP4DGX Spark / Strix Halo61 tok/s54 tok/s−12%maintainer di llama.cpp, via LocalAIMaster
Llama 3.1 70B · FP8 (denso)DGX Spark / Strix Halo2,7 tok/s2,7 tok/s−0%LMSYS, via LocalAIMaster
Llama 3.1 70B · FP8 · 64 utenti1× H100 80GB460–984 tok/s696 tok/s agg.nel rangevLLM: Morph (460) e Prem AI (984)

Come funzionano le stime

Memoria necessaria

parametri totali × bit ÷ 8 per i pesi, più la cache KV (stima per modello × contesto × utenti), più il 3% di overhead di runtime e 1 GB per GPU. La memoria utilizzabile è il 93% di quella della GPU, 110 GB sui box a memoria unificata da 128 GB e 470 GB su un Mac da 512 GB con il limite di memoria wired alzato.

Velocità di decodifica

Ogni passo legge una volta i pesi attivi (per i MoE con più utenti, l'unione degli esperti coinvolti) più la cache KV. Il tempo di passo è byte ÷ banda effettiva oppure FLOP ÷ calcolo effettivo, il maggiore dei due, più un overhead per layer. La banda effettiva è il 75% del picco (70% su Apple).

Perché 8 GPU non rendono un utente 8× più veloce

Ogni layer paga un costo fisso per il lancio dei kernel, il routing MoE e, tra più GPU, un all-reduce: circa 0,03 ms (denso) o 0,1 ms (MoE) per layer, più 0,06–0,15 ms su multi-GPU. Su un nodo questo pavimento domina, quindi un singolo utente vede decine di token al secondo. Il nodo si giustifica con la concorrenza e con la capacità.

Multi-GPU e offload

Lo scaling tensor-parallel è assunto al 60% su due GPU PCIe, al 50% su quattro e al 75% su un nodo NVLink. Con l’offload attivo, i pesi che non entrano in VRAM stanno nella RAM di sistema, letta a circa 60 GB/s: è così che i modelli MoE girano su una sola scheda desktop.

Concorrenza

Il throughput aggregato è utenti ÷ tempo di passo, scontato per scheduling e interferenza del prefill (circa il 2% per ogni utente in più). La memoria della cache KV cresce con gli utenti, quindi con contesti lunghi e molti utenti è la memoria a esaurirsi per prima.

Cosa ignora

Il tempo di elaborazione del prompt (time to first token), la quantizzazione della cache KV (la KV in FP8 dimezza quella memoria), la perdita di qualità dovuta alla quantizzazione e i kernel specifici del runtime. Il miglior adattamento non supera mai gli 8 bit perché il serving in FP8 è quasi senza perdite. Numero di layer e dimensioni della KV di diversi modelli 2026 sono stimati dalla famiglia architetturale; si assume che Mistral Large 3 e Nemotron 3 Ultra siano distribuiti in FP8.

Fonti

Compilato il 10 ottobre 2026. I rilasci di modelli open-weight cambiano ogni mese: considerate ogni cifra un punto di partenza e fate un benchmark sul vostro stack prima di acquistare.

← Torna al blog

Privacy e analisi

Solo con il tuo consenso, PostHog (UE) e Cloudflare misurano pagine visitate e ordine, durata, provenienza, paese approssimativo, browser, dispositivo e prestazioni.

Maggiori dettagli

Raccogliamo i percorsi delle pagine visitate e il loro ordine, gli orari e la durata della visita, il sito di provenienza, il paese approssimativo (ricavato dall'indirizzo IP) e informazioni di base su browser e dispositivo. Cloudflare misura anche le prestazioni delle pagine.

Non registriamo il contenuto dei moduli, i singoli clic o video della visita. PostHog non crea un profilo personale e conserva un identificatore anonimo solo per questa scheda del browser. Salviamo nel browser la tua scelta per le visite successive.

Se non sei d'accordo, puoi lasciare il sito senza attivare queste analisi.

Non accetto: esco dal sito