GPUFits

Model Hub: VRAM Requirements & GPU Fit

Each model page includes architecture specs, five-quant VRAM breakdowns, a verdict matrix across 12 GPUs (comfortable / tight / needs multi-GPU / infeasible) and theoretical speed estimates. All numbers are computed with our formulas: weights = params × bpw ÷ 8, KV cache at 8K context in fp16, plus 1.5GB runtime overhead.

Model Parameters Architecture Q4_K_M @8K VRAM
Llama 3.2 3B 3.21B Dense 4.4 GB
Llama 3.1 8B 8.03B Dense 7.5 GB
Qwen3 8B 8.2B Dense 7.7 GB
Phi-4 14B 14.7B Dense 12.2 GB
gpt-oss-20b 20.9B / 3.6B MoE 14.7 GB
Mistral Small 3.2 24B 24B Dense 17.5 GB
Gemma 3 27B 27.4B Dense 22.4 GB
Qwen3.8 27B 27.8B Dense 20.7 GB
Muse Glimmer 30B 29.6B Dense 20.1 GB
Qwen3 30B-A3B 30.5B / 3.3B MoE 21.0 GB
Qwen3 32B 32.8B Dense 23.7 GB
Llama 3.3 70B 70.6B Dense 47.4 GB
gpt-oss-120b 116.8B / 5.1B MoE 73.6 GB
DeepSeek-R1 671B 671B / 37B MoE · MLA 413.1 GB

Data verified 2026-09-01