Model Hub: VRAM Requirements & GPU Fit
Each model page includes architecture specs, five-quant VRAM breakdowns, a verdict matrix across 12 GPUs (comfortable / tight / needs multi-GPU / infeasible) and theoretical speed estimates. All numbers are computed with our formulas: weights = params × bpw ÷ 8, KV cache at 8K context in fp16, plus 1.5GB runtime overhead.
| Model | Parameters | Architecture | Q4_K_M @8K VRAM |
|---|---|---|---|
| Llama 3.2 3B | 3.21B | Dense | 4.4 GB |
| Llama 3.1 8B | 8.03B | Dense | 7.5 GB |
| Qwen3 8B | 8.2B | Dense | 7.7 GB |
| Phi-4 14B | 14.7B | Dense | 12.2 GB |
| gpt-oss-20b | 20.9B / 3.6B | MoE | 14.7 GB |
| Mistral Small 3.2 24B | 24B | Dense | 17.5 GB |
| Gemma 3 27B | 27.4B | Dense | 22.4 GB |
| Qwen3.8 27B | 27.8B | Dense | 20.7 GB |
| Muse Glimmer 30B | 29.6B | Dense | 20.1 GB |
| Qwen3 30B-A3B | 30.5B / 3.3B | MoE | 21.0 GB |
| Qwen3 32B | 32.8B | Dense | 23.7 GB |
| Llama 3.3 70B | 70.6B | Dense | 47.4 GB |
| gpt-oss-120b | 116.8B / 5.1B | MoE | 73.6 GB |
| DeepSeek-R1 671B | 671B / 37B | MoE · MLA | 413.1 GB |
Data verified 2026-09-01