Will my GPU run it?
Approximate VRAM fit for each accelerator × model size, at a given quant and context. Estimated from weights + KV cache — the one question every local-AI builder asks, in one matrix.
✓ fits≈ tight✕ won't fit
| Accelerator | VRAM | 1B | 3B | 8B | 14B | 32B | 70B | 120B | 180B |
|---|---|---|---|---|---|---|---|---|---|
| Apple M3 Ultra | 512 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Apple M2 Ultra | 192 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| NVIDIA H200 | 141 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Apple M3 Max | 128 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Apple M4 Max | 128 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| AMD EPYC 7352 24-Core Processor (znver2) | 126 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| NVIDIA RTX PRO 6000 Blackwell Server Edition | 95 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ |
| NVIDIA RTX PRO 6000 Blackwell Workstation Edition | 95 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ |
| NVIDIA A100 80GB | 80 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ |
| NVIDIA H100 | 80 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ |
| NVIDIA RTX 6000 Ada Generation | 48 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ |
| NVIDIA RTX A6000 | 48 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ |
| NVIDIA L40S | 44 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ≈ | ✕ | ✕ |
| AMD Instinct MI50 32GB | 32 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ |
| NVIDIA RTX 5090 | 32 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ |
| NVIDIA Tesla V100 | 32 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ |
| NVIDIA RTX 3090 | 24 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ |
| NVIDIA RTX 3090 Ti | 24 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ |
| NVIDIA RTX 4090 | 24 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ |
| NVIDIA Tesla P40 | 24 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ |
| Quadro RTX 6000 | 23 GB | ✓ | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ |
| NVIDIA GeForce RTX 4060 Ti | 16 GB | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ | ✕ |
| NVIDIA RTX 4080 | 16 GB | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ | ✕ |
| NVIDIA RTX 3080 | 10 GB | ✓ | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ | ✕ |
| AMD Radeon RX 6650 XT | 8 GB | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ | ✕ | ✕ |
| Apple M1 | 8 GB | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ | ✕ | ✕ |
| NVIDIA GeForce RTX 2070 Super | 8 GB | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ | ✕ | ✕ |
| NVIDIA GeForce RTX 3070 Ti | 8 GB | ✓ | ✓ | ✓ | ✕ | ✕ | ✕ | ✕ | ✕ |
Estimates use effective bits-per-weight per quant + a KV-cache approximation; real fit varies with architecture, attention type, and runtime. Apple unified memory is shown as total RAM (usable VRAM is typically ~75%). Treat ≈/✕ near the boundary as “try it.”