gpu4.pics
data via LocalScore
NVIDIA RTX 4080
llamafile 0.9.2
16 GB VRAM NVIDIA 320 W TDP
running Llama 3.2 1B Instruct· Q4_K_M· 1.5B
130
tokens / sec
2,001 · Excellent
Generation
130tok/s
higher is better
Prompt / prefill
11,035tok/s
higher is better
Time to first token
179 ms
lower is better
Efficiency
1.12 tok/s/W
Electricity cost
$0.043/Mtok
Power draw
118 W
AMD Ryzen 7 5700X 8-Core Processor (znver3) · 63 GB RAM · Linux · llamafile
gpu4.pics/r/ls-result-15

All benchmarks on this rig

ModelQuantGenPromptTTFTPowerPerf/W$/MtokScore
Llama 3.2 1B Instruct1.5BQ4_K_M13011,035179 ms118 W1.12 tok/s/W$0.043/Mtok2,001

How it stacks up — Llama 3.2 1B Instruct

NVIDIA RTX 4080
130
NVIDIA L40S
355
NVIDIA RTX 3090 Ti
354
NVIDIA H100
335
NVIDIA RTX 3090
330
NVIDIA RTX A6000
315
NVIDIA A100 80GB
308