gpu4.pics
data via LocalScore
NVIDIA GeForce RTX 4060 Ti
llamafile 0.9.1
16 GB VRAM NVIDIA
running Llama 3.2 1B Instruct· Q4_K_M· 1.5B
218
tokens / sec
2,328 · Excellent
Generation
218tok/s
higher is better
Prompt / prefill
9,337tok/s
higher is better
Time to first token
161 ms
lower is better
Efficiency
1.95 tok/s/W
Electricity cost
$0.024/Mtok
Power draw
112 W
AMD EPYC 7352 24-Core Processor (znver2) · 126 GB RAM · Linux · llamafile
gpu4.pics/r/ls-result-7

All benchmarks on this rig

ModelQuantGenPromptTTFTPowerPerf/W$/MtokScore
Llama 3.2 1B Instruct1.5BQ4_K_M2189,337161 ms112 W1.95 tok/s/W$0.024/Mtok2,328

How it stacks up — Llama 3.2 1B Instruct

NVIDIA GeForce RTX 4060 Ti
218
NVIDIA L40S
355
NVIDIA RTX 3090 Ti
354
NVIDIA H100
335
NVIDIA RTX 3090
330
NVIDIA RTX A6000
315
NVIDIA A100 80GB
308