gpu4.pics
data via LocalScore
NVIDIA GeForce RTX 4060 Ti
llamafile 0.9.1
16 GB VRAM NVIDIA
running Qwen2.5 14B Instruct· Q4_K_M· 14.8B
26.9
tokens / sec
317 · Passable
Generation
26.9tok/s
higher is better
Prompt / prefill
1,266tok/s
higher is better
Time to first token
1.07 s
lower is better
Efficiency
0.2 tok/s/W
Electricity cost
$0.238/Mtok
Power draw
136 W
AMD EPYC 7352 24-Core Processor (znver2) · 126 GB RAM · Linux · llamafile
gpu4.pics/r/ls-result-10

All benchmarks on this rig

ModelQuantGenPromptTTFTPowerPerf/W$/MtokScore
Qwen2.5 14B Instruct14.8BQ4_K_M26.91,2661.07 s136 W0.2 tok/s/W$0.238/Mtok317

How it stacks up — Qwen2.5 14B Instruct

NVIDIA GeForce RTX 4060 Ti
26.9
NVIDIA H100
72.2
NVIDIA RTX PRO 6000 Blackwell Workstation Edition
70.8
NVIDIA A100 80GB
66.3
NVIDIA RTX 3090 Ti
64.2
NVIDIA RTX 3090
59.9
NVIDIA RTX A6000
52