gpu4.pics
data via LocalScore
NVIDIA GeForce RTX 4060 Ti
llamafile 0.9.1
16 GB VRAM NVIDIA
running Meta Llama 3.1 8B Instruct· Q4_K_M
49.3
tokens / sec
565 · Strong
Generation
49.3tok/s
higher is better
Prompt / prefill
2,247tok/s
higher is better
Time to first token
612 ms
lower is better
Efficiency
0.37 tok/s/W
Electricity cost
$0.127/Mtok
Power draw
133 W
AMD EPYC 7352 24-Core Processor (znver2) · 126 GB RAM · Linux · llamafile
gpu4.pics/r/ls-result-9

All benchmarks on this rig

ModelQuantGenPromptTTFTPowerPerf/W$/MtokScore
Meta Llama 3.1 8B InstructQ4_K_M49.32,247612 ms133 W0.37 tok/s/W$0.127/Mtok565

How it stacks up — Meta Llama 3.1 8B Instruct

NVIDIA GeForce RTX 4060 Ti
49.3
NVIDIA H100
120
NVIDIA A100 80GB
110
NVIDIA RTX 3090 Ti
110
NVIDIA RTX PRO 6000 Blackwell Workstation Edition
103
NVIDIA RTX 3090
103
NVIDIA RTX A6000
90.5