gpu4.pics
data via LocalScore
AMD Radeon RX 6650 XT
llamafile 0.9.2
8 GB VRAM AMD
running Qwen2.5.1 Coder 7B Instruct· Q4_K_M· 7.6B
26.8
tokens / sec
180 · Modest
Generation
26.8tok/s
higher is better
Prompt / prefill
566tok/s
higher is better
Time to first token
2.58 s
lower is better
Composite score
180
Model size
7.6B
Runtime
llamafile
AMD EPYC 7352 24-Core Processor (znver2) · 126 GB RAM · Linux · llamafile
gpu4.pics/r/ls-result-20

All benchmarks on this rig

ModelQuantGenPromptTTFTPowerPerf/W$/MtokScore
Qwen2.5.1 Coder 7B Instruct7.6BQ4_K_M26.85662.58 s180