Qwen3 32B
32.8B densecurrent Qwen3 dense quality for mid-to-large local cards.
Quant
Q8_0
Speed
9.3-18
GPU layers
45/64
Score
89
Local LLM Toolkit
Tell it your GPU, workload, and tradeoff. It ranks 25 local models across 6 workloads and 3 priorities, then prefills VRAM checks before you download a 400GB+ weight file.
5/5 free runs left today
Current pick
current Qwen3 dense quality for mid-to-large local cards.
Quant
Q8_0
Speed
9.3-18 tok/s
Ranked recommendations
current Qwen3 dense quality for mid-to-large local cards.
Quant
Q8_0
Speed
9.3-18
GPU layers
45/64
Score
89
best general chat quality before the models get huge.
Quant
Q4_K_M
Speed
8.3-15.9
GPU layers
46/80
Score
85
mid-size R1 distill for 24GB-class cards.
Quant
Q8_0
Speed
18.1-34.8
GPU layers
48/48
Score
85
legacy Qwen 2.5 72B — still correct weights; prefer Qwen3 for new builds.
Quant
Q4_K_M
Speed
8-15.5
GPU layers
45/80
Score
84
Qwen3 mid-size that balances quality and VRAM.
Quant
Q8_0
Speed
18.1-34.8
GPU layers
40/40
Score
84
strongest reasoning under 20B for tight VRAM.
Quant
Q8_0
Speed
18.2-34.9
GPU layers
40/40
Score
83
Keep the result above. Get new GGUF benchmarks, VRAM math, and model-fit notes by email. M-F, only when there is something worth sending.
Single opt-in for the local-LLM newsletter. Unsubscribe anytime. Privacy.
Default context
4K tokens
Scope
25 models / 6 workloads / 3 priorities
Recent usage
0 tracked runs / 30d
§ 002 / PRICING
The toolkit is free for up to 5 free runs per tool per day. Upgrade to Pro to remove the limit and keep your rig history in one place.
Free
$0
Pro
$7/mo
Or $49/year