community pool / model answer

Qwen3.6-27B

chat · Qwen/Qwen3.6-27B

43.7 tok/s · model median · 146 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
Arc Pro B60 24GB ×28-bit9.5 tok/sreported1,135- GB4,096llama.cpp
Arc Pro B70 32GB4-bit43.5 tok/smeasured1,15617.5 GB131,072llama.cpp, vllm
Arc Pro B70 32GB5-bit26.6 tok/smeasured311- GB204,800llama.cpp
Arc Pro B70 32GB ×24-bit40.5 tok/sreported-- GB1,024llama.cpp
Arc Pro B70 32GB ×28-bit25.7 tok/sreported-- GB512llama.cpp
Arc Pro B70 32GB ×34-bit44.2 tok/smeasured-- GB1,024llama.cpp
Arc Pro B70 32GB ×44-bit33.1 tok/sreported-- GB1,024llama.cpp
Arc Pro B70 32GB ×48-bit43.7 tok/sreported-- GB4,096vllm
Arc Pro B70 32GB ×416-bit54.2 tok/sreported7917 GB262,144vllm
AMD Ryzen 7 7840HS4-bit3.5 tok/sreported-- GB2,048llama.cpp
GB10 Grace Blackwell 128GB4-bit33.3 tok/smeasured632117 GB262,144llama.cpp, vllm
M1 Max 64GB8-bit11.3 tok/sreported3,973- GB787llama.cpp
M5 Max 128GB4-bit19 tok/sreported174- GB8,192lmstudio
Multi-GPU 28GB ×24-bit21.9 tok/sreported155- GB4,096llama.cpp
Radeon 8060S Graphics 103GB4-bit88.3 tok/sreported33718 GB4,096hipfire
Radeon 890M 32GB4-bit4.9 tok/sreported-- GB4,096llama.cpp
Radeon AI Pro R9700 32GB4-bit278 tok/sreported10316.6 GB2,048hipfire
Radeon AI Pro R9700 32GB ×34-bit213.7 tok/sreported6316 GB4,096hipfire
Radeon AI Pro R9700 32GB ×38-bit17.8 tok/smeasured76849.4 GB262,144llama.cpp
Radeon AI Pro R9700 34GB4-bit254.8 tok/sreported11117.5 GB4,096hipfire
Radeon AI Pro R9700 57GB4-bit3.6 tok/sreported7,848- GB2,048llama.cpp
Radeon RX 7900 XTX 24GB4-bit28.4 tok/smeasured490- GB262,144llama.cpp
RTX 3060 12GB ×24-bit17.6 tok/sreported-18.2 GB128,000llama.cpp
RTX 3090 24GB4-bit26.2 tok/smeasured1,3740 GB131,072llama.cpp
RTX 3090 24GB ×24-bit46.7 tok/sreported125- GB2,048llama.cpp
RTX 3090 24GB ×26-bit22.7 tok/sreported2,101- GB2,048llama.cpp
RTX 3090 24GB ×28-bit40.9 tok/sreported2,101- GB2,048vllm
RTX 3090 Ti 24GB4-bit140.3 tok/sreported71022 GB1,024llama.cpp
RTX 4090 24GB4-bit44.2 tok/smeasured335- GB131,072llama.cpp
RTX 5060 Ti 16GB4-bit46 tok/sreported453- GB2,048llama.cpp
RTX 5090 32GB3-bit73.5 tok/smeasured3613.5 GB8,192llama.cpp
RTX 5090 32GB4-bit70.1 tok/smeasured3720 GB243,040llama.cpp, vllm
RTX 5090 32GB8-bit20 tok/sreported20016 GB2,048ollama
RTX PRO 6000 Blackwell 96GB4-bit105.7 tok/smeasured1,150- GB15,907llama.cpp
RTX PRO 6000 Blackwell 96GB8-bit72.1 tok/smeasured1,203- GB15,907llama.cpp
RTX PRO 6000 Blackwell 96GB16-bit56.4 tok/sreported99- GB2,048vllm
RTX PRO 6000 Blackwell 96GB ×216-bit99.6 tok/sreported58- GB2,048vllm
RTX PRO 6000 Blackwell 96GB ×416-bit146.1 tok/sreported51- GB2,048vllm
RX 7900 XT 20GB4-bit60.6 tok/sreported85- GB2,048vllm
RX 7900 XTX 24GB4-bit118.2 tok/smeasured12616.8 GB16,384hipfire, llama.cpp
Ryzen AI Max 395 128GB4-bit112 tok/sreported29016.8 GB2,048hipfire
Ryzen AI Max 395 128GB8-bit16.7 tok/sreported1,926- GB787llama.cpp
Ryzen AI Max 395 64GB4-bit12.4 tok/smeasured4,57217.1 GB10,240llama.cpp
Ryzen AI Max 395 64GB8-bit7.7 tok/sreported4,05927.8 GB8,192llama.cpp
Tesla P100 32GB ×24-bit47.4 tok/smeasured176- GB2,048llama.cpp
Tesla P100-PCIE-16GB 16GB3-bit7.5 tok/sreported-- GB2,048llama.cpp
Tesla P100-PCIE-16GB 16GB ×25-bit17.9 tok/sreported-- GB2,048llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.