community pool / model answer

Qwen3.6-27B-MTP-GGUF

chat · unsloth/Qwen3.6-27B-MTP-GGUF

66.4 tok/s · model median · 161 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
Arc Pro B70 32GB4-bit30.7 tok/sreported500- GB4,096llama.cpp
Arc Pro B70 32GB8-bit36.1 tok/sreported785- GB32,768llama.cpp
M5 Pro 24GB2-bit21.5 tok/sreported150- GB2,048llama.cpp
M5 Pro 24GB3-bit20 tok/sreported164- GB2,048llama.cpp
M5 Pro 24GB4-bit18.2 tok/smeasured175- GB2,048llama.cpp
Radeon AI Pro R9700 32GB4-bit43.3 tok/sreported77- GB2,048llama.cpp
RTX 3060 12GB ×24-bit17.7 tok/smeasured7,25718.1 GB131,072llama.cpp
RTX 3090 24GB1-bit49.2 tok/smeasured-2.5 GB196,608llama.cpp
RTX 3090 24GB4-bit101.5 tok/smeasured76120.2 GB131,072llama.cpp
RTX 3090 24GB ×24-bit65.2 tok/smeasured497- GB262,144llama.cpp
RTX 4090 24GB4-bit94.1 tok/sreported-23.9 GB76,000llama.cpp
RTX 5060 Ti 16GB3-bit26.7 tok/sreported596- GB2,048llama.cpp
RTX 5060 Ti 16GB ×24-bit33.3 tok/sreported17919.3 GB65,536llama.cpp
RTX 5090 32GB5-bit70.4 tok/sreported141- GB2,048llama.cpp
RTX PRO 6000 Blackwell 96GB6-bit60.1 tok/sreported301- GB131,072llama.cpp
RTX PRO 6000 Blackwell 96GB16-bit40.3 tok/sreported282- GB131,072llama.cpp
RX 7900 XTX 24GB4-bit48.5 tok/smeasured1,35921.9 GB262,144llama.cpp
Ryzen AI Max 395 128GB4-bit17.1 tok/smeasured29,41021.2 GB65,536llama.cpp
Ryzen AI Max 395 64GB4-bit29.2 tok/smeasured4,06318.3 GB8,192llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.