community pool / model answer

Qwen3.6-27B

chat · unsloth/Qwen3.6-27B

27.5 tok/s · model median · 41 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
Arc Pro B70 32GB ×24-bit42.1 tok/sreported-- GB512llama.cpp
Arc Pro B70 32GB ×34-bit49.4 tok/smeasured-- GB2,048llama.cpp
Arc Pro B70 32GB ×44-bit39.2 tok/smeasured-- GB1,024llama.cpp
M3 Ultra 512GB4-bit26.3 tok/smeasured316- GB8,192llama.cpp
M3 Ultra 512GB8-bit18.5 tok/sreported574- GB8,192lmstudio
M4 Max 48GB4-bit21.8 tok/sreported1- GB4,096lmstudio
RTX 3090 24GB ×24-bit41.2 tok/smeasured34624.3 GB131,712llama.cpp, vllm
RTX 3090 24GB ×28-bit45.5 tok/sreported80419 GB8,192llama.cpp
RTX 3090 Ti 24GB4-bit155.9 tok/sreported6818.4 GB4,096llama.cpp
RTX 4090 24GB3-bit49.4 tok/sreported163- GB8,192llama.cpp
Ryzen AI Max 395 128GB4-bit12 tok/smeasured-24 GB65,536hipfire, llama.cpp, ollama
Ryzen AI Max 395 128GB8-bit6.4 tok/smeasured-39.3 GB32,768llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.