community pool / model answer

Qwen3.6-27B-GGUF

chat · unsloth/Qwen3.6-27B-GGUF

24.8 tok/s · model median · 50 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
Arc Pro B70 32GB4-bit26 tok/smeasured-- GB2,048llama.cpp
M4 Pro 48GB4-bit12 tok/sreported-- GB640llama.cpp
M5 Pro 64GB4-bit11.4 tok/sreported911- GB2,048ollama
Radeon AI Pro R9700 32GB4-bit30.2 tok/sreported-- GB65,536llama.cpp
Radeon RX 7900 XTX 24GB3-bit33.3 tok/sreported-13.5 GB640llama.cpp
Radeon RX 7900 XTX 24GB4-bit28.5 tok/sreported-14.8 GB640llama.cpp
RTX 3060 12GB ×24-bit18.4 tok/sreported490- GB32,768llama.cpp
RTX 3090 24GB4-bit150.1 tok/sreported-19.5 GB2,048llama.cpp
RTX 3090 24GB ×24-bit37.8 tok/smeasured1,41612.2 GB65,536llama.cpp
RTX 3090 24GB ×26-bit22.2 tok/sreported1,53217.9 GB32,768llama.cpp
RTX 3090 24GB ×28-bit23 tok/sreported1,65922.1 GB32,768llama.cpp
RTX 3090 Ti 24GB4-bit35.7 tok/smeasured37421 GB73,728llama.cpp
RTX 4070 12GB2-bit21.1 tok/sreported1,39111.9 GB98,304llama.cpp
RTX 4090 24GB4-bit41.8 tok/sreported-- GB32,768llama.cpp
RTX 5060 Ti 16GB ×24-bit22.3 tok/sreported177- GB8,192llama.cpp
RTX 5090 32GB3-bit73.1 tok/smeasured46618.4 GB131,072llama.cpp
RTX 5090 32GB4-bit66.8 tok/smeasured45619.5 GB262,144llama.cpp
RTX 5090 32GB5-bit60.4 tok/smeasured47621.7 GB131,072llama.cpp
RTX 5090 32GB6-bit50.9 tok/smeasured52324.6 GB65,536llama.cpp
RTX A5000 24GB4-bit32.3 tok/sreported-16.2 GB4,096llama.cpp
RX 7900 XTX 24GB3-bit31.7 tok/sreported-11.6 GB512llama.cpp
Tesla P100 32GB ×216-bit17.2 tok/smeasured10,079- GB2,048llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.