community pool / model answer

Qwen3.6-35B-A3B-GGUF

chat · unsloth/Qwen3.6-35B-A3B-GGUF

56.9 tok/s · model median · 53 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
CMP 170HX 64GB8-bit104.9 tok/smeasured328- GB16,384llama.cpp
M4 Pro 48GB4-bit47.1 tok/sreported-- GB640llama.cpp
M5 32GB4-bit34.3 tok/sreported-- GB64,000llama.cpp
Radeon 890M 32GB4-bit20.1 tok/sreported1,530- GB2,048llama.cpp
Radeon AI Pro R9700 32GB4-bit78.6 tok/sreported178- GB2,048llama.cpp
Radeon RX 7900 XTX 24GB4-bit57.6 tok/sreported-19.5 GB640llama.cpp
Radeon RX 9070 16GB3-bit76 tok/sreported36015.5 GB65,536llama.cpp
RTX 3060 12GB2-bit75.3 tok/sreported63- GB65,536llama.cpp
RTX 3060 12GB ×24-bit78.2 tok/smeasured22421.6 GB98,304llama.cpp
RTX 3090 24GB ×23-bit125.9 tok/sreported-10.1 GB131,072llama.cpp
RTX 3090 24GB ×24-bit124 tok/sreported-22.5 GB1,048,576llama.cpp
RTX 3090 24GB ×26-bit40.3 tok/sreported46319.8 GB32,768llama.cpp
RTX 4070 12GB4-bit28.4 tok/sreported772- GB2,048vllm
RTX 4090 24GB4-bit165.1 tok/sreported-23,691 GB64,000llama.cpp
RTX 5060 Ti 16GB ×24-bit94.4 tok/sreported81- GB8,192llama.cpp
Ryzen AI Max 385 24GB4-bit19.2 tok/sreported1,530- GB2,048llama.cpp
Ryzen AI Max 395 64GB4-bit60.5 tok/sreported96321.5 GB8,192llama.cpp
Tesla P100 32GB ×216-bit67 tok/smeasured3,541- GB2,048llama.cpp
Tesla P100-PCIE-16GB 16GB3-bit24.2 tok/sreported-- GB2,048llama.cpp
Tesla P100-PCIE-16GB 16GB ×25-bit63.9 tok/sreported-- GB2,048llama.cpp
Tesla V100 32GB4-bit58.3 tok/smeasured71,44721.5 GB262,144llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.