community pool / model answer

Qwen3.6-35B-A3B-MTP-GGUF

chat · unsloth/Qwen3.6-35B-A3B-MTP-GGUF

69.4 tok/s · model median · 36 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
GTX 1080 Ti 11GB4-bit39.4 tok/sreported-10 GB128,000llama.cpp
M5 Max 128GB4-bit97 tok/sreported-- GB2,048llama.cpp
M5 Pro 24GB3-bit80.4 tok/sreported54- GB65,536llama.cpp
Radeon AI Pro R9700 32GB4-bit56.7 tok/sreported024.5 GB2,048llama.cpp
RTX 3060 12GB2-bit39.2 tok/smeasured3,477- GB2,048llama.cpp
RTX 3060 12GB4-bit24.6 tok/sreported3,009- GB8,320llama.cpp
RTX 3060 12GB ×24-bit98.9 tok/sreported86- GB2,048llama.cpp
RTX 3090 24GB3-bit195.1 tok/sreported2420.2 GB163,840llama.cpp
RTX 3090 24GB4-bit121.6 tok/sreported8723.2 GB262,144llama.cpp
RTX 4090 24GB4-bit213.9 tok/sreported-- GB32,768llama.cpp
RTX 5060 Ti 16GB3-bit119.1 tok/sreported-- GB150,000llama.cpp
RTX 5060 Ti 16GB4-bit36.7 tok/sreported-16 GB131,072llama.cpp
RTX 5060 Ti 16GB ×24-bit129.1 tok/sreported93- GB8,192llama.cpp
RTX 5070 12GB4-bit64.5 tok/sreported228- GB64,000llama.cpp
RTX 5070 Ti 16GB ×24-bit141 tok/sreported12329,335 GB163,840llama.cpp
RTX 5090 32GB4-bit222.9 tok/sreported8928.6 GB65,536llama.cpp
RTX 5090 32GB5-bit265.4 tok/sreported57- GB2,048llama.cpp
RX 6700 10GB3-bit10.1 tok/sreported2,7814 GB4,096llama.cpp
RX 7900 XTX 24GB ×24-bit109.5 tok/sreported183- GB2,048llama.cpp
Ryzen AI Max 395 128GB4-bit54.5 tok/smeasured32,83024.4 GB262,144llama.cpp
Ryzen AI Max 395 64GB4-bit60.5 tok/smeasured1,57521.5 GB8,192llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.