community pool / model answer

Qwen3.6-35B-A3B

chat · Qwen/Qwen3.6-35B-A3B

70.8 tok/s · model median · 136 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
Arc Pro B60 24GB4-bit42.6 tok/sreported590- GB2,048llama.cpp
Arc Pro B70 32GB4-bit70 tok/smeasured37222 GB32,768llama.cpp, vllm
Arc Pro B70 32GB5-bit67 tok/smeasured69- GB262,144llama.cpp
Arc Pro B70 32GB ×24-bit73.9 tok/sreported-- GB2,048llama.cpp
Arc Pro B70 32GB ×28-bit110.7 tok/sreported-31.2 GB65,536vllm
Arc Pro B70 32GB ×41-bit120.8 tok/sreported-29.8 GB65,536vllm
Arc Pro B70 32GB ×44-bit68.8 tok/sreported-60 GB262,144llama.cpp
Arc Pro B70 32GB ×48-bit99.8 tok/sreported77127.6 GB32,768vllm
Arc Pro B70 32GB ×416-bit102.5 tok/sreported104123 GB262,144vllm
Intel(R) Core(TM) Ultra 7 155H3-bit13.4 tok/sreported-- GB2,048llama.cpp
GB10 Grace Blackwell 128GB4-bit64.5 tok/sreported15387 GB262,144vllm
GB10 Grace Blackwell 128GB6-bit56.1 tok/sreported-- GB2,048llama.cpp
GB10 Grace Blackwell 128GB8-bit55.7 tok/smeasured206- GB262,144vllm
GTX 1060 6GB2-bit15 tok/sreported-5.9 GB76,800llama.cpp
GTX 1080 Ti 11GB2-bit21.6 tok/smeasured-10.4 GB8,192llama.cpp
GTX 1080 Ti 11GB3-bit14.6 tok/sreported-9.6 GB8,192llama.cpp
GTX 1080 Ti 11GB4-bit10.3 tok/sreported-10.2 GB8,192llama.cpp
GTX 1080 Ti 11GB8-bit6.4 tok/sreported-10.9 GB8,192llama.cpp
M1 Max 64GB4-bit59.3 tok/sreported45- GB2,048ollama
M3 Ultra 512GB4-bit31.9 tok/sreported620- GB2,048mlx
M5 Max 128GB4-bit119.7 tok/sreported3719.9 GB8,192lmstudio, mlx
Multi-GPU 28GB ×24-bit85.6 tok/smeasured81- GB4,096llama.cpp
Radeon AI Pro R9700 32GB4-bit277.4 tok/smeasured520- GB4,096hipfire, llama.cpp
Radeon AI Pro R9700 32GB ×24-bit32.6 tok/sreported135- GB32,768vllm
Radeon AI Pro R9700 32GB ×34-bit98.9 tok/smeasured17132 GB787llama.cpp, vllm
Radeon AI Pro R9700 32GB ×38-bit79.2 tok/smeasured34344.8 GB787llama.cpp
Radeon AI Pro R9700 34GB4-bit259.5 tok/sreported7727.8 GB4,096hipfire
Radeon AI Pro R9700 57GB4-bit33.2 tok/sreported1,294- GB2,048llama.cpp
Radeon AI Pro R9700 57GB6-bit26.4 tok/sreported1,568- GB2,048llama.cpp
Radeon AI Pro R9700 57GB8-bit24.4 tok/sreported1,254- GB2,048llama.cpp
Radeon RX 9070 16GB4-bit34.2 tok/sreported41714.6 GB131,072llama.cpp
RTX 3050 8GB3-bit31 tok/sreported139- GB28,000llama.cpp
RTX 3060 12GB3-bit27.9 tok/smeasured1,4765.6 GB4,096llama.cpp
RTX 3060 12GB4-bit35 tok/sreported-- GB131,072llama.cpp
RTX 3060 12GB ×24-bit67.6 tok/sreported-20.9 GB96,000llama.cpp
RTX 3070 Ti 8GB3-bit33.5 tok/sreported-7,949 GB262,144llama.cpp
RTX 3080 12GB4-bit35.4 tok/smeasured-9.5 GB196,608llama.cpp
RTX 3090 24GB4-bit11 tok/sreported647- GB2,048llama.cpp
RTX 3090 24GB ×24-bit155.6 tok/smeasured12121.3 GB32,768vllm
RTX 3090 24GB ×26-bit137.9 tok/sreported648- GB2,048llama.cpp
RTX 4070 12GB4-bit39.6 tok/smeasured1,476- GB2,048vllm
RTX 4090 24GB3-bit157.7 tok/sreported175- GB8,192llama.cpp
RTX 5080 16GB3-bit150.6 tok/sreported-14.2 GB131,072llama.cpp
RTX 5090 32GB4-bit190 tok/smeasured5426.7 GB262,144llama.cpp, ollama, vllm
RTX 5090 32GB6-bit219.8 tok/sreported2127.5 GB4,096llama.cpp
RTX PRO 6000 Blackwell Workstation Edition 96GB16-bit164.1 tok/sreported3,44985.3 GB65,536sglang
RX 6700 10GB3-bit16.2 tok/sreported2,4484 GB4,096llama.cpp
RX 7900 XTX 24GB4-bit175 tok/smeasured7622.1 GB4,096hipfire
Ryzen AI Max 395 103GB4-bit174.9 tok/sreported296- GB4,096hipfire
Ryzen AI Max 395 64GB4-bit62.4 tok/smeasured1,02021.5 GB8,192llama.cpp
T4 16GB2-bit54.7 tok/sreported-- GB2,048llama.cpp
Tesla P100 32GB ×24-bit78.1 tok/sreported157- GB2,048llama.cpp
Tesla V100 32GB ×26-bit96.7 tok/sreported-60 GB65,536llama.cpp
Tesla V100 SXM2 32GB4-bit66.8 tok/sreported40,00028 GB96,000ollama
Ultra 7 155H 32GB3-bit8.7 tok/sreported-- GB2,048llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.