community pool / model answer

Qwen3.5-9B

chat · Qwen/Qwen3.5-9B

47.1 tok/s · model median · 43 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
Arc Pro B60 24GB8-bit30.4 tok/sreported366- GB4,096llama.cpp
Arc Pro B60 24GB ×28-bit30.4 tok/sreported367- GB4,096llama.cpp
AMD Ryzen 7 8745H w/ Radeon 780M4-bit13.9 tok/sreported1,6304 GB32,768llama.cpp
Intel(R) Core(TM) Ultra 7 155H4-bit8.5 tok/sreported-- GB2,048llama.cpp
GTX 1080 Ti 11GB4-bit64.9 tok/sreported-- GB2,048llama.cpp
GTX 1080 Ti 11GB5-bit34.3 tok/sreported-9 GB8,192llama.cpp
Radeon 8060S Graphics 103GB4-bit255.8 tok/sreported1247.7 GB4,096hipfire
Radeon AI Pro R9700 32GB4-bit371.8 tok/sreported637.7 GB4,096hipfire
Radeon AI Pro R9700 57GB4-bit15.8 tok/sreported1,791- GB2,048llama.cpp
Radeon RX 5700 XT 8GB4-bit61.6 tok/sreported1487.4 GB4,096hipfire
Radeon RX 6950 XT 16GB4-bit222 tok/sreported1267.4 GB4,096hipfire
RTX 3060 12GB3-bit43 tok/sreported1,5406.4 GB4,608llama.cpp
RTX 3060 12GB4-bit51.4 tok/smeasured1,685- GB131,072llama.cpp
RTX 3060 Ti 8GB4-bit63.5 tok/sreported249- GB2,048llama.cpp
RTX 3080 Ti 12GB8-bit15.4 tok/sreported164,150- GB250,000llama.cpp
RTX 3090 24GB ×28-bit71.7 tok/sreported675- GB2,048llama.cpp
RTX 3090 Ti 24GB4-bit119.1 tok/sreported1568 GB8,192llama.cpp
RTX 5080 16GB8-bit79.6 tok/sreported82- GB4,096llama.cpp
RTX 5090 32GB6-bit170 tok/sreported46- GB2,048llama.cpp
RTX PRO 6000 Blackwell 96GB16-bit171.6 tok/sreported40233.6 GB8,192vllm
RX 7900 XTX 24GB4-bit337 tok/smeasured767.4 GB4,096hipfire
Ryzen AI Max 395 128GB4-bit37.2 tok/smeasured-6.4 GB32,768llama.cpp
Ultra 7 155H 32GB4-bit6.5 tok/sreported-- GB2,048llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.