community pool / model answer

gpt-oss-20b

chat · openai/gpt-oss-20b

102.8 tok/s · model median · 39 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
Arc Pro B60 24GB8-bit40.7 tok/sreported459- GB4,096llama.cpp
Arc Pro B60 24GB ×28-bit40.1 tok/sreported460- GB4,096llama.cpp
GB10 Grace Blackwell 121GB16-bit49.1 tok/sreported-- GB128,000vllm
GB10 Grace Blackwell 128GB4-bit49.2 tok/sreported74- GB32,768vllm
M1 Max 64GB4-bit62.4 tok/sreported172- GB2,048ollama
M1 Max 64GB8-bit83.6 tok/sreported-- GB640llama.cpp
M5 Max 128GB4-bit137 tok/sreported-12.4 GB2,048mlx
Radeon 890M 32GB4-bit23.9 tok/sreported1,210- GB2,048llama.cpp
Radeon AI Pro R9700 32GB ×24-bit48.3 tok/sreported89- GB32,768vllm
Radeon AI Pro R9700 32GB ×38-bit152.9 tok/smeasured24617 GB131,072llama.cpp
RTX 2080 8GB4-bit12 tok/sreported-12 GB2,048ollama
RTX 3060 12GB4-bit74 tok/sreported-12 GB2,048ollama
RTX 3080 12GB4-bit21 tok/sreported-8.2 GB2,048ollama
RTX 3090 24GB4-bit162.4 tok/smeasured1,7900 GB131,072llama.cpp
RTX 5080 16GB8-bit222.4 tok/sreported48- GB4,096llama.cpp
RTX 5090 32GB4-bit307.2 tok/sreported83- GB2,048lmstudio
RTX3060+RTX2080-pooled-20GB 20GB4-bit77 tok/sreported-12 GB2,048ollama
RX 6700 XT 12GB8-bit22.4 tok/smeasured-- GB4,736llama.cpp
Ryzen AI Max 385 24GB4-bit23.2 tok/sreported1,210- GB2,048llama.cpp
Ryzen AI Max 395 64GB4-bit75.2 tok/sreported93112.2 GB8,192llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.