community pool / model answer

gemma-4-31B-it

chat · google/gemma-4-31B-it

24.8 tok/s · model median · 32 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
Arc Pro B70 32GB4-bit16.4 tok/smeasured-- GB131,072llama.cpp
M1 Max 64GB8-bit8.4 tok/sreported287- GB2,048ollama
Radeon AI Pro R9700 32GB4-bit28.8 tok/sreported-- GB2,048llama.cpp
Radeon AI Pro R9700 32GB ×38-bit14.2 tok/smeasured1,08945.7 GB794llama.cpp
Radeon AI Pro R9700 57GB4-bit3.3 tok/sreported8,092- GB2,048llama.cpp
RTX 3090 24GB ×24-bit135.1 tok/sreported7145.1 GB2,048vllm
RTX 3090 24GB ×28-bit87.7 tok/sreported11021.6 GB8,192vllm
RTX 5090 32GB4-bit68.5 tok/sreported11517.8 GB8,192llama.cpp
RTX 5090 32GB6-bit46.5 tok/sreported15827.3 GB8,192llama.cpp
RTX 5090 32GB8-bit38 tok/sreported25064 GB2,048llama.cpp
RTX PRO 6000 Blackwell 96GB16-bit40 tok/sreported55- GB2,048vllm
RTX PRO 6000 Blackwell 96GB ×416-bit98.2 tok/sreported43- GB2,048vllm
RTX PRO 6000 Blackwell Workstation Edition 96GB8-bit58.6 tok/sreported68- GB131,072vllm
RTX PRO 6000 Blackwell Workstation Edition 96GB16-bit47.4 tok/smeasured26,51386.1 GB131,072vllm
Ryzen AI Max 395 128GB4-bit10.7 tok/sreported-25.4 GB16,384llama.cpp
Tesla P100-PCIE-16GB 16GB ×25-bit15.3 tok/sreported-- GB2,048llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.