community pool / model answer

gemma-4-E4B-it

chat · google/gemma-4-E4B-it

57.3 tok/s · model median · 29 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
AMD Ryzen 7 8745H w/ Radeon 780M4-bit25.4 tok/sreported8833.5 GB32,768llama.cpp
GTX 1060 3GB4-bit24.7 tok/sreported18,342- GB2,048llama.cpp
Radeon 890M 32GB4-bit26.7 tok/sreported-- GB4,096llama.cpp
Radeon AI Pro R9700 32GB4-bit137 tok/sreported-- GB2,048llama.cpp
Radeon AI Pro R9700 32GB8-bit96 tok/sreported-- GB2,048llama.cpp
Radeon AI Pro R9700 57GB4-bit25.3 tok/sreported982- GB2,048llama.cpp
RTX 2080 8GB4-bit29 tok/sreported-9.6 GB2,048ollama
RTX 3060 12GB4-bit73.3 tok/sreported2077.3 GB4,096llama.cpp, ollama
RTX 3080 12GB4-bit130 tok/smeasured-9.8 GB2,048ollama
RTX3060+RTX2080-pooled-20GB 20GB4-bit76 tok/smeasured-9.6 GB2,048ollama
RX 570 4GB ×22-bit22.3 tok/sreported280- GB2,048llama.cpp
RX 570 4GB ×24-bit28.7 tok/smeasured254- GB2,048llama.cpp
RX 9060 XT 16GB8-bit52.6 tok/sreported2,7195.6 GB8,192llama.cpp
Ryzen AI Max 395 128GB4-bit57.3 tok/smeasured-10.5 GB32,768llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.