community pool / model answer

gemma-4-E2B-it

chat · google/gemma-4-E2B-it

107 tok/s · model median · 15 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
AMD Ryzen 7 8745H w/ Radeon 780M4-bit47.4 tok/sreported4852.5 GB32,768llama.cpp
Intel(R) Core(TM) Ultra 7 155H4-bit27.6 tok/sreported-- GB2,048llama.cpp
Qualcomm Snapdragon 888 ARM644-bit6.2 tok/sreported10,0006 GB1,306llama.cpp
GTX 1060 3GB4-bit48.2 tok/sreported8,399- GB2,048llama.cpp
Radeon AI Pro R9700 32GB8-bit169.7 tok/sreported-- GB2,048llama.cpp
Radeon AI Pro R9700 57GB4-bit47.4 tok/sreported493- GB2,048llama.cpp
RTX 3060 12GB4-bit133.4 tok/sreported1123.8 GB4,096llama.cpp
RX 570 4GB ×22-bit16 tok/sreported246- GB2,048llama.cpp
RX 5700 8GB4-bit73.1 tok/sreported-3 GB2,048llama.cpp
Ryzen AI Max 395 128GB4-bit107 tok/smeasured-8.5 GB32,768llama.cpp
Ultra 7 155H 32GB4-bit28 tok/sreported-- GB2,048llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.