community pool / model answer

LFM2.5-8B-A1B

chat · LiquidAI/LFM2.5-8B-A1B

189.3 tok/s · model median · 35 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
AMD Ryzen 7 8745H w/ Radeon 780M Graphics4-bit63.1 tok/sreported521- GB65,536llama.cpp
GTX 1060 3GB4-bit8.5 tok/sreported33,535- GB2,048llama.cpp
M5 Pro 48GB4-bit189.3 tok/sreported1344.8 GB2,048mlx
Radeon AI Pro R9700 34GB4-bit241.1 tok/sreported1945.4 GB4,096hipfire
RTX 3060 12GB4-bit194.4 tok/smeasured3236.9 GB131,072llama.cpp
RTX 3060 12GB8-bit128.5 tok/sreported37- GB4,096llama.cpp
RTX 5060 Ti 16GB4-bit254.3 tok/sreported22- GB4,096llama.cpp
RTX 5060 Ti 16GB8-bit183.1 tok/sreported25- GB4,096llama.cpp
RTX 5070 Ti 16GB4-bit402.3 tok/sreported16- GB4,096llama.cpp
RTX 5070 Ti 16GB8-bit307.4 tok/sreported20- GB4,096llama.cpp
RX 570 4GB ×24-bit18.6 tok/smeasured325- GB2,048llama.cpp
RX 6700 10GB4-bit172.3 tok/sreported2,1514 GB4,096llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.