community pool / model answer

Muse-Glimmer-30B-GGUF

chat · unsloth/Muse-Glimmer-30B-GGUF

33.3 tok/s · model median · 12 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
Arc Pro B70 32GB ×48-bit161.9 tok/sreported2,872- GB32,768llama.cpp
Radeon AI Pro R9700 32GB4-bit33.2 tok/sreported478- GB2,048llama.cpp
Radeon AI Pro R9700 32GB5-bit25.8 tok/sreported559- GB2,048llama.cpp
RTX 3060 12GB ×24-bit37.8 tok/sreported1,38817.3 GB65,536llama.cpp
RTX 3080 12GB3-bit13.8 tok/sreported2,8119.4 GB16,384llama.cpp
RTX 3090 24GB ×26-bit31.7 tok/sreported176- GB2,048llama.cpp
RTX 4060 Ti 16GB ×26-bit44 tok/sreported-- GB125,000llama.cpp
RTX PRO 6000 Blackwell 96GB8-bit48.1 tok/sreported40232.8 GB131,072llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.