community pool / model answer

Ornith-1.0-35B-GGUF

chat · ornith-ai/Ornith-1.0-35B-GGUF

60.6 tok/s · model median · 30 runs in the model record.

Reference rigQuantizationMedian resultBasisTTFT (ms)Peak VRAMMax contextEngines
Arc Pro B60 24GB4-bit62.7 tok/sreported532- GB4,096llama.cpp
Arc Pro B60 24GB ×24-bit62.6 tok/sreported532- GB4,096llama.cpp
RTX 3060 12GB ×24-bit85.9 tok/smeasured3,07921.1 GB65,536llama.cpp
RTX 3090 24GB4-bit124.1 tok/sreported94- GB262,144llama.cpp
RTX 3090 24GB ×24-bit136.5 tok/sreported86- GB262,144llama.cpp
RTX 4070 12GB4-bit43.2 tok/smeasured393- GB2,048vllm
RTX 5090 32GB4-bit252.6 tok/sreported1- GB2,048ollama
RX 5700 4GB4-bit27.4 tok/sreported122- GB2,048llama.cpp
RX 5700 8GB4-bit27.4 tok/sreported127- GB2,048llama.cpp
Ryzen AI Max 395 128GB4-bit43 tok/sreported26,64920.9 GB65,536llama.cpp
Ryzen AI Max 395 64GB4-bit60.6 tok/smeasured1,58321.5 GB8,192llama.cpp

Context tested

The table above is the tested context for each exact rig and quantization cell. Empty fields remain empty rather than being filled with an estimate.