bestmodel.run / blog — Como achar em 5 minutos o melhor LLM local para a sua GPU no bestmodel.run date 2026-09-29 · Carlos Felipe Aprenda a achar o melhor LLM local para a sua GPU em 5 minutos no bestmodel.run: encontre seu rig, veja rankings tok/s e envie medições. # Como achar em 5 minutos o melhor LLM local para a sua GPU no bestmodel.run Se você já tentou rodar um LLM local e ficou travado na pergunta "qual modelo roda na minha placa?", este tutorial é para você. A maioria tenta adivinhar: olha a VRAM, escolhe um modelo, baixa uma quantização e torce. O problema é que "melhor" não é só o maior modelo que cabe: é a combinação de modelo, quantização, engine e hardware que define a velocidade útil. O bestmodel.run existe para responder exatamente isso: que modelo de IA roda na sua máquina, a que velocidade e se vale a pena. Em vez de promessas genéricas, ele usa medições assinadas da comunidade. Isso significa que você pode olhar dados reais de rigs parecidos com o seu, comparar tok/s e decidir com menos chute. Neste guia, você faz o caminho em 5 minutos: achar seu rig, ver o ranking, abrir a página do modelo, entender formato e engine e enviar sua medição. ## Passo 1: ache o seu rig em `/hardware` O primeiro passo é encontrar a sua máquina ou GPU no bestmodel.run. Acesse `/hardware`. Ali, o site lista rigs — ou seja, combinações de GPU e máquina — com um slug. Um slug é o nome curto usado na URL. Por exemplo, uma RTX 3090 de 24 GB pode aparecer como `rtx-3090-24gb`. Procure pelo slug que mais se parece com o seu hardware. Se você não encontrar exatamente o seu rig, não precisa desistir: quando o rig não existe, o site sugere os 10 slugs mais parecidos. Use essa lista para escolher a configuração mais próxima da sua. O objetivo é ter uma base de medições confiável para começar. ## Passo 2: veja o ranking em `/wall?rig=<slug>` Depois de escolher o slug, abra `/wall?rig=<slug>`. Por exemplo, se o seu rig for `rtx-3090-24gb`, a URL fica `/wall?rig=rtx-3090-24gb`. Essa página mostra o ranking de modelos medidos naquela GPU, em tok/s. Você vê o que já foi medido e como se comporta. Por padrão, o site esconde modelos minúsculos, menores que 1B, e modelos "de brinquedo". Isso ajuda a focar em modelos que realmente podem ser úteis para uso local. Use essa página para responder perguntas práticas: - Quais modelos já têm medições para essa GPU? - Qual modelo entrega mais tok/s? - Existe um modelo menor que é muito mais rápido e ainda atende à sua necessidade? - Um modelo grande está lento demais para o seu uso? O ponto importante: o ranking mostra velocidade medida, não apenas "este modelo é melhor". Para muitos usuários, a diferença entre uma velocidade baixa e uma velocidade alta muda a experiência: um modelo mais rápido pode ser mais útil do que um maior que demora minutos. ## Passo 3: abra a página do modelo em `/m/<slug-do-modelo>` Quando você encontrar um modelo interessante no ranking, abra a página dele em `/m/<slug-do-modelo>`. A página do modelo mostra as medições associadas a ele. É ali que você vê mais detalhes do comportamento do modelo. Se você digitar um slug errado, o site sugere os modelos parecidos. Por exemplo, se você tentar `/m/gemma-4-12b-it`, o site pode sugerir `google-gemma-4-12b-it`. Isso é útil porque nomes mudam, prefixos aparecem e quantizações variam. Use a sugestão para chegar à página correta. Ao abrir a página do modelo, procure entender: - O modelo tem medições para o seu rig ou para rigs parecidos? - A velocidade varia conforme o formato ou engine? - Há medições suficientes para confiar na comparação? - O modelo parece bom para o seu caso de uso, ou é apenas popular? Se a página mostrar poucas medições, trate o resultado com cautela. Se mostrar várias medições de comunidade, você tem uma base mais sólida para decidir. ## Passo 4: formato e engine mudam tudo Muitas pessoas escolhem o modelo e param por aí. Mas, em LLM local, formato e engine podem mudar drasticamente a velocidade: o mesmo modelo pode ser lento em uma configuração e rápido em outra. Um exemplo real medido numa RTX 3090 mostra isso bem. O Qwen 3.8 27B em GGUF Q5, usando llama.cpp, teve 23 tok/s. O mesmo modelo em EXL3 + DFlash2, usando exllamav3, ficou na faixa de ~70–100 tok/s. A diferença muda a experiência de "aguenta para testes" para "dá para usar com conforto". Outro exemplo: Gemma 4 12B W4A16, usando vLLM, teve 66,5 tok/s com 1 pedido. Isso mostra que modelos menores nem sempre são a única opção: se a GPU aguenta, um 12B pode entregar velocidade interessante conforme formato e engine. Ao comparar modelos, não olhe apenas o nome: veja modelo, quantização, engine e tok/s. Se duas linhas parecem iguais, mas uma usa GGUF Q5 e outra usa EXL3 + DFlash2, a velocidade pode ser muito diferente. A pergunta certa não é só "qual modelo roda na minha placa?", mas "qual combinação de modelo, formato e engine roda bem na minha placa?". ## Passo 5: envie a sua medição em `/submit` O bestmodel.run fica melhor com medições da comunidade. Se você rodou um modelo local, acesse `/submit` e envie a sua: isso ajuda pessoas com GPUs parecidas. Esse passo é importante quando o rig não tem muitas medições. Onde não há medição para a sua GPU, o site só estima por fórmula. Trate como estimativa: útil para começar, mas não substitui medição real. Se você consegue medir, enviar o dado torna a informação mais confiável. Enviar uma medição também ajuda a entender seu hardware: você pode descobrir que uma engine é melhor para a sua GPU, que uma quantização muda a velocidade ou que um modelo promissor não atende à sua necessidade. ## Dica: use `?as=agent` para pedir ao seu assistente Qualquer página aceita `?as=agent` para uma versão em texto voltada a agentes e LLMs. Se você usa um assistente, pode pedir a ele para ler `/wall?rig=rtx-3090-24gb&as=agent` ou uma página de modelo com `?as=agent`. Isso é útil para automatizar comparações: listar modelos mais rápidos para um rig, resumir medições ou comparar configurações. A versão em texto facilita a leitura por agentes. ## CTA: faça o teste agora Se você quer parar de chutar e descobrir o melhor LLM local para a sua GPU, siga este fluxo: 1. Acesse `/hardware` e encontre o slug do seu rig. 2. Abra `/wall?rig=<slug>` e veja o ranking de modelos medidos. 3. Escolha um modelo e abra `/m/<slug-do-modelo>` para ver as medições. 4. Compare formato, quantização e engine, porque a velocidade muda muito. 5. Se você tiver uma medição própria, envie em `/submit`. O bestmodel.run não promete o modelo perfeito para todo mundo. Ele oferece dados medidos pela comunidade para você responder: que modelo roda na sua máquina, a que velocidade e se vale a pena. Se sua GPU não tem medições suficientes, envie a sua. Assim, a próxima pessoa terá uma resposta mais próxima da realidade.