bestmodel.run / blog
Como achar em 5 minutos o melhor LLM local para a sua GPU no bestmodel.run
Se você já tentou rodar um LLM local e ficou travado na pergunta "qual modelo roda na minha placa?", este tutorial é para você. A maioria tenta adivinhar: olha a VRAM, escolhe um modelo, baixa uma quantização e torce. O problema é que "melhor" não é só o maior modelo que cabe: é a combinação de modelo, quantização, engine e hardware que define a velocidade útil.
O bestmodel.run existe para responder exatamente isso: que modelo de IA roda na sua máquina, a que velocidade e se vale a pena. Em vez de promessas genéricas, ele usa medições assinadas da comunidade. Isso significa que você pode olhar dados reais de rigs parecidos com o seu, comparar tok/s e decidir com menos chute.
Neste guia, você faz o caminho em 5 minutos: achar seu rig, ver o ranking, abrir a página do modelo, entender formato e engine e enviar sua medição.
Passo 1: ache o seu rig em /hardware
O primeiro passo é encontrar a sua máquina ou GPU no bestmodel.run. Acesse /hardware. Ali, o site lista rigs — ou seja, combinações de GPU e máquina — com um slug. Um slug é o nome curto usado na URL. Por exemplo, uma RTX 3090 de 24 GB pode aparecer como rtx-3090-24gb.
Procure pelo slug que mais se parece com o seu hardware. Se você não encontrar exatamente o seu rig, não precisa desistir: quando o rig não existe, o site sugere os 10 slugs mais parecidos. Use essa lista para escolher a configuração mais próxima da sua. O objetivo é ter uma base de medições confiável para começar.
Passo 2: veja o ranking em /wall?rig=<slug>
Depois de escolher o slug, abra /wall?rig=<slug>. Por exemplo, se o seu rig for rtx-3090-24gb, a URL fica /wall?rig=rtx-3090-24gb.
Essa página mostra o ranking de modelos medidos naquela GPU, em tok/s. Você vê o que já foi medido e como se comporta. Por padrão, o site esconde modelos minúsculos, menores que 1B, e modelos "de brinquedo". Isso ajuda a focar em modelos que realmente podem ser úteis para uso local.
Use essa página para responder perguntas práticas:
- Quais modelos já têm medições para essa GPU?
- Qual modelo entrega mais tok/s?
- Existe um modelo menor que é muito mais rápido e ainda atende à sua necessidade?
- Um modelo grande está lento demais para o seu uso?
O ponto importante: o ranking mostra velocidade medida, não apenas "este modelo é melhor". Para muitos usuários, a diferença entre uma velocidade baixa e uma velocidade alta muda a experiência: um modelo mais rápido pode ser mais útil do que um maior que demora minutos.
Passo 3: abra a página do modelo em /m/<slug-do-modelo>
Quando você encontrar um modelo interessante no ranking, abra a página dele em /m/<slug-do-modelo>. A página do modelo mostra as medições associadas a ele. É ali que você vê mais detalhes do comportamento do modelo.
Se você digitar um slug errado, o site sugere os modelos parecidos. Por exemplo, se você tentar /m/gemma-4-12b-it, o site pode sugerir google-gemma-4-12b-it. Isso é útil porque nomes mudam, prefixos aparecem e quantizações variam. Use a sugestão para chegar à página correta.
Ao abrir a página do modelo, procure entender:
- O modelo tem medições para o seu rig ou para rigs parecidos?
- A velocidade varia conforme o formato ou engine?
- Há medições suficientes para confiar na comparação?
- O modelo parece bom para o seu caso de uso, ou é apenas popular?
Se a página mostrar poucas medições, trate o resultado com cautela. Se mostrar várias medições de comunidade, você tem uma base mais sólida para decidir.
Passo 4: formato e engine mudam tudo
Muitas pessoas escolhem o modelo e param por aí. Mas, em LLM local, formato e engine podem mudar drasticamente a velocidade: o mesmo modelo pode ser lento em uma configuração e rápido em outra.
Um exemplo real medido numa RTX 3090 mostra isso bem. O Qwen 3.8 27B em GGUF Q5, usando llama.cpp, teve 23 tok/s. O mesmo modelo em EXL3 + DFlash2, usando exllamav3, ficou na faixa de ~70–100 tok/s. A diferença muda a experiência de "aguenta para testes" para "dá para usar com conforto".
Outro exemplo: Gemma 4 12B W4A16, usando vLLM, teve 66,5 tok/s com 1 pedido. Isso mostra que modelos menores nem sempre são a única opção: se a GPU aguenta, um 12B pode entregar velocidade interessante conforme formato e engine.
Ao comparar modelos, não olhe apenas o nome: veja modelo, quantização, engine e tok/s. Se duas linhas parecem iguais, mas uma usa GGUF Q5 e outra usa EXL3 + DFlash2, a velocidade pode ser muito diferente. A pergunta certa não é só "qual modelo roda na minha placa?", mas "qual combinação de modelo, formato e engine roda bem na minha placa?".
Passo 5: envie a sua medição em /submit
O bestmodel.run fica melhor com medições da comunidade. Se você rodou um modelo local, acesse /submit e envie a sua: isso ajuda pessoas com GPUs parecidas.
Esse passo é importante quando o rig não tem muitas medições. Onde não há medição para a sua GPU, o site só estima por fórmula. Trate como estimativa: útil para começar, mas não substitui medição real. Se você consegue medir, enviar o dado torna a informação mais confiável.
Enviar uma medição também ajuda a entender seu hardware: você pode descobrir que uma engine é melhor para a sua GPU, que uma quantização muda a velocidade ou que um modelo promissor não atende à sua necessidade.
Dica: use ?as=agent para pedir ao seu assistente
Qualquer página aceita ?as=agent para uma versão em texto voltada a agentes e LLMs. Se você usa um assistente, pode pedir a ele para ler /wall?rig=rtx-3090-24gb&as=agent ou uma página de modelo com ?as=agent.
Isso é útil para automatizar comparações: listar modelos mais rápidos para um rig, resumir medições ou comparar configurações. A versão em texto facilita a leitura por agentes.
CTA: faça o teste agora
Se você quer parar de chutar e descobrir o melhor LLM local para a sua GPU, siga este fluxo:
- Acesse
/hardwaree encontre o slug do seu rig. - Abra
/wall?rig=<slug>e veja o ranking de modelos medidos. - Escolha um modelo e abra
/m/<slug-do-modelo>para ver as medições. - Compare formato, quantização e engine, porque a velocidade muda muito.
- Se você tiver uma medição própria, envie em
/submit.
O bestmodel.run não promete o modelo perfeito para todo mundo. Ele oferece dados medidos pela comunidade para você responder: que modelo roda na sua máquina, a que velocidade e se vale a pena. Se sua GPU não tem medições suficientes, envie a sua. Assim, a próxima pessoa terá uma resposta mais próxima da realidade.