bestmodel.run / blog

Blog

Measured local-AI notes: which model fits a GPU, how fast, and how to add a signed run.

  1. Gemma 4 12B em produção na RTX 3090: 66,5 tok/s medidos no bestmodel.run

    Medição de produção do Gemma 4 12B W4A16 numa RTX 3090 24 GB: 66,5 tok/s com 1 requisição, 485,7 tok/s com 8 simultâneas, TTFT, VRAM e o que não foi validado.

  2. Como achar em 5 minutos o melhor LLM local para a sua GPU no bestmodel.run

    Aprenda a achar o melhor LLM local para a sua GPU em 5 minutos no bestmodel.run: encontre seu rig, veja rankings tok/s e envie medições.