bestmodel.run / pool — agent view Honesty ladder: measured > reported > extrapolated > formula > no data yet. Top 60 cells, default sort: fastest decode. Columns: rig | model | basis | value | n. Filter: rig=rtx-5090-32gb. Full machine surface: /llms.txt · REST API: api.bestmodel.run rig | model | basis | value | n rtx-5090-32gb | radixark-qwen3-8-27b-nvfp4 | reported | 4,662.6 tok/s | n=2 rtx-5090-32gb | ggml-org-models-moved | reported | 4,360.9 tok/s | n=1 rtx-5090-32gb | nvidia-nvidia-nemotron-3-nano-30b-a3b-nvfp4 | measured | 582.5 tok/s | n=3 rtx-5090-32gb | nvidia-nvidia-nemotron-3-5-lightning-30b-a3b-nvfp4 | reported | 564.1 tok/s | n=2 rtx-5090-32gb | unsloth-gemma-4-26b-a4b-it-gguf | reported | 395 tok/s | n=2 rtx-5090-32gb | liquidai-lfm2-24b-a2b-gguf | reported | 393.2 tok/s | n=1 rtx-5090-32gb | cyankiwi-gemma-4-26b-a4b-it-awq-4bit | measured | 369 tok/s | n=4 rtx-5090-32gb | unsloth-qwen3-6-35b-a3b-gguf | reported | 324.4 tok/s | n=2 rtx-5090-32gb | lmstudio-community-qwen3-30b-a3b-instruct-2507-gguf | reported | 312.9 tok/s | n=1 rtx-5090-32gb | openai-gpt-oss-20b | reported | 307.2 tok/s | n=1 rtx-5090-32gb | nvidia-nvidia-nemotron-3-nano-30b-a3b-bf16 | reported | 299.4 tok/s | n=2 rtx-5090-32gb | aidxteam-qwen3-coder-30b-a3b-instruct-awq | reported | 287.7 tok/s | n=2 rtx-5090-32gb | lmstudio-community-nvidia-nemotron-3-nano-30b-a3b-gguf | reported | 286.8 tok/s | n=1 rtx-5090-32gb | google-gemma-4-26b-a4b-it | measured | 282 tok/s | n=7 rtx-5090-32gb | lmstudio-community-nemotron-3-nano-omni-30b-a3b-reasoning-gguf | reported | 274.4 tok/s | n=1 rtx-5090-32gb | unsloth-qwen3-6-35b-a3b-mtp-gguf | reported | 265.4 tok/s | n=1 rtx-5090-32gb | lmstudio-community-qwen3-coder-30b-a3b-instruct-gguf | reported | 263 tok/s | n=1 rtx-5090-32gb | ornith-ai-ornith-1-5-35b-a3b-nvfp4 | reported | 258.8 tok/s | n=1 rtx-5090-32gb | coherelabs-north-mini-code-1-0 | reported | 258.4 tok/s | n=1 rtx-5090-32gb | unsloth-gemma-4-26b-a4b-it-gguf | reported | 255.7 tok/s | n=1 rtx-5090-32gb | ornith-ai-ornith-1-0-35b-gguf | reported | 252.6 tok/s | n=1 rtx-5090-32gb | lmstudio-community-qwen3-6-35b-a3b-gguf | reported | 243.1 tok/s | n=1 rtx-5090-32gb | nvidia-nvidia-nemotron-3-nano-4b-gguf | reported | 237.8 tok/s | n=1 rtx-5090-32gb | lmstudio-community-gemma-4-e2b-it-gguf | reported | 232.6 tok/s | n=1 rtx-5090-32gb | neroued-qwen3-8-27b-nvfp4-ninfer | reported | 231.8 tok/s | n=2 rtx-5090-32gb | google-gemma-4-26b-a4b-it-qat-q4-0-gguf | measured | 230.5 tok/s | n=3 rtx-5090-32gb | qwen-qwen3-8b | reported | 227.1 tok/s | n=1 rtx-5090-32gb | unsloth-qwen3-6-35b-a3b-mtp-gguf | reported | 222.9 tok/s | n=2 rtx-5090-32gb | unsloth-qwen2-5-vl-7b-instruct-gguf | reported | 222.4 tok/s | n=1 rtx-5090-32gb | qwen-qwen3-6-35b-a3b | reported | 219.8 tok/s | n=1 rtx-5090-32gb | lmstudio-community-qwen3-4b-thinking-2507-gguf | reported | 219.7 tok/s | n=1 rtx-5090-32gb | poolside-laguna-xs-2-1-nvfp4 | reported | 216.7 tok/s | n=2 rtx-5090-32gb | z-lab-qwen3-6-27b-dflash | reported | 215.4 tok/s | n=1 rtx-5090-32gb | lmstudio-community-deepseek-r1-distill-qwen-7b-gguf | reported | 213.3 tok/s | n=1 rtx-5090-32gb | lmstudio-community-gemma-4-26b-a4b-it-gguf | reported | 209.8 tok/s | n=1 rtx-5090-32gb | lmstudio-community-qwen3-5-35b-a3b-gguf | reported | 209.3 tok/s | n=1 rtx-5090-32gb | unsloth-gemma-4-31b-it-qat-gguf | reported | 207.6 tok/s | n=1 rtx-5090-32gb | poolside-laguna-xs-2-1-int4 | reported | 206.2 tok/s | n=2 rtx-5090-32gb | infatoshi-qwen3-6-35b-a3b-nvfp4-fp8 | reported | 203.6 tok/s | n=1 rtx-5090-32gb | ar4ikov-kat-coder-v2-5-dev-awq-w4a16-asym | reported | 201.2 tok/s | n=1 rtx-5090-32gb | qwen-qwen3-6-35b-a3b | measured | 190 tok/s | n=5 rtx-5090-32gb | redhatai-qwen3-6-35b-a3b-nvfp4 | reported | 183.3 tok/s | n=1 rtx-5090-32gb | sakamakismile-gemma-4-12b-coder-fable5-composer2-5-mtp-nvfp4 | reported | 182.7 tok/s | n=2 rtx-5090-32gb | lmstudio-community-glm-4-7-flash-gguf | reported | 182.5 tok/s | n=1 rtx-5090-32gb | zai-org-glm-4-7-flash | reported | 175.9 tok/s | n=1 rtx-5090-32gb | qwen-qwen3-5-9b | reported | 170 tok/s | n=1 rtx-5090-32gb | quanttrio-glm-4-7-flash-awq | reported | 163.1 tok/s | n=2 rtx-5090-32gb | lmstudio-community-gemma-4-e4b-it-gguf | reported | 161.5 tok/s | n=1 rtx-5090-32gb | qwen-qwen3-8-27b | measured | 157.4 tok/s | n=7 rtx-5090-32gb | lmstudio-community-deepseek-r1-0528-qwen3-8b-gguf | reported | 141.5 tok/s | n=1 rtx-5090-32gb | prism-ml-bonsai-27b-gguf | reported | 136.7 tok/s | n=1 rtx-5090-32gb | sakamakismile-huihui-qwen3-8-27b-abliterated-nvfp4 | measured | 135.6 tok/s | n=16 rtx-5090-32gb | lmstudio-community-gemma-3n-e4b-it-text-gguf | reported | 135.4 tok/s | n=1 rtx-5090-32gb | lmstudio-community-glm-4-6v-flash-gguf | reported | 132.7 tok/s | n=1 rtx-5090-32gb | pearsonkyle-qwen3-8-27b-gptq-w4a16 | measured | 132.7 tok/s | n=3 rtx-5090-32gb | google-gemma-4-12b-it-qat-q4-0-gguf | reported | 130.8 tok/s | n=1 rtx-5090-32gb | essentialai-rnj-1-instruct-gguf | reported | 123.2 tok/s | n=1 rtx-5090-32gb | sakamakismile-qwen3-6-27b-text-nvfp4-mtp | reported | 121.9 tok/s | n=2 rtx-5090-32gb | unsloth-qwen3-6-27b-nvfp4 | reported | 120.9 tok/s | n=1 rtx-5090-32gb | sakamakismile-qwen3-8-27b-mtp-nvfp4 | measured | 117.7 tok/s | n=7 Capture or correct a number: /console (signed, Ed25519).