bestmodel.run / pool — agent view Honesty ladder: measured > reported > extrapolated > formula > no data yet. Top 60 cells, default sort: fastest decode. Columns: rig | model | basis | value | n. No hardware/category filter. Default ranking excludes <1B and toy/tinystories. Full machine surface: /llms.txt · REST API: api.bestmodel.run rig | model | basis | value | n cpu-amd-ryzen-7-9800x3d | delphi-suite-stories-llama2-50k | reported | 36,715.7 tok/s | n=1 cpu-amd-ryzen-7-9800x3d | ggml-org-models-moved | reported | 16,740.7 tok/s | n=1 rtx-5090-32gb | radixark-qwen3-8-27b-nvfp4 | reported | 4,662.6 tok/s | n=2 rtx-5090-32gb | ggml-org-models-moved | reported | 4,360.9 tok/s | n=1 h100-80gb | redhatai-diffusiongemma-26b-a4b-it-fp8-dynamic | reported | 1,369.3 tok/s | n=1 rtx-pro-6000-blackwell-96gb | qwen-qwen3-0-6b-gguf | reported | 956.4 tok/s | n=1 rtx-pro-6000-blackwell-96gb | unsloth-llama-3-2-1b-instruct-gguf | reported | 699.9 tok/s | n=1 rtx-3090-24gb | liquidai-lfm2-5-1-2b-instruct-gguf | measured | 682.2 tok/s | n=4 rtx-pro-6000-blackwell-96gb | google-gemma-3-1b-it | reported | 664.3 tok/s | n=1 rtx-5090-32gb | nvidia-nvidia-nemotron-3-nano-30b-a3b-nvfp4 | measured | 582.5 tok/s | n=3 rtx-3090-24gb | liquidai-lfm2-5-1-2b-instruct-gguf | measured | 564.4 tok/s | n=3 rtx-5090-32gb | nvidia-nvidia-nemotron-3-5-lightning-30b-a3b-nvfp4 | reported | 564.1 tok/s | n=2 rtx-pro-6000-blackwell-96gb | google-diffusiongemma-26b-a4b-it | reported | 528.7 tok/s | n=1 rtx-pro-6000-blackwell-96gb | mmangkad-qwen3-6-35b-a3b-nvfp4 | reported | 506.2 tok/s | n=1 rx-6750-xt-12gb | liquidai-lfm2-5-1-2b-instruct | reported | 500 tok/s | n=1 rtx-pro-6000-blackwell-96gb | nvidia-nvidia-nemotron-3-5-lightning-30b-a3b-nvfp4 | measured | 494.7 tok/s | n=4 rtx-pro-6000-blackwell-96gb | meta-llama-llama-3-2-3b-instruct | reported | 489.2 tok/s | n=1 rtx-5080-16gb | meta-llama-llama-3-2-1b-instruct | reported | 448.1 tok/s | n=1 rtx-pro-6000-blackwell-96gb-x2 | zai-org-glm-5-3-flash | measured | 443.1 tok/s | n=9 tesla-v100-32gb-x4 | quasar-qat-qwen3-8-27b-quasar-nvfp4 | reported | 427.3 tok/s | n=1 rtx-5070-ti-16gb | liquidai-lfm2-5-8b-a1b | reported | 402.3 tok/s | n=1 rtx-5090-32gb | unsloth-gemma-4-26b-a4b-it-gguf | reported | 395 tok/s | n=2 rtx-5090-32gb | liquidai-lfm2-24b-a2b-gguf | reported | 393.2 tok/s | n=1 tesla-v100-16gb-x4 | qwen-qwen3-8-27b | reported | 391 tok/s | n=1 h100-80gb | nvidia-nvidia-nemotron-3-5-lightning-30b-a3b-bf16 | reported | 381.2 tok/s | n=2 radeon-ai-pro-r9700-32gb | qwen-qwen3-5-9b | reported | 371.8 tok/s | n=1 rtx-pro-6000-blackwell-96gb | inclusionai-ling-3-0-tiny | reported | 369.1 tok/s | n=1 rtx-5090-32gb | cyankiwi-gemma-4-26b-a4b-it-awq-4bit | measured | 369 tok/s | n=4 rtx-3090-24gb | baidu-unlimited-ocr | reported | 365.5 tok/s | n=1 rtx-3090-24gb | ggml-org-nvidia-nemotron-3-5-lightning-30b-a3b-gguf | reported | 353.7 tok/s | n=1 rtx-5090-32gb-x2 | redhatai-qwen3-6-35b-a3b-nvfp4 | reported | 340.8 tok/s | n=1 h200-sxm-141gb | nvidia-nvidia-nemotron-3-5-lightning-30b-a3b-bf16 | reported | 337.6 tok/s | n=1 h100-80gb | qwen-qwen3-6-35b-a3b-fp8 | reported | 337.1 tok/s | n=2 rx-7900-xtx-24gb | qwen-qwen3-5-9b | measured | 337 tok/s | n=7 rtx-pro-6000-blackwell-96gb | nvidia-qwen3-6-35b-a3b-nvfp4 | measured | 330.3 tok/s | n=3 rtx-3080-12gb | liquidai-lfm2-5-8b-a1b-gguf | reported | 328.4 tok/s | n=1 rtx-pro-6000-blackwell-96gb-x4 | nvidia-qwen3-6-35b-a3b-nvfp4 | reported | 325.9 tok/s | n=1 rtx-a5000-24gb | ggml-org-gemma-3-1b-it-gguf | reported | 325.2 tok/s | n=2 rtx-5090-32gb | unsloth-qwen3-6-35b-a3b-gguf | reported | 324.4 tok/s | n=2 rtx-a5000-24gb | qwen-qwen2-5-1-5b-instruct-gguf | reported | 320.6 tok/s | n=2 rtx-pro-6000-blackwell-max-q-workstation-edition-96gb-x4 | dealignai-deepseek-v4-1-flash-uncensored-fp8 | reported | 316.6 tok/s | n=1 rtx-5090-32gb | lmstudio-community-qwen3-30b-a3b-instruct-2507-gguf | reported | 312.9 tok/s | n=1 rtx-3060-12gb | qwen-qwen3-0-6b | reported | 310.4 tok/s | n=1 rtx-pro-6000-blackwell-96gb-x4 | fraserprice-deepseek-v4-flash-abliterated-dspark | reported | 309 tok/s | n=2 rtx-pro-6000-blackwell-96gb-x4 | fraserprice-deepseek-v4-flash-dspark | measured | 308.2 tok/s | n=3 rtx-5070-ti-16gb | liquidai-lfm2-5-8b-a1b | reported | 307.4 tok/s | n=2 rtx-5090-32gb | openai-gpt-oss-20b | reported | 307.2 tok/s | n=1 rtx-3090-24gb | liquidai-lfm2-5-2-6b-gguf | reported | 305.6 tok/s | n=1 rtx-pro-6000-blackwell-max-q-workstation-edition-96gb-x4 | deepseek-ai-deepseek-v4-1-flash | measured | 303.7 tok/s | n=6 rtx-5090-32gb | nvidia-nvidia-nemotron-3-nano-30b-a3b-bf16 | reported | 299.4 tok/s | n=2 rtx-pro-6000-blackwell-96gb-x4 | deepseek-ai-deepseek-v4-flash-0731 | measured | 296.7 tok/s | n=5 rtx-3090-24gb | poolside-laguna-xs-2-1 | reported | 296 tok/s | n=1 rtx-pro-6000-blackwell-96gb | radixark-qwen3-8-27b-nvfp4-bf16-lmhead | reported | 296 tok/s | n=1 h100-nvl-94gb-x2 | qwen-qwen3-8-27b | reported | 293.3 tok/s | n=1 rtx-5090-32gb | aidxteam-qwen3-coder-30b-a3b-instruct-awq | reported | 287.7 tok/s | n=2 rtx-5090-32gb | lmstudio-community-nvidia-nemotron-3-nano-30b-a3b-gguf | reported | 286.8 tok/s | n=1 radeon-ai-pro-r9700-34gb | qwen-qwen3-5-27b | reported | 286.6 tok/s | n=1 radeon-ai-pro-r9700-32gb | qwen-qwen3-8-27b | measured | 285.5 tok/s | n=7 rtx-5090-32gb | google-gemma-4-26b-a4b-it | measured | 282 tok/s | n=7 rtx-a5000-24gb | ggml-org-gemma-3-1b-it-gguf | reported | 281.9 tok/s | n=2 Capture or correct a number: /console (signed, Ed25519).