bestmodel.run / pool — agent view

Honesty ladder: measured > reported > extrapolated > formula > no data yet.
Top 60 cells, default sort: fastest decode. Columns: rig | model | basis | value | n.
No hardware/category filter. Default ranking excludes <1B and toy/tinystories.
Full machine surface: /llms.txt · REST API: api.bestmodel.run

  rig                               | model                                  | basis    | value          | n
  cpu-amd-ryzen-7-9800x3d            | delphi-suite-stories-llama2-50k        | reported | 36,715.7 tok/s | n=1
  cpu-amd-ryzen-7-9800x3d            | ggml-org-models-moved                  | reported | 16,740.7 tok/s | n=1
  rtx-5090-32gb                      | radixark-qwen3-8-27b-nvfp4             | reported | 4,662.6 tok/s  | n=2
  rtx-5090-32gb                      | ggml-org-models-moved                  | reported | 4,360.9 tok/s  | n=1
  h100-80gb                          | redhatai-diffusiongemma-26b-a4b-it-fp8-dynamic | reported | 1,369.3 tok/s  | n=1
  rtx-pro-6000-blackwell-96gb        | qwen-qwen3-0-6b-gguf                   | reported | 956.4 tok/s    | n=1
  rtx-pro-6000-blackwell-96gb        | unsloth-llama-3-2-1b-instruct-gguf     | reported | 699.9 tok/s    | n=1
  rtx-3090-24gb                      | liquidai-lfm2-5-1-2b-instruct-gguf     | measured | 682.2 tok/s    | n=4
  rtx-pro-6000-blackwell-96gb        | google-gemma-3-1b-it                   | reported | 664.3 tok/s    | n=1
  rtx-5090-32gb                      | nvidia-nvidia-nemotron-3-nano-30b-a3b-nvfp4 | measured | 582.5 tok/s    | n=3
  rtx-3090-24gb                      | liquidai-lfm2-5-1-2b-instruct-gguf     | measured | 564.4 tok/s    | n=3
  rtx-5090-32gb                      | nvidia-nvidia-nemotron-3-5-lightning-30b-a3b-nvfp4 | reported | 564.1 tok/s    | n=2
  rtx-pro-6000-blackwell-96gb        | google-diffusiongemma-26b-a4b-it       | reported | 528.7 tok/s    | n=1
  rtx-pro-6000-blackwell-96gb        | mmangkad-qwen3-6-35b-a3b-nvfp4         | reported | 506.2 tok/s    | n=1
  rx-6750-xt-12gb                    | liquidai-lfm2-5-1-2b-instruct          | reported | 500 tok/s      | n=1
  rtx-pro-6000-blackwell-96gb        | nvidia-nvidia-nemotron-3-5-lightning-30b-a3b-nvfp4 | measured | 494.7 tok/s    | n=4
  rtx-pro-6000-blackwell-96gb        | meta-llama-llama-3-2-3b-instruct       | reported | 489.2 tok/s    | n=1
  rtx-5080-16gb                      | meta-llama-llama-3-2-1b-instruct       | reported | 448.1 tok/s    | n=1
  rtx-pro-6000-blackwell-96gb-x2     | zai-org-glm-5-3-flash                  | measured | 443.1 tok/s    | n=9
  tesla-v100-32gb-x4                 | quasar-qat-qwen3-8-27b-quasar-nvfp4    | reported | 427.3 tok/s    | n=1
  rtx-5070-ti-16gb                   | liquidai-lfm2-5-8b-a1b                 | reported | 402.3 tok/s    | n=1
  rtx-5090-32gb                      | unsloth-gemma-4-26b-a4b-it-gguf        | reported | 395 tok/s      | n=2
  rtx-5090-32gb                      | liquidai-lfm2-24b-a2b-gguf             | reported | 393.2 tok/s    | n=1
  tesla-v100-16gb-x4                 | qwen-qwen3-8-27b                       | reported | 391 tok/s      | n=1
  h100-80gb                          | nvidia-nvidia-nemotron-3-5-lightning-30b-a3b-bf16 | reported | 381.2 tok/s    | n=2
  radeon-ai-pro-r9700-32gb           | qwen-qwen3-5-9b                        | reported | 371.8 tok/s    | n=1
  rtx-pro-6000-blackwell-96gb        | inclusionai-ling-3-0-tiny              | reported | 369.1 tok/s    | n=1
  rtx-5090-32gb                      | cyankiwi-gemma-4-26b-a4b-it-awq-4bit   | measured | 369 tok/s      | n=4
  rtx-3090-24gb                      | baidu-unlimited-ocr                    | reported | 365.5 tok/s    | n=1
  rtx-3090-24gb                      | ggml-org-nvidia-nemotron-3-5-lightning-30b-a3b-gguf | reported | 353.7 tok/s    | n=1
  rtx-5090-32gb-x2                   | redhatai-qwen3-6-35b-a3b-nvfp4         | reported | 340.8 tok/s    | n=1
  h200-sxm-141gb                     | nvidia-nvidia-nemotron-3-5-lightning-30b-a3b-bf16 | reported | 337.6 tok/s    | n=1
  h100-80gb                          | qwen-qwen3-6-35b-a3b-fp8               | reported | 337.1 tok/s    | n=2
  rx-7900-xtx-24gb                   | qwen-qwen3-5-9b                        | measured | 337 tok/s      | n=7
  rtx-pro-6000-blackwell-96gb        | nvidia-qwen3-6-35b-a3b-nvfp4           | measured | 330.3 tok/s    | n=3
  rtx-3080-12gb                      | liquidai-lfm2-5-8b-a1b-gguf            | reported | 328.4 tok/s    | n=1
  rtx-pro-6000-blackwell-96gb-x4     | nvidia-qwen3-6-35b-a3b-nvfp4           | reported | 325.9 tok/s    | n=1
  rtx-a5000-24gb                     | ggml-org-gemma-3-1b-it-gguf            | reported | 325.2 tok/s    | n=2
  rtx-5090-32gb                      | unsloth-qwen3-6-35b-a3b-gguf           | reported | 324.4 tok/s    | n=2
  rtx-a5000-24gb                     | qwen-qwen2-5-1-5b-instruct-gguf        | reported | 320.6 tok/s    | n=2
  rtx-pro-6000-blackwell-max-q-workstation-edition-96gb-x4 | dealignai-deepseek-v4-1-flash-uncensored-fp8 | reported | 316.6 tok/s    | n=1
  rtx-5090-32gb                      | lmstudio-community-qwen3-30b-a3b-instruct-2507-gguf | reported | 312.9 tok/s    | n=1
  rtx-3060-12gb                      | qwen-qwen3-0-6b                        | reported | 310.4 tok/s    | n=1
  rtx-pro-6000-blackwell-96gb-x4     | fraserprice-deepseek-v4-flash-abliterated-dspark | reported | 309 tok/s      | n=2
  rtx-pro-6000-blackwell-96gb-x4     | fraserprice-deepseek-v4-flash-dspark   | measured | 308.2 tok/s    | n=3
  rtx-5070-ti-16gb                   | liquidai-lfm2-5-8b-a1b                 | reported | 307.4 tok/s    | n=2
  rtx-5090-32gb                      | openai-gpt-oss-20b                     | reported | 307.2 tok/s    | n=1
  rtx-3090-24gb                      | liquidai-lfm2-5-2-6b-gguf              | reported | 305.6 tok/s    | n=1
  rtx-pro-6000-blackwell-max-q-workstation-edition-96gb-x4 | deepseek-ai-deepseek-v4-1-flash        | measured | 303.7 tok/s    | n=6
  rtx-5090-32gb                      | nvidia-nvidia-nemotron-3-nano-30b-a3b-bf16 | reported | 299.4 tok/s    | n=2
  rtx-pro-6000-blackwell-96gb-x4     | deepseek-ai-deepseek-v4-flash-0731     | measured | 296.7 tok/s    | n=5
  rtx-3090-24gb                      | poolside-laguna-xs-2-1                 | reported | 296 tok/s      | n=1
  rtx-pro-6000-blackwell-96gb        | radixark-qwen3-8-27b-nvfp4-bf16-lmhead | reported | 296 tok/s      | n=1
  h100-nvl-94gb-x2                   | qwen-qwen3-8-27b                       | reported | 293.3 tok/s    | n=1
  rtx-5090-32gb                      | aidxteam-qwen3-coder-30b-a3b-instruct-awq | reported | 287.7 tok/s    | n=2
  rtx-5090-32gb                      | lmstudio-community-nvidia-nemotron-3-nano-30b-a3b-gguf | reported | 286.8 tok/s    | n=1
  radeon-ai-pro-r9700-34gb           | qwen-qwen3-5-27b                       | reported | 286.6 tok/s    | n=1
  radeon-ai-pro-r9700-32gb           | qwen-qwen3-8-27b                       | measured | 285.5 tok/s    | n=7
  rtx-5090-32gb                      | google-gemma-4-26b-a4b-it              | measured | 282 tok/s      | n=7
  rtx-a5000-24gb                     | ggml-org-gemma-3-1b-it-gguf            | reported | 281.9 tok/s    | n=2

Capture or correct a number: /console (signed, Ed25519).