bestmodel.run / model — Qwen3.8-27B-GGUF (agent view)

category chat · unsloth/Qwen3.8-27B-GGUF · 519 runs in the model record
answer: 44 tok/s (model median)

Honesty ladder: measured > reported > extrapolated > formula > no data yet.
Empty fields stay empty — never filled with an estimate.

  rig | quant | median result | basis | ttft | peak vram | max context
  A100 40GB                          | 4-bit | 41.1 tok/s     | reported | ttft 10,667ms | vram 19 GB | ctx 65,536
  A100 40GB                          | 8-bit | 33.7 tok/s     | reported | ttft 10,194ms | vram 30 GB | ctx 65,536
  Arc Pro B60 24GB                   | 4-bit | 21.2 tok/s     | reported | ttft 147ms | vram - GB | ctx 2,048
  Arc Pro B60 24GB                   | 6-bit | 16 tok/s       | reported | ttft 796ms | vram - GB | ctx 2,048
  Arc Pro B70 32GB                   | 4-bit | 31.2 tok/s     | reported | ttft 2,995ms | vram - GB | ctx 2,048
  Arc Pro B70 32GB                   | 6-bit | 24.1 tok/s     | reported | ttft 354ms | vram - GB | ctx 2,048
  Arc Pro B70 32GB                   | 8-bit | 16.1 tok/s     | reported | ttft 572ms | vram - GB | ctx 2,048
  B200 192GB                         | 4-bit | 86.8 tok/s     | reported | ttft 632ms | vram 17.3 GB | ctx 32,768
  CMP 170HX 64GB                     | 4-bit | 47 tok/s       | measured | ttft 29,673ms | vram - GB | ctx 132,352
  CMP 170HX 64GB                     | 8-bit | 49.7 tok/s     | measured | ttft 27,843ms | vram - GB | ctx 132,352
  CMP 170HX 64GB                     | 16-bit | 23.2 tok/s     | measured | ttft 13,004ms | vram - GB | ctx 67,549
  M4 Pro 24GB                        | 4-bit | 47.2 tok/s     | reported | ttft 373ms | vram - GB | ctx 2,048
  M5 Max 128GB                       | 4-bit | 24.3 tok/s     | reported | ttft 85ms | vram - GB | ctx 2,048
  Multi-GPU 56GB ×2                  | 8-bit | 36.7 tok/s     | reported | ttft 3,082ms | vram 45.5 GB | ctx 2,048
  Radeon AI Pro R9700 32GB           | 1-bit | 41.2 tok/s     | measured | ttft 455ms | vram 7.3 GB | ctx 32,768
  Radeon AI Pro R9700 32GB           | 4-bit | 39.5 tok/s     | measured | ttft 615ms | vram 21.6 GB | ctx 262,144
  Radeon AI Pro R9700 32GB           | 6-bit | 21.6 tok/s     | measured | ttft 641ms | vram 25.6 GB | ctx 32,768
  RTX 3060 12GB                      | 2-bit | 18.3 tok/s     | measured | ttft 150ms | vram - GB | ctx 32,768
  RTX 3060 12GB ×2                   | 3-bit | 15.5 tok/s     | reported | ttft -ms | vram - GB | ctx 32,768
  RTX 3060 12GB ×2                   | 4-bit | 18.7 tok/s     | measured | ttft 1,506ms | vram 19.4 GB | ctx 131,072
  RTX 3080 12GB                      | 2-bit | 44.4 tok/s     | measured | ttft 2,526ms | vram 9.7 GB | ctx 65,536
  RTX 3090 24GB                      | 4-bit | 72.6 tok/s     | measured | ttft 647ms | vram 18.4 GB | ctx 32,768
  RTX 3090 24GB                      | 6-bit | 51.5 tok/s     | reported | ttft 206ms | vram - GB | ctx 2,048
  RTX 3090 24GB ×2                   | 4-bit | 73 tok/s       | reported | ttft 1,175ms | vram - GB | ctx 2,048
  RTX 3090 24GB ×2                   | 8-bit | 51.6 tok/s     | measured | ttft 230ms | vram - GB | ctx 262,144
  RTX 4060 Ti 16GB ×2                | 4-bit | 53.6 tok/s     | reported | ttft -ms | vram - GB | ctx 2,048
  RTX 4070 12GB                      | 2-bit | 65.7 tok/s     | reported | ttft 227ms | vram 9.3 GB | ctx 2,048
  RTX 5070 12GB                      | 2-bit | 46.3 tok/s     | measured | ttft 572ms | vram 9.8 GB | ctx 32,768
  RTX 5090 32GB                      | 2-bit | 88.1 tok/s     | reported | ttft 82ms | vram - GB | ctx 2,048
  RTX 5090 32GB                      | 3-bit | 79.4 tok/s     | measured | ttft 382ms | vram 17.3 GB | ctx 131,072
  RTX 5090 32GB                      | 4-bit | 101.6 tok/s    | measured | ttft 130ms | vram 21.3 GB | ctx 262,144
  RTX 5090 32GB                      | 5-bit | 60.2 tok/s     | measured | ttft 424ms | vram 23.2 GB | ctx 131,072
  RTX 5090 32GB                      | 6-bit | 79.3 tok/s     | measured | ttft 423ms | vram 30.3 GB | ctx 262,144
  RTX PRO 6000 Blackwell 96GB        | 2-bit | 100.7 tok/s    | measured | ttft -ms | vram - GB | ctx 131,072
  RTX PRO 6000 Blackwell 96GB        | 3-bit | 88.9 tok/s     | measured | ttft -ms | vram - GB | ctx 131,072
  RTX PRO 6000 Blackwell 96GB        | 4-bit | 79.3 tok/s     | measured | ttft -ms | vram - GB | ctx 131,072
  RTX PRO 6000 Blackwell 96GB        | 5-bit | 67.8 tok/s     | measured | ttft -ms | vram - GB | ctx 131,072
  RTX PRO 6000 Blackwell 96GB        | 6-bit | 57.5 tok/s     | reported | ttft -ms | vram - GB | ctx 131,072
  RTX PRO 6000 Blackwell 96GB        | 8-bit | 50.2 tok/s     | measured | ttft 42,652ms | vram - GB | ctx 131,072
  RTX PRO 6000 Blackwell 96GB        | 16-bit | 61 tok/s       | measured | ttft 40,786ms | vram - GB | ctx 131,072
  RX 7800 XT 16GB                    | 4-bit | 42 tok/s       | reported | ttft -ms | vram - GB | ctx 121,000
  RX 7900 XTX 24GB                   | 4-bit | 42.3 tok/s     | measured | ttft 298ms | vram 22.9 GB | ctx 180,224
  Ryzen AI Max 395 128GB             | 4-bit | 26.7 tok/s     | measured | ttft 603ms | vram 23.9 GB | ctx 131,072
  Ryzen AI Max 395 128GB             | 5-bit | 13.4 tok/s     | reported | ttft 642ms | vram 23.1 GB | ctx 4,096
  Ryzen AI Max 395 128GB             | 6-bit | 13.3 tok/s     | reported | ttft 730ms | vram 25.7 GB | ctx 4,096
  Ryzen AI Max 395 128GB             | 8-bit | 11.2 tok/s     | reported | ttft 746ms | vram 31.1 GB | ctx 4,096
  Ryzen AI Max 395 64GB              | 4-bit | 24.1 tok/s     | measured | ttft 4,332ms | vram 18 GB | ctx 8,192