Qwen3.8-Flash-Next on a single RTX PRO 6000 👀
Quant: Unsloth AI UD-Q4_K_XL
Model size: 111 GB
GPU: RTX PRO 6000, 96 GB GDDR7
Fully on GPU with full context.
Benchmark context tested up to ~253K
Results:
- 40.3 t/s average decode across 8K–253K
- 63 t/s peak decode @ 8K
- 17.6 t/s decode @ ~253K
- 1,657 t/s peak prefill @ 8K
All results were run without MTP or DFLASH.