Opus-level intelligence running fully local at home on dual RTX 4090s.
Qwen3.8-27B-GGUF:
- 80 tok/s
- Full 262k context
- MTP on
- Only 34 GB of 48 GB VRAM used
- Outperforms Claude Opus max on SWE-Pro: 61.7 vs Claude Opus 4.6’s 53.4 GPQA: 89.2 vs 91.3
No need API bills, Or no rate limits.
Local frontier-class models are no longer theoretical.