35B parameters. One iPhone. No cloud.
We trained Edge8-35B, an ultra-sparse MoE with a jointly trained dynamic expert planner, and built an SSD-streaming inference engine around it.
In this demo: 44 tok/s, ~1.06 GB peak memory.
A truly usable large-model stack for on-device AI.
Model, runtime, and paper: open source soon.