Enjoy the DwarfStar glm-5.3-flash branch with GLM 5.3 Flash Q2 and Q4 support: single MacBook 128GB or DGX Spark inference, two MacBook RDMA 128GB each Q4 inference in tensor parallel fashion at 37 t/s single generation. ~500 t/s prefill for now, can be higher. ROCm soon.