๊ฐ€์ž… ํ›„ ์ดˆ๋Œ€ ๋งํฌ๋ฅผ ๊ณต์œ ํ•˜๋ฉด ๋™์˜์ƒ ์žฌ์ƒ ๋ฐ ์ดˆ๋Œ€ ๋ณด์ƒ์„ ๋ฐ›์„ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

SGLang
@sgl_project
Run LLMs fast at any scale ๐Ÿ”— Join our community For AI tech blogs & deep-dives ๐Ÿ‘‰ @lmsysorg
๊ฐ€์ž… May 2025
53 ํŒ”๋กœ์ž‰ ์ค‘    9.5K ํŒฌ
SGLang v0.5.20 landed! Welcome @intel XPU to join standard SGLang releases ๐ŸŽ‰ Some of our favorite updates: - RL sampling masks make rollouts more reliable, with up to 52% faster decode - Unified Radix Tree adds SWA branching-point caching: ~20pt higher cache hit rate, ~1/3 lower TTFT - DSpark now supports PD + DCP for long-context serving - SGLang Simulator brings scheduler & cache experiments to CPU - ROCm model loading is up to 12.5ร— faster - SGLang-Diffusion gets up to ~38% lower E2E latency New models include GLM-5.3-Flash, Qwen3.8-Flash-Next, K2 Horizon, Hy4-Preview, FastH3, VDN-H3, and more. Full release notes๐Ÿ‘‡
๋” ๋ณด๊ธฐ