๊ฐ€์ž… ํ›„ ์ดˆ๋Œ€ ๋งํฌ๋ฅผ ๊ณต์œ ํ•˜๋ฉด ๋™์˜์ƒ ์žฌ์ƒ ๋ฐ ์ดˆ๋Œ€ ๋ณด์ƒ์„ ๋ฐ›์„ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

Ali Hatamizadeh
@ahatamiz1
LLM Tech Lead & Staff Research Scientist @NVIDIA Co-creator of Gated DeltaNet & Gated DeltaNet-2
๊ฐ€์ž… June 2015
180 ํŒ”๋กœ์ž‰ ์ค‘    4.1K ํŒฌ
GDN-2 scales nicely with Muon ๐Ÿš€ We trained hybrid MoE models at three scales (2B-7B) with Muon. GDN-2 matches Mamba2's loss with ~10% less training compute!