๊ฐ€์ž… ํ›„ ์ดˆ๋Œ€ ๋งํฌ๋ฅผ ๊ณต์œ ํ•˜๋ฉด ๋™์˜์ƒ ์žฌ์ƒ ๋ฐ ์ดˆ๋Œ€ ๋ณด์ƒ์„ ๋ฐ›์„ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

Paolo Rosson
@redp314
Head of Applied AI at Dext. Building | Quantum physics PhD from Oxford | Former Italian blindfolded Rubikโ€™s cube record holder
๊ฐ€์ž… May 2015
2.3K ํŒ”๋กœ์ž‰ ์ค‘    1.7K ํŒฌ
Got Meta's new Muse Glimmer 30B running on my MacBook (M3 Max, 96GG) and tested the serving options available so far. Fastest right now: Ollama's MLX engine (DFlash included) at ~29 tok/s. Tuned llama.cpp: ~21. Raw mlx-vlm: ~10, not optimized yet. Numbers below if you're setting it up ๐Ÿ‘‡
๋” ๋ณด๊ธฐ