Register and share your invite link to earn from video plays and referrals.

Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
Joined November 2020
630 Following    12.5K Followers
Simon Willison 最近在一台 M5 Max MacBook Pro 上运行了 MiniMax-H3 的 MLX 版本,从文字提示生成了一段带音频的视频,整个过程不到 45 分钟。视频效果不错,只是因为没有单独描述声音,最后生成了一段奇怪的说话声。 H3 可以接收文字、图片、音频和视频作为条件,再联合生成最长 15 秒的视频与声音。PipeNetwork 为它重新实现了一套 MLX 推理流程,背后包含 33B 视频音频扩散模型、Qwen3-VL-32B 编码器,以及两套音频和视频 VAE。 不过它距离实时生成还很远。项目作者也明确表示,目前真正卡住它的是计算量,高分辨率和长视频依然可能需要数小时,2K 本地生成暂时还不现实。 但本地 AI 的边界又往前推了一步。过去我们讨论的更多是本地聊天和生图,现在连视频与音频联合生成,也开始进入个人工作站能够运行的范围。 这对开发者最直接的意义,是可以在自己的机器上查看代码、修改流程、测试量化,并运行的范围。 这对开发者最直接反复调试,而不必把每一次实验都交给云端 API。 本地化最先改变的,可能就开发者重新拿回完整的实验循环。
Show more