TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
Joined November 2020
630
Following
12.5K
Followers
Xudong Han
@Xudong07452910
2026.08.06 04:20
Simon Willison 最近在一台 M5 Max MacBook Pro 上运行了 MiniMax-H3 的 MLX 版本,从文字提示生成了一段带音频的视频,整个过程不到 45 分钟。视频效果不错,只是因为没有单独描述声音,最后生成了一段奇怪的说话声。 H3 可以接收文字、图片、音频和视频作为条件,再联合生成最长 15 秒的视频与声音。PipeNetwork 为它重新实现了一套 MLX 推理流程,背后包含 33B 视频音频扩散模型、Qwen3-VL-32B 编码器,以及两套音频和视频 VAE。 不过它距离实时生成还很远。项目作者也明确表示,目前真正卡住它的是计算量,高分辨率和长视频依然可能需要数小时,2K 本地生成暂时还不现实。 但本地 AI 的边界又往前推了一步。过去我们讨论的更多是本地聊天和生图,现在连视频与音频联合生成,也开始进入个人工作站能够运行的范围。 这对开发者最直接的意义,是可以在自己的机器上查看代码、修改流程、测试量化,并运行的范围。 这对开发者最直接反复调试,而不必把每一次实验都交给云端 API。 本地化最先改变的,可能就开发者重新拿回完整的实验循环。
Show more
0
0
0
1
0
Forward to community
Most Popular Users
Tibo
@thsottiaux
777.9K Followers
Serenity
@aleabitoreddit
1.1M Followers
Donald J. Trump
@realDonaldTrump
111.9M Followers
Elon Musk
@elonmusk
241.7M Followers
Sam Altman
@sama
6.3M Followers
New York Post
@nypost
4.2M Followers
OpenAI
@OpenAI
5.4M Followers
zerohedge
@zerohedge
3.4M Followers
Wall St Engine
@wallstengine
199K Followers
SpaceXAI
@SpaceXAI
2.1M Followers
First Squawk
@FirstSquawk
569.4K Followers
Anthropic
@AnthropicAI
1.8M Followers
Polymarket
@Polymarket
2M Followers
Ansem 🐂🀄️
@blknoiz06
1.4M Followers
Kalshi
@Kalshi
472.8K Followers