看到这个工具,我突然觉得我应该给我的一些工具加上一些好听的BGM了
Google Magenta 开源的 Magenta RealTime 2,是一个实时音乐生成模型,带 open-weights 模型、Python 推理库、C++ 推理引擎,也能做 DAW 插件和 macOS 应用。
如果你做音乐工具、AI 创作软件、实时音频插件,可以看下这个项目。它的方向是让 AI 融入创作过程
Star:1.5k+
GitHub:
显示更多
如果有一个会自己分工接任务,自己相互rewiew的工具就好了
哎,还真有! 看板式协作项目 agent-teams-ai
你只管下高层命令,agent 会自己接任务、互发消息和互相 review,重点是可以把 Codex、Claude、OpenCode 聚合起来
GitHub 现在约 1.2k stars
工具地址:
显示更多
我让 AI 找一个值得做的产品,它盯上了律师账单里的 6 分钟
最近用 AI 做产品调研时,我越来越明显地感觉到一个问题:
信息并不缺,缺的是判断。
问“下一个 AI 机会在哪里”,很容易得到一长串听起来都对的答案:AI 法务、AI 财务、AI 营销、AI 编程……
但真正准备行动时,还是不知道哪个需求真实存在,哪个只是被反复包装的趋势。
所以这次我换了一种问法。
我让 AI 从用户抱怨、产品评论、GitHub Issues、行业报告和现有产品中寻找信号。每提出一个方向,还必须主动寻找反证:竞争太强、付费意愿不足,或者已经有成熟工具解决,就淘汰。
它一共比较了12个方向。
广告上线前 QA 的损失很直接,但链接和落地页检查已经有成熟工具;AI 代码审计的痛点很强,但市场拥挤,而且人仍然可能需要逐行复核;财务对账高频,却绕不开数据权限和“到底以哪个系统为准”的问题。
最后留下的,是一个我原本完全没有想到的场景:
律师的工时记录与账单叙事(比如美国的法律服务)。
许多按小时计费的律师以0.1小时,也就是6分钟为单位记账。会议、邮件、电话和文档修改结束后,他们还要回忆自己做过什么、匹配案件、补记时间,再把记录改成客户能够接受的账单描述。
AI 在这里不需要替律师做法律判断。
它只需要把日历、邮件和文档活动整理成带来源的候选记录,再由律师确认、修改或删除。
它真正解决的也不是“写得更快”,而是减少漏记、降低审核返工,并让每条收费描述都有依据。
这次测试用的是 Apodex。它里面的 Deep Discover 最让我意外的地方,不是能生成多少想法,而是会主动反驳自己的想法,把一个宽泛的问题逐步收敛成可以验证的假设。
它也没有把这个结果包装成确定的创业机会,而是给出了一套30天验证方案:访谈律师和 billing manager,用脱敏样本测试草稿编辑时间,再验证是否真的有人愿意进入付费试点。
如果律师不愿开放数据、修改草稿和自己重写一样费时,或者现有软件已经够用,那这个方向就应该停止。
我觉得这才是这次测试最有价值的地方。
它没有替我宣布一个答案,而是帮我排除了一批看起来正确的答案,最后告诉我:
下一步最值得验证什么,以及出现什么结果时应该放弃。
有时候,真正有用的 AI 不是让人更快得到结论,而是让一个模糊的问题,终于有了可以行动的下一步。
Open Source Harness:
Open Weights:
Website:
显示更多
这周真的离谱,感觉各家商量好了同一时间放炸弹。
三个核心线索,我自己觉得比较有意思:一个是新模型对极高效率和成本控制的内卷式追求,另一个是海外对开源 AI 的态度,还有模型绕过护栏后去破防 security 体系。
① 这周最值得关注的其实是两件事撞一起了:DeepSeek 和 OpenAI 同时在 coding agent 的价格线上动手。
DeepSeek 放了 V4 Flash 的正式版,284B MoE、激活13B,性能已经超过了之前的V4 Pro-Preview,也持平/超过了 GLM 5.2。价格 $0.14 / $0.28 per million tokens(缓存命中仅0.02人民币per million tokens)。
然后OpenAI 那边,GPT-5.6 Luna 直接砍了 80%,现在 $0.20 / $1.20。Terra 也降了 20%。
两个动作叠在一起看,信号很明确:coding agent 的价格战正式开打了。之前 $2-3 的 input 价格是常态,现在直接被砸到 $0.14-0.20 的区间。
② Dario 发了个声明澄清 Anthropic 从来没主张 ban open-weights,说"没有危险能力的 open-weights 是 public good"。这个背景是 Anthropic 没签那个支持开源 AI 的联合声明,被圈内骂了。Dario 这波算是找补,但措辞挺小心的,一边说不支持 ban,一边还是强调 targeted export controls 和限制大规模蒸馏。
还有一封 pacingthefrontier的公开信,几个主要 AI 实验室负责人签名,说 recursive self-improvement 可能在加速 AI 进展,要求政府支持国际 effort 来“deliberately pace the frontier”。翻译成人话就是:我们觉得自己可能快控制不住了,政府快来管管。
③ 字节 SeeDance 2.5,单段视频市场提高到30 秒 720p 视频,支持 30 张图 + 10 段视频 + 10 段音频做 reference。真的是生产力级别的质变。
④ Google DeepMind 发了 Gemini Robotics 2,三个模型:ER 2 做高层规划,Robotics 2 做 VLA 执行,On-Device 2 做本地部署。
Hassabis 之前说机器人距离突破还需 18-24 个月,这个判断我现在还是认同的。硬件、数据和算法都还是瓶颈。
⑤几个快速带过的:
Microsoft 出了 MAI-Cyber-1-Flash,专门做软件漏洞挖掘的模型。网络安全垂直模型这个方向,感觉接下来会越来越多。
Thinking Machines 放了 Inkling-Small,276B MoE / 12B active,主打 audio intelligence,是 Inkling 的四分之一大小。
Nvidia 投了 Ilya 的 SSI,50亿美金,给了 Vera Rubin 算力,据说要Scale提升一个数量级。
这周信息量是真的大。我的感受是,coding agent 的价格战已经开始实质性改变 API 市场的定价结构了,这是接下来几个月最值得关注的变量。
大家这周有什么特别关注的,可以聊聊。
显示更多
普通用户如何不被各大 AI 厂商的宣传榜单带偏?推荐你把 Artificial Analysis 加入收藏夹。
每当有新模型发布,各大厂商总会宣称自己在某项基准测试中“全方位碾压”对手。但实际上,没有一个模型能在所有场景下完美胜出。Artificial Analysis 就是一个专注于提供客观、多维度数据的 AI 模型评测与对比平台,帮助你拨开营销迷雾。
它核心的评测逻辑,是把复杂的模型对比拆解为三个最贴近实际使用感受的维度:
1️⃣ 智能度(Intelligence): 聚合了 MMLU、MATH 等权威学术基准测试,以及基于人类真实盲测偏好的 Chatbot Arena 胜率,客观反映模型处理复杂逻辑、代码和文本的综合能力。
2️⃣ 速度(Speed): 包含首字延迟(Time to First Token)和生成速度(Tokens per Second)。对于内容编辑或需要实时对话的用户来说,速度直接决定了使用体验。
3️⃣ 成本(Cost): 明确标出每百万 Token 的输入和输出价格。对于开发者和需要批量处理任务的团队,这是控制预算的关键指标。
除了这三个核心维度,网站还支持按“开放权重(Open Weights)”进行筛选,并针对图像生成、视频生成和语音模型开辟了专门的评测板块。最方便的是,平台更新极快,最近几天新发布的模型几乎都能在第一时间查到数据。
该网站全英文,包含大量模型技术说明和数据图表,配合沉浸式翻译即可无障碍阅读。但请记住,平台的第三方数据是一个高效的筛选入口,而非绝对真理。
模型在特定提示词(Prompt)或私有数据集上的表现各不相同,在最终决定前,依然建议使用你自己的真实业务样例进行实际验证。
🔗:
显示更多