蚂蚁百灵团队刚发了个新模型 Ling-3.0-flash:124B 的 MoE,每个 token 只激活 5.1B,256K 上下文,主打 Agent 工作流里的「高速执行」。OpenRouter 上现在有免费档,8 月 3 日截止,这之前不花钱就能调。
正好,我手里有个跑了半年的真实场景,拿来验证它再合适不过。
播客是我很重要的信息输入源,但光听留不下东西,所以我搭了条流水线:播客音频 → 火山引擎转写(带说话人分离)→ 大模型成稿 → 存进 Obsidian。成稿这步一直是 Claude Sonnet 在干:给 Speaker N 推断真名、修同音字、分章节、写摘要。
说实话我一直觉得这步有点杀鸡用牛刀,这种活给一个便宜的执行模型干正合适,于是做了个对比测试。
素材挑的知行小酒馆 E239 对谈沈帅波那期,80 分钟节目、2.9 万字转写稿,一把喂进 256K 上下文,连切块都省了。
同一个 prompt 一字不改,Ling 关思考、开思考各跑一组,原来的 Sonnet 流程当基线。我还故意把说话人匿名成 Speaker 1/2,往稿子里埋了 17 个转写稿里真实会出现的同音字错误当考题:「投流→投留」「变现→变线」「算法→蒜法」这种。
结果:同一个任务,8.5 秒 vs 2-3 分钟,成本 0 元 vs 一块钱。连跑三次 8.35 / 8.53 / 8.50 秒,稳得不像话。
但也不是全赢。
赢的地方:
关思考 8.5 秒出稿,首 token 3 秒出头。Sonnet 干同样的活要 2-3 分钟
说话人命名全对,从对话里推断出主持人雨白、嘉宾沈帅波,连别人喊他的昵称「波波」都挂上了
10 个章节时间戳全部真实且递增(这个位置最容易出幻觉),我写了脚本回转写稿 212 段里逐个比对。takeaways 里的数字也逐条翻回原文查过:日发 1.2 亿条视频、一人管 50 个号、B 站两年从 100 万涨到 106.9 万粉,全有出处
输的地方:
17 个埋错,关思考只抓到 7 个,开思考 10 个。「投留」「蒜法」这种一眼假的都能放过,纠错这块不能全托付
开思考版吐出来的 JSON,摘要里的引号没转义,直接解析就崩,我还得写段代码修
另外一个坑:开思考时 max_tokens 得给足,思考 token 是算在输出额度里的——这次实测开思考输出 6832 token,其中 4189 是思考。给少了正文会被直接截断。
最后我的决定:结构化成稿这步换成它,纠错留在原流程里。人定好规格,让它去干活~ 免费档 8 月 3 日前还能稳定接入到工作流,最香了哈哈
想自己试的:
OpenRouter 免费档(8 月 3 日截止,充 10 刀能把每天 50 次请求解锁到 1000 次)
不想接 API,官网网页版直接聊:
官方发布推文:
显示更多