註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

小盖
@xiaogaifun
做有意思的事情。
加入 February 2026
79 正在關注    4.1K 粉絲
腾讯 Hy4 preview 内测的真实感受。 现在这个模型竞争是真的激烈。完全没想到,腾讯混元 Hy4 preview 这么快就来了,之前很多人还预测说得年底。我昨天一早拿到了内测名额,干了 2000 多万 Token,还是想和大家说下我的真实感受。 先说模型基本的配置,这现在看模型,就和手机一样,得先看参数。Hy4 preview 的基本面是: 1)总参数 770B、激活参数49B。 2)1M 上下文。 3)输入缓存命中 0.3 元。 能看出来,确实腾讯也在逐步提升模型的总参数量,这也是意料之中的事情。目前各个公司都在追求更大规模参数的模型,毕竟大参数和模型之间,还是有直接的对应关系。 Benchmark 等等能在其他地方查到的信息,我就不说了。直接谈谈我的使用感受。 1、Hy4 preview 仍然在快速进步,综合能力基本上已经逼近 GLM-5.3 的水准,超过 DeepSeek V4 系列。这次之后,我觉得腾讯的模型也正式跨入到国内第一梯队的水准了。至少和之前我们讨论的 Kimi、GLM 等等模型,可以有来有回了。 2、或者这么说,我这两天全天候在 WorkBuddy 中深度使用 Hy4 preview。在我日常跑的这些 Coding 或者办公任务里,已经很难明显感觉到 Hy4 preview 和其他几个头部模型之间有什么差距。感受不出来,根本感受不出来。有更复杂 Coding 场景的同学,也可以试试,评论区里交流。价格还是非常便宜。 3、我让它做了一个北京地铁动态交互网站,前前后后大概跑了半个多小时。大家可以直接看效果。其实它第一次生成出来的版本,完成度就已经非常高了。这个 Case 我之前也试过 Hy3 正式版,基本做不出来。所以单看前端 Coding,Hy4 preview 相比 Hy3 的提升还是非常明显的。 4、我把自己目前正在跑的一个后端项目交给它,让它帮我检查里面可能存在的漏洞。其中有一部分涉及订单场景,不同平台的支付逻辑交织在一起,代码本身还是比较复杂的。Hy4 preview 最后真的找到了一个并发场景下,订单号和支付逻辑之间的 Bug。 这部分代码其实是 GPT-5.6 写的。后来我也让 GPT-5.6 自己重新反思、检查了一遍,它没有找到这个问题,Hy4 preview 反而找到了。当然,一个 Case 不能说明两个模型谁一定更强。但至少这个结果挺让我意外的。 5、不用猜,Hy4 preview 这次肯定在后训练方面,着重优化了办公任务。毕竟腾讯的 WorkBuddy 现在重点在渗透知识工作者,这类人群的杀手级的应用场景就是文档处理、数据分析等等。 我给了它一个比较复杂的审计任务,需要在几张表之间来回比对数据,最后根据这些数据找出问题,再给出结论。这个任务其实很考验模型能不能一直记住前面的业务规则,同时把几张表里的信息真正对应起来。 6、最后我还顺手测了一个比较有意思的 Case。我把我们产品的 Logo 给它,让它只用纯 HTML,帮我做一个动态效果,有点像之前 Grok Bot 那种感觉。大家也可以直接看最后的效果。半个月前,我同样也让 GLM 5.3 跑过这个 Case,现在,已经难分伯仲了。 7、当然,仍然也还是有一些缺点。比如模型仍然会有不同程度的过度思考。地铁那个 Case 里,我看到模型在生成动画时,它会花很多时间反复检查一些其实已经没有问题的细节。 这个问题在长任务里会更加明显。模型能力强了以后,它确实会习惯性的反思,但反思太多,任务时间就会被拉长。 尤其是一些需求非常明确的小修改,我其实只希望它赶紧改完,不需要每一步都想得那么复杂。我看到官方也提到这个问题了,最近我用 GPT 5.6 和 5.6,也会遇到类似的问题。 8、另外就是审美。虽然比 Hy3 preview 有提升,但我感觉 Hy4 在后训练上,应该还没有花很多精力做这件事。 就像 Logo 动画那个例子,我提示词比较简单的时候,它生成的第一版还是会出现一些比较难看的光晕、渐变,包括元素之间的比例和动效节奏,也容易往那种很典型的 AI 审美上靠。 当然,如果我继续给它反馈,让它把这些东西去掉,最后是可以改得非常完美。所以问题更多还是默认审美没有做到特别好。希望正式版的时候这个问题可以解决。
顯示更多
0
43
50
5
轉發到社區