用混元4 跑了一下鹈鹕测试,结果让我震惊🔥
简单理解就是测试混元4模型的,空间感知、图像理解和视觉理解这三个方面,整体测试下来效果很不错。
这里我就来解释一下什么是鹈鹕测试。
鹈鹕测试其实可以简单理解成三层:
1、测 SVG 是否真正由模型生成
检查是不是老老实实用 SVG 代码画出来,而不是塞图片、文字或者其他绕过方式,因为第一步要先确认,模型是真的会写 SVG。
2、测空间和几何结构是否正确
比如轮子数量、位置、车架连接,以及鹈鹕有没有真的坐在自行车上,因为 SVG 本质上是在用代码描述物体之间的空间关系,这一步主要看模型懂不懂结构。
3、测最终视觉语义是否正确
把 SVG 渲染成图片,再判断“像不像鹈鹕”“是不是真的在骑自行车”因为代码能运行、结构也完整,不代表最后画出来的东西就是对的。
显示更多
简单看了一圈刚发布的 Hy4 preview,我觉得有 3 个点挺有意思。
第一,它明显在为长任务和 Agent 做准备。
1M 上下文背后塞了 Sparse Attention、IndexCache、MTP,不只是把窗口数字拉大,而是在解决长链路任务真正跑不动的问题。
第二,Hy4 已经开始参与“研发自己”。
从训练策略、评测到推理优化都开始让模型参与,官方给出的吞吐提升是 31.8%。
第三,模型竞争开始从“会不会答题”,转向“能不能长期干活”。
腾讯也开始拿真实工程任务测试,缓存价格已经打到了 0.3 元 / M Token。
看来这次腾讯是像这种动真格的了,已经不再是比单纯的模型能力,而是谁更适合成为长期运行的 Agent 底座。
显示更多