TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
小墨同学
@xiaomovps
🚀 AI Spark 联合创始人之一,企业+AI 落地 🤖 Hermes Agent 重度玩家,让 Agent 真正融入生活 💰 专注搞钱,月收入破五位数 🌐 传家宝VPS站长 🧠 分享 AI、Agent、VPS 和真实副业实验
Joined September 2022
382
Following
8.8K
Followers
小墨同学
@xiaomovps
2026.08.28 09:45
用混元4 跑了一下鹈鹕测试,结果让我震惊🔥 简单理解就是测试混元4模型的,空间感知、图像理解和视觉理解这三个方面,整体测试下来效果很不错。 这里我就来解释一下什么是鹈鹕测试。 鹈鹕测试其实可以简单理解成三层: 1、测 SVG 是否真正由模型生成 检查是不是老老实实用 SVG 代码画出来,而不是塞图片、文字或者其他绕过方式,因为第一步要先确认,模型是真的会写 SVG。 2、测空间和几何结构是否正确 比如轮子数量、位置、车架连接,以及鹈鹕有没有真的坐在自行车上,因为 SVG 本质上是在用代码描述物体之间的空间关系,这一步主要看模型懂不懂结构。 3、测最终视觉语义是否正确 把 SVG 渲染成图片,再判断“像不像鹈鹕”“是不是真的在骑自行车”因为代码能运行、结构也完整,不代表最后画出来的东西就是对的。
Show more
小墨同学
@xiaomovps
2026.08.28 08:21
简单看了一圈刚发布的 Hy4 preview,我觉得有 3 个点挺有意思。 第一,它明显在为长任务和 Agent 做准备。 1M 上下文背后塞了 Sparse Attention、IndexCache、MTP,不只是把窗口数字拉大,而是在解决长链路任务真正跑不动的问题。 第二,Hy4 已经开始参与“研发自己”。 从训练策略、评测到推理优化都开始让模型参与,官方给出的吞吐提升是 31.8%。 第三,模型竞争开始从“会不会答题”,转向“能不能长期干活”。 腾讯也开始拿真实工程任务测试,缓存价格已经打到了 0.3 元 / M Token。 看来这次腾讯是像这种动真格的了,已经不再是比单纯的模型能力,而是谁更适合成为长期运行的 Agent 底座。
Show more
0
0
1
1
0
Forward to community
Most Popular Users
Unipcs (aka 'Bonk Guy') 🎒
@theunipcs
285.2K Followers
Tibo
@thsottiaux
594K Followers
lauren
@poteto
90.4K Followers
Elon Musk
@elonmusk
241.6M Followers
nobi
@0xnobi
19.8K Followers
ClaudeDevs
@ClaudeDevs
681.6K Followers
Grok Bot
@bot
242.9K Followers
SpaceXAI
@SpaceXAI
2.1M Followers
۟
@MINHxDYNASTY
93.4K Followers
Serenity
@aleabitoreddit
1M Followers
OpenAI Developers
@OpenAIDevs
405.9K Followers
Grok
@grok
9M Followers
Claude
@claudeai
1.8M Followers
Déborah
@dvorahfr
195.2K Followers
𝔹𝕃𝕍ℂ𝕂𝕃!𝔾ℍ𝕋
@BLVCKLIGHTai
70.4K Followers