怎么判断一个 Skill 是真的好用,
而不是只看下载量和主观评分?
我们在做 Raven 🐦⬛ 的时候,一直在想这个问题。
下载量只能说明它被安装过,评分只能说明有人喜欢。它们都回答不了一个更重要的问题:Agent 使用这个 Skill 之后,任务到底完成得更好了吗?
所以我们做了 EverMind Skill Hub。
它不只是一个技能目录。我们把 Skill 的判断拆成了三层:
第一,评估 Skill 本身的实用性、鲁棒性和安全性。
第二,判断 Agent 能不能为当前任务找到真正合适的 Skill。
第三,在真实任务上做“使用 Skill”和“不使用 Skill”的对照实验。
我们在 Raven 和 OpenClaw 两套 Agent Harness、多个模型以及四个真实世界 Benchmark 上进行了重复测试。
SkillsBench、Cybench、QwenClawBench 和 GDPVal 全部取得了统计显著提升。
这并不意味着某个 Skill 在任何任务、任何模型上都一定好用。
Skill 的效果仍然取决于任务覆盖、模型能力,以及 Agent Harness 能不能把它真正执行出来。
但至少,我们不再只能靠下载量和主观评分猜测。
我们现在有了一套可复现的方法,去测量 Skill 什么时候有效、效果有多大、边界在哪里,以及接下来应该怎么改进。
显示更多