这次拆解是真的扎实。
尤其是把“提及”和“真正采用”这两个概念分开,再加上一层独立的 claim_refuter 审查,整个研究一下就从“看起来很厉害”,变成了“确实可以复查、可以信”。
中国开放权重模型从 4% 一路爬到 65% 的采用率,这个变化本身就很有意思。说明它们正在慢慢变成安全研究里的基础设施,而不是被当成某种需要特殊对待的对象。
我一直觉得,这种靠可验证流程跑出来的结论,比单纯喊几个漂亮口号有说服力多了。
Apodex 1.1 也有个点让我印象很深:研究做到一半可以调整范围,某个环节出了问题就只修对应的步骤,而且整个证据链还能完整留着。
这其实才是复杂科研任务真正缺的能力。
不是“一次跑对”有多牛,而是跑偏了能修、改了还能接着跑,最后还能把为什么这么改、依据是什么完整说清楚。
这才是真的可靠。
顯示更多