deepseek 这次事情我真的觉得挺讽刺的
一开始 pro 换 v4.1 flash:会影响生产,eval 指标更好不代表实际表现更好
后面听从用户意见,继续路由到原 pro,又变成:言而无信,朝令夕改,是不是发现新 flash 模型能力还不如 pro
只能说最好是不要把这种公众意见听进去,认定了怎么做就坚定做下去,隔壁 anthropic 就把这一点贯彻的很彻底 hhh
显示更多
我大意了啊,没有闪,被 agent 一个灵车漂移就甩飞出去了
最近认真在做 performance 方面的优化,发现之前有些问题居然没有审计到,拿 obelisk 追溯了一下为啥会出现这个问题
我也是没想到 agent 居然还能把已有的实现方案做歪来(哦,刚好 callback 昨天的指令漂移,这代码是 opus 5 写的),关键这咋过的交叉 review 的呢??看来有些时候还是要自己看代码,晕
显示更多
deepseek harness 文章已更新(
dsh 内部的心智模型其实没那么简单,我在写这篇文章的时候也挣扎了很久;不过,对于写一个插件的人来说,却没有那么复杂。 文章有对此阐述,「复杂度不是消失了,而是转移进了系统内部」,相信读完这篇文章,你能够对 dsh 内部的架构有一个比较好的认知
repo:
此页面仍在持续更新(
显示更多
这不是新闻了,Databricks 在一组精心设计的 eval 中,发现 pi 的综合表现远超其他 harness
Less is More 的前提是:精简上下文造成的信息缺乏,模型有意愿且有办法自己寻回,通过 tool call 和外界环境交互
而这不恰好是现在强模型发展的趋势吗,harness 只需足够 robust 就好了,剩下的让模型自由发挥就好了,所以我看好 pi
(顺便说一句,obelisk 对 pi 的支持应该会使 pi 的表现有很大程度的提升,并且我们正在考虑在 pi 侧做一些东西,而不止给 pi 提供 cli 侧的适配,感谢 pi 的自由度
显示更多
最近在推上看到一些用人月神话等比较 classic 的叙事来反观 agent engineering 的观点
我觉得 That’s a nice try
但是也要意识到 agent 的本质是有持久化状态的计算节点(虽然 llm 本身是纯函数),并可以通过一组有副作用的函数与外界环境交互,只不过输入输出是自然语言
那么适用于人的协作形式自然未必适用于 agent,盲目把 agent 类比成人类工程师也会使我们丢失在新空间里解决问题的能力
显示更多