TwiScan
热门
社区
账号集合
登录
注册
English
日本語
한국의
简体中文
繁体中文
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
AI Dance
@AI_Whisper_X
China AI insider | Silicon Valley Decoded 一边盯硅谷,一边扒中国AI 算法 + VC 双视角 · 讲人话 📬 aidance.info
@gmail
.com
加入 October 2024
293
正在关注
5.9K
粉丝
AI Dance
@AI_Whisper_X
2026.07.21 12:24
Claude Code 和 Codex 都有 /goal 命令,很多人默认这俩差不多。刚读了 Charles Azam 的一个实验才发现,同一个命令下,是完全不同的两套系统,实验结果也挺好玩。 实验用的是一道光纤网络设计题,是他 2018 年当学生时做过的。他当年花了一周写 C++ 解它,可以作为一个人肉 baseline。这次他让 Fable 5 和 GPT-5.6 Sol 各跑三组 plain vs /goal 配对,每次 30 分钟,分数越低越好。 不过这个 benchmark 我倒是兴趣不大,我最感兴趣的是两套 /goal 的实现。 Claude Code:独立评审员模式 /goal 实现为 session 级的 Stop hook。主模型每跑完一轮,一个小评估模型(默认 Haiku)读取目标条件和对话记录,回答 yes/no 答 no 就再开一轮,答 yes 就清除目标 关键限制:评估模型不能用工具、不能看文件,只能根据对话记录里出现的证据来判断。它能抓住“提前退出”,但没法知道“再跑一千万次求解器迭代值不值” 优点是裁判独立(不是自己给自己打分),缺点是裁判是瞎的(只看 transcript) Codex:持久化状态 + 自我声明模式 goal 是持久化的线程状态:TUI 保存目标,SQLite 记录状态和预算 工作模型自己拿到 create_goal / get_goal / update_goal 三个工具。线程空闲但目标还在时,Codex 注入一个“继续干 + 完成度审计”的续跑轮次 关键区别:由工作模型自己声明完成。它看得到文件、也能用工具,但等于自己批改自己的作业 (这里对应的是作者查看的 Codex CLI 0.144.4;Claude Code 没有开源,相关实现来自 Anthropic 官方文档。)
显示更多
0
0
26
49
2
转发到社区
热门用户
狱
@Wx1n11124
268.9K 粉丝
New York Post
@nypost
4.2M 粉丝
オリコンニュース
@oricon
1.9M 粉丝
Reuters
@Reuters
26.4M 粉丝
First Squawk
@FirstSquawk
569.2K 粉丝
吴说区块链
@wublockchain12
181.5K 粉丝
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K 粉丝
TVer新着
@TVer_info
100.9K 粉丝
玉米棒棒
@fljjx61
0 粉丝
空空道人
@Kongkongda5882
34.2K 粉丝
中國新聞社
@CNS1952
547.6K 粉丝
billboard
@billboard
16.8M 粉丝
华尔街观察 Xtrader
@cnfinancewatch
129.9K 粉丝
李李Momo💋
@Lili33O49
23.7K 粉丝
看中國
@kanzhongguo
348.9K 粉丝