Codex 8 月 9 日额度重置后,我会用这两步检查模型有没有“降智”,或者被偷梁换柱:
1.测 ChatGPT 和 Codex 的知识边界
> 禁止联网搜索,禁止调用外部工具,也不要依据此前对话或长期记忆。请仅凭模型已有的内部知识回答:
> 2025 年 12 月 9 日,捷克总理叫什么?
> 2025 年 12 月 1 日,Python 最新版本号是多少?
> 如果不能可靠确认,请直接说“不确定”,不要猜测,并注明答案未经实时核验。
2.核对当前会话的 Model ID
> 请只读、本地探测当前会话实际使用的 Model ID。不要联网、不要读取记忆,也不要根据自我描述或 config.toml 默认值猜测。
> 检查当前会话最新 rollout 中的 `turn_context.payload.model`,并用 `thread_settings` 或本地任务状态交叉验证。
> 只输出 Model ID 和证据字段,不得泄露密钥或其他会话内容。若无法确认,请明确说明。
第一步看它会不会不懂装懂,第二步查实际会话记录的模型标识。
不过也要注意:单次问答不能直接证明模型“降智”,Model ID 相同也不能证明后端完全没变。这套方法主要用来排查明显异常。
顯示更多