注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 strict
strict 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 strict 的推特
据 Bitcoin News 报道,美国阿拉斯加州参议院法案 SB 249 将于 2026 年 10 月 1 日正式生效,该法案对加密货币 ATM 实施了严苛的监管要求。法案规定,加密货币 ATM 运营商必须获得货币传送许可,每台设备需在州政府注册;交易限额设定为每人每天 1000 美元及 30 天内 1 万美元,手续费上限为 10%。此外,法案强制要求运营商在机身上显示醒目的防欺诈警告,且须在交易前通过严格的 KYC 程序采集用户信息,同时利用区块链分析技术筛查钱包地址。法案还包含“严格责任(Strict Liability)”条款,即若运营商未能执行验证程序导致欺诈发生,将承担直接责任。
显示更多
我尼玛可以哟,同样跑 Agent 任务成本砍到 1/9——OpenSquilla,6134 个 Star!0.5.0 Preview 4,微内核 AI Agent。 一句话:本地模型路由器把每一轮对话分给“够用且最便宜”的模型,同预算换更高智能密度。 核心不是又一个聊天壳,而是把 Agent 运行层做成了省 token 的 harness: (1)SquillaRouter 本地路由——LightGBM + ONNX 分类器在本地给每轮打分,按 C0-C3 层级选模型,路由判断不把 prompt 送出机器。 (2)自适应推理和 Prompt——简单任务轻量处理,复杂任务才开扩展推理和完整系统提示,尽量不把 token 浪费在废话上。 (3)20+ LLM 提供商——OpenAI、Anthropic、OpenRouter、Ollama、DeepSeek、Gemini、Qwen/DashScope 等都能接,主备选择不动代码和配置结构。 (4)技能按需加载 + MCP——15 个内置技能用到才加载;既能当 MCP client,也能跑成 MCP server。 (5)本地持久记忆——MEMORY.md + 日期 Markdown 笔记,SQLite 全文搜索和 sqlite-vec 语义召回,embedding 可走本地 ONNX。 (6)分层安全沙箱——Standard/Strict/Locked 三档权限矩阵,Linux 用 Bubblewrap,macOS 走 Seatbelt,敏感操作可接人工审批。 它把 Web UI、CLI、聊天频道都接到同一个 TurnRunner,工具分发、重试、决策日志行为一致;还有会话/子代理/定时任务、成本统计,适合长期跑 Agent 工作流。 官方 PinchBench 1.2.1 的 25 个任务里,OpenSquilla 平均分 0.9251、总成本 ;对照是、6.233。分数几乎贴住,成本差了一个数量级,这就很牛逼了。 支持 Windows、macOS、Linux;可桌面安装、终端安装,也能从源码跑。适合想用 Agent 干活、但不想每轮都硬烧顶配模型预算的兄弟。 好东西转给需要的兄弟。🚀 #AIAgent# #开源工具# #老杨啊分享#
显示更多
推荐这篇文章,Flask 作者 Armin Ronacher 追踪 Pi 的 bug 发现了一个让人不安的事实:新版 Claude 模型(Opus 4.8、Sonnet 5)的工具调用在退化——不是变好了,是变差了。而且他找到了根因:RL 后训练过度适配了 Claude Code 自己的工具 schema,导致替代工具 schema 越来越"离群"。这是所有自己做 agent harness 的人都需要读的文章。 更好的模型,更差的工具调用 一个奇怪的 Pi issue 让我在过去两天掉进了一个深坑。简短版:新版 Claude 模型有时会在调用 Pi 的 edit 工具时,给嵌套的 edits[] 数组加上多余的、编造出来的字段。不是 Haiku 或什么小模型——是 Opus 4.8。编辑本身通常是正确的,但参数不匹配 schema,因为模型发明了不存在的 keys,Pi 拒绝工具调用并要求重试。 这不完全意外——模型偶尔会发出格式不正确的工具调用,特别小的模型。但让我意外的是,这在 Anthropic 的新模型中变得更糟了。Opus 4.8 和 Sonnet 5 都表现出这个问题,而之前的旧模型不这样。换句话说,这个模型家族的 SOTA 模型在某个特定工具 schema 上不如它们的旧兄弟。 工具调用就是文本 如果你没有花太多时间看 LLM 工具调用的内部机制,需要理解的重要一点是:工具调用不是魔法。模型收到一份转录文本、一个系统 prompt 和一个可用工具列表。服务器把这些搅成一个带有特殊标记 token 的大 prompt。因为模型用那个格式的示例训练和强化过,它在生成过程中某一点会发出被 API 或客户端解释为"用这些参数调用这个工具"的东西。 细节是:嵌套数组里面的 JSON 是序列化在 XML 标签里面的。基本顶层字符串参数在线显示,而对象数组通过 JSON 序列化实现。这很重要,因为当模型在一个几百 token 的转义字符串后面要决定 } 还是 ,"..." 时,这正是最高熵的点。 失败 Pi 的 edit 工具支持在一个调用中做多个精确字符串替换,所以参数里有一个 edits 数组。在失败的案例里,模型产生了这样的条目:额外加了 requireUnique: true、oldText2、newText2。反复测试中我看到了一整批编造出来的尾随 keys:type、id、kind、unique、requireUnique、matchCase、in_file、forceMatchCount、children、notes、cost,甚至一个 event.0.additionalProperties 在里面。 最烦人的是,实际 oldText 和 newText 负载在我检查过的无效调用里是字节级正确的。模型确实产生了正确的调用,然后在对象末尾加了垃圾。 这个失败也高度上下文依赖。全新的单轮"编辑这个文件"prompt 完全不会复现。有 agent 历史——模型读过文件、诊断了问题、然后写了多行编辑——就能复现。而且不是所有转录都会这样。打开 strict 工具调用在我的运行中完全消除了问题。 为什么在变差 我最强的假设是这不是随机退化,而是训练 artifact。 旧 Anthropic 模型训练时,它们训练了一些工具,但那个训练还没有 Claude Code 这样用户交付的 harness 作为明显目标。现代 Anthropic 模型大概率不同,因为它们的后训练包括了 Claude Code 或一个看起来非常相似的 harness。模型学到了在那个环境下什么样的工具调用是成功的。它也会学到那个环境容忍什么错误。 Claude Code 自己的工具相对扁平。普通 edit 工具不是 Pi 的嵌套 edits[] 形状,更接近 file_path、old_string、new_string 和一个可选 flag(replace_all)。看 Claude Code 的客户端非常有启发:它包含格式错误工具用的重试路径、参数别名、类型强制转换、Unicode 修复和未知 key 过滤。换句话说,Anthropic 自己的客户端似乎期望和接受相当数量的 slop,并修复它,大部分是静默的。 如果强化学习发生在这样的 harness 里,或一个模拟里,那么稍微格式不正确的工具调用仍然可以完成任务并得到奖励。harness 完全吸收了错误,几乎不存在惩罚"发明一个别名"、"加一个多余字段"或"用一个相近的参数名"的梯度。 更糟的是,模型可能变得极强地适应了标准 Claude Code edit 工具的形状。一个不同的 harness 可以提供语义相同但 schema 不同的工具。这样的工具会越来越离群。训练得更好的模型可能实际上更难对付你,因为它的先验更强。 这不算太意外,但这是一个变迁。Opus 4.5 发布时,它适应其他 edit 工具的能力异常好。我当时相当确信我们在一条好路上——模型只要指令好,更可能适应任何种类的工具形状。现在我有些担心我们在哪条路上。替代工具 schema 可能不只是不熟悉。它们可能被优化特定、宽容的工具生态的后训练隐式惩罚。而且那个生态没有文档。 Slop Harness Claude Code 是闭源的,但我们可以看压缩后的代码。老实说,它对输入数据非常宽容。 首先,Claude Code 检查模型可见文本里是否有泄露的 Claude# #Agent# #工具调用#
显示更多
0
21
188
42
转发到社区