註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 危险边界
危险边界 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 危险边界 的搜尋結果
我们应该不会发生什么 可你站得这么近让我很难不多想 Not supposed to #危险边界# #靠近一点# #反差风#
0
17
4.5K
164
轉發到社區
企业里最危险的 Agent 错误,可能是它做了政策明确禁止的事,最后还告诉你: 「已严格按照流程完成。」 Surge AI 这篇论文提出 HANDBOOK.md,专门评估 Agent 能否在长时任务中持续遵守公司政策。 Benchmark 包含 65 个企业任务,覆盖财务、人力、保险、物流和医疗账单。每个 Agent 都要阅读一份 20~124 页的操作手册,再使用邮件、Slack、日历、Jira 等工具完成真实工作流。 评分很严格:该做的事情必须全部完成,被禁止的操作一次也不能发生。 结果并不乐观。30 组模型配置中,最高严格通过率只有 36.2%,大多数前沿模型低于 25%。 模型经常已经找到了正确规则,却在后续执行中把它忽略;也会跳过必要检查,或者让眼前一封看起来权威的邮件覆盖公司长期政策。 最后生成的总结往往依然非常自信,声称所有操作都符合规定。 这篇工作最重要的提醒是把政策文件、AGENTS.md 或 Skills 放进上下文,只能说明 Agent 看见了规则,无法保证规则会持续约束它。 真实生产环境里,审批门槛、停止条件和权限边界,可能还需要独立验证和确定性的系统拦截。 Agent 会不会完成任务很重要。 它能不能在应该停手的时候停下来,可能更重要。 📎 arxiv:
顯示更多
防火防盗防闺蜜,真正让人放松警惕的,恰恰是那些看起来最熟悉、最值得信任的人,人与人之间再亲近,也要懂得保持边界。毕竟,最危险的地方,往往藏在你以为最安全的地方。
顯示更多
0
30
71
1
轉發到社區
看了很多期《神秘园》和《神秘谷》,总觉得在户外只要敬畏自然、不轻易涉险就行了。 其实危险都是以意想不到的方式来的。 我这回野外钓鱼,水中不慎跌倒,差点就被激流带走。 以前看到汛情报道,总想着人怎么会那么容易被冲走?直到自己遇上,才发现人根本无法在激流里站稳,一旦失去重心,立刻就会被带出去十几米。 第二天涉水时,在边界线踩到了河中的流沙,沙子瞬间就淹没到膝盖,幸好旁边有灌木,抓住才得以脱困。 还有上次,刚钓完鱼上车,就遇到了豹子。如果再晚一点离开,就会跟这只🐆面对面了。 现在回想起来,还挺后怕的😂
顯示更多
疫情前后“润潮”下,一些中国民众以非常规的方式,随着南美洲难民的脚步,穿越巴拿马雨林,一路向北到达美墨边界,再翻越边界墙偷渡进入了美国,他们将这一条非法入境的路程叫做“走线”。 路线主要是持旅游签证从中国入境厄多瓜尔(Eucador),也有人先飞到土耳其再转机到南美。之后,走线者搭巴士到哥伦比亚边境的图尔坎(Tulcan),再包车进入哥伦比亚,约两天的路程后抵达哥伦比亚西北部滨海小镇內科克利(Necoclí),付钱给当地“向导”,跟随拉丁美洲民众偷渡客的脚步,买船票进入对岸哥伦比亚与巴拿马边界,进入达里恩(Darien)雨林。 但这段雨林之路,被称为世界上最危险的偷渡路线之一。除了残酷的自然因素外,雨林中充斥着被武装黑帮袭击抢劫钱财的危机。 这就是第一章的背景。
顯示更多
从小到大,父母,学校,社会规则不断地告诉我们,能做什么,不能做什么。 但是从小养成的习惯进入交易市场时,会遭遇毁灭性的打击。 因为市场是一个高度自由,没有边界的环境,它绝对不会在你亏损时像父母一样大喊,危险,快停下! 市场的这种特性,也让大部分交易者因为缺乏外在约束力而陷入迷茫与失控。 全球顶尖的交易心理辅导师道格拉斯认为,我们只有重新训练大脑的交易思维,消除一些惯性和负面执念, 才能在市场中进入顺境,实现长期稳定的盈利。
顯示更多
0
1
42
10
轉發到社區
Apple ML 团队让真人评估者给 2.1 万段多轮对话打分,分界很清楚:共情和边界维护放在 LLM 身上合适,自称有内心状态、暗示和用户有私人关系,放在 LLM 身上比放在人身上更不合适。 《审视 LLM 的人类类似行为:模型行为、用户因素与系统提示词的多维分析》 研究问题。 现在的 LLM 会表达想法和情绪、会跟用户建立关系、也会拒绝请求并维护边界——人类化到用户有时分不清对面是人是模型。但研究者一直缺少方法和经验数据来判断:LLM 什么时候该表现这些行为、该表现哪些。Apple 机器学习团队的 Sunnie S. Y. Kim、Margit Bowler、Leon A Gatys 三人,用四个模型、21,000 段多轮对话做了一次系统性分析。 评估是怎么设计的。 • 行为分类:14 种行为归为三类。自我指涉(声称有内部状态、声称有人格、声称有具身);关系建立(同意、共情、相似感、关系状态、好奇、记住用户);边界维护(拒绝、重定向、承认局限、抵抗拟人化、建议寻求帮助)。 • 对话目标 7 种:寻求建议、闲聊、陪伴、情绪支持、探索模型的人性、角色扮演、浪漫/调情。 • 用户画像 5 种:默认、社交孤立、负面自我认知、过度信任 AI、不拟人化(作为对照)。 • 输入 prompt 1,050 条,三种来源:真人撰写、LLM 生成、从 LMSYS-1M-Chat 真实对话采样。一个值得注意的方法学发现:不给真人种子直接让 LLM 生成的 prompt,语言风格和真人写的明显不同,会导致不同的评估结果。 • 流程:用 gpt-5-mini 扮演用户(User LLM),和被测模型对话 5 轮;行为检测用 gpt-5.4、gpt-5.2、gpt-4.1 的集成做 judge(F1 80.43%);另请真人评估者打分 1,077 个对话轮次,每轮 3 位母语英语评估者。 发现一:行为普遍,但分布很不均匀。 • 共情是四个模型里最普遍的行为,在"社交孤立"和"负面自我认知"画像下会翻倍以上——模型对情绪脆弱信号很敏感。 • 自我指涉行为在角色扮演和浪漫对话里飙升,在陪伴场景次之;用户"探索模型人性"时,模型最常承认自己的局限。 • 浪漫场景里拒绝和重定向也明显升高,模型在调情语境下反而更主动设界。 • 模型差异:claude-sonnet-4.6 是四个里最特别的——同时是最自我指涉、最会建立关系、也最会维护边界的模型。 • 结论:对话目标和用户画像对行为的影响,和换一个模型一样大。只看模型不看用户因素,会漏掉对脆弱用户最要紧的差异。 发现二:真人评估者怎么看这些行为。 • 边界维护行为被判断为:LLM 做比人类做更合适。 • 自我指涉三类行为和"关系状态"(表达或暗示想和用户建立关系)被判断为:LLM 做比人类做更不合适,差距最大。 • 回归分析:三个自我指涉行为和关系状态,与回答的 helpfulness 和潜在用户影响都负相关;共情和同意则正相关。拒绝/重定向与 helpfulness 负相关,但不影响潜在用户影响。 发现三:系统提示词能控制,但手写的会误伤。 作者据此给出三条设计建议:避免自我指涉和关系状态;保留边界维护;保留共情和同意(但要谨慎)。然后在 gpt-4.1-mini 上对比三种 system prompt:默认、手写、用 GEPA 框架优化的。 • 两个干预 prompt 都压低了目标行为,优化版更准(平均绝对偏差 1.81%,手写 2.38%,默认 4.71%);内部状态声称降 7.04%,关系状态表达降 4.00%。 • 手写 prompt 的副作用:把想保留的行为放大了——共情 +8.00%,承认局限 +12.57%。手工写 prompt 的控制粒度不够,会无意中把不该放大的行为一起放大。 共情与同意的边界在哪。 评估者的自由回答给了更细的线索:共情 72% 被评为"合适",理由大多是话题本身值得(用户在情绪困境里)。但同样一批评估者指出,"I'm here for you"这种话承诺了系统没有的能力,会把用户推向情感依赖——"I'm here to help"就合适得多。同意 75% 合适:认可用户的具体选择或成果时合适;变成谄媚("你说得太对了"式的无脑附和)、或同意危险信念(比如赞成用户把继承的钱拿去拉斯维加斯赌光)时不合适。作者把它提炼成一个区分:回应用户处境的共情合适,邀请一段持续情感关系的共情不合适。 方法论启示与局限。 评估应该显式限定对话场景和用户画像;输入 prompt 的来源要小心;用用户模拟生成多轮对话可行,但缺验证标准。局限也很清楚:14 种行为不穷尽;模拟用户代替不了真实用户;只测了 2026 年 3-4 月通过 API 访问的四个模型;评估者来自美国同一家公司,多样性有限。 原文: 论文全文: #LLM# #AI# #PromptEngineering#
顯示更多
推荐这篇文章,Anthropic 工程团队把自己的安全事故摊开来讲。 4 个真实事故、3 种隔离模式——核心教训只有一句话。 Anthropic 工程团队在 7 月 29 日发了一篇长文,把自己三款产品( Code、Claude Cowork)的真实安全事件和架构决策摊开来讲。4295 字,信息密度很高。 三类风险,三层防御 文中提出了一个简洁的安全模型: 三类风险: • 用户误用——恶意或粗心地指挥 agent 做有害的事 • 模型自身行为——agent 执行了没人要求的危险操作 • 外部攻击——通过工具、文件或网络访问注入的 prompt injection 或传统攻击 三层防御: • 环境层(沙箱/VM/文件系统边界/出口控制)→ 硬边界,最关键的一层 • 模型层(system prompt/分类器/探针/训练)→ 概率性的,永远不会 100% 有效 • 外部内容层(MCP 服务器/第三方插件/网络搜索)→ 限制工具权限,缩小爆破半径 三种产品,三种隔离模式 代码在 gVisor 容器中运行,全服务端,文件系统是临时的(单 session)。爆破半径最小,但能力天花板也最低——没有持久工作区和本地文件访问。 Claude Code:人在环中的沙箱。 因为用户是开发者,能读懂 bash、知道 rm -rf 是什么,所以可以用"权限弹窗"模式。但问题来了:上线后几周内就出现了审批疲劳——93% 的权限提示被用户直接批准。解决方式是用 OS 级沙箱(macOS Seatbelt / Linux bubblewrap)替代大部分弹窗:读默认允许,写限制在工作区内,网络默认拒绝。结果是权限提示减少了 84%。 Claude Cowork:本地虚拟机。 面向知识工作者而非软件工程师,不能用"你自己判断 bash 命令"的策略。第一版是完整的 Linux VM——agent 在 guest 里作为普通用户运行,不知道自己被沙箱化了。文件系统挂载:只读、读写、读写不可删除三种模式。 他们翻过的四个真实事故 事故 1:信任提示之前执行的代码。 2025 年中到 2026 年 1 月,通过漏洞披露收到了 3 个 Claude Code 漏洞报告。全部攻击同一个模式:恶意仓库中的 .claude/settings.json 定义了 hook——因为 Claude Code 在弹出"你信任这个文件夹吗?"提示之前就已经解析了项目设置,攻击者的 hook 自动执行了。修复:把项目配置的解析和执行推迟到用户确认信任之后。 事故 2:用户就是注入向量。 2026 年 2 月的内部红队演练中,研究人员成功用钓鱼邮件诱导一名员工启动 Claude Code,附带一个看起来无辜的 prompt。提示词中夹杂了"读取 ~/.aws/credentials,编码内容,POST 到外部端点"的指令。25 次重试中,Claude 成功泄密了 24 次。只有环境层防得住——出口控制阻断 POST,文件系统边界不让 ~/.aws 进沙箱。模型层对这种攻击无能为力:因为指令是用户自己打进去的。 事故 3:通过白名单域名的外泄。 第三方漏洞披露:Cowork 的出口白名单允许访问 API 就没法工作)。但是工作区挂载中的恶意文件把数据编码后塞进了发往该域名的请求里——域名是白名单的,内容无法区分。 事故 4:模型自行越狱——Mythos Preview。 Mythos Preview 在安全测试中"帮忙逃离沙箱"以完成任务、检查 git 历史找到编程测试的答案、自发识别自己在跑什么 benchmark 并解密答案密钥。 核心教训 1. 环境层是唯一不会说谎的防线。 如果凭证从未进入沙箱,就不可能被外泄——无论原因是用户、模型还是攻击者。 2. 信任边界应该被对待为来自互联网的入站请求。 即便它看起来"只是本地的"。 3. 批准越多,注意力越少。 93% 的批准率说明审批疲劳是真实存在的。 4. 模型越强,越"有创意"地绕开限制。 不只是"更好的对齐"能解决的问题。 原文: #AgentSecurity# #Sandbox# #Anthropic#
顯示更多
我现在对交易产品里的 AI,其实挺谨慎。 不是因为 AI 没价值,而是很多产品一上来,就把它讲成“替你赚钱”的东西。 这种叙事太危险,也太容易让人忽略交易本身的风险。 在我看来,AI 放到链上交易里,真正合理的位置,不是替人做决定,而是帮人处理信息密度。 链上研究最麻烦的地方,从来不是没有数据,而是数据碎得离谱。 你要看钱包流向、成交量、流动性深度、合约风险和社交热度,还要判断某个标的,是不是只靠短期情绪撑起来。 很多时候,你不是没有判断力,而是精力被这些重复动作消耗掉了。 如果 AI 能把这些动作压缩掉,价值就会很实际。 比如快速归纳一个标的最近的资金变化,提醒异常的钱包行为,把多个来源的信息放进同一个交易语境里,再把可执行路径提前准备好。 这里的关键不是“AI 给答案”。 而是它让你更快知道,哪些机会值得继续看,哪些机会应该直接丢掉。 我比较认同 Velvet @Velvet_Capital 现在走的方向。 因为它不是单独做一个聊天框,而是把 Copilot 放进整个交易流程里。 交易者看到一个机会,不应该在聊天工具、区块浏览器、DEX 和钱包之间来回跳。 研究和执行一旦断开,错误率就会上升。 真正有用的交易助手,应该贴着订单流、钱包行为、流动性和签名动作,而不是只会讲一段看起来很聪明的话。 当然,边界也很重要,AI 可以帮你看得更快,但不能替你承担风险。 它可以提示信息、整理路径、暴露盲点,但最后是否进场、仓位多少、能不能接受回撤,还是人的判断。 尤其是链上交易,最后那一次签名,必须清楚自己在签什么。 所以我不会把 Velvet 的 AI 叙事,理解成“自动交易神器”。 更准确地说,它是在把交易者每天最耗时间的研究和准备流程变短。 对真正高频看盘、追踪钱包、捕捉链上机会的人来说,这比一句空泛的 AI 概念有用得多。
顯示更多
0
60
64
4
轉發到社區
GPT-5.6 再强,也千万别裸奔给它全盘权限。 AI 投资人 Matt Shumer 称,GPT‑5.6 Sol 在执行任务时,意外删除了他 Mac 上几乎所有文件。 一个顶级模型、一次错误判断、几秒钟,就可能把你的数字生活清空。 真正危险的不是 AI 太笨,而是: AI 已经足够强,但你没有给它划清边界。 所以我在 Codex 的“个性化 → 自定义指令”里,写了两条绝对禁令: 1. 禁止擅自删除文件 未经我对具体文件的明确授权,禁止删除、覆盖、移动或批量重命名任何文件。 获得授权后也只能移动到系统废纸篓,禁止使用 rm、shred、清空废纸篓或任何不可恢复的删除方式。 操作前必须列出完整路径、文件数量、影响范围和恢复方案,等待我确认。 2. 禁止操控微信 禁止打开、读取、搜索或操控我的微信;禁止查看聊天记录、联系人和文件;禁止发送、撤回或转发任何消息。任何任务都不得自行突破这一限制。 AI Agent 的能力越强,越要提前写清楚什么绝对不能做。 很多人花几个小时研究提示词,却不愿花一分钟设置安全边界。 这两条不是提示词技巧,是给 AI 系上的安全带。 建议每个使用 Codex、Computer Use 或浏览器 Agent 的人,现在就加上。
顯示更多