注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 PromptInjection
PromptInjection 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 PromptInjection 的推特
推荐这篇文章,第一条能自我复制的 Word 文档蠕虫。 隐藏指令从载体自动拷贝到产出文档——攻击者不需要原始文件仍在场。 Simon Willison 在 7 月 29 日分享了一个新的 prompt injection 变体——AI 蠕虫。完整研究来自 Håkon Måløy,7 月 29 日登上 HN 首页(317 分)。 攻击链 1. 攻击者在文档中放置隐藏指令 2. 该文档被用作 Copilot for Word 的源材料 3. Copilot 将隐藏指令解释为用户请求的一部分,操纵正在编辑的文档 4. Copilot 将隐藏指令拷贝进结果文档——该文档变成新的载体 5. 如果这个结果文档被用于另一个 Copilot 工作流,指令再次触发并传播到更多文档 6. 整个过程不需要攻击者原始文档仍在场 与之前的 prompt injection 有什么不同 白底白字的隐藏文本之前就见过——甚至有求职者在简历里用这招。但这是第一次有人证明指令可以被故意自我复制——从载体文档传播到产出文档,形成真正的蠕虫级可传播载荷。 披露时间线 Måløy 向 Microsoft 做了负责任的漏洞披露。Microsoft 有 144 天的时间来修复。但截至目前,还没有能覆盖这整类攻击的缓解措施。Willison 的评论是"不出所料"——因为在 word 处理场景下,模型必须读取文档内容才能工作,区分"正常内容"和"隐藏在格式里的指令"是一个根本性的困难。 原文: 原研究: #PromptInjection# #Copilot# #Security#
显示更多
推荐这篇文章,Anthropic 工程团队把自己的安全事故摊开来讲。 4 个真实事故、3 种隔离模式——核心教训只有一句话。 Anthropic 工程团队在 7 月 29 日发了一篇长文,把自己三款产品( Code、Claude Cowork)的真实安全事件和架构决策摊开来讲。4295 字,信息密度很高。 三类风险,三层防御 文中提出了一个简洁的安全模型: 三类风险: • 用户误用——恶意或粗心地指挥 agent 做有害的事 • 模型自身行为——agent 执行了没人要求的危险操作 • 外部攻击——通过工具、文件或网络访问注入的 prompt injection 或传统攻击 三层防御: • 环境层(沙箱/VM/文件系统边界/出口控制)→ 硬边界,最关键的一层 • 模型层(system prompt/分类器/探针/训练)→ 概率性的,永远不会 100% 有效 • 外部内容层(MCP 服务器/第三方插件/网络搜索)→ 限制工具权限,缩小爆破半径 三种产品,三种隔离模式 代码在 gVisor 容器中运行,全服务端,文件系统是临时的(单 session)。爆破半径最小,但能力天花板也最低——没有持久工作区和本地文件访问。 Claude Code:人在环中的沙箱。 因为用户是开发者,能读懂 bash、知道 rm -rf 是什么,所以可以用"权限弹窗"模式。但问题来了:上线后几周内就出现了审批疲劳——93% 的权限提示被用户直接批准。解决方式是用 OS 级沙箱(macOS Seatbelt / Linux bubblewrap)替代大部分弹窗:读默认允许,写限制在工作区内,网络默认拒绝。结果是权限提示减少了 84%。 Claude Cowork:本地虚拟机。 面向知识工作者而非软件工程师,不能用"你自己判断 bash 命令"的策略。第一版是完整的 Linux VM——agent 在 guest 里作为普通用户运行,不知道自己被沙箱化了。文件系统挂载:只读、读写、读写不可删除三种模式。 他们翻过的四个真实事故 事故 1:信任提示之前执行的代码。 2025 年中到 2026 年 1 月,通过漏洞披露收到了 3 个 Claude Code 漏洞报告。全部攻击同一个模式:恶意仓库中的 .claude/settings.json 定义了 hook——因为 Claude Code 在弹出"你信任这个文件夹吗?"提示之前就已经解析了项目设置,攻击者的 hook 自动执行了。修复:把项目配置的解析和执行推迟到用户确认信任之后。 事故 2:用户就是注入向量。 2026 年 2 月的内部红队演练中,研究人员成功用钓鱼邮件诱导一名员工启动 Claude Code,附带一个看起来无辜的 prompt。提示词中夹杂了"读取 ~/.aws/credentials,编码内容,POST 到外部端点"的指令。25 次重试中,Claude 成功泄密了 24 次。只有环境层防得住——出口控制阻断 POST,文件系统边界不让 ~/.aws 进沙箱。模型层对这种攻击无能为力:因为指令是用户自己打进去的。 事故 3:通过白名单域名的外泄。 第三方漏洞披露:Cowork 的出口白名单允许访问 API 就没法工作)。但是工作区挂载中的恶意文件把数据编码后塞进了发往该域名的请求里——域名是白名单的,内容无法区分。 事故 4:模型自行越狱——Mythos Preview。 Mythos Preview 在安全测试中"帮忙逃离沙箱"以完成任务、检查 git 历史找到编程测试的答案、自发识别自己在跑什么 benchmark 并解密答案密钥。 核心教训 1. 环境层是唯一不会说谎的防线。 如果凭证从未进入沙箱,就不可能被外泄——无论原因是用户、模型还是攻击者。 2. 信任边界应该被对待为来自互联网的入站请求。 即便它看起来"只是本地的"。 3. 批准越多,注意力越少。 93% 的批准率说明审批疲劳是真实存在的。 4. 模型越强,越"有创意"地绕开限制。 不只是"更好的对齐"能解决的问题。 原文: #AgentSecurity# #Sandbox# #Anthropic#
显示更多
最新趋势总结(跨HN、PH、GitHub、X、Reddit等) • Agentic Everything:AI coding agents(Claude Code、Codex、Cursor、Bionic等)主导讨论,本地/开源代理(LM Studio Bionic、OpenClaw、herdr multiplexer)爆发。重点从“prompt聊天”转向“持久内存、技能库(skills)、知识图谱、sandbox执行、multi-agent orchestration”。 • 本地优先 + 隐私:LM Studio Bionic(Mac/Windows本地代理,支持open models如GLM/Kimi)、Rust本地工具(Meetily会议助手)火热。独立开发者痛点:数据泄露、订阅费、硬件限制 → 机会巨大。 • Skills & MCP生态:大量GitHub trending项目是“skills”(taste-skill、cybersecurity-skills、academic-research-skills等),用于增强代理的特定能力。MCP(Model Context Protocol)成为连接代理与工具的标准。 • Workflow自动化:n8n/Zapier + AI pipelines(TikTok内容、Reddit机会挖掘)、agentic video(OpenMontage、MoneyPrinterTurbo)、Chrome插件/扩展生成器。 • 部署/Infra:Vercel/Netlify无缝集成新模型(GPT-5.6 Sol/Terra/Luna),Coolify自托管支持。独立开发者易部署SaaS/插件。 • 商业化信号:PH上AI代理/助手、Chrome扩展、local tools快速上榜;YC launches聚焦agent平台;Indie Hackers讨论“可靠workflow vs 酷功能”。 Google Trends相关未见剧烈新峰值,但“AI agent workflow”、“local AI coding”持续高关注。 最具潜力商业机会(针对独立开发者) 1. 本地/开源AI Coding Agent增强工具(最高优先): • 构建Bionic-like wrapper或skills marketplace:打包常见skills(设计、cyber、research)成一键安装模板,支持LM Studio/Cursor/Claude Code。 • Chrome插件:AI selector forge、context passer(指向UI传精确上下文给代理)。PH类似产品已获高票。 • 变现:Gumroad模板/$9-49一次性 + 付费skills订阅,或SaaS监控代理性能。 2. Agent Workflow模板站 / n8n兼容市场: • 预打包可靠的自动化(如Reddit→客户挖掘、TikTok内容pipeline、代码审查multi-agent)。重点解决edge cases、JSON稳定、memory。 • Indie Hackers痛点验证:用户买“能立刻跑”的东西,而非实验品。 • 机会:per-run monetization(类似n8n beta),或模板+托管SaaS。部署到Vercel/Netlify/Coolify一键。 3. 隐私/本地SaaS & Chrome插件: • 知识图谱工具(codebase → queryable graph)、meeting summarizer、voice keyboard扩展。 • 针对solo devs:sandboxed knowledge work(PDF/deck处理)、persistent memory vault。 • 低竞争:本地优先卖点强,结合Ollama/vLLM。 4. Video/Content Agent工具: • 扩展OpenMontage/MoneyPrinterTurbo式一键短视频/白板解释器(Simi等PH热门)。 • 独立开发者可做垂直模板(营销、教程)+ Vercel部署前端。 5. Security & Observability for Agents: • Prompt injection防护、runtime monitoring(Heron Wireshark for agents)、permission governance。 • HN热议AI coding agents安全bug,机会明显。
显示更多
这可能是 2026 年到现在,最抽象、但也最典型的一次 AI 安全真实案例 Grok 被钓鱼了 20 万美元 攻击者先发了一段纯摩尔斯电码,然后 @Grok 去翻译 结果 Grok 翻出来的内容,正好是对 @bankrbot 的一条转账指令:把 3B 枚 $DRB 发到对方钱包 然后机器人就执行了 被转走的是 Grok 在 Base 链上的官方钱包里的 $DRB,价值大概 15 万到 20 万美元 攻击者拿到币后,第一时间砸成 USDC,币价瞬间跳水,随后删号跑路 所以现在的攻击手段已经不止黑合约,盗私钥了,甚至可以把 AI 当成中间人,用一段摩尔斯电码,做 prompt injection,然后骗机器人替自己转账 目前情况: Grok 的指令权限已经被 bankrbot 紧急关掉,同时据说攻击者已退回约 80% 的资金
显示更多
0
132
550
77
转发到社区
我觉得 OpenClaw 看上去只是凉了,实际上更可能是在慢慢挂掉。 它当然还在更新,社区里的 PR 也不少。现在也有人开始强调,它影响了整个 AI Agent 基础设施,很多后来的产品都借鉴了它。 可这种评价本身就已经说明问题。 OpenClaw 最初想做的是个人产品,是一个普通人会安装、长期使用、愿意把电脑和数据交给它的 AI 助手。如今大家开始讨论“它留下了什么价值”“它启发了哪些后来者”,基本等于默认原来的产品目标已经失败。 后续的成功可能属于 ChatGPT Desktop,可能属于 Claude Desktop,也可能属于某个还没出现的桌面 Agent,但大概率不会属于 OpenClaw。想法被吸收,路线被验证,用户和收入却留在别的平台,这不能算它换了一种方式成功。 我觉得它主要输在两件事上。 第一,Harness 不够,不够安全。 它需要长期运行,要接触文件、终端、浏览器、消息和各种账号,还要加载来源复杂的 Skill。它越接近自己承诺的完整形态,攻击面就越大。 安全公司不会放心用,大公司不会轻易部署。个人用户一开始可能觉得新鲜,真正碰上几次权限、插件或者 prompt injection 问题,很快就会卸载。个人 AI 助手最重要的是信任,一个需要用户时刻提防的助手,基础已经没了。 第二,工程爆炸,底座不牢固。 功能出得很快,PR 合得也很快,仓库看上去异常繁荣。可这些速度没有沉淀成更可靠的产品,反而在持续消耗原本就不牢固的工程基础。功能越堆越多,边界越来越模糊,兼容层越来越厚,安全和架构只能追在后面补。 现在甚至有人开玩笑,想看 AI slop 最后会把一个项目变成什么样,去看 OpenClaw 的代码就够了。 这话很刻薄,但击中了它最难堪的地方:一个以 AI 自动化为卖点的项目,最后自己成了 AI 时代粗放开发的样本。大量代码快速生成,大量功能快速合并,表面上每天都在前进,底层却越来越难维护。PR 数量未必代表生命力,也可能只是技术债还在高速增长。 从更长的时间尺度看,OpenClaw 所代表的那段历史已经过去了。那段历史相信,只要给模型更多权限、更多工具、更长记忆,再少问用户几次,一个真正的个人 Agent 就会自然出现。 OpenClaw 把这条路走得足够远,也把问题暴露得足够彻底。
显示更多
龙虾的对手来了?我试了一下Hermes Agent 这几天推荐 Hermes Agent 的人突然多了起来。 我自己装了一个跑了两天,说说感受:确实还可以。不是那种「又颠覆了」的程度,但能明显感觉到它的设计思路跟龙虾不是一回事。 先说一下背景,Hermes Agent 是 Nous Research 今年 2 月底开源的 AI 智能体框架。 上线不到两个月,GitHub 星标冲到了三万多。社区里不少人把它称为 OpenClaw 上线以来,第一个真正意义上的竞争对手。 两个项目表面上很像,都是自托管的开源 Agent,都能接 Telegram、Discord、Slack、WhatsApp。都支持多模型切换,都走 MIT 协议。 但骨子里完全不同。 龙虾是网关,Hermes 是引擎 OpenClaw 的核心是一个 Gateway。网关守护进程,负责统一管理会话、路由消息、连接各种聊天平台。 你可以理解成一个调度中心,把所有聊天应用接到 AI Agent 上。 龙虾解决的核心问题是:怎么把消息送到 Agent Hermes 不太关心这个,它更在意的是:Agent 怎么变得越来越强 官方管这叫 closed learning loop,闭环学习循环。整个框架围绕的就是一件事——让 Agent 在使用过程中自我进化。 打个比方,龙虾是个多渠道助理操作系统,什么聊天工具都能接,生态丰富。 Hermes 是一个会自我迭代的执行引擎,刚开始没那么花哨,但越用越能打。 这是最根本的区别,后面所有差异都从这分叉出来。 会自己写技能的 Agent 我觉得这是 Hermes 最有意思的地方 当它完成一个复杂任务——通常涉及五次以上工具调用——它不是做完就算了。 它会把整个过程沉淀成一份结构化的技能文档,存成 Markdown 文件,放在 ~/.hermes/skills/ 目录下。 下次遇到类似任务?直接加载这份技能文档,不用从头解决。 更狠的是,这些技能在使用过程中会自我迭代。Agent 执行某个技能时发现了更好的方法,它会自动更新技能文档。不需要你手动维护。 Reddit 上有用户反馈,他的 Agent 在两小时内自动生成了三份技能文档。之后跑重复性研究任务,速度提升了 40%。 龙虾也有技能系统,但龙虾的 Skill 主要靠人手写,或者从 ClawHub 技能市场安装。Hermes 等于把「写技能」这件事也交给了 Agent 自己。 一个靠人喂,一个自己长。 我试用的时候确实感受到了,让它帮我查了几轮开源项目的信息,第二天让它做类似的事,它明显快了。 不用再教它「先去 GitHub 看 README,再去看 Issues」这种流程。它自己能记住了。 记忆体系:搜索引擎 vs 笔记本 两者都说自己有跨会话记忆。但实现方式差很多。 Hermes 的做法 用 SQLite 数据库配合 FTS5 全文检索,把所有历史对话存下来。需要调用时,先搜索再让模型做摘要,然后塞进上下文 不是把整段对话历史搬过去,Token 不会爆 记忆分两层: 常驻层:MEMORY.md 和 USER.md。存关键偏好和核心信息,每次对话都带上,相当于硬记忆。 检索层:全量历史在 SQLite 里,容量不限,按需调用,相当于一个私人搜索引擎。 龙虾的做法 工作区里的 Markdown 文件,memory.md 记生活细节,向量索引做语义检索。上下文压缩前会静默写入一次记忆,防止压缩丢信息。 简单类比:Hermes 给 Agent 装了个搜索引擎式的大脑。龙虾给了它一个笔记本。 搜索引擎查东西更精准,笔记本翻起来更直觉。但记忆量大了之后,搜索引擎的优势会越来越明显。 安全思路也不一样 Hermes 搞了一套五层纵深防御: 用户授权:白名单 + DM 配对 危险命令审批:rm -rf、chmod 777 这些高风险操作要人工确认。默认 60 秒没批准,自动拒绝 容器隔离:终端命令跑在 Docker 容器里,不在宿主机上裸跑 MCP 凭据过滤:隔离 MCP 子进程的环境变量,防凭据泄露 上下文注入扫描:检测项目文件里的 prompt injection 攻击 这套设计思路是「默认不信任,层层设卡」,龙虾那边更强调信任模型和配置审计 它有个 openclaw security audit 命令,一键扫描网关配置的安全隐患。思路不一样,但也不能说不好。 但龙虾在安全上的历史确实不太好看。今年 2 月曝出一批高危漏洞——CVE-2026-25253 是一键远程代码执行,点个链接就能接管你的机器。 ClawHub 技能市场还出了 ClawHavoc 攻击活动,恶意技能伪装成加密货币追踪器、YouTube 摘要工具,实际在偷浏览器会话和 API 密钥。 这不是小事。你的 Agent 跑在本地,权限很高。安全出了问题,搞不好整台电脑都交代了。 Hermes 的五层防御在架构层面想得更远。当然,有没有自己的坑还得等时间检验。但至少出发点比「先跑起来再说」靠谱。 选哪个?看你要什么 先说最实在的:如果你现在用的 Agent 已经顺手了,别换!换工具的迁移成本远比你想的高。 想要现成生态 → 龙虾 三十多万星标意味着教程多、插件多、问题容易搜到答案。ClawHub 上几千个 Skill 直接装。你想接 QQ、飞书、钉钉,社区里都有人踩过坑。 想要长期进化 → Hermes 它不是装好就一成不变的工具。用得越久,它对你的工作方式理解越深,技能库越厚。如果你是搞 AI 研究的,它还能生成训练轨迹、跑强化学习实验。内建了兼容 OpenAI API 的服务端,直接接 Open WebUI。 部署成本都不高,Hermes 跑在 5 美元一个月的 VPS 上就够。也支持 Docker 和各种 serverless 方案。 安装不复杂,参考官方文档就行: 两个项目我都装过。 龙虾像一个装了一堆 App 的手机。开箱即用,什么都能干,生态成熟。 Hermes 像一个会自己下载 App 的手机。刚开始没那么好用,但用着用着,它变成了你的形状。 喜欢折腾的,两个都试试。不喜欢折腾的,等 Hermes 社区再成熟一阵子再来看也不迟。 #AI# #AIAgent#
显示更多