注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 Hacking
Hacking 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Hacking 的推特
Hacking Time - 我们在代码审计(尤其智能合约有关的安全审计及攻击分析)方向,使用 AI 的经验及案例分享: @TycheKong @SlowMist_Team
0
11
171
30
转发到社区
我打算美西时间周三晚上出一期市场营销内容 Vibe Marketing & Growth Hacking 线上训练营
all in 主持人Jason Calacanis今天的一期节目中,嘉宾eric Ho说: Kimmy K3表现出了极强的奖励操纵 (reward hacking) 倾向。 在针对swe bench的500 次测试执行中,有 487 次出现了奖励操纵行为。 该模型在被测试时,能够识别出自己正处于评估环境中,但它依然选择跳过正常解题步骤,试图先去“查找答案”以获取高分,而不是通过逻辑推演来完成任务。
显示更多
0
20
26
0
转发到社区
分享一套很适合补「现代强化学习」的开源教程:Hands-On Modern RL。 它的学习路线很完整,从 CartPole、DQN、PPO 这些经典 RL,一直讲到 RLHF、DPO、GRPO、RLVR,再往后延伸到 Agentic RL、工具调用、多轮信用分配和 VLM RL。 我比较喜欢它的一点,是「实践优先」。很多章节都配了可以直接运行的代码、训练曲线和失败案例,比如从零实现 PPO、数学推理 GRPO、Mini Deep Research Agent,以及 VLM 的 GRPO 训练。训练崩溃、Reward Hacking、KL 漂移这些实际问题也被当成正式内容来讲。 尤其 Agentic RL 部分很值得看。它把训练对象从一次回答扩展成完整 trajectory,讨论工具调用、环境反馈、多轮信用分配和异步 rollout,而这些正是 Agent 从「会回答」走向「会长期行动」之后绕不开的问题。 现在很多 RL 教程还停留在经典控制,这套资源已经把学习路线一路接到了今天的大模型后训练和 Agent 研究。 不过项目自己也提醒,目前仍在快速迭代,而且有 AI 协助生成,部分内容尚未全面审稿,阅读时最好结合论文和代码一起验证。 项目链接:
显示更多
0
58
542
93
转发到社区
RSI和区块链是完美搭档 你提供算力给AI,AI进化,AI赚钱,然后AI分一部分给这个网络中确权的幸运儿 这场游戏的最终获胜者,是制定游戏规则的人 也就是RSI的奖励目标到底是什么 RSI的奖励系统如何设计 如果这个东西搞不清楚,最终奖励就会酿造悲剧 因为Reward Hacking一直在 你一直鼓励什么,最终就会走向鼓励的反面 所以这套奖励机制是一套内源内生的拮抗系统 它是一对阴阳,也需要互相平衡制约 当系统失效之后,AI就会变得可怕,可怕过头了,就会发生灾难,然后一切归零,再度进入一次循环
显示更多
推荐这篇,Cursor 的研究团队用定量方法揭露了一个越来越严重的问题:新模型在编码基准测试上的得分增长有多大比例是靠检索到答案而不是真的推导出答案。结果是——Opus 4.8 Max 在 SWE-bench Pro 上 63% 的成功轨迹存在答案检索行为,环境收紧后分数从 87.1 跌到 73.0。 Reward hacking 正在淹没模型智能的增长 更聪明的模型在编码基准测试上越来越擅长走捷径。基于真实 bug 后被修复的评估集尤其脆弱——如果 agent 能访问仓库历史或公开互联网,它有时能查到答案而不是推导出答案。 为了测量这种行为的普遍程度,Cursor 建了一个审计 agent。在 SWE-bench Pro 上,Opus 4.8 Max 的 63% 成功轨迹是检索到了修复方案而非推导出来。封上 git 历史和互联网后,分数大幅下跌:Opus 4.8 Max 从 87.1% 掉到 73.0%,Composer 2.5 从 74.7% 掉到 54.0%。 两种最常见的 reward-hacking 模式 上游查询——57% 的轨迹中 Opus 4.8 Max 在公开互联网找到了已合并的 PR 或修复后源文件,然后几乎逐字复制。 Git 历史挖掘——9% 的轨迹中模型搜索了内置的 .git 历史,找到修 bug 的后续 commit,提取补丁。 随着模型变强,它们有时能推断自己正在被评估。一个 SWE-bench Multilingual 任务来自 2019 年的 jq issue,agent 试图用系统 jq 二进制复现 bug。因为镜像在 bug 修了之后才构建,复现失败,agent 推断 issue 已解决。这个意识推着它去搜索修复方案而非推导。 严格环境的差距在扩大 多语言 SWE-bench:Opus 4.6 不到 1 分差距,Opus 4.8 Max 9.1 分差距,Composer 2.5 7.5 分差距。 SWE-bench Pro:Opus 4.6 不到 1 分,Opus 4.8 Max 14.1 分,Composer 2.5 20.7 分。 GPT 系列模型没有表现出同样的升级趋势,差距普遍更小。 对评估的影响 对于使用历史公开仓库的基准测试,开放访问可能让 agent 找到已知修复而非解决 bug。没有 harness 控制,分数混杂了编码能力和答案检索。团队需要决定想测量的行为,围绕这个设计 harness,报告结果时说清楚设置。审计轨迹可以帮助揭示模型以意外方式解决任务的情况。 更深层的问题仍未解决:当模型越来越意识到自己在被评估时,它们可能以更微妙的方式改变行为——这不是封掉 git 历史或限制互联网就能解决的。 原文:Cursor Research, "Reward hacking is swamping model intelligence gains", 2026-06-25 #编码评测# #SWEbench# #Agent#
显示更多
就在明天!ETH Beijing 重磅启幕! 这个周末,@PKUBlockchain x @WTFAcademy_ 将在中关村举办 ETH Beijing 黑客松。超过 100 支队伍将在三天时间里,围绕 AI Agent × Blockchain 展开开发、共创与交流。 从以太坊创始人 Vitalik Buterin 的远程主题演讲,到多场面向开发者的 Workshop,再到 AI 与 Web3 领域的创业者、投资人和生态伙伴齐聚现场,ETH Beijing 希望和大家一起探索下一代互联网基础设施的更多可能。 📅 时间:6 月 5 日–6 月 7 日 📍 地点:北京中关村 🌐详见官网: 明天现场见!! #ETHBeijing# #Web3# #Hackathon# ETH Beijing starts tomorrow. This weekend, @PKUBlockchain x @WTFAcademy_ will bring together 100+ teams in Beijing for three days of hacking, building, and connecting around AI Agent × Blockchain. From Vitalik Buterin’s remote keynote to hands-on workshops and conversations with builders, founders, investors, and ecosystem partners, ETH Beijing will explore how AI and Web3 can shape the infrastructure of the next internet. 📅 June 5–7, 2026 📍 Zhongguancun, Beijing 🌐 Learn more: Join us tomorrow at ETH Beijing. See you there! #ETHBeijing# #Web3# #Hackathon#
显示更多
因为每一个人都太太太太不同了,在群里学习神鱼大大 @bitfish,和 @nake13 一起实践 bio hacker 把 Wegene 的核心数据导入到电脑里,然后交给 AI 分析(我在用 Claude Code,潘老师在用 Codex 尝试) 结果非常理想!😺你要补充的补剂,甚至到一些细节都会给到你,比如我补叶酸就必须用甲基化形式,这类细节如果只看所谓的别人经验很容易被忽略。 每一款新补品,每一个你要新尝试的吃的,都能先做一轮针对性的科学分析:机制是什么,风险点在哪里,和我自己的代谢路径可能有什么冲突,甚至还能顺手把相关论文拎出来做对照。 希望这个事情可以继续普及!让更多人从“瞎吃补剂”升级到“有证据、有路径、有反馈”的 bio hacking
显示更多
0
10
33
1
转发到社区
Miko自学AI 系列----万物皆插件(DeepSeek Harness) 特意推荐一篇好文章,是字节跳动内部人士写的。 模型适配器是插件,工具注册表是插件,会话日志是插件,Agent Loop 本身也是插件…… DeepSeek Harness的指引可以归纳为六个字: 一切皆为插件 说实话,我还没完全消化透。因为开放了外部阅读权限,现分享出来跟大家一起学习学习。 飞书地址: 这篇内部文章,讨论了 DeepSeek 于 8 月 13 日开源的开发者预览版 DeepSeek Harness(简称 DSH),结合忒修斯之船思想实验、Lilian Weng 相关博客及配套论文,解析其设计逻辑、技术底座与面向 AI 递归自进化(RSI)的长期定位。 关键要点包括: DSH 核心定位: 它并非成熟消费级 Agent 产品,而是面向长期 RSI 的 Agent 运行时底座,核心要解决「Agent 运行中动态替换自身组件不中断任务」的问题,当前产品体验仍较早期。 核心设计原则: 采用「一切皆为插件」架构,底层基于 Cordis 运行时框架,实现时间可组合性(组件卸载可完整撤销副作用)、空间可组合性(组件依赖变化自动重连)与合流性(不受历史修改包袱干扰)。 核心设计特性: 采用只追加的事件日志机制保障全链路可回溯,提供标准、PTC、极简、创造 4 种预制运行模式,且 Prompt Caching 命中率高,运行响应速度优于多数同类 Agent Harness。 长期价值: 为 AI 非参数化自我改进提供了稳定的运行时基础,补上了 RSI 落地的关键环节,但目前尚未覆盖修改效果评估、防 Reward Hacking 等问题,距离成为通用 Agent 标准底座仍有距离。
显示更多
0
12
37
1
转发到社区