注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 Replay
Replay 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Replay 的推特
CodeX App 新推出的这个插件 Record and Replay,功能十分的逆天呀! 基本上可以实现桌面自动化:你在桌面录制一遍自己的操作过程,它就能给你转成“技能”。以后只要是桌面上可以操作的,比如说发公众号文章之类的,全部都可以实现自动化。
显示更多
RPA 也要进入 AI 时代了 Codex 推出 Record & Replay 插件 你操作一遍,Codex 就能学会 说实话,看到这个功能有些感慨 这可能会让整个 RPA 软件行业迎来一次大地震 当 AI 开始覆盖你的业务流程时,你该怎么办?
显示更多
吴说获悉,硬件钱包厂商 Ledger 就 BIP-110 潜在分叉发布安全提醒称,BIP-110 是一项未内置重放保护(replay protection)的比特币软分叉方案,如果形成独立链,BTC 持有者可能在新链获得相同数量的对应资产,但两条链初期可能接受相同签名交易。用户若尝试转移或出售 BIP-110 链上的资产,相关交易可能被“重放”至比特币主链,导致对应 BTC 同时被转出。Ledger 表示,其设备在技术上可以签署相关交易,但建议在重放保护机制加入前不要领取或操作 BIP-110 分叉币。
显示更多
Halborn 要审 Alkanes,而且明确说是 Bitcoin metaprotocol + indexer,这个定性我觉得很关键。 BTC L1 资产协议最难的地方,不只是合约逻辑本身,而是不同节点能不能从同一段 Bitcoin 历史里 replay 出同一个协议状态。 这也是我最近在本机跑 Bitcoin full node + Alkanes full index 的原因。 我不想只看 UI 或第三方 API 给出来的结果。 我更想自己从原始链数据往上验证 state transition、trace、余额、失败调用和流动性变化。 如果 BTC DeFi 真的起来,优势不会只是“谁先发现下一个 ticker”。 真正的壁垒会是:谁拥有自己的数据层。
显示更多
0
15
25
3
转发到社区
特斯拉已经从图片学习向动态视觉学习大模型转变,OpenClaw和codex开始向动作过程学习转变,AI的学习能力会无限进化到比人类聪明而比人类能干。 :Codex新出的Record & Replay是我今年见到最牛逼的功能,没有之一!以前,你需要通过文字描述创建Skills。现在,你只需要操作一遍,Codex会全部录下来,然后分析每步操作的逻辑,最后自动生成可重复使用的Skills。这个对于AI学习人类技能有非常大的促进!
显示更多
我也是服了,最近真累。左手维权megaeth,右手绞杀脚本。 撸毛的老师不要再写脚本fake 前端状态提交了。@axisrobotics 虽然是可以提交成功的。但是通过不了后端轨迹的replay验证。 最后数据还是会被rejected,白白浪费我们大量服务器资源做数据verification。用脚本提交的假数据也会导致账号被封啊。 何必呢,老师。
显示更多
0
112
43
3
转发到社区
继续分享今天的Manus使用实例。 起因是看到有媒体转载了A16z刚刚更新的Web端AI应用50强,编辑用红圈标出了其中的国产AI应用,用以佐证赢麻了的主题。(图1) 这就是我说小厂千万不要害怕营销风评的原因,在很多时候你连曝光权都不会得到平等对待,编辑只认得大厂出品的图标和名字,但实际上这里图还有一堆中国公司推出的AI产品,就这么被开除国籍了。 那么,如果要核实这里面到底有几家中国公司,怎么办?Claude会用知识库的截止日期来做筛选,Grok 3的Deep Research轮次不够,OpenAI的Operator应该可以但200美金我是真没开,最后用Manus解决回放在这里你们可以自己看: manus点im/share/AppolsjmuwQW9EevzVrRlN?replay=1 manus点im/share/KJDn3CJL4kVXBXiV0mANeU?replay=1 我的指令词是:「这张图上有50款AI产品,请确定其中哪些产品是由中国公司推出的,不要遗漏也不要偷懒,老老实实的对每一家公司进行核实,最后给我一份报告。」 这是一个纯体力活,如果给人(实习生)来做,就是让他把每一家公司的名字写下来,然后一家家的去查,最后给出一个报告,券商之类的机构把工作拆解到执行端,都是这么干的。 AI Agent至少能够起到等量价值,Manus的todo列得很清晰,先用OCR提取图片文本,列出1-50家公司,接着一家家的去做查询,包括搜索关键词、访问官网、确认总部、了解新闻、甚至阅读LindIn,最终告诉我列表里实际上有12款由中国公司推出的产品。(图2) 这个交付成果我是认的,有些带争议的判断,比如它没有把PixAI算进去,是因为PixAI本身总部就设在新加坡,实控团队在国内的消息比较隐蔽,按Manus给自己定的验证标准来看不算遗漏。 这么说吧,如果你要解决类似的需求,你是自己机械性的操作几个小时,不停的开关窗口更新文档,还是把活儿丢给AI Agent牛马去干,只负责验收结果? 另外,从实测体感出发,「不要遗漏也不要偷懒,老老实实的对每一家公司进行核实」这句话也是必加的,原因和我前几天说的模型偷懒本能有关,不刻意强调的话很容易被AI偷工减料。 就像以前的提示词技巧会有情绪勒索的偏方,比如说你要是不认真回答这个世界就会有一个无辜的人死去,然后立竿见影的AI就会用心多了,后来几次训练迭代之后AI已经变聪明了,情绪勒索不再管用,但「请调用你的单次Token消耗上限」这样的明确命令还是偶尔能有奇效。 这次任务也超出了Manus的单任务算力上限,所以拆成了2次完成的,还是那句话,AI Agent发展路上的最大拦路虎,永远是计算资源的分配,芯片会是个好生意,而且不应该只是英伟达的好生意。
显示更多
0
12
118
26
转发到社区
翁家翌新 blog:超越梯度的学习 昨天看到翁家翌(前 OpenAI 研究员)新写了一篇 blog《Learning Beyond Gradients》,挺有意思的,分享一些我读下来的感受。 原文较长且偏技术,下面这版做了不少删减和重组,建议感兴趣的同学直接读原文 · · · 翁家翌:超越梯度的学习 持续学习(Continual Learning)之所以一直很难,很大程度上是因为神经网络的顽疾:灾难性遗忘。那如果我们不只盯着权重更新这一条路呢? 随着 LLM agent 越来越强,写代码这件事变得又快又好。但翁家翌注意到一个更有趣的现象:agent 可以反复读取失败信息、修改策略代码、添加测试、回放录像,让整套程序在不动任何网络权重的情况下持续变强。 · · · 这个视角让他重新审视了一个老朋友:heuristic,也就是手写规则和程序化策略。之前很多 heuristic 不是没用,而是维护太贵了,而coding agent 改变的正是这条维护曲线。那些曾经用完就扔的一次性补丁,开始变得值得长期拥有。 凡是能被持续迭代的东西,都开始变得更可解,这也恰恰是持续学习一直追求的目标。 它有没有可能成为继 pretraining → RLHF → 大规模 RL/RLVR 之后的下一个范式? · · · 翁家翌用 Codex(gpt-5.4)做了实验,纯写规则版本,完全不碰神经网络。结果超出预期: — Atari Breakout 的打砖块分数从 387 一路升到 864,达到理论最高分; — MuJoCo 四足和跑步机器人任务中,纯 Python 策略也跑进了常见 Deep RL 结果的量级,HalfCheetah 五轮均值 11836.7; — 跑完 Atari 全部 57 个游戏后,在相同的环境交互步数下,中位数得分已经远高于 PPO 这类标准算法。 这里被更新的对象早就不是单纯的策略函数了,而是一整套带着记忆、反馈入口和回归机制的软件系统。翁家翌把它叫作 Heuristic Learning(HL,启发式学习)。 (我自己也做过 evolve,但不训练神经网络,纯靠规则约束,感觉系统怎么都智能不起来。其实不管 RL 还是 HL,能不能跑起来都是看一件事,优化结果的评分能不能清晰定义。) · · · Heuristic Learning(HL) 是什么?HL 怎么持续学习? HL 的核心是用 coding agent 维护一个 Heuristic System(HS)。 和 Deep RL 的差异: — 反馈来源:不是 loss 函数,而是测试结果、环境奖励、日志、视频、失败模式分析; — 更新方式:不走反向传播,agent 直接改 policy、状态检测器、测试、配置或记忆结构; — 维护对象:不止一个 trace(黄金轨迹)、环境 wrapper 等。 以前怎么没人搞?专家系统 70 年代就有,但人维护起来是噩梦:加一条规则修好 case A,case B 崩了;规则堆到几百条后,除了原作者没人看得懂。 而 coding agent 不怕堆规则。它能同时读所有代码、跑全量测试、对比日志,把维护成本打下来。用翁的比喻说,就像纺纱机改变纺线成本曲线一样:手工纺贵得要死,机器一上来就塌掉了。 · · · Heuristic Learning 怎么做 Continual Learning 神经网络把经验压进权重,忘没忘、怎么忘的都是黑箱。HL 的历史则是显式的:版本 diff、回归测试、replay、视频、golden trace 全透明。新增能力前先固化旧能力:跑回归测试、跑固定种子回放。如果新规则破坏旧 case,agent 能直接定位到哪行代码引入的 regression。 但规则叠太多、agent 自己都维护不动的时候,就需要"历史压缩",把一堆 case-specific 的补丁合并成更通用的逻辑,否则系统迟早变成没人敢碰的代码泥球。 · · · 当然,HL 不是万能药。因为 Heuristic Learning 并不能做所有神经网络能做的事情。它的上限卡在代码的表达能力:比如复杂感知和长程泛化。翁家翌也坦率地说,他想不出有哪个 agent 能纯靠 Python、不用网络去搞定 ImageNet。 所以真正的问题变成了:怎么把神经网络和 HL 结合起来,同时搞定在线学习和持续学习? 最有希望的方向是:用 HL 快速处理在线数据,把在线经验变成可训练、可回归、可筛选的数据,再周期性地更新神经网络。以机器人为例,借用 System 1 / System 2 的说法,一种可能的分工是: — 专用浅层 NN 作为 System 1 的一部分:快、便宜,负责感知、分类、物体状态估计; — HL 也可以当做 System 1 的一部分:负责最新数据处理、规则、测试、回放、memory、安全边界、局部恢复; — LLM agent 作为 System 2:负责给 HL 提供反馈、改进数据,并周期性把 HL 生成的数据拿过来更新自己。 · · · Agentic coding 改变的不仅是写代码的速度,更改变了"哪些代码值得被长期拥有"。过去很多 heuristic 看上去没前途,不是它们太弱,而是维护不起。 coding agent 改变的就是这条维护成本曲线。 规则、测试、日志、记忆和补丁,原来只是散落的工程材料,现在开始能组成一个持续进化的 Heuristic System,去解决在线学习和持续学习一直没搞定的事。 欢迎来到下一个范式。 · so,skills + instruction following = AGI?
显示更多
0
1
171
41
转发到社区
日读论文: From Context to Skills: Can Language Models Learn from Context Skillfully? (Ctx2Skill) 互斗写书,越斗越偏 ──────── 医生想用一份刚出的临床指南调整治疗方案。50 页文档,密密麻麻全是术语,规则之间还交叉引用。他真正需要的是把"什么病合什么药"变成几条能照着走的步骤。直接把整份指南扔给 GPT-5.1 让它答题,全 benchmark 平均对率 21%——大模型读完了,用不出来。这不是它"长上下文"不行,是 *它没把规则提炼成可以反复调用的小手册*。 老办法是把人类标注员请来给文档画重点:把规则、流程、注意事项提炼成自然语言"技能",附在 prompt 前面给模型用。但这条路有两个死结:一是*标注成本爆炸*——50 页技术文档,标注员要把整套领域逻辑读到能复述,几小时才标一份;500 份这么搞,人累死也搞不完。二是*没有外部反馈*——如果想让 AI 自动写技能,怎么验证它提炼对了?没有 ground truth、没有执行结果、没有标准答案,它瞎写你都不知道。已有的"自动写技能"方法(AutoSkill、SkillX 等)都需要环境给反馈信号——比如"代码跑出来对不对""任务完成没"——可面对一份纯文档,没人替你判对错。 作者说不需要外人。让模型自己跟自己打——一个出题,一个解题,第三方判 pass/fail。每一回合,错题让解题方反省"我漏了什么知识",过得太轻松的题让出题方反省"我出题不够刁"。两边各自维护一份自然语言的"技能手册",回合结束之后改写各自的手册。这套循环不依赖人类标注,也不依赖任务本身的对错反馈—— *只用模型互相之间的胜负就能把技能写出来*。 ──────── 按常识,5 个回合互相磨练完,第 5 回合的 Reasoner 手册应该最强吧? 错。论文做了固定回合的对照实验(GPT-4.1):*单调下降*。越练越差。 为什么?作者起了个名字: *adversarial collapse*——对抗坍缩。Challenger 越来越凶,开始出"考钻牛角尖"的题;Reasoner 为了应付这些极端题,把手册改得越来越歪——专为对付怪题而存在的条目挤掉了通用知识。两边都在围着一个不代表真实任务分布的"病态点"打转。 更阴险的是, *这种崩塌在循环内部察觉不到*——Judge 每一回合只看当前题,没有信号告诉你"之前学会的事是不是被新条目挤丢了"。 ** 怎么找回早期的好手册:Cross-Time Replay 既然不能信"最后一版",得回头挑。但凭什么挑? 办法:在 5 个回合里偷偷攒两套小探针—— - *Hard probe*:每回合败得最惨(评分点通过率最低)的那道题 - *Easy probe*:每回合解得最轻松(评分点最少)的那道题 循环跑完,把 5 个版本的 Reasoner 手册*回去重做*这两套探针。每个版本算两个分:在难题集上的解题率 ρ_h、在易题集上的解题率 ρ_e。 *选哪一版?* 让 ρ_h × ρ_e 最大的那一版赢。 为什么是乘积不是相加?*乘积惩罚"舍弱保强"*——一个版本如果为了多解几道难题、把易题做塌了,乘积立刻塌(一个 0 拉低全场);加法只算总分,掩盖短板。消融:换成加法 → -0.6%。 ──────── *你的对手如果只服你一个人,他会变成你的镜子,不是你的镜鉴*。 Self-play 跑久了,Challenger 出的题不再代表真实世界,只代表 Reasoner 当下还不会的边角;Reasoner 的手册也不再是知识,只是这场私局的应试手册。两个人在屋里关久了,一起走进自己造的回音壁。 破解的办法不在循环里——*在循环之外保留一份"代表性参照"*,回头挑哪一版没飘走。Cross-Time Replay 是这个论文真正的灵魂,不是某个技术细节。它在说:*对抗优化必须配一个不参与对抗的判别器*,否则一定会塌。这个判别器不一定是人,可以是从对抗自己内部偷出来的、有代表性的小样本——但它必须独立于"当下这一刻在追什么"。
显示更多