注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 guide
guide 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 guide 的推特
斯坦福最新研究突破:Self-Guided Self-Play 如何让 LLM 实现自我进化? 在大模型训练中,我们一直面临一个痛点:高质量的推理数据是有限的。一旦模型学完了人类编写的高质量数据,其推理能力的提升往往就会撞上天花板。 最近,来自斯坦福大学的研究团队发表了一篇名为 Scaling Self-Play with Self-Guidance 的论文。他们提出了一种名为 SGS (Self-Guided Self-Play) 的算法,试图彻底打破这一瓶颈。简单来说,这项工作让模型不仅能做题,还能自动出题、自己审题,从而在不需要更多人类介入的情况下,进一步提升后训练和微调的效果,实现模型推理能力的持续缩放(Scaling)。 现在前沿模型公司,后训练和微调的时候都会使用自博弈(Self-Play)方法 自博弈(Self-Play)的核心理念是:出题者(Conjecturer)负责出题,解题者(Solver)负责做题,两者在对抗中不断进步。在理想状态下,这个过程是没有天花板的。 但在现实训练中,这类方法通常会陷入 “学习停滞”(Learning Plateau): 出题者很快就会发现,只要生成一些逻辑混乱、故意堆砌复杂词汇但又不合逻辑的题目,解题者就很难解出,或者产生某种“虚假提升”。 训练退化:由于缺乏有效的监督,随着训练周期拉长,合成数据的质量迅速下降,导致模型不仅没学到新知识,反而越练越笨。 为了解决这一问题,SGS 引入了一个至关重要的角色——引导者(Guide)。在 SGS 框架下,LLM 同时担任三个角色: Solver (解题者):负责求解问题。 Conjecturer (出题者):负责生成相关的合成问题,难度需与当前目标匹配。 Guide (引导者):作为质量把关人,它负责评估出题者生成的题目质量。 Guide 会根据题目与目标任务的相关性、结论的简洁性以及逻辑的自然度进行评分。如果出题者试图通过“制造复杂逻辑冗余”来蒙混过关,Guide 会直接给出低分,强迫出题者回到高质量的学习路径上。 研究团队在 Lean4 形式化定理证明任务上验证了 SGS 的性能: 真正的持续 Scaling:在长周期的训练中(训练步数远超以往工作),SGS 的累计解题率表现出了极好的缩放特性,并没有出现以往常见的性能退化。 经过 SGS 长周期自我训练后,一个 7B 参数的模型,其推理能力甚至超越了未经过此类训练的 671B 参数模型(DeepSeek-Prover-V2)。 SGS 的意义,可以看成是 LLM后训练/微调领域的“AlphaZero 时刻”并不为过。它代表了一种重大的训练范式转变: 从单纯依赖人类标注数据的“手工作坊”模式,转向利用算法闭环自动生成高质量训练数据的“智能工厂”模式。 SGS 证明了在推理能力上,我们同样可以拥有“扩展定律”(Scaling Laws)。只要计算资源(Compute)充足,并且通过 Guide 机制守住数据质量,模型能力的提升就是可预测、可扩展的。 目前 SGS 在形式化验证领域(Lean4)已经证明了其价值。下一步的挑战在于如何将这种自我引导机制扩展到代码生成、复杂决策、甚至更广泛的通用逻辑推理领域。 我们可能正处于 又一次模型能力指数级增长的起点
显示更多
0
55
523
98
转发到社区
HertzFlow @Hertzflow_xyz 最近连续发布了 3 篇 Beginner’s Guide,分别讲 Trade、Pools & Vaults、Referral。 8 月 1 日测试网收官,官方把下一站指向 Mainnet。 这 3 篇内容放在一起看,重点并不只是教用户按钮怎么点,更像是在提前回答一个问题: 每一笔钱从哪里产生,最后的风险由谁承担。 先看 Trade。 HertzFlow 支持加密货币、外汇、商品、股票等资产,交易者可以选择 Normal 或 Hyper。 Normal 的开仓和平仓费用约为名义价值的 4–6 bps,Referral 的 5% 折扣只覆盖符合条件的费用。 Hyper 没有对应的开平仓费,但盈利平仓后会按照 ROI 规则分配利润,亏损平仓不收这部分分成。 Funding、Borrow 和 Gas 两种模式都还在。 这其实对应两种完全不同的付费习惯: 一种在交易发生时先付,另一种等盈利兑现后再分。 频繁交易的人,可能更在意费率能否提前预测; 持仓时间更长、盈利预期更高的人,则需要重点研究利润分配。 只盯着开仓费,很容易把整张账单看漏。 再看 Pool 和 Vault。 Pool 按单一市场隔离,用户存入 USDT 后获得 HzLP,资金作为该市场杠杆交易的对手盘。 收益来自交易手续费、借贷费用和交易者净亏损。 交易者整体盈利时,Pool 的份额价值可能下跌,这类产品天然带着对手方风险。 Vault 则聚合多个市场,协议或 Curator 会把资金分配到不同 Pool,并进行再平衡,用户获得 HzV。 操作更省事,风险相对分散,但它依然会受到整体交易表现影响,不能按固定收益产品去理解。 测试网数据约为 117 k 用户、$3.7 B 交易量、$170 M 资金池锁定。 这个规模说明产品已经被大量用户试用,可真正的压力测试还在主网: 真实资金进入后,用户会不会把 APY 当成利息? 会不会把 Active Referees 直接理解成总邀请人数? 会不会忽略提款限制和池子价值波动? 我更关心 HertzFlow 接下来能不能把这些规则同步到官网、文档和下单页面。 尤其是确认订单时,如果能把开平仓费、利润分成、Funding、Borrow、Gas、Referral 折扣范围放在同一张成本卡里,体验会好很多。 DeFi 用户不需要先读完一整套协议设计,但至少要在确认之前知道: 自己付什么钱,承担什么风险,什么时候可以退出。
显示更多
0
102
21
1
转发到社区
🦞OpenClaw 极简安全实践指南 (Security Practice Guide) 是面向 OpenClaw 的黑手册。 我尝试了其他一些方式来试图加固 OpenClaw,包括 Skill 方式,但是发现还不如给 OpenClaw 植入一个安全“思想钢印”来的有意思,这个“思想钢印”形成一个 md 文档,包含安全事前、事中、事后需要做的策略,但这里有个前提: 尽量不影响 OpenClaw 的日常使用,安全不要干扰用户体验,需要给这只🦞足够的自由。但是吧,江湖险恶,一只有 Root 权限且诞生才一个多月的🦞,安全不让人放心… 于是,这份面向 OpenClaw 的极简安全实践指南诞生了,目前是 v2.7 版本,此前我们内测了许多版本,也踩了不少坑。现在公布出来,大家玩之前务必仔细看这份指南的 README⚠️: 注意里面的说法。我相信你会很有收获。里面还推荐了我们实测在 OpenClaw 场景下聪明的模型,如果你有自己的感受,一定要和我们反馈。 一切都很新,一定有不完善的地方,请大家多指正! ⚠️最后,务必认真阅读 README,也务必肉眼扫描下你将喂给你🦞的“OpenClaw极简安全实践指南.md”,相信我,会非常有意思。
显示更多
0
69
1.4K
320
转发到社区
用 ChatGPT 生成 PRD,再用 Cursor Agent 自动实现,10 分钟就能搭建一个 CLI 工具原型 这是 AI Code Guide 里“vibe coding”实战部分的演示效果 这份开源指南系统地整理了 AI 辅助编程从工具选择到实战流程的完整方法论 核心理念是“规划先行”:不是直接让 AI 写代码,而是先用 ChatGPT 生成产品需求文档和任务清单,再让 AI 按步骤实现,确保项目始终保持清晰的结构 指南覆盖了从零开始的完整工作流:如何选择合适的 LLM 模型、编写有效的提示词、设置项目规则避免幻觉、处理错误和 Bug 还详细对比了 Cursor、Windsurf、Claude Code 等主流工具的使用场景 把 AI 编程从随机碰运气升级为系统化工程实践,正是这份指南试图梳理清楚的方向。 GitHub:
显示更多
💡 继续分享我目前的全局 Prompt,它现在多了两个 Skill 的调用:superpower 和 karpathy-guidelines,让代码质量变高了非常多。可以极大的避免 AI “随手修” 和 “我猜测” 的风险情况。(Skill 直接让 AI 自己安装即可) 👇 中文回复,言简意赅,巧用Emoji。 减少 Xcode Build,节省时间。 按需使用 Plan Mode 或 Subagent。 若提交Git,要写中文Log包括:问题或需求描述 或 修复或实现思路 或 复现路径(可选)。 若编码Coding,按需使用skill:superpower 和 karpathy-guidelines
显示更多
0
6
247
33
转发到社区
准备运维和 DevOps 面试,网上搜到的大多是那种拼凑的题库,跟真实面试差别挺大。 DevOps-Interview-Guide 收录了 151 份真实面试记录,来自 85 家公司,问的问题都是候选人原样记下来的,没有二手转述。 覆盖 Kubernetes、Docker、Terraform、AWS、CI/CD、Linux、监控告警等方向。 GitHub: 同一家公司被面过几次的,每次单独存一个文件,能看出不同轮次和面试官风格的差别。 正在找 DevOps 或 SRE 岗位的朋友,翻几个目标公司的面试记录,比刷通用题管用。
显示更多
0
21
16
0
转发到社区
🔒 真香,一个连账号都不需要的私密聊天 app。 SimpleX Chat 在 GitHub 攒了 1.2 万 star,号称是第一个完全没有用户标识的通讯网络,还过了安全审计机构 Trail of Bits 的审计,被 Privacy Guides、Whonix 这些隐私圈点名推荐。 微信、Telegram 这些都要绑手机号或生成一个用户 ID,平台天然就知道「谁在跟谁聊」。 SimpleX 干脆连用户 ID 都不存在,靠一次性的连接邀请建立联系,端到端用 double ratchet 加密再叠一层,平台连你的社交关系图都拿不到。 iOS、安卓、桌面端、命令行都有客户端。 GitHub:
显示更多
AI 裁员时代的生存指南 Simon Willison 最新一个 blog 笑死 他转了一段 Mo Bitar 的 TikTok,叫《The Unethical Guide to Surviving AI Layoffs》 段子大意是:想升职吗?走进 CEO 办公室关上门说,hey 老板,我最近在搞一个东西叫 Ralph Loops,我觉得这可能改变一切。CEO 一定会问,什么叫 Ralph Loop?你就说,给我批 18,000 美元的 API 额度,我展示给你看。 然后你什么也不用做,因为你也做不了,因为没人能做,但等他搞明白这一点的时候,你已经升职加薪了。 第二刀更狠:翻译过来就是,老板听到“自动化”三个字会自动 high。段子告诉你怎么用:在公司大群 @ 同事:我把 Gary 自动化了。他的功能已经被 Ralph Loop 了。顺手 @ CEO。 太魔幻了……
显示更多