註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 MuJoCo
MuJoCo 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 MuJoCo 的搜尋結果
机器人世界模型(全新维度,0 去重 = 全新信息) 核心项目: - Awesome-WAM(OpenMOSS):World Action Models 综合论文列表,含 DreamDojo(从人类视频学习的通用机器人世界模型) - awesome-physical-ai:VLA 模型、世界模型、具身基础模型论文合集,含 NVIDIA Cosmos Predict2.5 - π₀/π₀.5(Physical Intelligence):视觉-语言-动作流模型,通用机器人控制 - GR00T N1(NVIDIA):通用人形机器人开放基础模型 - InternVLA-A1(阿里巴巴):统一理解、生成和动作的机器人操作模型 仿真环境: Genesis、Isaac Sim、MuJoCo 仍是主流 操作策略: LeRobot(Hugging Face)、Octo、Diffusion Policy、ACT 是当前热门
顯示更多
Axis Robotics 每天看着机器人模型在实验室里卡住。 跑不通的抓取动作,识别不了的场景,泛化不了的路径。 人类好像越来越能造机器人,但越来越不会教机器人了。 1> @axisrobotics 最早就是一个数据标注项目——只不过标的不是图片,是机器人动作。 你打开浏览器,用鼠标拖拽一个虚拟机械臂,教它怎么拿起杯子、怎么拧开瓶盖、怎么给花浇水。就这么简单。动动鼠标,教机器人,赚积分。 但团队很快发现了一个问题: 不是没人想教,是根本不知道怎么教。 2> 机器人的数据,被什么东西卡住了? 大语言模型有全网文本可以训练。 自动驾驶有上亿公里路测数据。 但机器人呢? 真实的机器人操作数据,只能靠实验室里少数专家,一台一台机械臂手动采集。成本高、速度慢、场景单一。 而机器人需要学会的,是真实世界里千变万化的动作——拿起不同形状的杯子、在不同光照下识别物体、在杂乱环境中规划路径。 实验室里采集的那点数据,不够。 3> Axis 看不下去了。 他们发现Physical AI最大的瓶颈不是算法,是数据覆盖度。 没有足够多、足够多样化的训练数据,再好的模型也是空中楼阁。 所以他们决定换一种思路。 4> 从实验室采集变成全民众包。 Axis 的做法很简单:在浏览器里搭建物理仿真环境,让全球任何一个人,打开网页就能操作虚拟机器人。 你拖拽机械臂完成的每一个动作,都会被记录成一条轨迹数据。 这些数据经过验证后,用来训练真正的机器人模型。 2026年2月,Axis 做了一次代号叫"小王子的玫瑰"的实验。 全球1.2万名普通用户在5天内完成了10,000条高质量轨迹数据的采集。 然后他们把其中一批数据直接部署到了真实的 Franka 机械臂上——成功复现。 不需要你买机器人,不需要你懂编程。打开浏览器,动动鼠标,你就在教一个真正的机器人如何行动。 5> 但最有意思的是商业模式。 企业客户可以提出定制化的数据需求——特定任务、特定环境、特定机器人本体。 Axis 把这些需求拆解成任务套件,分发给全球贡献者网络。 贡献者完成任务、产生数据,企业付费购买。 部分收入回流给贡献者。 形成一个闭环: 商业需求 → 任务生成 → 众包采集 → 数据验证 → 模型训练 → 部署落地 物理AI变成了一个网络:商业需求驱动数据创建,贡献者提供智能,模型持续进化。 6> 技术底子怎么样? Axis 自研了 MetaSim 架构,把复杂的物理仿真和轻量化的网页交互解耦。 你在浏览器里拖拽机械臂的每一帧,背后是 MuJoCo 的高频物理模拟,再通过跨仿真重放技术在 Isaac Sim 里做大规模域随机化。 说白了就是:你操作简单,但数据质量不简单。 截至2026年7月,Axis 数据集已包含207个多样化任务和超过5万条轨迹。 7> 最新进展是什么? 7月28日,Axis Robotics 宣布完成1200万美元种子轮融资。 Hack VC 领投,Nomad Capital、Pi Core Team Ventures、10K Ventures 及多位天使投资人跟投。 资金将用于加速建设大规模并行、有人类参与的全球数据引擎。 而且,Axis 即将在 Base 链上推出主产品——数据贡献记录上链,可验证、可追溯。 8> 现在,Axis 正在测试网阶段释放任务。 首批30个任务,已有三分之一进度跑满100%。 Hub 任务可以直接参与,Alliance 任务需要邀请码。 早起的鸟不一定吃到虫,但至少先占了训练工位。 关注 @BTCDTA@0xsexybanana 机器人不会自己学会走路。 但你可以教它。 打开浏览器,动动鼠标,你就在参与建造物理AI的"GPT时刻"。 #AxisRobotics# #PhysicalAI# #Web3#
顯示更多
0
80
13
0
轉發到社區
翁家翌新 blog:超越梯度的学习 昨天看到翁家翌(前 OpenAI 研究员)新写了一篇 blog《Learning Beyond Gradients》,挺有意思的,分享一些我读下来的感受。 原文较长且偏技术,下面这版做了不少删减和重组,建议感兴趣的同学直接读原文 · · · 翁家翌:超越梯度的学习 持续学习(Continual Learning)之所以一直很难,很大程度上是因为神经网络的顽疾:灾难性遗忘。那如果我们不只盯着权重更新这一条路呢? 随着 LLM agent 越来越强,写代码这件事变得又快又好。但翁家翌注意到一个更有趣的现象:agent 可以反复读取失败信息、修改策略代码、添加测试、回放录像,让整套程序在不动任何网络权重的情况下持续变强。 · · · 这个视角让他重新审视了一个老朋友:heuristic,也就是手写规则和程序化策略。之前很多 heuristic 不是没用,而是维护太贵了,而coding agent 改变的正是这条维护曲线。那些曾经用完就扔的一次性补丁,开始变得值得长期拥有。 凡是能被持续迭代的东西,都开始变得更可解,这也恰恰是持续学习一直追求的目标。 它有没有可能成为继 pretraining → RLHF → 大规模 RL/RLVR 之后的下一个范式? · · · 翁家翌用 Codex(gpt-5.4)做了实验,纯写规则版本,完全不碰神经网络。结果超出预期: — Atari Breakout 的打砖块分数从 387 一路升到 864,达到理论最高分; — MuJoCo 四足和跑步机器人任务中,纯 Python 策略也跑进了常见 Deep RL 结果的量级,HalfCheetah 五轮均值 11836.7; — 跑完 Atari 全部 57 个游戏后,在相同的环境交互步数下,中位数得分已经远高于 PPO 这类标准算法。 这里被更新的对象早就不是单纯的策略函数了,而是一整套带着记忆、反馈入口和回归机制的软件系统。翁家翌把它叫作 Heuristic Learning(HL,启发式学习)。 (我自己也做过 evolve,但不训练神经网络,纯靠规则约束,感觉系统怎么都智能不起来。其实不管 RL 还是 HL,能不能跑起来都是看一件事,优化结果的评分能不能清晰定义。) · · · Heuristic Learning(HL) 是什么?HL 怎么持续学习? HL 的核心是用 coding agent 维护一个 Heuristic System(HS)。 和 Deep RL 的差异: — 反馈来源:不是 loss 函数,而是测试结果、环境奖励、日志、视频、失败模式分析; — 更新方式:不走反向传播,agent 直接改 policy、状态检测器、测试、配置或记忆结构; — 维护对象:不止一个 trace(黄金轨迹)、环境 wrapper 等。 以前怎么没人搞?专家系统 70 年代就有,但人维护起来是噩梦:加一条规则修好 case A,case B 崩了;规则堆到几百条后,除了原作者没人看得懂。 而 coding agent 不怕堆规则。它能同时读所有代码、跑全量测试、对比日志,把维护成本打下来。用翁的比喻说,就像纺纱机改变纺线成本曲线一样:手工纺贵得要死,机器一上来就塌掉了。 · · · Heuristic Learning 怎么做 Continual Learning 神经网络把经验压进权重,忘没忘、怎么忘的都是黑箱。HL 的历史则是显式的:版本 diff、回归测试、replay、视频、golden trace 全透明。新增能力前先固化旧能力:跑回归测试、跑固定种子回放。如果新规则破坏旧 case,agent 能直接定位到哪行代码引入的 regression。 但规则叠太多、agent 自己都维护不动的时候,就需要"历史压缩",把一堆 case-specific 的补丁合并成更通用的逻辑,否则系统迟早变成没人敢碰的代码泥球。 · · · 当然,HL 不是万能药。因为 Heuristic Learning 并不能做所有神经网络能做的事情。它的上限卡在代码的表达能力:比如复杂感知和长程泛化。翁家翌也坦率地说,他想不出有哪个 agent 能纯靠 Python、不用网络去搞定 ImageNet。 所以真正的问题变成了:怎么把神经网络和 HL 结合起来,同时搞定在线学习和持续学习? 最有希望的方向是:用 HL 快速处理在线数据,把在线经验变成可训练、可回归、可筛选的数据,再周期性地更新神经网络。以机器人为例,借用 System 1 / System 2 的说法,一种可能的分工是: — 专用浅层 NN 作为 System 1 的一部分:快、便宜,负责感知、分类、物体状态估计; — HL 也可以当做 System 1 的一部分:负责最新数据处理、规则、测试、回放、memory、安全边界、局部恢复; — LLM agent 作为 System 2:负责给 HL 提供反馈、改进数据,并周期性把 HL 生成的数据拿过来更新自己。 · · · Agentic coding 改变的不仅是写代码的速度,更改变了"哪些代码值得被长期拥有"。过去很多 heuristic 看上去没前途,不是它们太弱,而是维护不起。 coding agent 改变的就是这条维护成本曲线。 规则、测试、日志、记忆和补丁,原来只是散落的工程材料,现在开始能组成一个持续进化的 Heuristic System,去解决在线学习和持续学习一直没搞定的事。 欢迎来到下一个范式。 · so,skills + instruction following = AGI?
顯示更多
0
1
171
41
轉發到社區
OpenAI 后训练核心成员翁家翌(Jiayi Weng)以个人名义提出了一种名为「启发式学习」的强化学习新范式,并开源了全部实验代码。他用 Codex(GPT-5.4)反复玩 Atari 打砖块游戏,但 GPT-5.4 自始至终没有被重新训练过。真正在进步的,是 GPT-5.4 写出来的那套游戏策略代码。 流程是这样的:GPT-5.4 先写一版打砖块的 Python 策略,跑一局,看录像,找出哪里打丢了球,然后自己改代码再跑。经过几轮迭代,策略代码从 387 分涨到了 864 满分。全程没有任何神经网络被训练,纯靠 AI 反复修改 if-else 规则、调落点预测、加死循环检测。最终那套代码包含球路预测器、卡球检测器、回归测试和实验日志,已经长成了一个完整的软件系统。 这和传统强化学习的核心区别在于「学到的东西存在哪」。传统做法把知识压进神经网络参数里,人看不懂,学新任务还容易把旧的覆盖掉(即灾难性遗忘)。翁家翌的做法反过来:知识就是代码,人能读、能改、能加测试锁住,不会因为学新东西就丢了旧本领。 除了打砖块满分,他还在 MuJoCo Ant(模拟机器蚂蚁走路)上跑出超 6000 分的深度强化学习级成绩,在 Atari57 全套 57 个游戏上逼近了 PPO 基准。但翁家翌也明确画了边界:纯代码搞不定复杂感知任务,比如用 Python 写 if-else 去认图片。 他设想的终局是混合架构:底层用轻量神经网络负责视觉等感知,中层用启发式学习处理实时逻辑和安全规则,顶层由大模型审查日志、改代码,再周期性地用底层积累的高质量数据更新自身。过去手写规则之所以被淘汰,不是因为规则没用,而是人类维护不起。现在 AI 写代码够快够好,这条老路重新走得通了。
顯示更多
0
26
592
89
轉發到社區