四块拼在一起:1. 先验–后验隐空间(从 H0.7 继承)
训练时后验支路能看到未来的视觉和触觉,用来教先验「接下来接触会怎样」。推理时拿掉未来,只留当前指令 + 画面 + 学到的 latent query。官方强调它不重建未来像素,只预测和任务有关的交互后果。2. 慢–快动作专家
慢路:每个 action chunk 开头算一次世界–动作上下文并缓存,生成整段 horizon。
快路:chunk 内若干锚点注入最新本体感觉和触觉,只重写下一小段动作。
这是为了解决「VLA 一段动作还没跑完,接触已经变了」。3. 通用触觉编码器
上面说的金字塔 + 缺测占位。4. TopoHand(第二代统一动作空间)
替代 H0.5 的 200 维槽位。一只手 = 腕部坐标系 + 10 维形态码(形状 VAE)+ 20 个标准关节。夹爪则是「拇指尖到最近指尖的归一化开合」。人手、灵巧手、平行爪走同一套语义,再加本体 adapter。数据叫 UniHand-3.0:50 万小时+ 第一人称视频(公开集 + 合作方 + 自采),号称国内最大操作视频池,再配异构真机和合成人–机对齐数据。三阶段:大规模预训练 → 任务对齐的人演示 mid-train → 真机 post-train。
显示更多