先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.23863
Grounded Action Model:先在 3D 里找准物体,再让机器人动手
Grounded Action Model: 3D Grounding as a Foundation for Robotics
Gehao Zhang,Weikai Huang,Shailesh Shailesh,Yiyan Peng 等 6 位作者 · 2026-09-20
机器人基础模型先学「东西在哪」,再学怎么动
打开交互式解读 →三个要点
- 问题:机械臂操作必须知道哪些物体重要、它们具体在哪。但现有机器人基础模型所依赖的预训练骨干——VLA 里的语言模型、世界-动作模型里的视频生成器——并不直接要求这种度量层面的定位,只能从机器人示范中隐式学到。
- 方法:GAM 可以用语言、点或框来指定目标,先统一转换为所选物体的「以物体为中心」的表示(目标视觉特征 + 度量几何),再与机器人状态历史一起送入多流 Transformer 预测动作块。它也可以作为底层控制器,由高层规划器(如 Molmo2)驱动完成长任务。
- 结果:RoboTwin 2.0 的 50 个任务平均成功率 55.3%(Spatial Forcing 为 52.0%),场景随机化下 47.6%(对比 30.4%),而动作策略只用干净场景示范训练;LIBERO-PRO 16 种扰动平均 61%(π0.5 为 53%);真机双臂在视觉偏移下 17/20 成功,π0.5 为 4/20。作者承认定位错误会直接传导到动作且无法恢复。
17/20 vs 4/20 真机双臂 YAM 在视觉偏移下的成功次数(GAM vs π0.5)
适合谁读:做机器人基础模型、工业抓取与家用机械臂的团队;关注 VLA 路线竞争的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。