先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.10522

Show-Harness:给视觉语言模型一套「方向键」,它就能直接操作机械臂

Show-Harness: Just a VLM Agent Can Play Robots
Yanzhe Chen,Zechen Bai,Zhijun Cao,Wenzheng Zeng 等 10 位作者 · 2026-09-09

不训练专门的机器人大模型,只换一个接口,通用视觉模型就能玩机器人

打开交互式解读 →

3 分钟版

问题 VLM 对世界有广泛理解,但把这种智能转成机器人控制很难。VLA 需要大规模机型专属预训练;代码即策略类 Agent 又把模型挡在细粒度物理决策之外。

思路 设计一个紧凑的语义动作空间:相对于当前参考视角的六向移动、绕轴旋转、抓取、释放、完成。每个动作只带来小而局部的物理变化,让 VLM 一直处在「感知—推理—动作—反馈」闭环中。机型专属解释器把动作转成 6 自由度位姿设定点,换机器人只需换解释器。同一接口还做成图形界面 GUMI,让人和 Agent 不用遥操作硬件就能采集示范数据。

结果 零样本模式(Gemini-3.1 Pro)和微调模式(Qwen3.5-2B)都在跨任务、跨环境、跨机型测试中超过 π0.5、GR00T 等基线。把解释器步长从 2 cm 改为 1 cm,零样本精细任务从 60% 提到 82%,无需重训。

所以呢 「对的接口」可以从通用模型中释放出可观的具身能力,而不需要额外模型容量或昂贵的专门预训练。目前只验证了单臂和双臂的平行夹爪,人形和灵巧手尚未覆盖。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。