先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.16590

Zetta:机器人模型不动,让外壳在执行中自己学会「纠错」

Zetta $\zeta$: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
Xin Ding,Liang Mi,Mingzhe Huang,Zixuan Wang 等 12 位作者 · 2026-08-17

冻结机器人大模型,只进化代码写的「监视器 + 恢复动作」

打开交互式解读 →

3 分钟版

问题 具身数据稀缺,端到端策略在真实部署中很脆弱;大模型 Agent 外壳又基本是开环的,只能在回合结束后反思,无法在执行过程中及时干预,反思出的经验也难复用。

思路 冻结基础策略,只进化外壳中的运行时监视器(critic)和恢复技能。三个不同时间尺度的循环:动作频率上运行监视器、必要时触发恢复;每批试跑后聚类失败、诊断根因、提出候选监视器与恢复;只有在留出验证中提升成功率并能泛化的候选才写入技能库。配套 Z-Infra 把 Agent 逻辑与异构的仿真、模型和算力资源解耦,提高试跑吞吐。

结果 RoboCasa 18 个任务宏平均从 73.56% 升到 93.56%;LIBERO-Pro 40 个任务—设置组合从 32.00% 升到 71.13%,其中 Goal 两种扰动设置达到 92.5% 和 89.0%。Z-Infra 在并发 16 时吞吐是不用它时的 7.7 倍(均为作者自报)。

所以呢 性能提升来自外壳而非重新训练模型;从源任务学到的监视器与恢复动作还能零样本迁移到相似失败模式的任务。但实验全部在仿真中完成。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。