先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.16859
HarnessEval-W:用 Agent 外壳来评测世界模型
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
Weiliang Chen,Haowen Sun,Jun Gao,Jiawei Chi 等 43 位作者 · 2026-08-17
分数要有推理链:评测本身也交给「主 Agent + 子 Agent」来做
打开交互式解读 →三个要点
- 问题:世界模型的评测需要判断物理、因果和世界状态是否正确演变。现有基准用固定指标暴力计算,没有可检查、可验证的推理链。
- 方法:把 LLM 生态里的外壳范式搬到世界模型评测:主 Agent 先理解每个用例的上下文,把评测问题拆成可测量的子问题,再派出配有定制上下文和诊断工具的子 Agent 分别求证,最后检查证据、汇总成结论。每次评测都留下一棵可追溯的证据树。
- 结果:在 18 个代表性世界模型、330 个评测用例上,判断与人类偏好高度一致:意图类转变的 Spearman 相关 0.93,物理类转变 0.87(作者自报)。整套流程开源为持续更新的基准。
0.93 与人类排序的 Spearman 相关(意图类转变)
适合谁读:做世界模型、视频生成和具身仿真的团队;关注评测基础设施的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。