先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.16859

HarnessEval-W:用 Agent 外壳来评测世界模型

HarnessEval-W: Agentifying the Evaluation of Visual Worlds
Weiliang Chen,Haowen Sun,Jun Gao,Jiawei Chi 等 43 位作者 · 2026-08-17

分数要有推理链:评测本身也交给「主 Agent + 子 Agent」来做

打开交互式解读 →

三个要点

0.93 与人类排序的 Spearman 相关(意图类转变)

适合谁读:做世界模型、视频生成和具身仿真的团队;关注评测基础设施的投资人。

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。