先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.17426
SemComp-Bench:视频生成能不能「把事办成」?
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
Keyu Tu,Zhuowei Chen,Mengqi Huang,Yuxin Wang 等 7 位作者 · 2026-08-18
画面好看不等于把事办成:最好的模型完成率不到 40%
打开交互式解读 →3 分钟版
问题 现有视频生成基准关注画质、时间连贯和主体一致,很少同时评测「是否达成指令要求的结果」和「结果是否仍基于参考图中的对象」。
思路 从完整的真实视频中截取参考帧和结果片段,构成「参考图—指令—结果视频」三元组,保证任务真实可达。四阶段流水线:候选过滤、状态挖掘、视频延展、指令结构化;每个样本配简略和详细两种指令。评测用视觉语言模型回答结构化的是非题:结果达成(OA)要求四项全部通过,生成可靠性(GR)检查物理违例、模糊、伪影等。
结果 约 2 万条视频产出 1,273 个评测样本,核心子集 60 个(六个领域各 10 个)。HunyuanVideo-1.5 的 OA 37.8% 最高,Wan2.2-I2V-A14B 28.3%;Seedance 2.0 的 GR 91.8% 最高。图生视频在三个模型家族中都优于文生视频(作者自报)。
所以呢 生成可靠性和结果达成的排名不一致;所有模型的瓶颈都在场景内时空连贯。把视频模型用于规划或仿真前,需要单独检验它能否到达目标状态。
关键数字
- 37.8% 最高结果达成分(HunyuanVideo-1.5)(§5.2)
- 91.8% 最高生成可靠性(Seedance 2.0)(§5.3)
- 1,273 流水线产出的评测样本数(§5.1)
- 0.328 场景内时空连贯的最低通过率(§5.3)
局限与疑问
- 核心子集只有 60 个样本。
- 评判依赖单一 VLM,未报告与人工一致率。
- 数据能否用于训练尚未验证。
- 结果为作者自报。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。