先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.17426

SemComp-Bench:视频生成能不能「把事办成」?

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
Keyu Tu,Zhuowei Chen,Mengqi Huang,Yuxin Wang 等 7 位作者 · 2026-08-18

画面好看不等于把事办成:最好的模型完成率不到 40%

打开交互式解读 →

3 分钟版

问题 现有视频生成基准关注画质、时间连贯和主体一致,很少同时评测「是否达成指令要求的结果」和「结果是否仍基于参考图中的对象」。

思路 从完整的真实视频中截取参考帧和结果片段,构成「参考图—指令—结果视频」三元组,保证任务真实可达。四阶段流水线:候选过滤、状态挖掘、视频延展、指令结构化;每个样本配简略和详细两种指令。评测用视觉语言模型回答结构化的是非题:结果达成(OA)要求四项全部通过,生成可靠性(GR)检查物理违例、模糊、伪影等。

结果 约 2 万条视频产出 1,273 个评测样本,核心子集 60 个(六个领域各 10 个)。HunyuanVideo-1.5 的 OA 37.8% 最高,Wan2.2-I2V-A14B 28.3%;Seedance 2.0 的 GR 91.8% 最高。图生视频在三个模型家族中都优于文生视频(作者自报)。

所以呢 生成可靠性和结果达成的排名不一致;所有模型的瓶颈都在场景内时空连贯。把视频模型用于规划或仿真前,需要单独检验它能否到达目标状态。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。