先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.24997
VideoGen-Agent:用强化学习教 Agent 调工具来生成视频
VideoGen-Agent: Reinforcing Video Generation Agents
Binxu Li,Haoyi Duan,Yuhui Zhang,Yaohui Zhang 等 12 位作者 · 2026-09-21
不换生成模型,换个会调工具的 Agent,分数就上去了
打开交互式解读 →三个要点
- 问题:视频生成模型画面好看,但不一定忠于提示:训练后出现的新事物画不出来、人物身份前后不一致、运动违反物理、多步骤动作顺序错乱。
- 方法:以 Qwen3-VL-8B-Instruct 为策略模型,覆盖六类任务(流程知识、单/多实体身份、物理模拟、组合场景、多镜头),在「推理-行动-观察」循环里调度检索、物理模拟、生成、目标检测和深度估计等工具。先用教师蒸馏轨迹做 SFT,再做多任务智能体强化学习。
- 结果:在作者自建的 VABench(600 条留出提示,Gemini 3.1 Pro 按评分细则打分)上,用工具集 1 总分 75.6,比其底层生成器 Seedance 1.0 高 19.1 分,比最强单模型 Seedance 2.0 高 2.4 分;换成更强的工具集 2、不再训练 Agent,总分升到 86.1。注意评测基准和评委都由作者选定。
86.1 VABench 总分(更换为工具集 2,无需重训 Agent)
适合谁读:做 AI 视频、广告与内容生产工具的团队;关注「Agent 编排层」价值的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。