先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.34309
MaLiang-Harness:用「写程序」来画图和做视频
MaLiang-Harness: A Programmable Path to Image and Video Generation
Haoyu Zhao,Zihao Zhang,Xudong Wang,Jiaxi Gu 等 7 位作者 · 2026-09-28
让大模型写绘图程序,渲染、检查、再改
打开交互式解读 →三个要点
- 问题:多模态大模型可以把创作意图写成可执行的绘图/动画程序,再交给渲染器生成图像或视频。但程序跑通不等于画对——物体位置错、动画时机错都很常见。作者把这种落差叫做「程序到视觉的鸿沟」(P2V gap)。
- 方法:MaLiang-Harness 把生成组织成「构建—检查—修改」的持续过程:保存可执行程序和任务上下文(PEG 状态),把每次编辑和渲染结果关联起来(TGP),支持回退并在完成前检查当前版本(REV),可接多种渲染后端。
- 结果:在 50 个图像任务(MaLiang-IBench)上评测 11 个闭源模型、在 13 个视频任务(MaLiang-VBench)上评测 4 个。GPT-6-Astra 两项生成成功率都是 100%,96.0% 的图像任务和 76.9% 的视频任务满足全部质量阈值;通用能力分数相近的模型,视觉生成表现差异很大。作者承认照片级写实和「改不动」仍是难点。
96.0% GPT-6-Astra 满足全部质量阈值的图像任务比例
适合谁读:做 AI 设计工具、可编辑矢量/动画生成的创业团队;关注「生成可控、可追溯」路线的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。