先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.18323
MiniMax-H3 能推理物理世界吗?全模态生成模型评测
Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model
Haoyu Zhao,Zihao Zhao,Tianyu Deng,Ziqin Xu 等 13 位作者 · 2026-09-16
给半张图、一段声音,让模型生成「接下来会发生什么」
打开交互式解读 →三个要点
- 问题:全模态生成模型(如 MiniMax-H3)能统一理解文本、图像、视频、音频并联合生成音视频。作者想知道:多模态对齐能否提升模型对物理世界的推理?现有视频生成和世界模型的评测输入模态有限,而且提示往往直接描述了目标视频内容。
- 方法:围绕物理世界推理的四个维度构建新任务,设计四种输入场景——隐含提示配多帧图、音频+图像、前缀视频、音频+视频。每种模态只提供部分证据,模型必须综合互补线索推断事件的隐含状态和未来走向。
- 结果:517 个评测实例上,MiniMax-H3 总成功率 41.97%;基于视频的决策推理最好(56.00%),基于音频的消歧推理最弱(27.40%)。作者认为「接受多模态输入」和「真正整合多模态推理」之间仍有很大差距。
41.97% MiniMax-H3 在 517 个实例上的总成功率
适合谁读:做视频生成、世界模型和多模态评测的团队;关注国内大模型厂商多模态进展的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。