先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.05000
多模态预训练的「物理学」:知识流、模态协同与早期统一
Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes
Junlin Han,Shengbang Tong,David Fan,Minghao Chen 等 7 位作者 · 2026-08-05
晚融合会让模型「视觉偷懒」:越早统一训练越好
打开交互式解读 →三个要点
- 问题:原生统一的多模态预训练是基础模型的重要方向,但模态在统一训练中如何相互作用、设计空间如何取舍,仍缺少系统的经验证据。
- 方法:在合成与大规模真实数据上做受控实验,拆解语言、视觉理解、视觉生成之间的知识迁移,研究数据复杂度和架构(共享注意力与归一化、模态专属前馈层)对协同或竞争的影响,并比较早期统一、晚期对齐与顺序训练。
- 结果:模态间迁移不对称;从一开始联合训练优于晚期对齐,晚融合会出现「视觉偷懒」、过度依赖语言先验;推导出的配方只用 5% 的算力就达到强生成性能,并用多个 13.5B MoE 模型、2T token 的训练在规模上验证(作者自报)。
5% 高效配方所需的算力比例
适合谁读:训练多模态基础模型的团队;关注统一模型路线的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。