先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.02711
Hunyuan3D-Buffalo 1.0:理解、生成、编辑 3D 的统一多模态模型
Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing
Junliang Ye,Kenkun Liu,Guocun Wang,Yang Li 等 16 位作者 · 2026-08-03
一个架构做 3D 理解、文生 3D、指令编辑和部件生成
打开交互式解读 →三个要点
- 问题:统一的 3D 建模受限于多模态数据稀缺,尤其缺少大规模、几何一致的 3D 编辑数据。
- 方法:构建 87M 规模的 3D 多模态语料(25M 理解样本、50M 文生 3D 对、12M 由 Nano3D-v2 生成的编辑对);Hunyuan3D-VLM 负责语义、结构与空间理解,并为 Hunyuan3D DiT 提供条件;编辑与部件生成额外以源物体表示为条件,保持未编辑区域。
- 结果:在文生 3D 和 3D 编辑基准上达到最优或领先,理解与部件生成能力也较强;分析显示生成和理解训练都能提升编辑效果(作者自报)。
87M 3D 多模态训练语料规模
适合谁读:做游戏、3D 内容与数字资产的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。