先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.33757
YuE2:先写乐谱再演奏的整首歌生成模型
YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality
Ruibin Yuan,Jiahao Pan,Junyan Jiang,Zhiyue Wu 等 35 位作者 · 2026-09-27
先写出可读的乐谱,再把它唱成完整的歌
打开交互式解读 →三个要点
- 思路:符号音乐模型能写出旋律、和声、节奏,但停在乐谱;音频模型能生成完整歌曲,但作曲过程是隐式的。YuE2 用一个 AR-NAR 混合 Transformer,先写出包含旋律、和弦、调式、拍号、速度和曲式的可读乐谱,再展开为语义音乐 token,最后生成整首立体声音频。
- 结果:同一检查点下,专家在整体质量上 49.3% 偏好「先写谱」,34.6% 偏好不写谱(其余为平局);WildSongBench 上 SongBench Global Avg 6.73,超过所有公开基线,8 选 1 时达到 6.96。专家试听中 8 选 1 版本优于 Suno v4.5,与 Suno v5 接近持平。
- 配套:为了从没有对齐乐谱的录音中学习,团队还推出 MERT2(音乐表征,15 项 MARBLE 指标中 14 项刷新最好成绩)和 SheetSage2(扒谱)。乐谱可编辑、可零样本翻唱,也能让外部语言模型把用户反馈翻译成作曲修改。
49.3% vs 34.6% 专家整体质量偏好:先写谱 vs 不写谱
适合谁读:做 AI 音乐、配乐与创作工具的团队;关注开源生成模型与 Suno 竞争格局的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。