先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.02023
SwanTale:一个模型同时生成多人对话、环境声与音效
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
Yu Zhang,Ruiqi Li,Changhao Pan,Ke Lei 等 6 位作者 · 2026-08-03
用一句描述设计声音,再连同场景音效一起生成
打开交互式解读 →3 分钟版
问题 创作者要在没有参考录音的情况下设计声音、用自然语言控制风格、让人声与环境声和音效同时出现,并在之后复用设计好的声音;现有系统通常把这些拆成不同模型。
思路 数据侧:SwanData-Caption 清洗真实媒体音频、补充老年人语音 / 短句 / 难读词三类合成数据,并标注「环境—说话人—细粒度内容」三层描述。模型侧:自研 SwanVAE 编码多种音频,流式 Transformer 中隔层换成统一 MoE(任务共享专家 + 帧级路由专家 + 空专家),再用课程学习和 GRPO 后训练。
结果 零样本单人与双人对话中,音色一致性、表现丰富度和层次感均排第一;InstructTTSEval 中文 APS 86.1 第一;自建 SwanBench-Scene 整体 Mean MOS 4.22 第一(作者自报)。内容准确率与音质并非最好。
所以呢 语音合成开始覆盖「声音设计 + 场景音频」的完整需求,内容生产工具可以用一个模型完成过去需要配音演员、音效师分别处理的环节。
关键数字
- 4.22 SwanBench-Scene 整体 Mean MOS(Table 7)
- 86.1 InstructTTSEval 中文 APS(Table 6)
- 0.95 零样本单人场景的音色一致性(Table 5)
- 23M 零样本基座预训练的单说话人数据(§4.1)
局限与疑问
- 多数基准为团队自建。
- 内容准确率与音质不是最好。
- 角色扮演类指令偏弱。
- 训练数据以内部数据为主,难以复现。
- 结果为作者自报。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。