先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.02023

SwanTale:一个模型同时生成多人对话、环境声与音效

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
Yu Zhang,Ruiqi Li,Changhao Pan,Ke Lei 等 6 位作者 · 2026-08-03

用一句描述设计声音,再连同场景音效一起生成

打开交互式解读 →

3 分钟版

问题 创作者要在没有参考录音的情况下设计声音、用自然语言控制风格、让人声与环境声和音效同时出现,并在之后复用设计好的声音;现有系统通常把这些拆成不同模型。

思路 数据侧:SwanData-Caption 清洗真实媒体音频、补充老年人语音 / 短句 / 难读词三类合成数据,并标注「环境—说话人—细粒度内容」三层描述。模型侧:自研 SwanVAE 编码多种音频,流式 Transformer 中隔层换成统一 MoE(任务共享专家 + 帧级路由专家 + 空专家),再用课程学习和 GRPO 后训练。

结果 零样本单人与双人对话中,音色一致性、表现丰富度和层次感均排第一;InstructTTSEval 中文 APS 86.1 第一;自建 SwanBench-Scene 整体 Mean MOS 4.22 第一(作者自报)。内容准确率与音质并非最好。

所以呢 语音合成开始覆盖「声音设计 + 场景音频」的完整需求,内容生产工具可以用一个模型完成过去需要配音演员、音效师分别处理的环节。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。