先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.08936
AuK:一个开源模型同时做语音生成和语音编辑
AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing
Ziyang Ma,Zhikang Niu,Wenming Tu,Tianrui Wang 等 33 位作者 · 2026-09-08
用一句自然语言指令,既能合成语音,也能改已有的录音
打开交互式解读 →三个要点
- 问题:语音生成、内容编辑、降噪分离、副语言(情绪、笑声等)编辑、声学编辑通常由不同模型完成,接口不统一。
- 方法:用自然语言指令加音频上下文作为统一接口;构建约 3.03 billion 条指令—音频样本、195 万小时有效监督,覆盖五类任务。架构为多模态大模型做语义条件 + 在语音、通用音频和音乐上联合训练的 VAE + 混合整流流 Transformer。训练从只做生成的预热开始,再联合生成与编辑预训练,后训练用人类反馈偏好优化(编辑)和基于奖励的强化学习(生成)。
- 结果:作者称在零样本与指令控制的语音生成、通用指令编辑上领先,在信号级修复任务上具有竞争力。蒸馏版 AuK-Flash 只需 4 步推理、不用无分类器引导,墙钟时间比完整模型快 4.5 倍。代码与权重均已开源。
4.5× AuK-Flash 相对完整模型的墙钟加速
适合谁读:做语音合成、配音、播客与音频编辑产品的团队;关注开源语音基础模型的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。