
StepFun AI 最近推出了其开源音频编辑模型 Step-Audio-EditX,这款拥有30亿参数的创新模型让音频编辑如同文本编辑般直观且高度可控。它通过将音频信号的修改任务转化为逐字令牌操作,显著简化了富有表现力的语音内容调整过程。
当前主流的零样本文本到语音(TTS)系统在情感表达、语调风格、口音特征以及音色控制方面仍存在局限性。虽然能够生成自然流畅的语音,却难以精准满足用户的个性化需求。以往的研究多依赖额外编码模块或复杂网络结构来分离这些因素,而 Step-Audio-EditX 则另辟蹊径,通过优化训练数据和目标函数实现精细控制。
该模型采用双代码本标记机制,将语音信号分解为两个并行的令牌流:一个以16.7Hz 的频率捕捉语言内容信息,另一个以25Hz 的频率记录语义与韵律特征。模型在融合了文本和音频令牌的混合语料库上进行训练,使其具备同时处理文字与声音标记的能力。
其核心技术之一是引入大边距学习策略,在后续训练阶段使用合成的大边距三元组和四元组样本增强模型判别与生成能力。依托来自约6万名说话者的高质量语音数据,Step-Audio-EditX 在情感迁移和风格变换任务中展现出卓越性能。同时,模型还结合人类评分反馈与偏好数据,利用强化学习进一步提升输出语音的自然度与准确性。

为全面评估模型效果,研究团队构建了名为 Step-Audio-Edit-Test 的评测基准,并采用 Gemini2.5Pro 作为自动评判引擎。实验结果表明,经过多轮迭代编辑后,模型在情感表达和说话风格还原上的准确率显著提高。更值得注意的是,Step-Audio-EditX 还可作为增强工具,有效改善其他闭源 TTS 系统输出的音频质量,为未来音频编辑技术的发展开辟了全新路径。
以上就是StepFun AI 开源音频编辑模型 Step-Audio-EditX的详细内容,更多请关注php中文网其它相关文章!
每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。
Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号