首页 > 新闻 > IT新闻 > 正文

StepFun AI 开源音频编辑模型 Step-Audio-EditX

碧海醫心
发布: 2025-11-10 17:39:01
原创
169人浏览过

stepfun ai 开源音频编辑模型 step-audio-editx

StepFun AI 最近推出了其开源音频编辑模型 Step-Audio-EditX,这款拥有30亿参数的创新模型让音频编辑如同文本编辑般直观且高度可控。它通过将音频信号的修改任务转化为逐字令牌操作,显著简化了富有表现力的语音内容调整过程。

当前主流的零样本文本到语音(TTS)系统在情感表达、语调风格、口音特征以及音色控制方面仍存在局限性。虽然能够生成自然流畅的语音,却难以精准满足用户的个性化需求。以往的研究多依赖额外编码模块或复杂网络结构来分离这些因素,而 Step-Audio-EditX 则另辟蹊径,通过优化训练数据和目标函数实现精细控制。

该模型采用双代码本标记机制,将语音信号分解为两个并行的令牌流:一个以16.7Hz 的频率捕捉语言内容信息,另一个以25Hz 的频率记录语义与韵律特征。模型在融合了文本和音频令牌的混合语料库上进行训练,使其具备同时处理文字与声音标记的能力。

其核心技术之一是引入大边距学习策略,在后续训练阶段使用合成的大边距三元组和四元组样本增强模型判别与生成能力。依托来自约6万名说话者的高质量语音数据,Step-Audio-EditX 在情感迁移和风格变换任务中展现出卓越性能。同时,模型还结合人类评分反馈与偏好数据,利用强化学习进一步提升输出语音的自然度与准确性。

模力视频
模力视频

模力视频 - AIGC视频制作平台 | AI剪辑 | 云剪辑 | 海量模板

模力视频 51
查看详情 模力视频

StepFun AI 开源音频编辑模型 Step-Audio-EditX

为全面评估模型效果,研究团队构建了名为 Step-Audio-Edit-Test 的评测基准,并采用 Gemini2.5Pro 作为自动评判引擎。实验结果表明,经过多轮迭代编辑后,模型在情感表达和说话风格还原上的准确率显著提高。更值得注意的是,Step-Audio-EditX 还可作为增强工具,有效改善其他闭源 TTS 系统输出的音频质量,为未来音频编辑技术的发展开辟了全新路径。

以上就是StepFun AI 开源音频编辑模型 Step-Audio-EditX的详细内容,更多请关注php中文网其它相关文章!

相关标签:
最佳 Windows 性能的顶级免费优化软件
最佳 Windows 性能的顶级免费优化软件

每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。

下载
来源:php中文网
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
最新问题
开源免费商场系统广告
热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新 English
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送
PHP中文网APP
随时随地碎片化学习

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号