资讯详情

资讯详情

建站行业动态 · 设计趋势 · 数字化升级干货

FireRedTTS3:从克隆到设计再到编辑,支持24语+21方言,让语音创作更自由

FireRedTTS3:从克隆到设计再到编辑,支持24语+21方言,让语音创作更自由 FireRedTTS3 是小红书 FireRed 团队开源的新一代语音生成与编辑模型基于“语义丰富的连续语音表示”把语音合成和编辑统一到一个系统里。简单说它就像一个“能克隆声音、能按描述造声音、还能像改文档一样改语音”的全能语音工具特别适合需要高质量、多语言、可控语音的应用场景。主要特点多语言 多方言支持很强支持24种语言包括中文、英语、日语、韩语、阿拉伯语、西班牙语、俄语、泰语、越南语等以及21种中文方言如四川话、上海话、粤语、闽南话、河南话、湖南话等。只需提供几秒钟参考音频就能让模型用“那个人的声音”说出对应语言/方言的内容音色相似度高发音也较准。在公开评测Seed-TTS-eval、MiniMax-MLS-Test上平均错误率和说话人相似度都表现领先。声音设计Voice Design不需要参考音频直接用自然语言描述想要的声音例如“一个年轻女性的温柔嗓音语速稍慢带一点俏皮”。模型会先生成一份声音属性规划再合成出全新的声音。语音编辑Speech Editing语义编辑像改文字一样对已有语音做插入、删除、替换比如把“猫”改成“狗”。声学编辑调整语速、音高、音量有特定指令格式。编辑后其他部分基本保持原样音色不漂移。应用领域配音与内容创作短视频、有声书、动画、广告等需要多语言/方言克隆或定制音色的场景。智能客服与虚拟助手生成自然、带情感或特定口音的对话语音。教育与本地化多语言/方言学习材料、地方特色内容制作。语音后期处理快速修改已有录音改错词、调语速等省去重新录制的麻烦。个性化语音产品定制专属AI语音、角色扮演、游戏角色配音等。使用教程建议N卡显存8G起支持50系显卡包含主程序压缩包和模型pretrained_models文件夹下载解压主程序后将模型pretrained_models文件夹移动到主程序目录下即可。建议8G显存起如果生成的文字内容较长建议显存12G起包含“语音克隆”、“音色设计”和“语音编辑”三个功能根据需要切换对应的选项卡语音克隆上传参考音频输入参考文本和需要合成的文本选择目标语言合成即可。音色设计输入音色描述比如一个年轻温柔的女声和待合成的文本合成即可。语音编辑上传参考音频输入编辑指令比如把我很好替换为你很好编辑即可。软件目录结构 deepface pretrained_models/│ ├── campp/│ ├── fireredtts3_base/│ ├── fireredtts3_instruct/│ ... fireredtts3 examples一键启动.exe......下载地址点此下载

相关资讯