DDSP-SVC – AI声音克隆

3周前发布 1,021 0 0

DDSP-SVC 是一个新的开源歌声转换项目,自由 AI 变声器软件。相比于著名的 SO-VITS-SVC, 它训练和合成对电脑硬件的要求要低的多,并且训练时长有数量级的缩短,和 RVC 的训练速度接近。

语言:
zh
收录时间:
2026-08-31
DDSP-SVC – AI声音克隆DDSP-SVC – AI声音克隆

DDSP-SVC 是一个新的开源歌声转换项目,自由 AI 变声器软件。相比于著名的 SO-VITS-SVC, 它训练和合成对电脑硬件的要求要低的多,并且训练时长有数量级的缩短,和 RVC 的训练速度… DDSP-SVC 是一个新的开源歌声转换项目,致力于开发可以在个人电脑上普及的自由 AI 变声器软件。 相比于著名的 SO-VITS-SVC , 它训练和合成对电脑硬件的要求要低的多,并且训练时长有数量级的缩短,和 RVC 的训练速度接近。 另外在进行实时变声时,本项目的硬件资源消耗显著低于 SO-VITS-SVC , 但可能略高于 RVC 最新版本。 虽然 DDSP 的原始合成质量不是很理想(训练时在 tensorboard 中可以听到原始输出),但在使用基于预训练声码器的增强器(老版本)或使用浅扩散模型(新版本)增强音质后,对于部分数据集可以达到不亚于 SOVITS-SVC 和 RVC 的合成质量。 老版本的模型仍然是兼容的,以下章节是老版本的使用说明。新版本部分操作是相同的,见之前章节。 免责声明:请确保仅使用 合法获得的授权数据 训练 DDSP-SVC 模型,不要将这些模型及其合成的任何音频用于非法目的。 本库作者不对因使用这些模型检查点和音频而造成的任何侵权,诈骗等违法行为负责。 1.1 更新:支持多说话人和音色混合。 2.0 更新:开始支持实时 vst 插件,并优化了 combsub 模型, 训练速度极大提升。旧的 combsub 模型仍然兼容,可用 combsub-old.yaml 训练,sins 模型不受影响,但由于训练速度远慢于 combsub, 目前版本已经不推荐使用。 3.0 更新:由于作者删库 vst 插件取消支持,转为使用独立的实时变声前端;支持多种编码器,并将 contentvec768l12 作为默认编码器;引入浅扩散模型,合成质量极大提升。 4.0 更新:支持最先进的 RMVPE 音高提取器,联合训练 DDSP 与扩散模型,提升推理与训练速度,进一步提升合成质量。 5.0 更新:支持更快速的 FCPE 音高提取器,改进 DDSP 模型与扩散模型,提升推理与训练速度,进一步提升合成质量。

数据统计

相关导航

通义听悟AI实时语音翻译插件

通义听悟AI实时语音翻译插件

它可以实时语音翻译以及智能记录,如果你想看英语的视频,就可以在chrome插件中安装同意听悟。 打开英语的视频,在听悟的插件中打开字幕与双语显示,就可以顺利转出原文和实时翻译结果,点击最小化就可以只显示双语字幕,并拖动到任意位置,另外在看完后会自动保存下来原文和翻译的结果 在通义听悟的网页端有一个单独的页面,还可以帮你区分对话发言人。 通义听悟的网址: https://tingwu.aliyun.com/ 插件网址: https://chrome.google.com/webstore/detail/%E9%80%9A%E4%B9%89%E5%90%AC%E6%82%9F-%E5%B7%A5%E4%BD%9C%E5%AD%A6%E4%B9%A0ai%E5%8A%A9%E6%89%8B/omlgpaciclcjgbligehccipcikleeiea?hl=zh-CN
千鹿Pr助手

千鹿Pr助手

「千鹿Pr助手」是一款基于Adobe Premiere Pro(简称Pr)开发的AI智能插件,它将强大易用的AI功能、丰富多样的剪辑素材,无缝融入Pr用户的创作流程,帮助Pr用户简化剪辑操作、节省创作时间,提升Pr用户剪辑创作体验。「千鹿Pr助手」支持一键语音识别字幕、AI配音、声音克隆等功能,内置丰富的贴纸、特效、转场、滤镜、字幕模板等素材,可以适用于多种Pr剪辑创作场景。
SenseAudio

SenseAudio

SenseAudio是商汤科技推出的专业AI语音生成和开放平台,提供高拟真语音合成、声音克隆、人声分离及多语种识别转写等能力。拥有70+专业音色,支持情感调节与高保真输出,可生成自然流畅、贴近真人的语音;仅需3-30秒音频即可完成声音克隆,精准复刻专属音色。支持20+语种语音识别转写,适配全球化需求。SenseAudio提供便捷API接口,支持毫秒级流式播报与万字长文本合成,可快速集成至各类应用。
TexttoSpeech.im:免费在线将文本转换为语音

TexttoSpeech.im:免费在线将文本转换为语音

TextToSpeech.im介绍 —— 终极文本转语音解决方案 ?无缝转换文本为语音:享受TextToSpeech.im先进的神经网络技术!我们迅速将您的文本转换为高质量的语音体验。 ? 50种语言支持,8000种音色:无论您是为全球受众创建内容还是针对特定的地域口音,我们准备为您提供服务。我们支持50多种语言和将近8000种独特的音调。 ? 完全免费,无需注册:我们的服务完全免费。您不需要注册或使用任何其他隐藏费用。TextToSpeech.im向所有人开放! ⚡快速语音合成:我们利用先进并强大的神经网络推理模型为您提供快速的文本到语音转换服务,为您节省时间! ?商用免费:所有合成的音频文件都是100%您的版权,可用于任何合法用途。 您的音频内容生产方式将彻底改变! 加入我们的社区,使用TextToSpeech.im!