GPT-SoVITS

GPT-SoVITS

零样本文本到语音(TTS): 输入5秒的声音样本,即刻体验文本到语音转换。 少样本TTS: 仅需1分钟的训练数据即可微调模型,提升声音相似度和真实感。 跨语言支持: 支持与训练数据集不同语言的推理,目前支持英语、日语和中文。 WebUI工具: 集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注,协助初学者创建训练数据集和GPT/SoVITS模型。 介绍视频 https://www.bilibili.com/video/BV12g4y1m7Uw/ 来自B站up主:花儿不哭
8410
Wunjo

Wunjo

一个高级语音和Deepfake神经网络工具。功能: * 可以合成和克隆英语、俄语和中文的声音,同时支持实时语音识别。 * 能深度伪造面部和嘴唇动画,并使用一张照片进行人脸交换。 * 通过文本提示改变视频,进行分割和修饰。 * 具有语音合成、声音克隆、实时语音识别、多对话创建、视频到视频转换、深度伪造动画、AI修饰工具、自动分割掩码等功能。 * 支持英语、俄语、中文和西班牙语等多种语言。 * 适用于初学者和专业人士。 * 保护用户隐私。 * 应用于广告配音、游戏角色配音、有声书朗读和深度伪造项目等应用场景。 * 需要Python 3.10和ffmpeg作为运行环境。 * 由Wladislav Radchenko进行开发和维护。
8210
MDX23声音分离,一键安装包

MDX23声音分离,一键安装包

本整合包修改自MVSEP-MDX23-Colab_v2,原项目为colab部署,作者修改了部分代码使其可以本地运行 该方案在 https://mvsep.com/ 网站上的SDR Vocals得分10.2196,截止打包日为开源模型中得分最高方案,对应参数已按照榜单修改完成。 评价:人声剥离完整,不砍频,测试用的这首很多模型都会把人声剥没一部分,该方案在作者测试中目前表现最好,但是会漏器乐,可能需要额外处理。 对比2.2版本,主要的变化是换用了新模型,以及配套的新方案和参数。 MVSEP-MDX23,如果你需要运行这个算法进行音源分离,占用显存可达4-15G,低于4G显存,可能运行失败 项目地址: https://github.com/jarredou/MVSEP-MDX23-Colab_v2 下载链接: https://pan.baidu.com/s/14KkRhYMIbqeYooq6mH0Knw?pwd=h9er 解压密码 领航员未鸟 2.2版本视频介绍: https://www.bilibili.com/video/BV1u8411y7P4/ 2.3版本视频介绍: https:/
8210
Sesame AI

Sesame AI

Sesame AI是新一代AI语音伴侣,具备先进的自然对话能力和独特个性,旨在通过类人语音呈现技术提供有意义的互动体验。Sesame AI突破性地拉近了AI与人类互动的距离,我们运用尖端的语音临场技术,打造真实自然的对话体验,同时秉持诚信原则,明确传达AI的身份属性。Sesame AI目前提供Maya和Miles两位富有表现力的语音伙伴,用户可以通过浏览器网页端在线体验使用。
8010