GPT-SoVITS

3周前发布 841 0 0

零样本文本到语音(TTS): 输入5秒的声音样本,即刻体验文本到语音转换。 少样本TTS: 仅需1分钟的训练数据即可微调模型,提升声音相似度和真实感。 跨语言支持: 支持与训练数据集不同语言的推理,目前支持英语、日语和中文。 WebUI工具: 集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注,协助初学者创建训...

语言:
zh
收录时间:
2026-08-31
GPT-SoVITSGPT-SoVITS

零样本文本到语音(TTS): 输入5秒的声音样本,即刻体验文本到语音转换。 少样本TTS: 仅需1分钟的训练数据即可微调模型,提升声音相似度和真实感。 跨语言支持: 支持与训练数据集不同语言的推理,目前支持英语、日语和中文。 WebUI工具: 集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注,协助初学者创建训练数据集和GPT/SoVITS模型。 介绍视频 https://www.bilibili.com/video/BV12g4y1m7Uw/ 来自B站up主:花儿不哭

数据统计

相关导航

sd-webui-faceswaplab

sd-webui-faceswaplab

sd-webui-faceswaplab是一个扩展功能强大的面部替换工具,其功能特点如下: 多功能面部替换:sd-webui-faceswaplab可以进行多个面部的替换操作,使用户能够对多个人脸进行替换,实现不同面部的互换。 修复涂鸦:该工具还具有修复功能,可以对图像中的涂鸦进行修复,使图像看起来更加干净和自然。 检查点功能:sd-webui-faceswaplab支持检查点功能,用户可以在进行面部替换操作时保存检查点,方便随时恢复和继续进行操作。 开源许可证:该工具使用AGPL-3.0许可证,这意味着它是开源的,用户可以自由地使用、修改和分发该工具的源代码。
FreeU

FreeU

FreeU是一个开源项目,该项目由ChenyangSi创建。它的目标是在Diffusion U-Net中提供免费的资源。 Diffusion U-Net是一个用于图像分割的深度学习模型。它基于U-Net架构,并通过将扩散过程与传统的卷积神经网络相结合,提供了更好的图像分割结果。 FreeU项目允许开发人员免费访问和使用Diffusion U-Net,无需支付任何费用。这为开发人员提供了方便和实惠的方式来学习和应用图像分割技术。