AudioGPT

3周前发布 602 0 0

这是一个借助大语言模型(LLM)处理音频的工具,可以: – 生成音乐 – 背景音效 – 音频生成字幕 – 文字生成音频 – 文字生成音频并模拟声音 – 根据图片生成音频 – 对音频进行inpaint(局部屏蔽) – 根据音频和人脸照片合成视频 – 检测音频中的事件,以及开始和结束时间 – 单声道变双声道 – 通过文本描述检测特定声音发生的...

语言:
zh
收录时间:
2026-08-31
AudioGPTAudioGPT

这是一个借助大语言模型(LLM)处理音频的工具,可以: – 生成音乐 – 背景音效 – 音频生成字幕 – 文字生成音频 – 文字生成音频并模拟声音 – 根据图片生成音频 – 对音频进行inpaint(局部屏蔽) – 根据音频和人脸照片合成视频 – 检测音频中的事件,以及开始和结束时间 – 单声道变双声道 – 通过文本描述检测特定声音发生的时间 – 抽取某种声音 – 去除背景噪音 多人混合声分离出单人声音 语音翻译 http://github.com/AIGC-Audio/AudioGPT 演示:https://huggingface.co/spaces/AIGC-Audio/AudioGPT 论文:https://arxiv.org/abs/2304.12995

数据统计

相关导航

gpt-crawler

gpt-crawler

用于从URL生成知识文件,以创建您自己的自定义GPT模型。 功能点: 1. **网站爬虫**:可从指定的URL爬取网站内容,为GPT模型提供学习和生成知识的素材。 2. **生成知识文件**:爬取的内容不仅被存储,还将被转化成知识文件,这些文件可以用来培训你自己的GPT模型。 3. **自定义GPT模型**:利用生成的知识文件,用户可以定制自己的GPT模型,以便生成特定类型的文本。 4. **MIT许可证**:gpt-crawler是在MIT许可下发布的,这意味着您可以自由地使用,复制,修改,合并,发布,分发,再许可,或者销售这个软件。
GPT-SoVITS

GPT-SoVITS

零样本文本到语音(TTS): 输入5秒的声音样本,即刻体验文本到语音转换。 少样本TTS: 仅需1分钟的训练数据即可微调模型,提升声音相似度和真实感。 跨语言支持: 支持与训练数据集不同语言的推理,目前支持英语、日语和中文。 WebUI工具: 集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注,协助初学者创建训练数据集和GPT/SoVITS模型。 介绍视频 https://www.bilibili.com/video/BV12g4y1m7Uw/ 来自B站up主:花儿不哭
Segment-Anything

Segment-Anything

Segment-Anything是一个模型,它提供了运行推理的代码、训练模型的检查点下载链接以及示例笔记本。以下是Segment-Anything的功能特点总结: 推理功能:Segment-Anything模型通过使用已训练的模型检查点,可以对图像进行分割,并提取出图像中各个区域的感兴趣部分。 模型检查点下载:用户可以从该项目中获取已经训练好的模型检查点,以便在自己的应用中使用或进行二次开发。 示例笔记本:Segment-Anything提供了一些示例笔记本,展示了如何使用该模型进行图像分割的步骤和方法。 开放源代码:Segment-Anything的代码是开放源代码,并使用Apache-2.0许可证进行授权,这意味着用户可以自由地使用、修改和分发代码。
LabelU 开源标注工具

LabelU 开源标注工具

1.产品介绍 一款轻量级开源标注工具,自由组合多样工具,无缝兼容多格式数据,同时支持载入预标注,加速数据标注效率 2.特色功能 LabelU 提供了多种标注工具和功能,支持图像、视频、音频标注。 · 图像类:多功能图像处理工具,涵盖 2D 框、语义分割、多段线、关键点等多种标注工具,协助完成图像的标识、注释和分析。 · 视频类:具备强大视频处理能力,可实现视频分割、视频分类、视频信息提取等功能,为模型训练提供优质标注数据。 · 音频类:高效精准的音频分析工具,可实现音频分割、音频分类、音频信息提取等功能,将复杂的声音信息直观可视化。 3.产品特性 · 简易,提供多种图像标注工具,通过简单可视化配置即可标注 · 灵活,多种工具可自由组合使用,满足大部分图像,视频,音频的标注需求 · 通用,支持导出多种数据格式,包括 JSON,COCO,MASK