AudioGPT

AudioGPT

这是一个借助大语言模型(LLM)处理音频的工具,可以: – 生成音乐 – 背景音效 – 音频生成字幕 – 文字生成音频 – 文字生成音频并模拟声音 – 根据图片生成音频 – 对音频进行inpaint(局部屏蔽) – 根据音频和人脸照片合成视频 – 检测音频中的事件,以及开始和结束时间 – 单声道变双声道 – 通过文本描述检测特定声音发生的时间 – 抽取某种声音 – 去除背景噪音 多人混合声分离出单人声音 语音翻译 http://github.com/AIGC-Audio/AudioGPT 演示:https://huggingface.co/spaces/AIGC-Audio/AudioGPT 论文:https://arxiv.org/abs/2304.12995
7120
pdf2htmlEX

pdf2htmlEX

一个用于将PDF文件转换为HTML格式的开源工具。它是由coolwanglu在GitHub上开发和维护的。这个工具的主要功能是将PDF文件中的文本、图像、表格等内容提取出来,并将其转换为可以在网页浏览器中显示的HTML格式。 pdf2htmlEX支持多种操作系统,包括Windows、Linux和macOS。它具有简单易用的界面,用户只需通过简单的命令行操作即可完成PDF到HTML的转换。此外,pdf2htmlEX还提供了一些高级功能,如自定义输出样式、设置转换参数等,以满足不同用户的需求。
1,1220
DeepLX

DeepLX

OwO-Network/DeepLX是一个开源项目,它基于DeepL免费服务,将其转换为本地API,提供给第三方程序使用,例如沉浸式翻译、Bob等。DeepLX默认监听本地1188端口,提供多种安装方式,包括Windows、macOS、Linux和Docker。 DeepLX是无限制请求次数的,但DeepL可能会限制IP。在Python中使用DeepLX时,如果遇到429错误,表示你的IP已被暂时屏蔽,请不要频繁请求。
1,2920
Massively Multilingual Speech

Massively Multilingual Speech

Facebook AI推出了一款多语言语音识别模型,它是目前最先进的系统之一,可以同时支持多种语言的语音识别,包括非标准化和口音较重的语音。该模型使用了先进的深度学习技术和自监督学习方法,以更好地利用大量未标记的数据进行训练,并在多项基准测试中取得了最优秀的结果。这一技术的应用可以极大地提高语音识别的准确性和可用性,为用户提供更好的语音交互体验。
7220