Buzz:离线开源免费语音转文字(字幕) 翻译站点

Buzz:离线开源免费语音转文字(字幕) 翻译站点

Whisper 是一种通用语音识别模型。它利用各种大型数据集上的音频进行训练,也是一个多任务模型,可以执行多语言语音识别以及语音翻译和语言识别。 在第一次使用 Buzz 的时候,会下载 Whisper 的模型,根据不同的质量要求,模型尺寸也非常可观: Whisper模型存储在~/.cache/wilsper中。 Whisper.cpp模型存储在~/Library/Caches/Buzz(Mac OS)、~/.cache/Buzz(Unix)或C:Users<username>AppDataLocalBuzzBuzzcache(Windows)中。 Hugging 模型存储在~/.cache/huggingface/hub中。 https://github.com/chidiwilliams/buzz
9810
CapsWriter-Offline 语音输入 字幕转录工具

CapsWriter-Offline 语音输入 字幕转录工具

这是 CapsWriter-Offline ,一个 PC 端的语音输入、字幕转录工具。 两个功能: 视频教程: CapsWriter-Offline 电脑端离线语音输入工具 对 Windows 端: 其它系统: 模型说明: 下载地址: (百度网盘容易掉链接,补链接太麻烦了,我不一定会补链接。GitHub Releases 界面下载是最可靠的。)
1,4510
LabelU 开源标注工具

LabelU 开源标注工具

1.产品介绍 一款轻量级开源标注工具,自由组合多样工具,无缝兼容多格式数据,同时支持载入预标注,加速数据标注效率 2.特色功能 LabelU 提供了多种标注工具和功能,支持图像、视频、音频标注。 · 图像类:多功能图像处理工具,涵盖 2D 框、语义分割、多段线、关键点等多种标注工具,协助完成图像的标识、注释和分析。 · 视频类:具备强大视频处理能力,可实现视频分割、视频分类、视频信息提取等功能,为模型训练提供优质标注数据。 · 音频类:高效精准的音频分析工具,可实现音频分割、音频分类、音频信息提取等功能,将复杂的声音信息直观可视化。 3.产品特性 · 简易,提供多种图像标注工具,通过简单可视化配置即可标注 · 灵活,多种工具可自由组合使用,满足大部分图像,视频,音频的标注需求 · 通用,支持导出多种数据格式,包括 JSON,COCO,MASK
8510