Project Icon

Whisper-Finetune

语音识别模型的高效微调与加速

Whisper-Finetune项目致力于优化OpenAI的Whisper语音识别模型。该项目采用Lora技术进行微调,支持多种数据类型的训练,并通过CTranslate2和GGML实现加速推理。此外,项目提供了跨平台应用和服务器部署方案,为语音识别应用开发提供了全面支持。

Arabic-Whisper-CodeSwitching-Edition - 针对阿拉伯语和英语混合语音的优化识别模型
GithubHuggingfacetransformers代码转换开源项目模型语言模型语音识别阿拉伯语
本模型是经过精调的OpenAI Whisper Large v2版本,旨在提升阿拉伯语和英语混合语音的识别精度。基于阿拉伯-英语代码切换数据集训练,适用于处理多语言环境中的阿拉伯语和英语混合语音。虽然在该特定场景中表现优异,但在其它语言或单语言场景中性能可能有所下降。
whisper-node - 提升本地转录性能的Node.js绑定
GithubJSONNode.jsOpenAIwhisper-node开源项目转录
Whisper-node是OpenAI Whisper的Node.js绑定,支持本地转录,输出格式包括JSON、.txt、.srt和.vtt。该项目经过CPU优化,支持Apple Silicon ARM,并提供单词级精度的时间戳。通过npm可快速安装,并可选下载模型。未来将增加浏览器兼容性、语言检测和说话者识别等新功能。
whisper-playground - 多语言实时语音转文字程序的快速搭建指南
CondaDiartGithubHugging FacePyannoteWhisper Playground开源项目
借助faster-whisper、Diart和Pyannote,构建支持99种语言的实时语音转文字应用程序。可以通过在线演示版直接体验,并依据清晰的设置指南迅速启动。该项目支持调整多种参数如模型大小、语言选择和转录方法,优化转录体验。项目依赖于Hugging Face Hub上的Pyannote模型,需先接受相应使用条款。提供详细的安装步骤和故障排查指导,方便解决常见问题。
Whisperboard - 提供的语音转录服务的开源iOS应用
GithubOpenAIWhisperBoardiOS开源项目灵活模型语音转录
WhisperBoard是一款开源iOS应用,基于OpenAI的Whisper模型,为用户提供高质量的语音转录服务。用户可通过简单操作开始录音,并进行高级语音转录。此应用支持音频文件的导入与导出,并可灵活选择录音麦克风,以确保最佳音质。用户还可以在应用中浏览和下载不同的Whisper模型,以满足不同需求。未来功能包括实时转录和可恢复转录进程。
whispercpp - Python绑定实现高效语音识别
GithubPybind11Python绑定whisper.cppwhispercpp开源项目语音转文字
whispercpp是一个基于Pybind11的whisper.cpp Python绑定库,为开发者提供高效的语音识别功能。该库支持快速加载预训练模型、转录音频文件,并具有实验性的流式转录功能。whispercpp提供简洁的API接口,方便快速集成whisper.cpp的功能。它还遵循XDG Base Directory规范,确保合理的文件管理。这个项目为Python开发者提供了便捷的方式来使用whisper.cpp的强大语音识别能力。
whisper-vits-svc - 基于VITS的端到端歌声转换开源项目
AIGithubPyTorchVITS开源项目深度学习语音转换
whisper-vits-svc是一个开源的端到端歌声转换项目,基于VITS模型架构。该项目支持多说话人转换,可混合创建新音色,并能处理带轻伴奏的声音。它集成了Whisper、BigVGAN等技术,提高了抗噪性和音质。项目面向深度学习入门者,需要Python和PyTorch基础。目前不支持实时转换,训练需要至少6GB显存。
WhisperHallu - 实验性音频预处理工具提升Whisper转录准确度
AI处理GithubWhisper噪音去除开源项目语音转录音频预处理
WhisperHallu是一个实验性音频预处理项目,通过降噪、静音去除和语音标记等技术优化Whisper转录,减少幻听文本。该工具提供多种处理选项,支持与WhisperTimeSync和karaok-AI等项目集成。项目包含Google Colab笔记本和详细的安装使用说明,为追求高质量音频转录的开发者和研究人员提供了实用解决方案。
whisper-jax - 速度提升70倍的Whisper JAX音频转录与翻译解决方案
GithubWhisper JAX并行处理开源项目性能模型音频转录
Whisper JAX是基于Hugging Face Transformers实现的音频转录与翻译模型,通过JAX代码优化实现70倍速度提升,兼容CPU、GPU和TPU。模型能在Hugging Face Hub演示,并提供详细的安装、使用和高级配置指南,助力开发者在多种环境下高效部署。
openai-whisper-talk - 多功能语音对话应用
Chat CompletionsEmbeddingsGithubOpenAIWhisperopenai-whisper-talk开源项目
openai-whisper-talk 是一个集成多项 OpenAI 技术的语音对话应用,组合了 Whisper 自动语音识别、Chat Completions 模拟对话、Text-to-Speech 语音合成功能。最新版本引入了时间表管理与长期记忆功能,能添加、修改、删除和检索事件,并保存信息供未来参考。基于 Vue.js 和 Nuxt 构建,实现了个性化互动,让对话更自然流畅。
Stage-Whisper - 跨平台免费开源音频转录工具
GithubStage-WhisperWhisper应用程序开源开源项目音频转录
Stage Whisper是一款免费开源的音频转录应用,基于OpenAI的Whisper模型,提供精确的音频文件转录。它拥有直观的图形界面,用户可以轻松存储和编辑转录内容。该项目旨在让非技术用户也能方便地使用Whisper的强大功能。适用于MacOS、Windows和Linux多平台,目前正进行重大改进,测试版即将发布。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号