Project Icon

data2vec-audio-base-960h

利用自监督学习提升语音识别效率的开源框架

Data2Vec是一种开源模型,基于Librispeech数据集进行960小时的16kHz语音音频的预训练和微调,在语音识别领域表现优异。利用自监督学习与自蒸馏手段,Data2Vec准确提取上下文信息,优化了自动语音识别的表现。在LibriSpeech的测试中,取得了“clean”任务2.77和“other”任务7.08的词错误率(WER),体现了其在业内的竞争力。

Wav2Vec2-large-xlsr-hindi - 针对印地语优化的开源语音识别模型
GithubHindiHuggingfaceWav2Vec2开源项目模型深度学习自然语言处理语音识别
Wav2Vec2-large-xlsr-hindi是一个专为印地语优化的开源语音识别模型。该模型基于Facebook的wav2vec2-large-xlsr-53架构,通过低资源印度语言多语言ASR挑战数据集进行微调。适用于16kHz采样的语音输入,无需额外语言模型即可直接使用。在Common Voice印地语测试集上,模型达到72.62%的词错误率。项目提供了完整的使用指南、评估方法和训练脚本,为研究人员的进一步开发和应用提供了便利。
libriheavy - 大规模语音识别数据集,50,000小时带标点和上下文
GithubLibriheavy上下文开源项目数据集标点符号语音识别
Libriheavy是基于Librilight的大规模标注语音数据集,总时长达50,000小时。该数据集包含标点、大小写和上下文信息,适用于多种语音任务研究。Libriheavy提供完整版和ASR训练专用版本,支持多种数据格式。此外,项目还提供基线模型和性能排行榜,展示了在不同规模子集上的识别效果。研究人员可以通过简单步骤获取并使用这一丰富的语音识别资源。
faster-whisper-large-v2 - 多语言语音识别模型 支持高效转录和翻译
CTranslate2GithubHuggingfaceWhisper开源项目模型模型转换自然语言处理语音识别
faster-whisper-large-v2是基于OpenAI Whisper large-v2模型转换的CTranslate2格式语音识别模型。该模型支持100多种语言的音频转录和翻译,性能高效且语言覆盖范围广泛。开发者可通过faster-whisper库轻松使用,实现强大的多语言语音处理。模型采用FP16格式保存权重,可在加载时根据需求调整计算类型,适应不同应用场景。
PaddlePaddle-DeepSpeech - 基于PaddlePaddle的开源中文语音识别系统
DeepSpeech2GithubPaddlePaddle开源项目深度学习端到端ASR语音识别
PaddlePaddle-DeepSpeech是一个基于PaddlePaddle框架的中文语音识别项目。该系统支持自定义数据集训练和多种数据增强方法,适用于多样化场景。项目提供预训练模型,兼容Windows和Linux平台,并支持Nvidia Jetson等开发板推理。系统集成了GUI界面、Web部署和长语音识别功能,为开发者提供完整的语音识别工具链。
wav2vec2-large-xlsr-53-portuguese - XLSR-53微调的葡萄牙语语音识别模型
Common VoiceGithubHuggingfaceWav2Vec2XLSR-53开源项目模型葡萄牙语语音识别
此语音识别模型通过在Common Voice 6.1数据集上微调XLSR-53模型,专门针对葡萄牙语优化。在测试中,模型表现优异,词错误率为11.31%,字符错误率为3.74%。模型设计用于处理16kHz采样率的语音输入,可独立使用或与语言模型结合以提升性能。项目还包含详细的使用说明和评估工具,方便研究者和开发者快速应用和测试。
vocos - 基于傅里叶变换的快速神经声码器
GithubVocos开源项目深度学习神经声码器语音技术音频合成
Vocos是一款创新的神经声码器,通过生成频谱系数而非时域样本来合成音频波形。它采用GAN训练,支持从梅尔频谱图和EnCodec令牌重建音频,实现了快速高效的音频合成。Vocos的独特设计弥合了时域和傅里叶域神经声码器之间的差距,为音频合成领域提供了新的解决方案。
Transformer-TTS - 神经语音合成系统
GithubPyTorchTacotronTransformer-TTS开源项目神经网络语音合成
Transformer-TTS,一个基于Pytorch的高效神经语音合成系统。它使用Transformer网络,且训练速度是传统seq2seq模型的3到4倍。不仅提供预训练模型,其合成语音质量经实验证明优异。同时,项目支持自定义学习模型及策略,包括Noam式预热衰减学习率及关键的梯度裁剪等,是语音合成研究的理想选择。
WhisperSpeech - 多语言支持的开源文本转语音系统,功能强大并易于定制
GithubWhisperSpeech多语言支持开源模型开源项目文本转语音语音克隆
WhisperSpeech是基于开源Whisper框架开发的文本至语音系统,提供了商业级安全的语音合成解决方案。当前支持英语LibreLight数据集,并计划拓展到多语言支持。用户可通过在线Colab平台体验其高效的语音合成和声音克隆功能。
deep-speaker - 深度学习语者嵌入系统,适用语者识别与验证
Deep SpeakerGithubKerasTensorflow开源项目神经网络说话人嵌入
本系统利用神经网络将语音映射到超球面,通过余弦相似度计算语音相似度,实现语者识别、验证与聚类。基于TensorFlow和Keras实现,支持多版本,提供可训练和预训练模型。适用于需大规模数据处理和高性能计算的用户,并提供详细的训练与测试指南。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号