wav2vec2-large-960h-lv60-self

Wav2Vec2大规模语音识别模型实现低词错误率

模型自训练 Github 语音识别模型评估开源项目 Huggingface Wav2Vec2 LibriSpeech

Wav2Vec2-large-960h-lv60-self是一个基于Wav2Vec2技术的大规模语音识别模型。该模型在960小时的Libri-Light和Librispeech数据集上进行预训练和微调，采用自训练方法。在LibriSpeech清晰测试集上，模型实现1.9%的词错误率，其他测试集上为3.9%。模型可直接用于音频转录，特别适合标记数据有限的语音识别任务。

Huggingface

介绍相关项目

english-filipino-wav2vec2-l-xls-r-test-09 - XLSR-53架构英语和菲律宾语双语语音识别模型

GithubHuggingfacewav2vec2人工智能开源项目机器学习模型语音模型语音识别

这是一个基于wav2vec2-large-xlsr-53-english模型在filipino_voice数据集上微调的英语-菲律宾语语音识别模型。通过20轮训练，模型在评估集上达到1.0054的损失值和57.50%的词错误率。采用Adam优化器、线性学习率调度和混合精度训练等技术，模型性能逐步提升，最终实现了较好的双语语音识别效果。

sew-d-tiny-100k-ft-ls100h - SEW-D架构语音识别模型实现性能与效率的优化平衡

GithubHuggingfaceLibriSpeechSEW-D开源项目模型深度学习自然语言处理语音识别

sew-d-tiny-100k-ft-ls100h是基于SEW-D架构的预训练语音识别模型，在LibriSpeech数据集上经过微调。模型在clean测试集和other测试集上分别达到10.47%和22.73%的词错误率，同时推理速度比wav2vec 2.0提升1.9倍。这一模型在保持识别准确率的基础上大幅提高了效率，可应用于自动语音识别、说话人识别等多种语音处理任务，为相关领域提供了性能与效率兼具的解决方案。

wav2vec2-xls-r-300m-ftspeech - 基于XLS-R-300m的丹麦语语音识别模型使用FTSpeech数据集微调

FTSpeechGithubHuggingfaceXLS-R-300mwav2vec2丹麦语开源项目模型语音识别

该丹麦语自动语音识别模型基于wav2vec2-xls-r-300m在FTSpeech数据集上微调。模型利用1,800小时丹麦议会演讲转录数据训练，在Danish Common Voice 8.0和Alvenir测试集上分别实现17.91%和13.84%的词错误率(WER)。这一性能表明，该模型为丹麦语语音识别任务提供了有效的解决方案。

w2v-bert-2.0 - 大规模多语言语音编码器

GithubHuggingfaceSeamless CommunicationTransformersW2v-BERT 2.0开源项目模型语音编码器预训练模型

W2v-BERT 2.0是一款开源的多语言语音编码器，基于Conformer架构设计。该模型包含6亿参数，在4.5百万小时的无标签音频数据上进行预训练，涵盖143种语言。作为Seamless系列的核心组件，W2v-BERT 2.0可应用于自动语音识别和音频分类等任务。该模型支持通过Hugging Face Transformers和Seamless Communication框架使用，为多语言语音处理研究提供了有力工具。

wav2vec2-indonesian-javanese-sundanese - 印尼、爪哇和巽他语的多语言语音识别模型

GithubHuggingfaceWav2Vec2印尼语多语言开源项目模型自动语音识别语音识别

利用优化的Wav2Vec2模型，专注于印尼、爪哇和巽他语的多语言语音识别，数据来自Common Voice和TTS数据集，拥有较低字错误率并提供在线演示，工具无需语言模型，适合16kHz语音输入，帮助研究人员和开发者探索多语言识别技术。

awesome-large-audio-models - 音频AI模型前沿进展与资源汇总

Github大型音频模型开源项目语音合成语音识别跨模态AI音乐生成

本项目汇总了音频AI领域的精选资源,涵盖语音识别、合成、翻译等多个方向的前沿进展。定期更新最新论文和开源实现,为研究者和开发者提供全面了解音频AI发展的平台。内容包括主流大型音频模型、各应用领域技术及大规模数据集,是音频AI研究的重要参考资料。

libriheavy - 大规模语音识别数据集，50,000小时带标点和上下文

GithubLibriheavy上下文开源项目数据集标点符号语音识别

Libriheavy是基于Librilight的大规模标注语音数据集，总时长达50,000小时。该数据集包含标点、大小写和上下文信息，适用于多种语音任务研究。Libriheavy提供完整版和ASR训练专用版本，支持多种数据格式。此外，项目还提供基线模型和性能排行榜，展示了在不同规模子集上的识别效果。研究人员可以通过简单步骤获取并使用这一丰富的语音识别资源。

wav2letter - 端到端语音识别解决方案

ASRFlashlightGithubwav2letter++卷积神经网络开源项目语音识别

wav2letter++现已整合到Flashlight中，专注于端到端和在线语音识别的研究。该项目提供多种预训练模型和数据准备指南，适用于有监督和半监督学习。通过Flashlight的ASR应用实现所有功能，确保高效、准确的语音识别。

vits2_pytorch - 单阶段文本到语音转换的效率与质量提升

GithubVITS2单阶段模型对抗学习开源项目文本转语音架构设计

VITS2_pytorch是一款先进的单阶段文本到语音转换模型，采用对抗学习和架构设计改进前代产品。这一最新的非官方实现版本，旨在通过增强模型结构和训练机制，有效提升语音自然度和特征相似性，同时显著降低对音素转换的依赖，从而提高训练和推断的效率。该项目还为专业人士提供了预训练模型和多种语言的样本音频，支持开箱即用的转换学习。

UniCATS-CTX-vec2wav - 声学上下文感知的创新声码器

CTX-vec2wavGithubUniCATS上下文感知声码器开源项目语音合成

UniCATS-CTX-vec2wav是UniCATS框架中的声学上下文感知声码器。该项目利用上下文VQ-Diffusion和声码化技术进行语音合成，提供完整的训练和推理流程。支持多GPU训练，并提供16kHz和24kHz采样率的预训练模型参数。此开源项目为研究人员和开发者提供了探索先进语音合成技术的平台。

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

Project Cover

天工AI音乐

天工AI音乐平台支持音乐创作，特别是在国风音乐领域。该平台适合新手DJ和音乐爱好者使用，帮助他们启动音乐创作，增添生活乐趣，同时发现和分享新音乐。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号