#NeMo

GenerativeAIExamples - 生成式AI示例，快速部署和测试

NVIDIARAGLangChainTritonNeMoGithub开源项目

NVIDIA提供的生成式AI示例，使用CUDA-X软件栈和NVIDIA GPU，展示快速部署、测试和扩展AI模型的方法。包括最新的RAG管道构建技巧、实验性示例和企业应用，支持本地和远程推理，集成流行LLM编程框架，并附有详细开发文档。

parakeet-tdt_ctc-1.1b - 高性能自动语音识别模型解决方案

词错误率自动语音识别数据集Github开源项目快速同构体NeMoHuggingface模型

parakeet-tdt_ctc-1.1b提供了一个功能强大的语音识别模型，支持将语音转录为包含标点和大写字母的文本。由NVIDIA NeMo和Suno.ai团队联合开发，拥有1.1B的参数规模，能够高效地处理大规模的音频数据。该模型利用局部注意力和全局令牌技术实现单次处理11小时音频。其在多个公开数据集上的出色表现，表明其在语音转录应用中有广泛的适用性和较低的词错误率（WER）。

reazonspeech-nemo-v2 - 改进后的Conformer架构实现日语长音频自动语音识别

Huggingface模型NeMo语音识别Github日语开源项目ReazonSpeechConformer

reazonspeech-nemo-v2是一个基于改进Conformer架构的日语自动语音识别模型。它采用Longformer注意力机制和RNN-T结构，可处理长达数小时的音频。模型在ReazonSpeech v2.0语料库上训练，参数量为619M。通过reazonspeech库，用户可便捷地使用该模型进行日语语音识别。

speakerverification_en_titanet_large - NVIDIA TitaNet-Large英语说话人识别模型

模型说话人验证TitaNet说话人识别Github语音识别Huggingface开源项目NeMo

NVIDIA TitaNet-Large是一个专为英语说话人验证和分割设计的深度学习模型。它采用深度可分离1D卷积架构，参数量约23M，能从16kHz单声道音频中提取说话人特征。模型在VoxCeleb1等数据集上表现优异，可通过NVIDIA NeMo工具包进行推理和微调。适用于说话人验证、分割等多种语音识别任务。

parakeet-rnnt-0.6b - 先进的英语语音识别模型准确率达98.37%

模型Transducer开源项目Huggingface语音转文本FastConformerGithub自动语音识别NeMo

parakeet-rnnt-0.6b是NVIDIA NeMo和Suno.ai联合开发的英语语音识别模型。采用FastConformer Transducer架构，拥有约6亿参数。在LibriSpeech测试集上错误率仅1.63%，多个数据集上表现优异。支持16kHz单声道音频输入，可通过NeMo工具包使用，适用于多种语音转文本场景。

parakeet-tdt-1.1b - 先进的FastConformer-TDT英语语音识别模型

模型HuggingfaceFastConformerGithub语音识别TDTNVIDIA开源项目NeMo

parakeet-tdt-1.1b是NVIDIA NeMo和Suno.ai团队联合开发的英语语音识别模型。采用FastConformer-TDT架构，拥有11亿参数，在多个测试集上表现优异，LibriSpeech clean测试集词错误率为1.39%。可通过NeMo工具包轻松集成使用，适用于多种语音转文本场景。

parakeet-rnnt-1.1b - 高性能英语语音识别模型实现优异音频转文本效果

HuggingfaceFastConformer模型NeMoGithub自动语音识别开源项目英语语音模型Transducer

parakeet-rnnt-1.1b是NVIDIA NeMo和Suno.ai联合开发的英语语音识别模型。基于FastConformer Transducer架构，该模型拥有11亿参数，在64000小时英语语音数据上训练。它能准确将语音转录为小写英文文本，并在多个标准数据集上表现出色。研究人员可通过NeMo工具包使用该模型进行推理或微调，适用于多种语音识别场景。

mistral-nemo-instruct-2407-awq - Mistral-Nemo-Instruct-2407模型的AWQ量化指令版本

模型Github开源项目Huggingface人工智能自然语言处理大语言模型MistralNeMo

mistral-nemo-instruct-2407-awq是Mistral-Nemo-Instruct-2407模型的AWQ量化版本。这个项目通过使用AWQ（Activation-aware Weight Quantization）技术，在保持原有模型性能的基础上，显著降低了模型大小和计算资源需求。该模型适用于各类自然语言处理任务，为开发者和研究人员提供了一个优化的大规模语言模型选择。

parakeet-ctc-1.1b - 高效自动语音识别模型，快速完成语音转录

Github模型FastConformer开源项目词错误率NeMopytorch自动语音识别Huggingface

parakeet-ctc-1.1b是由NVIDIA NeMo和Suno.ai团队开发的ASR模型，采用FastConformer架构，参数量约11亿。该模型适用于16kHz单声道音频，可以转录语音为小写英文。经过多数据集测试，字错率表现优异，如LibriSpeech clean数据集WER为1.83。利用NVIDIA NeMo工具包，该模型可用于推理或微调，适合多领域音频转录。

uzbek-speaker-verification-v4 - 乌兹别克语说话人验证模型NeMo实现的优化

模型性能NeMoGithub开源项目模型Huggingface自动语音识别数据集Uzbek-speaker-verification-v4

提供预训练的乌兹别克语说话人验证模型，适合语音识别任务，支持NeMo工具包中的推理和微调。模型经过大量语音数据训练，在标准语音识别中表现良好，适用于学术研究和商业应用。

相关文章

Article Cover

NVIDIA GenerativeAIExamples：加速生成式AI工作流的开源项目

2024年08月30日

Article Cover

GenerativeAIExamples学习资料汇总 - NVIDIA开源的生成式AI参考工作流

2024年09月10日

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号