parakeet-ctc-1.1b

高效自动语音识别模型，快速完成语音转录

Github 模型 FastConformer 开源项目词错误率 NeMo pytorch 自动语音识别 Huggingface

parakeet-ctc-1.1b是由NVIDIA NeMo和Suno.ai团队开发的ASR模型，采用FastConformer架构，参数量约11亿。该模型适用于16kHz单声道音频，可以转录语音为小写英文。经过多数据集测试，字错率表现优异，如LibriSpeech clean数据集WER为1.83。利用NVIDIA NeMo工具包，该模型可用于推理或微调，适合多领域音频转录。

Github

Huggingface

介绍相关项目

FCH-TTS - 并行语音合成模型

GithubParallelTTS合成样例声码器开源项目语音合成预训练模型

FCH-TTS采用先进的并行语音合成技术，快速生成高质量语音。支持多语种及多种声音风格，满足多样化应用需求。项目持续迭代，引入诸如SoftDTW损失函数等新功能和优化，同时集成顶尖的声码器技术。FCH-TTS不仅提供预训练模型和丰富的合成示例，还允许用户自定义训练和合成，适用于教育、娱乐及商业多个领域。

metavoice-src - 1.2B参数开源TTS模型，支持情感语音合成和跨语言声音克隆

GithubMetaVoice-1BTTS开源开源项目情感语音语音克隆

MetaVoice-1B是一个开源的1.2B参数TTS模型，经过10万小时的语音训练，支持英语情感语音合成和零样本的美式和英式语音克隆（仅需30秒参考音频）。该模型还支持跨语言声音克隆和任意长度文本的语音合成。可通过云端或本地部署使用，并提供Hugging Face和Google Colab的演示。

transliterate - 高精度自然语言音译转换模型达99.12%准确率

AdamGithubHuggingfacetransliterate开源项目性能评估机器学习模型模型训练

基于深度学习架构的音译模型，通过优化训练实现99.12%的高准确率。模型能够稳定完成文本音译转换任务，在多项评估指标上均表现出色，为文本音译应用提供可靠支持。

speech-to-text-benchmark - 开源语音识别基准测试框架对比多家主流引擎

Github基准测试开源项目模型大小计算效率识别准确率语音转文本

该项目提供了一个开源的语音识别基准测试框架，对比了Amazon、Azure、Google等主流云服务以及OpenAI Whisper、Picovoice等引擎的性能。框架使用LibriSpeech、TED-LIUM和Common Voice数据集，评估词错率、计算效率和模型大小等指标。测试结果客观展示了各引擎在准确度和资源消耗方面的表现，为选择语音识别解决方案提供了参考依据。

wav2vec2-base-superb-ks - 高效的关键词识别音频分类模型

GithubHuggingfaceSUPERBWav2Vec2关键词识别开源项目模型语音命令音频分类

Wav2Vec2-Base模型支持SUPERB关键字识别任务，具备高准确性和快速响应的特点。该模型预训练于16kHz语音音频，采用Speech Commands数据集，通过Hugging Face的管道实现关键词检测，适应实时设备应用。

wavlm-libri-clean-100h-base-plus - WavLM微调模型在LibriSpeech数据集上的语音识别性能

GithubHuggingfaceLibriSpeechWavLM开源项目微调模型自然语言处理语音识别

本模型是基于microsoft/wavlm-base-plus在LibriSpeech ASR - CLEAN数据集上微调而来。经过3个epoch的训练，模型在评估集上达到0.0819的损失和6.83%的词错率。训练过程采用多GPU并行计算，使用Adam优化器和线性学习率调度器。模型的词错率从初始的100%显著降低至约7%，体现了其在语音识别任务上的卓越表现。模型基于Transformers 4.15.0.dev0和PyTorch 1.9.0+cu111框架，在8个GPU上进行分布式训练，并采用了Native AMP混合精度训练技术，有效提高了计算效率。

spear-tts-pytorch - Pytorch实现的多说话人文本转语音模型

GithubPyTorchSpear-TTS多说话人开源项目文本转语音注意力网络

Spear-TTS是一个基于Pytorch的多说话人文本转语音模型。该项目实现了高效的文本到语义转换，可用于SoundStorm项目的条件控制。Spear-TTS支持最小监督下的高保真语音合成，集成闪速注意力和推测性解码等技术，为TTS研究和开发提供了有力工具。

april-asr - 高效流式语音识别库，支持离线模式

APIGithubONNXRuntimeapril-asr开源项目离线转录语音识别

april-asr是一个轻量级离线流式语音识别库，提供C API接口并支持C#和Python绑定。该项目适用于实时字幕等应用场景，当前主要支持英语识别。april-asr基于ONNXRuntime开发，可在Linux和Windows平台上构建。项目虽仍在开发中，但已提供示例代码和模型训练指南，为开发者提供了简洁灵活的语音识别解决方案。

whisper-large-v3-turbo - OpenAI Whisper large-v3-turbo 快速多语言语音识别与翻译模型

AI模型GithubHuggingfaceTransformersWhisper多语言开源项目模型语音识别

Whisper large-v3-turbo是OpenAI推出的优化版语音识别和翻译模型。它在保持高质量输出的同时大幅提升了处理速度，支持100多种语言。该模型在噪声环境和不同口音下表现稳定，具备零样本学习能力。适用于实时转录、字幕生成等场景，代表了语音AI技术的最新进展。

sew-d-tiny-100k-ft-ls100h - SEW-D架构语音识别模型实现性能与效率的优化平衡

GithubHuggingfaceLibriSpeechSEW-D开源项目模型深度学习自然语言处理语音识别

sew-d-tiny-100k-ft-ls100h是基于SEW-D架构的预训练语音识别模型，在LibriSpeech数据集上经过微调。模型在clean测试集和other测试集上分别达到10.47%和22.73%的词错误率，同时推理速度比wav2vec 2.0提升1.9倍。这一模型在保持识别准确率的基础上大幅提高了效率，可应用于自动语音识别、说话人识别等多种语音处理任务，为相关领域提供了性能与效率兼具的解决方案。

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号