Project Icon

wespeaker

深度学习声纹识别开源工具包 支持多模型和应用场景

WeSpeaker是一个开源的说话人嵌入学习工具包,主要用于说话人验证。它支持在线特征提取和加载预提取的kaldi格式特征,提供ResNet和ECAPA-TDNN等多种预训练模型。WeSpeaker具有命令行和Python编程接口,在VoxCeleb和CNCeleb等数据集上表现出色。此外,它还提供说话人分割功能。这个工具包适用于研究和生产环境,为声纹识别领域提供了有力支持。

wespeaker-voxceleb-resnet34-LM - 采用预训练的Wespeaker嵌入模型优化音频说话人识别
GithubHuggingfacepyannote.audio声纹识别开源项目模型深度学习音频处理
这个开源项目集成了WeSpeaker的wespeaker-voxceleb-resnet34-LM预训练模型,适用于pyannote.audio,提升说话人识别和验证的效率。可执行基础和高级功能,如GPU加速、音频片段嵌入提取和滑动窗口特征识别。兼容pyannote.audio 3.1及更高版本,以提供更加快速和可靠的音频处理方案。
3D-Speaker - 开源多模态说话人识别与验证工具包
3D-SpeakerGithubModelScope开源工具包开源项目说话人验证预训练模型
3D-Speaker是一个开源的单模态和多模态说话人验证、识别和分离工具包。它提供ERes2Net、CAM++等预训练模型,适用于多种说话人相关任务。该项目发布的大规模语音数据集3D-Speaker有助于语音表示解耦研究。3D-Speaker支持有监督和自监督训练,以及语言识别等多种实验设置,为研究人员提供全面的说话人技术解决方案。
deep-speaker - 深度学习语者嵌入系统,适用语者识别与验证
Deep SpeakerGithubKerasTensorflow开源项目神经网络说话人嵌入
本系统利用神经网络将语音映射到超球面,通过余弦相似度计算语音相似度,实现语者识别、验证与聚类。基于TensorFlow和Keras实现,支持多版本,提供可训练和预训练模型。适用于需大规模数据处理和高性能计算的用户,并提供详细的训练与测试指南。
wenet - 轻量精准的全栈语音识别解决方案
GithubWeNet安装指南开源工具包开源项目文档语音识别
WeNet项目提供生产就绪的全栈语音识别方案,强调精准与轻量化。项目在多个公共语音数据集上实现了最先进效果。WeNet易于安装和使用,支持Python编程和命令行操作,并兼容多种硬件,包括Ascend NPU。通过借鉴ESPnet和Kaldi等项目,WeNet提供高效的模型训练和部署方式。用户可在GitHub或微信讨论群中参与交流,获取技术支持和项目信息更新。
wekws - 端到端关键词检测的开源工具包
GithubWeKws关键词识别唤醒词检测开源项目深度学习物联网设备
WeKws是一个面向生产环境的端到端关键词检测工具包。它支持多种应用场景,包括单一唤醒词、多唤醒词、可定制唤醒词和个性化唤醒词。该工具包针对物联网设备优化,具有低功耗、参数少、计算复杂度低和流式检测等特点。WeKws兼容多种开源唤醒词数据集和硬件平台,如Web浏览器、x86、Android和树莓派。
embedding - 开源说话人嵌入模型 改进x-vector架构提升语音识别效果
GithubHuggingfaceVoxCelebpyannote嵌入模型开源项目模型说话人识别音频处理
这是一个基于pyannote.audio的开源说话人嵌入模型,采用改进的x-vector TDNN架构和SincNet特征。模型在VoxCeleb 1测试集上达到2.8%的等错误率,无需额外的语音活动检测或PLDA。支持GPU加速、音频片段嵌入提取和滑动窗口嵌入等功能,可用于说话人识别、验证和分类等任务。
wavlm-base-sv - WavLM预训练模型声纹识别与说话人验证系统
GithubHuggingfaceWavLM开源项目模型自监督学习语音处理语音识别说话人验证
WavLM是Microsoft开发的说话人验证预训练模型,基于16kHz采样语音训练,使用960小时Librispeech数据集预训练,并在VoxCeleb1数据集上进行X-Vector架构微调。模型通过话语和说话人对比学习,实现语音特征提取、身份验证及声纹识别。
spkrec-ecapa-voxceleb - 基于SpeechBrain的ECAPA-TDNN说话人验证系统
ECAPA-TDNNGithubHuggingfaceSpeechBrainVoxCeleb开源项目模型语音识别说话人验证
该项目基于SpeechBrain框架,提供预训练的ECAPA-TDNN模型用于说话人验证和嵌入提取。模型在VoxCeleb 1和2数据集上训练,在VoxCeleb1测试集达到0.80%的错误等价率。系统架构结合卷积和残差块,采用注意力统计池化提取嵌入,并使用加性边际Softmax损失训练。项目提供简单的接口,方便用户进行说话人验证或嵌入提取,可应用于多种语音识别场景。
spkrec-xvect-voxceleb - 基于xvector的说话人识别与验证技术
GithubHuggingfaceSpeechBrainTDNN模型Voxcelebxvectors开源项目模型语者验证
利用SpeechBrain的TDNN预训练模型,提供基于xvector嵌入的说话人识别和验证。该工具采用Voxceleb数据集并在Voxceleb1测试集上获得了3.2%的EER表现,支持GPU推理,自动化音频处理确保输入符合要求。
voxcelebs12_rawnet3 - 多语言语者识别解决方案,提升音频处理能力
ESPnetGithubHuggingfaceVoxCeleb多语言开源项目模型演讲者识别语音识别
RawNet3模型基于ESPnet2框架和VoxCeleb数据集进行训练,专注于提升语者识别和音频处理的精度。该模型结合自监督式前端和现成工具,提供了创新的语者嵌入解决方案。用户可按照ESPnet的安装指南下载并应用此模型,配置选项包括Adam优化器和余弦退火调度器,充分保障模型训练过程的高效性与稳定性。适用于多语言语者识别应用场景,助力开发者增强音频处理的精度与便捷性。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号