BigVGAN

大规模训练的通用神经网络声码器

BigVGAN是一个通过大规模训练实现的通用神经网络声码器。它可高质量合成多语言语音、环境声音和乐器声音等多种音频。项目提供多个预训练模型，支持44kHz采样率和512倍上采样比率。BigVGAN集成自定义CUDA内核，在单个A100 GPU上推理速度提升1.5-3倍。

访问官网

Multi-Tacotron-Voice-Cloning - 实现俄语和英语语音克隆的多功能深度学习系统

GithubMulti-Tacotron Voice Cloning多语种开源项目文本转语音深度学习语音合成

Multi-Tacotron-Voice-Cloning 是基于Real-Time-Voice-Cloning开发的，支持俄语与英语的多语言语音克隆系统。该系统能够利用几秒钟的音频样本，生成声音的数值模型并应用于文本到语音的转换。提供预训练模型和广泛的数据集，同时支持在线Colab演示，适合需要进行英语或俄语语音合成的用户。

EigenGAN-Tensorflow - 层级特征分解的生成对抗网络框架

EigenGANGithub人脸生成图像属性编辑开源项目无监督学习生成对抗网络

EigenGAN-Tensorflow是一个基于TensorFlow实现的生成对抗网络框架,采用层级特征分解方法。该项目提供CelebA和Anime数据集的训练测试代码,可生成和操控高质量人脸与动漫图像。通过特征分解实现图像属性的无监督学习和精确控制,支持多GPU训练,并提供预训练模型。此开源项目为GAN研究和开发提供了实用工具。

wav2vec2-large-xlsr-53-chinese-zh-cn - 中文自动语音识别模型提供广泛应用支持

Common VoiceGithubHuggingSoundHuggingfaceXLSR Wav2Vec2开源项目模型语音识别语音转录

该模型基于Common Voice、CSS10和ST-CMDS数据集，对facebook的wav2vec2-large-xlsr-53进行了微调，以实现中文自动语音识别。模型能够处理16kHz采样率的语音输入，可通过HuggingSound库直接进行语音转录或使用定制推理脚本。评估结果显示，模型在Common Voice测试数据集上WER为82.37%，CER为19.03%。感谢OVHcloud提供的GPU支持，该模型适用于医药、教育等领域语音数据处理。

Awesome-Talking-Head-Synthesis - 最新音频驱动和神经辐射场技术在数字人头像生成中的应用

3DGithubNeRFTalking Head Synthesis开源项目数据集音频驱动

这个项目收集了生成对抗网络(GANs)和神经辐射场(NeRF)在说话头合成领域的相关研究。内容包括图像和音频驱动的说话头生成技术、数据集、研究综述和代表性工作。从2D到3D、单模态到多模态,项目全面展示了说话头生成的技术发展,为相关研究提供参考资料。

parler-tts-large-v1 - 开源大规模语音合成模型支持自然语言控制和多人声定制

GithubHuggingfaceParler TTS人工智能开源项目模型自然语言处理语音合成音频生成

Parler-TTS Large v1是一个基于22亿参数、45K小时音频数据训练的文本转语音模型。通过文本提示可控制语音的性别、噪音、语速等特征，内置34个预设发音人。项目开源了完整训练资源和数据处理代码，采用Apache 2.0许可证发布。

wav2vec2-large-xlsr-53 - 突破性多语言语音识别模型适用低资源语言场景

GithubHuggingfaceWav2Vec2-XLSR-53多语言模型开源项目模型深度学习语音识别预训练模型

Wav2Vec2-XLSR-53是一款基于wav2vec 2.0架构的多语言语音识别模型。该模型通过在53种语言的原始音频上预训练，学习跨语言语音表示。在CommonVoice和BABEL等基准测试中，Wav2Vec2-XLSR-53显著优于单语言模型，特别适合低资源语言的语音识别任务。这一开源项目为研究人员提供了强大工具，有助于推动低资源语言语音理解的进展。

whisper-vits-svc - 基于VITS的端到端歌声转换开源项目

AIGithubPyTorchVITS开源项目深度学习语音转换

whisper-vits-svc是一个开源的端到端歌声转换项目,基于VITS模型架构。该项目支持多说话人转换,可混合创建新音色,并能处理带轻伴奏的声音。它集成了Whisper、BigVGAN等技术,提高了抗噪性和音质。项目面向深度学习入门者,需要Python和PyTorch基础。目前不支持实时转换,训练需要至少6GB显存。

F5-TTS - 提高训练和推理速度的先进文本到语音转换系统

E2 TTSF5-TTSGithub开源项目推理数据集训练

项目F5-TTS利用Diffusion Transformer和ConvNeXt V2技术，显著提升了训练和推理速度。支持生成最长30秒的音频，并通过Sway Sampling技术优化推理性能。用户可以自定义数据集，并使用多GPU和fp16配置加速训练。提供单次推理、语音编辑和批量推理功能，并支持通过Gradio App进行操作。多种测试数据集和评估工具确保模型表现稳定高效。

glow-tts - 通过单调对齐搜索进行文本转语音的生成流

GithubGlow-TTSHiFi-GAN并行合成开源项目文本转语音模型训练

Glow-TTS，一款创新的文本到语音转换模型，独立完成文本与语音的单调对齐搜索，无需外部辅助。此模型不仅大幅提升合成速度，还支持多样性与可控性，并可适应多说话人环境。更新项包括采用新技术降低噪声并优化发音，使其在速度和音质上优于传统模型。

whisper - 多语种语音识别与翻译解决方案

GithubOpenAITransformer模型Whisper多语言处理开源项目热门语音识别

Whisper是一个通用语音识别模型，支持多种语言处理任务，如语音翻译和语言识别。该模型基于大规模多样化音频数据集进行训练，利用Transformer技术实现高效的序列到序列学习。用户可以通过简单的命令或Python代码实现快速准确的语音识别与翻译，是一个适用于多种应用场景的强大工具。支持多个模型大小和语言选项，用户可根据需求选择合适的模型。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com