#VITS

vits - 基于变分自编码器和对抗学习的端到端TTS系统

VITS语音合成变分自编码器对抗学习TTSGithub开源项目

VITS是一种结合变分自编码器和对抗学习的端到端TTS系统，能够提升语音合成的自然度。通过变分推理和正态化流，以及随机时长预测器，VITS实现了多样节奏的语音合成。实验结果表明，该方法在LJ Speech数据集上的表现优于现有的TTS系统，接近真实语音的水平。

vits_chinese - 基于BERT和VITS技术的文本到语音合成系统

TTSBERTVITS文本到语音自然语言处理Github开源项目

vits_chinese项目引入了BERT和VITS技术，通过隐藏的韵律嵌入和自然语言特性，显著提高了文本到语音合成的音质和自然度。此项目不只适于高质量音频生成，也提供模块化蒸馏加速和在线演示，便利学习和开发人员的应用。

TensorVox - 用 C++ 编写的神经语音合成桌面应用程序

TensorVox神经语音合成TensorFlowTTSCoqui-TTSVITSGithub开源项目

TensorVox是为提高神经语音合成技术普及度而设计的桌面应用。支持多语言，不需庞大Python库，该工具通过TensorFlow C API和LibTorch实现轻量级操作。提供清晰易懂的模型训练和导出指南，是语音技术爱好者的顶级选择。

Bert-VITS2 - 多语言BERT驱动的语音合成模型

Bert-VITS2FishAudioMassTTSTTSVITSGithub开源项目

Bert-VITS2项目融合了多语言BERT和先进的自回归TTS模型，提供高品质的语音合成。此项目参考了MassTTS等开源项目，并推荐使用Fish-Speech。详情和演示请参见视频链接和文档，项目强调中文用户需求和法律合规，禁止违规用途。

sound_dataset_tools2 - 多功能语音数据集制作工具

sound_dataset_tools2语音数据集音频处理GUI界面VITSGithub开源项目

sound_dataset_tools2是一款语音数据集制作工具。它具有GUI界面，支持音频+字幕和纯音频自动切割两种数据导入方式。该工具优化音频切割效果，减少断音问题，可导出符合VITS等项目要求的数据集格式。它还包含语音评测功能，有助于从大量数据中筛选出高质量数据集。此工具适用于需要创建语音数据集的研究人员和爱好者。

ChatWaifu - 多语言AI语音交互系统

ChatGPT语音对话VITS多角色语音AI交互Github开源项目

ChatWaifu是一个结合TTS和VITS技术的AI语音对话系统，实现与ChatGPT的自然语音交互。该项目支持多角色语音、语音识别对话，并提供Marai机器人和Live2D的UI版本对接。支持中文、英语和日语，为用户提供多语言AI对话体验。ChatWaifu为AI领域研究者和开发者提供了一个探索语音交互应用的开放平台。

whisper-vits-svc - 基于VITS的端到端歌声转换开源项目

VITS语音转换深度学习PyTorchAIGithub开源项目

whisper-vits-svc是一个开源的端到端歌声转换项目,基于VITS模型架构。该项目支持多说话人转换,可混合创建新音色,并能处理带轻伴奏的声音。它集成了Whisper、BigVGAN等技术,提高了抗噪性和音质。项目面向深度学习入门者,需要Python和PyTorch基础。目前不支持实时转换,训练需要至少6GB显存。

Retrieval-based-Voice-Conversion - 基于VITS的开源语音转换框架

RVC语音转换AI语音开源框架VITSGithub开源项目

Retrieval-based-Voice-Conversion是一个基于VITS的开源语音转换框架。该项目提供库、API和命令行接口，支持标准和自定义设置，允许灵活配置模型和环境。它具有详细的音频推理参数设置功能，并支持Docker部署，使语音转换技术更易于使用和实施。

VITS-fast-fine-tuning - 个性化多语言语音合成与转换工具

VITS语音克隆文本转语音多语言声音转换Github开源项目

VITS-fast-fine-tuning是一个开源的语音合成项目，旨在快速实现个性化的多语言文本转语音和声音转换功能。该工具支持中英日三语合成，允许用户添加自定义声音，并实现角色间的声音转换。项目提供本地训练和Google Colab两种方式，适应不同用户需求。此外，它能从多种音频源（如短音频、长音频、视频和B站链接）克隆声音，为用户提供灵活的声音定制选项。VITS-fast-fine-tuning的微调过程通常只需1小时左右，大大提高了个性化语音模型的开发效率。

mms-tts-eng - Facebook开源英语文本转语音AI模型

模型MMS多语言语音英语开源项目Huggingface文字转语音GithubVITS

Facebook开发的MMS项目推出英语文本转语音模型，采用VITS架构实现高质量语音合成。该开源模型可通过Hugging Face Transformers库调用，支持非确定性合成以生成富有表现力的语音。作为多语言语音技术项目的一部分，此模型旨在推动语音合成技术在更多语言中的应用。

mms-tts-cat - Facebook MMS项目推出加泰罗尼亚语文本转语音模型

模型语音合成加泰罗尼亚语多语言GithubVITSMMS开源项目Huggingface

该模型是Facebook Massively Multilingual Speech项目的加泰罗尼亚语文本转语音(TTS)模型。基于VITS架构,通过端到端训练实现高质量语音合成。模型结构包括后验编码器、解码器和条件先验,采用变分推理和对抗训练方法。研究人员可通过Transformers库便捷使用此模型生成加泰罗尼亚语语音。

相关文章

Article Cover

VITS: 端到端文本转语音的新突破

Article Cover

VITS中文语音合成系统: 基于BERT和VITS的高质量TTS实践

Article Cover

TensorVox:轻量级桌面神经网络语音合成应用

Article Cover

Sound Dataset Tools 2: 一个强大的语音数据集制作工具

Article Cover

Whisper-VITS-SVC: 一个强大的歌声转换与克隆引擎

Article Cover

Retrieval-based Voice Conversion: 语音转换的革命性技术

Article Cover

ChatWaifu: 打造您的专属AI虚拟伴侣

Article Cover

VITS快速微调：打造个性化多语言语音合成与声音转换系统

Article Cover

VITS入门指南 - 强大的端到端语音合成模型

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号