TensorVox 项目介绍
TensorVox 是一款致力于在桌面环境中提供用户友好且轻量化的神经语音合成应用程序。其目的在于提高人们对该技术的可访问性,使得普通用户也可以轻松地进行语音合成体验。
背景技术
TensorVox 主要由 TensorFlowTTS 驱动,同时也引入了 Coqui-TTS 和 VITS。整个程序是用纯 C++/Qt 编写的,利用 Tensorflow 的 C API 来与 Tensorflow 模型交互(前两个模型),并使用 LibTorch 处理 PyTorch 模型。因此,用户不需要安装大型的 Python 库,只需几个简单的 DLL 文件即可进行推断。
软件功能与特性
TensorVox 支持从多个代码库中导入模型:
- TensorFlowTTS 支持的模型有 FastSpeech2、Tacotron2(基于字符和音素)及 Multi-Band MelGAN。
- Coqui-TTS 支持 Tacotron2(基于音素的 IPA)和 Multi-Band MelGAN,需将其从 PyTorch 转换为 Tensorflow。
- jaywalnut310/VITS 支持 VITS,这是一个端到端的模型。
这些模型示范提供了足够的指导,以便用户了解所需的步骤。对于希望专门为此目的训练模型的用户,推荐使用支持最好的 TensorFlowTTS 与实现最接近完美的 VITS。
语言支持
- TensorVox 支持英语(Coqui、TFTTS 和 VITS)、德语和西班牙语(仅支持 TensorFlowTTS)。用户无需对代码进行修改,即可添加语言,只需确保音素集是 IPA、ARPA 或 GlobalPhone。
开发与构建
TensorVox 目前仅支持 Windows 10 x64 环境(有报道称其运行在 8.1 上)。
构建要求
- Qt Creator
- MSVC 2017 (v141) 编译器
提供的构建步骤
- 下载 预编译的二进制依赖项和包含文件。
- 解压使得
deps
文件夹与项目主文件处于同一目录。 - 使用 Qt Creator 打开项目,添加编译器并进行编译。
用户需要下载发布版程序,并将此处新产生的可执行文件替换其中的可执行文件,以确保所有 DLL 文件到位。
外部依赖与鸣谢
TensorVox 在开发中借助了以下外部资源:
- LibTorch: 用于 PyTorch 的 C++ 前端。
- Tensorflow C API: 用于与 Tensorflow 进行交互的 C API。
- 其他包括 WAVE 文件导出处理、窗口样式、现代化 C++ 的 JSON 支持、降噪处理等,所有这些工具各显其能。
联系与支持
用户可以在此项目的 GitHub 页面提出问题,或加入 Discord 服务器 以进行讨论或寻求帮助。如需关于媒体、授权或其他正式事务的询问,请发送电子邮件至 9yba9c1y@anonaddy.me。
许可说明
TensorVox 程序本身使用 MIT 许可证。对于使用的模型,其各自的许可证要求可能会有所不同。例如,在越南使用 TensorFlowTTS 模型的用户需查阅 许可证详情。