Logo

WhisperSpeech: 开源文本转语音技术的新突破

WhisperSpeech:开源文本转语音技术的新突破

在当今数字时代,语音技术的影响力正在迅速扩大。文本转语音(TTS)模型正在发挥变革性作用,从丰富有声读物到增强播客,甚至改善与聊天机器人的交互。今天,我们将为大家介绍这一领域的新成员 - WhisperSpeech,这是由Collabora开发的开源文本转语音模型。

WhisperSpeech简介

WhisperSpeech是一个开源的文本转语音系统,通过反转Whisper语音识别模型来实现语音合成。该项目的目标是成为语音领域的"Stable Diffusion",既强大又易于定制。WhisperSpeech只使用经过适当许可的语音录音,所有代码都是开源的,因此该模型始终可以安全地用于商业应用。

目前,WhisperSpeech的模型主要在英语LibreLight数据集上进行训练。在下一个版本中,开发团队计划支持多种语言(Whisper和EnCodec都是多语言的)。

WhisperSpeech架构图

WhisperSpeech的技术原理

WhisperSpeech的创新架构从Whisper语音识别模型中汲取灵感,并反转其操作,从转录转向文本到语音的合成。这种独特的方法为生成自然语音开辟了一系列可能性。该模型利用现有的开源技术,如Meta的Encodec音频编解码器和charactr的Vocos声码器,通过构建在已建立的解决方案之上来确保效率。

WhisperSpeech的工作原理如下:

  1. 利用OpenAI Whisper编码器块生成嵌入,然后对其进行量化以获得语义标记。

  2. 使用EnCodec对音频波形进行建模。它可以在1.5kbps的比特率下提供合理的质量,通过使用Vocos(在EnCodec标记上预训练的声码器)可以将其提升到高质量。

  3. 采用流行的seq2seq transformer和Collabora精心训练的模型进行语义到声学(S2A)和文本到语义(T2S)的处理。

  4. 这些模型与开源的Vocos声码器相结合,从文本输入产生高质量的语音输出。

WhisperSpeech的发展历程

WhisperSpeech的基础可以追溯到Google Research的SPEAR TTS论文。不幸的是,Google既没有发布代码也没有发布权重,因此Collabora团队决定开发一个新的开源TTS模型。

在开发过程中,WhisperSpeech经历了多次重要更新:

  • 2024年1月29日:成功训练了一个支持英语、波兰语和法语的"tiny" S2A模型,并实现了法语的声音克隆。

  • 2024年1月18日:优化了推理性能,集成了torch.compile,添加了kv-caching并调整了一些层,使模型在消费级4090 GPU上的运行速度超过实时12倍。同时,实现了在单个句子中混合多种语言。

  • 2024年1月10日:推出了一个新的SD S2A模型,在保持高质量语音生成的同时大大提高了速度。还添加了基于参考音频文件的声音克隆示例。

  • 2023年12月10日:发布了支持多语言(英语和波兰语)的新模型。

WhisperSpeech的应用场景

WhisperSpeech的应用范围广泛,包括但不限于:

  1. 音频编辑: TTS模型为创作者提供了在播客和视频中无缝修改音轨的能力。例如,可以用合成语音替换明确的内容,为自我审查和内容改编提供创造性的解决方案。

  2. 交互式语音应答(IVR)系统: WhisperSpeech的自然语音非常适合IVR系统,使自动交互对客户来说更加个性化和引人入胜。

  3. 公共广播: 在公共场所或商业环境中,该模型的逼真语音可用于清晰有效的公告。

  4. 有声读物和播客: 可以用于生成高质量的有声读物或增强播客的音频效果。

  5. 语音助手: 为智能语音助手提供更自然、更人性化的声音输出。

WhisperSpeech的未来展望

Collabora对WhisperSpeech的未来有雄心勃勃的计划:

  1. 多语言支持: 目前已经在英语、波兰语和法语上取得了成功,未来将支持更多语言。

  2. 情感和韵律控制: 计划找出一种方法来控制生成的情感和韵律。

  3. 社区合作: 创建一个社区努力,收集多种语言的免费许可语音。

  4. 最终多语言模型: 训练最终的多语言模型,实现更广泛的语言支持。

  5. 性能优化: 继续优化模型性能,使其在更多设备上实现实时运行。

  6. 商业应用: 由于使用了适当许可的数据集,WhisperSpeech可以安全地用于商业应用,这为其未来的广泛应用奠定了基础。

结语

WhisperSpeech代表了开源文本转语音技术的一个重要进步。通过结合Whisper的强大功能和创新的架构设计,WhisperSpeech为自然语音合成开辟了新的可能性。随着项目的不断发展和完善,我们可以期待看到更多令人兴奋的应用和突破。无论是在娱乐、教育还是商业领域,WhisperSpeech都有潜力改变我们与语音技术互动的方式。

对于那些对语音技术感兴趣的开发者和研究者来说,WhisperSpeech提供了一个绝佳的机会来探索和贡献开源TTS技术。通过访问WhisperSpeech的GitHub仓库,你可以深入了解项目的代码,尝试最新的模型,甚至为其未来的发展做出贡献。

随着语音技术在我们日常生活中扮演越来越重要的角色,像WhisperSpeech这样的开源项目将继续推动创新,使高质量的语音合成技术更加普及和易于获取。让我们共同期待WhisperSpeech为语音技术领域带来的更多突破和可能性。

最新项目

Project Cover
豆包MarsCode
豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。
Project Cover
AI写歌
Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。
Project Cover
商汤小浣熊
小浣熊家族Raccoon,您的AI智能助手,致力于通过先进的人工智能技术,为用户提供高效、便捷的智能服务。无论是日常咨询还是专业问题解答,小浣熊都能以快速、准确的响应满足您的需求,让您的生活更加智能便捷。
Project Cover
有言AI
有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。
Project Cover
Kimi
Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。
Project Cover
吐司
探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。
Project Cover
SubCat字幕猫
SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。
Project Cover
AIWritePaper论文写作
AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。
Project Cover
稿定AI
稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。
投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号