#越南语

PhoBERT: 越南语预训练语言模型的突破性进展

2024年09月05日
Cover of PhoBERT: 越南语预训练语言模型的突破性进展

vietTTS:开源越南语文本转语音库

2024年09月05日
Cover of vietTTS:开源越南语文本转语音库

viXTTS:革新越南语文本转语音技术的开源项目

2024年09月05日
Cover of viXTTS:革新越南语文本转语音技术的开源项目
相关项目
Project Cover

vixtts-demo

viXTTS是一个开源的文本转语音工具,基于XTTS-v2.0.3模型,主要针对越南语进行优化。该工具使用viVoice数据集微调,支持高质量声音克隆。用户可通过Hugging Face在线体验或在本地Ubuntu/WSL2系统运行。虽然重点优化越南语,但也支持其他语言尝试。项目提供详细的安装和使用说明,便于研究者和开发者使用。

Project Cover

vietTTS

vietTTS是一个开源的越南语文本转语音系统,集成了持续时间模型、声学模型和HiFiGAN声码器。项目提供预训练模型、数据处理工具、训练脚本和合成接口,便于研究和开发。包含详细文档,涵盖安装、数据准备和模型训练,对越南语语音合成技术发展具有参考价值。项目提供在线演示和音频样例,直观展示效果。目前项目已停止更新,新版本已迁移至LightSpeed项目,其中包含新的男声模型。

Project Cover

PhoBERT

PhoBERT是首个针对越南语的大规模预训练语言模型,基于RoBERTa架构开发。该模型在多项越南自然语言处理任务中展现出卓越性能,包括词性标注、依存句法分析、命名实体识别和自然语言推理。PhoBERT提供base和large两种版本,可通过transformers和fairseq库轻松集成使用,为越南语自然语言处理研究和应用开辟了新的可能。

Project Cover

vinai-translate-vi2en-v2

VinAI Translate是一个实现越南语和英语互译的神经机器翻译系统,以其创新架构和优异的实验结果,受到业界关注。研究人员可通过项目主页获取更多信息,并在使用时引用相关论文。

Project Cover

phobert-base-v2

phobert-base-v2是一个专为越南语设计的预训练语言模型。该模型基于RoBERTa架构,使用20GB维基百科和新闻文本以及120GB OSCAR-2301文本进行训练。在词性标注、依存句法分析、命名实体识别和自然语言推理等多项越南语自然语言处理任务中,phobert-base-v2展现出卓越性能。模型可通过Hugging Face transformers库轻松调用,最大支持256个token输入。

Project Cover

vinai-translate-en2vi-v2

VinAI开发的越南语-英语双向神经机器翻译系统,提供了两个预训练模型,分别用于越南语到英语和英语到越南语的翻译。系统采用神经网络架构,致力于提高翻译质量。研究人员可通过引用相关论文了解更多技术细节和实验结果。该项目为跨语言交流和自然语言处理研究提供了有价值的资源。

Project Cover

wav2vec2-base-vi

该项目开发了基于wav2vec2架构的越南语自监督学习模型。模型使用13000小时的多样化越南语YouTube音频数据进行预训练,包括清晰音频、噪声音频和对话等。项目提供95M参数的基础版和317M参数的大型版预训练模型。在VLSP 2020 ASR数据集上,大型模型配合5-gram语言模型可将词错率降至5.32%。这些模型为越南语语音识别等下游任务提供了有力支持。

Project Cover

phobert-base

PhoBERT作为针对越南语开发的预训练语言模型,提供base和large两个版本。该模型基于RoBERTa框架,优化了BERT的预训练方法。在词性标注、依存句法分析、命名实体识别和自然语言推理等多个越南语NLP任务中,PhoBERT均实现了性能突破,超越了现有的单语言和多语言模型。这一创新为越南语自然语言处理的研究与应用奠定了坚实基础。

Project Cover

symato

该项目使用独特的音节、标记和声调分割方法,开发了高效的越南语语言模型。通过创新的token化技术和RWKV架构,解决了传统Transformer模型在处理越南语多字节编码时的性能瓶颈。项目包括小数据集实验、大规模数据处理及大型模型训练,展示了在有限计算资源下应用规模规律的潜力。模型具有广泛适应性,既节省计算资源,又保持高效的文本生成和语言理解能力。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号