#越南语

该项目使用独特的音节、标记和声调分割方法，开发了高效的越南语语言模型。通过创新的token化技术和RWKV架构，解决了传统Transformer模型在处理越南语多字节编码时的性能瓶颈。项目包括小数据集实验、大规模数据处理及大型模型训练，展示了在有限计算资源下应用规模规律的潜力。模型具有广泛适应性，既节省计算资源，又保持高效的文本生成和语言理解能力。

vixtts-demo - 专注越南语的开源文本转语音工具

viXTTS文字转语音语音克隆越南语Hugging FaceGithub开源项目

viXTTS是一个开源的文本转语音工具，基于XTTS-v2.0.3模型，主要针对越南语进行优化。该工具使用viVoice数据集微调，支持高质量声音克隆。用户可通过Hugging Face在线体验或在本地Ubuntu/WSL2系统运行。虽然重点优化越南语，但也支持其他语言尝试。项目提供详细的安装和使用说明，便于研究者和开发者使用。

vietTTS - 开源越南语文本转语音系统

TTS语音合成HiFiGAN越南语预训练模型Github开源项目

vietTTS是一个开源的越南语文本转语音系统，集成了持续时间模型、声学模型和HiFiGAN声码器。项目提供预训练模型、数据处理工具、训练脚本和合成接口，便于研究和开发。包含详细文档，涵盖安装、数据准备和模型训练，对越南语语音合成技术发展具有参考价值。项目提供在线演示和音频样例，直观展示效果。目前项目已停止更新，新版本已迁移至LightSpeed项目，其中包含新的男声模型。

PhoBERT - 为越南语自然语言处理带来革新

PhoBERT自然语言处理预训练语言模型越南语transformersGithub开源项目

PhoBERT是首个针对越南语的大规模预训练语言模型,基于RoBERTa架构开发。该模型在多项越南自然语言处理任务中展现出卓越性能,包括词性标注、依存句法分析、命名实体识别和自然语言推理。PhoBERT提供base和large两种版本,可通过transformers和fairseq库轻松集成使用,为越南语自然语言处理研究和应用开辟了新的可能。

vinai-translate-vi2en-v2 - 精确的越南语与英语神经翻译模型

Github开源项目语言翻译VinAI Translate越南语模型Huggingface神经机器翻译英语

VinAI Translate是一个实现越南语和英语互译的神经机器翻译系统，以其创新架构和优异的实验结果，受到业界关注。研究人员可通过项目主页获取更多信息，并在使用时引用相关论文。

phobert-base-v2 - 为越南语开发的高性能预训练语言模型

模型Github预训练模型PhoBERT开源项目语言模型Huggingface越南语自然语言处理

phobert-base-v2是一个专为越南语设计的预训练语言模型。该模型基于RoBERTa架构，使用20GB维基百科和新闻文本以及120GB OSCAR-2301文本进行训练。在词性标注、依存句法分析、命名实体识别和自然语言推理等多项越南语自然语言处理任务中，phobert-base-v2展现出卓越性能。模型可通过Hugging Face transformers库轻松调用，最大支持256个token输入。

vinai-translate-en2vi-v2 - VinAI开发的越南语-英语双向神经机器翻译系统

VinAI Translate机器翻译Huggingface模型英语Github开源项目自然语言处理越南语

VinAI开发的越南语-英语双向神经机器翻译系统，提供了两个预训练模型，分别用于越南语到英语和英语到越南语的翻译。系统采用神经网络架构，致力于提高翻译质量。研究人员可通过引用相关论文了解更多技术细节和实验结果。该项目为跨语言交流和自然语言处理研究提供了有价值的资源。

wav2vec2-base-vi - 基于wav2vec2的越南语自监督学习模型提升语音识别性能

模型Wav2Vec2预训练模型开源项目Huggingface自监督学习语音识别越南语Github

该项目开发了基于wav2vec2架构的越南语自监督学习模型。模型使用13000小时的多样化越南语YouTube音频数据进行预训练,包括清晰音频、噪声音频和对话等。项目提供95M参数的基础版和317M参数的大型版预训练模型。在VLSP 2020 ASR数据集上,大型模型配合5-gram语言模型可将词错率降至5.32%。这些模型为越南语语音识别等下游任务提供了有力支持。

phobert-base - 突破性的越南语预训练语言模型

语言模型模型越南语PhoBERTGithubRoBERTaHuggingface开源项目自然语言处理

PhoBERT作为针对越南语开发的预训练语言模型，提供base和large两个版本。该模型基于RoBERTa框架，优化了BERT的预训练方法。在词性标注、依存句法分析、命名实体识别和自然语言推理等多个越南语NLP任务中，PhoBERT均实现了性能突破，超越了现有的单语言和多语言模型。这一创新为越南语自然语言处理的研究与应用奠定了坚实基础。

wav2vec2-base-vietnamese-250h - wav2vec2提升越南语音识别精度

开源项目模型Github越南语HuggingfaceCTCwav2vec2语音识别自动语音识别

项目应用wav2vec2技术实现越南语的自动语音识别。模型在13000小时的未标注YouTube音频上预训练，并在250小时的VLSP ASR数据集上进行微调，支持16kHz采样音频。结合4-grams语言模型，显著提高了语音识别的准确性，降低了VIVOS数据集的词错误率，从10.77降至6.15。项目使用CC BY-NC 4.0授权，适用于非商业用途。

PhoGPT-4B-Chat - 开放源码的越南语生成模型——PhoGPT-4B-Chat

Github模型开源开源项目对话变体PhoGPT越南语Huggingface生成模型

PhoGPT-4B-Chat是面向越南语的生成模型，通过在70K教学指令和290K对话上进行微调，展现出色表现。其基于3.7B参数的结构，利用102B代币的越南语语料库从头开始进行预训练，使其在开源领域中脱颖而出。

ner-vietnamese-electra-base - ELECTRA基础越南语命名实体识别模型

模型越南语命名实体识别Github深度学习ELECTRAHuggingface开源项目自然语言处理

该越南语命名实体识别模型利用ELECTRA预训练架构，并在VLSP 2018数据集上进行了微调。模型在评估集上展现出优秀性能，F1分数达92.14%。它能够有效识别越南语文本中的位置、组织和人名等实体类型。模型通过Transformers库提供，便于集成到各类越南语自然语言处理应用中。

vietnamese-sbert - 基于SBERT的越南语句子相似度与语义分析模型

语义相似度Githubsentence-transformers向量嵌入开源项目越南语自然语言处理Huggingface模型

基于sentence-transformers框架开发的越南语NLP模型，通过RoBERTa架构将文本映射至768维向量空间。支持句子相似度计算、语义搜索及文本聚类功能，可通过sentence-transformers和HuggingFace进行快速部署。该模型经过专门优化，为越南语自然语言处理任务提供精确的语义表示。

PhoWhisper-large - 越南语自动语音识别模型PhoWhisper

Github机器学习开源项目越南语模型HuggingfaceWhisperPhoWhisper语音识别

PhoWhisper是一个基于多语言Whisper模型开发的越南语语音识别系统，提供五个不同版本。该模型通过844小时的多方言越南语数据集训练，适用于越南语音转文字、字幕生成等应用场景。在越南语ASR基准测试中表现优异，项目论文已被ICLR 2024收录。

phobert-base-vietnamese-sentiment - PhoBERT微调的越南语情感分析模型

phobert文本分类开源项目越南语Huggingface情感分析机器学习Github模型

该项目基于vinai/phobert-base模型微调，专门用于越南语情感分析。模型可将文本分为负面、正面或中性三类情感。使用30K电子商务评论数据集训练，适用于分析越南语句子的情感倾向。项目提供了简单的集成方法，方便在NLP应用中实现越南语情感分析功能。

phobert-base-vi-sentiment-analysis - 越南语情感分析工具，实现文本情绪精确判定

Github情绪分类模型模型训练开源项目越南语HuggingfacePhoBert情感分析

模型专注越南语文本情绪识别，提供准确的情感分类。其开放源码和多元应用场合使研究者和开发者受益。

bert-base-vietnamese-uncased - 增强越南语文本分析的BERT语言模型

Github模型开源项目trituenhantao.io越南语Huggingface筛选分类BERT

该BERT模型专为越南语的新闻和维基百科数据而设计，适用于序列分类任务。用户可以通过Python代码轻松导入和使用，提升文本分析和自然语言处理的效率。由trituenhantao.io团队于2020年发布在GitHub，用户可以轻松访问到详细的文档和支持。此模型为自然语言处理和机器学习研究者及开发者提供了强大可靠的工具。

opus-mt-en-vi - 基于Transformer架构的英越翻译模型实现37.2 BLEU评分

HuggingfaceOPUSTatoeba开源项目模型英语越南语Github机器翻译

基于transformer-align架构开发的英语到越南语机器翻译模型，在Tatoeba测试集上达到37.2 BLEU分和0.542 chrF评分。模型使用SentencePiece技术进行分词预处理，支持英语到越南语（含喃字）的翻译功能。作为OPUS项目的组成部分，该模型于2020年6月发布，并提供完整的模型权重与测试数据集。

halong_embedding - 优化的信息检索与越南文本嵌入模型

越南语余弦相似度信息检索开源项目模型GithubHalong Embedding句子转换器Huggingface

这个模型专注于越南语文本嵌入，利用RAG以提高生产效率，并采用Matryoshka损失来实现嵌入截断，从而加快比较速度。微调于intfloat/multilingual-e5-base模型，该模型适用于语义文本相似性、搜索和文本分类等任务，映射到784维密集向量空间，支持多语种处理。在多个余弦相似度指标中具有卓越表现，如cosine accuracy@10达到0.9687，提供高效的信息检索和分类解决方案。

viXTTS：革新越南语文本转语音技术的开源项目

2024年09月05日

vietTTS:开源越南语文本转语音库

2024年09月05日

PhoBERT: 越南语预训练语言模型的突破性进展

2024年09月05日

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com