#越南语
symato - 处理越南语的开源语言模型,适用于低资源环境
Github开源项目语音模型RWKV大规模语言模型Symato越南语
该项目使用独特的音节、标记和声调分割方法,开发了高效的越南语语言模型。通过创新的token化技术和RWKV架构,解决了传统Transformer模型在处理越南语多字节编码时的性能瓶颈。项目包括小数据集实验、大规模数据处理及大型模型训练,展示了在有限计算资源下应用规模规律的潜力。模型具有广泛适应性,既节省计算资源,又保持高效的文本生成和语言理解能力。
vixtts-demo - 专注越南语的开源文本转语音工具
Github开源项目语音克隆Hugging Face文字转语音越南语viXTTS
viXTTS是一个开源的文本转语音工具,基于XTTS-v2.0.3模型,主要针对越南语进行优化。该工具使用viVoice数据集微调,支持高质量声音克隆。用户可通过Hugging Face在线体验或在本地Ubuntu/WSL2系统运行。虽然重点优化越南语,但也支持其他语言尝试。项目提供详细的安装和使用说明,便于研究者和开发者使用。
vietTTS - 开源越南语文本转语音系统
Github开源项目预训练模型语音合成TTS越南语HiFiGAN
vietTTS是一个开源的越南语文本转语音系统,集成了持续时间模型、声学模型和HiFiGAN声码器。项目提供预训练模型、数据处理工具、训练脚本和合成接口,便于研究和开发。包含详细文档,涵盖安装、数据准备和模型训练,对越南语语音合成技术发展具有参考价值。项目提供在线演示和音频样例,直观展示效果。目前项目已停止更新,新版本已迁移至LightSpeed项目,其中包含新的男声模型。
PhoBERT - 为越南语自然语言处理带来革新
Github开源项目自然语言处理transformers预训练语言模型越南语PhoBERT
PhoBERT是首个针对越南语的大规模预训练语言模型,基于RoBERTa架构开发。该模型在多项越南自然语言处理任务中展现出卓越性能,包括词性标注、依存句法分析、命名实体识别和自然语言推理。PhoBERT提供base和large两种版本,可通过transformers和fairseq库轻松集成使用,为越南语自然语言处理研究和应用开辟了新的可能。
vinai-translate-vi2en-v2 - 精确的越南语与英语神经翻译模型
Github开源项目模型Huggingface语言翻译越南语英语VinAI Translate神经机器翻译
VinAI Translate是一个实现越南语和英语互译的神经机器翻译系统,以其创新架构和优异的实验结果,受到业界关注。研究人员可通过项目主页获取更多信息,并在使用时引用相关论文。
wav2vec2-base-vietnamese-250h - wav2vec2提升越南语音识别精度
Github开源项目语音识别模型Huggingface自动语音识别越南语CTCwav2vec2
项目应用wav2vec2技术实现越南语的自动语音识别。模型在13000小时的未标注YouTube音频上预训练,并在250小时的VLSP ASR数据集上进行微调,支持16kHz采样音频。结合4-grams语言模型,显著提高了语音识别的准确性,降低了VIVOS数据集的词错误率,从10.77降至6.15。项目使用CC BY-NC 4.0授权,适用于非商业用途。
PhoGPT-4B-Chat - 开放源码的越南语生成模型——PhoGPT-4B-Chat
Github开源项目开源模型生成模型HuggingfacePhoGPT越南语对话变体
PhoGPT-4B-Chat是面向越南语的生成模型,通过在70K教学指令和290K对话上进行微调,展现出色表现。其基于3.7B参数的结构,利用102B代币的越南语语料库从头开始进行预训练,使其在开源领域中脱颖而出。
ner-vietnamese-electra-base - ELECTRA基础越南语命名实体识别模型
Github开源项目深度学习自然语言处理模型命名实体识别Huggingface越南语ELECTRA
该越南语命名实体识别模型利用ELECTRA预训练架构,并在VLSP 2018数据集上进行了微调。模型在评估集上展现出优秀性能,F1分数达92.14%。它能够有效识别越南语文本中的位置、组织和人名等实体类型。模型通过Transformers库提供,便于集成到各类越南语自然语言处理应用中。
vietnamese-sbert - 基于SBERT的越南语句子相似度与语义分析模型
Github开源项目自然语言处理模型Huggingface向量嵌入越南语sentence-transformers语义相似度
基于sentence-transformers框架开发的越南语NLP模型,通过RoBERTa架构将文本映射至768维向量空间。支持句子相似度计算、语义搜索及文本聚类功能,可通过sentence-transformers和HuggingFace进行快速部署。该模型经过专门优化,为越南语自然语言处理任务提供精确的语义表示。
PhoWhisper-large - 越南语自动语音识别模型PhoWhisper
Github开源项目Whisper语音识别机器学习模型Huggingface越南语PhoWhisper
PhoWhisper是一个基于多语言Whisper模型开发的越南语语音识别系统,提供五个不同版本。该模型通过844小时的多方言越南语数据集训练,适用于越南语音转文字、字幕生成等应用场景。在越南语ASR基准测试中表现优异,项目论文已被ICLR 2024收录。
phobert-base-vietnamese-sentiment - PhoBERT微调的越南语情感分析模型
Github开源项目机器学习模型情感分析Huggingface文本分类越南语phobert
该项目基于vinai/phobert-base模型微调,专门用于越南语情感分析。模型可将文本分为负面、正面或中性三类情感。使用30K电子商务评论数据集训练,适用于分析越南语句子的情感倾向。项目提供了简单的集成方法,方便在NLP应用中实现越南语情感分析功能。
phobert-base-vi-sentiment-analysis - 越南语情感分析工具,实现文本情绪精确判定
Github开源项目模型训练模型情感分析Huggingface越南语情绪分类PhoBert
模型专注越南语文本情绪识别,提供准确的情感分类。其开放源码和多元应用场合使研究者和开发者受益。
bert-base-vietnamese-uncased - 增强越南语文本分析的BERT语言模型
Github开源项目BERT模型Huggingface越南语trituenhantao.io筛选分类
该BERT模型专为越南语的新闻和维基百科数据而设计,适用于序列分类任务。用户可以通过Python代码轻松导入和使用,提升文本分析和自然语言处理的效率。由trituenhantao.io团队于2020年发布在GitHub,用户可以轻松访问到详细的文档和支持。此模型为自然语言处理和机器学习研究者及开发者提供了强大可靠的工具。
opus-mt-en-vi - 基于Transformer架构的英越翻译模型 实现37.2 BLEU评分
Github开源项目模型Huggingface机器翻译越南语英语TatoebaOPUS
基于transformer-align架构开发的英语到越南语机器翻译模型,在Tatoeba测试集上达到37.2 BLEU分和0.542 chrF评分。模型使用SentencePiece技术进行分词预处理,支持英语到越南语(含喃字)的翻译功能。作为OPUS项目的组成部分,该模型于2020年6月发布,并提供完整的模型权重与测试数据集。
halong_embedding - 优化的信息检索与越南文本嵌入模型
Github开源项目模型Huggingface信息检索越南语余弦相似度句子转换器Halong Embedding
这个模型专注于越南语文本嵌入,利用RAG以提高生产效率,并采用Matryoshka损失来实现嵌入截断,从而加快比较速度。微调于intfloat/multilingual-e5-base模型,该模型适用于语义文本相似性、搜索和文本分类等任务,映射到784维密集向量空间,支持多语种处理。在多个余弦相似度指标中具有卓越表现,如cosine accuracy@10达到0.9687,提供高效的信息检索和分类解决方案。