IndicBERTv2-MLM-only

支持23种印度语言和英语的大规模多语言预训练模型

模型 Github 多语言模型印度语言开源项目 Huggingface 机器学习 IndicBERT 自然语言处理

IndicBERTv2-MLM-only是一个支持23种印度语言和英语的大规模多语言预训练模型。该模型基于IndicCorp v2数据集训练，包含2.78亿参数，采用掩码语言模型（MLM）目标。在IndicXTREME基准测试中，模型展现出优秀的多语言和零样本迁移能力。作为印度语言自然语言处理的重要资源，IndicBERTv2-MLM-only有望推动相关研究，缩小印度语言在NLP领域的差距。

Github

Huggingface

介绍相关项目

mdeberta-v3-base - DeBERTa V3架构多语言模型助力跨语言NLU任务

DeBERTaGithubHuggingface多语言模型开源项目模型深度学习自然语言处理预训练模型

mdeberta-v3-base是基于DeBERTa V3架构的多语言预训练模型,使用2.5T CC100数据训练。在XNLI跨语言迁移任务中,其平均准确率达79.8%,显著超越XLM-R。模型采用梯度解耦嵌入共享和ELECTRA式预训练,增强下游任务表现。结构包含12层transformer,768维隐藏层,共2.76亿参数。适用于多语言自然语言理解任务,尤其在低资源语言中表现出色。

distilbert-base-multilingual-cased - 提升效率的多语言轻量级BERT模型，支持104种语言

DistilBERTGithubHuggingface多语言模型开源项目模型维基百科自然语言处理迁移学习

distilbert-base-multilingual-cased是BERT基础多语言模型的轻量级版本，支持104种语言。该模型包含6层、768维度和12个头，总参数量为1.34亿。它在多语言维基百科数据上预训练，适用于掩码语言建模和各种下游任务的微调。与原版相比，这个模型在保持性能的同时将运行速度提高了一倍，为多语言自然语言处理任务提供了更高效的解决方案。

chinese-bert-wwm-ext - 全词掩码中文BERT模型加速自然语言处理

BERTGithubHuggingface中文处理全词掩码开源项目模型自然语言处理预训练模型

chinese-bert-wwm-ext是一个开源的全词掩码中文BERT预训练模型，致力于提高中文自然语言处理效率。该模型由哈工大讯飞联合实验室开发，通过全词掩码技术增强了对中文语境的理解。项目开放了预训练模型和相关资源，可应用于文本分类、情感分析、问答系统等多种中文NLP任务。研究人员可基于此模型进行定制化微调，以满足特定领域的应用需求。

deberta-v2-xlarge-mnli - DeBERTa架构的大规模预训练语言模型用于自然语言推理

DeBERTaGithubHuggingface人工智能开源项目微软机器学习模型自然语言处理

deberta-v2-xlarge-mnli是基于DeBERTa V2架构的大型预训练语言模型,经过MNLI任务微调。模型包含24层,1536隐藏单元,共9亿参数。它采用解耦注意力和增强掩码解码器,在GLUE等自然语言理解基准测试中表现优异,为相关研究与应用提供了新的可能。

w2v-bert-2.0 - 大规模多语言语音编码器

GithubHuggingfaceSeamless CommunicationTransformersW2v-BERT 2.0开源项目模型语音编码器预训练模型

W2v-BERT 2.0是一款开源的多语言语音编码器，基于Conformer架构设计。该模型包含6亿参数，在4.5百万小时的无标签音频数据上进行预训练，涵盖143种语言。作为Seamless系列的核心组件，W2v-BERT 2.0可应用于自动语音识别和音频分类等任务。该模型支持通过Hugging Face Transformers和Seamless Communication框架使用，为多语言语音处理研究提供了有力工具。

mDeBERTa-v3-base-mnli-xnli - 支持100种语言的零样本分类和自然语言推理模型

GithubHuggingfaceXNLI数据集mDeBERTa-v3多语言模型开源项目模型自然语言推理零样本分类

mDeBERTa-v3-base-mnli-xnli是一个支持100种语言的自然语言推理模型。它在XNLI和MNLI数据集上进行微调,在15种语言的XNLI测试集上达到80.8%的平均准确率。该模型可用于零样本分类和NLI任务,为多语言NLP应用提供了有效解决方案。模型基于Microsoft的mDeBERTa-v3架构,在CC100多语言数据集上预训练。

bert-base-multilingual-cased - BERT多语言预训练模型覆盖104种语言

BERTGithubHuggingface多语言模型开源项目模型深度学习自然语言处理预训练

bert-base-multilingual-cased是基于104种语言Wikipedia数据预训练的BERT模型。通过掩码语言建模和下一句预测实现自监督学习，可用于微调多种NLP任务。该模型支持多语言处理，适用于序列分类、标记分类和问答等应用，为NLP研究和开发提供了强大的多语言基础。

llm-jp-1.3b-v1.0 - 大规模语言模型支持多语言和多种编程语言

GithubHuggingfaceLLM-jp大型语言模型开源项目模型深度学习自然语言处理训练数据

此大规模语言模型由日本研发，支持多语言（含日语和英语）及多编程语言。采用Transformer架构，经过预训练和指令调优，适用于多种自然语言处理任务。模型在多个硬件和软件环境中优化，包括使用Megatron-DeepSpeed和TRL，可用于生成自然语言文本，应用广泛，性能优异。

bert-base-indonesian-1.5G-sentiment-analysis-smsa - BERT基础印尼语情感分析模型实现高精度文本分类

BERTGithubHuggingfaceindonlu印尼语开源项目情感分析机器学习模型

这是一个基于cahya/bert-base-indonesian-1.5G模型在indonlu数据集上微调的印尼语情感分析模型。在评估集上，该模型实现了93.73%的准确率，为印尼语文本分类任务提供了高效解决方案。模型使用Adam优化器和线性学习率调度器，通过10轮训练达到了稳定的性能表现。

EuroLLM-1.7B-Instruct - 支持35种语言的欧洲开源大语言模型

EuroLLMGithubHuggingface多语言模型开源项目机器翻译模型神经网络自然语言处理

EuroLLM-1.7B-Instruct是一个欧盟支持开发的大语言模型,具备17亿参数规模,可处理包括欧盟在内的35种语言。模型在机器翻译性能方面超越同规模的Gemma-2B模型,接近更大规模的Gemma-7B水平。采用transformer架构和分组查询机制,实现高效推理。这是欧盟首个面向多语言处理的开源语言模型项目。

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号