Project Icon

nomic-bert-2048

预训练BERT模型实现2048序列长度的上下文理解

nomic-bert-2048模型通过Wikipedia和BookCorpus数据集训练,采用改进的位置编码技术,支持2048长度的文本序列处理。在GLUE基准评测中展现出与传统BERT相当的性能,同时具备更强的长文本理解能力。该模型兼容标准BERT分词系统,适用于文本补全和分类等自然语言处理任务。

bert-large-NER - BERT大型版命名实体识别模型实现最先进性能
BERTCoNLL-2003GithubHuggingface命名实体识别开源项目机器学习模型自然语言处理
bert-large-NER是一个基于BERT大型模型的命名实体识别(NER)工具。该模型在CoNLL-2003数据集上训练,可准确识别地点、组织、人名和其他杂项四类实体。模型支持通过Transformers pipeline轻松集成,适用于多种NER应用场景。在测试集上,bert-large-NER的F1分数达到91.7%,展现了卓越的实体识别能力。
chinese-bert-wwm - 基于全词掩码技术的中文自然语言处理模型
BERTGithubHuggingface中文自然语言处理全词掩码开源项目机器学习模型预训练模型
chinese-bert-wwm 是一个采用全词掩码技术的中文 BERT 预训练模型。该模型由哈工大讯飞联合实验室(HFL)开发,基于 Google BERT 架构,通过全词掩码方式优化中文语言理解能力。模型支持文本分类、命名实体识别等自然语言处理任务,是 MacBERT、ELECTRA 等中文预训练模型系列的重要组成部分。
bert_uncased_L-4_H-256_A-4 - 精简BERT模型系列适用于计算资源受限场景
BERTGithubHuggingface开源项目模型模型压缩知识蒸馏自然语言处理迁移学习
bert_uncased_L-4_H-256_A-4是BERT模型系列中的一款,专为计算资源受限环境设计。该模型保留了标准BERT架构和训练目标,但规模更小。它可进行常规微调,在知识蒸馏中表现尤佳。此项目旨在支持资源有限的机构开展研究,并鼓励探索创新方向,而非单纯扩大模型规模。
character-bert - 字符级CNN构建的开放词汇表神经网络模型
CharacterBERTGithub开放词表开源项目神经网络自然语言处理词嵌入
CharacterBERT是BERT的一个变体,采用字符级CNN模块动态构建词表示,无需依赖预定义词片词汇表。这种方法可生成任意输入标记的表示,适用于医学等专业领域。与标准BERT相比,CharacterBERT生成词级上下文表示,对拼写错误更为鲁棒,且可轻松适应不同领域而无需重新训练词片词汇表。该模型在多个医学领域任务中表现优于BERT,提供更便捷实用的词级开放词汇表表示。
Yi-34B-200K - 开源双语大模型 提升长文本理解能力
GithubHuggingfaceTransformerYi双语大语言模型开源开源项目模型
Yi-34B-200K是开源的双语大语言模型,专注于提升长文本理解。通过在长时间上下文数据上训练5亿个token,Yi-34B-200K的『寻针与草垛』测试表现从89.3%提高到99.8%。其独特的数据集和高效的训练管道,使Yi系列在语言理解、常识推理和阅读理解方面表现优异,超过其他开源模型。该模型适用于个人、学术和中小企业,性价比较高。
kobigbird-bert-base - 基于稀疏注意力的韩文BigBird预训练模型,优化长序列处理
BERTGithubHuggingfaceKoBigBird开源项目模型稀疏注意力长序列韩语
该项目利用稀疏注意力机制,扩展BERT模型以处理更长的序列。KoBigBird模型通过从韩文BERT检查点暖启动,能够以更低的计算成本处理最长达4096的序列。推荐使用BertTokenizer进行标记化,支持更改注意力模式和参数配置,以优化不同任务的性能。
nomic-embed-text-v1 - 多语言文本嵌入模型 适用于多种NLP任务
GithubHuggingfacesentence-transformers开源项目文本相似度机器学习模型特征提取自然语言处理
nomic-embed-text-v1是一个文本嵌入模型,支持多语言处理和多种NLP任务。该模型在句子相似度、文本分类、聚类等任务中表现良好,可为下游应用提供文本表示。通过深度学习技术,该模型能够捕捉文本语义信息,为自然语言处理任务提供支持。
bert-base-nli-mean-tokens - BERT模型用于句子嵌入和语义分析
BERTGithubHuggingfacesentence-transformers句子嵌入开源项目模型特征提取语义相似度
bert-base-nli-mean-tokens是一个句子嵌入模型,基于BERT架构开发。该模型将文本映射至768维向量空间,主要应用于聚类和语义搜索。通过sentence-transformers库可轻松调用,支持最大128个token输入,采用平均池化策略。虽然已被更新的模型替代,但其实现方法对研究句子嵌入技术仍有参考价值。
w2v-bert-2.0 - 大规模多语言语音编码器
GithubHuggingfaceSeamless CommunicationTransformersW2v-BERT 2.0开源项目模型语音编码器预训练模型
W2v-BERT 2.0是一款开源的多语言语音编码器,基于Conformer架构设计。该模型包含6亿参数,在4.5百万小时的无标签音频数据上进行预训练,涵盖143种语言。作为Seamless系列的核心组件,W2v-BERT 2.0可应用于自动语音识别和音频分类等任务。该模型支持通过Hugging Face Transformers和Seamless Communication框架使用,为多语言语音处理研究提供了有力工具。
mDeBERTa-v3-base-xnli-multilingual-nli-2mil7 - mDeBERTa-v3模型实现多语言自然语言推理和零样本分类
GithubHuggingfacemDeBERTa-v3多语言开源项目机器学习模型自然语言推理零样本分类
mDeBERTa-v3-base-xnli-multilingual-nli-2mil7是一个支持100种语言的自然语言推理和零样本分类模型。它基于mDeBERTa-v3-base架构,通过XNLI和multilingual-NLI-26lang-2mil7数据集微调,包含27种语言的270多万个文本对。该模型在XNLI和英语NLI测试中表现优异,展现出卓越的跨语言迁移能力,为多语言NLP任务提供了强大解决方案。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号