Project Icon

switch-base-128

探索语言模型优化与参数缩放的最新进展

Switch Transformers采用专家混合(MoE)模型架构,针对掩码语言模型(MLM)任务进行训练。该模型使用稀疏多层感知器层取代传统的前馈层,提升了训练效率。在Colossal Clean Crawled Corpus上完成了高达万亿参数的预训练,表现出优于T5的微调效果,并实现了相较于T5-XXL模型的四倍加速,适合需要高效语言模型的应用。

bigbird-roberta-base - 高性能长序列文本处理的稀疏注意力Transformer模型
BigBirdGithubHuggingfacetransformer模型开源项目模型深度学习自然语言处理长序列处理
BigBird-RoBERTa-base是一种基于块稀疏注意力机制的Transformer模型,可处理长达4096个token的序列。该模型在Books、CC-News、Stories和Wikipedia等大规模数据集上预训练,大幅降低了计算成本。在长文档摘要和长上下文问答等任务中,BigBird-RoBERTa-base展现出优秀性能。模型支持灵活配置注意力类型,可在默认的块稀疏模式和全注意力模式间切换,为超长序列文本处理提供了高效方案。
e5-base-unsupervised - E5-base突出文本嵌入的创新性
E5-base-unsupervisedGithubHuggingface句子相似度对比学习开源项目文本嵌入模型自然语言处理
探索无监督文本嵌入的新领域,E5-base-unsupervised模型通过弱监督对比预训练实现文本表示学习。模型由12层组成,嵌入尺寸为768,支持句子相似度评估等多种任务。模型专为高效的查询和段落编码设计,适合开放问答和广告信息检索等场景使用。其使用便捷,支持与Sentence Transformers结合应用,以便在不同任务中灵活调整。同时,该模型仅支持英文文本,最大支持512个令牌。访问相关文档和基准测试可进一步了解性能和训练细节。
mpt-7b - 高性能开源大语言模型
GithubHuggingfaceMPT-7B大语言模型开源开源项目模型深度学习自然语言处理
MPT-7B是一个开源大语言模型,在1万亿英文文本和代码上预训练。其改进的Transformer架构支持高效训练和推理,可处理超长输入。模型采用ALiBi技术处理长序列,无需位置嵌入。MPT-7B支持商业使用,为开发者提供了适用于多种下游任务微调的强大基础模型。
flan-t5-base - 基于T5架构的多语言文本生成模型
FLAN-T5GithubHuggingface多语言开源项目指令微调模型自然语言处理迁移学习
FLAN-T5 base是基于T5架构的多语言文本生成模型,在1000多个任务上进行了指令微调。该模型支持翻译、问答、推理等自然语言处理任务,在零样本和少样本学习方面表现优异。FLAN-T5 base不仅覆盖多种语言,还能在有限参数下实现与更大模型相当的性能,为研究人员提供了探索语言模型能力和局限性的有力工具。
Qwen1.5-32B - 提供稳定多语言支持的Transformer语言模型
GithubHuggingfaceQwen1.5-32BTransformer架构多语言支持开源项目模型模型性能提高语言模型
Qwen1.5是基于Transformer架构的语言模型,支持多语言和多种模型尺寸,适合不同需求。相比前版本,该模型显著提升了聊天性能,并在所有尺寸中稳定支持32K上下文长度,且无需信任远程代码,使用更加便捷。经过大量数据预训练,具备强大文本生成能力,用户可通过后续训练进一步提升性能。详细信息可在Hugging Face和项目博客中查看。
multilingual-e5-small - 多语言句子嵌入模型支持100多种语言
GithubHuggingface分类句子转换器多语言开源项目检索模型聚类
multilingual-e5-small是一个支持100多种语言的句子嵌入模型。该模型在MTEB基准测试的分类、检索、聚类等任务中表现良好,适用于跨语言文本匹配和相似度计算。作为轻量级模型,它可在信息检索、文本分类和机器翻译等领域发挥作用,同时保持较低的计算资源需求。
sentence-transformers-multilingual-e5-large - 多语言句子嵌入模型适用于语义搜索和文本相似度分析
GithubHuggingfacesentence-transformers多语言模型嵌入向量开源项目模型自然语言处理语义相似度
sentence-transformers-multilingual-e5-large是一个多语言句子嵌入模型,将句子和段落映射到1024维向量空间。该模型基于sentence-transformers库构建,适用于聚类、语义搜索等任务。支持多语言处理,可通过Python代码轻松调用。模型在Sentence Embeddings Benchmark上进行了评估,为自然语言处理应用提供了有效的文本表示方法。
SuperNova-Medius-GGUF - 跨架构蒸馏技术打造的14B参数高性能语言模型
GithubHuggingfaceSuperNova-Medius人工智能开源项目模型知识蒸馏自然语言处理语言模型
SuperNova-Medius-GGUF是一款14B参数的语言模型,采用跨架构蒸馏技术融合Qwen2.5-72B-Instruct和Llama-3.1-405B-Instruct的优势。该模型在指令遵循和复杂推理方面表现优异,适用于客户支持、内容创作和技术辅助等场景。经多项基准测试,SuperNova-Medius性能超越同类模型,在保持资源效率的同时提供强大功能,为组织提供高质量生成式AI应用解决方案。
xlm-roberta-xxl - 基于2.5TB数据训练的100语言自然语言处理模型
GithubHuggingfaceXLM-RoBERTa-XL多语言模型开源项目机器学习模型自然语言处理预训练模型
XLM-RoBERTa-XXL是一个基于2.5TB CommonCrawl数据预训练的多语言Transformer模型,支持100种语言的自然语言处理任务。通过掩码语言建模技术实现句子的双向表示学习,适用于序列分类、标记分类、问答等下游任务的微调,可应用于多语言文本分析和跨语言任务场景。
Qwen1.5-72B - 支持多语言与性能提升的单向解码模型
GithubHuggingfaceQwen1.5Transformer架构多语言支持开源项目性能提升模型语言模型
Qwen1.5是一种基于Transformer架构的单向解码语言模型,提供包括0.5B至72B的多种尺寸,以及一个14B的MoE版本。该模型支持多语言和稳定的32K上下文长度,并显著提高聊天模型的性能。其采用SwiGLU激活和改进的分词器,适合多语言应用。建议结合SFT、RLHF等后续训练使用,无需依赖远程代码,是一种实用的文本生成工具。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能,包括文生视频、动态画面和形象生成等,帮助用户快速上手,创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台,用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品,帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型,为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能,满足事务性工作的高频需求,帮助撰稿人节省精力,提高效率,优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号