DeepSeek-MoE

创新MoE架构打造高效大规模语言模型

DeepSeekMoE 大语言模型 MoE架构模型评估开源模型 Github 开源项目

DeepSeek-MoE项目开发了创新的混合专家架构语言模型，采用细粒度专家分割和共享专家隔离策略。该16.4B参数模型仅使用40%计算量就达到DeepSeek 7B和LLaMA2 7B的性能水平。模型可在单个40GB内存GPU上直接部署运行，无需量化，为学术和商业研究提供了高效便捷的工具。

moondream1 - 轻量级视觉语言模型强大性能与高效结构的完美结合

GithubHuggingfacemoondream1人工智能图像识别开源项目模型深度学习视觉问答

moondream1是一个包含1.6B参数的视觉语言模型，基于SigLIP、Phi-1.5和LLaVa训练数据集开发。尽管规模较小，该模型在VQAv2和GQA等基准测试中展现出接近大型模型的性能。moondream1能够解析图像内容，回答相关问题，并生成详细描述。该开源项目仅限于研究用途，不可用于商业应用。研究人员可通过简洁的Python代码实现图像理解和问答功能。

OLMo-7B-0724-hf - OLMo开放式语言模型促进语言处理技术进步

AI2GithubHuggingfaceOLMo变形金刚开源语言模型开源项目模型自然语言处理

OLMo是由AI2开发的开源语言模型系列，旨在推动语言模型科学研究。该模型基于Dolma数据集训练，采用先进的Transformer结构，实现性能提升和多阶段优化。OLMo-7B-0724-hf具备强大的文本生成能力，适用于文本推理和生成任务。支持在HuggingFace平台上进行加载、微调和评估，且提供多种数据检查点，方便研究与开发。该项目得到多家机构支持，并在多个主要AI任务中表现优异。

DARE_TIES_13B - 通过合并多种预训练语言模型提升AI性能

DARE_TIES_13BGithubHuggingface大模型开源项目模型算法合并语言模型配置文件

项目通过DARE TIES方法合并预训练语言模型，使用yunconglong的Truthful DPO TomGrc FusionNet 7Bx2 MoE 13B作为基础，结合了13B DPO及13B MATH DPO模型。通过密度和权重配置，采用bfloat16和int8掩码，在计算效率和文本覆盖上均有显著提升。

deepseek-coder-6.7B-base-AWQ - 大规模训练的代码语言模型，支持项目级代码补全和填充

GithubHuggingfaceIris数据集PyTorch开源项目模型模型训练深度学习神经网络

deepseek-coder-6.7B-base是一个在2万亿token上训练的大规模代码语言模型。采用16K窗口大小和填空任务训练，支持项目级代码补全和填充。在多个编程语言基准测试中表现优异，擅长代码补全、生成和理解。模型由87%的代码和13%的中英文自然语言构成，可支持多语言编程任务。

honeybee - 优化多模态大语言模型性能的局部性增强投影器

GithubHoneybee多模态大语言模型局部性增强投影器开源项目深度学习计算机视觉

Honeybee项目通过局部性增强投影器提升多模态大语言模型性能。该项目在MMB、MME、SEED-I等基准测试中表现优异，提供预训练和微调模型检查点。Honeybee支持多种数据集，包含详细的数据准备、训练和评估指南，为多模态AI研究和开发提供开源工具。

deepseek-coder-1.3b-instruct - DeepSeek Coder 多语言支持的开源代码生成与补全模型

DeepSeek CoderGithubHuggingface代码语言模型商业使用多语言编程开源项目模型项目级代码补全

DeepSeek Coder 1.3B是一款基于2T tokens数据训练的开源代码语言模型，包含87%代码和13%中英文自然语言。该模型支持多种编程语言，提供项目级代码补全和填充功能，并在HumanEval等基准测试中展现出色性能。采用16K窗口大小，模型适用于各类开发场景，并支持商业用途。开发者可通过简单的API快速集成和使用这一强大的代码生成工具。

Defne_llama3_2x8B - 增强型MoE模型，结合llama3的融合创新

Defne_llama3_2x8BGithubHuggingfacetransformers开源项目文本生成模型混合专家模型自然语言处理

Defne_llama3_2x8B是一个支持多语言的混合专家结构(MoE)模型，由两个llama3模型合并而成。通过transformers库实现高效的自然语言生成，支持英语和土耳其语，适合多语言文本生成和自然语言理解。用户可通过Python代码轻松与模型交互，实现数学问题解答及友好的人机对话。该模型在动态计算环境中具备高效的运行能力。

Chinese-Mixtral - 使用Sparse MoE架构的中文Mixtral模型

Chinese-MixtralGithubMixtral大模型量化开源项目指令精调稀疏混合专家模型

模型基于Mistral.ai的Mixtral模型开发，经过中文增量训练与指令精调，具备处理长文本（原生支持32K上下文，实测可达128K）的能力。包括中文Mixtral基础模型与指令模型，显著提升数学推理和代码生成性能。通过llama.cpp进行量化推理，最低仅需16G内存。开源提供代码、训练脚本与详细教程，支持多种推理和部署工具，适合个人电脑本地快速部署量化模型。

Mooncake - 大语言模型服务架构采用KVCache分离设计

GithubKVCacheLLM服务Mooncake分离架构吞吐量开源项目

Mooncake是一种创新的大语言模型服务架构。它采用以KVCache为中心的分离设计，将预填充和解码集群分开，并充分利用GPU集群的闲置资源实现KVCache的分布式缓存。Mooncake的核心调度器在确保延迟服务水平目标的同时，最大化系统的有效吞吐量。通过实施预测性早期拒绝策略，该架构在高负载情况下表现优异，尤其适合长上下文场景。实验结果表明，在特定模拟环境中，Mooncake能够在满足服务水平目标的前提下，将系统吞吐量提升525%。

soft-moe-pytorch - PyTorch 实现的软专家混合模型框架

GithubPytorchSoft MoE专家混合开源项目深度学习神经网络

soft-moe-pytorch 项目实现了基于 PyTorch 的软专家混合 (Soft MoE) 模型。该模型支持非自回归编码器，可用于文本到图像等任务。项目特点包括灵活设置专家数量、动态分配插槽，以及与 Transformer 架构兼容。这一工具为深度学习研究和开发提供了高效、可扩展的 MoE 模型实现，有助于提升模型性能。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com