H2O

提升大型语言模型推理效率的关键token识别技术

H2O 大语言模型 KV缓存推理效率注意力机制 Github 开源项目

H2O项目提出了一种创新的KV缓存实现方法，通过识别对注意力分数贡献最大的少数token，显著减少了大型语言模型推理的内存占用。该项目引入了Heavy Hitter Oracle (H2O)作为KV缓存淘汰策略，在多个任务中验证了其准确性。在OPT-6.7B和OPT-30B模型上，H2O显著提高了推理吞吐量并减少了延迟，为大型语言模型的高效推理提供了新的解决方案。

Github

介绍相关项目

huozi - 支持32K上下文的双语稀疏混合专家模型

GithubHIT-SCIR中文MT-Bench开源项目活字3.0活字通用大模型自然语言处理

活字3.0是一个支持32K上下文的稀疏混合专家模型，具备中英文知识、数学推理和代码生成能力，并在指令遵循和安全性上有所提升。项目开源了中文MT-Bench数据集，支持多种推理框架如Transformers、vLLM和llama.cpp，为自然语言处理研究和应用提供更多选择。

KIVI - 高效2比特KV缓存量化算法提升大型语言模型性能

GithubKIVIKV缓存量化LLM内存优化开源项目推理加速

KIVI是一种创新的2比特KV缓存量化算法，无需模型微调即可优化大型语言模型的内存使用。该算法对键缓存按通道、值缓存按令牌进行量化，适用于Llama-2、Falcon和Mistral等模型。KIVI在保持模型质量的同时，将峰值内存使用降低2.6倍，批处理大小提升4倍，推理吞吐量增加2.35至3.47倍。其硬件友好设计有效缓解了大型语言模型推理中的速度和内存瓶颈问题。

ov-gpt2-fp32-no-cache - 改进GPT-2文本生成性能的开源项目，结合Optimum-Intel

GPT2GithubHuggingfaceOpenvinoOptimum-Intel开源项目文本生成模型

此项目结合Optimum-Intel而优化GPT-2的文本生成，继承于HF模型库的GPT-2，并采用OMZ的Openvino IR，实现了无缓存的高效预测。该模型允许在Optimum-Intel环境中使用OVModelForCausalLM进行文本生成，具有长文本输出和多序列结果的功能，帮助提升生成效率。

MInference - 动态稀疏注意力加速长上下文语言模型

GithubMInference动态稀疏注意力大语言模型开源项目性能优化长文本处理

MInference是一项新技术，通过利用长上下文语言模型注意力机制的动态稀疏性来加速预填充过程。该技术离线确定注意力头的稀疏模式，在线近似稀疏索引，并使用优化内核动态计算注意力。在A100 GPU上，MInference实现了预填充速度提升10倍，同时保持模型准确性。它支持LLaMA-3、GLM-4等多种长上下文模型，有效处理百万级别token的上下文。

opt-2.7b - Meta AI开发的开放预训练Transformer语言模型

GithubHuggingfaceOPT人工智能开源项目文本生成模型自然语言处理预训练语言模型

OPT是Meta AI开发的开放预训练Transformer语言模型系列,参数规模125M至175B。采用先进数据收集和训练方法,性能与GPT-3相当。旨在促进大规模语言模型的可重复研究,扩大研究群体。主要基于英语语料预训练,使用因果语言建模,适用于文本生成和下游任务微调。OPT开放了完整模型访问权限,有助于研究大语言模型的工作原理、影响及相关挑战。

Mooncake - 大语言模型服务架构采用KVCache分离设计

GithubKVCacheLLM服务Mooncake分离架构吞吐量开源项目

Mooncake是一种创新的大语言模型服务架构。它采用以KVCache为中心的分离设计，将预填充和解码集群分开，并充分利用GPU集群的闲置资源实现KVCache的分布式缓存。Mooncake的核心调度器在确保延迟服务水平目标的同时，最大化系统的有效吞吐量。通过实施预测性早期拒绝策略，该架构在高负载情况下表现优异，尤其适合长上下文场景。实验结果表明，在特定模拟环境中，Mooncake能够在满足服务水平目标的前提下，将系统吞吐量提升525%。

h2o-llmstudio - 轻松微调大型语言模型的无代码图形界面

GithubH2O LLM StudioLLM微调Nvidia GPU图形用户界面开源项目无代码界面

H2O LLM Studio 提供无代码图形界面，轻松微调大型语言模型。支持多种超参数调整，包括LoRA和8位模型训练技术，甚至还可使用强化学习。用户可以可视化跟踪模型性能，并与模型互动获取即时反馈。支持将模型导出至 Hugging Face Hub，方便与社区分享。

Quest - 长文本LLM推理的查询感知稀疏化框架

GithubKV缓存Quest开源项目注意力机制稀疏性长上下文LLM推理

Quest是一个创新的长文本LLM推理框架，通过在KV缓存中应用查询感知稀疏化技术，显著减少了注意力计算中的内存移动。该框架跟踪缓存页面的Key值范围，并利用Query向量评估页面重要性，仅加载最关键的KV缓存页面。实验表明，Quest可将自注意力计算速度提升至7.03倍，推理延迟降低2.23倍，同时在长依赖任务中保持高精度。

OLMo-7B-0724-hf - OLMo开放式语言模型促进语言处理技术进步

AI2GithubHuggingfaceOLMo变形金刚开源语言模型开源项目模型自然语言处理

OLMo是由AI2开发的开源语言模型系列，旨在推动语言模型科学研究。该模型基于Dolma数据集训练，采用先进的Transformer结构，实现性能提升和多阶段优化。OLMo-7B-0724-hf具备强大的文本生成能力，适用于文本推理和生成任务。支持在HuggingFace平台上进行加载、微调和评估，且提供多种数据检查点，方便研究与开发。该项目得到多家机构支持，并在多个主要AI任务中表现优异。

LongMem - 为语言模型赋予长期记忆能力

GithubLongMem开源项目评估语言模型长期记忆预训练

LongMem项目通过创新的长期记忆机制提升了语言模型的性能。该项目实现了记忆库、检索机制和联合注意力等核心技术，使模型在内容学习任务中表现优异。项目开源了完整代码，包括环境配置、模型结构和评估方法，为研究者提供了便利的复现和探索工具。LongMem为自然语言处理领域开辟了新的研究方向。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号