DeepSpeed-MII

开源低延迟模型推理库

DeepSpeed-MII 高吞吐量低延迟模型支持优化技术 Github 开源项目

DeepSpeed-MII是一款开源Python库，专注于高吞吐量、低延迟和成本效益的模型推理。支持的技术包括块状KV缓存、连续批处理、高性能CUDA内核等，适用于37000多个模型，如Llama-2、Mixtral和Phi-2。v0.2版本提升了性能和功能，吞吐量提高至2.5倍。适用于语言模型及图像生成任务。

访问官网

Github

Huggingface

介绍相关项目

DeepSpeed-MII 项目介绍

简介

DeepSpeed-MII 是一个开源的 Python 库，由 DeepSpeed 开发设计，旨在普及高效的模型推理。它专注于高通量、低延迟和经济实惠。MII 提供了多项功能和技术，如阻塞的 KV 缓存、连续批处理、动态拆分融合、张量并行以及高性能的 CUDA 内核，支持如 Llama-2-70B、Mixtral（MoE）8x7B 和 Phi-2 等大型语言模型（LLM）的快速推理。

核心技术

用于高通量文本生成的 MII

MII 通过下列关键技术实现加速文本生成推理：

阻塞的 KV 缓存：优化模型推理速度。
连续批处理：提高处理效率。
动态拆分融合：减少处理时间。
高性能 CUDA 内核：提高硬件利用率。

MII 传统技术

在过去，MII 在低延迟服务场景中引入了多项关键性能优化，包括：

Transformer 的深度融合。
多 GPU 推理和张量切片。
面向资源受限系统的 ZeRO 推理。
编译器优化。

MII 的工作原理

MII 利用 DeepSpeed-Inference 技术，根据模型架构、模型大小、批处理大小和可用硬件资源，自动应用适当的系统优化，从而减少延迟并最大化吞吐量。

支持的模型

MII 目前支持超过 37,000 种模型，涵盖八种流行的模型架构：

Falcon: 7B - 180B
Llama: 7B - 65B
Llama-2: 7B - 70B
Llama-3: 8B - 405B
Mistral: 7B
Mixtral (MoE): 8x7B
OPT: 0.1B - 66B
Phi-2: 2.7B
Qwen and Qwen2: 7B - 72B

快速入门

DeepSpeed-MII 允许用户通过简单的代码部署支持的模型：

安装

用户可以通过 PyPI 安装 DeepSpeed-MII：

pip install deepspeed-mii

非持久化管道

这种方式适合快速体验 DeepSpeed-MII，仅需几行代码：

import mii
pipe = mii.pipeline("mistralai/Mistral-7B-v0.1")
response = pipe(["DeepSpeed is", "Seattle is"], max_new_tokens=128)
print(response)
pipe.destroy()

持久化部署

适用于长期运行和生产环境：

import mii
client = mii.serve("mistralai/Mistral-7B-v0.1")
response = client.generate(["Deepspeed is", "Seattle is"], max_new_tokens=128)
print(response)
client.terminate_server()

贡献与商标

DeepSpeed-MII 欢迎社区贡献，并遵循 Microsoft 的开源行为准则。项目中可能包含商标或标识，使用时须遵循相关品牌使用指南。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号