#FP8
TransformerEngine - 用于在 NVIDIA GPU 上加速 Transformer 模型的库
Transformer EngineNVIDIA深度学习FP8Hopper GPUGithub开源项目
Transformer Engine是NVIDIA推出的一个库,专门用于在其GPU上加速Transformer模型。该库支持8位浮点(FP8)精度,使训练和推理性能大幅提升的同时,内存使用降低。TE提供了一系列优化的构建模块和混合精度API,适用于各种流行的深度学习框架,保证精度不受影响。通过与主流大型语言模型库的集成,简化了FP8支持的实现,使Transformer模型的训练和推理更加高效和便捷,适用于多种NVIDIA GPU架构。
Meta-Llama-3.1-8B-Instruct-FP8-KV - FP8量化策略提升模型计算效率
QuarkMeta-Llama-3.1-8B-Instruct开源项目FP8GithubHuggingface模型部署量化策略
项目利用Quark工具对模型的线性层进行FP8量化,实现更高效的部署和轻微的推理性能提升。使用Pile数据集进行校准,提高模型性能。支持单GPU和多GPU环境,便于在vLLM兼容后端进行高效部署,Perplexity指标略有提升。
Meta-Llama-3-70B-Instruct-FP8 - FP8量化优化的Meta-Llama-3-70B指令模型实现高效部署
模型量化Llama3开源项目FP8HuggingfaceGithub大语言模型vLLM
Meta-Llama-3-70B-Instruct-FP8是一个经FP8量化优化的大型语言模型。通过AutoFP8技术,该模型将参数位数从16减至8,大幅降低存储和GPU内存需求。在OpenLLM基准测试中,其平均得分为79.16,与原始模型的79.51相近。这个英语助手式聊天模型适用于商业和研究领域,可通过vLLM后端实现高效部署。
DeepSeek-Coder-V2-Lite-Instruct-FP8 - FP8量化模型优化提高大语言模型部署效率
vLLMGithub开源项目文本生成DeepSeek-Coder-V2-Lite-Instruct-FP8量化FP8Huggingface模型
DeepSeek-Coder-V2-Lite-Instruct-FP8是一种经过FP8量化优化的模型,旨在提升商业与研究中英文聊天助手的效率。此优化通过减少参数位数,有效降低内存和存储器需求,达到了79.60的HumanEval+基准测试得分。在vLLM 0.5.2及以上版本中实现高效部署。
Meta-Llama-3.1-70B-Instruct-FP8-KV - Meta-Llama-3.1的FP8量化方法实现高效部署
HuggingfaceFP8量化推理Quark开源项目模型GithubMeta-Llama-3.1-70B-Instruct
项目使用Quark对Meta-Llama-3.1模型进行FP8量化,优化了线性层(不含lm_head)的权重和激活过程。支持用户在单或多GPU平台上部署并在vLLM兼容平台上高效运行。尽管伪量化评估结果可能与实际推理精确度略有不同,但仍提供关键指标,助力模型开发与优化。通过FP8对称模式的应用,模型性能得到提升,并提供了准确性的参考标准,为后续模型开发提供支持。