FBGEMM: Facebook开源的高性能低精度矩阵运算库

FBGEMM 矩阵乘法低精度计算 PyTorch 服务器推理 Github 开源项目

FBGEMM简介

FBGEMM(Facebook GEneral Matrix Multiplication)是Facebook开源的一款低精度、高性能矩阵乘法和卷积库,专门为服务器端推理而设计。作为PyTorch量化操作符在x86机器上的后端实现,FBGEMM为深度学习模型的低精度推理提供了强大的支持。

FBGEMM的主要特点

针对低精度数据进行了专门优化,不同于传统的科学计算线性代数库(通常使用FP32或FP64精度)。
为小批量提供高效的低精度通用矩阵乘法(GEMM)实现。
支持行级量化和异常值感知量化等精度损失最小化技术。
充分利用融合机会,克服了低精度矩阵乘法中带宽受限操作的独特挑战。
作为PyTorch量化操作符在x86机器上的后端实现。

FBGEMM的技术原理

FBGEMM采用了类似于其他针对FP32和FP64数据类型的高性能GEMM实现的方法,但专门针对低精度数据进行了优化。其核心实现基于以下几个关键技术:

1. 矩阵分块和缓存优化

FBGEMM使用多层循环结构,将矩阵分成适合CPU缓存层次结构的小块:

Loop1 for ic = 0 to M-1 in steps of MCB
Loop2   for kc = 0 to K-1 in steps of KCB
          //Pack MCBxKCB block of A
Loop3     for jc = 0 to N-1 in steps of NCB
            //Pack KCBxNCB block of B
//--------------------Macro Kernel------------
Loop4       for ir = 0 to MCB-1 in steps of MR
Loop5         for jr = 0 to NCB-1 in steps of NR
//--------------------Micro Kernel------------
Loop6           for k = 0 to KCB-1 in steps of 1
                  //update MRxNR block of C matrix

这种结构可以充分利用CPU的多级缓存,提高数据访问效率。

2. 矩阵打包

FBGEMM在计算过程中对矩阵块进行重新组织(打包),以实现内部核心的顺序数据访问。这对于现代硬件架构上实现高效带宽至关重要。

3. 计算与打包融合

FBGEMM利用打包操作的带宽受限特性,将一些简单的计算操作与打包过程融合。例如,在打包A矩阵时同时计算行偏移,避免了对A矩阵数据的多次访问。

FBGEMM Packing

4. 动态代码生成

FBGEMM采用"一刀切"的方法不适用于所有情况,因此实现了动态生成矩阵形状特定的向量化代码。这种方法可以为不同大小和形状的矩阵生成高效的内核。

5. INT8量化和INT16累加

FBGEMM支持INT8矩阵乘法并累加到INT16,以获得更好的性能。INT8 FMA与INT16累加通过vpmaddubsw和vpaddsw向量指令的组合实现。

6. 异常值感知量化

为了避免INT16累加时的溢出/饱和问题,FBGEMM采用了异常值感知量化技术。将B矩阵拆分为B = B' + B_sparse,其中B'只包含小幅值,大幅值被分离为B_sparse。

FBGEMM的性能优势

FBGEMM在Intel(R) Xeon(R) CPU E5-2680 v4上进行了性能基准测试,结果显示:

对于计算密集型场景,INT8 GEMM with INT16累加可以达到FP32理论峰值的2倍。
对于带宽受限场景,INT8 GEMM with INT32累加在小批量情况下表现优异,甚至超过了FP32理论屋顶线性能。

FBGEMM Performance

FBGEMM的应用场景

FBGEMM在Facebook的多个AI服务中得到了广泛应用,带来了显著的性能提升:

将英语到西班牙语的翻译速度提高了1.3倍。
将Feed中使用的推荐系统的DRAM带宽使用降低了40%。
在Rosetta(Facebook用于理解图像和视频中文本的机器学习系统)中,将字符检测速度提高了2.4倍。

FBGEMM的未来发展

FBGEMM团队计划在以下几个方向继续改进:

为更多Facebook内部使用的模型实现量化推理。
优化对组卷积(groupwise convolution)的支持。
与PyTorch进行更深入的集成。
进一步提高效率,如合并深度卷积与1x1卷积。
改进性能调试支持。

结论

FBGEMM作为一个开源项目,为服务器端深度学习推理提供了高效的低精度矩阵运算解决方案。它不仅大幅提升了Facebook内部AI服务的性能,也为整个深度学习社区提供了宝贵的工具。随着量化推理技术的不断发展,FBGEMM有望在未来发挥更大的作用,推动AI应用在服务器端的进一步优化和普及。

对于有兴趣深入了解或贡献FBGEMM项目的开发者,可以访问FBGEMM的GitHub仓库获取更多信息。FBGEMM团队也欢迎社区成员通过GitHub Issues、Discussions或PyTorch Slack的#fbgemm频道与他们交流。

相关项目

Project Cover

TorchRec是一个专为大规模推荐系统设计的PyTorch库，提供稀疏性和并行性解决方案。它支持多种嵌入表分片策略，并能自动优化分片计划。通过流水线训练和优化内核，提高模型性能。还支持量化训练和推理，包含多个验证的模型架构和数据集示例，适用于需要高性能和扩展性的推荐系统项目。

Project Cover

FBGEMM是一个专注于服务器端推理的高性能低精度矩阵运算库。它提供小批量的高效低精度矩阵乘法，支持行级量化等技术以最小化精度损失，并通过操作融合解决低精度计算的挑战。作为PyTorch在x86平台上量化算子的后端，FBGEMM为深度学习推理提供了关键支持。

相关文章

Article Cover

TorchRec: 构建大规模推荐系统的PyTorch领域库

最新项目

Project Cover

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

商汤小浣熊

小浣熊家族Raccoon，您的AI智能助手，致力于通过先进的人工智能技术，为用户提供高效、便捷的智能服务。无论是日常咨询还是专业问题解答，小浣熊都能以快速、准确的响应满足您的需求，让您的生活更加智能便捷。

Project Cover

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

Project Cover

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号