#GEMM
cutlass - 高性能矩阵乘法与混合精度计算的CUDA C++模板库
CUTLASSGEMMCUDA高性能矩阵运算Tensor CoreGithub开源项目
CUTLASS是一个高性能CUDA C++模板库,旨在高效实现矩阵乘法(GEMM)及其扩展运算。支持各种精度与多个NVIDIA架构,如Volta、Turing、Ampere和Hopper。该库的模块化设计方便用户构建和优化自定义核心和应用程序。3.5.1版本新增特性以提升性能并增加新架构支持。
CUDA-GEMM-Optimization - CUDA实现的GEMM优化与性能分析
CUDAGEMM矩阵乘法GPU优化性能分析Github开源项目
该项目展示了一系列针对通用矩阵乘法(GEMM)的CUDA内核优化实现。内容涵盖从基础到高度优化的多个GEMM内核版本,并提供了详细的性能分析。这些内核适用于任意矩阵大小,并针对NVIDIA GeForce RTX 3090 GPU进行了参数调优。项目包含Docker环境配置说明、编译运行指南,以及FP32和FP16 GEMM的性能对比,直观展示了不同优化技术对性能的影响。
相关文章