Project Icon

nccl

优化GPU间通信的高性能库

NCCL是NVIDIA开发的开源GPU通信库,为深度学习和高性能计算优化了全归约、广播等通信模式。它在PCIe、NVLink等平台上实现高带宽,支持单节点和多节点GPU应用。NCCL可用于任意数量的GPU,适配单进程和多进程(如MPI)环境,为AI和科学计算提供高效的通信解决方案。该项目提供简易的构建安装方法和灵活的编译选项,方便开发者根据需求优化性能。

neon - 深度学习框架,兼容多硬件,实现高效模型训练
GithubIntelMKLNervananeon开源项目深度学习框架
neon是Intel推出的深度学习框架,旨在实现最佳性能,兼容多种硬件。提供全面的教程和iPython笔记本,支持卷积层、RNN、LSTM、GRU和BatchNorm等常用层。预训练模型库和示例脚本涵盖VGG、强化学习、深度残差网络等。neon v2.0.0+优化了CPU性能,集成Intel Math Kernel Library,用户可快速安装并部署在CPU、GPU或Nervana硬件上。
oneDNN - 优化深度学习应用的跨平台性能库,支持多种处理器架构
CPU优化GithubUXL Foundationdeep learningoneAPI specificationoneDNN开源项目
oneAPI Deep Neural Network Library (oneDNN) 是一个开源的跨平台性能库,提供深度学习应用的核心模块。oneDNN 专为Intel架构处理器、Intel图形处理器和Arm 64位架构处理器进行优化,并实验性支持NVIDIA、AMD、OpenPOWER、IBMz 和 RISC-V 等架构的 GPU 和 CPU。深度学习应用及框架开发者可以利用oneDNN提升在多种硬件上的性能表现。
distributed-llama - 优化大型语言模型的分布式计算性能
Distributed LlamaGithubLlama 3Python 3TCP socketsTensor parallelism开源项目
通过分布式计算技术,分散大型语言模型(LLMs)的工作负载到多个设备上,即使是性能较弱的设备也能运行强大的LLMs。项目使用TCP sockets同步状态,用户可以使用家庭路由器轻松配置AI集群,实现显著加速效果。Distributed Llama支持多种模型架构,提供简便的设置和操作方法,用户可以在本地运行大规模语言模型。
accel-brain-code - 深度学习和机器学习算法库集合
Github开源项目强化学习机器学习深度学习生成对抗网络自动编码器
accel-brain-code是一个开源项目,集成了多个深度学习和机器学习算法库。它包括自动编码器、生成对抗网络、深度强化学习等模块,旨在通过概念验证和研发创建原型。该项目探索了AI民主化后的机器学习研发可能性,为快速开发复杂AI系统提供了基础。其功能涵盖自动摘要、强化学习、生成对抗网络等多个领域。
cupy - GPU加速的Python科学计算库
CUDACuPyGPU计算GithubNumPy兼容Python开源项目
CuPy是一个开源的GPU加速科学计算库,与NumPy和SciPy兼容。它支持在NVIDIA CUDA和AMD ROCm平台上运行,提供简洁的API接口和复杂数学运算能力。CuPy通过保持与NumPy的API兼容性,使现有代码易于迁移到GPU上,同时显著提升科学计算和机器学习任务的性能。此外,CuPy还提供对底层CUDA功能的访问,允许开发者充分利用GPU的计算能力。它不仅适用于科学计算,还广泛应用于数据分析、深度学习等领域,为研究人员和工程师提供了强大的GPU加速工具。
Deep-learning-in-cloud - 深度学习云计算资源和工具综合指南
GithubMLOps云GPU免费计算资源开源项目模型部署深度学习
这个开源项目汇集了云端深度学习资源和工具信息。内容包括GPU云服务比较、云GPU提供商列表、定价和试用信息、模型部署平台、MLOps工具以及学术优惠。项目旨在帮助开发者和企业选择合适的云计算资源,提高模型训练效率并降低成本。此外还提供了模型部署和MLOps相关指导,为深度学习全生命周期提供参考。无论是个人开发者还是企业,都能在这里找到适合自己需求的云计算资源和工具。
CUDA-GEMM-Optimization - CUDA实现的GEMM优化与性能分析
CUDAGEMMGPU优化Github开源项目性能分析矩阵乘法
该项目展示了一系列针对通用矩阵乘法(GEMM)的CUDA内核优化实现。内容涵盖从基础到高度优化的多个GEMM内核版本,并提供了详细的性能分析。这些内核适用于任意矩阵大小,并针对NVIDIA GeForce RTX 3090 GPU进行了参数调优。项目包含Docker环境配置说明、编译运行指南,以及FP32和FP16 GEMM的性能对比,直观展示了不同优化技术对性能的影响。
keops - 大规模矩阵运算与自动微分的高效GPU加速库
GPU计算GithubKeOps开源项目核方法符号矩阵自动微分
KeOps是一个开源库,专门用于高效计算大型数组的归约运算。它集成了高效C++程序和自动微分引擎,支持Python、Matlab和R等多种编程语言。KeOps尤其适合处理核矩阵向量乘积、K近邻查询和N体问题等计算,即使在核矩阵或距离矩阵超出内存容量的情况下也能高效运行。与PyTorch GPU基准相比,KeOps在多种几何应用中能实现10-100倍的性能提升,广泛应用于核方法和几何深度学习等领域。
calico - 多数据平面支持的高性能容器网络和安全解决方案
CalicoGithubKubernetes容器网络开源项目网络安全
Calico是一个开源的容器网络和安全解决方案,支持eBPF、Linux、Windows和VPP等多种数据平面。它可在多种环境下使用,包括多云、裸机和虚拟机。Calico以高性能和低资源占用著称,提供可扩展架构、精细访问控制和加密功能。作为Kubernetes网络策略的领先实现,Calico目前在全球166个国家的800万多个节点上运行。
Efficient-Computing - 华为诺亚方舟实验室开发的AI模型优化技术集合
GithubHuawei Noah's Ark Lab开源项目模型压缩深度学习神经网络高效计算
Efficient-Computing项目旨在提高AI模型的计算效率和性能。这个由华为诺亚方舟实验室开发的高效计算方法集合包含多个子项目,涵盖了模型压缩、二值神经网络、知识蒸馏、网络剪枝、模型量化、自监督学习、训练加速、目标检测和低层视觉等领域的技术。该项目为AI研究和开发提供了多样化的工具和资源。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号