Project Icon

hidet

用Python编写的开源深度学习编译器,主要优化NVIDIA GPU上的推理任务

Hidet是一个用Python编写的开源深度学习编译器,主要优化NVIDIA GPU上的推理任务。它能将PyTorch和ONNX模型编译成高效的CUDA内核,通过图级和算子级优化提升性能。Hidet易于集成,支持通过torch.compile优化PyTorch模型,为开发者提供了便捷的深度学习性能优化方案。

torch2trt - PyTorch模型转TensorRT加速工具
GPU加速GithubPyTorchTensorRTtorch2trt开源项目模型转换
torch2trt是一款将PyTorch模型转换为TensorRT的开源工具。它基于TensorRT Python API开发,具有简单易用和灵活可扩展的特点。用户通过单个函数调用即可完成模型转换,还支持自定义层转换器。该工具适配多种常用模型,并提供模型保存和加载功能。torch2trt能显著提升NVIDIA设备上的模型推理性能,适用于PyTorch模型推理加速场景。
nnsight - 解释和操作深度学习模型内部的Python包
GithubPyTorchnnsight开源项目模型操作深度学习模型神经网络解释
nnsight是一个专门用于深度学习模型内部解释和操作的Python包。它可以访问模型隐藏状态、进行噪声注入和跨提示干预。该工具支持保存中间值、修改参数和多token生成等功能,方便研究人员和开发者深入分析和调试神经网络模型。
executorch - 移动和边缘设备上高效运行PyTorch模型的解决方案
ExecuTorchGithubPyTorch开源项目推理能力模型部署边缘设备
ExecuTorch 提供端到端解决方案,实现移动和边缘设备上的推理能力,涵盖穿戴设备、嵌入式设备和微控制器。作为 PyTorch Edge 生态系统的一部分,ExecuTorch 通过轻量级运行时,利用硬件能力(如 CPU、NPU 和 DSP),高效地将 PyTorch 模型部署到多种平台。其主要优势包括:广泛的兼容性、开发效率和出色的用户体验。欲了解更多技术细节和教程,请访问文档网站获取最新版本。
chainer - Python深度学习框架,支持动态计算图和CUDA加速
CUDAChainerCuPyGithub开源项目深度学习自动微分
Chainer是一个Python深度学习框架,提供基于define-by-run方法的自动微分API(动态计算图)和面向对象的高级API,用于构建和训练神经网络。通过CuPy支持CUDA/cuDNN,实现高性能训练和推理。尽管Chainer已进入维护阶段,仅进行bug修复和维护,但其文档、教程和社区资源仍然活跃,适合研究和开发深度学习模型的用户。
hqq - 无需校准数据即可快速精确量化大模型的工具
8,4,3,2,1 bitsCUDAGithubHQQtorch.compile开源项目模型量化
HQQ是一种无需校准数据即可快速精确量化大模型的工具,支持从8bit到1bit的多种量化模式。兼容LLMs和视觉模型,并与多种优化的CUDA和Triton内核兼容,同时支持PEFT训练和Pytorch编译,提升推理和训练速度。详细基准测试和使用指南请访问官方博客。
TransformerEngine - 用于在 NVIDIA GPU 上加速 Transformer 模型的库
FP8GithubHopper GPUNVIDIATransformer Engine开源项目深度学习
Transformer Engine是NVIDIA推出的一个库,专门用于在其GPU上加速Transformer模型。该库支持8位浮点(FP8)精度,使训练和推理性能大幅提升的同时,内存使用降低。TE提供了一系列优化的构建模块和混合精度API,适用于各种流行的深度学习框架,保证精度不受影响。通过与主流大型语言模型库的集成,简化了FP8支持的实现,使Transformer模型的训练和推理更加高效和便捷,适用于多种NVIDIA GPU架构。
quickai - 简化复杂机器学习模型的实验过程
GithubPythonQuickAIYOLO卷积神经网络开源项目机器学习
QuickAI 是一个 Python 库,简化了前沿机器学习模型的实验流程。支持 EfficientNet、VGG、ResNet 等图像分类模型和 GPT-NEO、Distill BERT 等自然语言处理模型。只需1-2行代码即可完成模型训练和评估,兼容 TensorFlow 和 PyTorch,并提供 Docker 容器便于环境配置。适用于各水平用户,助力快速推进机器学习项目。
nncase - 神经网络编译器 优化AI加速器性能
AI加速器GithubK230nncase开源项目模型量化神经网络编译器
nncase是专为AI加速器设计的神经网络编译器,支持多输入输出和多分支结构。它采用静态内存分配,提供算子融合优化,支持浮点和uint8量化推理,以及基于校准数据集的后量化。nncase支持零拷贝加载平面模型,适用于K230、K510和K210等芯片。它提供丰富的操作符支持、使用指南和示例,以及完整的生态系统资源,有助于高效部署AI模型。
GPTFast - Hugging Face Transformers模型推理加速工具
GPTFastGithubHugging Face开源项目推理加速量化静态键值缓存
GPTFast是一个为Hugging Face Transformers模型优化推理速度的开源Python库。它集成了多种加速技术,如静态键值缓存、int4量化和推测解码,可将模型推理速度提升7.6-9倍。GPTFast支持torch.compile、int8量化、GPTQ int4量化等优化方法,通过简单的API调用即可应用于各类Hugging Face模型。该项目持续更新,未来计划引入更多先进的加速技术。
ctransformers - Python接口的高效C/C++ Transformer模型
CTransformersGGMLGithubLangChainPythonTransformer模型开源项目
CTransformers提供Python接口,通过GGML库高效加载和运行C/C++实现的Transformer模型。支持多种模型类型,如GPT-2、GPT-J、LLaMA等,并可与Hugging Face和LangChain集成。提供CUDA、ROCm和Metal兼容的GPU加速选项,适合高性能自然语言处理任务。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号