bitsandbytes

高效CUDA优化库支持多位量化和矩阵运算

bitsandbytes CUDA 量化优化器硬件后端 Github 开源项目

bitsandbytes是一个轻量级Python库，为CUDA自定义函数提供封装。该库主要提供8位优化器、矩阵乘法(LLM.int8())以及8位和4位量化功能。通过bitsandbytes.nn模块实现多位线性层，bitsandbytes.optim模块提供优化器。目前正在拓展对更多硬件后端的支持，包括Intel CPU+GPU、AMD GPU和Apple Silicon，Windows平台的支持也在开发中。

Github

Huggingface

介绍相关项目

T-MAC - 优化低比特量化LLM推理的CPU加速框架

CPU加速GithubLLM推理T-MAC低比特量化开源项目矩阵乘法

T-MAC是一个创新的内核库，采用查找表技术实现混合精度矩阵乘法，无需反量化即可加速CPU上的低比特LLM推理。该框架支持多种低比特模型，包括GPTQ/gguf的W4A16、BitDistiller/EfficientQAT的W2A16和BitNet的W1(.58)A8。T-MAC在多种设备上展现出显著性能提升，例如在Surface Laptop 7上，单核处理速度可达20 tokens/s，四核可达48 tokens/s，比llama.cpp快4~5倍。

optimum-quanto - PyTorch模型量化框架提升性能和效率

GithubOptimum QuantoPyTorch开源项目机器学习模型优化量化

Optimum Quanto是专为Optimum设计的PyTorch量化框架。它支持eager模式、多设备部署，自动插入量化/反量化存根和操作，实现从浮点到动态/静态量化模型的无缝转换。支持多种精度的权重和激活量化，有效提升模型性能和内存效率。该框架为Hugging Face和原生PyTorch模型提供简便的量化流程。

ppq - 多功能的神经网络量化工具

GithubOnnxPPQTensorRT开源项目神经网络量化量化优化

PPQ 是一个适用于工业应用的神经网络量化工具。通过将浮点运算转换为定点运算，它显著提升系统功耗效率和执行速度。具备高度扩展性，用户可自定义量化过程，并结合多种硬件和推理库使用。版本 0.6.6 更新了图模式匹配、图融合功能，并新增 FP8 量化规范和 PFL 基础类库。支持 TensorRT, Openvino, Onnxruntime 等推理框架，实现高效的神经网络量化部署。

highway - 多架构支持的高性能SIMD向量化库

GithubHighwaySIMD向量化开源项目性能优化跨平台

Highway是一个跨平台C++向量化库,支持x86、ARM等多种CPU架构的SIMD指令。它提供统一API,实现一次编码多平台运行,支持静态编译和运行时动态调度。Highway适用于图像处理、数据压缩、密码学等领域,提供丰富的向量化操作,易用性和性能兼备,是开发高性能软件的理想选择。

keops - 大规模矩阵运算与自动微分的高效GPU加速库

GPU计算GithubKeOps开源项目核方法符号矩阵自动微分

KeOps是一个开源库,专门用于高效计算大型数组的归约运算。它集成了高效C++程序和自动微分引擎,支持Python、Matlab和R等多种编程语言。KeOps尤其适合处理核矩阵向量乘积、K近邻查询和N体问题等计算,即使在核矩阵或距离矩阵超出内存容量的情况下也能高效运行。与PyTorch GPU基准相比,KeOps在多种几何应用中能实现10-100倍的性能提升,广泛应用于核方法和几何深度学习等领域。

Qwen2.5-Math-72B-Instruct-GGUF - Llamacpp在Qwen2.5-Math代码量化中的应用

ARM芯片GithubHugging FaceHuggingfaceQwen2.5-Math-72B-Instruct开源项目性能模型量化

项目应用llama.cpp对Qwen2.5-Math模型进行量化，提供多种量化格式以适应不同硬件配置。更新包括改进的分词器，涵盖高至极低质量的量化文件，适用于不同RAM和VRAM需求，并支持在ARM芯片上运行。使用K-quant和I-quant等量化方法，有助于优化模型性能与速度。下载和安装可通过huggingface-cli实现，灵活快捷。

Behemoth-123B-v1-GGUF - 多种量化策略优化文本生成模型效率

Behemoth-123B-v1GithubHuggingface开源项目性能优化文本生成模型模型下载量化

Behemoth-123B-v1-GGUF 项目运用 Llamacpp imatrix 技术进行模型量化，支持从 Q8_0 到 IQ1_M 的多种格式，适应不同硬件环境。项目涵盖多种文件种类，量化质量和大小各异，从高质到低质，满足多样使用需求。用户可根据 RAM 和 VRAM 选择合适文件，平衡速度与质量的追求。Q8_0 格式在嵌入和输出权重方面的质量表现突出，而适用于 ARM 芯片的 Q4_0_X_X 格式则显著提升运算速度，尤其适合低内存硬件。

tt-metal - Python与C++神经网络运算库

GithubGrayskull模组TT-MetaliumTT-NNWormhole模组开源项目神经网络

TT-NN 提供灵活的神经网络运算功能，支持包括ResNet-50和BERT-Large在内的多种模型，能够实现高效的端到端和设备间的数据吞吐量。其兼容N150和N300卡的Wormhole模型，及适用于TT-QuietBox和TT-LoudBox的高性能模型，能满足不同硬件需求。结合TT-Metalium低级编程模型，提供丰富的开发指导和API参考，有助于在Tenstorrent硬件上高效地进行神经网络训练和推理。

BitMagic - C++位向量压缩库用于高效数据处理和内存优化

BitMagicGithubSIMD优化压缩位向量序列化开源项目数据科学

BitMagic是一个专注于内存优化的C++库，用于信息检索和数据科学。它通过位切片变换、秩选择压缩和逻辑计算实现高效的位向量和容器压缩。该库支持快速序列化和搜索，适用于内存受限场景和大数据处理。BitMagic提供集合运算、区间操作和三值逻辑等功能，并支持WebAssembly和ARM平台，为开发者提供全面的数据处理解决方案。

lightseq - 基于CUDA的高性能训练与推理库

BERT性能GithubLightSeqTransformer模型序列处理开源项目混合精度训练

LightSeq为基于CUDA的高性能训练与推理库，专为序列处理和生成优化，支持BERT、Transformer等主流模型。最新版本新增int8混合精度功能，显著提升训练与推理效率，完美兼容Fairseq、Hugging Face等框架。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号