#低比特量化

量化技术在深度学习中的应用与发展:Awesome-Quantization-Papers项目解析

3 个月前

模型量化深度学习神经网络 Transformer 低比特量化 Github 开源项目

3 个月前

T-MAC: 为边缘设备打造的低比特LLM部署神器

3 个月前

T-MAC 低比特量化 CPU加速 LLM推理矩阵乘法 Github 开源项目

3 个月前

相关项目

T-MAC

T-MAC是一个创新的内核库，采用查找表技术实现混合精度矩阵乘法，无需反量化即可加速CPU上的低比特LLM推理。该框架支持多种低比特模型，包括GPTQ/gguf的W4A16、BitDistiller/EfficientQAT的W2A16和BitNet的W1(.58)A8。T-MAC在多种设备上展现出显著性能提升，例如在Surface Laptop 7上，单核处理速度可达20 tokens/s，四核可达48 tokens/s，比llama.cpp快4~5倍。

Awesome-Quantization-Papers

Awesome-Quantization-Papers是一个全面的深度学习模型量化研究论文列表,涵盖AI会议、期刊和arXiv上的最新成果。项目根据模型结构和应用场景进行分类,重点关注Transformer和CNN在视觉、语言处理等领域的量化方法。通过定期更新,为研究人员提供模型量化领域的最新进展。

TinyLlama-1.1B-Chat-v0.3-AWQ

该项目采用AWQ低位量化方法，提高了多用户服务器场景下的Transformers推理速度和效率。相比GPTQ，AWQ在减少部署成本的同时，能够使用更小的GPU进行推理。TinyLlama模型支持4-bit量化，并兼容vLLM与Huggingface TGI插件，高效应对高并发需求。在Zhang Peiyuan的开发下，该模型适合计算和内存资源有限的开源项目部署。

Llama-2-7B-Chat-AWQ

AWQ是一种高效的4位量化方法，在多用户环境中的并发推理中表现出色。它通过降低模型计算需求，实现小型GPU的部署，从而节省成本。AWQ支持vLLM服务器，尽管总体吞吐量低于未量化模型，但在有限硬件环境中提高了推理效率，例如70B模型可在48GB显存的GPU上运行。AWQ适合如Llama 2 7B Chat的对话优化模型，为AI助手应用提供成本效益高的解决方案。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com