compute-engine

优化极度量化神经网络推理的高性能引擎

Larq Compute Engine 神经网络 TensorFlow Lite 移动平台二值化神经网络 Github 开源项目

Larq Compute Engine是专为极度量化神经网络设计的推理引擎。它支持多种移动平台，提供优化的TensorFlow Lite自定义运算符。通过平铺、矢量化和多线程并行化技术，该引擎提高了缓存命中率、计算吞吐量和多核CPU性能。它与Larq和TensorFlow集成，实现从训练到部署的流畅过程，并兼容Larq Zoo的预训练BNN模型。

访问官网

Github

介绍相关项目

inferflow - 为大语言模型提供高效灵活的推理解决方案

GithubInferflow大语言模型开源项目推理引擎模型服务量化

Inferflow是一款功能强大的大语言模型推理引擎，支持多种文件格式和网络结构。它采用3.5位量化和混合并行推理等创新技术，提高了推理效率。用户通过修改配置文件即可部署新模型，无需编写代码。Inferflow支持GPU/CPU混合推理，为模型部署提供灵活选择。该项目为研究人员和开发者提供了高效易用的LLM推理工具。

MNN - 高效轻量的深度学习框架，支持多设备推理和训练

GithubMNN开源项目推理引擎深度学习框架轻量级高性能

MNN是一个高效轻量的深度学习框架，支持设备上的推理和训练。已被阿里巴巴30多个应用集成，覆盖直播、短视频、搜索推荐等70多种场景。MNN适用于嵌入式设备，支持TensorFlow、Caffe、ONNX等多种模型格式，并优化了ARM和x64 CPU及多种GPU的计算性能。通过MNN Workbench，用户可以下载预训练模型、进行可视化训练并一键部署到设备上。

TNN - 轻量级、高效能、多平台支持的开源深度学习框架

GithubTNN人工智能开源项目性能优化模型转换跨平台

TNN，腾讯优图实验室开源的神经网络推理框架，提供针对移动设备和X86/NV GPUs的高效性能优化。该框架已被QQ、微视等多款应用使用，并支持各大平台包括TensorFlow、Pytorch、MxNet。

qwen2.5-7b-ins-v3-GGUF - 量化优化AI模型的多样化选择指南

GithubHuggingfaceQwen2.5-7b-ins-v3quantization参数嵌入权重开源项目模型

该项目利用llama.cpp的b3901版本和imatrix选项对AI模型进行量化优化，支持各种硬件的量化格式下载。在LM Studio中运行这些模型，可通过缩小文件大小实现更高效的部署。K-quant格式在低资源环境中表现突出，而I-quants则在某些情况下显示出其新方法的优越性能，尤其建议ARM芯片用户选择Q4_0_X_X以获取更快速的响应。

vllm - 高性能与易用性的LLM推理与服务平台

GithubLLM服务PagedAttentionvLLM开源项目量化高吞吐量

vLLM是一个高性能且易用的LLM推理与服务平台，具备PagedAttention内存管理、CUDA/HIP图形加速、量化支持、并行解码算法及流式输出等技术优势。vLLM无缝集成Hugging Face模型，兼容多种硬件设备，支持分布式推理和OpenAI API。最新版本支持Llama 3.1和FP8量化。用户可通过pip安装并参考详细文档快速入门。

llama.cpp - C/C++ 实现的 LLaMA 模型推理，支持多种硬件和系统

C/C++Githubllama.cpp多模态模型开源项目模型推理热门量化优化

llama.cpp 提供了基于 C/C++ 的纯粹实现，支持包括 LLaMA 在内的多个模型的推理。专为多种硬件和操作系统优化，包括使用 ARM NEON、AVX 指令集和 Metal 框架的设备。此外，项目支持使用 NVIDIA GPU 的自定义 CUDA 核心，以及通过 HIP 支持 AMD GPU，为开发者在本地或云环境中实现高效、低延迟的大规模语言模型推理提供了强大的灵活性和可扩展性。

AutoGPTQ - 基于GPTQ算法的LLM量化与推理优化工具包

AutoGPTQGPTQ算法Github安装指南开源项目推理速度量化模型

AutoGPTQ是基于GPTQ算法的LLM量化工具包，支持多种模型类型和硬件平台的推理优化，整合Marlin与Exllama内核，提升推理速度与性能，适合在资源受限环境中部署高效的语言模型。

PowerInfer - 消费级GPU上大型语言模型高效推理引擎

GPU加速GithubPowerInfer大语言模型局部性设计开源项目混合CPU/GPU使用

PowerInfer是一款在个人电脑上针对消费级GPU设计的高效大型语言模型(LLM)推理引擎。它结合激活局部性原理和CPU/GPU混合技术，通过优化热/冷激活神经元的处理方式，显著提高推理速度并降低资源消耗。软件还融入了适应性预测器和神经元感知技术，优化了推理效率和精度，支持快速、低延迟的本地模型部署。

lancedb - 高效管理与检索嵌入的开源多模态向量数据库

GPU支持GithubLanceDB多模态数据嵌入管理开源项目矢量搜索

LanceDB 是一款开源的多模态向量数据库，具备持久存储功能，能够简化嵌入的管理与检索。它支持生产级别的向量搜索，无需管理服务器，可存储、查询和过滤向量、元数据以及多模态数据（包括文本、图片、视频、点云等）。它还支持向量相似性搜索、全文搜索和SQL查询，并提供原生的Python和JavaScript/TypeScript支持，同时实现零拷贝和自动版本管理。LanceDB 与 LangChain、LlamaIndex、Apache-Arrow、Pandas、Polars、DuckDB 等多个生态系统集成。其核心由Rust编写，基于Lance构建，专为高性能机器学习工作负载而设计。

lightseq - 基于CUDA的高性能训练与推理库

BERT性能GithubLightSeqTransformer模型序列处理开源项目混合精度训练

LightSeq为基于CUDA的高性能训练与推理库，专为序列处理和生成优化，支持BERT、Transformer等主流模型。最新版本新增int8混合精度功能，显著提升训练与推理效率，完美兼容Fairseq、Hugging Face等框架。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号