Project Icon

InternVL2-2B-AWQ

跨多语言多图像任务的高效视觉语言模型

InternVL2-2B-AWQ以AWQ算法实现4bit权重量化,模型推理速度较FP16提升至2.4倍。lmdeploy兼容众多NVIDIA GPU进行W4A16推理,提升离线批量推理效率。同时,该项目提供RESTful API服务并兼容OpenAI接口,快速部署和应用于视觉-语言任务。此多语言兼容的模型不仅提高推理效率,还具备灵活的服务特性。

llm-awq - 激活感知权重量化技术实现大语言模型高效压缩与加速
AWQGithubLLM开源项目模型量化视觉语言模型边缘设备
AWQ是一种高效的大语言模型低比特权重量化技术,支持INT3/4量化,适用于指令微调和多模态模型。它提供预计算模型库、内存高效的4位线性层和快速推理CUDA内核。AWQ使TinyChat可在边缘设备上实现大模型高效本地推理。该技术已被Google、Amazon等采用,并获MLSys 2024最佳论文奖。
Llama-2-70B-Chat-AWQ - 基于AWQ的4位量化法优化多用户环境推理效率
AI助手GithubHuggingfaceLlama 2Meta开源项目性能优化模型量化
AWQ是一种高效的四位量化方法,能够提升Transformer的推理速度。结合vLLM,该方案在多用户服务器中实现高吞吐量的并发推理。AWQ的优势包括支持使用较小的GPU进行运行,简化部署要求并降低整体成本。例如,一个70B模型可在一台48GB的GPU上运行,而无需使用两台80GB设备。尽管目前整体吞吐量仍低于未量化模型,AWQ提供了更灵活的硬件选择。
AutoAWQ - 面向大型语言模型的高效4位量化框架
AutoAWQGPU加速Github大语言模型开源项目推理量化
AutoAWQ是一个专门针对大型语言模型的4位量化框架,通过实现激活感知权重量化算法,可将模型速度提升3倍,同时减少3倍内存需求。该框架支持Mistral、LLaVa、Mixtral等多种模型,具备多GPU支持、CUDA和ROCm兼容性以及PEFT兼容训练等特性。AutoAWQ为提升大型语言模型的推理效率提供了有力工具。
Llama-2-7B-Chat-AWQ - 高效4位量化提升AI对话性能
GithubHuggingfaceLlama 2Meta低比特量化对话生成开源项目文本生成模型
AWQ是一种高效的4位量化方法,在多用户环境中的并发推理中表现出色。它通过降低模型计算需求,实现小型GPU的部署,从而节省成本。AWQ支持vLLM服务器,尽管总体吞吐量低于未量化模型,但在有限硬件环境中提高了推理效率,例如70B模型可在48GB显存的GPU上运行。AWQ适合如Llama 2 7B Chat的对话优化模型,为AI助手应用提供成本效益高的解决方案。
Mythalion-13B-AWQ - 利用高效的低比特量化提升Transformer推理速度
GithubHuggingfaceMythalion 13B伪人AI开源项目文本生成模型模型整合量化
该项目提供高效的AWQ模型文件,支持4比特量化在多用户环境中实现快速Transformer推理。虽然未量化模型的整体吞吐量更高,但通过使用更小的GPU,AWQ模型显著降低了部署成本,例如仅需1台48GB GPU即可运行70B模型。该模型适合需要高吞吐量并行推理的场景,用户可借助vLLM或AutoAWQ轻松调用以降低成本并简化部署。
Llama-2-13B-chat-AWQ - 增强Transformer模型推理效率的AWQ量化技术
GithubHuggingfaceLlama 2Meta对话优化开源项目文本生成模型模型量化
Llama-2-13B-chat-AWQ项目利用AWQ低比特量化提高Transformer模型推理效率,支持4比特量化技术,相较于传统GPTQ方法,能更快速地实现多用户并发推理,降低硬件要求和部署成本。AWQ现已兼容vLLM平台进行高吞吐量推理,尽管总体吞吐量较未量化模型略有不如,但可通过较小的GPU实现高效部署,比如70B模型仅需一台48GB GPU即可运行。
Qwen2.5-32B-Instruct-AWQ - 支持128K长文本的多语言量化大模型
GithubHuggingfaceQwen2.5人工智能多语言处理大语言模型开源项目模型量化模型
Qwen2.5-32B指令微调模型经AWQ量化后参数量达32.5B,显著增强了编程和数学计算能力。模型支持29种语言交互,可处理128K tokens长文本,具备结构化数据理解和JSON生成等核心功能。基于transformers架构开发,通过量化技术实现高效部署,适用于大规模AI应用场景。
InternVL2-1B - 多模态大语言模型实现多图像和视频智能理解
GithubHuggingfaceInternVL2人工智能多模态大语言模型开源项目模型自然语言处理计算机视觉
InternVL2-1B是一款新型多模态大语言模型,结合了InternViT-300M-448px视觉模型和Qwen2-0.5B-Instruct语言模型。该模型在文档理解、图表分析和场景文字识别等任务中表现优异,能有效处理长文本、多图像和视频输入。InternVL2-1B在开源多模态模型中表现突出,部分能力可与商业模型比肩。通过采用8k上下文窗口训练,该模型大幅提升了处理长输入序列的能力。
Qwen2-VL-2B-Instruct-AWQ - 支持多分辨率的多语言多模态视觉模型
GithubHuggingfaceQwen2-VL多语言支持开源项目性能评估模型模型架构视觉理解
Qwen2-VL是一款先进的多模态模型,具备卓越的图像和视频理解能力,并能够处理多语言文本。其支持动态分辨率处理,适用于移动设备和机器人自动化操作。模型特色包括旋转位置嵌入和高效量化模型,提高推理速度和内存利用率,适合多种视觉任务如图像描述和视频分析。
OpenHermes-2.5-Mistral-7B-AWQ - 使用AWQ方法提升Transformer推理速度的低位量化技术
AI模型GithubHuggingfaceOpenHermes-2.5-Mistral-7B人机对话合成数据开源项目模型量化
AWQ通过4-bit量化提供高效、快速的Transformer推理体验,与GPTQ相比具有更优性能。它在Text Generation Webui、vLLM、Hugging Face的Text Generation Inference和AutoAWQ等多个平台上支持,为AI应用带来了显著的性能提升,适用于多用户推理服务器的开发以及Python代码中的集成使用。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号