Project Icon

meditron-7B-AWQ

通过低比特量化方法优化变换器模型性能

此项目提供EPFL LLM团队的Meditron 7B模型的AWQ量化文件,采用高效的4位低比特量化方法,在提升变换器推理速度的同时保证质量。兼容多种平台和工具,如Text Generation Webui、vLLM、Hugging Face Text Generation Inference及Transformers。

AutoAWQ - 面向大型语言模型的高效4位量化框架
AutoAWQGPU加速Github大语言模型开源项目推理量化
AutoAWQ是一个专门针对大型语言模型的4位量化框架,通过实现激活感知权重量化算法,可将模型速度提升3倍,同时减少3倍内存需求。该框架支持Mistral、LLaVa、Mixtral等多种模型,具备多GPU支持、CUDA和ROCm兼容性以及PEFT兼容训练等特性。AutoAWQ为提升大型语言模型的推理效率提供了有力工具。
Meta-Llama-3.1-8B-Instruct-awq-4bit - 高效4位量化的大型指令模型 适用GPU推理
AutoAWQGPUGithubHuggingfaceLlama 3.1开源项目模型自然语言处理量化
Meta-Llama-3.1-8B-Instruct模型的4位量化版本,采用AutoAWQ技术实现。This Kaitchup开发的这一版本旨在提高GPU推理效率,在保持原始性能的同时显著降低内存占用。适合在资源受限环境中运行,项目页面提供了量化过程、评估结果及使用方法的详细信息。
Llama-3.1-Nemotron-70B-Instruct-HF-FP8-dynamic - 多语种量化优化模型,显著降低内存占用
GithubHuggingfaceLlama-3.1-Nemotron-70B-Instruct-HF-FP8-dynamic多语言支持开源项目文本生成模型模型优化量化
通过将权重和激活量化为FP8格式,该项目优化了Llama-3.1-Nemotron模型,显著降低了GPU内存与磁盘的占用。模型适用于商业与研究,支持多语言开发和会话助手的构建。利用vLLM,可以实现高效部署并具有OpenAI兼容性。Llama-3.1-Nemotron-70B-Instruct-HF-FP8-dynamic在诸多测试中表现优良,在Arena-Hard评估中达99.41%的恢复率。
Llama-3-8B-Instruct-GPTQ-4-Bit - 利用GPTQ量化优化模型性能的新方法
Apache AirflowGPTQGithubHuggingfaceMeta-Llama-3-8B-Instruct开源项目数据协调模型量化
Astronomer的4比特量化模型通过GPTQ技术减少VRAM占用至不足6GB,比原始模型节省近10GB。此优化提高了延迟和吞吐量,即便在较便宜的Nvidia T4、K80或RTX 4070 GPU上也能实现高效性能。量化过程基于AutoGPTQ,并按照最佳实践进行,使用wikitext数据集以减小精度损失。此外,针对vLLM和oobabooga平台提供详细配置指南,以有效解决加载问题。
BioMistral-7B-GGUF - 精准医学文本生成的多位量化模型
BioMistral-7B-GGUFGPU加速GithubHuggingfacePyTorch开源项目模型模型下载量化方法
BioMistral-7B-GGUF项目提供支持2至8位量化的GGUF格式模型文件,专为生成多语言的医学和生物文本而设计。由BioMistral创建,该模型兼容多种客户端和库,如llama.cpp,支持GPU加速。其兼容Autotrain和endpoints,可集成至LangChain环境。用户能借助如llama-cpp-python的工具实现快速下载和部署,旨在提升文本生成任务的性能,为高级对话和叙事应用提供支持。
Qwen2.5-7B-bnb-4bit - 采用4bit量化技术加速Qwen2.5-7B模型并降低70%内存占用
GithubHuggingfaceQwen2.5Unsloth大语言模型开源项目模型模型微调深度学习
基于Qwen2.5-7B的量化优化版本,通过4bit量化技术将内存占用降低70%。模型拥有76亿参数,具备128K上下文长度和29种语言处理能力,支持编码、数学运算和长文本生成等功能。该版本在保持原有性能的同时实现轻量化部署,可用于后续的模型微调与定制开发。
Mistral-7B-Instruct-v0.3-GGUF - Mistral-7B-Instruct模型的多种量化版本优化性能与文件大小
GGUFGithubHuggingfaceMistral-7B-Instruct-v0.3llama.cpp开源项目模型模型性能量化
该项目为Mistral-7B-Instruct-v0.3模型提供多种量化版本,采用llama.cpp的imatrix选项。量化类型从Q8_0到IQ1_S不等,文件大小范围为1.61GB至7.70GB。项目详细介绍了各版本特点,并提供下载指南和选择建议,方便用户根据硬件条件和性能需求选择最佳版本。
Qwen2-1.5B-Instruct-IMat-GGUF - 运用量化技术优化Qwen2-1.5B-Instruct模型的文本生成能力
GithubHuggingfaceIMatrixQwen2-1.5B-Instruct开源项目文本生成模型量化
项目利用llama.cpp对Qwen2-1.5B-Instruct模型进行量化,支持从8bit到1bit的多种位数及IMatrix数据集。这种方法能减少模型体积且保持性能多样,适用于不同文本生成任务。用户可使用huggingface-cli简便下载及合并文件,以满足不同应用需求。项目因其灵活性及高效性,适宜不同计算资源的使用者,为其提供多样选择。
idefics2-8b-chatty-AWQ - 4-bit量化的多模态模型及其应用场景
4-bit AWQGithubHuggingFaceM4/idefics2-8b-chattyHuggingface图像文本多模态开源项目模型量化
这是一款4-bit AWQ量化的多模态模型,支持多种数据集与任务,帮助提升计算效率和模型性能。
Mistral-7B-Instruct-v0.3-AWQ - Mistral模型AWQ量化版支持高级函数调用和三代分词
AWQ量化GithubHuggingfaceMistral-7B-Instruct-v0.3大语言模型开源项目模型模型量化自然语言处理
作为Mistral-7B-Instruct-v0.3的AWQ量化版本,该模型采用4比特压缩技术,在提供快速推理性能的同时保持了原有精度。通过扩展词汇表和引入第三代分词技术,增强了模型的理解能力。目前已集成到主流AI框架平台,可在搭载NVIDIA显卡的Linux或Windows系统上运行。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能,包括文生视频、动态画面和形象生成等,帮助用户快速上手,创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台,用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品,帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型,为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能,满足事务性工作的高频需求,帮助撰稿人节省精力,提高效率,优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号