LongQLoRA

大语言模型上下文长度高效扩展的创新方法

LongQLoRA 大语言模型上下文长度扩展低资源训练性能评估 Github 开源项目

LongQLoRA是一种扩展大语言模型上下文长度的方法，可在单个32GB V100 GPU上将LLaMA2模型的上下文长度从4096扩展到8192。该方法在PG19和Proof-pile数据集上表现优异，仅需1000步微调即可达到接近MPT-7B-8K的性能。项目还提供了预训练数据集、指令微调数据集以及扩展上下文长度的模型。

Github

Huggingface

介绍相关项目

LongMem - 为语言模型赋予长期记忆能力

GithubLongMem开源项目评估语言模型长期记忆预训练

LongMem项目通过创新的长期记忆机制提升了语言模型的性能。该项目实现了记忆库、检索机制和联合注意力等核心技术，使模型在内容学习任务中表现优异。项目开源了完整代码，包括环境配置、模型结构和评估方法，为研究者提供了便利的复现和探索工具。LongMem为自然语言处理领域开辟了新的研究方向。

LLaVA-HR - 混合分辨率适应技术助力多模态大模型

GithubLLaVA-HR多模态大语言模型开源项目视觉语言任务高分辨率

LLaVA-HR是一个采用混合分辨率适应技术的多模态大语言模型。它支持1536x1536的高分辨率图像输入,提高了细粒度视觉语言任务的性能。该模型在保持与LLaVA-1.5相近训练成本的同时,在多个基准测试中表现出色。LLaVA-HR为研究社区提供了一个新的基线,展示了混合分辨率适应方法在提升多模态模型性能方面的潜力。

LLaMA-Pro - 具有块扩展的渐进式 LLaMA

GPT模型GithubLLaMA ProMetaMath开源项目深度学习自然语言处理

LLaMA-Pro项目通过模块扩展实现渐进式改进，显著提升算法性能。开源代码和模型包括LLaMA-Pro-8B和Mistral-Pro-8B-v0.1，后者在多个基准测试中表现优异，尤其在代码与数学能力方面超越主流型号。项目还提供了本地执行方法和训练代码。在ACL 2024大会上，项目论文已被接收，展示出其学术和实用价值。同时，LLaMA-Pro项目提供评估工具和预训练样例，支持开发者高效开发。

ChatGLM-Tuning - ChatGLM-6B和LoRA结合的经济型语言模型微调方案

AI模型ChatGLM-6BGithubLoRA开源项目微调深度学习

ChatGLM-Tuning项目是一个基于ChatGLM-6B和LoRA技术的语言模型微调解决方案。该项目包含数据预处理、模型训练和推理功能，支持Alpaca数据集。它提供预训练LoRA模型，并计划引入中文数据和RLHF技术。这一方案适用于16GB以上显存的GPU环境，为开发者提供了一种经济高效的大型语言模型定制途径。

Llama-3-8B-Instruct-GPTQ-4-Bit - 利用GPTQ量化优化模型性能的新方法

Apache AirflowGPTQGithubHuggingfaceMeta-Llama-3-8B-Instruct开源项目数据协调模型量化

Astronomer的4比特量化模型通过GPTQ技术减少VRAM占用至不足6GB，比原始模型节省近10GB。此优化提高了延迟和吞吐量，即便在较便宜的Nvidia T4、K80或RTX 4070 GPU上也能实现高效性能。量化过程基于AutoGPTQ，并按照最佳实践进行，使用wikitext数据集以减小精度损失。此外，针对vLLM和oobabooga平台提供详细配置指南，以有效解决加载问题。

LLM-Finetuning - 大型语言模型高效微调指南

GithubHugging FaceLoRAPEFT大型语言模型开源项目微调

了解如何使用LoRA和Hugging Face Transformers库高效微调大型语言模型。项目提供详细的教程笔记本，包括在Colab中微调Llama 2、GPT-Neo-X-20B、MPT-Instruct-30B等模型的指导和代码示例。无论新手或专家，均可找到实用资源，提升语言模型性能。欢迎贡献和提交问题，共同完善此开源项目。

Meta-Llama-3.1-8B-Instruct-quantized.w8a8 - 量化优化的多语言文本生成模型

GithubHuggingfaceMeta-Llama-3vLLM多语言开源项目文本生成模型量化

该模型通过INT8量化优化，实现了GPU内存效率和计算吞吐量的提升，支持多语言文本生成，适用于商业和研究中的辅助聊天任务。在多个基准测试中，该模型实现了超越未量化模型的恢复率，尤其在OpenLLM和HumanEval测试中表现突出。使用GPTQ算法进行量化，有效降低了内存和磁盘的占用。可通过vLLM后端快速部署，并支持OpenAI兼容服务。

LLaMA-VID - 支持长视频处理的多模态大语言模型

GithubLLaMA-VID多模态大语言模型开源项目视觉语言模型视频理解

LLaMA-VID是一个新型多模态大语言模型,可处理长达数小时的视频。它通过增加上下文令牌扩展了现有框架的能力,采用编码器-解码器结构和定制令牌生成策略,实现对图像和视频的高效理解。该项目开源了完整的模型、数据集和代码,为视觉语言模型研究提供了有力工具。

ALMA-13B-Pretrain - 改进大型语言模型的翻译性能与偏好优化技术

ALMAGithubHuggingfaceLoRA微调对比偏好优化开源项目数据集机器翻译模型

ALMA基于新的翻译模型范式，初步在单语数据上进行精调，接着应用高质量的平行数据进行优化，从而显著提升大型语言模型的翻译效果。其最新版本ALMA-R采用了对比偏好优化（CPO），相较于传统监督精调，进一步提高了翻译的精度，可与GPT-4媲美。尤其是ALMA-13B-LoRA，通过过渡性精调和人类撰写的平行数据，确保了在专业翻译任务中的卓越表现。

relora - 使用ReLoRA实现高效深度学习模型训练

GithubPEFTPyTorchReLoRAflash attention开源项目训练

ReLoRA项目通过低秩更新实现高效深度学习训练，兼容Python 3.10+和PyTorch 2.0+，支持更大的微批次大小。用户可通过执行预处理和不同配置的训练脚本，达到高效分布式训练，并支持cosine重启调度和多GPU配置。项目涵盖了预热训练和ReLoRA重启，适用于各种规模的模型训练。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号