datablations

对在数据限制下扩展语言模型的方法的研究

language models 训练数据数据重复数据稀缺 C4 Github 开源项目

本项目研究在数据受限情况下扩展语言模型的方法。通过对9000亿训练令牌和90亿参数模型进行实验，提出并验证了重复令牌和多余参数的计算优化法则。实验涵盖数据增强、困惑度过滤及去重处理。相关模型和数据集公开在仓库，有助于在资源有限情况下高效训练和优化语言模型。

GithubOLMo人工智能开源语言模型开源项目机器学习自然语言处理

OLMo是一个开源语言模型项目，提供多种规模的先进模型，如1B、7B和7B Twin 2T，全部基于Dolma数据集训练。该项目支持模型训练、微调和推理，提供详细配置和检查点以确保研究可重现。OLMo还包含数据检查和评估工具，为语言模型研究提供全面支持，旨在加速这一领域的科学进展。

reversal_curse - 大语言模型的逆向学习局限性研究

GithubLLMReversal Curse人工智能开源项目机器学习自然语言处理

该研究项目探讨了大语言模型在逆向学习任务中的表现局限。研究通过三个实验发现，模型学习A=B关系时难以自动掌握B=A关系。实验涵盖身份信息逆转、实际应用中的逆转问题和指令逆转。项目开源了数据生成、模型微调和评估代码，有助于深入理解语言模型的学习局限。

llms - 大型语言模型的原理与实践应用全面解析

BERTGPTGithubTransformer开源项目自然语言处理语言模型

本项目全面介绍大型语言模型(LLMs)的基本概念、应用场景和技术演进。内容涵盖统计语言模型、神经网络语言模型,以及基于Transformer的预训练模型如GPT和BERT等。系统讲解LLMs核心原理,并探讨模型评估、文本生成和提示工程等实用技术。同时展示LLMs在计算机视觉等领域的创新应用,通过理论与实践结合,为读者提供深入了解LLMs技术的全面指南。

h2o-danube3-4b-base - 高效大语言模型支持离线运行

GithubH2O.aiHuggingfaceh2o-danube3-4b参数大语言模型开源项目模型模型架构

h2o-danube3是H2O.ai构建的基础大语言模型，具有40亿参数，支持在手机上本地和离线运行。该模型采用Llama 2架构调整，集成Mistral tokenizer，拥有32,000词汇和8,192上下文长度。模型兼容transformers库，提供量化和分片方案，适用于多GPU设备。其在Open LLM Leaderboard的Hellaswag测试中获得79.84高分。建议用户负责地使用该模型，审慎评估生成内容。

Llama-2-7B-CAT - 改进大型语言模型的性能与应用策略

GithubHuggingfacemeta-llama开源项目技术规格模型环境影响训练数据

此项目专注于提升大型语言模型的性能，研究如何通过有效的训练方法进行改进。用户可以通过示例代码快速了解使用方法及模型的应用场景与局限性。

LLMLingua - 提示词压缩技术助力大语言模型效率提升

GithubLLMLingua大语言模型开源项目推理加速提示词压缩长文本处理

LLMLingua系列是一套创新的提示词压缩工具，可将提示词压缩至原长度的5%，同时保持大语言模型性能。通过小型语言模型识别并移除非必要标记，该技术有效解决长文本处理和上下文遗忘等问题，大幅降低API使用成本并提高推理效率。LLMLingua系列包含三个版本，适用于检索增强生成、在线会议和代码处理等多种场景。

PowerLM-3b - 基于Power学习率调度器训练的高性能3B参数小型语言模型

GithubHuggingfacePowerLM-3b代码示例开源项目文本生成模型模型评估语言模型

PowerLM-3b是一个基于Power学习率调度器训练的3B参数语言模型。它在开源和专有数据集上训练，在自然语言多选题、代码生成和数学推理等基准测试中表现优异。该模型在同规模模型中展现出较高性能，适用于需要高效小型语言模型的场景。用户可通过Hugging Face transformers库轻松部署和使用PowerLM-3b。

LongLM - 通过Self-Extend方法扩展大语言模型的上下文窗口

FlashAttentionGithubLLMLlama-3SelfExtendtransformers开源项目

LongLM项目介绍了Self-Extend方法，通过不需要调优的方式扩展大语言模型（LLM）的上下文窗口，利用其内在能力处理长上下文。此方法获得了Google I/O和ICML 2024的关注，并支持多种模型如Llama-3、Gemma和Qwen1.5。项目说明了如何安装和运行Self-Extend，并提供组选参数的指导原则及实验结果，以帮助用户应用这一技术。

llm-attacks - 研究大语言模型的对抗性攻击与安全防御

GCG算法GithubLLM攻击实验复现对抗性攻击开源项目语言模型

LLM-attacks项目致力于研究对齐语言模型的通用和可迁移对抗性攻击。项目实现了GCG算法，可对LLaMA-2等模型进行安全测试。研究者能够复现论文中的单一行为、多行为和迁移实验。项目提供完整的安装指南、模型使用说明和实验脚本，并包含交互式演示notebook。该研究有助于深入理解和提升大语言模型的安全性，对相关领域的发展具有重要价值。

gemma-2B-10M - Gemma 2B模型实现1000万token上下文处理仅需32GB内存

Gemma 2BGithub内存优化局部注意力开源项目推理优化长上下文

gemma-2B-10M项目采用递归局部注意力机制，在32GB内存限制下实现了处理1000万token上下文的能力。该项目为Gemma 2B模型提供CUDA优化的推理功能，显著提升了处理效率。项目设计简洁易用，便于开发者快速应用。虽然目前处于早期阶段，但在长文本处理领域展现出巨大潜力，有望推动相关技术的进步。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com