dolma

3万亿令牌的多样化开放数据集与高性能管理工具

Dolma Dataset Dolma Toolkit AI2 语言模型数据集管理 Github 开源项目

Dolma项目提供一个包含3万亿令牌的多样化开放数据集，涵盖网络内容、学术出版物、代码、书籍和百科材料。Dolma Toolkit是一款高性能工具包，能够高效整理大型数据集，支持并行处理、便捷移植、内置标签器、快速去重、扩展性和云支持。该项目由Allen Institute for AI开发，数据集可在HuggingFace平台下载。

Github

Huggingface

介绍相关项目

dolphin-2.1-mistral-7b - 无审查AI助手模型，商用与非商用都可行

Dolphin 2.1GithubHuggingfacea16z培训开源开源项目数据集模型

Dolphin-2.1-mistral-7b模型基于mistralAI，采用Apache-2.0许可证，可用于商业及非商业用途。该无审查模型通过数据集过滤去除对齐和偏见，建议在服务化前添加自定义对齐层。数据集包括开源的Dolphin和Airoboros，经过去重和清理提升了质量，模型使用ChatML格式进行提示训练，48小时内完成4个周期训练，提倡负责任使用。

TinyLlama-1.1B-intermediate-step-1195k-token-2.5T - TinyLlama项目中的1.1B模型实现高效计算

GithubHuggingfaceLLama 2TinyLlama优化开源项目模型模型参数预训练

TinyLlama通过创新方法，在2.5万亿tokens数据集上实现预训练，紧凑的1.1B参数设计提高了计算和内存效率，适用于多种开源项目。

chat-dataset-baseline - 中文对话模型训练资源整合平台

AI训练GithubLLaMA-Factory中文对话模型开源项目数据集模型优化

chat-dataset-baseline项目整合Hugging Face平台优质数据集，为中文对话模型训练提供全面资源。采用PDCA循环迭代，涵盖数据选择、模型训练、测试和优化。项目提供详细指南，适合数据科学家和AI爱好者快速上手，用于训练高质量中文基础模型，为特定行业应用打下基础。

OCR_DataSet - 综合OCR数据集资源库及工具集

Github图像标注开源项目数据集文字识别深度学习计算机视觉

OCR_DataSet项目整合了13个知名的多语言OCR数据集，涵盖ICDAR2015、MLT2019和COCO-Text_v2等。项目特色包括数据格式统一化、便捷的百度网盘下载、详尽的数据集信息表和简化的读取脚本。此外，项目还提供了数据生成工具链接，为OCR领域的研究和开发工作提供了全面的资源支持。

loft - 探索百万级token长文本处理的前沿基准

GithubLOFT多模态任务开源项目文本检索语言模型长上下文基准

LOFT是一个长文本处理基准，包含6类30多个数据集，涵盖检索、多跳推理等任务。该项目提供多模态数据、评估代码和数据集重生成工具，旨在测试大规模语言模型的长文本处理能力。LOFT为研究人员提供了标准化平台，用于全面评估长文本语言模型性能，有助于推动自然语言处理技术发展。

Llama-3.2-1B - 提升2.4倍速度的语言模型微调框架

GithubHuggingfaceLlama 3.2Unsloth内存优化多语言支持开源项目模型模型微调

Meta发布的Llama-3.2-1B是一款支持8种语言的大规模语言模型。通过集成Unsloth工具，该项目实现了模型微调速度提升2.4倍、内存占用降低58%的性能优化。项目提供Google Colab环境支持，可快速进行模型训练，并支持将成果导出为GGUF、vLLM格式或部署至Hugging Face平台。

stablelm-3b-4e1t - StableLM开源语言模型在1万亿token数据上训练达到30亿参数规模

GithubHuggingfaceStableLM-3B-4E1T人工智能大语言模型开源模型开源项目文本生成模型

StableLM-3B-4E1T是一个开源语言模型，通过在Falcon RefinedWeb和RedPajama-Data等数据集上训练4轮获得，总计处理1万亿tokens数据。模型采用LayerNorm归一化和Rotary位置编码技术，支持Flash Attention 2优化。在HellaSwag和Winogrande任务评测中分别达到75.94%和71.19%的准确率，展现出良好的语言理解能力。

dim - 开源数据安装管理器，简化项目数据处理

Githubdim开源数据管理开源项目数据下载数据处理数据搜索

Data Installation Manager (DIM) 是一个开源工具，旨在像包管理器一样高效管理项目中的开源数据。用户可以通过DIM记录数据源URL和进行后处理操作，利用dim.json文件快速准备所需数据。DIM支持解压缩、编码转换等常见任务，并且能够通过CKAN搜索数据和使用GPT-3生成数据处理代码。更多详情和安装方法请参考官方文档。

Luotuo-Chinese-LLM - 综合性中文大语言模型开源项目

Github中文大语言模型子项目开源开源项目快速上手骆驼项目

骆驼(Luotuo)项目是一个综合性中文大语言模型开源项目，涵盖Chat凉宫春日、骆驼嵌入、骆驼QA等多个子项目。该项目由来自商汤科技和华中师范大学的研究人员发起，致力于推进中文大语言模型的研发和应用。项目内容包括模型训练、数据处理和应用开发等多个领域，为研究人员和开发者提供了丰富的开源资源。

Llama-2-7b-hf - Meta开发的开源语言模型支持多种参数规模和商业应用

GithubHuggingfaceLlama 2人工智能大语言模型开源项目模型自然语言处理预训练模型

Llama-2-7b-hf是Meta推出的开源大型语言模型之一，采用优化的Transformer架构。该模型经过2万亿token预训练，拥有70亿参数，支持4k上下文长度。Llama 2系列提供预训练和微调版本，可用于多种自然语言生成任务。在多项基准测试中表现优异，并支持商业应用，是一个功能强大的开源AI工具。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号