dataset

摩洛哥方言Darija与英语双语开源数据集DODa

Darija DODa 开源数据集摩洛哥方言自然语言处理 Github 开源项目

Darija Open Dataset (DODa)是一个专注于摩洛哥方言的开源项目，包含约15万条条目。该数据集提供语义和语法分类、多种拼写形式、词形变化以及大量翻译句子。DODa采用拉丁字母和阿拉伯字母，反映了Darija拼写的多样性，为自然语言处理应用提供了丰富资源。项目目标是成为Darija NLP的重要参考，并鼓励社区贡献。

访问官网

Github

Huggingface

介绍相关项目

dclm - 大型语言模型训练与评估的开源综合框架

DataComp-LMGithub大语言模型开源项目数据处理模型训练评估

DataComp-LM是一个开源的大型语言模型训练和评估框架。它提供了超过300T的CommonCrawl标准语料库、基于open_lm的预训练方案和50多项评估指标。研究人员可利用该框架在411M至7B参数规模下进行数据集构建实验。通过数据集优化，DataComp-LM已显著提升了模型性能，创建了多个跨规模表现优异的高质量数据集。

DAMO-ConvAI - 达摩院对话式AI研究代码库

DAMO ConvAIGithub人工智能对话AI开源项目自然语言处理阿里巴巴

DAMO-ConvAI是达摩院对话式AI研究的开源代码库，汇集了多项前沿成果。项目在LREC-COLING 2024、EMNLP 2023和ACL 2023等顶级会议上发表论文，并在DSTC11-SIMMC赛道及Spider、SparC、CoSQL等排行榜上名列前茅。DAMO-ConvAI专注于对话系统、自然语言处理和机器学习领域的研究，为开发者提供丰富资源。

bert-base-arabic-camelbert-da-sentiment - CAMeLBERT-DA阿拉伯语情感分析模型

CAMeLBERT-DAGithubHuggingface开源项目情感分析模型自然语言处理阿拉伯语预训练语言模型

CAMeLBERT-DA情感分析模型是基于阿拉伯方言预训练模型微调而成。该模型利用ASTD、ArSAS和SemEval数据集进行了fine-tuning，可通过CAMeL Tools或transformers pipeline轻松集成使用。模型支持对阿拉伯语文本进行积极和消极的二分类情感分析。这一成果对研究阿拉伯语言模型的变体、规模和任务类型之间的相互作用具有重要意义。

OLMo-7B - 专注于语言模型科学的开放模型

GithubHuggingfaceOLMo开源项目模型模型性能训练数据集语言模型

OLMo系列模型由Allen Institute for AI开发，旨在推进语言模型科学。该系列模型使用Dolma数据集进行训练，提供诸如OLMo 7B等多种版本及详细的训练检查点和代码支持。这些模型可用于英文学术研究，并可在Hugging Face平台上获取。项目获得哈佛大学、Databricks、AMD等机构支持，并在MMLU测试中显示出明显的性能提升。

DALM - 优化AI语言模型的开源自适应工具包

ArceeDALMGithubLlama-2-7b-hfRAG-end2endcontrastive learning开源项目

Arcee开源的领域自适应语言模型工具包（DALM）结合了RAG-e2e架构，实现LLM与向量存储的高效整合。该工具包支持Llama、Falcon和GPT等解码器，适用于特定领域的高级定制。工具包包括数据处理、训练和评估的完整代码库，支持对比学习和高效的检索生成联合训练。

Adala - 提供灵活可扩展运行时环境的自主数据标注框架

AdalaGithub人工智能开源项目数据标注机器学习自适应学习

Adala 是一个用于数据处理的自主数据标注框架，具备灵活的运行时环境和Python集成。通过迭代学习，系统内的智能体可以独立获取技能，适应不同的环境。Adala 提供可靠的数据处理结果和多种定制化选项，适合AI工程师、机器学习研究人员、数据科学家和教育工作者使用，并兼容OpenAI和VertexAI等大型语言模型。

awesome-json-datasets - 免费开放的海量JSON数据集合

APIGitHubGithubJSON开源开源项目数据集

awesome-json-datasets项目收集了大量免费开放的JSON格式数据集，内容涵盖比特币、气候、犯罪、货币等多个领域。项目为每个数据集提供直接访问链接，并附有使用提示，方便开发者和数据分析师快速获取所需资源。作为一个综合性的JSON数据集索引，该项目为数据驱动的应用开发和研究提供了便利。

awesome-instruction-dataset - 开源的多任务多语言指令微调数据集

AlpacaChatGPTGithubLLMsRLHF开源项目数据集

该项目收录了一系列开源指令微调数据集，用以训练基于聊天的LLM（如GPT-4、ChatGPT、LLaMA、Alpaca）。数据集包括视觉指令微调、文本指令微调和人类反馈增强学习（RLHF）数据集。项目提供了详尽的数据集列表，方便研究人员和开发人员使用这些资源。支持多任务和多语言，覆盖英语、中文等多种语言数据，数据集来源多样，包括人类生成、自我指令生成以及混合数据集，适合多种LLM训练需要。

dodrio - 交互式工具帮助NLP研究者分析Transformer模型的注意力权重

DodrioGithubNLPTransformer模型交互式可视化开源项目文本分析

Dodrio是一个交互式可视化系统，旨在帮助NLP研究人员分析和比较Transformer模型中的注意力权重。用户可查看实时演示、下载代码并本地运行。由Jay Wang、Robert Turko和Polo Chau开发，支持个性化模型和数据集的可视化。

awesome-synthetic-datasets - 大语言模型合成数据集资源汇总

CosmopediaGithubSelf-InstructTinyStories合成数据集大语言模型开源项目

该项目整理了大语言模型生成合成数据集的相关资源，包括教程、技术、数据集、工具和论文。涵盖TinyStories、Cosmopedia等数据集，以及Self-Instruct、AutoPrompt等技术，为AI研究和开发提供参考。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号