Awesome-LLMs-Datasets
这个项目全面收集和分类了大型语言模型(LLM)数据集,包括预训练语料库、指令微调数据集、偏好数据集、评估数据集和传统NLP数据集五大类别。新增的内容涵盖多模态大语言模型数据集和检索增强生成数据集。项目统计了444个数据集的详细信息,覆盖8种语言和32个领域,为LLM研究提供了全面参考资源。