Data-Provenance-Collection
Data-Provenance-Collection项目致力于提高AI训练数据集的透明度和负责任使用。该项目审计了44个数据集合,涵盖1800多个文本微调数据集,记录了其来源、许可和创建者等元数据。开发者可通过项目脚本筛选符合许可和特征要求的数据集,促进AI训练数据的规范使用。