#数据选择
相关项目
LESS
LESS项目提供了一种数据选择方法,通过选择有影响力的数据来增强特定功能。该项目涵盖了安装要求、数据准备、数据选择和模型训练的详细步骤,并提供相应的脚本和指南。通过预热训练、构建梯度数据存储库、任务数据选择和最终训练四个步骤,提升模型在下游任务中的表现能力。利用Flan v2、COT、Dolly和Open Assistant等训练数据集,以及MMLU、TydiQA和BBH等评估数据集,优化特定任务的模型性能。
data-selection-survey
这个项目全面梳理了语言模型数据选择的各个环节,涵盖预训练、指令微调和偏好对齐等阶段。内容包括语言过滤、启发式方法、数据质量评估和去重等核心技术,还探讨了多语言和特定领域模型的专门选择策略。项目汇集了众多相关研究文献,为语言模型开发提供了系统的参考资源。
deita
Deita是一个开源项目,为大型语言模型的指令调优提供自动数据选择工具。项目包含开源工具包、高质量轻量级数据集和高效训练模型。Deita模型使用仅十分之一的指令调优数据,就能达到其他先进聊天模型的性能水平。项目提供全面评估结果,展示了在多项基准测试中的表现。