Sophia
Sophia是一种为大规模语言模型预训练设计的随机二阶优化器。它通过支持更大学习率,提高了训练速度和模型性能。该项目提供Sophia-G优化器的实现,包含超参数调优指南和GPT-2训练脚本,方便研究人员应用这一优化技术。Sophia适用于GPT-2等不同规模的模型,展现了良好的扩展性。
Sophia是一种新型二阶随机优化算法,利用Hessian矩阵对角线的低成本随机估计和裁剪机制来优化模型训练。相比Adam算法,Sophia在预训练损失、计算量和训练时间方面表现更优,可将训练成本降低50%。此算法易于集成,无需特殊模型架构或基础设施,适用于各类机器学习项目。