SPIN
SPIN项目通过使用自对弈机制提升语言模型性能,无需额外的人类注释数据。模型通过生成自旋数据并与其先前版本对弈来优化策略。多项基准测试结果表明,SPIN显著提升模型表现,超过直接偏好优化方法。开源的完整代码和训练脚本提供了从数据生成到模型微调的全套流程。