#ILQL

trlx - 分布式微调大型语言模型的强化学习框架，支持奖励函数与高效并行

trlXHugging FaceNVIDIA NeMoPPOILQLGithub开源项目

一个专注于强化学习微调大型语言模型的分布式训练框架。支持使用奖励函数或已标注数据集进行训练，兼容🤗Hugging Face和NVIDIA NeMo模型，可扩展到20B参数以上。实现了PPO和ILQL等多种RL算法，提供详细文档和丰富示例，支持分布式训练和超参数搜索。适用于各种应用场景，通过高效并行技术提升训练效率。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号