Logo

#模型架构

Logo of large_language_model_training_playbook
large_language_model_training_playbook
此页面提供了大规模语言模型训练的实用指南和资源,涉及模型架构选择、并行策略、模型规模、张量精度、训练超参数设定、最大化吞吐量、稳定性问题、数据处理以及软件和硬件故障调试等主题。这些开放的技巧和工具可以帮助更高效地训练大规模语言模型,并提升其性能和稳定性。
Logo of Nonstationary_Transformers
Nonstationary_Transformers
Non-stationary Transformers项目开发了新型时间序列预测方法,采用系列平稳化和去平稳注意力机制处理非平稳数据。该方法在多个基准数据集上展现出优异性能,并能有效提升现有注意力模型的预测效果。项目开源了完整代码和实验脚本,为时间序列预测研究和应用提供了重要参考。