#AI2
dolma入门指南 - 用于语言模型预训练的开放数据集和处理工具
1 个月前
Dolma:开源大规模语言模型预训练数据集与工具包
2 个月前
相关项目
dolma
Dolma项目提供一个包含3万亿令牌的多样化开放数据集,涵盖网络内容、学术出版物、代码、书籍和百科材料。Dolma Toolkit是一款高性能工具包,能够高效整理大型数据集,支持并行处理、便捷移植、内置标签器、快速去重、扩展性和云支持。该项目由Allen Institute for AI开发,数据集可在HuggingFace平台下载。
allenact
AllenAct是一个专为Embodied AI研究设计的开源框架,提供模块化和灵活的学习架构,支持多种环境和算法。其主要特点包括任务抽象、训练序列试验、PyTorch支持和多智能体功能。由Allen Institute for AI开发,提供详尽的文档、教程及预训练模型,为Embodied AI研究提供有效支持。