Project Icon

PERSIA

突破百万亿参数的推荐模型训练框架

PERSIA代表'并行推荐训练系统与混合加速',是一个创新的开源框架,专为训练超大规模深度学习推荐模型而设计。该系统能够处理高达100万亿参数的模型,在效率和可扩展性方面表现卓越。PERSIA不仅在公共数据集上展现出优势,还在大型商业应用中得到实际验证。作为首个公开的PyTorch基础推荐训练系统,PERSIA为推荐算法的研究和应用开辟了新的可能性。

awesome-recommend-system-pretraining-papers - 推荐系统预训练及大型语言模型论文资源
GithubRecommend System大语言模型开源项目数据集用户表示预训练预训练模型
此资源汇总了预训练推荐系统和大型语言模型相关的论文,涵盖用户表示预训练、序列推荐、图预训练等子领域,并提供丰富的数据集和代码链接。研究人员可以通过该列表了解如何利用预训练和大型语言模型提升推荐系统性能,获得最新研究成果和实用工具。
bert-base-parsbert-uncased - 基于BERT的波斯语自然语言处理模型ParsBERT
BERTGithubHuggingfaceParsBERT开源项目模型波斯语言模型深度学习自然语言处理
ParsBERT是一个基于BERT架构的波斯语预训练模型,使用超过200万份多样化文档构建而成。该模型在情感分析、文本分类和命名实体识别等任务中表现卓越,优于多语言BERT等其他模型。ParsBERT采用全词遮蔽策略,为波斯语自然语言处理研究奠定了坚实基础,推动了相关技术的发展。
LibRecommender - 推荐系统开源库 集成多种算法与完整工作流
GithubLibRecommender协同过滤开源项目推荐系统机器学习深度学习
LibRecommender是一个专注于端到端推荐流程的开源系统库。它实现了FM、DIN、LightGCN等多种流行算法,支持协同过滤和基于内容的混合推荐。该库具有低内存占用、支持冷启动和动态特征等优势,提供从数据处理到模型训练、评估和部署的完整工作流。其API设计统一友好,适用于多种推荐场景。
petastorm - 开源数据访问库,支持单机或分布式训练和评估深度学习模型,直接从Apache Parquet格式数据集中读取数据
Apache ParquetGithubPetastorm分布式训练开源项目机器学习框架深度学习
Petastorm是一个开源数据访问库,支持单机或分布式训练和评估深度学习模型,直接从Apache Parquet格式数据集中读取数据。该库兼容Tensorflow、PyTorch和PySpark等主流Python机器学习框架,也可用于纯Python代码。Petastorm支持多种数据压缩格式,提供方便的API用于数据生成和读取,并支持列选择、并行读取、行过滤等功能。用户可以轻松在单机或Spark集群上生成数据集,是构建高效机器学习管道的理想工具。
peft - 大模型高效微调的先进方法
AccelerateDiffusersGithubLoRAPEFTTransformers开源项目
参数高效微调(PEFT)通过只调整少量额外参数来适配大规模预训练模型,大幅降低计算和存储成本,同时性能接近完全微调模型。PEFT与Transformers、Diffusers和Accelerate集成,支持多种下游任务的训练和推理。了解更多方法和优势,请访问官方文档和教程。
torchtitan - PyTorch原生大规模语言模型训练框架
GithubLLM训练Llama模型PyTorchtorchtitan分布式训练开源项目
torchtitan是基于PyTorch的大规模语言模型训练框架,展示了最新分布式训练功能。它采用简洁模块化设计,支持多种并行化技术,包括数据并行、张量并行和管道并行。框架还提供分布式检查点和Float8等先进特性,为Llama 3和Llama 2等模型预训练提供高效方案。torchtitan旨在展示PyTorch在大规模语言模型训练中的潜力。
lightning-flash - 跨数据领域和任务的AI模型训练与处理解决方案
AIGithubPyTorchlightning-flash开源项目模型训练深度学习
Lightning Flash提供多任务和多数据领域的AI解决方案,用户只需三步即可完成数据加载、模型配置和微调。项目支持多种预训练模型和优化策略,简化深度学习工作流程,适用于各种数据域和任务类型。其功能包括模型预测、训练策略、优化器和调度器选择,以及自定义数据变换。Flash旨在让用户无需自行开发复杂的研究框架,即可在生产环境中应用AI模型。
psi - 开源框架助力多模态集成AI系统开发
GithubPlatform for Situated Intelligence人工智能多模态系统开源框架开源项目流数据处理
Platform for Situated Intelligence (\psi)是一个开源框架,专注于多模态集成AI系统的开发和研究。它提供高性能基础设施处理多模态时序流数据,并配备数据可视化、标注和处理工具。\psi包含丰富的组件生态系统,支持各类传感器、处理技术和执行器。该框架适用于开发社交机器人、混合现实系统等应用,尤其擅长处理流式传感器数据、整合多种AI技术,并满足低延迟要求。
BMTrain - 分布式大规模深度学习模型训练优化工具
BMTrainGithubZeRO优化分布式训练大模型训练开源项目性能优化
BMTrain是一款为大规模深度学习模型设计的分布式训练工具。它能够支持训练包含数十亿参数的模型,并保持代码简洁性。该工具集成了ZeRO优化和通信优化等技术,可提高训练效率和显存利用率。BMTrain与PyTorch兼容,仅需少量代码调整即可实现分布式训练。在13B参数的GPT-2模型训练中,BMTrain展现出优越性能。
recommenders - 利用TensorFlow构建推荐系统模型的库
GithubKerasTensorFlow Recommenders开源项目推荐系统数据准备模型训练
TensorFlow Recommenders 是一款利用TensorFlow构建推荐系统模型的库。它涵盖了数据准备、模型构建、训练、评估和部署的完整工作流程,基于Keras,旨在为用户提供易学且灵活的体验,能够支持构建复杂模型。只需确保安装TensorFlow 2.x,并使用pip安装即可开始使用。详细的文档和教程能够帮助用户快速入门。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号