#DNA序列

GENA-LM: 一个用于长DNA序列的开源基础模型家族

2 个月前

GENA-LM DNA序列预训练模型转化器基因组学 Github 开源项目

2 个月前

相关项目

GENA_LM

GENA-LM是专为长DNA序列设计的开源基础模型家族。它采用BPE分词方法，支持最长36k bp的输入序列，并基于最新T2T人类基因组进行预训练。该项目提供多种预训练模型，包括BERT和BigBird架构，可用于启动子预测和剪接位点识别等多种下游任务。GENA-LM为基因组学研究提供了新的分析工具，促进了DNA序列分析技术的进步。

nucleotide-transformer-v2-500m-multi-species

nucleotide-transformer-v2-500m-multi-species是一个基于850个多物种基因组预训练的5亿参数Transformer模型。该模型利用多样化物种的DNA序列信息,通过掩码语言建模训练,可用于分子表型预测等任务。它采用6-mer标记化方法,结合旋转位置编码和门控线性单元,在900B个标记上训练而成。这一基础模型为基因组学研究提供了有力工具,可应用于多种下游分析。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com