#生物学
awesome-public-datasets - 多领域高质量公共数据集资源汇总
开源数据集生物学基因组学蛋白质数据库微阵列数据Github开源项目
Awesome Public Datasets汇集了农业、生物学、计算机科学等多个领域的高质量公共数据集。该项目源于上海交通大学OMNILab,现隶属于BaiYuLan开放AI社区。它为研究人员和数据科学家提供了便捷获取开放数据资源的途径,支持各类分析和研究工作。资源列表涵盖广泛,质量可靠,是数据科学工作的重要参考。
esm - ESM3生成模型实现蛋白质序列结构功能联合推理
ESM3蛋白质模型生成式模型生物学人工智能Github开源项目
ESM3是一个创新的生物学生成模型,能够同时处理蛋白质的序列、结构和功能。通过离散令牌表示这三种数据模态,ESM3可根据部分输入预测完整的蛋白质信息。作为一个生成式掩码语言模型,它采用迭代采样方法。ESM3架构具有高度可扩展性,其最大版本拥有980亿参数,曾对2.78亿个蛋白质进行训练。
Scientific-LLM-Survey - 生物化学领域科学大语言模型研究综述
大语言模型科学生物学化学医学Github开源项目
Scientific-LLM-Survey项目系统梳理生物化学领域科学大语言模型研究进展。涵盖文本、分子、蛋白质和基因组语言模型,以及多模态模型的最新发展。项目收录关键论文,提供数据集和基准测试资源,为该领域研究提供全面参考。
DNABERT-2-117M - 多物种基因组分析的先进Transformer模型
模型生物学DNABERT-2医学开源项目Huggingface基因组Github深度学习
DNABERT-2-117M是一个创新的多物种基因组分析工具,基于先进的Transformer架构。它整合了MosaicBERT技术,实现了DNA序列的高效嵌入计算。用户可以通过简单的Python代码调用模型,获取DNA序列的向量表示。这一功能为生物信息学和医学基因组学研究提供了强大支持,有望推动多种基因组分析任务的进展。