Project Icon

scispacy

科学文献处理的定制spaCy管道与模型

scispaCy项目提供了适用于科学文献处理的定制化spaCy管道和模型,包括基于生物医学数据训练的分词器、词性标注器和实体识别模型。用户可轻松安装和使用这些工具,项目支持多种NER模型和实体链接器,适合不同任务使用,并提供详细的安装和使用指南。

gensim - Gensim:高效的Python主题建模和文档索引工具
GensimGithubNLPPython主题建模开源项目文档相似性
Gensim是一个针对自然语言处理和信息检索的Python库,用于执行主题建模、文档索引和相似性检索。该库依靠高效的内存独立算法和多核实现,可以处理超过内存容量的大型语料库。Gensim支持LSA、LDA、RP和HDP等各种流行算法,并支持分布式计算。其直观接口和详实文档使得用户可以轻松集成与扩展,是大规模文本数据处理的优秀选择。
HugNLP - 基于Hugging Face的全面NLP开发应用框架
GithubHugNLPNLP应用开发开源项目指令微调预训练语言模型
HugNLP是基于Hugging Face的NLP开发应用库,为研究人员提供便利高效的开发环境。它集成了丰富的模型、处理器和应用模块,支持知识增强预训练、提示微调、指令调优等技术。该框架还包含参数高效学习、不确定性估计等工具,可用于构建多种NLP应用。HugNLP获得CIKM 2023最佳演示论文奖。
SmallLanguageModel-project - 自主构建完整的语言模型,从数据采集到训练一步到位
GithubPythonSmallLanguageModel依赖安装开源项目数据处理模型训练
该项目提供全面的构建语言模型指南,包括数据收集、预处理及模型训练。项目涵盖从数据采集到训练多种模型(如BERT、GPT、Seq-2-Seq)的全部必要工具和步骤。适用于Python 3.8及以上版本,通过详细的教程和文档帮助开发者高效实现模型训练与应用。
nlp-recipes - 使用最新深度学习模型加速自然语言处理系统开发
Azure Machine LearningBERTGithubNLPtransformers开源项目深度学习
该资源库提供构建NLP系统的示例和最佳实践,重点关注最新的深度学习方法和常见场景,如文本分类、命名实体识别和文本摘要。支持多语言,特别是利用预训练模型应对不同语言任务。内容基于与客户的合作经验,旨在简化开发过程,帮助数据科学家和工程师快速部署AI解决方案。
doccano - 开源多功能文本标注平台
GithubRESTful APIdoccano协作标注开源工具开源项目文本标注
doccano是一个开源文本标注平台,支持多种任务类型,包括文本分类、序列标注和序列到序列。该工具提供协作标注、多语言支持和移动端兼容等特性,适用于情感分析、命名实体识别和文本摘要等领域。用户能够快速创建项目并上传数据,高效构建数据集。doccano提供多种部署选项,如pip安装、Docker容器和云平台一键部署,方便用户根据需求选择。
mynlp - 高性能和可扩展的中文自然语言处理工具包
GithubMynlp中文NLP安装开源项目模型词典
mynlp是一个高性能且可扩展的中文自然语言处理工具包,支持通过Maven和Gradle轻松安装。用户可根据需求选择核心词典、词性标注、命名实体识别、拼音切分等模型资源,mylnp-all依赖包涵盖大部分常用资源。该项目参考了多个优秀开源项目并结合多种算法,适用于广泛的应用场景。详情请访问mynlp在线文档。
underthesea - 越南语自然语言处理开源工具包
GithubPythonUnderthesea开源开源项目文本分类越南自然语言处理
越南语自然语言处理开源 Python 工具包,提供简便的 API 和预训练模型,支持词语分割、词性标注、命名实体识别、文本分类和依存句法分析。工具包遵循 GNU 通用公共许可证 v3.0,包含数据集和教程,适用于科研和开发。最新版本支持 LLMs 和基于提示的文本分类功能,用户可以通过 pip 安装。教程涵盖从句子分割到情感分析和语言检测等多种功能。
skweak - Python开源工具助力NLP弱监督学习
GithubNLPskweak开源项目弱监督标注函数聚合模型
skweak是一个基于Python的开源工具包,通过弱监督方法解决NLP中标注数据稀缺问题。用户可定义多个标注函数自动标注文档,并聚合结果生成标注语料库。支持序列标注和文本分类,提供简洁API快速实现标注功能。与SpaCy集成,易于融入现有NLP流程。适用于资源匮乏语言、特定任务标签等场景,是NLP项目的有力助手。
scikit-learn - Python机器学习的核心工具库
GithubPythonscikit-learn开源项目数据科学机器学习
scikit-learn是基于SciPy构建的Python机器学习库,提供高效的数据挖掘和分析工具。支持分类、回归、聚类等多种机器学习任务,自2007年启动以来由志愿者维护,已成为广受欢迎的开源项目。其特点包括易用性、高性能和完善的文档,在学术和工业领域得到广泛应用。
EasyNLP - 综合性易用的NLP工具包,支持大规模预训练模型
EasyNLPGithubNLP工具包分布式训练多模态预训练模型开源项目知识蒸馏
EasyNLP是一个由阿里巴巴发布的自然语言处理工具包,基于PyTorch架构,支持分布式训练和多种NLP算法。它结合知识蒸馏和少样本学习技术,支持大规模预训练模型的部署,并支持CLIP和DALLE等多模态预训练模型,与阿里云PAI平台无缝集成,提供统一的模型训练和部署框架,广泛应用于多个业务场景。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号