entity-recognition-datasets

多领域实体识别和命名实体识别任务数据集

Entity Recognition Named Entity Recognition Datasets NER Annotations Github 开源项目

此库包含多个领域的实体识别和命名实体识别（NER）任务数据集，包括新闻、社交媒体、医学等。项目提供数据目录和转换代码，部分数据因许可证限制无法直接共享。虽然自2020年起更新较少，但仍接受通过issue或pull request添加的数据集，并支持多种语言的NER数据，如德语、西班牙语和荷兰语等。

文档

bert4ner-base-chinese - 基于BERT的中文命名实体识别模型，具备高精度性能

BertSoftmaxGithubHuggingfacePEOPLEbert4ner中文实体识别开源项目模型

bert4ner-base-chinese项目是一个基于BERT的中文命名实体识别模型，在人民日报数据集上取得了高精度表现。通过BertSoftmax网络结构，能够准确识别文本中的人名、时间等实体信息。可通过nerpy库调用该模型，也支持无外部依赖的直接调用方式，适用于各种自然语言处理应用。

distilbert-base-cased-finetuned-conll03-english - 基于DistilBERT的英语命名实体识别模型

CoNLL-2003DistilBERTGithubHuggingface命名实体识别开源项目模型自然语言处理迁移学习

这是一个基于distilbert-base-cased模型微调的英语命名实体识别(NER)工具。该模型在conll2003英语数据集上训练，对大小写敏感，在验证集上达到98.7%的F1分数。它能够有效识别和分类文本中的人名、地名和组织名等命名实体，为各种自然语言处理任务提供支持。

awesome-emotion-recognition-in-conversations - 对话情感识别的最新研究资源与进展综述

Github对话系统开源项目情感识别机器学习深度学习自然语言处理

本文整理了对话情感识别(ERC)领域的全面论文阅读列表,包括上下文情感分析、讽刺识别和对话行为分类等相关研究。列表涵盖ERC的概述文章、数据集、最新方法及相关任务,为研究人员提供了丰富的参考资源。内容持续更新,欢迎补充相关论文。

bert-spanish-cased-finetuned-ner - 西班牙语BERT模型微调用于命名实体识别

BETOGithubHuggingfaceNER开源项目模型精调西班牙语

通过微调，西班牙语BERT cased模型被优化用于命名实体识别任务。使用CONLL Corpora ES数据集，训练数据包含8700条实例，开发数据2200条。在评估集上F1得分为90.17，表现优于其他多语种和TinyBERT模型。采用Huggingface工具包，便于快速应用。

gliner_medium-v2.1 - 多功能通用型命名实体识别模型GLiNER

GLiNERGithubHuggingface人工智能命名实体识别开源项目机器学习模型自然语言处理

GLiNER是一种基于双向Transformer编码器的命名实体识别模型，可识别任意类型的实体。该模型为资源受限场景提供了实用的替代方案，克服了传统NER模型仅限预定义实体的局限性，同时避免了大型语言模型的高成本问题。GLiNER支持多语言，提供不同规模的版本，安装使用简便。在NER基准测试中表现优异，适用于多种应用场景。

tessdata - Tesseract.js OCR语言数据集综合指南

GithubNPM包OCRTesseract.js开源项目训练数据语言模型

tessdata项目是Tesseract.js的多语言OCR数据集仓库。它提供了LSTM和传统OCR引擎的训练文件，包括默认和替代版本。项目详细说明了各数据集特点、NPM包发布状态，并介绍了通过CDN或本地方式集成到Tesseract.js的方法。这一资源为开发者提供了全面的OCR语言数据集使用指南。

bert_cased_ner - BERT模型驱动的土耳其语命名实体识别工具

BertTurkGithubHuggingfaceMilliyetNER命名实体识别土耳其语开源项目模型自然语言处理

项目开发了一个专门用于土耳其语的BERT命名实体识别模型。该模型基于MilliyetNER新闻语料库训练，可识别人名、地点和组织三类实体。模型表现优异，测试集F1得分达0.96。提供简洁的Python接口，方便研究者和开发者在土耳其语自然语言处理任务中应用。

prodigy-openai-recipes - 结合OpenAI大语言模型与本地Prodigy实例，通过零次和少次学习技术，高效构建高质量数据集的方法

GithubNEROpenAIProdigyspaCytextcat开源项目

该项目展示了如何结合OpenAI大语言模型与本地Prodigy实例，通过零次和少次学习技术，高效构建高质量数据集。用户可以使用该方法进行命名实体识别和文本分类等任务，手动校正模型预测结果以提高数据准确性。项目提供详细的设置指南，帮助用户在本地安装和运行必要的软件，并配置API密钥。通过高效的数据注解流程和灵活的模板设置，用户能够快速获得金标准数据，并训练符合特定需求的监督模型。

Medical-NER - DeBERTa微调的医学命名实体识别模型

DeBERTaGithubHuggingfaceNER模型token-classification医学数据集医疗实体识别开源项目模型

该模型基于DeBERTa在PubMED数据集上微调，可识别41种医学实体，如诊断、症状和治疗。它利用先进的自然语言处理技术从医疗文本中准确提取关键信息，支持临床决策和医学研究。模型可通过Hugging Face推理API或transformers库轻松使用，为医疗信息处理提供了便捷工具。

bcms-bertic-ner - BERTić微调模型实现BCMS语言的高效命名实体识别

BERTićGithubHuggingface命名实体识别巴尔干语言开源项目机器学习模型自然语言处理

bcms-bertic-ner是一个针对波斯尼亚语、克罗地亚语、黑山语和塞尔维亚语(BCMS)的命名实体识别模型。该模型基于BERTić架构，通过多个标准和社交媒体数据集进行微调，可识别人名、地点、组织和其他实体。在开发数据上，模型达到91.38的F1分数，为BCMS语言的自然语言处理任务提供了有力工具。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com