#分词

Kagome: 强大而灵活的日语形态素分析器

3 个月前
Cover of Kagome: 强大而灵活的日语形态素分析器

PyHanLP: 强大的中文自然语言处理工具包

3 个月前
Cover of PyHanLP: 强大的中文自然语言处理工具包

SentencePiece: 革新自然语言处理的无监督文本分词利器

3 个月前
Cover of SentencePiece: 革新自然语言处理的无监督文本分词利器

NLP中的Tokenizer:文本分词的关键技术

3 个月前
Cover of NLP中的Tokenizer:文本分词的关键技术

wink-nlp-utils: 强大的自然语言处理工具库

3 个月前
Cover of wink-nlp-utils: 强大的自然语言处理工具库

深入探讨Synonyms:中文近义词工具包的原理与应用

3 个月前
Cover of 深入探讨Synonyms:中文近义词工具包的原理与应用
相关项目
Project Cover

ltp

LTP(Language Technology Platform)提供中文分词、词性标注、句法分析和命名实体识别等自然语言处理功能。通过多任务框架和共享预训练模型进行优化,显著提升性能。LTP支持快速的感知机算法推理和高精度的深度学习分析,并在Huggingface Hub上提供预训练模型下载。最新版LTP v4.2.0优化了结构,并支持用户自定义模型训练和上传,提高了灵活性和实用性。

Project Cover

Synonyms

Synonyms是一个开源的中文近义词工具包,用于自然语言处理任务。它支持文本对齐、相似度计算、语义偏移和关键词提取等功能。该工具包基于大规模词向量模型,覆盖43万余词汇,适用于聊天机器人、问答系统、推荐系统等场景。Synonyms提供词语和句子相似度计算API,可用于多种NLP应用。

Project Cover

tokenizer

Tokenizer是一个纯Go语言实现的自然语言处理分词库,支持Word level、Wordpiece和BPE等多种分词模型。该项目可用于训练新模型或微调现有模型,并兼容HuggingFace预训练模型。Tokenizer为Go开发者提供了构建NLP应用所需的工具,助力高效生产级软件开发。

Project Cover

pyhanlp

pyhanlp是HanLP1.x的Python接口,支持中文分词、词性标注、命名实体识别、依存句法分析等多种NLP任务。项目提供自动下载升级功能,算法经工业界和学术界验证。配套《自然语言处理入门》书籍,支持命令行和API调用,适合NLP研究和工程应用。

Project Cover

wink-nlp-utils

wink-nlp-utils是一个轻量级自然语言处理工具集,提供36多个实用函数。支持姓名提取、语料库生成、句子分割、分词和停用词移除等功能。适用于语义搜索和文本分类等任务的预处理,为开发人员提供简洁API。该项目是wink开源家族的一员,专注于文本预处理和分析,在npm上可用,具有完整的文档和测试覆盖率。支持Node.js环境。

Project Cover

sentencepiece

SentencePiece是一种用于神经网络文本生成系统的无监督分词工具。它支持多种子词算法,如BPE和unigram语言模型,可直接从原始文本训练。这个工具具有语言无关性,实现了子词正则化,运行速度快,占用资源少。SentencePiece能直接生成词汇ID序列,执行NFKC标准化,是一个完全端到端的系统,无需依赖特定语言的预处理或后处理。

Project Cover

subword-nmt

subword-nmt是一个文本子词分割预处理工具,主要应用于神经机器翻译领域。它实现了字节对编码(BPE)等算法,具备多语言联合学习、词汇过滤和BPE dropout等功能。该工具支持pip安装,提供命令行接口,适用于各类NMT任务,可有效处理罕见词。

Project Cover

kagome

Kagome是一个用Go语言开发的开源日语形态素分析工具。它支持将MeCab-IPADIC和UniDic等多种词典嵌入二进制文件,并提供普通、搜索和扩展三种分词模式。Kagome可通过命令行、服务器或WebAssembly方式使用,具有性能高、易于集成和跨平台等特点,适用于各种日语文本处理任务。

Project Cover

ParsiAnalyzer

ParsiAnalyzer是一个为Elasticsearch开发的波斯语分析插件。该插件提供文本分词、标准化和词干提取等功能,专门处理波斯语的独特特征。它能将空格转换为零宽连接符,标准化波斯语标点和数字,移除变音符号,并去除常见停用词。ParsiAnalyzer易于集成,可提高Elasticsearch中波斯语文本的搜索和分析质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号