khaiii

Kakao开源的韩语形态素分析工具

khaiii 形态素分析机器学习自然语言处理韩语分析 Github 开源项目

khaiii是Kakao开发的开源韩语形态素分析工具，采用CNN算法实现。该项目结合预分析词典和错误修复技术，在保证准确率的同时提供高效处理速度。支持自定义词典，可用于韩语自然语言处理的基础预处理，适合大规模文本分析场景。

文档

open-korean-instructions - 韩语指令数据集，用于语言模型训练

ChatGPTGPTGithubOpen Korean Instructions开源项目번역 데이터셋한국어

本项目收集了多个开放的韩语指令数据集，用于语言模型训练，包括KoAlpaca和ShareGPT等翻译数据。同时还包含GPT生成的多种数据，以提升模型性能。如有新的数据，请通过PR提交。

KoSimCSE-roberta-multitask - 韩语句子嵌入模型实现高效语义相似度计算

GithubHuggingfaceRoBERTaSimCSE开源项目模型语义相似度韩语句子嵌入预训练模型

KoSimCSE-roberta-multitask是一款开源的韩语句子嵌入模型，主要用于计算句子间的语义相似度。在语义文本相似性测试中，该模型的平均得分达到85.77。项目提供预训练模型和推理代码，方便用户进行句子嵌入和相似度计算。同时，它还为个人训练模型提供环境支持，适用于各种自然语言处理和语义分析任务。

KoSimCSE-roberta - 基于RoBERTa架构的韩语句子相似度预训练模型

GithubHuggingfaceKoSimCSERoBERTa开源项目模型语义相似度韩语句嵌入预训练模型

KoSimCSE-roberta是一个韩语句子向量嵌入预训练模型，基于RoBERTa架构和多任务学习方法构建。在语义文本相似度测试中，模型取得85.77%的评分。模型提供完整的预训练权重和推理环境，可用于计算韩语句子间的语义相似度，支持文本匹配等自然语言处理任务。

koelectra-base-v3-discriminator - 韩语ELECTRA预训练判别器模型

ELECTRAGithubHuggingface分词器判别器开源项目模型韩语预训练模型

koelectra-base-v3-discriminator是第三代韩语ELECTRA预训练语言模型判别器，采用base规模参数配置。模型内置韩语文本处理功能，通过tokenizer实现文本标记化和ID转换，主要应用于文本分类、伪造内容检测等自然语言处理任务。项目采用Apache 2.0许可证开源发布。

ko-gemma-2-9b-it - 韩语大型语言模型，最新版本提升对话生成能力

GemmaGithubHuggingface大型语言模型开源项目文本生成模型谷歌韩国语

Ko-Gemma-2-9B-IT 是基于 Google 技术的韩语对话生成模型，经过精心调整，优化人类反馈，适合各种文本生成任务。

polyglot-ko-12.8b-safetensors - Polyglot-ko 12.8B韩语模型的SafeTensors优化版

EleutherAIGithubHuggingfacePolyglot-kosafetensors开源项目文本生成模型韩语模型

该项目提供EleutherAI开发的Polyglot-ko 12.8B韩语模型的SafeTensors格式优化版。优化版采用1GB的较小分片大小，提高了模型的易用性和部署便捷性。在保持原始性能的同时，优化版显著提升了加载速度和存储效率。这一资源对于从事韩语自然语言处理的研究人员和开发者具有重要价值，可用于各类韩语NLP任务。

roberta-base - 基于大规模韩语数据集的RoBERTa预训练语言模型

GithubHuggingfaceKLUERoBERTa开源项目机器学习模型自然语言处理韩语模型

RoBERTa-base是KLUE（Korean Language Understanding Evaluation）项目开发的韩语预训练模型，基于BertTokenizer分词器构建，支持transformers库直接调用。作为韩语语言理解评估框架的基础模型，主要应用于韩语自然语言处理任务和相关研究工作。

kor - 利用LLM高效提取文本结构化数据

GithubKorLLMLangChainpydantic开源项目数据抽取

Kor是一款原型工具，通过定义数据结构和提供示例，帮助从文本中提取结构化数据。该工具生成提示并发送给指定的LLM进行解析。兼容pydantic v1和v2，支持解析、函数调用和JSON模式等多种抽取方式。适用于精确理解用户请求并与API进行自然语言交互的场景。

koelectra-base-v3-generalized-sentiment-analysis - 基于ELECTRA的韩语情感分析模型实现商品评论智能分类

GithubHuggingfacekoelectratransformers开源项目情感分析文本分类模型自然语言处理

这是一个基于ELECTRA的韩语情感分析模型，专门用于分析商品评论的情感倾向。模型采用Transformers库实现，可轻松集成到各种应用中。它能准确识别正面和负面评论，并提供置信度分数。该模型提供简单易用的API，方便开发人员快速部署情感分析功能，有助于企业更深入地理解客户反馈。

nlp-lang - 自然语言处理工具包，提供词语标准化、汉字转拼音等功能

GithubViterbi算法nlp-lang开源项目自然语言处理词语标准化词频统计

该项目封装了常用的自然语言处理工具和组件，如词语标准化、tire树结构、文本断句、html标签清理、Viterbi算法等。组件还包括汉字转拼音、简繁体转换、bloomfilter、指纹去重、SimHash相似度计算、词共现统计、内存搜索提示和WordWeight统计等。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com