small-text

Small-Text：Python中的文本分类主动学习工具

small-text 积极学习文本分类 Python sklearn Github 开源项目

Small-Text 是一个前沿的文本分类主动学习工具，支持多种查询策略、初始化策略和停止准则，用户可以灵活组合使用。工具支持 GPU 加速的 Pytorch 模型和 transformers 集成，适用于复杂文本分类任务，同时也支持 CPU 的轻量安装。科学验证的组件和详细文档使无论是试验还是实际应用，都变得更简单。要求 Python 3.7 或更高版本，支持 CUDA 10.1 或更新版本。如需了解更多，请访问其文档和安装指南。

Github

介绍相关项目

HarvestText - 开源文本处理和分析工具，支持无监督方法和领域知识整合

GithubHarvestTextPython开源项目文本预处理无监督方法自然语言处理

HarvestText 是一个开源文本处理与分析工具，专注于无（弱）监督方法，能够整合领域知识，高效处理和分析特定领域文本。主要功能包括精细分词、文本清洗、实体链接、命名实体识别和依存句法分析等，并支持情感分析、关系网络构建、文本摘要及信息检索等高级应用。广泛应用于小说分析、网络文本及专业文献处理，具备高效灵活的特点。

scikit-llm - 无缝集成大型语言模型到Scikit-Learn，提升文本分析能力

ChatGPTGithubScikit-LLM开源软件开源项目文本分析机器学习

Scikit-LLM通过将ChatGPT等强大语言模型无缝集成到Scikit-Learn中，增强文本分析任务效果。该工具支持零样本文本分类，并提供简单的Python代码实现快速部署。项目为数据科学家和开发者提供高效的文本分析解决方案，支持快速安装和详细文档，社区反馈和支持也是其重要组成部分。

fastc - 轻量级文本分类工具适用于内存受限环境

Githubfastc嵌入模型开源项目文本分类机器学习自然语言处理

fastc是一款为CPU环境优化的文本分类工具，专为内存受限场景设计。它采用高效蒸馏模型生成嵌入，结合逻辑回归或最近质心方法实现快速分类。该工具支持多分类器并行执行，具备模型训练、保存、加载和发布功能，并提供推理服务器部署选项。fastc为开发者提供了一个全面且高效的文本分类解决方案。

textdistance - Python文本距离和相似度计算库

GithubPython库TextDistance字符串比较开源项目相似度计算算法

TextDistance是一个计算序列距离和相似度的Python库。它实现了30多种算法,包括编辑距离、基于令牌、基于序列、基于压缩和语音等类型。该库支持纯Python实现,可比较多个序列,并提供NumPy加速选项。TextDistance接口简单灵活,适用于各种文本分析和字符串比较任务。

botpress_Vaganet_new_model - 高效的少样本学习技术提升多语言文本分类精度

GithubHuggingfaceLogistic回归SetFit句子转换器对比学习开源项目文本分类模型

SetFit模型结合sentence-transformers的微调与LogisticRegression，实现88.97%的文本分类准确率，支持在多语言环境下进行34类文本分类，具备少样本学习能力，是资源有限条件下的高效选择。

TextAttack - 为NLP模型生成对抗样本和进行数据增强的专业工具

GithubNLPTextAttack对抗样本开源项目数据增强模型训练

TextAttack是一个专为自然语言处理（NLP）提供对抗攻击、数据增强和模型训练的Python框架。通过多种预定义攻击策略，用户可以更好地理解和研究NLP模型。TextAttack支持简便的命令行操作和广泛的模型与数据集，提供详细的文档和示例代码，帮助提高模型的泛化能力和鲁棒性。

e5-small-v2 - 轻量级多语言嵌入模型用于语义搜索和自然语言处理

GithubHuggingfaceMTEBsentence-transformers开源项目文本相似度模型模型评估自然语言处理

e5-small-v2是一款轻量级多语言嵌入模型，适用于语义搜索和自然语言处理任务。该模型在MTEB基准测试中表现优异，涵盖文本分类、检索、聚类和语义相似度等多个领域。尽管体积小巧，e5-small-v2仍能有效处理多种语言，为开发者提供了一个高效且多用途的嵌入解决方案。

simpletransformers - 快速构建和优化Transformer模型的开源工具

GithubHugging FaceNLPSimple Transformers开源项目机器学习深度学习

simpletransformers是一个基于Hugging Face Transformers的开源工具,通过简化的API让用户能够用少量代码快速构建和优化Transformer模型。该库支持文本分类、命名实体识别、问答系统等多种NLP任务,为研究人员和开发者提供了便捷的方式来应用这些强大的模型。simpletransformers具有直观的接口和丰富的功能,可用于各类自然语言处理场景,有效降低了使用Transformer模型的门槛。

text2vec-base-multilingual - 多语言文本嵌入与分类模型

GithubHuggingfacesentence-transformers多语言开源项目文本分类模型聚类自然语言处理

text2vec-base-multilingual是一个多语言文本嵌入和分类模型，支持中文、英文、德文等语言。该模型在句子相似度、文本分类等任务中表现良好，适用于多种自然语言处理应用。在MTEB基准测试中，它展示了跨语言处理能力，可用于多语言文本数据分析。

bert-classification-tutorial - BERT与Transformers库实现的新闻文本分类项目

BERTGithub开源项目文本分类深度学习自然语言处理预训练语言模型

这是一个基于BERT模型的现代化文本分类实现项目。项目采用最新的Python、PyTorch和Transformers库，为自然语言处理任务提供了高质量模板。完整流程涵盖数据准备、模型训练和评估，并具有清晰的代码结构和详细说明。虽然主要针对livedoor新闻语料库的分类任务，但也易于适应其他文本分类需求。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能，包括文生视频、动态画面和形象生成等，帮助用户快速上手，创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台，用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品，帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型，为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能，满足事务性工作的高频需求，帮助撰稿人节省精力，提高效率，优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号