Project Icon

fastText

高效词向量学习和文本分类库

fastText是Facebook开发的开源自然语言处理库,专注于高效词向量学习和文本分类。它支持157种语言,利用子词信息丰富词向量表示,并采用多种技巧提升分类性能。该库易用且训练速度快,适合大规模文本处理。fastText还提供模型量化功能,可大幅压缩模型体积,便于部署。

small-text - Small-Text:Python中的文本分类主动学习工具
GithubPythonsklearnsmall-text开源项目文本分类积极学习
Small-Text 是一个前沿的文本分类主动学习工具,支持多种查询策略、初始化策略和停止准则,用户可以灵活组合使用。工具支持 GPU 加速的 Pytorch 模型和 transformers 集成,适用于复杂文本分类任务,同时也支持 CPU 的轻量安装。科学验证的组件和详细文档使无论是试验还是实际应用,都变得更简单。要求 Python 3.7 或更高版本,支持 CUDA 10.1 或更新版本。如需了解更多,请访问其文档和安装指南。
NLP-Natural-Language-Processing - 全面的自然语言处理资源与工具库
GithubNatural Language Processing开源项目数据科学机器学习深度学习计算机视觉
提供全面的自然语言处理(NLP)资源,涵盖数据集、前沿技术、课程、书籍推荐、GitHub代码示例及流行工具。涉及数据分析、知识图谱、模型与算法、情感分析、主题建模等任务的详细资料与学习路径。了解最新NLP动态,探索自然语言处理的应用潜力。
setfit - SetFit高效小样本学习框架,支持多语言文本分类
GithubHugging Face HubSetFit多语言支持少量标签数据开源项目无需提示
SetFit是一种高效且无需提示的小样本微调框架,利用Sentence Transformers实现高准确度的小样本学习。不需要手工制作提示或语言模型转换器,直接从文本示例生成丰富嵌入,大大提高训练速度。在仅有少量标记数据的情况下,SetFit的精度可与大型模型相媲美。例如,针对客户评论情感数据集,仅使用每类8个标记样本就能达到RoBERTa Large的全量训练精度。支持多语言文本分类,兼容Hugging Face Hub,训练和推理过程简单直观,是一个高效实用的选择。
text2vec-base-multilingual - 多语言文本嵌入与分类模型
GithubHuggingfacesentence-transformers多语言开源项目文本分类模型聚类自然语言处理
text2vec-base-multilingual是一个多语言文本嵌入和分类模型,支持中文、英文、德文等语言。该模型在句子相似度、文本分类等任务中表现良好,适用于多种自然语言处理应用。在MTEB基准测试中,它展示了跨语言处理能力,可用于多语言文本数据分析。
text2text - 跨语言文本处理的综合工具包
GithubText2Text开源项目文本生成自然语言处理语言翻译跨语言模型
提供跨语言文本生成、翻译、嵌入和问答等功能的NLP工具包,支持百种语言。可在Google Colab平台免费运行,适用学术研究、企业应用和个性化开发。通过示例和快速入门指南,用户能快速掌握强大的多语言模型,高效处理文本。
vectorflow - 高效、容错的开源码向量嵌入处理流程
API端点GithubVectorFlow向量嵌入开源开源项目高吞吐量
VectorFlow 提供高效、可靠的 API 端点,能够快速处理和存储大量原始数据的向量嵌入。支持多种文本格式(如 TXT、PDF、HTML、DOCX),推荐在生产环境中使用 Kubernetes 部署。用户可以通过 Python 客户端或 Docker-Compose 快速本地运行。项目当前为 MVP 版本,具备重试功能、集成 AWS S3 和自定义块校验 Webhook 等特性。访问官方文档或加入社区以了解更多信息及使用案例。
text_classifier_tf2 - 多模型文本分类框架 支持TextCNN、BERT等
Github开源项目文本分类模型部署深度学习模型训练方法评估指标
该开源项目提供基于TensorFlow 2的多模型文本分类框架。支持TextCNN、TextRNN、BERT等模型,集成词向量增强、对抗训练、对比学习等功能。框架适用于二分类和多分类任务,提供灵活配置选项。项目还包含交互式预测和批量测试工具,便于分析模型性能和错误案例。
fnet-base - FNet模型采用傅里叶变换实现高效自然语言处理
FNetGLUE benchmarkGithubHuggingface傅里叶变换开源项目模型模型预训练自然语言处理
FNet是一种创新型自然语言处理模型,通过傅里叶变换替代传统注意力机制,提高了计算效率。该模型在C4数据集上预训练,采用掩码语言建模和下一句预测任务。在GLUE基准测试中,FNet达到BERT模型93%的性能,微调速度快32%。这种架构为大规模文本处理应用提供了高效选择。
spark-nlp - 高效自然语言处理与大规模语言模型开源库
Apache SparkGithubSpark NLP开源项目机器学习自然语言处理预训练模型
Spark NLP 是一个基于 Apache Spark 的开源库,提供高效且准确的自然语言处理注释,支持机器学习管道的分布式扩展。该库包含超过 36000 个预训练管道和模型,支持 200 多种语言,涵盖分词、词性标注、嵌入、命名实体识别、文本分类、情感分析、机器翻译等任务。兼容 BERT、RoBERTa 等主流变压器模型,支持 Python、R、Java、Scala 和 Kotlin。
Pytorch-RNN-text-classification - RNN短文本分类模型 支持多类别高效处理
GithubLSTMPyTorchRNN开源项目短文本分类词嵌入
Pytorch-RNN-text-classification是一个多类别短文本分类模型,基于RNN架构设计。该项目使用Pytorch实现,集成词嵌入、LSTM(或GRU)和全连接层。模型支持GloVe预训练词向量,采用交叉熵损失函数和Adam优化器。通过零填充和PackedSequence技术处理mini-batch,提高训练效率。项目包含数据预处理和训练脚本,方便研究人员快速应用于实际文本分类任务。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能,包括文生视频、动态画面和形象生成等,帮助用户快速上手,创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台,用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品,帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型,为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能,满足事务性工作的高频需求,帮助撰稿人节省精力,提高效率,优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号