cde-small-v1

增强文本分类与信息检索能力的多任务模型

MTEB 分类聚类检索 Huggingface 句子嵌入 Github 开源项目模型

该项目在多任务环境下表现优异，尤其在文本分类与检索任务中。模型在多个数据集上表现出高准确率与精度，广泛适用于商业、教育与研究领域。其卓越的性能满足了对高精确度的需求，提供了一致而可靠的结果。

Huggingface

介绍相关项目

Multimodal-Toolkit - 通用多模态数据与文本特征融合工具包

GithubHuggingFace TransformersMultimodal TransformersPython分类任务回归任务开源项目

一个用于分类和回归任务的工具包，结合HuggingFace Transformers的文本特征与表格数据，生成多模态特征以提高模型性能。该工具包支持多种模型和组合方法，提供详尽的示例和数据集，包括BERT、ALBERT等模型，以及电商评论、Airbnb数据和宠物领养预测等实际应用。

contextualized-topic-models - 多语言支持的上下文话题模型工具，适用于零样本学习

BERTCombinedTMContextualized Topic ModelsGithubSBERTZeroShotTM开源项目

提供先进的上下文字话题模型工具，支持BERT等预训练语言模型，适用于多语言和零样本学习。CTM包含CombinedTM和ZeroShotTM两大主要模型，能适应不同任务需求。通过结合上下文嵌入和词袋模型，CTM能够生成更具连贯性的主题。项目还提供Kitty子模块用于人机交互文档分类，并附有详细教程和文档，帮助用户快速上手，提升话题建模效果。

classifier-multi-label - 基于BERT的多标签文本分类算法实现

BERTGithubSeq2SeqTextCNNtf.nn.softmax_cross_entropy_with_logits多标签分类开源项目

本项目介绍了如何使用BERT结合TextCNN、Denses、Seq2Seq等多种算法实现多标签文本分类。涵盖了模型结构、损失函数和解码方法等细节，展示了不同方法在推理速度和分类效果上的表现，提供了实验数据和结论，帮助开发者选择最佳解决方案。

pytextclassifier - PyTextClassifier：支持多种文本分类和聚类算法的高性能工具库

GithubPyTextClassifier开源工具包开源项目文本分类聚类算法自适应文本分析

PyTextClassifier是一款高性能的Python工具库，提供多种文本分类和聚类算法，支持二分类、多分类、多标签分类和Kmeans聚类。适用于情感分析和文本风险分类，设计简明易用，算法高效清晰。支持句子和文档级的文本任务，兼容英文和中文文本。包含FastText、TextCNN、TextRNN和BERT等深度学习模型，适合各类生产环境。

BCEmbedding - 双语跨语言嵌入模型提升检索增强生成效果

BCEmbeddingGithubRAG双语开源项目语义表示跨语言

BCEmbedding是一款双语和跨语言嵌入模型，针对检索增强生成(RAG)任务进行优化。该模型包含EmbeddingModel和RerankerModel两个组件，分别用于语义向量生成和搜索结果优化。BCEmbedding在中英文语义表示和RAG评估中展现出优异性能，支持多语言和多领域应用。该项目提供了便捷的API接口，可直接集成到RAG系统中，已在实际产品中得到应用验证。

MiniCPM - 轻量级大语言模型实现高性能端侧部署

GithubMiniCPM多模态开源模型开源项目模型量化端侧大语言模型

MiniCPM是一系列高效的端侧大语言模型，仅有2.4B非词嵌入参数。经过优化后，在多项评测中表现优异，甚至超越了一些参数量更大的模型。该项目支持多模态功能，可在移动设备上流畅运行。MiniCPM开源了多个版本，涵盖文本、多模态、量化和长文本等应用场景，适用于学术研究和特定商业用途。这一开源项目由面壁智能与清华大学自然语言处理实验室联合开发。

CEPE - 并行编码框架助力语言模型处理长文本

CEPEGithubLLaMA上下文扩展并行编码开源项目长文本语言建模

CEPE是一个扩展语言模型上下文窗口的开源框架,采用并行编码方法处理长文本输入。该项目提供数据预处理、模型训练和基线评估的完整代码,并发布了可通过Hugging Face使用的预训练模型。CEPE在语言建模和开放域问答等任务中表现优异,为处理长文本提供了高效解决方案。

stella - 支持长文本的通用中文文本编码模型

C-MTEBGithubstella模型中文文本编码向量嵌入开源项目长文本处理

stella是一个通用中文文本编码模型，提供base和large两个版本，支持1024长度输入。模型采用多样化训练数据和先进方法，包括对比学习、难负例处理和EWC技术。在C-MTEB基准测试中表现优异，特别是长文本编码能力突出。适用于文本分类、聚类和检索等多种自然语言处理任务。

fastc - 轻量级文本分类工具适用于内存受限环境

Githubfastc嵌入模型开源项目文本分类机器学习自然语言处理

fastc是一款为CPU环境优化的文本分类工具，专为内存受限场景设计。它采用高效蒸馏模型生成嵌入，结合逻辑回归或最近质心方法实现快速分类。该工具支持多分类器并行执行，具备模型训练、保存、加载和发布功能，并提供推理服务器部署选项。fastc为开发者提供了一个全面且高效的文本分类解决方案。

BERTopic - 高效的Transformers主题建模，支持多种模式

BERTopicGithubPythonc-TF-IDFtransformers主题建模开源项目

BERTopic是一种利用Transformers和c-TF-IDF进行主题建模的技术，能够生成易于解释的密集主题聚类，同时保留关键词描述。该项目支持多种主题建模方法，如有监督、半监督和无监督模式，具有模块化和高扩展性。丰富的可视化功能和多种表示方法进一步支持深入分析。BERTopic还兼容多种嵌入模型，并支持多语言处理，适应不同应用场景。

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com