opensearch-neural-sparse-encoding-v1

跨平台高效搜索的稀疏检索模型

Lucene倒排索引稀疏检索 Huggingface MS MARCO数据集 Github 开源项目 OpenSearch 模型查询扩展

此开源项目展示了一个学习型稀疏检索模型，通过将查询和文档编码为稀疏向量，提供高效的搜索解决方案。模型在MS MARCO数据集上进行训练，并在BEIR基准测试中展示了优良的搜索相关性与推理速度。支持OpenSearch神经稀疏功能，能与Lucene倒排索引结合，进行高效的索引与搜索。该项目提供多个模型版本，适应不同的数据集与应用需求。使用者能在OpenSearch集群内或通过HuggingFace模型API进行模型的外部运行。

访问官网

Huggingface

介绍相关项目

bge-base-en-v1.5-onnx-Q - BAAI/bge-base-en-v1.5的量化ONNX版本用于文本嵌入和相似度搜索

BAAI/bge-base-en-v1.5FastEmbedGithubHuggingface嵌入模型开源项目文本分类模型相似度搜索

该项目提供了BAAI/bge-base-en-v1.5模型的量化ONNX版本，专注于文本嵌入和相似度搜索。通过FastEmbed库，用户可以轻松生成文本嵌入并进行相似度计算。量化后的模型在保持原有性能的基础上，显著提升了推理速度和资源效率，适用于需要高效文本处理的各种应用场景。

haystack - 用于构建端到端LLM应用程序的高级框架，支持广泛的NLP功能

GithubHaystackLLM开源项目文档检索热门自然语言问答语义搜索

Haystack是一个综合性的LLM框架，能够实现从文档检索到问题回答的多种功能。用户可以灵活选择使用OpenAI、Cohere、Hugging Face等提供的模型，或是自定义部署在各大平台的模型。该框架支持包括语义搜索、答案生成和大规模文档处理等广泛的NLP任务，同时还支持使用现成模型或对其进行微调，基于用户反馈持续优化模型性能。适用于企业级应用开发，帮助用户解决复杂的NLP问题。

colbertv2.0 - 基于BERT的大规模文本快速检索模型

ColBERTGithubHuggingface向量检索开源项目搜索模型模型深度学习自然语言处理

ColBERT v2是一个开源的文本检索模型，基于BERT架构，采用细粒度上下文后期交互技术。它能在毫秒级内对大规模文本集合进行快速准确的搜索，同时保持高质量检索结果。该模型支持索引构建、检索搜索和模型训练等功能，并提供预训练模型和Python API。ColBERT v2在GitHub上持续更新，适用于需要高效文本检索的应用场景。

awesome-semantic-search - 语义搜索与语义相似性全面资源

AIGithubNLPSemantic SearchSemantic SimilarityText Embedding开源项目

综合性语义搜索和相似性资源库，包含多领域的学术论文、工具和数据集，适用于搜索引擎优化和信息检索研究，不仅限于文本，还涵盖图像、语音等应用。

sae - 高效训练语言模型k稀疏自编码器的开源库

这是一个用于训练语言模型k稀疏自编码器(SAE)的开源库。它使用TopK激活函数实现激活稀疏，可扩展至大型模型和数据集，无需额外存储。该库支持加载HuggingFace Hub预训练SAE，提供命令行和编程接口，允许自定义hookpoint训练任意子模块。支持分布式训练，适用于大规模语言模型。

awesome-vector-search - 向量搜索技术资源大全,引擎、框架、库与研究

Apache CassandraFaissGithub向量搜索引擎向量数据库开源项目近似最近邻搜索

本项目汇集了向量搜索领域的综合技术资源，包括框架、引擎、库、云服务和研究论文。内容涵盖Qdrant、Milvus等独立服务，Faiss、ScaNN等库，以及Pinecone、Zilliz Cloud等云服务。此外，收录的研究论文为算法优化提供了理论支持。开发者可借此构建高效搜索应用，研究人员则能深入了解最新算法进展。

MindSearch - 开源AI搜索引擎框架，支持深度知识探索

AI搜索引擎GithubMindSearch人类偏好开源框架开源项目知识发现

MindSearch是一个开源的AI搜索引擎框架，支持Perplexity.ai Pro性能。用户可以使用GPT、Claude等闭源LLM或InternLM2.5-7b-chat等开源LLM，轻松部署类似Perplexity.ai风格的搜索引擎。MindSearch能够解决各种问题，通过浏览数百个网页提供深入的知识，并优化用户界面体验。它通过动态图构建过程，将用户查询分解为多个子问题，逐步扩展搜索图，显著提高响应的深度、广度和准确性。

msmarco-MiniLM-L12-cos-v5 - 用于语义搜索的句子转换和嵌入模型

GithubHuggingfaceMS MARCOMiniLM句子转换器开源项目模型自然语言处理语义搜索

msmarco-MiniLM-L12-cos-v5是一个专为语义搜索设计的句子转换模型，能将文本映射到768维向量空间。该模型在MS MARCO数据集上训练，支持通过sentence-transformers和HuggingFace Transformers两种方式使用。它生成规范化嵌入，适用于多种相似度计算方法，可用于开发高效的语义搜索应用。

ms-marco-TinyBERT-L-6 - 跨编码器在信息检索与重排序中的应用

Cross-EncoderGithubHuggingfaceMS MarcoSentenceTransformers信息检索开源项目模型模型性能

TinyBERT-L-6模型在MS Marco Passage Ranking任务中进行了优化，解决信息检索中的查询与段落排序问题。该模型通过交叉编码器实现高效的信息检索，提升查准率并缩短排序时间。支持Transformers与SentenceTransformers工具使用，简化实现流程，展示良好性能。项目提供详尽的训练代码和性能评估，助力深度学习场景下的信息处理任务优化。

simlm-msmarco-reranker - SimLM预训练的高性能密集段落检索模型

GithubHuggingfaceSimLM信息检索密集段落检索开源项目模型自然语言处理预训练模型

simlm-msmarco-reranker模型采用简单的瓶颈架构,通过自监督预训练压缩段落信息。在MS-MARCO等数据集上表现优异,超越ColBERTv2等多向量方法。该模型仅需无标签语料库即可训练,适用于缺乏标记数据的场景。研究人员可以使用此模型计算查询和段落的相关性得分,应用于信息检索和文本排序任务。

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号