anserini

开源可复现信息检索研究工具包

Anserini 信息检索 Lucene 回归实验 MS MARCO Github 开源项目

Anserini是基于Lucene开发的开源信息检索工具包,致力于推动可复现的学术研究。该工具包提供从索引构建到结果评估的端到端实验支持,实现了BM25、doc2query-T5、SPLADE等多种先进检索模型。Anserini可应用于各类标准IR测试集,有助于缩小信息检索研究与实际搜索应用之间的差距。

访问官网

Github

介绍相关项目

timesearch - Reddit内容归档与分析的多功能工具集

GithubPushshift APIReddit数据抓取timesearch开源项目数据库离线阅读

timesearch是一套专门用于Reddit内容归档和分析的工具集。它可以获取子版块和用户的历史帖子及评论，实时监控新内容，下载样式和Wiki页面。该工具还能生成离线阅读HTML，创建索引和进行数据统计。通过结合使用Pushshift API和Reddit API，timesearch能够获取更全面的历史数据，突破了Reddit自身API的限制。这个开源项目为Reddit内容研究和分析提供了便捷的解决方案。

astra - 高性能云原生数据搜索与分析平台

AstraGithubKubernetes支持云原生搜索引擎全文搜索开源项目日志分析

Astra是一款云原生搜索和分析引擎，专门针对日志、追踪和审计数据设计。该引擎易于部署和管理，具有高成本效益，可扩展至PB级数据规模。Astra提供全文搜索功能，优先处理最新数据，并为Kubernetes和Grafana提供原生支持。它还具备自动扩展、多租户和零数据丢失等特性，可作为大多数Opensearch日志用例的替代方案。

refinery - 自然语言数据管理和标注的开源解决方案

GithubKern AIrefinery人工智能开源开源项目自然语言处理

开源工具refinery帮助数据科学家管理和提升自然语言处理项目的数据质量。通过半自动化标注和数据监控，提高数据标注效率。支持Hugging Face和spaCy集成，提升处理速度与质量。旨在优化单人开发者与团队的协作，确保训练数据的可靠管理，并提供多语言文本的新分析视角，使NLP模型构建更加快捷高效。

RetroMAE - 创新的检索导向语言模型预训练技术

BERTGithubRetroMAE信息检索开源项目自然语言处理预训练模型

RetroMAE是一种创新的检索导向语言模型预训练方法。通过掩码自编码器技术，该方法在MS MARCO和BEIR等基准测试中取得了显著性能提升。项目开源了预训练模型和微调工具，并提供了详细使用说明。RetroMAE在监督检索任务中表现卓越，同时展现出优秀的零样本迁移能力，为信息检索研究带来新的突破。项目提供了多个预训练模型，包括在维基百科和图书语料上预训练的基础版本，以及在MS MARCO数据集上微调的特定版本。研究人员可以通过Hugging Face轻松加载这些模型，进行实验或进一步改进。

msmarco-MiniLM-L6-en-de-v1 - MSMARCO跨语言文本重排序模型支持英德双向检索

GithubHuggingfaceMS MARCO信息检索开源项目性能评估搜索排序模型跨语言模型

这是一个基于MS MARCO数据集训练的跨语言文本重排序模型，支持英语和德语文本的相关性排序。模型可处理英语-英语、德语-英语和德语-德语的文本匹配任务。在TREC-DL19和GermanDPR基准测试中表现出色，处理速度可达每秒1600个文档对。兼容SentenceTransformers和Transformers框架，为跨语言信息检索应用提供了高效方案。

daisyRec - 开源推荐系统评估和基准测试框架

GithubPython工具包协同过滤基准测试开源项目推荐系统深度学习

daisyRec是一个支持多维度公平比较的Top-N推荐任务基准测试框架。该开源工具整合了传统和深度学习推荐算法，支持CUDA加速和多个公开数据集。通过提供GUI命令生成器和严格的评估标准，daisyRec致力于推动推荐系统研究的可复现性和公平比较。

torrentinim - 低资源占用的开源种子搜索引擎和爬虫

APIGithubTorrentinim开源项目爬虫种子搜索引擎自托管

Torrentinim是一款开源的种子搜索引擎和爬虫，具有API驱动和低内存占用特点。支持Linux、Mac和Windows平台，可爬取多个索引站点的种子和磁力链接。设计简单易用，下载即可运行，平均RAM使用仅24MB。提供JSON搜索接口，支持eztv、1337x、nyaa等多个种子网站。Torrentinim高性能、低占用，是理想的自托管种子搜索解决方案。

sensei - AI驱动的智能问答引擎提供精准答案

AI搜索引擎FastAPIGithubNext.jsSensei Search开源大语言模型开源项目

Sensei Search是一款基于AI技术的智能问答引擎，集成多种先进的大型语言模型。采用现代web技术构建，支持本地和云端部署，提供快速、准确的信息检索和问题解答服务。能够处理日常查询和复杂问题，提供智能化的解决方案。这个开源项目结合了先进的AI搜索和问答技术，为用户提供全面的信息检索体验。

splade-v3 - SPLADE-v3稀疏神经信息检索模型的最新进展

GithubHuggingfaceSPLADE信息检索开源项目文本检索机器学习模型自然语言处理

SPLADE-v3是SPLADE系列的最新稀疏神经信息检索模型，基于SPLADE++SelfDistil优化而来。该模型采用KL散度和MarginMSE混合损失函数，每次查询选取8个负样本进行训练。在性能方面，SPLADE-v3在MS MARCO开发集上达到40.2的MRR@10分数，BEIR-13测试中获得51.7的平均nDCG@10。这一成果为稀疏神经信息检索领域树立了新标准。研究人员可以通过GitHub平台获取并应用SPLADE-v3模型，以提升信息检索效果。

alexandria - 高效全文索引与哈希表的开源搜索引擎

AlexandriaDockerGithub开源项目构建指南测试套件调试

Alexandria开源搜索引擎项目聚焦高效全文索引和哈希表技术，提供详细文档和多种构建方式。支持Docker容器化和手动构建，配备完整测试套件保障质量。项目为开发者提供了深入研究和参与搜索引擎开发的平台，是搜索技术学习和创新的重要资源。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号