anserini
Anserini是基于Lucene开发的开源信息检索工具包,致力于推动可复现的学术研究。该工具包提供从索引构建到结果评估的端到端实验支持,实现了BM25、doc2query-T5、SPLADE等多种先进检索模型。Anserini可应用于各类标准IR测试集,有助于缩小信息检索研究与实际搜索应用之间的差距。
ik-analyzer
ik-analyzer是一个Maven化的中文分词器项目,专为中文分词优化词典。该项目支持Lucene 5至9全系列版本,已发布至Maven Central方便集成。除Java实现外,还提供Rust版本,为开发者提供更多选择。