Project Icon

simple

SQLite全文检索扩展:支持中文和拼音搜索

Simple是一个SQLite FTS5扩展,为中文和拼音全文检索提供支持。该项目实现了微信移动端的多音字检索方案,并集成了cppjieba以提高词组匹配精度。它具备自动构建匹配查询、连续高亮匹配词、返回匹配位置等功能。Simple适用于各类需要在SQLite中实现中文搜索的应用,兼容多种编程语言和平台。

[!提示] 新增:Rust Crate!感谢 xuxiaocheng0201

下载量 构建状态 代码覆盖率 代码质量 许可证:MIT

Simple 分词器

Simple 是一个支持中文和拼音的 sqlite3 fts5 扩展。它完整实现了 微信移动端的全文检索多音字问题解决方案 一文中的方案四,非常简单和高效地支持中文及拼音的搜索。

实现相关介绍:https://www.wangfenjin.com/posts/simple-tokenizer/

在此基础上,我们还支持通过 cppjieba 实现更精准的词组匹配,介绍文章见 https://www.wangfenjin.com/posts/simple-jieba-tokenizer/

使用方法

代码使用

命令行使用

首先需要确认你使用的 SQLite 版本支持 fts5 扩展,确认方法是:

select fts5(?1);

然后就可以使用了,具体示例可以参考 example.sqlcpp

$ ./sqlite3
SQLite 版本 3.32.3 2020-06-18 14:00:33
输入 ".help" 获取使用提示。
已连接到临时内存数据库。
使用 ".open FILENAME" 重新打开持久性数据库。
sqlite> .load libsimple
sqlite> CREATE VIRTUAL TABLE t1 USING fts5(text, tokenize = 'simple');
sqlite> INSERT INTO t1 VALUES ('中华人民共和国国歌');
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match simple_query('中华国歌');
[中华]人民共和[国国歌]
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match jieba_query('中华国歌');
[中华]人民共和国[国歌]
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match simple_query('中华人民共和国');
[中华人民共和国国]歌
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match jieba_query('中华人民共和国');
[中华人民共和国]国歌

功能

  1. simple tokenizer 支持中文和拼音的分词,并且可通过开关控制是否需要支持拼音
  2. simple_query() 函数实现自动组装 match query 的功能,用户不用学习 fts5 query 的语法
  3. simple_highlight() 实现连续高亮 match 的词汇,与 sqlite 自带的 highlight 类似,但是 simple_highlight 实现了连续 match 的词汇分到同一组的逻辑,理论上用户更需要这样
  4. simple_highlight_pos() 实现返回 match 的词汇位置,用户可以自行决定怎么使用
  5. simple_snippet() 实现截取 match 片段的功能,与 sqlite 自带的 snippet 功能类似,同样是增强连续 match 的词汇分到同一组的逻辑
  6. jieba_query() 实现结巴分词的效果,在索引不变的情况下,可以实现更精准的匹配。可以通过 -DSIMPLE_WITH_JIEBA=OFF 关闭结巴分词的功能 #35
  7. jieba_dict() 指定字典目录,只需要调用一次,需要在调用 jieba_query() 之前指定。

开发

编译相关

使用支持 c++14 及以上的编译器编译,直接在根目录运行 ./build-and-run 就会编译所有需要的文件并运行测试。编译输出见 output 目录

也可以手动使用 cmake:

mkdir build; cd build
cmake ..
make -j 12
make install

支持 iOS 编译:

./build-ios.sh

代码

  • src/entry 入口文件,注册 sqlite tokenizer 和函数
  • src/simple_tokenizer 分词器实现
  • src/simple_highlight 高亮函数,基于内置的高亮函数改进,让命中的相邻单词连续高亮
  • src/pinyin 中文转拼音以及拼音拆 query 的实现

待办事项

  • 添加 CI/CD
  • 添加使用示例,参见 cpp python3
  • 部分参数可配置,比如拼音文件的路径(已经把文件打包到 so 中)
  • 减少依赖,减小 so 的大小
  • 给出性能数据:加载扩展时间2ms内;第一次使用拼音功能需要加载拼音文件,大约 500ms;第一次使用结巴分词功能需要加载结巴分词文件,大约 4s。

Star 历史

Star 历史图表

项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号