semchunk: 快速轻量的文本语义分块Python库

semchunk

semchunk简介

semchunk是一个快速、轻量级的纯Python库,专门用于将文本分割成语义连贯的块。它由Umar Butler开发,并在GitHub上开源。semchunk的核心功能是能够智能地将长文本切分成大小适中、语义完整的片段,这对于很多自然语言处理任务来说都是非常有用的预处理步骤。

与其他文本分割工具相比,semchunk在速度和语义准确性方面都表现出色。根据开发者的测试,semchunk在语义分割的准确性上优于LangChain的RecursiveCharacterTextSplitter,同时在处理速度上比semantic-text-splitter快90%以上。这种优异的性能使semchunk成为处理大规模文本数据的理想选择。

semchunk logo

安装和基本使用

semchunk可以通过pip轻松安装:

pip install semchunk

使用semchunk进行文本分块非常简单。以下是一个基本的示例:

import semchunk

chunker = semchunk.chunkerify('gpt-4', chunk_size=512)
text = "这是一段长文本..."
chunks = chunker(text)

在这个例子中,我们首先创建了一个"chunker"函数,指定使用GPT-4的tokenizer和512个token的块大小。然后,我们可以直接将文本传入这个函数,得到分割后的文本块列表。

核心功能与特性

1. 灵活的tokenizer选择

semchunk支持多种tokenizer,包括:

OpenAI模型的tokenizer (如GPT-4, GPT-3.5等)
Hugging Face的tokenizer
tiktoken编码器
自定义的token计数函数

这种灵活性使得semchunk能够适应各种不同的应用场景和模型要求。

2. 智能的分块算法

semchunk采用了复杂而高效的分块算法,能够在保持语义完整性的同时实现快速处理。它的工作原理包括:

使用最具语义意义的分隔符拆分文本
递归地分割chunks,直到所有chunks都小于或等于指定的大小
合并小于指定大小的chunks
重新附加非空白分隔符到chunks的末尾

这个过程确保了分割后的文本块既符合大小要求,又保持了语义的连贯性。

3. 多进程支持

对于大规模文本处理任务,semchunk提供了多进程支持,可以显著提高处理速度:

chunks = chunker([text1, text2, text3], processes=4)

通过设置processes参数,用户可以轻松利用多核处理器的优势。

4. 进度显示

在处理大量文本时,semchunk可以显示进度条,方便用户了解处理进度:

chunks = chunker([text1, text2, text3], progress=True)

这个特性在处理耗时较长的任务时特别有用。

Progress bar

技术原理深度解析

semchunk的高效性主要来源于其独特的分块算法。这个算法按照以下优先顺序使用分隔符:

最大的换行符序列
最大的制表符序列
最大的空白字符序列
句子终止符 (如 ., ?, !, *)
从句分隔符 (如 ;, ,, (, ), [, ] 等)
句子中断符 (如 :, —, …)
单词连接符 (如 /, \, –, &, -)
其他所有字符

这种层次化的分割策略确保了文本在语义上的连贯性,同时也保证了分割的效率。

性能对比

semchunk的性能表现令人印象深刻。在处理NLTK的Gutenberg语料库时(包含18个文本,共3,001,260个token),semchunk仅用了6.69秒就完成了将所有样本分割成512个token长的块的任务。相比之下,semantic-text-splitter完成同样的任务需要116.48秒,semchunk的速度提升了94.26%。

这种显著的性能优势使semchunk成为处理大规模文本数据的理想选择,特别是在需要快速预处理或实时处理的场景中。