sycamore
Sycamore是一个开源的AI文档处理引擎,针对ETL、RAG和LLM应用。它具备处理和丰富各类文档(如报告、幻灯片和手册)的能力,特别在PDF和嵌入图表的图像处理上表现优异。借助Aryn Partitioning Service,Sycamore实现了高效的文档分割、OCR和数据提取,极大提升了数据块分割准确性和检索效果。其DocSet抽象模型支持大规模数据处理,包括表格提取和视觉摘要,确保高质量数据可以轻松载入向量数据库和混合搜索引擎。