textract

多格式文档文本提取工具

textract 文本提取文档处理 Python库开源项目 Github

textract是一个开源文本提取工具，支持从多种格式文档（如PDF、Word、Excel等）中提取文本。该项目最初由Dean Malmgren创建，现由Jazzband社区维护。textract提供简单接口，具备全面的文档支持，旨在简化文本提取流程。它适用于需要从不同类型文档中批量提取文本的场景，为用户提供高效的文本提取解决方案。

访问官网

Github

介绍相关项目

tika-python - Python版Apache Tika库，支持文档解析、文本翻译与语言检测

Apache TikaGithubPython库REST服务器tika-python安装开源项目

tika-python是Apache Tika的Python移植版，通过Tika REST Server提供强大的文档解析、文本翻译和语言检测功能。该库支持通过多个接口调用，支持gzip压缩输入输出流，并提供命令行工具。用户可配置环境变量，在无网络连接环境中使用，优化其行为。

tesserocr - Python封装的OCR引擎简化技术集成

GithubOCRPythonTesseract APItesserocr图像识别开源项目

tesserocr是基于Tesseract OCR引擎的Python封装库，通过Cython集成Tesseract C++ API。它提供简洁的Pythonic接口，支持多线程并发，可与Pillow库配合。tesserocr简化了OCR集成，便于开发者在Python项目中实现高效文字识别。该库支持多种图像格式，提供丰富的API功能，包括文本识别、布局分析和方向检测等。tesserocr支持多种语言识别、图像预处理、文本布局分析等高级功能。它还提供了简单的命令行接口，方便快速测试和使用。该库适用于各种OCR应用场景，如文档数字化、图像文本提取和自动化数据录入等。

HarvestText - 开源文本处理和分析工具，支持无监督方法和领域知识整合

GithubHarvestTextPython开源项目文本预处理无监督方法自然语言处理

HarvestText 是一个开源文本处理与分析工具，专注于无（弱）监督方法，能够整合领域知识，高效处理和分析特定领域文本。主要功能包括精细分词、文本清洗、实体链接、命名实体识别和依存句法分析等，并支持情感分析、关系网络构建、文本摘要及信息检索等高级应用。广泛应用于小说分析、网络文本及专业文献处理，具备高效灵活的特点。

texify - 高效OCR模型，图像数学公式到Markdown和LaTeX的转换工具

GithubLaTeXOCRTexify图像转换开源项目机器学习

Texify是一个开源OCR模型，可将含数学公式的图像或PDF转换为Markdown和LaTeX格式。支持块级和内联公式，兼容CPU、GPU和MPS。基于多样化数据集训练，相较其他开源工具准确度更高。提供GUI、命令行和Python API，适用于多种场景。

Extracta.ai - 自动提取非结构化文档数据无需训练高效解析

AI工具Extracta.ai人工智能数据提取文档处理自动化

Extracta.ai为智能文档数据提取工具，可从多种非结构化文档中自动提取信息。支持PDF、图片、扫描件等格式，无需复杂训练。用户定义所需字段并上传文件后，即可获得结构化数据。适用于发票、简历、合同等文档处理，提高效率减少错误。采用加密存储技术，符合GDPR规定，确保数据安全。

pdfminer.six - Python开源PDF文本提取与分析库

GithubPDF解析Python库pdfminer.six开源项目文本提取文档分析

pdfminer.six是一个开源Python库，用于从PDF文档中提取和分析文本数据。该库能够提取文本内容及其位置、字体和颜色信息，支持PDF-1.7规范、CJK语言和垂直书写。pdfminer.six还可提取图像、目录和交互式表单，支持多种压缩和加密方式。其模块化设计便于扩展，适用于多种PDF分析场景。该项目是PDFMiner的社区维护分支，提供了全面的PDF文档分析功能。

ExtractThinker - 使用 LLM 从文件和文档中提取数据的库

ExtractThinkerGithubLLMs开源项目数据提取文档处理智能文档

ExtractThinker提供智能文件数据提取，支持Tesseract OCR、Azure Form Recognizer和AWS TextExtract等多种文档加载器。适用于异步处理、多种格式和ORM风格操作的模块化架构，并与LangChain生态系统兼容。专注于智能文档处理，大幅提升数据提取准确率，适用于发票、驾照等多场景。

wiktextract - 高效提取Wiktionary数据的开源Python工具

GithubJSONPythonWiktextractWiktionary开源项目数据提取

Wiktextract是一款开源Python工具,专门从英语Wiktionary数据中提取多语言词典信息。通过展开模板和Lua宏,它能准确提取释义、词形和发音等数据。Wiktextract可提取词条、词性、变形、翻译、发音和用法等多方面信息,支持命令行使用或作为Python库集成。这一工具为自然语言处理、机器翻译等领域提供了丰富的词典资源。

pytextrank - 基于图算法的Python自然语言处理与知识图谱工具

GithubPyTextRankspaCy图算法开源项目文本摘要自然语言处理

PyTextRank 是一个Python实现的TextRank算法库，作为spaCy管道扩展，专注于图形化自然语言处理和知识图谱应用。它支持短语提取、低成本抽取式摘要，方便将非结构化文本转化为结构化信息。

OCRmyPDF - 扫描PDF文件的OCR转换与优化工具

GithubOCRmyPDFPDF文档多语言支持开源软件开源项目文字识别

OCRmyPDF是一款开源的命令行工具，专门用于为扫描PDF文件添加OCR文本层。它支持多语言识别、页面旋转和倾斜校正，并能生成符合长期存储标准的PDF/A文件。此工具可优化PDF图像，常常生成比原文件更小的输出。OCRmyPDF利用多核处理技术，能高效处理大型文档，已在数百万PDF文件上得到验证。它为用户提供了将不可搜索的扫描文档转换为可搜索、可复制的PDF文件的简便方法。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号