awesome-web-scraper

4.5

Web Scraper 网络爬虫数据抓取开源工具编程语言 Github 开源项目

产品介绍：awesome-web-scraper项目汇集了多种编程语言的网页抓取和爬虫工具，涵盖Java、C/C++、C#、Erlang、Python、PHP、Node.js、Ruby、Go和Rust等语言。该项目提供每个工具的简要说明和GitHub链接，便于开发者快速选择适合的解决方案。这些工具可用于网页数据抓取、内容提取和网站爬取，适用于搜索引擎构建、数据分析和自动化测试等场景。作为一个精选资源列表，awesome-web-scraper为开发者提供了宝贵的参考。

访问官网 Github

介绍

超赞网络爬虫

优秀网络爬虫和爬虫工具的集合。

Java

Apache Nutch - 高度可扩展、高度可伸缩的网络爬虫。可插拔的解析、协议、存储和索引。
websphinx - 专门用于HTML信息提取的网站处理器。
Open Search Server - 提供全套搜索功能。构建自己的索引策略。解析器提取全文数据。爬虫可以索引一切。
crawler4j - Java开源网络爬虫，提供简单的接口用于爬取网页。使用它，你可以在几分钟内设置一个多线程网络爬虫。

C/C++

HTTrack - 高度可扩展、高度可伸缩的网络爬虫。可插拔的解析、协议、存储和索引。

C#

ccrawler - 基于C# 3.5版本构建。包含一个简单的网页内容分类器扩展，可以根据内容区分网页。

Erlang

ebot - 基于nosql数据库(apache couchdb, riak)、AMQP数据库(rabbitmq)、webmachine和mochiweb构建的开源网络爬虫。

Python

scrapy - Scrapy，一个快速的高层次网络爬虫和刮取框架。
gdom - gdom，使用GraphQL进行DOM遍历和刮取。
trafilatura - 用于提取元数据、主要文本和评论的库和命令行工具。
extractnet - 基于机器学习的Python内容和元数据提取框架
Scrapegraph-ai - 一个使用AI进行网页抓取的开源库

PHP

Goutte - Goutte，一个简单的PHP网络爬虫。
DiDOM - 简单快速的HTML解析器。
simple_html_dom - 简单HTML DOM库的分支。
PHPCrawl - PHPCrawl是一个用PHP编写的网站爬行/爬虫框架。
Crawler - 用于快速网络爬虫和刮取开发的库。

Nodejs

puppeteer - Headless Chrome Node API https://pptr.dev。
Phantomjs - 可编程的Headless WebKit。
node-crawler - NodeJS + 服务器端jQuery的网络爬虫/蜘蛛。
node-simplecrawler - 灵活的事件驱动型node爬虫。
spider - 使用node.js和jQuery对网站进行可编程爬取。
slimerjs - 运行Gecko的类似PhantomJS的工具。
casperjs - PhantomJS和SlimerJS的导航脚本编写和测试工具。
zombie - 使用node.js的超快、全栈、无头浏览器测试。
nightmare - Nightmare是PhantomJS的高级封装，让你可以自动化浏览器任务
jsdom - WHATWG DOM和HTML标准的JavaScript实现，用于node.js
xray - 下一代网络爬虫。透过<html>噪音看本质。
lightcrawler - 爬取网站并通过Google lighthouse运行。

Ruby

wombat - 轻量级Ruby网络爬虫/刮取工具，具有优雅的DSL，可从页面提取结构化数据。

Go

gocrawl - 礼貌、精简且并发的网络爬虫。
fetchbot - 一个简单灵活的网络爬虫，遵循robots.txt策略和爬取延迟。

Rust

scraper - 使用CSS选择器进行HTML解析和查询。
reqwest - Rust的人体工程学、功能齐全的HTTP客户端。

许可证

贡献

在提交建议之前，请阅读贡献指南。

欢迎提出问题或创建拉取请求来添加你的内容。

相关项目

Project Cover

开源Python网络爬虫和数据提取框架

Project Cover

Salesforce DX开发效率提升工具

Project Cover

Python网络爬虫和浏览器自动化库

Project Cover

功能强大的网页爬虫和浏览器自动化库

Project Cover

github-trending-backup

GitHub热门项目自动备份与趋势追踪工具

Project Cover

轻量级Docker日志实时监控工具

Project Cover

快速灵活的Go语言网络爬虫框架

Project Cover

高效多语言代码统计工具

Project Cover

awesome-puppeteer

Puppeteer资源列表无头Chrome自动化工具

Project Cover

curl命令转编程代码工具支持多种语言

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

商汤小浣熊

小浣熊家族Raccoon，您的AI智能助手，致力于通过先进的人工智能技术，为用户提供高效、便捷的智能服务。无论是日常咨询还是专业问题解答，小浣熊都能以快速、准确的响应满足您的需求，让您的生活更加智能便捷。

Project Cover

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

Project Cover

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号