Ecosyste.ms: Awesome

An open API service indexing awesome lists of open source software.

Awesome Lists | Featured Topics | Projects

awesome-crawler-cn

互联网爬虫,蜘蛛,数据采集器,网页解析器的汇总,因新技术不断发展,新框架层出不穷,此文会不断更新...
https://github.com/liinnux/awesome-crawler-cn

Last synced: 6 days ago
JSON representation

  • Java

    • Apache Nutch - 用于生产环境的高度可扩展的高度可扩展的网络爬虫.
    • Apache Nutch - 用于生产环境的高度可扩展的高度可扩展的网络爬虫.
    • anthelion - 一个基于Apache Nutch抓取语义注释在HTML页面插件.
    • JSoup - 采集,分析,处理和清洗HTML页面.
    • websphinx - HTML网站特定的处理、信息提取.
    • Open Search Server - 全套搜索功能,建立你自己的索引策略。分析、提取全文数据,这个框架可以索引的一切.
    • Spiderman - 一个可扩展的,多线程的网络爬虫.
    • Spiderman2 - 分布式网络爬虫框架,支持javascript渲染.
    • StormCrawler - 基于开放源代码、构建低延迟的网络资源采集框架,基于Apache Storm.
  • Python

    • cola - 一个分布式的爬虫框架.
    • Scrapy-Redis - 基于Scrapy内核采用Redis组件的爬虫。
    • cola - 一个分布式的爬虫框架.
    • feedparser - 一个通用的feed解析器.
    • Grab - 网站采集框架.
    • MechanicalSoup - 一个自动化的互动网站Python库.
    • django-dynamic-scraper - 基于Scrapy内核由django Web框架开发的爬虫。
    • distribute_crawler - 基于Scrapy内核采用redis, mongodb开发的分布式爬虫框架。
    • pyspider - 一个强大纯python的数据采集系统.
    • Demiurge - 基于PyQuery的微型爬虫框架.
    • Scrapely - 一个纯python的HTML页面捕捉库.
    • Scrapy-Redis - 基于Scrapy内核采用Redis组件的爬虫。
    • cola - 一个分布式的爬虫框架.
    • Scrapy - 一种高效的屏幕,网页数据采集框架。
    • scrapy-cluster - 基于Scrapy内核采用Redis 和 Kafka 开发的分布式爬虫框架。
  • C#

    • ccrawler - 一个简单的Web内容分类方案,它可以根据其内容分开网页,基于C#3.5.
    • SimpleCrawler - 简单的多线程网络爬虫,基于REG表达式.
    • DotnetSpider - 基于C#开发的一个轻量级,交叉平台的网络爬虫.
    • ccrawler - 一个简单的Web内容分类方案,它可以根据其内容分开网页,基于C#3.5.
    • ccrawler - 一个简单的Web内容分类方案,它可以根据其内容分开网页,基于C#3.5.
  • JavaScript

    • simplecrawler - 基于事件驱动开发的网络爬虫.
    • js-crawler - 基于Node.JS,支持HTTP(S)的网络爬虫.
    • x-ray - 支持分页的网络爬虫.
  • R

    • rvest - 基于R开发的简单网络爬虫.
    • rvest - 基于R开发的简单网络爬虫.
  • Go

    • pholcus - 一个分布式,支持高并发的网络爬虫.
  • Scala

    • scrala - 由Scala开发基于scrapy内核的网络爬虫.