欧美bbbwbbbw肥妇,免费乱码人妻系列日韩,一级黄片

基于Vert.x和RxJava 2構(gòu)建通用的爬蟲框架的示例

 更新時間:2018年02月01日 10:28:53   作者:fengzhizi715  
這篇文章主要介紹了基于Vert.x和RxJava 2構(gòu)建通用的爬蟲框架的示例,小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧

最近由于業(yè)務需要監(jiān)控一些數(shù)據(jù),雖然市面上有很多優(yōu)秀的爬蟲框架,但是我仍然打算從頭開始實現(xiàn)一套完整的爬蟲框架。

在技術(shù)選型上,我沒有選擇Spring來搭建項目,而是選擇了更輕量級的Vert.x。一方面感覺Spring太重了,而Vert.x是一個基于JVM、輕量級、高性能的框架。它基于事件和異步,依托于全異步Java服務器Netty,并擴展了很多其他特性。

github地址:https://github.com/fengzhizi715/NetDiscovery

一. 爬蟲框架的功能

爬蟲框架包含爬蟲引擎(SpiderEngine)和爬蟲(Spider)。SpiderEngine可以管理多個Spider。

1.1 Spider

在Spider中,主要包含幾個組件:downloader、queue、parser、pipeline以及代理池IP(proxypool),代理池是一個單獨的項目,我前段時間寫的,在使用爬蟲框架時經(jīng)常需要切換代理IP,所以把它引入進來。

proxypool地址:https://github.com/fengzhizi715/ProxyPool


其余四個組件都是接口,在爬蟲框架中內(nèi)置了一些實現(xiàn),例如內(nèi)置了多個下載器(downloader)包括vertx的webclient、http client、okhttp3、selenium實現(xiàn)的下載器。開發(fā)者可以根據(jù)自身情況來選擇使用或者自己開發(fā)全新的downloader。

Downloader的download方法會返回一個Maybe<Response>。

package com.cv4j.netdiscovery.core.downloader;
import com.cv4j.netdiscovery.core.domain.Request;
import com.cv4j.netdiscovery.core.domain.Response;
import io.reactivex.Maybe;

/**
 * Created by tony on 2017/12/23.
 */
public interface Downloader {
  Maybe<Response> download(Request request);
  void close();
}

在Spider中,通過Maybe<Response>對象來實現(xiàn)后續(xù)的一系列的鏈式調(diào)用,比如將Response轉(zhuǎn)換成Page對象,再對Page對象進行解析,Page解析完畢之后做一系列的pipeline操作。

         downloader.download(request)
              .observeOn(Schedulers.io())
              .map(new Function<Response, Page>() {

                @Override
                public Page apply(Response response) throws Exception {
                  Page page = new Page();
                  page.setHtml(new Html(response.getContent()));
                  page.setRequest(request);
                  page.setUrl(request.getUrl());
                  page.setStatusCode(response.getStatusCode());
                  return page;
                }
              })
              .map(new Function<Page, Page>() {

                @Override
                public Page apply(Page page) throws Exception {

                  if (parser != null) {

                    parser.process(page);
                  }

                  return page;
                }
              })
              .map(new Function<Page, Page>() {

                @Override
                public Page apply(Page page) throws Exception {

                  if (Preconditions.isNotBlank(pipelines)) {

                    pipelines.stream()
                        .forEach(pipeline -> pipeline.process(page.getResultItems()));
                  }

                  return page;
                }
              })
              .subscribe(new Consumer<Page>() {

                @Override
                public void accept(Page page) throws Exception {

                  log.info(page.getUrl());

                  if (request.getAfterRequest()!=null) {

                    request.getAfterRequest().process(page);
                  }
                }
              }, new Consumer<Throwable>() {
                @Override
                public void accept(Throwable throwable) throws Exception {
                  log.error(throwable.getMessage());
                }
              });

在這里使用RxJava 2可以讓整個爬蟲框架看起來更加響應式:)

1.2 SpiderEngine

SpiderEngine可以包含多個Spider,可以通過addSpider()、createSpider()來將爬蟲添加到SpiderEngine和創(chuàng)建新的Spider并添加到SpiderEngine。


在SpiderEngine中,如果調(diào)用了httpd(port)方法,還可以監(jiān)控SpiderEngine中各個Spider。

1.2.1 獲取某個爬蟲的狀態(tài)

http://localhost:{port}/netdiscovery/spider/{spiderName}

類型:GET

1.2.2 獲取SpiderEngine中所有爬蟲的狀態(tài)

http://localhost:{port}/netdiscovery/spiders/

類型:GET

1.2.3 修改某個爬蟲的狀態(tài)

http://localhost:{port}/netdiscovery/spider/{spiderName}/status

類型:POST

參數(shù)說明:

{
  "status":2  //讓爬蟲暫停
}

status 作用
2 讓爬蟲暫停
3 讓爬蟲從暫停中恢復
4 讓爬蟲停止

使用框架的例子

創(chuàng)建一個SpiderEngine,然后創(chuàng)建三個Spider,每個爬蟲每隔一定的時間去爬取一個頁面。

    SpiderEngine engine = SpiderEngine.create();
    Spider spider = Spider.create()
        .name("tony1")
        .repeatRequest(10000,"http://www.163.com")
        .initialDelay(10000);

    engine.addSpider(spider);
    Spider spider2 = Spider.create()
        .name("tony2")
        .repeatRequest(10000,"http://www.baidu.com")
        .initialDelay(10000);

    engine.addSpider(spider2);
    Spider spider3 = Spider.create()
        .name("tony3")
        .repeatRequest(10000,"http://www.126.com")
        .initialDelay(10000);
    engine.addSpider(spider3);
    engine.httpd(8080);
    engine.run();

上述程序運行一段時間之后,在瀏覽器中輸入:http://localhost:8080/netdiscovery/spiders

我們能看到三個爬蟲運行的結(jié)果。


將json格式化一下

{
  "code": 200,
  "data": [{
    "downloaderType": "VertxDownloader",
    "leftRequestSize": 0,
    "queueType": "DefaultQueue",
    "spiderName": "tony2",
    "spiderStatus": 1,
    "totalRequestSize": 7
  }, {
    "downloaderType": "VertxDownloader",
    "leftRequestSize": 0,
    "queueType": "DefaultQueue",
    "spiderName": "tony3",
    "spiderStatus": 1,
    "totalRequestSize": 7
  }, {
    "downloaderType": "VertxDownloader",
    "leftRequestSize": 0,
    "queueType": "DefaultQueue",
    "spiderName": "tony1",
    "spiderStatus": 1,
    "totalRequestSize": 7
  }],
  "message": "success"
}

案例

最近比較關注區(qū)塊鏈,因此做了一個程序來實時抓取三種數(shù)字貨幣的價格,可以通過“詢問”公眾號的方式來獲取最新的價格。

目前該程序已經(jīng)上線,可以通過詢問我的公眾號,來實時獲取這幾種數(shù)字貨幣的最新價格。

TODO

  1. 增加對登錄驗證碼的識別
  2. 增加elasticsearch的支持

總結(jié)

這個爬蟲框架才剛剛起步,我也參考了很多優(yōu)秀的爬蟲框架。未來我會在框架中考慮增加通過截屏圖片來分析圖片中的數(shù)據(jù)。甚至會結(jié)合cv4j框架。過年前,在爬蟲框架中會優(yōu)先實現(xiàn)對登錄驗證碼的識別。

以上就是本文的全部內(nèi)容,希望對大家的學習有所幫助,也希望大家多多支持腳本之家。

相關文章

  • Android中斷并重啟一個Thread線程的簡單方法

    Android中斷并重啟一個Thread線程的簡單方法

    下面小編就為大家?guī)硪黄狝ndroid中斷并重啟一個Thread線程的簡單方法。小編覺得挺不錯的,現(xiàn)在就分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2017-02-02
  • Android冷啟動優(yōu)化的3個小案例分享

    Android冷啟動優(yōu)化的3個小案例分享

    為了提高App的冷啟動耗時,除了在常規(guī)的業(yè)務側(cè)進行耗時代碼優(yōu)化之外,為了進一步縮短啟動耗時,需要在純技術(shù)測做一些優(yōu)化探索,本期我們從類預加載、Retrofit 、ARouter方面進行了進一步的優(yōu)化,感興趣的同學跟著小編一起來看看吧
    2023-07-07
  • Android自定義商品購買數(shù)量加減控件

    Android自定義商品購買數(shù)量加減控件

    這篇文章主要為大家詳細介紹了Android自定義商品購買數(shù)量加減控件的相關代碼,文中示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2016-11-11
  • Android webview與js交換JSON對象數(shù)據(jù)示例

    Android webview與js交換JSON對象數(shù)據(jù)示例

    js主動調(diào)用android的對象方式,android也無法返回給js一個jsonobject,需要js做一下轉(zhuǎn)換,具體代碼如下,感興趣的朋友可以參考下哈
    2013-06-06
  • Android 實例開發(fā)基于ArcSoft實現(xiàn)人臉識別

    Android 實例開發(fā)基于ArcSoft實現(xiàn)人臉識別

    人臉識別,是基于人的臉部特征信息進行身份識別的一種生物識別技術(shù)。用攝像機或攝像頭采集含有人臉的圖像或視頻流,并自動在圖像中檢測和跟蹤人臉,進而對檢測到的人臉進行識別的一系列相關技術(shù),通常也叫做人像識別、面部識別
    2021-11-11
  • Android編程中圖片特效處理方法小結(jié)

    Android編程中圖片特效處理方法小結(jié)

    這篇文章主要介紹了Android編程中圖片特效處理方法,實例總結(jié)了Android實現(xiàn)圖片的轉(zhuǎn)換、縮放、圓角及倒影等效果的相關技巧,具有一定參考借鑒價值,需要的朋友可以參考下
    2015-10-10
  • Android圖片或拍照選擇圖片功能實例代碼

    Android圖片或拍照選擇圖片功能實例代碼

    這篇文章主要給大家介紹了關于Android圖片或拍照選擇圖片功能的相關資料,文中通過示例代碼介紹的非常詳細,對各位Android開發(fā)者具有一定的參考學習價值,需要的朋友們下面來一起學習學習吧
    2019-05-05
  • android 復制 粘貼 剪切功能應用

    android 復制 粘貼 剪切功能應用

    網(wǎng)上有很多android 復制 粘貼 剪切功能的文章,只是放到自己的程序中不知道如何處理,現(xiàn)在尋得一可行方法,需要的朋友可以參考下
    2012-11-11
  • Android擴大View點擊范圍的方法

    Android擴大View點擊范圍的方法

    Android4.0設計規(guī)定的有效可觸摸的UI元素標準是48dp,轉(zhuǎn)化為一個物理尺寸約為9毫米。7~10毫米,這是一個用戶手指能準確并且舒適觸摸的區(qū)域。本文將介紹Android擴大View點擊范圍的方法
    2021-05-05
  • Android實現(xiàn)動態(tài)切換組件背景的方法

    Android實現(xiàn)動態(tài)切換組件背景的方法

    這篇文章主要介紹了Android實現(xiàn)動態(tài)切換組件背景的方法,需要的朋友可以參考下
    2014-07-07

最新評論