基于Vert.x和RxJava 2構(gòu)建通用的爬蟲(chóng)框架的示例
最近由于業(yè)務(wù)需要監(jiān)控一些數(shù)據(jù),雖然市面上有很多優(yōu)秀的爬蟲(chóng)框架,但是我仍然打算從頭開(kāi)始實(shí)現(xiàn)一套完整的爬蟲(chóng)框架。
在技術(shù)選型上,我沒(méi)有選擇Spring來(lái)搭建項(xiàng)目,而是選擇了更輕量級(jí)的Vert.x。一方面感覺(jué)Spring太重了,而Vert.x是一個(gè)基于JVM、輕量級(jí)、高性能的框架。它基于事件和異步,依托于全異步Java服務(wù)器Netty,并擴(kuò)展了很多其他特性。
github地址:https://github.com/fengzhizi715/NetDiscovery
一. 爬蟲(chóng)框架的功能
爬蟲(chóng)框架包含爬蟲(chóng)引擎(SpiderEngine)和爬蟲(chóng)(Spider)。SpiderEngine可以管理多個(gè)Spider。
1.1 Spider
在Spider中,主要包含幾個(gè)組件:downloader、queue、parser、pipeline以及代理池IP(proxypool),代理池是一個(gè)單獨(dú)的項(xiàng)目,我前段時(shí)間寫的,在使用爬蟲(chóng)框架時(shí)經(jīng)常需要切換代理IP,所以把它引入進(jìn)來(lái)。
proxypool地址:https://github.com/fengzhizi715/ProxyPool
其余四個(gè)組件都是接口,在爬蟲(chóng)框架中內(nèi)置了一些實(shí)現(xiàn),例如內(nèi)置了多個(gè)下載器(downloader)包括vertx的webclient、http client、okhttp3、selenium實(shí)現(xiàn)的下載器。開(kāi)發(fā)者可以根據(jù)自身情況來(lái)選擇使用或者自己開(kāi)發(fā)全新的downloader。
Downloader的download方法會(huì)返回一個(gè)Maybe<Response>。
package com.cv4j.netdiscovery.core.downloader; import com.cv4j.netdiscovery.core.domain.Request; import com.cv4j.netdiscovery.core.domain.Response; import io.reactivex.Maybe; /** * Created by tony on 2017/12/23. */ public interface Downloader { Maybe<Response> download(Request request); void close(); }
在Spider中,通過(guò)Maybe<Response>對(duì)象來(lái)實(shí)現(xiàn)后續(xù)的一系列的鏈?zhǔn)秸{(diào)用,比如將Response轉(zhuǎn)換成Page對(duì)象,再對(duì)Page對(duì)象進(jìn)行解析,Page解析完畢之后做一系列的pipeline操作。
downloader.download(request) .observeOn(Schedulers.io()) .map(new Function<Response, Page>() { @Override public Page apply(Response response) throws Exception { Page page = new Page(); page.setHtml(new Html(response.getContent())); page.setRequest(request); page.setUrl(request.getUrl()); page.setStatusCode(response.getStatusCode()); return page; } }) .map(new Function<Page, Page>() { @Override public Page apply(Page page) throws Exception { if (parser != null) { parser.process(page); } return page; } }) .map(new Function<Page, Page>() { @Override public Page apply(Page page) throws Exception { if (Preconditions.isNotBlank(pipelines)) { pipelines.stream() .forEach(pipeline -> pipeline.process(page.getResultItems())); } return page; } }) .subscribe(new Consumer<Page>() { @Override public void accept(Page page) throws Exception { log.info(page.getUrl()); if (request.getAfterRequest()!=null) { request.getAfterRequest().process(page); } } }, new Consumer<Throwable>() { @Override public void accept(Throwable throwable) throws Exception { log.error(throwable.getMessage()); } });
在這里使用RxJava 2可以讓整個(gè)爬蟲(chóng)框架看起來(lái)更加響應(yīng)式:)
1.2 SpiderEngine
SpiderEngine可以包含多個(gè)Spider,可以通過(guò)addSpider()、createSpider()來(lái)將爬蟲(chóng)添加到SpiderEngine和創(chuàng)建新的Spider并添加到SpiderEngine。
在SpiderEngine中,如果調(diào)用了httpd(port)方法,還可以監(jiān)控SpiderEngine中各個(gè)Spider。
1.2.1 獲取某個(gè)爬蟲(chóng)的狀態(tài)
http://localhost:{port}/netdiscovery/spider/{spiderName}
類型:GET
1.2.2 獲取SpiderEngine中所有爬蟲(chóng)的狀態(tài)
http://localhost:{port}/netdiscovery/spiders/
類型:GET
1.2.3 修改某個(gè)爬蟲(chóng)的狀態(tài)
http://localhost:{port}/netdiscovery/spider/{spiderName}/status
類型:POST
參數(shù)說(shuō)明:
{ "status":2 //讓爬蟲(chóng)暫停 }
status | 作用 |
---|---|
2 | 讓爬蟲(chóng)暫停 |
3 | 讓爬蟲(chóng)從暫停中恢復(fù) |
4 | 讓爬蟲(chóng)停止 |
使用框架的例子
創(chuàng)建一個(gè)SpiderEngine,然后創(chuàng)建三個(gè)Spider,每個(gè)爬蟲(chóng)每隔一定的時(shí)間去爬取一個(gè)頁(yè)面。
SpiderEngine engine = SpiderEngine.create(); Spider spider = Spider.create() .name("tony1") .repeatRequest(10000,"http://www.163.com") .initialDelay(10000); engine.addSpider(spider); Spider spider2 = Spider.create() .name("tony2") .repeatRequest(10000,"http://www.baidu.com") .initialDelay(10000); engine.addSpider(spider2); Spider spider3 = Spider.create() .name("tony3") .repeatRequest(10000,"http://www.126.com") .initialDelay(10000); engine.addSpider(spider3); engine.httpd(8080); engine.run();
上述程序運(yùn)行一段時(shí)間之后,在瀏覽器中輸入:http://localhost:8080/netdiscovery/spiders
我們能看到三個(gè)爬蟲(chóng)運(yùn)行的結(jié)果。
將json格式化一下
{ "code": 200, "data": [{ "downloaderType": "VertxDownloader", "leftRequestSize": 0, "queueType": "DefaultQueue", "spiderName": "tony2", "spiderStatus": 1, "totalRequestSize": 7 }, { "downloaderType": "VertxDownloader", "leftRequestSize": 0, "queueType": "DefaultQueue", "spiderName": "tony3", "spiderStatus": 1, "totalRequestSize": 7 }, { "downloaderType": "VertxDownloader", "leftRequestSize": 0, "queueType": "DefaultQueue", "spiderName": "tony1", "spiderStatus": 1, "totalRequestSize": 7 }], "message": "success" }
案例
最近比較關(guān)注區(qū)塊鏈,因此做了一個(gè)程序來(lái)實(shí)時(shí)抓取三種數(shù)字貨幣的價(jià)格,可以通過(guò)“詢問(wèn)”公眾號(hào)的方式來(lái)獲取最新的價(jià)格。
目前該程序已經(jīng)上線,可以通過(guò)詢問(wèn)我的公眾號(hào),來(lái)實(shí)時(shí)獲取這幾種數(shù)字貨幣的最新價(jià)格。
TODO
- 增加對(duì)登錄驗(yàn)證碼的識(shí)別
- 增加elasticsearch的支持
總結(jié)
這個(gè)爬蟲(chóng)框架才剛剛起步,我也參考了很多優(yōu)秀的爬蟲(chóng)框架。未來(lái)我會(huì)在框架中考慮增加通過(guò)截屏圖片來(lái)分析圖片中的數(shù)據(jù)。甚至?xí)Y(jié)合cv4j框架。過(guò)年前,在爬蟲(chóng)框架中會(huì)優(yōu)先實(shí)現(xiàn)對(duì)登錄驗(yàn)證碼的識(shí)別。
以上就是本文的全部?jī)?nèi)容,希望對(duì)大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。
- Java爬蟲(chóng)框架之WebMagic實(shí)戰(zhàn)
- 分享一個(gè)簡(jiǎn)單的java爬蟲(chóng)框架
- 半小時(shí)實(shí)現(xiàn)Java手?jǐn)]網(wǎng)絡(luò)爬蟲(chóng)框架(附完整源碼)
- java能寫爬蟲(chóng)程序嗎
- Java爬蟲(chóng)(Jsoup與WebDriver)的使用
- 使用java實(shí)現(xiàn)網(wǎng)絡(luò)爬蟲(chóng)
- Java 網(wǎng)絡(luò)爬蟲(chóng)新手入門詳解
- Java 網(wǎng)絡(luò)爬蟲(chóng)基礎(chǔ)知識(shí)入門解析
- Java 實(shí)現(xiàn)網(wǎng)絡(luò)爬蟲(chóng)框架詳細(xì)代碼
相關(guān)文章
Android中斷并重啟一個(gè)Thread線程的簡(jiǎn)單方法
下面小編就為大家?guī)?lái)一篇Android中斷并重啟一個(gè)Thread線程的簡(jiǎn)單方法。小編覺(jué)得挺不錯(cuò)的,現(xiàn)在就分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧2017-02-02Android冷啟動(dòng)優(yōu)化的3個(gè)小案例分享
為了提高App的冷啟動(dòng)耗時(shí),除了在常規(guī)的業(yè)務(wù)側(cè)進(jìn)行耗時(shí)代碼優(yōu)化之外,為了進(jìn)一步縮短啟動(dòng)耗時(shí),需要在純技術(shù)測(cè)做一些優(yōu)化探索,本期我們從類預(yù)加載、Retrofit 、ARouter方面進(jìn)行了進(jìn)一步的優(yōu)化,感興趣的同學(xué)跟著小編一起來(lái)看看吧2023-07-07Android自定義商品購(gòu)買數(shù)量加減控件
這篇文章主要為大家詳細(xì)介紹了Android自定義商品購(gòu)買數(shù)量加減控件的相關(guān)代碼,文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下2016-11-11Android webview與js交換JSON對(duì)象數(shù)據(jù)示例
js主動(dòng)調(diào)用android的對(duì)象方式,android也無(wú)法返回給js一個(gè)jsonobject,需要js做一下轉(zhuǎn)換,具體代碼如下,感興趣的朋友可以參考下哈2013-06-06Android 實(shí)例開(kāi)發(fā)基于ArcSoft實(shí)現(xiàn)人臉識(shí)別
人臉識(shí)別,是基于人的臉部特征信息進(jìn)行身份識(shí)別的一種生物識(shí)別技術(shù)。用攝像機(jī)或攝像頭采集含有人臉的圖像或視頻流,并自動(dòng)在圖像中檢測(cè)和跟蹤人臉,進(jìn)而對(duì)檢測(cè)到的人臉進(jìn)行識(shí)別的一系列相關(guān)技術(shù),通常也叫做人像識(shí)別、面部識(shí)別2021-11-11android 復(fù)制 粘貼 剪切功能應(yīng)用
網(wǎng)上有很多android 復(fù)制 粘貼 剪切功能的文章,只是放到自己的程序中不知道如何處理,現(xiàn)在尋得一可行方法,需要的朋友可以參考下2012-11-11Android擴(kuò)大View點(diǎn)擊范圍的方法
Android4.0設(shè)計(jì)規(guī)定的有效可觸摸的UI元素標(biāo)準(zhǔn)是48dp,轉(zhuǎn)化為一個(gè)物理尺寸約為9毫米。7~10毫米,這是一個(gè)用戶手指能準(zhǔn)確并且舒適觸摸的區(qū)域。本文將介紹Android擴(kuò)大View點(diǎn)擊范圍的方法2021-05-05Android實(shí)現(xiàn)動(dòng)態(tài)切換組件背景的方法
這篇文章主要介紹了Android實(shí)現(xiàn)動(dòng)態(tài)切換組件背景的方法,需要的朋友可以參考下2014-07-07