Java爬蟲技術(shù)框架之Heritrix框架詳解
Heritrix是一個由Java開發(fā)的開源Web爬蟲系統(tǒng),用來獲取完整的、精確的站點內(nèi)容的深度復(fù)制,
具有強大的可擴展性,運行開發(fā)者任意選擇或擴展各個組件,實現(xiàn)特定的抓取邏輯。
一、Heritrix介紹
Heritrix采用了模塊化的設(shè)計,用戶可以在運行時選擇要用的模塊。它由核心類(core classes)和插件模塊(pluggable modules)構(gòu)成。
核心類可以配置,但不能被覆蓋,插件模塊可以由第三方模塊取代。所以我們就可以用實現(xiàn)了特定抓取邏輯的第三方模塊來取代默認的插件模塊,從而滿足自己的抓取需要。
CrawlController(下載控制器)整個下載過程的總控制者,整個抓取工作的起點,決定整個抓取任務(wù)的開始和結(jié)束。每個URI都有一個獨立的線程,它從邊界控制器(Frontier)獲取新的URI,然后傳遞給Processor chains(處理鏈)經(jīng)過一系列Processor(處理器)處理。
二、Heritrix架構(gòu)
中央控制器 CrawlController 是核心組件,決定了整個抓取任務(wù)的開始與結(jié)束。
用戶在 Heritrix web UI 控制臺設(shè)置抓取任務(wù)后,heritrix首先構(gòu)造XMLSettingsHandler對象,然后調(diào)用CrawlController的構(gòu)造函數(shù),構(gòu)造一個CrawlController實例并初始化,這樣,CrawlController就具備了運行條件。
此時,只需調(diào)用 requestCrawlStart()方法就可以啟動線程池和Frontier,以便向線程池中工作線程提供抓取用的URL鏈接。
Heritrix 3.x 的框架主要分為 Engine 和 Component
三、一些API
org.archive.crawler.framework.CrawlJob;
org.archive.crawler.postprocessor.CandidatesProcessor;
org.archive.modules.CrawlURI;
等等
抓取任務(wù)CrawlOrder類:是整個抓取工作的起點。一次抓取任務(wù)包括許多屬性,建立一個任務(wù)的方式有很多種,最簡單的一種就是根據(jù)默認的order.xml來配置。
中央控制器CrawlController:該類決定著抓取任務(wù)的開始和結(jié)束。它包含以下幾個組件:
CrawlOrder:該類保存了order.xml的屬性配置;
CrawlScope:決定當前抓取范圍;
ProcessorChainList:處理器鏈;
Frontier:一次抓取任務(wù)需要設(shè)定一個Frontier,以此來不斷為其每個線程提供URI;
ToePool:它是一個線程池,管理了所有在當前任務(wù)中抓取過的Host名稱和Server名稱。
中央控制器CrawlControllr的類結(jié)構(gòu)如圖所示:
Frontier鏈接制造工廠:它表示一種為線程提供鏈接的工具,通過一些特定的算法來決定哪個鏈接將接下來被送入處理器鏈中,同時,它本身也負責(zé)一定的日志和狀態(tài)報告功能。
BdbFrontier類:它是用Berkeley DB 實現(xiàn)的,Berkeley DB 就是一個HashTable,它能夠按“key/value”方式保存數(shù)據(jù),能夠為應(yīng)用程序提供可伸縮的、高性能的、有事務(wù)保護功能的嵌入式數(shù)據(jù)庫。
Heritrix的多線程ToeThread和ToePool:要想更快更有效地抓取網(wǎng)頁,必須采用多線程,Heritrix則采用多線程機制,提供了一個標準的線程池ToePool,用于管理所有的抓取線程。
處理器鏈 Processor:包括PreProcessor、Fetcher、Extractor、Writer、PostProcessor五種。
四、應(yīng)用
作為爬蟲模塊,爬取數(shù)據(jù)
到此這篇關(guān)于爬蟲技術(shù)框架之Heritrix框架詳解的文章就介紹到這了,更多相關(guān)爬蟲技術(shù)框架 Heritrix內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
- Python爬蟲實例——scrapy框架爬取拉勾網(wǎng)招聘信息
- Python爬蟲 scrapy框架爬取某招聘網(wǎng)存入mongodb解析
- Python3爬蟲爬取英雄聯(lián)盟高清桌面壁紙功能示例【基于Scrapy框架】
- Python爬蟲框架scrapy實現(xiàn)downloader_middleware設(shè)置proxy代理功能示例
- Python爬蟲框架scrapy實現(xiàn)的文件下載功能示例
- python爬蟲框架scrapy實現(xiàn)模擬登錄操作示例
- Python爬蟲框架Scrapy常用命令總結(jié)
- Python爬蟲框架Scrapy基本用法入門教程
- Python使用Scrapy爬蟲框架全站爬取圖片并保存本地的實現(xiàn)代碼
- Python爬蟲框架Scrapy實例代碼
相關(guān)文章
解析Python中的eval()、exec()及其相關(guān)函數(shù)
本篇文章主要介紹了解析Python中的eval()、exec()及其相關(guān)函數(shù),小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧2017-12-12python GUI庫圖形界面開發(fā)之PyQt5信號與槽的高級使用技巧裝飾器信號與槽詳細使用方法與實例
這篇文章主要介紹了python GUI庫圖形界面開發(fā)之PyQt5信號與槽的高級使用技巧裝飾器信號與槽詳細使用方法與實例,需要的朋友可以參考下2020-03-03Pycharm配置遠程SSH服務(wù)器實現(xiàn)(切換不同虛擬環(huán)境)
本文主要介紹了Pycharm配置遠程SSH服務(wù)器實現(xiàn),文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2023-02-02在vscode使用jupyter notebook出現(xiàn)bug及解決
這篇文章主要介紹了在vscode使用jupyter notebook出現(xiàn)bug及解決,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教2024-06-06