Selenium 模擬瀏覽器動(dòng)態(tài)加載頁(yè)面的實(shí)現(xiàn)方法
相信爬取大公司的數(shù)據(jù)時(shí),常常會(huì)遇到頁(yè)面信息動(dòng)態(tài)加載的問(wèn)題,
如果僅僅使用content = urllib2.urlopen(URL).read(),估計(jì)信息是獲取不全的,這時(shí)候就需要模擬瀏覽器加載頁(yè)面的過(guò)程,
selenium提供了方便的方法,我也是菜鳥(niǎo),試了很多種方式,下面提供覺(jué)得最靠譜的(已經(jīng)證明對(duì)于爬取新浪微博的topic、twitter under topic完全沒(méi)問(wèn)題)。
至于下面的browser變量是什么,看前面的幾篇文章。
首先是請(qǐng)求對(duì)應(yīng)的URL:
right_URL = URL.split("from")[0] + "current_page="+str(current_page) + "&since_id="+str(since_id) + "&page="+str(page_index) + "#Pl_Third_App__"+str(Pl_Third_App) print right_URL try: browser.get(right_URL) print "loading more, sleep 3 seconds ... 0" time.sleep(3) # NO need for this sleep, but we add ... browser = selenuim_loading_more(browser, method_index=0) except: print "one exception happen ==> get_tweeter_under_topic 2 ..." pass
然后模擬瀏覽器,加載更多(推薦使用method_index=0,已經(jīng)證明比其他好用很多):
def selenuim_loading_more(browser, method_index=0): if method_index==0: browser.implicitly_wait(3) # 為了快速滑動(dòng),先設(shè)置超時(shí)時(shí)間為1秒 # while True: for i in range(1, 4): # at most 3 times print "loading more, window.scrollTo bettom for the", i,"time ..." browser.execute_script("window.scrollTo(0,document.body.scrollHeight);") try: # 定位頁(yè)面底部的換頁(yè)tab browser.find_element_by_css_selector("div[class='W_pages']") break # 如果沒(méi)拋出異常就說(shuō)明找到了底部標(biāo)志,跳出循環(huán) except NoSuchElementException: pass # 拋出異常說(shuō)明沒(méi)找到底部標(biāo)志,繼續(xù)向下滑動(dòng) browser.implicitly_wait(4) # 將超時(shí)時(shí)間改回10秒 elif method_index==1: browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more print "loading more, sleep 4 seconds ... 1" time.sleep(4) browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more print "loading more, sleep 3 seconds ... 2" time.sleep(2) elif method_index==2: load_more_1 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more ActionChains(browser).click(load_more_1).perform() print "loading more, sleep 4 seconds ... 1" time.sleep(4) load_more_2 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more ActionChains(browser).click(load_more_2).perform() print "loading more, sleep 3 seconds ... 2" time.sleep(2) elif method_index==3: print "loading more, sleep 4 seconds ... 1" element = WebDriverWait(browser, 4).until( EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']")) ) element.click() print "loading more, sleep 2 seconds ... 2" WebDriverWait(browser, 2).until( EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']")) ).click() return browser
以上就是本文的全部?jī)?nèi)容,希望對(duì)大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。
相關(guān)文章
Python 50行爬蟲(chóng)抓取并處理圖靈書(shū)目過(guò)程詳解
這篇文章主要介紹了Python 50行爬蟲(chóng)抓取并處理圖靈書(shū)目過(guò)程詳解,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2019-09-09Python實(shí)現(xiàn)簡(jiǎn)單查找最長(zhǎng)子串功能示例
這篇文章主要介紹了Python實(shí)現(xiàn)簡(jiǎn)單查找最長(zhǎng)子串功能,涉及字符串遍歷、統(tǒng)計(jì)等相關(guān)操作技巧,需要的朋友可以參考下2019-02-02分享一個(gè)pycharm專(zhuān)業(yè)版安裝的永久使用方法
這篇文章主要介紹了分享一個(gè)pycharm專(zhuān)業(yè)版安裝的永久使用方法,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2019-09-09Python在for循環(huán)中更改list值的方法【推薦】
這篇文章主要介紹了Python在for循環(huán)中更改list值的方法,非常不錯(cuò),具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2018-08-08使用python實(shí)現(xiàn)省市三級(jí)菜單效果
本文給大家分享的是使用使用python實(shí)現(xiàn)省市三級(jí)菜單效果的代碼,非常的實(shí)用,有需要的小伙伴可以參考下。2016-01-01Python實(shí)現(xiàn)多線(xiàn)程下載腳本的示例代碼
這篇文章主要介紹了Python實(shí)現(xiàn)多線(xiàn)程下載腳本的示例代碼,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2020-04-04詳細(xì)講解用Python發(fā)送SMTP郵件的教程
這篇文章主要詳細(xì)講解了用Python發(fā)送SMTP郵件的教程,包括在郵件中添加圖片等文件,強(qiáng)烈推薦!需要的朋友可以參考下2015-04-04