Selenium 模擬瀏覽器動態(tài)加載頁面的實現(xiàn)方法
相信爬取大公司的數(shù)據(jù)時,常常會遇到頁面信息動態(tài)加載的問題,
如果僅僅使用content = urllib2.urlopen(URL).read(),估計信息是獲取不全的,這時候就需要模擬瀏覽器加載頁面的過程,
selenium提供了方便的方法,我也是菜鳥,試了很多種方式,下面提供覺得最靠譜的(已經(jīng)證明對于爬取新浪微博的topic、twitter under topic完全沒問題)。
至于下面的browser變量是什么,看前面的幾篇文章。
首先是請求對應(yīng)的URL:
right_URL = URL.split("from")[0] + "current_page="+str(current_page) + "&since_id="+str(since_id) + "&page="+str(page_index) + "#Pl_Third_App__"+str(Pl_Third_App)
print right_URL
try:
browser.get(right_URL)
print "loading more, sleep 3 seconds ... 0"
time.sleep(3) # NO need for this sleep, but we add ...
browser = selenuim_loading_more(browser, method_index=0)
except:
print "one exception happen ==> get_tweeter_under_topic 2 ..."
pass
然后模擬瀏覽器,加載更多(推薦使用method_index=0,已經(jīng)證明比其他好用很多):
def selenuim_loading_more(browser, method_index=0):
if method_index==0:
browser.implicitly_wait(3) # 為了快速滑動,先設(shè)置超時時間為1秒
# while True:
for i in range(1, 4): # at most 3 times
print "loading more, window.scrollTo bettom for the", i,"time ..."
browser.execute_script("window.scrollTo(0,document.body.scrollHeight);")
try:
# 定位頁面底部的換頁tab
browser.find_element_by_css_selector("div[class='W_pages']")
break # 如果沒拋出異常就說明找到了底部標(biāo)志,跳出循環(huán)
except NoSuchElementException:
pass # 拋出異常說明沒找到底部標(biāo)志,繼續(xù)向下滑動
browser.implicitly_wait(4) # 將超時時間改回10秒
elif method_index==1:
browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more
print "loading more, sleep 4 seconds ... 1"
time.sleep(4)
browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more
print "loading more, sleep 3 seconds ... 2"
time.sleep(2)
elif method_index==2:
load_more_1 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more
ActionChains(browser).click(load_more_1).perform()
print "loading more, sleep 4 seconds ... 1"
time.sleep(4)
load_more_2 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more
ActionChains(browser).click(load_more_2).perform()
print "loading more, sleep 3 seconds ... 2"
time.sleep(2)
elif method_index==3:
print "loading more, sleep 4 seconds ... 1"
element = WebDriverWait(browser, 4).until(
EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))
)
element.click()
print "loading more, sleep 2 seconds ... 2"
WebDriverWait(browser, 2).until(
EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))
).click()
return browser
以上就是本文的全部內(nèi)容,希望對大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。
相關(guān)文章
Python在for循環(huán)中更改list值的方法【推薦】
這篇文章主要介紹了Python在for循環(huán)中更改list值的方法,非常不錯,具有一定的參考借鑒價值,需要的朋友可以參考下2018-08-08
詳細(xì)講解用Python發(fā)送SMTP郵件的教程
這篇文章主要詳細(xì)講解了用Python發(fā)送SMTP郵件的教程,包括在郵件中添加圖片等文件,強烈推薦!需要的朋友可以參考下2015-04-04

