欧美bbbwbbbw肥妇,免费乱码人妻系列日韩,一级黄片

玩轉(zhuǎn)python爬蟲之URLError異常處理

 更新時(shí)間:2016年02月17日 15:14:01   作者:崔慶才  
這篇文章主要介紹了python爬蟲的URLError異常處理,詳細(xì)探尋一下URL\HTTP異常處理的相關(guān)內(nèi)容,通過一些具體的實(shí)例來分析一下,非常的簡單,但是卻很實(shí)用,感興趣的小伙伴們可以參考一下

本節(jié)在這里主要說的是URLError還有HTTPError,以及對(duì)它們的一些處理。

1.URLError

首先解釋下URLError可能產(chǎn)生的原因:

  • 網(wǎng)絡(luò)無連接,即本機(jī)無法上網(wǎng)
  • 連接不到特定的服務(wù)器
  • 服務(wù)器不存在

在代碼中,我們需要用try-except語句來包圍并捕獲相應(yīng)的異常。下面是一個(gè)例子,先感受下它的風(fēng)騷

import urllib2
 
requset = urllib2.Request('http://www.xxxxx.com')
try:
  urllib2.urlopen(requset)
except urllib2.URLError, e:
  print e.reason

我們利用了 urlopen方法訪問了一個(gè)不存在的網(wǎng)址,運(yùn)行結(jié)果如下:

[Errno 11004] getaddrinfo failed

它說明了錯(cuò)誤代號(hào)是11004,錯(cuò)誤原因是 getaddrinfo failed

2.HTTPError

HTTPError是URLError的子類,在你利用urlopen方法發(fā)出一個(gè)請(qǐng)求時(shí),服務(wù)器上都會(huì)對(duì)應(yīng)一個(gè)應(yīng)答對(duì)象response,其中它包含一個(gè)數(shù)字”狀態(tài)碼”。舉個(gè)例子,假如response是一個(gè)”重定向”,需定位到別的地址獲取文檔,urllib2將對(duì)此進(jìn)行處理。

其他不能處理的,urlopen會(huì)產(chǎn)生一個(gè)HTTPError,對(duì)應(yīng)相應(yīng)的狀態(tài)嗎,HTTP狀態(tài)碼表示HTTP協(xié)議所返回的響應(yīng)的狀態(tài)。下面將狀態(tài)碼歸結(jié)如下:

  • 100:繼續(xù)  客戶端應(yīng)當(dāng)繼續(xù)發(fā)送請(qǐng)求??蛻舳藨?yīng)當(dāng)繼續(xù)發(fā)送請(qǐng)求的剩余部分,或者如果請(qǐng)求已經(jīng)完成,忽略這個(gè)響應(yīng)。
  • 101: 轉(zhuǎn)換協(xié)議  在發(fā)送完這個(gè)響應(yīng)最后的空行后,服務(wù)器將會(huì)切換到在Upgrade 消息頭中定義的那些協(xié)議。只有在切換新的協(xié)議更有好處的時(shí)候才應(yīng)該采取類似措施。
  • 102:繼續(xù)處理   由WebDAV(RFC 2518)擴(kuò)展的狀態(tài)碼,代表處理將被繼續(xù)執(zhí)行。
  • 200:請(qǐng)求成功      處理方式:獲得響應(yīng)的內(nèi)容,進(jìn)行處理
  • 201:請(qǐng)求完成,結(jié)果是創(chuàng)建了新資源。新創(chuàng)建資源的URI可在響應(yīng)的實(shí)體中得到    處理方式:爬蟲中不會(huì)遇到
  • 202:請(qǐng)求被接受,但處理尚未完成    處理方式:阻塞等待
  • 204:服務(wù)器端已經(jīng)實(shí)現(xiàn)了請(qǐng)求,但是沒有返回新的信 息。如果客戶是用戶代理,則無須為此更新自身的文檔視圖。    處理方式:丟棄
  • 300:該狀態(tài)碼不被HTTP/1.0的應(yīng)用程序直接使用, 只是作為3XX類型回應(yīng)的默認(rèn)解釋。存在多個(gè)可用的被請(qǐng)求資源。    處理方式:若程序中能夠處理,則進(jìn)行進(jìn)一步處理,如果程序中不能處理,則丟棄
  • 301:請(qǐng)求到的資源都會(huì)分配一個(gè)永久的URL,這樣就可以在將來通過該URL來訪問此資源    處理方式:重定向到分配的URL
  • 302:請(qǐng)求到的資源在一個(gè)不同的URL處臨時(shí)保存     處理方式:重定向到臨時(shí)的URL
  • 304:請(qǐng)求的資源未更新     處理方式:丟棄
  • 400:非法請(qǐng)求     處理方式:丟棄
  • 401:未授權(quán)     處理方式:丟棄
  • 403:禁止     處理方式:丟棄
  • 404:沒有找到     處理方式:丟棄
  • 500:服務(wù)器內(nèi)部錯(cuò)誤  服務(wù)器遇到了一個(gè)未曾預(yù)料的狀況,導(dǎo)致了它無法完成對(duì)請(qǐng)求的處理。一般來說,這個(gè)問題都會(huì)在服務(wù)器端的源代碼出現(xiàn)錯(cuò)誤時(shí)出現(xiàn)。
  • 501:服務(wù)器無法識(shí)別  服務(wù)器不支持當(dāng)前請(qǐng)求所需要的某個(gè)功能。當(dāng)服務(wù)器無法識(shí)別請(qǐng)求的方法,并且無法支持其對(duì)任何資源的請(qǐng)求。
  • 502:錯(cuò)誤網(wǎng)關(guān)  作為網(wǎng)關(guān)或者代理工作的服務(wù)器嘗試執(zhí)行請(qǐng)求時(shí),從上游服務(wù)器接收到無效的響應(yīng)。
  • 503:服務(wù)出錯(cuò)   由于臨時(shí)的服務(wù)器維護(hù)或者過載,服務(wù)器當(dāng)前無法處理請(qǐng)求。這個(gè)狀況是臨時(shí)的,并且將在一段時(shí)間以后恢復(fù)。

HTTPError實(shí)例產(chǎn)生后會(huì)有一個(gè)code屬性,這就是是服務(wù)器發(fā)送的相關(guān)錯(cuò)誤號(hào)。
因?yàn)閡rllib2可以為你處理重定向,也就是3開頭的代號(hào)可以被處理,并且100-299范圍的號(hào)碼指示成功,所以你只能看到400-599的錯(cuò)誤號(hào)碼。

下面我們寫一個(gè)例子來感受一下,捕獲的異常是HTTPError,它會(huì)帶有一個(gè)code屬性,就是錯(cuò)誤代號(hào),另外我們又打印了reason屬性,這是它的父類URLError的屬性。

import urllib2
 
req = urllib2.Request('http://blog.csdn.net/cqcre')
try:
  urllib2.urlopen(req)
except urllib2.HTTPError, e:
  print e.code
  print e.reason

運(yùn)行結(jié)果如下

403
Forbidden

錯(cuò)誤代號(hào)是403,錯(cuò)誤原因是Forbidden,說明服務(wù)器禁止訪問。

我們知道,HTTPError的父類是URLError,根據(jù)編程經(jīng)驗(yàn),父類的異常應(yīng)當(dāng)寫到子類異常的后面,如果子類捕獲不到,那么可以捕獲父類的異常,所以上述的代碼可以這么改寫

import urllib2
 
req = urllib2.Request('http://blog.csdn.net/cqcre')
try:
  urllib2.urlopen(req)
except urllib2.HTTPError, e:
  print e.code
except urllib2.URLError, e:
  print e.reason
else:
  print "OK"

如果捕獲到了HTTPError,則輸出code,不會(huì)再處理URLError異常。如果發(fā)生的不是HTTPError,則會(huì)去捕獲URLError異常,輸出錯(cuò)誤原因。

另外還可以加入 hasattr屬性提前對(duì)屬性進(jìn)行判斷,代碼改寫如下

import urllib2
 
req = urllib2.Request('http://blog.csdn.net/cqcre')
try:
  urllib2.urlopen(req)
except urllib2.URLError, e:
  if hasattr(e,"code"):
    print e.code
  if hasattr(e,"reason"):
    print e.reason
else:
  print "OK"

首先對(duì)異常的屬性進(jìn)行判斷,以免出現(xiàn)屬性輸出報(bào)錯(cuò)的現(xiàn)象。

以上,就是對(duì)URLError和HTTPError的相關(guān)介紹,以及相應(yīng)的錯(cuò)誤處理辦法

相關(guān)文章

  • Python開發(fā)必須掌握的Pip使用全攻略

    Python開發(fā)必須掌握的Pip使用全攻略

    在這篇文章中,我們將深入探討Python的主要包管理工具——Pip,包括Pip的基本概念、安裝和配置、中國國內(nèi)鏡像源的使用等,需要的可以參考一下
    2023-07-07
  • Python連接數(shù)據(jù)庫使用matplotlib畫柱形圖

    Python連接數(shù)據(jù)庫使用matplotlib畫柱形圖

    這篇文章主要介紹了Python連接數(shù)據(jù)庫使用matplotlib畫柱形圖,文章通過實(shí)例展開對(duì)主題的相關(guān)介紹。具有一定的知識(shí)參考價(jià)值性,感興趣的小伙伴可以參考一下
    2022-06-06
  • 基于Python實(shí)現(xiàn)圖片九宮格切圖程序

    基于Python實(shí)現(xiàn)圖片九宮格切圖程序

    這篇文章主要為大家詳細(xì)介紹了如何利用python和C++代碼實(shí)現(xiàn)圖片九宮格切圖程序,文中的示例代碼講解詳細(xì),具有一定的借鑒價(jià)值,需要的可以參考一下
    2023-04-04
  • Python實(shí)現(xiàn)截屏的函數(shù)

    Python實(shí)現(xiàn)截屏的函數(shù)

    本文給大家分享的是使用Python實(shí)現(xiàn)截屏功能的函數(shù),十分的實(shí)用,有需要的小伙伴可以參考下。
    2015-07-07
  • Django {{ MEDIA_URL }}無法顯示圖片的解決方式

    Django {{ MEDIA_URL }}無法顯示圖片的解決方式

    這篇文章主要介紹了Django {{ MEDIA_URL }}無法顯示圖片的解決方式,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2020-04-04
  • python爬蟲之線程池和進(jìn)程池功能與用法詳解

    python爬蟲之線程池和進(jìn)程池功能與用法詳解

    這篇文章主要介紹了python爬蟲之線程池和進(jìn)程池功能與用法,結(jié)合實(shí)例形式分析了Python基于線程池與進(jìn)程池的爬蟲功能相關(guān)操作技巧與使用注意事項(xiàng),需要的朋友可以參考下
    2018-08-08
  • Python中整數(shù)的緩存機(jī)制講解

    Python中整數(shù)的緩存機(jī)制講解

    今天小編就為大家分享一篇關(guān)于Python中整數(shù)的緩存機(jī)制講解,小編覺得內(nèi)容挺不錯(cuò)的,現(xiàn)在分享給大家,具有很好的參考價(jià)值,需要的朋友一起跟隨小編來看看吧
    2019-02-02
  • 解決Python報(bào)錯(cuò):SyntaxError:?invalid?character?‘,‘?(U+FF0C)

    解決Python報(bào)錯(cuò):SyntaxError:?invalid?character?‘,‘?(U+FF0C)

    Python中的 SyntaxError錯(cuò)誤是Python語言中常見的異常錯(cuò)誤類型之一,表示語法錯(cuò)誤,下面這篇文章主要給大家介紹了關(guān)于解決Python報(bào)錯(cuò):SyntaxError:?invalid?character?‘,‘?(U+FF0C)的相關(guān)資料,需要的朋友可以參考下
    2022-12-12
  • Python遞歸生成全排列序列實(shí)操

    Python遞歸生成全排列序列實(shí)操

    這篇文章主要介紹了Python遞歸生成全排列序列實(shí)操,文章給予Python遞歸的相關(guān)資料展開對(duì)全排列序列的實(shí)現(xiàn)介紹,需要的小伙伴可以參考一下
    2022-04-04
  • Permission denied的解決方法

    Permission denied的解決方法

    這篇文章主要介紹了Permission denied的解決方法,希望能給你帶來幫助
    2021-08-08

最新評(píng)論