快捷導(dǎo)航

Python實(shí)現(xiàn)可獲取網(wǎng)易頁(yè)面所有文本信息的網(wǎng)易網(wǎng)絡(luò)爬蟲功能示例

更新時(shí)間：2018年01月15日 11:00:36 作者：壞蛋是我

這篇文章主要介紹了Python實(shí)現(xiàn)可獲取網(wǎng)易頁(yè)面所有文本信息的網(wǎng)易網(wǎng)絡(luò)爬蟲功能,涉及Python針對(duì)網(wǎng)頁(yè)的獲取、字符串正則判定等相關(guān)操作技巧,需要的朋友可以參考下

本文實(shí)例講述了Python實(shí)現(xiàn)可獲取網(wǎng)易頁(yè)面所有文本信息的網(wǎng)易網(wǎng)絡(luò)爬蟲功能。分享給大家供大家參考，具體如下：

#coding=utf-8
#---------------------------------------
#  程序：網(wǎng)易爬蟲
#  作者：ewang
#  日期：2016-7-6
#  語(yǔ)言：Python 2.7
#  功能：獲取網(wǎng)易頁(yè)面中的文本信息并保存到TXT文件中。
#---------------------------------------
import string
import urllib2
import re
import os
class WangYi_Spider:
  #申明相關(guān)屬性
  def __init__(self):
    #給wangyiUrl屬性賦值
    self.wangyiUrl="http://www.163.com/"
    #用來保存頁(yè)面中文字信息
    self.pageinfor=[]
    print u'已經(jīng)啟動(dòng)網(wǎng)易爬蟲，爬爬...'
  #初始化加載頁(yè)面并將其轉(zhuǎn)碼存儲(chǔ)
  def wangyi(self):
    #讀取頁(yè)面的原始信息并將其從gbk轉(zhuǎn)碼
    Page=urllib2.urlopen(self.wangyiUrl).read().decode('gbk')
    #獲取頁(yè)面標(biāo)題
    title=self.find_title(Page)
    print u'網(wǎng)頁(yè)名稱:'+title
    #獲取頁(yè)面中文本信息
    self.save_infor(title)
  #查找頁(yè)面標(biāo)題
  def find_title(self,page):
    #匹配<title>xxxx</title>
    myTitle=re.search(r'<title>(.*?)</title>',page,re.S)
    #初始化標(biāo)題名為暫無標(biāo)題
    title=u'暫無標(biāo)題'
    #如果標(biāo)題存在把標(biāo)題賦值給title
    if myTitle:
      #(.*?)這稱作一個(gè)group，組是從1開始
      title=myTitle.group(1)
    else:
      print u'爬蟲報(bào)告：無法加載網(wǎng)頁(yè)標(biāo)題...'
    return title
  #保存頁(yè)面信息
  def save_infor(self,title):
    #加載頁(yè)面文本信息到數(shù)組中
    self.get_infor()
    #創(chuàng)建并打開本地文件
    f=open(title+'.txt','w+')
    #把獲取的頁(yè)面信息寫入文件中
    f.writelines(self.pageinfor)
    #關(guān)閉打開的文件
    f.close()
    print u'爬蟲報(bào)告：文件'+title+'.txt'+u'已經(jīng)下載:'+os.getcwd()
    print u'按任意鍵退出...'
    raw_input()
  #獲取頁(yè)面源碼并將其存儲(chǔ)到數(shù)組中
  def get_infor(self):
    #獲取頁(yè)面中的源碼
    page=urllib2.urlopen(self.wangyiUrl).read()
    #把頁(yè)面中的內(nèi)容gbk解碼然后獲取頁(yè)面中所有的文本信息
    self.deal_infor(page.decode('gbk'))
  #從頁(yè)面代碼中獲取所需文信息
  def deal_infor(self,page):
    #獲取<em >XXX</em>的文本信息XXX
    emTagItems=re.findall("<em.*?>(\W+?)</em>",page,re.S)
    #獲取<span>XXXX</a>的文本信息XXXX
    spanTagItems=re.findall("<span>(\W+?)</span>",page,re.S)
    #獲取<a .*>XXXX</a>的文本信息XXXX
    aTagItems=re.findall("<a.*?>(\W+?)</a>",page,re.S)
    #把em tag中獲取的文本信息添加到數(shù)組pageinfor中
    for emItem in emTagItems:
      #對(duì)獲取的文本信息用gbk進(jìn)行編碼
      self.pageinfor.append(emItem.encode('gbk')+'\n')
    #把span tag中獲取的文本信息添加到數(shù)組pageinfor中
    for spanItem in spanTagItems:
      #對(duì)獲取的文本信息用gbk進(jìn)行編碼
      self.pageinfor.append(spanItem.encode('gbk')+'\n')
    #把a(bǔ) tag中獲取的文本信息添加到數(shù)組pageinfor中
    for aItem in aTagItems:
      #對(duì)獲取的文本信息用gbk進(jìn)行編碼
      self.pageinfor.append(aItem.encode('gbk')+'\n')
#------------程序入口處----------------
print u"""#---------------------------------------
#  程序：網(wǎng)易爬蟲
#  作者：ewang
#  日期：2016-7-6
#  語(yǔ)言：Python 2.7
#  功能：獲取網(wǎng)易頁(yè)面中的文本信息并保存到TXT文件中
#--------------------------------------------------
"""
wangyiSpider=WangYi_Spider()
wangyiSpider.wangyi()

更多關(guān)于Python相關(guān)內(nèi)容可查看本站專題：《Python Socket編程技巧總結(jié)》、《Python正則表達(dá)式用法總結(jié)》、《Python數(shù)據(jù)結(jié)構(gòu)與算法教程》、《Python函數(shù)使用技巧總結(jié)》、《Python字符串操作技巧匯總》、《Python入門與進(jìn)階經(jīng)典教程》及《Python文件與目錄操作技巧匯總》

希望本文所述對(duì)大家Python程序設(shè)計(jì)有所幫助。

您可能感興趣的文章: