欧美bbbwbbbw肥妇,免费乱码人妻系列日韩,一级黄片

Python?Ajax爬蟲案例分享

 更新時間:2022年02月03日 13:43:04   作者:BoBo?yeah??  
這篇文章主要介紹了Python?Ajax爬蟲案例分享,文章會從街拍鏈接里面爬取圖片結(jié)構(gòu),下面文章對正在學(xué)習(xí)的你有一定的幫助,需要的小伙伴可以參考一下

1. 抓取街拍圖片

街拍圖片網(wǎng)址

2. 分析街拍圖片結(jié)構(gòu)

keyword: 街拍
pd: atlas
dvpf: pc
aid: 4916
page_num: 1
search_json: {"from_search_id":"20220104115420010212192151532E8188","origin_keyword":"街拍","image_keyword":"街拍"}
rawJSON: 1
search_id: 202201041159040101501341671A4749C4

可以找到規(guī)律,page_num從1開始累加,其他參數(shù)不變

3. 按功能不同編寫不同方法組織代碼

3.1 獲取網(wǎng)頁json格式數(shù)據(jù)

def get_page(page_num):
? ? global headers
? ? headers = {
? ? ? ? 'Host': 'so.toutiao.com',
? ? ? ? #'Referer': 'https://so.toutiao.com/search?keyword=%E8%A1%97%E6%8B%8D&pd=atlas&dvpf=pc&aid=4916&page_num=0&search_json={%22from_search_id%22:%22202112272022060101510440283EE83D67%22,%22origin_keyword%22:%22%E8%A1%97%E6%8B%8D%22,%22image_keyword%22:%22%E8%A1%97%E6%8B%8D%22}',
? ? ? ? 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/86.0.4240.198 Safari/537.36',
? ? ? ? 'X-Requested-With': 'XMLHttpRequest',
? ? ? ? 'Cookie': 'msToken=S0DFBkZ9hmyLOGYd3_QjhhXgrm38qTyOITnkNb0t_oavfbVxuYV1JZ0tT5hLgswSfmZLFD6c2lONm_5TomUQXVXjen7CIxM2AGwbhHRYKjhg; _S_DPR=1.5; _S_IPAD=0; MONITOR_WEB_ID=7046351002275317255; ttwid=1%7C0YdWalNdIiSpIk3CvvHwV25U8drq3QAj08E8QOApXhs%7C1640607595%7C720e971d353416921df127996ed708931b4ae28a0a8691a5466347697e581ce8; _S_WIN_WH=262_623'
? ? }
? ? params = {
? ? ? ? 'keyword': '街拍',
? ? ? ? 'pd': 'atlas',
? ? ? ? 'dvpf': 'pc',
? ? ? ? 'aid': '4916',
? ? ? ? 'page_num': page_num,
? ? ? ? 'search_json': '%7B%22from_search_id%22%3A%22202112272022060101510440283EE83D67%22%2C%22origin_keyword%22%3A%22%E8%A1%97%E6%8B%8D%22%2C%22image_keyword%22%3A%22%E8%A1%97%E6%8B%8D%22%7D',
? ? ? ? 'rawJSON': 1,
? ? ? ? 'search_id': '2021122721183101015104402851E3883D'
? ? }
? ? url = 'https://so.toutiao.com/search?' + urlencode(params)
? ? print(url)
? ? try:
? ? ? ? response=requests.get(url,headers=headers,params=params)
? ? ? ? if response.status_code == 200:
? ? ? ? #if response.content:
? ? ? ? ? ? #print(response.json())
? ? ? ? ? ? return response.json()
? ? except requests.ConnectionError:
? ? ? ? return None

3.2 從json格式數(shù)據(jù)提取街拍圖片

def get_images(json):
? ? images = json.get('rawData').get('data')
? ? for image in images:
? ? ? ? link = image.get('img_url')
? ? ? ? yield link

3.3 將街拍圖片以其md5碼命名并保存圖片

實現(xiàn)一個保存圖片的方法save_image(),其中 item 就是前面 get_images() 方法返回的一個字典。在該方法中,首先根據(jù) item 的 title 來創(chuàng)建文件夾,然后請求這個圖片鏈接,獲取圖片的二進(jìn)制數(shù)據(jù),以二進(jìn)制的形式寫入文件。圖片的名稱可以使用其內(nèi)容的 MD5 值,這樣可以去除重復(fù)。相關(guān)

代碼如下:

def save_image(link):
? ? data = requests.get(link).content
? ? with open(f'./image/{md5(data).hexdigest()}.jpg', 'wb')as f:#使用data的md5碼作為圖片名
? ? ? ? f.write(data)

3.4 main()調(diào)用其他函數(shù)

def main(page_num):
? ? json = get_page(page_num)
? ? for link in get_images(json):
? ? ? ? #print(link)
? ? ? ? save_image(link)

4 抓取20page今日頭條街拍圖片數(shù)據(jù)

這里定義了分頁的起始頁數(shù)和終止頁數(shù),分別為GROUP_START GROUP_END,還利用了多線程的線程池,調(diào)用其 map() 方法實現(xiàn)程下載。

if __name__ == '__main__':
? ? GROUP_START = 1
? ? GROUP_END = 20
? ? pool = Pool()
? ? groups = ([x for x in range(GROUP_START, GROUP_END + 1)])
? ? #print(groups)
? ? pool.map(main, groups)
? ? pool.close()
? ? pool.join()
import requests
from urllib.parse import urlencode
from hashlib import md5
from multiprocessing.pool import Pool
def get_page(page_num):
? ? global headers
? ? headers = {
? ? ? ? 'Host': 'so.toutiao.com',
? ? ? ? #'Referer': 'https://so.toutiao.com/search?keyword=%E8%A1%97%E6%8B%8D&pd=atlas&dvpf=pc&aid=4916&page_num=0&search_json={%22from_search_id%22:%22202112272022060101510440283EE83D67%22,%22origin_keyword%22:%22%E8%A1%97%E6%8B%8D%22,%22image_keyword%22:%22%E8%A1%97%E6%8B%8D%22}',
? ? ? ? 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/86.0.4240.198 Safari/537.36',
? ? ? ? 'X-Requested-With': 'XMLHttpRequest',
? ? ? ? 'Cookie': 'msToken=S0DFBkZ9hmyLOGYd3_QjhhXgrm38qTyOITnkNb0t_oavfbVxuYV1JZ0tT5hLgswSfmZLFD6c2lONm_5TomUQXVXjen7CIxM2AGwbhHRYKjhg; _S_DPR=1.5; _S_IPAD=0; MONITOR_WEB_ID=7046351002275317255; ttwid=1%7C0YdWalNdIiSpIk3CvvHwV25U8drq3QAj08E8QOApXhs%7C1640607595%7C720e971d353416921df127996ed708931b4ae28a0a8691a5466347697e581ce8; _S_WIN_WH=262_623'
? ? }
? ? params = {
? ? ? ? 'keyword': '街拍',
? ? ? ? 'pd': 'atlas',
? ? ? ? 'dvpf': 'pc',
? ? ? ? 'aid': '4916',
? ? ? ? 'page_num': page_num,
? ? ? ? 'search_json': '%7B%22from_search_id%22%3A%22202112272022060101510440283EE83D67%22%2C%22origin_keyword%22%3A%22%E8%A1%97%E6%8B%8D%22%2C%22image_keyword%22%3A%22%E8%A1%97%E6%8B%8D%22%7D',
? ? ? ? 'rawJSON': 1,
? ? ? ? 'search_id': '2021122721183101015104402851E3883D'
? ? }
? ? url = 'https://so.toutiao.com/search?' + urlencode(params)
? ? print(url)
? ? try:
? ? ? ? response=requests.get(url,headers=headers,params=params)
? ? ? ? if response.status_code == 200:
? ? ? ? #if response.content:
? ? ? ? ? ? #print(response.json())
? ? ? ? ? ? return response.json()
? ? except requests.ConnectionError:
? ? ? ? return None

def get_images(json):
? ? images = json.get('rawData').get('data')
? ? for image in images:
? ? ? ? link = image.get('img_url')
? ? ? ? yield link


def save_image(link):
? ? data = requests.get(link).content
? ? with open(f'./image/{md5(data).hexdigest()}.jpg', 'wb')as f:#使用data的md5碼作為圖片名
? ? ? ? f.write(data)


def main(page_num):
? ? json = get_page(page_num)
? ? for link in get_images(json):
? ? ? ? #print(link)
? ? ? ? save_image(link)


if __name__ == '__main__':
? ? GROUP_START = 1
? ? GROUP_END = 20
? ? pool = Pool()
? ? groups = ([x for x in range(GROUP_START, GROUP_END + 1)])
? ? #print(groups)
? ? pool.map(main, groups)
? ? pool.close()
? ? pool.join()

到此這篇關(guān)于Python Ajax爬蟲案例分享的文章就介紹到這了,更多相關(guān)Python Ajax爬蟲內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • pytorch-神經(jīng)網(wǎng)絡(luò)擬合曲線實例

    pytorch-神經(jīng)網(wǎng)絡(luò)擬合曲線實例

    今天小編就為大家分享一篇pytorch-神經(jīng)網(wǎng)絡(luò)擬合曲線實例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-01-01
  • Python數(shù)據(jù)分析中Groupby用法之通過字典或Series進(jìn)行分組的實例

    Python數(shù)據(jù)分析中Groupby用法之通過字典或Series進(jìn)行分組的實例

    下面小編就為大家分享一篇Python數(shù)據(jù)分析中Groupby用法之通過字典或Series進(jìn)行分組的實例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2017-12-12
  • Python PySpider爬蟲框架安裝使用教程

    Python PySpider爬蟲框架安裝使用教程

    PySpider是一個Python編寫的分布式網(wǎng)絡(luò)爬蟲框架,它可以幫助開發(fā)者快速構(gòu)建和部署爬蟲,并支持爬蟲任務(wù)的分布式運行,PySpider基于Twisted網(wǎng)絡(luò)框架和MongoDB數(shù)據(jù)庫,具有高效、穩(wěn)定、易用等特點,同時還提供了一套Web界面,可以方便地查看爬蟲任務(wù)的運行狀態(tài)和結(jié)果
    2023-11-11
  • 基于Python實現(xiàn)批量讀取大量nc格式文件并導(dǎo)出全部時間信息

    基于Python實現(xiàn)批量讀取大量nc格式文件并導(dǎo)出全部時間信息

    這篇文章主要為大家詳細(xì)介紹了如何基于Python語言,逐一讀取大量.nc格式的多時相柵格文件并導(dǎo)出其中所具有的全部時間信息的方法,需要的可以參考下
    2024-01-01
  • 使用pandas的DataFrame的plot方法繪制圖像的實例

    使用pandas的DataFrame的plot方法繪制圖像的實例

    今天小編就為大家分享一篇使用pandas的DataFrame的plot方法繪制圖像的實例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-05-05
  • PyQt5的安裝配置過程,將ui文件轉(zhuǎn)為py文件后顯示窗口的實例

    PyQt5的安裝配置過程,將ui文件轉(zhuǎn)為py文件后顯示窗口的實例

    今天小編就為大家分享一篇PyQt5的安裝配置過程,將ui文件轉(zhuǎn)為py文件后顯示窗口的實例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-06-06
  • Python遠(yuǎn)程linux執(zhí)行命令實現(xiàn)

    Python遠(yuǎn)程linux執(zhí)行命令實現(xiàn)

    這篇文章主要介紹了Python遠(yuǎn)程linux執(zhí)行命令實現(xiàn),文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2020-11-11
  • Python利用itchat對微信中好友數(shù)據(jù)實現(xiàn)簡單分析的方法

    Python利用itchat對微信中好友數(shù)據(jù)實現(xiàn)簡單分析的方法

    Python 熱度一直很高,我感覺這就是得益于擁有大量的包資源,極大的方便了開發(fā)人員的需求。下面這篇文章主要給大家介紹了關(guān)于Python利用itchat實現(xiàn)對微信中好友數(shù)據(jù)進(jìn)行簡單分析的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),需要的朋友可以參考下。
    2017-11-11
  • python FastApi實現(xiàn)數(shù)據(jù)表遷移流程詳解

    python FastApi實現(xiàn)數(shù)據(jù)表遷移流程詳解

    今天我們來聊一聊在FastApi里面,數(shù)據(jù)遷移工作,F(xiàn)astAPI是一個現(xiàn)代的,快速(高性能)python web框架。本文將利用fastapi實現(xiàn)數(shù)據(jù)表遷移功能,文中的示例代碼講解詳細(xì),需要的可以參考一下
    2022-08-08
  • 如何利用Python實現(xiàn)簡易的音頻播放器

    如何利用Python實現(xiàn)簡易的音頻播放器

    這篇文章主要介紹了如何利用Python實現(xiàn)簡易的音頻播放器,需要用到的庫有pygame和tkinter,實現(xiàn)音頻播放的功能,供大家學(xué)習(xí)參考,希望對你有所幫助
    2022-03-03

最新評論