欧美bbbwbbbw肥妇,免费乱码人妻系列日韩,一级黄片

python繞過(guò)圖片滑動(dòng)驗(yàn)證碼實(shí)現(xiàn)爬取PTA所有題目功能 附源碼

 更新時(shí)間:2021年01月06日 17:22:09   作者:XWHat__  
這篇文章主要介紹了python繞過(guò)圖片滑動(dòng)驗(yàn)證碼實(shí)現(xiàn)爬取PTA所有題目 附源碼,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下

最近學(xué)了python爬蟲(chóng),本著學(xué)以致用的態(tài)度去應(yīng)用在生活中。突然發(fā)現(xiàn)算法的考試要來(lái)了,范圍就是PTA刷過(guò)的題。讓我一個(gè)個(gè)復(fù)制粘貼?不可能,必須爬它!

先開(kāi)頁(yè)面,人傻了,PTA的題目是異步加載的,爬了個(gè)寂寞(空數(shù)據(jù))。AJAX我又不熟,突然想到了selenium。

selenium可以模擬人的操作讓瀏覽器自動(dòng)執(zhí)行動(dòng)作,具體的自己去了解,不多說(shuō)了。干貨來(lái)了:

登錄界面有個(gè)圖片的滑動(dòng)驗(yàn)證碼

驗(yàn)證碼

破解它的最好方式就是用opencv,opencv巨強(qiáng),自己了解。
思路開(kāi)始:
1.將背景圖片和可滑動(dòng)的圖片下載
2.用opencv匹配這兩張圖片的最匹配位置,不用在意怎么實(shí)現(xiàn)的,算法極其BT,不是我這種數(shù)學(xué)不及格的人能想的。最終會(huì)得到一個(gè)匹配度最高的XY值
3.由于Y值不用考慮,拖動(dòng)滑塊是X值的事情,調(diào)用selenium里抓放的函數(shù),把X值丟進(jìn)去,讓瀏覽器自動(dòng)滑動(dòng)即可。
注意:由于算法問(wèn)題,可能不能一次成功,重啟程序就行了,或者改動(dòng)代碼。
4.進(jìn)去之后就用selenium各種操作爬就完事了
以下是源碼:

from selenium import webdriver
from selenium.webdriver.common.action_chains import ActionChains
import requests
import time
import numpy
import cv2
import os

#作者:許文鴻
#未經(jīng)允許不可轉(zhuǎn)載,轉(zhuǎn)載時(shí)注明出處

#創(chuàng)建 WebDriver 對(duì)象,指明使用chrome瀏覽器驅(qū)動(dòng)
web = webdriver.Chrome(r'd:\chromedriver.exe')
web.implicitly_wait(5)
#調(diào)用WebDriver 對(duì)象的get方法 可以讓瀏覽器打開(kāi)指定網(wǎng)址
web.get('https://pintia.cn/auth/login')
zh = web.find_element_by_xpath('/html/body/div[1]/div[3]/div/div[2]/form/div[1]/div[1]/div/div/div[1]/input')
mm = web.find_element_by_xpath('/html/body/div[1]/div[3]/div/div[2]/form/div[1]/div[2]/div/div/div[1]/input')

#在PTA的賬號(hào)密碼:
zh.send_keys('******@qq.com')
mm.send_keys('******')
#找到登錄按鈕并點(diǎn)擊
web.find_element_by_xpath('/html/body/div[1]/div[3]/div/div[2]/form/div[2]/button/div/div').click()
#等待兩秒,驗(yàn)證碼加載完成
time.sleep(2)
#bg背景圖片
bg_img_src = web.find_element_by_xpath(
 '/html/body/div[3]/div[2]/div/div/div[2]/div/div[1]/div/div[1]/img[1]').get_attribute('src')
#front可拖動(dòng)圖片
front_img_src = web.find_element_by_xpath(
 '/html/body/div[3]/div[2]/div/div/div[2]/div/div[1]/div/div[1]/img[2]').get_attribute('src')
#保存圖片
with open("bg.jpg", mode="wb") as f:
 f.write(requests.get(bg_img_src).content)
with open("front.jpg", mode="wb") as f:
 f.write(requests.get(front_img_src).content)
#將圖片加載至內(nèi)存
bg = cv2.imread("bg.jpg")
front = cv2.imread("front.jpg")
js = 'alert("本人可能將此程序用于python課設(shè),請(qǐng)靚仔靚女不要直接提交本人代碼。即將報(bào)錯(cuò),需要?jiǎng)h除第42~44行代碼即可正常運(yùn)行");'
web.execute_script(js)
time.sleep(15)
#將背景圖片轉(zhuǎn)化為灰度圖片,將三原色降維
bg = cv2.cvtColor(bg, cv2.COLOR_BGR2GRAY)
#將可滑動(dòng)圖片轉(zhuǎn)化為灰度圖片,將三原色降維
front = cv2.cvtColor(front, cv2.COLOR_BGR2GRAY)
front = front[front.any(1)]
#用cv算法匹配精度最高的xy值
result = cv2.matchTemplate(bg, front, cv2.TM_CCOEFF_NORMED)
#numpy解析xy,注意xy與實(shí)際為相反,x=y,y=x
x, y = numpy.unravel_index(numpy.argmax(result), result.shape)
#找到可拖動(dòng)區(qū)域
div = web.find_element_by_xpath('/html/body/div[3]/div[2]/div/div/div[2]/div/div[2]/div[2]')
#拖動(dòng)滑塊,以實(shí)際相反的y值代替x
ActionChains(web).drag_and_drop_by_offset(div, xoffset=y // 0.946, yoffset=0).perform()

#至此成功破解驗(yàn)證碼,由于算法問(wèn)題,準(zhǔn)確率不能達(dá)到100%,可能需要多運(yùn)行1~2次

for page in range(0, 1000):
 time.sleep(1)
 #此處的網(wǎng)址為PTA固定網(wǎng)頁(yè),僅需要更換page
 web.get('https://pintia.cn/problem-sets?tab=1&filter=all&page={page_}'.format(page_=page))
 #獲取當(dāng)前頁(yè)面題目集網(wǎng)址,A_s為a標(biāo)簽的列表,urls用戶存放網(wǎng)址
 A_s = web.find_elements_by_class_name('name_QIjv7')
 urls = []
 for a in A_s:
  urls.append(a.get_attribute('href'))
 #當(dāng)頁(yè)面不存在可爬取的網(wǎng)址,則退出程序
 if urls.__len__() == 0:
  print('爬取完成')
  os._exit()
 #對(duì)剛才獲取的網(wǎng)址列表進(jìn)行遍歷
 for url in urls:
  web.get(url)
  #找到對(duì)應(yīng)的題目對(duì)象
  tm = web.find_elements_by_css_selector("[class='problemStatusRect_3kpmC PROBLEM_ACCEPTED_1Dzzi']")
  tm_total = 0
  for i in range(0, 1000):
   # 遍歷該頁(yè)面的題型
   try:
    tm_type = web.find_element_by_xpath(
     '/html/body/div/div[3]/div[2]/div/div[2]/div[{i_}]/div/div[2]'.format(i_=i * 2 + 2)).text
    # 如果題型為編程/函數(shù),記錄對(duì)應(yīng)的數(shù)量,方便后續(xù)爬取
    if tm_type == '編程題' or tm_type == '函數(shù)題':
     tm_total += int(web.find_element_by_xpath(
      '/html/body/div/div[3]/div[2]/div/div[2]/div[{i_}]/a/div/div'.format(i_=i * 2 + 2)).text[0])
   except:
    break
  # 根據(jù)函數(shù)/編程題數(shù)量取相應(yīng)的題目對(duì)象,舍棄其他題目
  if tm_total != 0:
   tm = tm[-tm_total:]
  else:
   tm = []
  # 遍歷剩余題目
  for tm_index in tm:
   try:
    tm_index.click()
    time.sleep(0.5)
    #獲取題目中的代碼
    tm_title = web.find_element_by_css_selector(
     "[class='text-center black-3 text-4 font-weight-bold my-3']").text
    mycode = web.find_element_by_css_selector('textarea').get_attribute('value')
    print('題目:' + tm_title)
    print(mycode)
    #接下來(lái)可以存入
   except:
    continue

到此這篇關(guān)于python繞過(guò)圖片滑動(dòng)驗(yàn)證碼實(shí)現(xiàn)爬取PTA所有題目功能 附源碼的文章就介紹到這了,更多相關(guān)python圖片滑動(dòng)驗(yàn)證碼內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python繪圖中的?四個(gè)繪圖技巧

    python繪圖中的?四個(gè)繪圖技巧

    在可視化數(shù)據(jù)時(shí),通常需要在單個(gè)圖形中繪制多個(gè)圖形。?例如,如果您想從不同的角度可視化相同的變量如:數(shù)字變量的并排直方圖和箱線圖,則多個(gè)圖形很有用。?在這篇文章中,我分享了繪制多個(gè)圖形的?4?個(gè)簡(jiǎn)單但實(shí)用的技巧,具有一定的參考價(jià)值,需要的小伙伴可以參考一下
    2021-12-12
  • Pytorch中的數(shù)據(jù)集劃分&正則化方法

    Pytorch中的數(shù)據(jù)集劃分&正則化方法

    這篇文章主要介紹了Pytorch中的數(shù)據(jù)集劃分&正則化方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教
    2021-05-05
  • Python簡(jiǎn)單實(shí)現(xiàn)Base64編碼和解碼的方法

    Python簡(jiǎn)單實(shí)現(xiàn)Base64編碼和解碼的方法

    這篇文章主要介紹了Python簡(jiǎn)單實(shí)現(xiàn)Base64編碼和解碼的方法,結(jié)合具體實(shí)例形式分析了Python實(shí)現(xiàn)base64編碼解碼相關(guān)函數(shù)與使用技巧,需要的朋友可以參考下
    2017-04-04
  • 詳解如何使用Python隱藏圖像中的數(shù)據(jù)

    詳解如何使用Python隱藏圖像中的數(shù)據(jù)

    隱寫(xiě)術(shù)是在任何文件中隱藏秘密數(shù)據(jù)的藝術(shù)。隱寫(xiě)術(shù)的主要目的是隱藏任何文件中的預(yù)期信息,而不實(shí)際改變文件的外觀,即文件外觀看起來(lái)和以前一樣。本文將利用Python實(shí)現(xiàn)隱藏圖像中的數(shù)據(jù),需要的可以參考一下
    2022-02-02
  • python執(zhí)行js腳本報(bào)錯(cuò)CryptoJS is not defined問(wèn)題

    python執(zhí)行js腳本報(bào)錯(cuò)CryptoJS is not defined問(wèn)題

    這篇文章主要介紹了python執(zhí)行js腳本報(bào)錯(cuò)CryptoJS is not defined問(wèn)題,具有很好的參考價(jià)值,希望對(duì)大家有所幫助,如有錯(cuò)誤或未考慮完全的地方,望不吝賜教
    2024-05-05
  • Python正則表達(dá)式re.sub()用法詳解

    Python正則表達(dá)式re.sub()用法詳解

    re.sub用于替換字符串中的匹配項(xiàng),下面這篇文章主要給大家介紹了關(guān)于Python正則表達(dá)式re.sub()用法的相關(guān)資料,文中通過(guò)實(shí)例代碼以及圖文介紹的非常詳細(xì),需要的朋友可以參考下
    2022-09-09
  • python 字典訪問(wèn)的三種方法小結(jié)

    python 字典訪問(wèn)的三種方法小結(jié)

    今天小編就為大家分享一篇python 字典訪問(wèn)的三種方法小結(jié),具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2019-12-12
  • 利用python為PostgreSQL的表自動(dòng)添加分區(qū)

    利用python為PostgreSQL的表自動(dòng)添加分區(qū)

    這篇文章主要介紹了利用python為PostgreSQL的表自動(dòng)添加分區(qū),文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2021-01-01
  • 基于K-Means聚類(lèi)算法演示及可視化展示

    基于K-Means聚類(lèi)算法演示及可視化展示

    這篇文章主要介紹了基于K-Means聚類(lèi)算法演示及可視化展示,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教
    2022-11-11
  • PyHacker編寫(xiě)指南引用Nmap模塊實(shí)現(xiàn)端口掃描器

    PyHacker編寫(xiě)指南引用Nmap模塊實(shí)現(xiàn)端口掃描器

    這篇文章主要為大家介紹了PyHacker編寫(xiě)指南Nmap模塊實(shí)現(xiàn)端口掃描,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2022-05-05

最新評(píng)論