php抓取并保存網(wǎng)站圖片的實(shí)現(xiàn)代碼
此程序?qū)崿F(xiàn)了網(wǎng)頁(yè)源代碼捕獲,圖片鏈接獲取、分析、并將同樣的圖片鏈接合并功能,實(shí)現(xiàn)了圖片抓取功能。利用php強(qiáng)大的網(wǎng)絡(luò)內(nèi)容處理函數(shù)將指定的網(wǎng)站上的所有圖片抓取下來(lái),保存在當(dāng)前目錄下,以下為代碼:
<?php /*完成網(wǎng)頁(yè)內(nèi)容捕獲功能*/ function get_img_url($site_name){ $site_fd = fopen($site_name, "r"); $site_content = ""; while (!feof($site_fd)) { $site_content .= fread($site_fd, 1024); } /*利用正則表達(dá)式得到圖片鏈接*/ $reg_tag = '/<img.*?\"([^\"]*(jpg|bmp|jpeg|gif)).*?>/'; $ret = preg_match_all($reg_tag, $site_content, $match_result); fclose($site_fd); return $match_result[1]; } /* 對(duì)圖片鏈接進(jìn)行修正 */ function revise_site($site_list, $base_site){ foreach($site_list as $site_item) { if (preg_match('/^http/', $site_item)) { $return_list[] = $site_item; }else{ $return_list[] = $base_site."/".$site_item; } } return $return_list; } /*得到圖片名字,并將其保存在指定位置*/ function get_pic_file($pic_url_array, $pos){ $reg_tag = '/.*\/(.*?)$/'; $count = 0; foreach($pic_url_array as $pic_item){ $ret = preg_match_all($reg_tag,$pic_item,$t_pic_name); $pic_name = $pos.$t_pic_name[1][0]; $pic_url = $pic_item; print("Downloading ".$pic_url." "); $img_read_fd = fopen($pic_url,"r"); $img_write_fd = fopen($pic_name,"w"); $img_content = ""; while(!feof($img_read_fd)){ $img_content .= fread($img_read_fd,1024); } fwrite($img_write_fd,$img_content); fclose($img_read_fd); fclose($img_write_fd); print("[OK] "); } return 0; } function main(){ /* 待抓取圖片的網(wǎng)頁(yè)地址 */ $site_name = "http://www.dbjr.com.cn/sheying/391528.html"; $img_url = get_img_url($site_name); $img_url_revised = revise_site($img_url, $site_name); $img_url_unique = array_unique($img_url_revised); //unique array get_pic_file($img_url_unique,"./"); } main(); ?>
此程序還有待完善的地方是,如果圖片在網(wǎng)站服務(wù)器上不同目錄下但文件名是相同的,此時(shí)圖片有可能是不一樣的,但在最后保存時(shí),后面得到的圖片會(huì)將前面已經(jīng)保存的圖片覆蓋掉,解決方法是在每次保存前先檢索當(dāng)前目錄下是否已有此文件名,有的話對(duì)將要保存的圖片重新命名即可。
以上就是為大家分享的php抓取并保存網(wǎng)站圖片的方法,以及在實(shí)踐過(guò)程中修正程序不完善的地方,希望這篇文章對(duì)大家的學(xué)習(xí)有所幫助。
- PHP 抓取新浪讀書(shū)頻道的小說(shuō)并生成txt電子書(shū)的代碼
- 使用PHP curl模擬瀏覽器抓取網(wǎng)站信息
- PHP抓取、分析國(guó)內(nèi)視頻網(wǎng)站的視頻信息工具類
- php抓取網(wǎng)站圖片并保存的實(shí)現(xiàn)方法
- thinkphp 抓取網(wǎng)站的內(nèi)容并且保存到本地的實(shí)例詳解
- PHP封裝的遠(yuǎn)程抓取網(wǎng)站圖片并保存功能類
- php抓取頁(yè)面與代碼解析 推薦
- PHP實(shí)現(xiàn)抓取HTTPS內(nèi)容
- php抓取頁(yè)面的幾種方法詳解
- PHP實(shí)現(xiàn)的抓取小說(shuō)網(wǎng)站內(nèi)容功能示例
相關(guān)文章
淺析is_writable的php實(shí)現(xiàn)
本篇文章是對(duì)is_writable的php實(shí)現(xiàn)方法進(jìn)行了詳細(xì)的分析介紹,需要的朋友參考下2013-06-06- 現(xiàn)在很多網(wǎng)站都存在跨站腳本攻擊漏洞,讓黑客有機(jī)可乘.跨站攻擊很容易就可以構(gòu)造,而且非常隱蔽,不易被查覺(jué)(通常盜取信息后馬上跳轉(zhuǎn)回原頁(yè)面)。如何攻擊,在此不作介紹,主要談?wù)勅绾畏婪丁?/div> 2015-09-09
php實(shí)現(xiàn)登錄頁(yè)面的簡(jiǎn)單實(shí)例
在本篇文章里小編給大家分享的是關(guān)于php實(shí)現(xiàn)登錄頁(yè)面的簡(jiǎn)單實(shí)例以及相關(guān)知識(shí)點(diǎn),有需要的朋友們學(xué)習(xí)下。2019-09-09利用瀏覽器的Javascript控制臺(tái)調(diào)試PHP程序
現(xiàn)在,越來(lái)越多的瀏覽器都有了開(kāi)發(fā)這工具或者Javascript控制臺(tái),通過(guò)這些工具,我們可以很方便的顯示PHP代碼中的變量或數(shù)組值2014-01-01PHP的Laravel框架中使用AdminLTE模板來(lái)編寫(xiě)網(wǎng)站后臺(tái)界面
這篇文章主要介紹了PHP的Laravel框架中使用AdminLTE模板來(lái)編寫(xiě)網(wǎng)站后臺(tái)的方法,AdminLTE基于BootStrap,能幫助快速創(chuàng)建網(wǎng)站后臺(tái)管理面板界面,需要的朋友可以參考下2016-03-03最新評(píng)論