欧美bbbwbbbw肥妇,免费乱码人妻系列日韩,一级黄片

PHP使用三種方法實現數據采集

 更新時間:2021年04月19日 10:31:05   作者:傾城一笑stu  
這篇文章主要介紹了PHP使用三種方法實現數據采集,對數據采集感興趣的同學,可以參考下

什么叫采集?

就是使用PHP程序,把其他網站中的信息抓取到我們自己的數據庫中、網站中。

PHP制作采集的技術

從底層的socket到高層的文件操作函數,一共有3種方法可以實現采集。

1. 使用socket技術采集:

socket采集是最底層的,它只是建立了一個長連接,然后我們要自己構造http協(xié)議字符串去發(fā)送請求。

例如要想獲取這個頁面的內容,http://tv.youku.com/?spm=a2hww.20023042.topNav.5~1~3!2~A,用socket寫如下:

<?php
//連接,$error錯誤編號,$errstr錯誤的字符串,30s是連接超時時間
$fp=fsockopen("www.youku.com",80,$errno,$errstr,30);
if(!$fp) die("連接失敗".$errstr);
 
//構造http協(xié)議字符串,因為socket編程是最底層的,它還沒有使用http協(xié)議
$http="GET /?spm=a2hww.20023042.topNav.5~1~3!2~A HTTP/1.1\r\n";   //  \r\n表示前面的是一個命令
$http.="Host:www.youku.com\r\n";  //請求的主機
$http.="Connection:close\r\n\r\n";   // 連接關閉,最后一行要兩個\r\n
 
//發(fā)送這個字符串到服務器
fwrite($fp,$http,strlen($http));
//接收服務器返回的數據
$data='';
while (!feof($fp)) {
$data.=fread($fp,4096);  //fread讀取返回的數據,一次讀取4096字節(jié)
}
//關閉連接
fclose($fp);
var_dump($data);
?>

打印出的結果如下,包含了返回的頭信息及頁面的源碼:

2. 使用curl_一套函數

curl把HTTP協(xié)議都封裝成了很多函數,直接傳相應參數即可,降低了編寫HTTP協(xié)議字符串的難度。

前提:在php.ini中要開啟curl擴展。

//生成一個curl對象
$curl=curl_init();
//設置URL和相應的選項
curl_setopt($curl, CURLOPT_URL, "http://www.youku.com");
curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);  //將curl_exec()獲取的信息以字符串返回,而不是直接輸出。
//執(zhí)行curl操作
$data=curl_exec($curl);
var_dump($data);

打印出的結果如下,只包含頁面的源碼:

3. 直接使用file_get_contents(最頂層的)

前提:在php.ini中設置允許打開一個網絡的url地址。

//使用file_get_contents()
$data=file_get_contents("http://www.youku.com");
var_dump($data);

3種方式的選擇

網絡之間通信主要使用的是以上三種。其中后兩種用的較多:如果要批量采集大量的數據時使用第二種【CURL】,性能好、穩(wěn)定。

偶爾發(fā)幾個請求發(fā)的頻繁不密集時使用第三種。

擴展:圖片的防盜鏈如何破?

比如7060網站上的圖片做了防盜鏈:在他的網站中可以看到圖片,把圖片拿到站外就無法訪問。

原理:在HTTP協(xié)議中有一個referer項,代表發(fā)這個請求的來源地址,服務器會判斷如果這個請求不是這個網站發(fā)來的就會過濾掉這個請求:

解決辦法:發(fā)HTTP時自己模擬referer即可:

擴展:有些要采集數據時時必須先登錄,可以使用模擬的試模擬在登錄狀態(tài)下的采集:

a. 先用瀏覽登錄一下,登錄完,瀏覽器的COOKIE中就會有SESSIONID

b. 發(fā)PHP發(fā)HTTP協(xié)議時,把瀏覽器中的SESSIONID放到PHP的HTTP協(xié)議請求里,這樣就在以登錄的狀態(tài)發(fā)請求。

總結:所有客戶端發(fā)過來的數據都可以被模擬,所以服務器上的程序必須要必要的地方過濾客戶端的數據。

什么時候用以上東西?接口開發(fā)時、采集時。

數據采集

例如我要采集這個url里的所有美國電影的信息,

http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html

則先要知道電影所在的節(jié)點的結構,我們使用firebug查看。

然后開始寫代碼:完整代碼如下

/**
 * 發(fā)一個GET請求獲取數據
 */
function get($url)
{
   global $curl;
   // 配置curl中的http協(xié)議->可配置的薦可以查PHP手冊中的curl_
   curl_setopt($curl, CURLOPT_URL, $url);
   curl_setopt($curl, CURLOPT_RETURNTRANSFER, TRUE);
   curl_setopt($curl, CURLOPT_HEADER, FALSE);
   // 執(zhí)行這個請求
   return curl_exec($curl);
}
 
// 生成一個curl對象
$curl = curl_init();
$url='http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html';
$data=get($url);
// 匹配電影所在位置
$list_preg = '/<li class="yk-col4 mr1">.+<\/li>/Us';
// 匹配img標簽上的src和alt
$img_preg = '/<img class="quic" _src="(.*)" src="(.*)" alt="(.*)" \/>/U';
//匹配電影的url
$video_preg='/<a href="(.*)" rel="external nofollow"  title="(.*)" target="(.*)"><\/a>/U';
//把所有的li存到$list里,$list是個二維數組
preg_match_all($list_preg,$data,$list);
   //var_dump($list);
foreach ($list[0] as $k => $v) {   //這里$v就是每一個li標簽
/* 獲取圖片及電影名稱
    preg_match($img_preg,$v,$img);  //把匹配到的圖片的信息存到$img里
    var_dump($img);
    */
    /*獲取電影地址
    preg_match($video_preg,$v,$video);  //把匹配到的電影的信息存到$video里
    var_dump($video);
*/
    preg_match($img_preg,$v,$img);
    preg_match($video_preg,$v,$video);
    echo $img[0].'<a href="'.$video[1].'" rel="external nofollow" >'.$video[2].'</a>';
}

測試:

打印$list;

打印$img

打印$video

最終效果:

如果需要把圖片拷貝到硬盤上,則在foreach循環(huán)里加上以下代碼:

 $imgData = get($img[1]);
    // 把圖片文件寫到硬盤上【下載】
    // 因為操作系統(tǒng)是GBK的,所以要把UTF8轉成GBK
    is_dir('./youkuimg/') ? '': mkdir('./youkuimg/');
	file_put_contents('./youkuimg/'.mb_convert_encoding($img[3], 'gbk', 'utf-8').'.jpg', $imgData);

效果如下:在當前目錄下的youkuimg目錄下就會有下載好的圖片。

以上就是PHP使用三種方法實現數據采集的詳細內容,更多關于PHP使數據采集的資料請關注腳本之家其它相關文章!

相關文章

  • PHP設計模式之簡單工廠和工廠模式實例分析

    PHP設計模式之簡單工廠和工廠模式實例分析

    這篇文章主要介紹了PHP設計模式之簡單工廠和工廠模式,結合實例形式分析了php設計模式中工廠模式的實現方法及相關操作注意事項,需要的朋友可以參考下
    2019-03-03
  • PHP如何防止XSS攻擊與XSS攻擊原理的講解

    PHP如何防止XSS攻擊與XSS攻擊原理的講解

    今天小編就為大家分享一篇關于PHP如何防止XSS攻擊與XSS攻擊原理的講解,小編覺得內容挺不錯的,現在分享給大家,具有很好的參考價值,需要的朋友一起跟隨小編來看看吧
    2019-03-03
  • php不寫閉合標簽的好處

    php不寫閉合標簽的好處

    一開始寫PHP代碼的時候,我是要寫PHP閉合標簽的,之后這幾年,習慣改了,不再寫PHP標簽了。
    2014-03-03
  • yii框架源碼分析之創(chuàng)建controller代碼

    yii框架源碼分析之創(chuàng)建controller代碼

    我們可以看到有時會使用protected目錄下的controller,有時會使用module中controller,具體是如何處理的呢,請看如下的分析
    2011-06-06
  • php foreach 參數強制類型轉換的問題

    php foreach 參數強制類型轉換的問題

    大家都知道foreach的參數如果不是數組類型,在運行的時候 就會出現類似“Warning: Invalid argument supplied for foreach() in XXX”warning信息。
    2010-12-12
  • PHP中使用gettext來支持多語言的方法

    PHP中使用gettext來支持多語言的方法

    開發(fā)多語言的Web應用是一件非常困難的事,各個國家的字符集的編碼方式、貨幣符號、日期格式、數字格式、文字表現都各不相同.
    2011-05-05
  • php如何解決無法上傳大于8M的文件問題

    php如何解決無法上傳大于8M的文件問題

    這篇文章主要介紹了php如何解決無法上傳大于8M的文件問題,需要的朋友可以參考下
    2014-03-03
  • PHP實現約瑟夫環(huán)問題的方法分析

    PHP實現約瑟夫環(huán)問題的方法分析

    這篇文章主要介紹了PHP實現約瑟夫環(huán)問題的方法,結合實例形式分析了php使用循環(huán)與遞歸實現約瑟夫環(huán)的相關操作技巧,需要的朋友可以參考下
    2017-12-12
  • PHP會話處理的10個函數

    PHP會話處理的10個函數

    在PHP開發(fā)中,比起Cookie,Session 是存儲在服務器端的會話,相對安全,并且不像 Cookie 那樣有存儲長度限制,這里我們詳細介紹一下PHP處理會話函數將要用到10個函數
    2015-08-08
  • PHP底層運行機制與工作原理詳解

    PHP底層運行機制與工作原理詳解

    這篇文章主要介紹了PHP底層運行機制與工作原理,文中通過圖文介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2020-07-07

最新評論