php使用iconv中文截?cái)鄦栴}的解決方法
本文實(shí)例講述了php使用iconv中文截?cái)鄦栴}的解決方法。分享給大家供大家參考。具體分析如下:
今天做了一個(gè)采集程序,原理很簡單,使用curl方法把對方頁面的html獲取分析,然后正則提取需要的數(shù)據(jù)并保存在數(shù)據(jù)庫。
由于對方頁面是GB2312編碼,而本地使用的是UTF-8編碼。因此在采集后需要進(jìn)行編碼轉(zhuǎn)換。
使用了iconv方法進(jìn)行編碼轉(zhuǎn)換
iconv — 字符串按要求的字符編碼來轉(zhuǎn)換
string iconv ( string $in_charset , string $out_charset , string $str )
將字符串 str 從 in_charset 轉(zhuǎn)換編碼到 out_charset 。
轉(zhuǎn)換的方法很簡單,直接使用iconv方法就可以了
<?php $content = iconv('GB2312', 'UTF-8', $content); //$content為采集到的內(nèi)容 ?>
試驗(yàn)了幾個(gè)頁面,都能正常采集。但在之后的采集中,有幾個(gè)頁面采集不完整。
一開始考慮是否正則有錯(cuò),檢查后排除此問題。經(jīng)過排查,發(fā)現(xiàn)經(jīng)過iconv轉(zhuǎn)碼后的內(nèi)容比采集的內(nèi)容少了一大段。
查看apache log,看到提示:Notice: iconv(): Detected an illegal character in input string。
翻查手冊,看到以下說明
如果你在 out_charset 后添加了字符串 //TRANSLIT,將啟用轉(zhuǎn)寫(transliteration)功能。這個(gè)意思是,當(dāng)一個(gè)字符不能被目標(biāo)字符集所表示時(shí),它可以通過一個(gè)或多個(gè)形似的字符來近似表達(dá)。
如果你添加了字符串 //IGNORE,不能以目標(biāo)字符集表達(dá)的字符將被默默丟棄。 否則, str 從第一個(gè)無效字符開始截?cái)嗖?dǎo)致一個(gè) E_NOTICE 。
原來iconv遇到不能識別的內(nèi)容,會從第一個(gè)不能識別的字符開始截?cái)?,并生成一個(gè)E_NOTICE。因此后邊的內(nèi)容被丟棄了。
而在輸出字符集后加上//IGNORE則只丟棄不能識別的內(nèi)容,而不會截?cái)嗪蛠G棄后面的內(nèi)容。
修改程序后一切正常
<?php $content = iconv('GB2312','UTF-8//IGNORE',$content);//$content為采集到的內(nèi)容 ?>
Tips:使用iconv時(shí),如果要使用UTF-8編碼的,請使用UTF-8而不要使用UTF8,因?yàn)閁TF8有些服務(wù)器會有問題。
希望本文所述對大家的php程序設(shè)計(jì)有所幫助。
- C# double和decimal數(shù)據(jù)類型以截?cái)嗟姆绞奖A糁付ǖ男?shù)位數(shù)
- MSSQL 將截?cái)嘧址蚨M(jìn)制數(shù)據(jù)問題的解決方法
- oracle中截?cái)啾淼氖褂媒榻B
- js中根據(jù)字?jǐn)?shù)截取字符串,不能截?cái)鄒rl
- c#完美截?cái)嘧址a(中文+非中文)
- PHP UTF8中文字符截?cái)嗪瘮?shù)代碼
- PHP在字符斷點(diǎn)處截?cái)辔淖值膶?shí)現(xiàn)代碼
- PHP連接MSSQL時(shí)nvarchar字段長度被截?cái)酁?55的解決方法
- PHP截?cái)鄻?biāo)題且兼容utf8和gb2312編碼
- js實(shí)現(xiàn)文字截?cái)喙δ?/a>
相關(guān)文章
修改Zend引擎實(shí)現(xiàn)PHP源碼加密的原理及實(shí)踐
來源:phphot PHP文件的源碼都是明文,這對于某些商業(yè)用途來說,并不適合。 因此考慮使用加密的手段保護(hù)源碼。 實(shí)在不耐煩等待zend出編譯器,而且編譯和加密本質(zhì)上不是一回事兒。自己動手、開始修改。2008-04-04PHP實(shí)現(xiàn)Redis分布式鎖的示例代碼
并發(fā)寫入問題可能導(dǎo)致數(shù)據(jù)不一致或重復(fù)寫入,為了解決這個(gè)問題,我們可以使用Redis實(shí)現(xiàn)分布式鎖,本文主要為大家介紹了PHP實(shí)現(xiàn)Redis分布式鎖的相關(guān)知識,希望對大家有所幫助2023-12-12php 下載保存文件保存到本地的兩種實(shí)現(xiàn)方法
以下是對php下載保存文件保存到本地的兩種實(shí)現(xiàn)方法進(jìn)行了介紹,需要的朋友可以過來參考下2013-08-08PHP實(shí)現(xiàn)利用MySQL保存session的方法
這篇文章主要介紹了PHP實(shí)現(xiàn)利用MySQL保存session的方法,是PHP程序設(shè)計(jì)中比較有實(shí)用價(jià)值的一個(gè)技巧,需要的朋友可以參考下2014-08-08PHP轉(zhuǎn)盤抽獎(jiǎng)接口實(shí)例
這篇文章主要介紹了PHP轉(zhuǎn)盤抽獎(jiǎng)接口的實(shí)現(xiàn)方法,實(shí)例分析了隨機(jī)抽獎(jiǎng)接口的實(shí)現(xiàn)原理與對應(yīng)數(shù)據(jù)庫操作的技巧,需要的朋友可以參考下2015-02-02php下利用curl判斷遠(yuǎn)程文件是否存在的實(shí)現(xiàn)代碼
php下利用curl判斷遠(yuǎn)程文件是否存在的實(shí)現(xiàn)代碼,我們有些程序因需要事先判斷文件是否存在然后再進(jìn)行后面的操作。2011-10-10利用PHP+JS實(shí)現(xiàn)搜索自動提示(實(shí)例)
本篇文章對利用PHP+JS實(shí)現(xiàn)搜索自動提示的方法進(jìn)行了詳細(xì)的分析介紹,需要的朋友參考下2013-06-06php文件打包 下載之使用PHP自帶的ZipArchive壓縮文件并下載打包好的文件
php文件打包 下載之使用PHP自帶的ZipArchive壓縮文件并下載打包好的文件2012-06-06