程序師世界是廣大編程愛好者互助、分享、學習的平台,程序師世界有你更精彩!
首頁
編程語言
C語言|JAVA編程
Python編程
網頁編程
ASP編程|PHP編程
JSP編程
數據庫知識
MYSQL數據庫|SqlServer數據庫
Oracle數據庫|DB2數據庫
 程式師世界 >> 編程語言 >> 網頁編程 >> PHP編程 >> PHP綜合 >> php使用iconv中文截斷問題的解決方法

php使用iconv中文截斷問題的解決方法

編輯:PHP綜合

本文實例講述了php使用iconv中文截斷問題的解決方法。分享給大家供大家參考。具體分析如下:

今天做了一個采集程序,原理很簡單,使用curl方法把對方頁面的html獲取分析,然後正則提取需要的數據並保存在數據庫。

由於對方頁面是GB2312編碼,而本地使用的是UTF-8編碼。因此在采集後需要進行編碼轉換。

使用了iconv方法進行編碼轉換

iconv — 字符串按要求的字符編碼來轉換 
string iconv ( string $in_charset , string $out_charset , string $str )

將字符串 str 從 in_charset 轉換編碼到 out_charset 。  

轉換的方法很簡單,直接使用iconv方法就可以了

<?php 
$content = iconv('GB2312', 'UTF-8', $content); //$content為采集到的內容 
?> 

試驗了幾個頁面,都能正常采集。但在之後的采集中,有幾個頁面采集不完整。
一開始考慮是否正則有錯,檢查後排除此問題。經過排查,發現經過iconv轉碼後的內容比采集的內容少了一大段。
查看apache log,看到提示:Notice: iconv(): Detected an illegal character in input string。

翻查手冊,看到以下說明

如果你在 out_charset 後添加了字符串 //TRANSLIT,將啟用轉寫(transliteration)功能。這個意思是,當一個字符不能被目標字符集所表示時,它可以通過一個或多個形似的字符來近似表達。

如果你添加了字符串 //IGNORE,不能以目標字符集表達的字符將被默默丟棄。 否則, str 從第一個無效字符開始截斷並導致一個 E_NOTICE 。

原來iconv遇到不能識別的內容,會從第一個不能識別的字符開始截斷,並生成一個E_NOTICE。因此後邊的內容被丟棄了。

而在輸出字符集後加上//IGNORE則只丟棄不能識別的內容,而不會截斷和丟棄後面的內容。

修改程序後一切正常

<?php 
$content = iconv('GB2312','UTF-8//IGNORE',$content);//$content為采集到的內容
?> 

Tips:使用iconv時,如果要使用UTF-8編碼的,請使用UTF-8而不要使用UTF8,因為UTF8有些服務器會有問題。

希望本文所述對大家的php程序設計有所幫助。

  1. 上一頁:
  2. 下一頁:
Copyright © 程式師世界 All Rights Reserved