程式師世界 >> 編程語言 >> 網頁編程 >> PHP編程 >> PHP綜合 >> php使用iconv中文截斷問題的解決方法

php使用iconv中文截斷問題的解決方法

編輯：PHP綜合

本文實例講述了php使用iconv中文截斷問題的解決方法。分享給大家供大家參考。具體分析如下：

今天做了一個采集程序，原理很簡單，使用curl方法把對方頁面的html獲取分析，然後正則提取需要的數據並保存在數據庫。

由於對方頁面是GB2312編碼，而本地使用的是UTF-8編碼。因此在采集後需要進行編碼轉換。

使用了iconv方法進行編碼轉換

iconv — 字符串按要求的字符編碼來轉換
string iconv ( string $in_charset , string $out_charset , string $str )

將字符串 str 從 in_charset 轉換編碼到 out_charset 。

轉換的方法很簡單，直接使用iconv方法就可以了

<?php 
$content = iconv('GB2312', 'UTF-8', $content); //$content為采集到的內容 
?>

試驗了幾個頁面，都能正常采集。但在之後的采集中，有幾個頁面采集不完整。
一開始考慮是否正則有錯，檢查後排除此問題。經過排查，發現經過iconv轉碼後的內容比采集的內容少了一大段。
查看apache log，看到提示：Notice: iconv(): Detected an illegal character in input string。

翻查手冊，看到以下說明

如果你在 out_charset 後添加了字符串 //TRANSLIT，將啟用轉寫（transliteration）功能。這個意思是，當一個字符不能被目標字符集所表示時，它可以通過一個或多個形似的字符來近似表達。

如果你添加了字符串 //IGNORE，不能以目標字符集表達的字符將被默默丟棄。否則， str 從第一個無效字符開始截斷並導致一個 E_NOTICE 。

原來iconv遇到不能識別的內容，會從第一個不能識別的字符開始截斷，並生成一個E_NOTICE。因此後邊的內容被丟棄了。

而在輸出字符集後加上//IGNORE則只丟棄不能識別的內容，而不會截斷和丟棄後面的內容。

修改程序後一切正常

<?php 
$content = iconv('GB2312','UTF-8//IGNORE',$content);//$content為采集到的內容
?>

Tips：使用iconv時,如果要使用UTF-8編碼的，請使用UTF-8而不要使用UTF8，因為UTF8有些服務器會有問題。

希望本文所述對大家的php程序設計有所幫助。

上一頁:php+Mysqli利用事務處理轉賬問題實例
下一頁:php發送與接收流文件的方法

PHP綜合

Eclipse中php插件安裝及Xdebug配置的使用詳解

由於在android開發團隊，又迷上了android自動化測

使用php清除bom示例

核心代碼function checkBOM ($filena

PHP代碼優化技巧小結

PHP優化的目的是花最少的代價換來最快的運行速度與最容易維護

php array_walk() 數組函數

復制代碼代碼如下: /*函數array_walk():單一

利用PHP如何寫APP接口詳解

搭建PHP環境由於本人使用的電腦是Mac，因此推薦大家使用M

Android ProgressBar進度條和ProgressDialog進度框的展示DEMO

在做手機開發時，經常碰到一些比較耗時的操作，這個時候進度條就

閱讀排行榜

解析左右值無限分類的實現算法 php計算數組相同值出現次數的代碼(array_count_values) 壞狼的PHP學習教程之第2天 PHP緩沖區用法總結 PHP5.3 新版本中的新特性詳解PHP中foreach的用法和實例 163的郵件用phpmailer發送(實例詳解) PHP 動態生成靜態HTML頁面示例代碼 PHP+MySQL分頁顯示示例 PHP正則表達式 /i, /is, /s, /isU等介紹 php 文章采集正則代碼

熱門圖文

指針解析（二）（原） PHP獲取用戶訪問IP地址的5種方法，ip5種 POJ 2784 Buy or Build最小生成樹 php過濾表單提交的html等危險代碼，php過濾表單提交 android-Android：圖片顯示的時候旋轉了90度 JavaBeans 程序開發從入門到精通教程2 python新手求助-python中文顯示的問題 Largest palindrome product

欄目導航

PHP基礎知識 PHP綜合 PHP入門知識關於PHP編程