程序師世界是廣大編程愛好者互助、分享、學習的平台,程序師世界有你更精彩!
首頁
編程語言
C語言|JAVA編程
Python編程
網頁編程
ASP編程|PHP編程
JSP編程
數據庫知識
MYSQL數據庫|SqlServer數據庫
Oracle數據庫|DB2數據庫
 程式師世界 >> 編程語言 >> 網頁編程 >> PHP編程 >> 關於PHP編程 >> 個人理解正則表達式——懶惰匹配,正則表達式匹配

個人理解正則表達式——懶惰匹配,正則表達式匹配

編輯:關於PHP編程

個人理解正則表達式——懶惰匹配,正則表達式匹配


問題描述

本文鏈接:http://www.hcoding.com/?p=130

初學正則表達式的時候都有一個疑問,例如:需要匹配串 "_abc_123_" 中 第一對"_"之間的字符,剛開始學習正則表達式的時候會寫成 "/_\w*_/",匹配的結果就是"abc_123" 而不是"abc"了;大神說加上一個問號,"/_\w*?_/",這時候匹配的結果就是"abc"。

我們知道'?'單獨使用的時候表示:重復零次或一次,而當'?'出現在重復限定符後面的,起的作用就是懶惰匹配,也就是匹配盡可能少的字符。懶惰限定符說明:

  • *?:重復任意次,但盡可能少重復
  • +?:重復1次或更多次,但盡可能少重復
  • ??:重復0次或1次,但盡可能少重復
  • {n,m}?:重復n到m次,但盡可能少重復
  • {n,}?:重復n次以上,但盡可能少重復

對的,“盡可能少重復”,這就是對懶惰匹配的粗暴直白的解說。

那麼怎麼理解“盡可能少重復”呢?我們可以從正則表達式的忽略優先量詞來解釋了。

忽略優先量詞

量詞"*?"、"+?"、"??"、"{n,m}?"、"{n,}?"都屬於忽略優先量詞,忽略優先量詞使用的是在?、+、*、{}後面添加?組成的,忽略優先在匹配的時候首先會嘗試忽略,如果失敗後回溯才會選擇嘗試。比如`ab??`匹配“abb”會得到‘a’而不是“ab”。當引擎匹配成功a後,由於是忽略優先,引擎首先選擇不匹配b,繼續查看表達式,發現表達式結束了,那麼引擎就直接上報匹配成功。具體我們通過下面的例子一步一步說明忽略優先量詞工作原理。

例子

還是上面的例子,用"/_\w*?_/"匹配"_abc_123_" 中 第一對"_"之間的字符。

開始匹配第一個'_'之後,‘\w*?’首先決定不需要匹配任何字符,因為它是忽略優先量詞,這時候就拿表達式'/_\w*?_/'中的第二個'_'('\w*?'後面的'_')和目標串'_abc_123_'中的'a'匹配,匹配失敗,這時候才會拿'\w*?'去嘗試未匹配的分支(使用\w匹配a,嘗試匹配a成功)

下一步,是嘗試匹配,還是忽略呢?因為'\w*?'是忽略優先量詞,會選擇忽略,那麼就是重復上一步,'_'匹配b失敗,'\w*?'去嘗試未匹配的分支ab,以上步驟總共重復了3次後(直到表達式'\w*?'後面的'_'和目標串第二個'_'匹配),最終匹配出'abc'。

過程(開始匹配第一個'_'之後):

  • 表達式/_\w*?_/'中的第二個'_'和目標串'_abc_123_'中的'a'匹配,匹配失敗,'\w*?'嘗試匹配目標串'_abc_123_'中的'a',匹配成功。
  • 表達式/_\w*?_/'中的第二個'_'和目標串'_abc_123_'中的'b'匹配,匹配失敗,'\w*?'嘗試匹配目標串'_abc_123_'中的'ab',匹配成功。
  • 表達式/_\w*?_/'中的第二個'_'和目標串'_abc_123_'中的'c'匹配,匹配失敗,'\w*?'嘗試匹配目標串'_abc_123_'中的'abc',匹配成功。
  • 表達式/_\w*?_/'中的第二個'_'和目標串'_abc_123_'中的'_'匹配,匹配成功,匹配結束。結果為abc。

以上是閱讀《精通正則表達式》關於忽略優先量詞一節的想法,如有不對虛心接受各位的指教,謝謝!

本文鏈接:http://www.hcoding.com/?p=130

原創文章,轉載請注明:JC&hcoding.com

  1. 上一頁:
  2. 下一頁:
Copyright © 程式師世界 All Rights Reserved