最近使用 PHP 寫了一個應用,主要是正則表達式的處理,趁機系統(tǒng)性的學習了相應知識。
1 2 3 4 5 | $preg = "/http:\/\/\w+\.\w+.(?:net|com|cn)+/is" ;
$preg2 = "/http:\/\/\w+\.\w+.(net|com|cn)+/is" ;
preg_match( $preg , $str , $arr );
preg_match( $preg2 , $str , $arr2 );
preg_match() 和 preg_match_all() 的區(qū)別
preg_match() 在匹配模式的時候匹配到一次就結束,而 preg_match_all() 則進行全局匹配,通過一個例子就能明白:
1 2 3 4 5 6 | $str = 'hello world china' ;
$preg = "/\w+\s/is" ;
preg_match( $preg , $str , $arr );
print_r( $arr );
preg_match_all( $preg , $str , $arr );
print_r( $arr );
正確理解 $ 和 ^
1 2 3 4 5 | $str = "13521899942a" ;
$preg = "/1[\d]{3,15}/is" ;
if (preg_match( $preg , $str , $arr )) {
echo "ok" ;
雖然字符串中有一個英文字母,但是這個子模式卻匹配了,原因就在于模式匹配到后就結束了,不會再去尋找英文字母,為了解決這問題 $ 和 ^ 就發(fā)揮作用了,比如讓字符串的開始和結尾必須匹配一定的模式,修改如下:
1 2 3 4 5 | $str = "13521899942a" ;
$preg = "/1[\d]{3,15}$/is" ;
if (preg_match( $preg , $str , $arr )) {
echo "ok" ;
$ 和 ^ 的跨行模式
默認的情況下,$ 和 ^ 只會匹配完整段落的開始和結尾,但是通過改變選項,允許匹配文本的每一行的開始和結尾,通過下面的例子就能明白
1 2 3 4 5 | $str ='hello
$preg = '/\w+$/ism' ; //$preg='/(?m)\w+$/is';
preg_match_all( $preg , $str , $arr );
print_r( $arr );
在正則中通過括號分組后,可以使用 \1,\2 這樣的數(shù)字進行后向引用,但是假如正則中模式太多,在使用的時候就會比較混亂,這時候可以采用分組命名來進行引用,看個例子:
1 2 3 | $str = "email:ywdblog@gmail.com;" ;
preg_match( "/email:(?<email>\w+?)/is" , $str , $matches );
echo $matches [ "email" ] . "_" . $matches [ 'no' ];
正則在匹配的時候是貪婪的,只要符合模式就會一直匹配下去,下面的例子,匹配到的文本是 <h2>hello</h2><h2>world</h2>
1 2 3 4 | $str = "<h2>hello</h2><h2>world</h2>" ;
$preg = "/<h2>.*<\/h2>/is" ;
preg_match( $preg , $str , $arr );
print_r( $arr );
1 2 3 4 | $str = "<h2>hello</h2><h2>world</h2>" ;
$preg = "/<h2>.*?<\/h2>/is" ;
preg_match( $preg , $str , $arr );
print_r( $arr );
進一步理解 preg_match_all()
1 2 3 4 5 6 7 8 | $str = 'jiangsu (nanjing) nantong
guangdong (guangzhou) zhuhai
beijing (tongzhou) haidian';
$preg = '/^\s*+([^(]+?)\s\(([^)]+)\)\s+(.*)$/m' ;
preg_match_all( $preg , $str , $arr ,PREG_PATTERN_ORDER);
print_r( $arr );
preg_match_all( $preg , $str , $arr ,PREG_SET_ORDER);
print_r( $arr );
雖然 preg_replace() 函數(shù)能完成大多數(shù)的替換,但是假如你想更好的控制,可以使用回調,不用多說看例子:
1 2 3 4 5 6 | $str = "china hello world" ;
$preg = '/\b(\w+)(\w)\b/' ;
function fun( $m ){
return $m [1]. strtoupper ( $m [2]);
echo preg_replace_callback( $preg , "fun" , $str );
在這一點上,PHP 比 Python 強大的多,Python 中沒有正則回調,不過可以使用閉包的方式解決,可看我以前的文章。
這個函數(shù)類似于 Python 中的 re.compile() 函數(shù),假如在模式中一些元字符僅僅想表達字符的本身含義,可以轉義,但是假如在模式中寫太多的轉義,會顯得很混亂,可以使用這個函數(shù)來統(tǒng)一轉義:
1 2 3 4 5 6 | $str = '\\*china*world' ;
$preg = "\*china" ;
$preg = preg_quote( $preg );
echo $preg ;
preg_match( "/{$preg}/is" , $str , $arr );
print_r( $arr );
向前查找 ?= 的妙用
The "?=" combination means "the next text must be like this". This construct doesn't capture the text.
(1)這個例子可以獲取 URL 中的協(xié)議部分,比如 https,ftp,注意 ?: 后面的部分不在返回的內(nèi)容中。
1 2 3 4 5 | $preg = '/[a-z]+(?=:)/' ;
preg_match( $preg , $str , $arr );
print_r( $arr );
(2)"invisible" 分隔符
也叫 “zero-width” 分隔符,參考下面的例子:
1 2 3 4 | $str = ( "chinaWorldHello" );
$preg = "/(?=[A-Z])/" ;
$arr = preg_split( $preg , $str );
print_r( $arr );
instead of specifying the order that things should appear, it's saying that it must appear but we're not worried about the order.
The first grouping is (?=.{8,}). This checks if there are at least 8 characters in the string. The next grouping (?=.[0-9]) means "any alphanumeric character can happen zero or more times, then any digit can happen". So this checks if there is at least one number in the string. But since the string isn't captured, that one digit can appear anywhere in the string. The next groupings (?=.[a-z]) and (?=.[A-Z]) are looking for the lower case and upper case letter accordingly anywhere in the string.
1 2 3 4 | $str = "HelloWorld2016" ;
if (preg_match( "/^.*(?=.{8,})(?=.*\d)(?=.*[a-z])(?=.*[A-Z]).*$/" , $str , $arr )){
print_r( $arr );
向后查找 ?<=
?<= 表示假如匹配到特定字符,則返回該字符后面的內(nèi)容。
?= 表示假如匹配到特定字符,則返回該字符前面的內(nèi)容。
1 2 3 4 | $str = 'chinadhello' ;
$preg = '/(?<=a)d(?=h)/' ;
preg_match( $preg , $str , $arr );
print_r( $arr );