
正则表达式教程
\b 是正则表达式规定的一个特殊代码(好吧,某些人叫它元字符,metacharacter),
代表着单词的开头或结尾,也就是单词的分界处。虽然通常英文的单词是由空格,标点符号或者
换行来分隔的,但是\b 并不匹配这些单词分隔字符中的任何一个,它只匹配一个位置。
如果需要更精确的说法,\b 匹配这样的位置:它的前一个字符和后一个字符不全是(一个是,
一个不是或不存在)\w。
假如你要找的是 hi
Lucy ,你应该用\bhi\b.*\bLucy\b。
这里,.是另一个元字符,匹配除了换行符以外的任意字符。*同样是元字符,不过它代表的
不是字符,也不是位置,而是数量——它指定*前边的内容可以连续重复出现任意次以使整个表达
式得到匹配。因此,.*连在一起就意味着任意数量的不包含换行的字符。现在\bhi\b.*\bLucy\b
的意思就很明显了:先是一个单词
hi, 然后是任意个任意字符 ( 但不能是换行 ) ,最后是
这个
单词。
换行符就是'\n',ASCII 编码为 10(十六进制 0x0A)的字符。
如果同时使用其它元字符,我们就能构造出功能更强大的正则表达式。比如下面这个例子:
0\d\d-\d\d\d\d\d\d\d\d 匹配这样的字符串:以
开头,然后是两个数字,然后是一个连字
号“ -” ,最后是
个数字 (也就是中国的电话号码。当然,这个例子只能匹配区号为 3 位的情形)。
这里的\d 是个新的元字符,匹配一位数字 (0 ,或
2 ,或…… ) 。-不是元字符,只匹配
它本身——连字符或者减号。
为了避免那么多烦人的重复,我们也可以这样写这个表达式:0\d{2}-\d{8}。 这里\d 后
面的{2}({8})的意思是前面\d 必须连续重复匹配
次 ) 。
测试正则表达式
其它可用的测试工具:
RegexBuddy
Javascript
正则表达式在线测试工具
如果你不觉得正则表达式很难读写的话,要么你是一个天才,要么,你不是地球人。正则表
达式的语法很令人头疼,即使对经常使用它的人来说也是如此。由于难于读写,容易出错,所以
找一种工具对正则表达式进行测试是很有必要的。
由于在不同的环境下正则表达式的一些细节是不相同的,本教程介绍的是微软 .Net
Framework 2.0 下正则表达式的行为,所以,我向你介绍一个.Net 下的工具 Regex Tester。
首先你确保已经安装了.Net Framework 2.0,然后下载
Regex Tester 。这是个绿色软件,下载
完后打开压缩包,直接运行 RegexTester.exe 就可以了。
玉堂资料汇编
2