正则表达式笔记

来源：互联网发布：vb err.clear 编辑：程序博客网时间：2024/06/06 06:49

正则表达式用于匹配字符串的规则的，知识点不难，但是比较繁琐，这篇文章把正则的基本常用点系统的整理了一下，方便自己以后要用的时候查阅，也希望给大家提供参考。废话不多说，直接奔主题

1.元字符

元字符说明 . 除了换行符以外的任意字符 * 指定*前边的内容可以连续重复使用任意次数 + 匹配重复1次或更多次 ^ 匹配字符串的开始 $ 匹配字符串的结束 \d 匹配一位数字 \s 匹配任意的空白符，如空格、Tab、换行符、中文全角空格等 \w 匹配字母或数字或下划线或汉字等 \b 匹配单词的开始或结束

2.转义字符

如果想查找元字符本身的话，就得使用\来取消这些字符的特殊意义。因此你应该使用\.和\* 。当然如果要查找\本身，也得用\\
例子：
deerchao\.net匹配deerchao.net，C:\\Windows匹配C:\Windows

3.限定符（重复）

代码说明 * 重复0次或更多次 + 重复1次或更多次 ? 重复0次或1次 {n} 重复n次 {n,} 重复n次或更多次 {n,m} 重复n到m次

4.字符类

要想查找数字，字母，空白是很简单的，因为已经有了对应这些字符集合的元字符，但是如果你想匹配没有预定义元字符的字符集合(比如元音字母a,e,i,o,u),应该怎么办？这个时候字符类就起作用了。
例子：

代码说明 [aeiou] 匹配任何一个英文元音字母 [.?!] 匹配标点符号(.或?或!) [0-9] \d完全一致，匹配0到9中的一位数字 [a-z0-9A-Z] 匹配a到z,A到Z,中任意一个字母或0到9任意一个数字

5.分枝条件

正则表达式里的分枝条件指的是有几种规则，如果满足其中任意一种规则都应该当成匹配，具体方法是用|把不同的规则分隔开。(注：匹配分枝条件时，将会从左到右地测试每个条件，如果满足了某个分枝的话，就不会去再管其它的条件了。)
例子：
0\d{2}-\d{8}|0\d{3}-\d{7} -> 这个表达式能匹配两种以连字号分隔的电话号码：一种是三位区号，8位本地号(如010-12345678)，一种是4位区号，7位本地号(0376-2233445)

6.分组

可以用小括号来指定子表达式(也叫做分组)，然后你就可以指定这个子表达式的重复次数了
例子：
(\d{1,3}.){3}\d{1,3} -> 可以匹配如123.123.123.123、001.002.003.004等类似于这样的字符串

7.反义

代码说明 \W 匹配任意不是字母，数字，下划线，汉字的字符 \S 匹配任意不是空白符的字符 \D 匹配任意非数字的字符 \B 匹配不是单词开头或结束的位置 [^x] 匹配除了x以外的任意字符 [^aeiou] 匹配除了aeiou这几个字母以外的任意字符

例子:

<a[^>]+> : 匹配用尖括号括起来的以a开头的字符串。

8.后向引用

后向引用用于重复搜索前面某个分组匹配的文本。
1. 默认情况下，每个分组会自动拥有一个组号，规则是：从左向右，以分组左括号为标志，第一个出现的分组的组号为1，第二个为2，以此类推。
例：\b(\w+)\b\s+\1\b 这里的\1就相当于(\w+)，这个正则可以匹配go go或move move这样的字符串
2. 也可以自己指定表达式的组名。
(?<Word>\w+) 或者(?'Word'\w+)这样就把\w+组名指定为Word了，要后向引用这个分组捕获的内容，你可以使用\k<Word>，所以上一个例子也可以这么写
\b(?<Word>\w+)\b\s+\k<Word>\b

后向引用捕获语法

代码/语法说明 (exp) 匹配exp,并捕获文本到自动命名的组里 (?<name>exp) 匹配exp,并捕获文本到名称为name的组里，也可以写成(?'name'exp) (?:exp) 匹配exp,不捕获匹配的文本，也不给此分组分配组号

9.断言

代码/语法说明 (?=exp) 匹配exp前面的位置 (?<=exp) 匹配exp后面的位置 (?!exp) 匹配后面跟的不是exp的位置 (?<!exp) 匹配前面不是exp的位置

例子：
- \b\w+(?=ing\b) ：匹配以ing结尾的单词的前面部分(除了ing以外的部分)，如：’m singing while you’re dancing.时，它会匹配sing和danc。
-(?<=\bre)\w+\b ：匹配以re开头的单词的后半部分(除了re以外的部分) 如：reading a book时，它匹配ading
- \b((?!abc)\w)+\b ：匹配不包含连续字符串abc的单词
- \d{3}(?!\d) ：匹配三位数字，而且这三位数字的后面不能是数
-(?<![a-z])\d{7} ：匹配前面不是小写字母的七位数字
- (?<=<(\w+)>).*(?=<\/\1>) ：如匹配<html>和</html>之间的内容

10.贪婪与懒惰

当正则表达式中包含能接受重复的限定符时，通常的行为是（在使整个表达式能得到匹配的前提下）匹配尽可能多的字符。以这个表达式为例：a.*b，它将会匹配最长的以a开始，以b结束的字符串。如果用它来搜索aabab的话，它会匹配整个字符串aabab。这被称为贪婪匹配。
有时，我们更需要懒惰匹配，也就是匹配尽可能少的字符。前面给出的限定符都可以被转化为懒惰匹配模式，只要在它后面加上一个问号?。这样.*?就意味着匹配任意数量的重复，但是在能使整个匹配成功的前提下使用最少的重复。
例如：a.*?b匹配最短的，以a开始，以b结束的字符串。如果把它应用于aabab的话，它会匹配aab（第一到第三个字符）和ab（第四到第五个字符）。

代码/语法说明 *? 重复任意次，但尽可能少重复 +? 重复1次或更多次，但尽可能少重复 ?? 重复0次或1次，但尽可能少重复 {n,m}? 重复n到m次，但尽可能少重复 {n,}? 重复n次以上，但尽可能少重复

1 0