零宽断言--高级正则-linux_kaige-ChinaUnix博客

一个人不是生来要给打败的yangkai.blog.chinaunix.net

首页　| 　博文目录　| 　关于我

linux_kaige

博客访问： 1675211
博文数量： 409
博客积分： 6240
博客等级：准将
技术积分： 4908
用户组：普通用户
注册时间： 2011-06-01 00:04

文章分类

全部博文（409）

Oracle服务端应用（24）
信息安全（3）
网络（虚拟化等全（1）
代理服务器squid（2）
Hadoop 大数（1）
oracle的sql（1）
标准对照表（2）
ATM相关（2）
oracle异常处理（1）
oracle存储过程/（7）
oracle备份与恢复（12）
java（3）
db2（1）
环境搭建（4）
perl（0）
php（1）
python（0）
object（2）
HA（1）
sql（14）
mysql（3）
网卡流量监测（3）
web服务器（6）
hash（1）
我的ftp手册（7）
文档规范（1）
正则（2）
sed（2）
项目管理（28）
web压力测试（5）
linux系统管理（25）
shell（19）
linux应用（20）
随便一说（3）
其他（6）
kernel（1）
awk（17）
DB（21）
凯哥的linux私房（20）
未分配的博文（137）

文章存档

2021年（1）

2019年（1）

2017年（1）

2016年（13）

2015年（22）

2013年（4）

2012年（240）

2011年（127）

我的朋友

相关博文

零宽断言--高级正则

分类： Python/Ruby

2012-01-14 20:09:26

【转载】但未能找到原作者。。。

零宽断言的意思是（匹配宽度为零，满足一定的条件/断言）我也不知道这个词语是那个王八蛋发明的，简直是太拗口了。

零宽断言用于查找在某些内容(但并不包括这些内容)之前或之后的东西，也就是说它们像 \b ^ $ \< \> 这样的锚定作用，用于指定一个位置，这个位置应该满足一定的条件(即断言)，因此它们也被称为零宽断言。断言用来声明一个应该为真的事实。正则表达式中只有当断言为真时才会继续进行匹配。

其中零宽断言又分四种：

1）

先行断言也叫零宽度正预测先行断言(?=exp) -- 表示匹配表达式前面的位置

例如 [a-z]*(?=ing) 可以匹配 cooking 和 singing 中的 cook 与 sing 。

注意：先行断言的执行步骤是这样的先从要匹配的字符串中的最右端找到第一个 ing (也就是先行断言中的表达式)然后再匹配其前面的表达式，若无法匹配则继续查找第二个 ing 再匹配第二个 ing 前面的字符串，若能匹配则匹配，符合正则的贪婪性。

例如： .*(?=ing) 可以匹配 "cooking singing" 中的 "cooking sing" 而不是 cook

2）

后发断言也叫零宽度正回顾后发断言(?<=exp) -- 表示匹配表达式后面的位置

例如(?<=abc).* 可以匹配 abcdefg 中的 defg

注意：后发断言跟先行断言恰恰相反它的执行步骤是这样的：先从要匹配的字符串中的最左端找到第一个abc(也就是先行断言中的表达式)然后再匹配其后面的表达式，若无法匹配则继续查找第二个 abc 再匹配第二个 abc 后面的字符串，若能匹配则匹配。

例如(?<=abc).* 可以匹配 abcdefgabc 中的 defgabc 而不是 abcdefg

3）

负向零宽断言

负向零宽断言 (?!exp) 也是匹配一个零宽度的位置，不过这个位置的“断言”取表达式的反值，例如 (?!exp) 表示 "exp" 前面的位置，如果 "exp" 不成立，匹配这个位置；如果 "exp" 成立，则不匹配。同样，负向零宽断言也有“先行”和“后发”两种，负向零宽后发断言为 (?

负向零宽后发断言(?

负向零宽先行断言 (?!exp)

负向零宽断言要注意的跟正向的一样。

常用分组语法
分类	代码/语法	说明
捕获	(exp)	匹配exp,并捕获文本到自动命名的组里
	(?exp)	匹配exp,并捕获文本到名称为name的组里，也可以写成(?'name'exp)
	(?:exp)	匹配exp,不捕获匹配的文本，也不给此分组分配组号
零宽断言	(?=exp)	匹配exp前面的位置
	(?<=exp)	匹配exp后面的位置
	(?!exp)	匹配后面跟的不是exp的位置
	(?	匹配前面不是exp的位置
注释	(?#comment)	这种类型的分组不对正则表达式的处理产生任何影响，用于提供注释让人阅读

例子:

cat file

aaa bbb CD="123" fd

要取出CD后面的值：

grep -oP '(?<=CD=")\d+' file

[解析]

以 CD=" 为后发断言，匹配它后面的多个数字。

cat file

Rx Optical Power: -5.01dBm, Tx Optical Power: -2.41dBm

要取出那几个分贝的值：

-5.01

-2.41

grep -oP '(?<=: ).*?(?=d)' file

[解析]

后发断言 ”: “ 后面的字符串，直到 d 字符前面的字符串，? 号的作用是避免贪婪匹配。

阅读(2008) | 评论(0) | 转发(0) |

上一篇：CU博客存在的一个问题

下一篇：虚拟机与虚拟机之间的端口映射

给主人留下些什么吧！~~

感谢所有关心和支持过ChinaUnix的朋友们

16024965号-6