正则表达式的贪婪性-rayzhang11-ChinaUnix博客

rayzhang11的ChinaUnix博客

首页　| 　博文目录　| 　关于我

rayzhang11

博客访问： 678725
博文数量： 96
博客积分： 2005
博客等级：上尉
技术积分： 1061
用户组：普通用户
注册时间： 2011-02-21 13:59

文章分类

全部博文（96）

服务器搭建（2）
MAC（1）
Window（11）
软件测试（9）
Python（5）
网络基础（3）
数据库（13）
linux（51）
未分配的博文（1）

文章存档

2013年（11）

2012年（30）

2011年（55）

我的朋友

相关博文

正则表达式的贪婪性

分类： LINUX

2011-10-16 08:57:33

正则表达式是具有贪婪性的，我们从下面这例谈起：
已知str="uid=100(guest) gid=100(others) groups=10(users),11(floppy)"
现在想要得到这个字符串中的第一个括号内的值，即guest该怎么办？假设$str的括号外的内容是不固定的，不能依据uid之类的关键字或空格去查找，所依据的只能是找第一对括号内的内容。

很自然的我们想到用sed，因为sed具有很强的模式匹配的功能，而且能够将匹配的部分内容强行记下来用于输出。这样，我们就会想：
echo $str|sed 's/模式串/1/'
只要模式串写好了,在匹配的过程中把guest这个字符串抠出来，让sed记住，然后用1输出就可以了。怎么写这个模式串？
.*想要匹配"uid=100"
(...)告诉sed要查找括弧内的文本
(.*)让sed记住匹配内容的常用手段，这里匹配的.*将来就能用1取出来
.*想要匹配" gid=100(others) groups=10(users),11(floppy)"部分
于是我们就写成了echo $str|sed 's/.*($.*$).*/\1/'
结果呢，得到的是"floppy"，为什么？
正则表达式是有贪婪性的，它总是与最长的可能长度匹配，而且越是排在前面的通配符优先级越高。这一例，第一个.*可以匹配"uid=100(guest) gid=100(others) groups=10(users),11"，仍然能保证后面通配符的匹配，那一对()匹配了floppy左右的括号，最后的.*自然是可有可无的，所以sed记住的就是floppy。
怎么办？我们必须打破正则表达式的贪吃性，用更明确的描述来实现这一点：
我们考虑如果在模式串中第一个.*中告诉sed这个.*是不能含有"("的，不久可以将.*限制到"uid=100"了吗？这个意思我们完全可以用[^(]*来表达，于是我们修订刚才的代码，变成：
echo $str|sed 's/[^(]*((.*)).*/1/'
似乎应该很好了，执行的结果却是"guest) gid=100(others) groups=10(users),11(floppy"，为什么？
原来仍然是正则表达是的贪婪性在作怪，虽然我们有效的阻止了第一个.*的贪吃，但是我们对(.*)中的.*却未加限制，于是它尽可能匹配了"guest) gid=100(others) groups=10(users),11(floppy",还能保证后面".*"的匹配性。我们再作限制，告诉sed，(.*)中的.*不能含有""，让它跨不过guest：
echo $str|sed 's/[^(]*($[^)]*$).*/\1/'
这回，输出结果终于是我们想要得"guest"了。

问题解决了，我们也了解了正则表达式（或说通配符）的贪婪性，于是就可以留个问题给大家，让大家自己体会体会：
怎么样取出str中第二对括号的内容"others"？=>echo $str|sed 's/[^(]*($[^)]*$)[^(]*($[^)]*$)[^(]*($[^)]*$)[^(]*($[^)]*$)/\2/'
怎么样取出str中第三对括号的内容"users"？=>echo $str|sed 's/[^(]*($[^)]*$)[^(]*($[^)]*$)[^(]*($[^)]*$)[^(]*($[^)]*$)/\3/'
怎么样取出str中第四对括号的内容"floppy"？=>echo $str|sed 's/.*($.*$)/\1/'

整理本文参照：

阅读(1874) | 评论(0) | 转发(0) |

上一篇：expect 使用

下一篇：awk中RS,ORS,FS,OFS区别与联系

给主人留下些什么吧！~~

感谢所有关心和支持过ChinaUnix的朋友们

16024965号-6