awk学习-caojiangfeng-ChinaUnix博客

珠一

首页　| 　博文目录　| 　关于我

caojiangfeng

博客访问： 1332315
博文数量： 213
博客积分： 7590
博客等级：少将
技术积分： 2185
用户组：普通用户
注册时间： 2008-08-31 17:31

个人简介

热爱开源，热爱linux

文章分类

全部博文（213）

大数据（3）

hadoop（3）
Python（1）
安全（0）
科技（2）
数据库（6）
QT（3）
笔试面试题（4）
常识（10）
LAMP（3）
操作系统（0）
Csharp（1）
perl（13）

perl脚本（4）
java（11）

jvm调优工具（1）
网络学习（5）

网络编程（1）
C语言（24）

用法与技术（10）

程序（12）
电脑知识（2）
linux相关（122）

日志相关（1）

sed和awk（9）

循环（1）

有用的shell网址（0）

驱动开发（4）

我的shell脚本（9）

shell（12）

应用配置（11）

模块编程（10）

Kernel（8）

条件语句（2）

其他（6）

命令学习（20）

信号及其信号处理（3）

进程（7）

文件系统（1）

系统配置（12）
英语学习（2）
未分配的博文（1）

文章存档

2018年（4）

2017年（1）

2015年（1）

2014年（5）

2013年（2）

2012年（2）

2011年（21）

2010年（82）

2009年（72）

2008年（23）

我的朋友

相关博文

awk学习

分类： LINUX

2009-08-01 22:34:31

#awk -F: '模式    {动作}' file
1)$ awk '/yaoshuyin/ {print $3,$2; print $4,$5}' emp_names.txt
2)$ awk '/yaoshuyin | cnscn/ {print $3,$2} {print $4,$5}' emp_names.txt
3)$ awk '$5 ˜ /yaoshuyin | tom/' emp_names.txt
4)# awk '$0 ~ /DBNAME/ { print $0}'   800hr_db.inc.php
$DB_DBNAME ="800hr_db";
5)#awk '$0 !~ /DBNAME/ { print $0}' 800hr_db.inc.php
   $DB_HOSTNAME="10.10.10.206";
   $DB_USERNAME="800hr";
   $DB_PASSWORD="800hr_buildhr_best";
?>

6)#awk '{FS=":"} {print $2}'   emp_names.txt

   #awk -F: '{print $2}' emp_names.txt

#awk -F: -f awk.prog   file

模式     是一个正规表达式或由!、||、&&、或由圆括号分组的几个正规表达式。正规式必须由/ ... /括起
            /hello/ {print $2, $1}   或
            /hello/ || /none/ {print $1, $2} 或
            !/hello/ {print $1, $2} 或
            /^[Hh1]/ {print $1, $2}
            /hello/ {
                         print $2
                         print $1
            }

================================================================
#awk函数
length($2)

BEGIN    {
                   print "Beginning to process the input data..."
                   for(s=2;s<6;++s)
                   {
                        if(s==4) continue;
                        print "s is now",s
                    }
                    printf   "this is a number %d and a string %s\n",333,"333"
             }

            {
                   s +=$2
                   print $2, "length=" length($2), "s =" s
            }

END      {
                   print "End of the process..."
            }

%c (character)
%d (decimal)
%o (octal)
%x (hexadecimal)
%f (float)
printf "one=>%1d<,two=>%2.3f<,three=>%-3d<\n",sss,sss,sss     # -表示左对齐

====================================================
awk语句
{
         if(s>2 && s<20 || s==10)
         {
                ++s
                print s
          }

          while(s<10)
          {
                s=$1/32.3
                ++m
           }

           for(s=0;s<10;++s)
           {
                  s=$1/32.3
                 ++m
            }

}

====================================================

$ df -k | awk '{print $1}'| grep -v "Filesystem"
文件系统
/dev/sda2
/dev/sda1
none

$ df -k | awk '{print $1}'| grep -v "Filesystem" | sed s'/\/dev\///g'
文件系统
sda2
sda1
none

#awk -f   prog filename_list

=========================================================
-F字段分隔符
$0              代表整行
$1              第一个字段
{print $2, $1}                 输出时以，为字段分隔符

在我们使用Linux时，一些常用的命令，比如ls、date、pwd等（不一一例举了）不太容易忘记，但是对于一些不太常用的命令而言，不光光是参数，就连命令都会忘记（小弟是做开发工作的，所以比较容易忘记:D）

让我们继续，开始使用 awk，以了解其工作原理。在命令行中输入以下命令：

$ awk '{ print }' /etc/passwd

您将会见到 /etc/passwd 文件的内容出现在眼前。现在，解释 awk 做了些什么。调用 awk 时，我们指定 /etc/passwd 作为输入文件。执行 awk 时，它依次对 /etc/passwd 中的每一行执行 print 命令。所有输出都发送到 stdout，所得到的结果与与执行catting /etc/passwd完全相同。

现在，解释 { print } 代码块。在 awk 中，花括号用于将几块代码组合到一起，这一点类似于 C 语言。在代码块中只有一条 print 命令。在 awk 中，如果只出现 print 命令，那么将打印当前行的全部内容。

这里是另一个 awk 示例，它的作用与上例完全相同：

$ awk '{ print $0 }' /etc/passwd

在 awk 中， $0 变量表示整个当前行，所以 print 和 print $0 的作用完全一样。

如果您愿意，可以创建一个 awk 程序，让它输出与输入数据完全无关的数据。以下是一个示例：

$ awk '{ print "" }' /etc/passwd

只要将 "" 字符串传递给 print 命令，它就会打印空白行。如果测试该脚本，将会发现对于 /etc/passwd 文件中的每一行，awk 都输出一个空白行。再次说明， awk 对输入文件中的每一行都执行这个脚本。以下是另一个示例：

$ awk '{ print "hiya" }' /etc/passwd

运行这个脚本将在您的屏幕上写满 hiya。:)
＝＋＝＋＝＋＝＋＝＋＝＋＝＋＝

多个字段

awk 非常善于处理分成多个逻辑字段的文本，而且让您可以毫不费力地引用 awk 脚本中每个独立的字段。以下脚本将打印出您的系统上所有用户帐户的列表：

$ awk -F":" '{ print $1 }' /etc/passwd

上例中，在调用 awk 时，使用 -F 选项来指定 ":" 作为字段分隔符。awk 处理 print $1 命令时，它会打印出在输入文件中每一行中出现的第一个字段。以下是另一个示例：

$ awk -F":" '{ print $1 $3 }' /etc/passwd

以下是该脚本输出的摘录：

halt7
operator11
root0
shutdown6
sync5
bin1
....etc.

如您所见，awk 打印出 /etc/passwd 文件的第一和第三个字段，它们正好分别是用户名和用户标识字段。现在，当脚本运行时，它并不理想 -- 在两个输出字段之间没有空格！如果习惯于使用 bash 或 python 进行编程，那么您会指望 print $1 $3 命令在两个字段之间插入空格。然而，当两个字符串在 awk 程序中彼此相邻时，awk 会连接它们但不在它们之间添加空格。以下命令会在这两个字段中插入空格：

$ awk -F":" '{ print $1 " " $3 }' /etc/passwd

以这种方式调用 print 时，它将连接 $1 、" " 和 $3 ，创建可读的输出。当然，如果需要的话，我们还可以插入一些文本标签：

$ awk -F":" '{ print "username: " $1 "\t\tuid:" $3 }' /etc/passwd

这将产生以下输出：

username: halt          uid:7
username: operator      uid:11
username: root          uid:0
username: shutdown      uid:6
username: sync          uid:5
username: bin           uid:1
....etc.

＝＋＝＋＝＋＝＋＝＋＝＋＝＋＝

外部脚本

将脚本作为命令行自变量传递给 awk 对于小的单行程序来说是非常简单的，而对于多行程序，它就比较复杂。您肯定想要在外部文件中撰写脚本。然后可以向 awk 传递 -f 选项，以向它提供此脚本文件：

$ awk -f myscript.awk myfile.in

将脚本放入文本文件还可以让您使用附加 awk 功能。例如，这个多行脚本与前面的单行脚本的作用相同，它们都打印出 /etc/passwd 中每一行的第一个字段：

BEGIN {
    FS=":"
}
{ print $1 }

这两个方法的差别在于如何设置字段分隔符。在这个脚本中，字段分隔符在代码自身中指定（通过设置 FS 变量），而在前一个示例中，通过在命令行上向 awk 传递 -F":" 选项来设置 FS。通常，最好在脚本自身中设置字段分隔符，只是因为这表示您可以少输入一个命令行自变量。我们将在本文的后面详细讨论 FS 变量。
＝＋＝＋＝＋＝＋＝＋＝＋＝＋＝

BEGIN 和 END 块

通常，对于每个输入行，awk 都会执行每个脚本代码块一次。然而，在许多编程情况中，可能需要在 awk 开始处理输入文件中的文本之前执行初始化代码。对于这种情况，awk 允许您定义一个 BEGIN 块。我们在前一个示例中使用了 BEGIN 块。因为 awk 在开始处理输入文件之前会执行 BEGIN 块，因此它是初始化 FS（字段分隔符）变量、打印页眉或初始化其它在程序中以后会引用的全局变量的极佳位置。

awk 还提供了另一个特殊块，叫作 END 块。awk 在处理了输入文件中的所有行之后执行这个块。通常，END 块用于执行最终计算或打印应该出现在输出流结尾的摘要信息。
＝＋＝＋＝＋＝＋＝＋＝＋＝＋＝
规则表达式和块

awk 允许使用规则表达式，根据规则表达式是否匹配当前行来选择执行独立代码块。以下示例脚本只输出包含字符序列 foo 的那些行：

/foo/ { print }

当然，可以使用更复杂的规则表达式。以下脚本将只打印包含浮点数的行：

/[0-9]+\.[0-9]*/ { print }

＝＋＝＋＝＋＝＋＝＋＝＋＝＋＝

表达式和块

还有许多其它方法可以选择执行代码块。我们可以将任意一种布尔表达式放在一个代码块之前，以控制何时执行某特定块。仅当对前面的布尔表达式求值为真时，awk 才执行代码块。以下示例脚本输出将输出其第一个字段等于 fred 的所有行中的第三个字段。如果当前行的第一个字段不等于 fred ，awk 将继续处理文件而不对当前行执行 print 语句：

$1 == "fred" { print $3 }

awk 提供了完整的比较运算符集合，包括 "=="、"<"、">"、"<="、">=" 和 "!="。另外，awk 还提供了 "~" 和 "!~" 运算符，它们分别表示“匹配”和“不匹配”。它们的用法是在运算符左边指定变量，在右边指定规则表达式。如果某一行的第五个字段包含字符序列 root ，那么以下示例将只打印这一行中的第三个字段：

$5 ~ /root/ { print $3 }

＝＋＝＋＝＋＝＋＝＋＝＋＝＋＝

条件语句

awk 还提供了非常好的类似于 C 语言的 if 语句。如果您愿意，可以使用 if 语句重写前一个脚本：

{
    if ( $5 ~ /root/ ) {
        print $3
    }
}

这两个脚本的功能完全一样。第一个示例中，布尔表达式放在代码块外面。而在第二个示例中，将对每一个输入行执行代码块，而且我们使用 if 语句来选择执行 print 命令。这两个方法都可以使用，可以选择最适合脚本其它部分的一种方法。

以下是更复杂的 awk if 语句示例。可以看到，尽管使用了复杂、嵌套的条件语句， if 语句看上去仍与相应的 C 语言 if 语句一样：

{
    if ( $1 == "foo" ) {
        if ( $2 == "foo" ) {
            print "uno"
        } else {
            print "one"
        }
    } else if ($1 == "bar" ) {
        print "two"
    } else {
        print "three"
    }
}

使用 if 语句还可以将代码：

! /matchme/ { print $1 $3 $4 }

转换成：

{
    if ( $0 !~ /matchme/ ) {
        print $1 $3 $4
    }
}

这两个脚本都只输出不包含 matchme 字符序列的那些行。此外，还可以选择最适合您的代码的方法。它们的功能完全相同。

awk 还允许使用布尔运算符 "||"（逻辑与）和 "&&"（逻辑或），以便创建更复杂的布尔表达式：

( $1 == "foo" ) && ( $2 == "bar" ) { print }

这个示例只打印第一个字段等于 foo 且第二个字段等于 bar 的那些行。

＝＋＝＋＝＋＝＋＝＋＝＋＝＋＝

数值变量！

至今，我们不是打印字符串、整行就是特定字段。然而，awk 还允许我们执行整数和浮点运算。通过使用数学表达式，可以很方便地编写计算文件中空白行数量的脚本。以下就是这样一个脚本：

BEGIN   { x=0 }
/^$/    { x=x+1 }
END     { print "I found " x " blank lines. :)" }

在 BEGIN 块中，将整数变量 x 初始化成零。然后，awk 每次遇到空白行时，awk 将执行 x=x+1 语句，递增 x 。处理完所有行之后，执行 END 块，awk 将打印出最终摘要，指出它找到的空白行数量。

＝＋＝＋＝＋＝＋＝＋＝＋＝＋＝

字符串化变量

awk 的优点之一就是“简单和字符串化”。我认为 awk 变量“字符串化”是因为所有 awk 变量在内部都是按字符串形式存储的。同时，awk 变量是“简单的”，因为可以对它执行数学操作，且只要变量包含有效数字字符串，awk 会自动处理字符串到数字的转换步骤。要理解我的观点，请研究以下这个示例：

x="1.01"
# We just set x to contain the *string* "1.01"
x=x+1
# We just added one to a *string*
print x
# Incidentally, these are comments :)

awk 将输出：

2.01

有趣吧！虽然将字符串值 1.01 赋值给变量 x ，我们仍然可以对它加一。但在 bash 和 python 中却不能这样做。首先，bash 不支持浮点运算。而且，如果 bash 有“字符串化”变量，它们并不“简单”；要执行任何数学操作，bash 要求我们将数字放到丑陋的 $( ) ) 结构中。如果使用 python，则必须在对 1.01 字符串执行任何数学运算之前，将它转换成浮点值。虽然这并不困难，但它仍是附加的步骤。如果使用 awk，它是全自动的，而那会使我们的代码又好又整洁。如果想要对每个输入行的第一个字段乘方并加一，可以使用以下脚本：

{ print ($1^2)+1 }

如果做一个小实验，就可以发现如果某个特定变量不包含有效数字，awk 在对数学表达式求值时会将该变量当作数字零处理。
＝＋＝＋＝＋＝＋＝＋＝＋＝＋＝

众多运算符

awk 的另一个优点是它有完整的数学运算符集合。除了标准的加、减、乘、除，awk 还允许使用前面演示过的指数运算符 "^"、模（余数）运算符 "%" 和其它许多从 C 语言中借入的易于使用的赋值操作符。

这些运算符包括前后加减（ i++ 、 --foo ）、加／减／乘／除赋值运算符（ a+=3 、 b*=2 、 c/=2.2 、 d-=6.2 ）。不仅如此 -- 我们还有易于使用的模／指数赋值运算符（ a^=2 、 b%=4 ）。

＝＋＝＋＝＋＝＋＝＋＝＋＝＋＝

字段分隔符

awk 有它自己的特殊变量集合。其中一些允许调整 awk 的运行方式，而其它变量可以被读取以收集关于输入的有用信息。我们已经接触过这些特殊变量中的一个，FS。前面已经提到过，这个变量让您可以设置 awk 要查找的字段之间的字符序列。我们使用 /etc/passwd 作为输入时，将 FS 设置成 ":"。当这样做有问题时，我们还可以更灵活地使用 FS。

FS 值并没有被限制为单一字符；可以通过指定任意长度的字符模式，将它设置成规则表达式。如果正在处理由一个或多个 tab 分隔的字段，您可能希望按以下方式设置 FS：

FS="\t+"

以上示例中，我们使用特殊 "+" 规则表达式字符，它表示“一个或多个前一字符”。

如果字段由空格分隔（一个或多个空格或 tab），您可能想要将 FS 设置成以下规则表达式：

FS="[[:space:]+]"

这个赋值表达式也有问题，它并非必要。为什么？因为缺省情况下，FS 设置成单一空格字符，awk 将这解释成表示“一个或多个空格或 tab”。在这个特殊示例中，缺省 FS 设置恰恰是您最想要的！
复杂的规则表达式也不成问题。即使您的记录由单词 "foo" 分隔，后面跟着三个数字，以下规则表达式仍允许对数据进行正确的分析：

FS="foo[0-9][0-9][0-9]"

＝＋＝＋＝＋＝＋＝＋＝＋＝＋＝

字段数量

接着我们要讨论的两个变量通常并不是需要赋值的，而是用来读取以获取关于输入的有用信息。第一个是 NF 变量，也叫做“字段数量”变量。awk 会自动将该变量设置成当前记录中的字段数量。可以使用 NF 变量来只显示某些输入行：

NF == 3 { print "this particular record has three fields: " $0 }
当然，也可以在条件语句中使用 NF 变量，如下：

{
    if ( NF > 2 ) {
        print $1 " " $2 ":" $3
    }
}

＋＝＋＝＋＝＋＝＋＝＋＝＋＝

记录号

记录号 (NR) 是另一个方便的变量。它始终包含当前记录的编号（awk 将第一个记录算作记录号 1）。迄今为止，我们已经处理了每一行包含一个记录的输入文件。对于这些情况，NR 还会告诉您当前行号。然而，当我们在本系列以后部分中开始处理多行记录时，就不会再有这种情况，所以要注意！可以象使用 NF 变量一样使用 NR 来只打印某些输入行：

(NR < 10 ) || (NR > 100) { print "We are on record number 1-9 or 101+" }
另一个示例：

{
    #skip header
    if ( NR > 10 ) {
        print "ok, now for the real information!"
    }
}

两条有用的命令
打印奇数行的内容
1｀awk 'NR%2==1' filename
打印偶数行的内容
2,awk 'NR%2==0' filename

awk下面的变量NF和$NF有什么区别?

{print NF} 也有{print $NF}
前者是输出了域个数，后者是输出最后一个字段的内容

如：~# echo $PWD | awk -F/ '{print $NF}'
root

{print NF} 也有{print $NF}
前者是输出了域个数，后者是输出最后一个字段的内容

如：~# echo $PWD | awk -F/ '{print $NF}'
root

阅读(1529) | 评论(0) | 转发(0) |

上一篇：变量的间接引用

下一篇：人生五十大信条

给主人留下些什么吧！~~

感谢所有关心和支持过ChinaUnix的朋友们

16024965号-6