awk

来源：互联网发布：软件开发框架设计编辑：程序博客网时间：2024/06/15 15:56

http://zhu8337797.blog.163.com/blog/static/17061754920101130317199/

http://blog.csdn.net/langlang2671/article/details/8174255

awk作为文本处理优秀工具之一，它有独自丰富的运算符。下面我们一起归纳总结一下，所有运算符。可以分为：算术运算符，赋值运算符，关系运算符，逻辑预算法，正则运算符。

一、运算符介绍

运算符描述赋值运算符= += -= *= /= %= ^= **=赋值语句逻辑运算符||逻辑或&&逻辑与正则运算符~ ~!匹配正则表达式和不匹配正则表达式关系运算符< <= > >= != ==关系运算符算术运算符+ -加，减* / &乘，除与求余+ - !一元加，减和逻辑非^ ***求幂++ --增加或减少，作为前缀或后缀其它运算符$字段引用空格字符串连接符?:C条件表达式in数组中是否存在某键值

说明：awk运算符基本与c语言相同。表达式及功能基本相同

二、实例介绍

awk赋值运算符

a+=5; 等价于：a=a+5; 其它同类

awk逻辑运算符

[chengmo@localhost ~]$ awk 'BEGIN{a=1;b=2;print (a>5 && b<=2),(a>5 || b<=2);}'
0 1

awk正则运算符

[chengmo@localhost ~]$ awk 'BEGIN{a="100testa";if(a ~ /^100*/){print "ok";}}'
ok

awk关系运算符

如：> < 可以作为字符串比较，也可以用作数值比较，关键看操作数如果是字符串就会转换为字符串比较。两个都为数字才转为数值比较。字符串比较：按照ascii码顺序比较。
[chengmo@localhost ~]$ awk 'BEGIN{a="11";if(a >= 9){print "ok";}}'

[chengmo@localhost ~]$ awk 'BEGIN{a=11;if(a >= 9){print "ok";}}'
ok

awk算术运算符

说明，所有用作算术运算符进行操作，操作数自动转为数值，所有非数值都变为0。
[chengmo@localhost ~]$ awk 'BEGIN{a="b";print a++,++a;}'
0 2

其它运算符

?:运算符
[chengmo@localhost ~]$ awk 'BEGIN{a="b";print a=="b"?"ok":"err";}'
ok

in运算符
[chengmo@localhost ~]$ awk 'BEGIN{a="b";arr[0]="b";arr[1]="c";print (a in arr);}'
0

[chengmo@localhost ~]$ awk 'BEGIN{a="b";arr[0]="b";arr["b"]="c";print (a in arr);}'
1
in运算符，判断数组中是否存在该键值。

扩展的正则表达式（Extended Regular Expression 又叫 ExtendedRegEx 简称 EREs）。

一、awk Extended Regular Expression (ERES)基础表达式符号介绍

+指定如果一个或多个字符或扩展正则表达式的具体值（在 +（加号）前）在这个字符串中，则字符串匹配。命令行：

awk '/smith+ern/'testfile

将包含字符 smit，后跟一个或多个 h 字符，并以字符 ern 结束的字符串的任何记录打印至标准输出。此示例中的输出是：

smithern, harrysmithhern, anne

?指定如果零个或一个字符或扩展正则表达式的具体值（在 ?（问号）之前）在字符串中，则字符串匹配。命令行：

awk '/smith?/'testfile

将包含字符 smit，后跟零个或一个 h 字符的实例的所有记录打印至标准输出。此示例中的输出是：

smith, alansmithern, harry smithhern, anne smitters, alexis

|指定如果以 |（垂直线）隔开的字符串的任何一个在字符串中，则字符串匹配。命令行：

awk '/allen | alan/' testfile

将包含字符串 allen 或 alan 的所有记录打印至标准输出。此示例中的输出是：

smiley, allensmith, alan

( )在正则表达式中将字符串组合在一起。命令行：

awk'/a(ll)?(nn)?e/' testfile

将具有字符串 ae 或 alle 或 anne 或 allnne 的所有记录打印至标准输出。此示例中的输出是：

smiley, allensmithhern, anne

{m}指定如果正好有 m 个模式的具体值位于字符串中，则字符串匹配。命令行：

awk '/l{2}/'testfile

打印至标准输出

smiley, allen

{m,}指定如果至少 m 个模式的具体值在字符串中，则字符串匹配。命令行：

awk '/t{2,}/'testfile

打印至标准输出：

smitters, alexis

{m, n}指定如果 m 和 n 之间（包含的 m 和 n）个模式的具体值在字符串中（其中m<= n），则字符串匹配。命令行：

awk '/er{1, 2}/'testfile

打印至标准输出：

smithern, harrysmithern, anne smitters, alexis

[String]指定正则表达式与方括号内 String 变量指定的任何字符匹配。命令行：

awk '/sm[a-h]/'testfile

将具有 sm 后跟以字母顺序从 a 到 h 排列的任何字符的所有记录打印至标准输出。此示例的输出是：

smawley, andy

[^ String]在 [ ]（方括号）和在指定字符串开头的 ^ (插入记号) 指明正则表达式与方括号内的任何字符不匹配。这样，命令行： awk '/sm[^a-h]/' testfile

打印至标准输出：

smiley, allensmith, alan smithern, harry smithhern, anne smitters, alexis

~,!~表示指定变量与正则表达式匹配（代字号）或不匹配（代字号、感叹号）的条件语句。命令行： awk '$1 ~ /n/' testfile

将第一个字段包含字符 n 的所有记录打印至标准输出。此示例中的输出是：

smithern, harrysmithhern, anne

^指定字段或记录的开头。命令行： awk '$2 ~ /^h/' testfile

将把字符 h 作为第二个字段的第一个字符的所有记录打印至标准输出。此示例中的输出是：

smithern, harry

$指定字段或记录的末尾。命令行： awk '$2 ~ /y$/' testfile

将把字符 y 作为第二个字段的最后一个字符的所有记录打印至标准输出。此示例中的输出是：smawley, andy smithern, harry

. （句号）表示除了在空白末尾的终端换行字符以外的任何一个字符。命令行：

awk '/a..e/'testfile

将具有以两个字符隔开的字符 a 和 e 的所有记录打印至标准输出。此示例中的输出是：

smawley, andysmiley, allen smithhern, anne

*（星号）表示零个或更多的任意字符。命令行： awk '/a.*e/'testfile

将具有以零个或更多字符隔开的字符 a 和 e 的所有记录打印至标准输出。此示例中的输出是：smawley, andy smiley, allen smithhern, anne smitters, alexis

\ (反斜杠)转义字符。当位于在扩展正则表达式中具有特殊含义的任何字符之前时，转义字符除去该字符的任何特殊含义。例如，命令行：

/a\/\//

将与模式 a // 匹配，因为反斜杠否定斜杠作为正则表达式定界符的通常含义。要将反斜杠本身指定为字符，则使用双反斜杠。有关反斜杠及其使用的更多信息，请参阅以下关于转义序列的内容。

与PERs相比，主要是一些结合类型表示符没有了：包括：”\d,\D,\s,\S,\t,\v,\n,\f,\r”其它功能基本一样的。我们常见的软件：javascript,.net,java支持的正则表达式，基本上是：EPRs类型。

二、awk 常见调用正则表达式方法

awk语句中：

awk‘/REG/{action}’

/REG/为正则表达式，可以将$0中，满足条件记录送入到：action进行处理.

awk正则运算语句(~,~!等同!~)

[chengmo@centos5~]$ awk 'BEGIN{info="this is a test";if( info ~ /test/){print"ok"}}'
ok

[chengmo@centos5~]$ awk 'BEGIN{info="this is a test";if( info ~ /[^0-9][^a-z]/){print"ok"}}'

awk内置使用正则表达式函数

gsub( Ere, Repl, [In ] )

sub( Ere, Repl, [In ] )

match( String, Ere)

split( String, A,[Ere] )

表-Awk的正则表达式元字符
元字符
^ 在串首匹配
$ 在串尾匹配
. 匹配单个任意字符
* 匹配零个或多个前导字符
+ 匹配一个或多个前导字符
？匹配零个或一个前导字符
[ABC] 匹配指定字符组（即A、B和C）中任一字符
[^ABC] 匹配任何一个不在指定字符组（即A、B和C）中的字符
[A-Z] 匹配A至Z之间的任一字符
A|B 匹配A或B
(AB)+ 匹配一个或多个AB的组合，例如：AB、ABAB、ABABAB
\* 匹配星号本身
& 用于替代串中，代表查找串中匹配到的内容