shell 脚本完成对日志文件的提取之awk 学习

来源：互联网发布：混音软件编辑：程序博客网时间：2024/06/04 18:57

前言

学习awk/sed/zmore/zgrep、istat

正文

1.awk

awk就是把文件逐行的读入，以空格为默认分隔符将每行切片，切开的部分再进行各种分析处理(awk是一个强大的文本分析工具，相对于grep的查找，sed的编辑，awk在其对数据分析并生成报告时，显得尤为强大。)。

使用方法

awk '{pattern + action}' {filenames}

尽管操作可能会很复杂，但语法总是这样，其中pattern 表示 AWK 在数据中查找的内容，而 action 是在找到匹配内容时所执行的一系列命令。花括号（{}）不需要在程序中始终出现，但它们用于根据特定的模式对一系列指令进行分组。 pattern就是要表示的正则表达式，用斜杠括起来。

awk语言的最基本功能是在文件或者字符串中基于指定规则浏览和抽取信息，awk抽取信息后，才能进行其他文本操作。完整的awk脚本通常用来格式化文本文件中的信息。

通常，awk是以文件的一行为处理单位的。awk每接收文件的一行，然后执行相应的命令，来处理文本。

调用awk

有三种方式调用awk

1.命令行方式awk [-F  field-separator]  'commands'  input-file(s)其中，commands 是真正awk命令，[-F域分隔符]是可选的。 input-file(s) 是待处理的文件。在awk中，文件的每一行中，由域分隔符分开的每一项称为一个域。通常，在不指名-F域分隔符的情况下，默认的域分隔符是空格。2.shell脚本方式将所有的awk命令插入一个文件，并使awk程序可执行，然后awk命令解释器作为脚本的首行，一遍通过键入脚本名称来调用。相当于shell脚本首行的：#!/bin/sh可以换成：#!/bin/awk3.将所有的awk命令插入一个单独文件，然后调用：awk -f awk-script-file input-file(s)其中，-f选项加载awk-script-file中的awk脚本，input-file(s)跟上面的是一样的。

入门实例

1.显示最近登录的5个帐号

[]:/home/>last -n 5 |awk '{print $1}' ；

p s:awk工作流程是这样的：读入有'\n'换行符分割的一条记录，然后将记录按指定的域分隔符划分域，填充域，$0则表示所有域,$1表示第一个域,$n表示第n个域。默认域分隔符是"空白键" 或 "[tab]键",所以$1表示登录用户，$3表示登录用户ip,以此类推。

2. 现实etc/passwd 的账户名

[]:/etc>cat passwd |awk -F ':' '{print $1}'

p s:这种是awk+action的示例，每行都会执行action{print $1}。

-F指定域分隔符为':'。

3. 801500.awk 文件功能：去掉日志文件标签</ROOT>之前的换行：

执行：zmore *.gz|awk -f ./801500.awk

4.显示/etc/passwd的账户和账户对应的shell,而账户与shell之间以tab键分割

[]:/etc>cat passwd |awk -F ':' '{print $1"\t"$7}'

5.如果只是显示/etc/passwd的账户和账户对应的shell,而账户与shell之间以逗号分割,而且在所有行添加列名name,shell,在最后一行添加"kevin,devzkn"。

[]:/etc>cat passwd |awk -F ':' ' BEGIN {print "name,shell"}{print $1","$7} END {print "kevin,devzkn"} '

ps:awk工作流程是这样的：先执行BEGING，然后读取文件，读入有/n换行符分割的一条记录，然后将记录按指定的域分隔符划分域，填充域，$0则表示所有域,$1表示第一个域,$n表示第n个域,随后开始执行模式所对应的动作action。接着开始读入第二条记录······直到所有的记录都读完，最后执行END操作。

6.搜索/etc/passwd有root关键字的所有行

:/etc>cat passwd | awk -F: '/root/'

这种是pattern的使用示例，匹配了pattern(这里是root)的行才会执行action(没有指定action，默认输出每行的内容)。

搜索支持正则，例如找root开头的: awk -F: '/^root/' /etc/passwd

awk内置变量

awk有许多内置变量用来设置环境信息，这些变量可以被改变，下面给出了最常用的一些变量。

ARGC               命令行参数个数ARGV               命令行参数排列ENVIRON            支持队列中系统环境变量的使用FILENAME           awk浏览的文件名FNR                浏览文件的记录数FS                 设置输入域分隔符，等价于命令行 -F选项NF                 浏览记录的域的个数NR                 已读的记录数OFS                输出域分隔符ORS                输出记录分隔符RS                 控制记录分隔符

1.统计/etc/passwd:文件名，每行的行号，每行的列数，对应的完整行内容:

[]:/etc>awk -F ':' '{print filemane: "FILENAME",linenumber:"NR",columns: "NF",linecontent :"$0"}' passwd

使用printf替代print,可以让代码更加简洁，易读

[]:/etc>awk -F':' '{printf("filename:%10s,linenumber:%s,cloumns:%s,linecontent:%s\n",FILENAME,NR,NF,$0)}' passwd

ps:print和printf

其中print函数的参数可以是变量、数值或者字符串。字符串必须用双引号引用，参数用逗号分隔。这里，逗号的作用与输出文件的分隔符的作用是一样的，只是后者是空格而已。

printf函数，其用法和c语言中printf基本相似,可以格式化字符串,输出复杂时，printf更加好用，代码更易懂。

awk编程

变量和赋值

除了awk的内置变量，awk还可以自定义变量。

1.下面统计/etc/passwd的账户人数

[]:/etc>awk '{count++;print $0;} END {print"user count is :",count}' passwd

ps :

count是自定义变量。action{}可以有多个语句，以;号隔开。

2.统计某个文件夹下的文件占用的大小，单位为M

[]:/etc>ls -l |awk '{size=0;} {size=size+$5;}END {print "[end]size is :",size/1024/1024,"M"}'

条件语句

awk中的条件语句是从C语言中借鉴来的，见如下声明方式：

if (expression) {    statement;    statement;    ... ...}if (expression) {    statement;} else {    statement2;}if (expression) {    statement1;} else if (expression1) {    statement2;} else {    statement3;}

统计某个文件夹下的文件占用的字节数,过滤4096大小的文件(一般都是文件夹):

[]:/etc>ls -l |awk '{size=0;} {if($5<=4096){size=size+$5;}}END {print "[end]size is :",size/1024/1024,"M"}'

ps:

循环语句

awk中的循环语句同样借鉴于C语言，支持while、do/while、for、break、continue，这些关键字的语义和C语言中的语义完全相同。

数组

因为awk中数组的下标可以是数字和字母，数组的下标通常被称为关键字(key)。值和关键字都存储在内部的一张针对key/value应用hash的表格里。由于hash不是顺序存储，因此在显示数组内容时会发现，它们并不是按照你预料的顺序显示出来的。数组和变量一样，都是在使用时自动创建的，awk也同样会自动判断其存储的是数字还是字符串。一般而言，awk中的数组用来从记录中收集信息，可以用于计算总和、统计单词以及跟踪模板被匹配的次数等等。

1.显示/etc/passwd的账户

[]:/etc>cat passwd |awk -F':' 'BEGIN {count=0;}{name[count]=$1;count++;};END {for (i=0;i<NR;i++){print i,name[i]}}'

0 0