shell编程系列14--文本处理三剑客之awk的概述及常用方法总结

awk是一个文本处理工具,通常用于处理数据并生成结果报告
awk的命名是它的创始人 Alfred Aho、Peter Weinberger和Brian Kernighan 姓氏的首个字母组成的 awk的工作模式

语法格式 第一种形式: awk 'BEGIN{}pattern{commands}END{}' file_name BEGIN在匹配之前就执行的操作,pattern{commands}是对每一行的操作,END是匹配完后的操作 第二种形式: standard output | awk 'BEGIN{}pattern{commands}END{}' 语法格式说明

语法格式     说明
BEGIN{} 正式处理数据之前执行
pattern 匹配模式
{commands} 处理命令,可能多行
END{} 处理完所有匹配数据后执行 awk的内置变量 内置变量对照表(上) 内置变量 含义
$ 整行内容
$-$n 当前行的第1-n个字段
NF 当前行的字段个数,也就是多少列
NR 当前的行号,从1开始计数
FNR 多文件处理时,每个文件行号单独计数,都是从0开始
FS 输入字段分隔符。不指定默认以空格或tab键分割
RS 输入行分隔符。默认回车换行
OFS 输出字段分隔符。默认为空格
ORS 输出行分隔符。默认为回车换行

内置变量对照表(下) 内置变量 含义
FILENAME 当前输入的文件名字
ARGC 命令行参数个数
ARGV 命令行参数数组

总结:
内置变量:
$ 打印行所有信息
$~$n 打印行的第1到n个字段信息
NF Number Field 处理行的字段个数
NR Number Row 处理行的行号
FNR File Number Row 多文件处理时,每个文件单独记录行号
FS Field Separator 字段分隔符,不指定时默认以空格或tab键分割
RS Row Separator 行分隔符,不指定时以回车换行分割
OFS Output Filed Separator 输出字段分隔符
ORS Output Row Separator 输出行分隔符
FILENAME 处理文件的文件名
ARGC 命令行参数个数
ARGV 命令行参数数组 # 输出整行数据 [root@localhost shell]# awk '{print $0}' passwd
root:x:::root:/root:/bin/bash
bin:x:::bin:/bin:/sbin/nologin
daemon:x:::daemon:/sbin:/sbin/nologin
adm:x:::adm:/var/adm:/sbin/nologin
lp:x:::lp:/var/spool/lpd:/sbin/nologin
sync:x:::sync:/sbin:/bin/sync
shutdown:x:::shutdown:/sbin:/sbin/shutdown
halt:x:::halt:/sbin:/sbin/halt
mail:x:::mail:/var/spool/mail:/sbin/nologin
operator:x:::operator:/root:/sbin/nologin
games:x:::games:/usr/games:/sbin/nologin
ftp:x:::FTP User:/var/ftp:/sbin/nologin
nobody:x:::Nobody:/:/sbin/nologin
systemd-network:x:::systemd Network Management:/:/sbin/nologin
dbus:x:::System message bus:/:/sbin/nologin
polkitd:x:::User for polkitd:/:/sbin/nologin
sshd:x:::Privilege-separated SSH:/var/empty/sshd:/sbin/nologin
postfix:x::::/var/spool/postfix:/sbin/nologin
ajie:x:::ajie:/home/ajie:/bin/bash
chrony:x::::/var/lib/chrony:/sbin/nologin
deploy:x::::/home/deploy:/bin/bash
nginx:x:::Nginx web server:/var/lib/nginx:/sbin/nologin # FS指定分隔符
[root@localhost shell]# awk 'BEGIN{FS=":"}{print $1}' passwd
root
bin
daemon
adm
lp
sync
shutdown
halt
mail
operator
games
ftp
nobody
systemd-network
dbus
polkitd
sshd
postfix
ajie
chrony
deploy
nginx # 默认以空格或者tab为分隔符
[root@localhost shell]# cat list
Hadoop Spark Flume
Java Python Scala
Allen Mike Meggie
[root@localhost shell]# awk '{print $1}' list
Hadoop
Java
Allen
[root@localhost shell]# awk 'BEGIN{FS=" "}{print $1}' list
Hadoop
Java
Allen # NF 输出每一行的字段个数
[root@localhost shell]# cat list
Hadoop Spark Flume
Java Python Scala Golang
Allen Mike Meggie
[root@localhost shell]# awk '{print NF}' list # NR 行号,处理多个文件(list,passwd,/etc/fstab)时行号累加
[root@localhost shell]# awk '{print NR}' list passwd /etc/fstab # FNR在处理两个文件以上时会单独计数
[root@localhost shell]# awk '{print FNR}' list passwd /etc/fstab [root@localhost shell]# cat list
Hadoop|Spark:Flume
Java|Python:Scala:Golang
Allen|Mike:Meggie # 以 | 符号分隔列
[root@localhost shell]# awk 'BEGIN{FS="|"}{print $2}' list
Spark:Flume
Python:Scala:Golang
Mike:Meggie
# 以 : 符号分隔列
[root@localhost shell]# awk 'BEGIN{FS=":"}{print $2}' list
Flume
Scala
Meggie # RS 指定行分隔符: --
[root@localhost shell]# cat list
Hadoop|Spark|Flume--Java|Python|Scala|Golang--Allen|Mike|Meggie
[root@localhost shell]# awk 'BEGIN{RS="--"}{print $0}' list
Hadoop|Spark|Flume
Java|Python|Scala|Golang
Allen|Mike|Meggie [root@localhost shell]# awk 'BEGIN{RS="--";FS="|"}{print $3}' list
Flume
Scala
Meggie # ORS输出分隔符,以&连接各输出行
[root@localhost shell]# awk 'BEGIN{RS="--";FS="|";ORS="&"}{print $3}' list
Flume&Scala&Meggie # 字段默认分隔符是空格
[root@localhost shell]# awk 'BEGIN{RS="--";FS="|";ORS="&"}{print $1,$3}' list
Hadoop Flume&Java Scala&Allen Meggie
& # OFS 指定字段分隔符为 :
[root@localhost shell]# awk 'BEGIN{RS="--";FS="|";ORS="&";OFS=":"}{print $1,$3}' list
Hadoop:Flume&Java:Scala&Allen:Meggie
& # FILENAME 文件名
[root@localhost shell]# awk '{print FILENAME}' list
list # 输出3次文件名list,是因为没有输入匹配模式 awk默认是行处理,文本有3行,处理三次会有3次输出
[root@localhost shell]# cat list
Hadoop|Spark|Flume--Java|Python|Scala|Golang--Allen|Mike|Meggie
Test File
Line
[root@localhost shell]# awk '{print FILENAME}' list
list
list
list # ARGC命令行参数个数
[root@localhost shell]# awk '{print ARGC}' list [root@localhost shell]# awk '{print ARGC}' list /etc/fstab # NF表示字段个数,NF= $NF 就是$ 表示最后一个字段
[root@localhost shell]# awk 'BEGIN{FS=":"}{print $NF}' /etc/passwd
/bin/bash
/sbin/nologin
/sbin/nologin
/sbin/nologin
/sbin/nologin
/bin/sync
/sbin/shutdown
/sbin/halt
/sbin/nologin
/sbin/nologin
/sbin/nologin
/sbin/nologin
/sbin/nologin
/sbin/nologin
/sbin/nologin
/sbin/nologin
/sbin/nologin
/sbin/nologin
/bin/bash
/sbin/nologin
/bin/bash
/sbin/nologin

最新文章

  1. Laravel大型项目系列教程(五)之文章和标签管理
  2. Makefile文件学习总结
  3. 密码校验正则表达式(java 环境)
  4. ALAssetsLibrary
  5. [PeterDLax著泛函分析习题参考解答]第1章 线性空间
  6. 转:史上最全最强SpringMVC详细示例实战教程
  7. qq邮箱是怎么做到同一个浏览器让多个不用用户同时打开的? --session的控制
  8. Activity的切换动画
  9. Dubbo(二) —— dubbo配置
  10. 其它综合-有趣的linux命令行工具-lolcat
  11. webpack4加载字体
  12. hdoj3251
  13. Java代码质量改进之:使用ThreadLocal维护线程内部变量
  14. laravel 自定义常量的方法
  15. SpringBoot集成jdbcTemplate/JPA
  16. 安装spark-1.5遇到的一些问题
  17. Linux下CPU信息的查看
  18. mysql条件查询中AND与OR联合使用的注意事项!
  19. 混沌数学之Kent模型
  20. Win10如何显示系统托盘所有图标

热门文章

  1. python模块统计
  2. MessageBox页面消息弹出框类
  3. JUC-10-ReadWriteLock读写锁
  4. java常用关键字(static、final、this、super)
  5. linux服务器初始化(防火墙、内核优化、时间同步、打开文件数)
  6. C# 异步的简单用法
  7. js遍历删除数组中不符合条件的元素
  8. info命令
  9. GoCN每日新闻(2019-09-24)
  10. (14)Go导入包几种方式