百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

Linux 下用 awk 分析日志文件实例

off999 2025-01-21 20:36 40 浏览 0 评论

关于 awk

awk 命令比较复杂,不过不要怕,这里不讲它那些复杂的参数,实际上我自己也只记得少数几个参数而已。。。

先简单的描述其作用如下

  • 对目标文件逐行分析
  • 对每一行的数据,默认以空格作为分隔符将其划分成多个域(或曰字段),并用 $n 来引用划分后的数据,其中 $0 表示原始的整行数据,而 $1 则表示划分出来的第一个域,依次类推
    • 当然你也可以自定义分隔符,这个属于进阶知识,暂时先放下不表
  • awk 有简单的编程能力,你写的代码需要用 '{}' 包围起来,在花括号里面写代码,作为程序员写 awk 的代码是很简单的,这里我们不打算讲 awk 的语法,一般常用的是
    • if 条件判断
    • print 打印输出

我们的日志文件,基本上每一行的格式都是固定的,所以就很适合用 awk 来分析了,接下来用一个稍有点复杂的案例来讲解下

目标

通过分析业务系统的 error.log 日志,统计出有哪些异常及其数量

分析

首先要看下异常日志的格式

2020-07-19 01:03:41,399 ERROR [qtp738355611-33898] [AppInfoController] - appUpdate:
java.lang.NumberFormatException: !hex 215
        at org.eclipse.jetty.util.TypeUtil.convertHexDigit(TypeUtil.java:375)
        at org.eclipse.jetty.util.UrlEncoded.decodeUtf8To(UrlEncoded.java:545)
        at org.eclipse.jetty.util.UrlEncoded.decodeTo(UrlEncoded.java:601)
        at org.eclipse.jetty.server.Request.extractParameters(Request.java:298)
        at org.eclipse.jetty.server.Request.getParameter(Request.java:708)
        at com.meizu.apkfilemanage.common.util.BuildBeanUtil.buildAppUpdate(BuildBeanUtil.java:905)
        at com.meizu.apkfilemanage.web.AppInfoController.appUpdate(AppInfoController.java:204)
        at sun.reflect.GeneratedMethodAccessor132.invoke(Unknown Source)

经过分析,发现每次打印异常的格式如下

  • 第一行:时间,日志级别,线程信息,类,异常消息(业务)
  • 第二行及后续:异常堆栈信息,其中第二行是异常的类名及异常消息

那么我们的思路是

  1. 找到有第三个域为 ERROR 的那一行
  2. 该行的下一行就是我们需要统计分析的那一行

命令

注意:该命令在 Linux 命令行下应该在同一行,这里为了排版需要,分成了多行

zcat error.log.20200719.gz | 
    awk -v line=0 '{if (line==1) print($0); if ($3=="ERROR") {line=1;} else {line=0;}}' | 
    sort | uniq -c | sort -rn

命令执行结果如下

     54 redis.clients.jedis.exceptions.JedisConnectionException: Could not get a resource from the pool
     54 org.mybatis.spring.MyBatisSystemException: nested exception is org.apache.ibatis.exceptions.PersistenceException:
     28 org.springframework.http.converter.HttpMessageNotWritableException: Could not write JSON: org.eclipse.jetty.io.EofException; nested exception is com.google.gson.JsonIOException: org.eclipse.jetty.io.EofException
     12 org.springframework.dao.DeadlockLoserDataAccessException:
      8 org.springframework.transaction.CannotCreateTransactionException: Could not open JDBC Connection for transaction; nested exception is java.sql.SQLException: An attempt by a client to checkout a Connection has timed out.
      7 java.lang.IllegalArgumentException: fromIndex(150) > toIndex(127)
      6 redis.clients.jedis.exceptions.JedisConnectionException: java.net.SocketTimeoutException: Read timed out
      4 org.springframework.dao.DataIntegrityViolationException:
      4 java.lang.IllegalStateException: Optional long parameter 'timestamp' is present but cannot be translated into a null value due to being declared as a primitive type. Consider declaring it as object wrapper for the corresponding primitive type.
      3 org.eclipse.jetty.io.EofException
      3 java.lang.NullPointerException
      3 java.lang.IllegalArgumentException: fromIndex(150) > toIndex(131)
      3 com.alibaba.fastjson.JSONException: syntax error, pos 720
      1 org.springframework.dao.CannotAcquireLockException:
      1 java.lang.NumberFormatException: !hex 71
      1 java.lang.NumberFormatException: !hex 34
      1 java.lang.NumberFormatException: !hex 215
      1 java.lang.NumberFormatException: !hex 15
      1 com.alibaba.fastjson.JSONException: unclosed string : 
      1 com.alibaba.fastjson.JSONException: unclosed string : 
      1 com.alibaba.fastjson.JSONException: syntax error, unexpect token error
      1 com.alibaba.fastjson.JSONException: not match ':' - ,
      1 com.alibaba.fastjson.JSONException: error parse false

命令解析

zcat

和 cat 命令类似,不过作用的对象是压缩文件,将文件内容直接输出

|

这是 linux 管道符,他的作用是把管道符左边命令的输出当作管道符右边命令的输入,示例

ps aux | grep 'java'

awk

  • -v :我们定义了一个变量 line,其初始值为 0,如果为 1 就表示当前行是异常堆栈的第一行,我们要将该行输出供后续统计
awk -v line=0 '{if (line==1) print($0); if($3=="ERROR") {line=1;} else {line=0;}}'

我们知道,awk 命令会对输入的文本逐行进行处理,类似以下的处理过程

while 当前行不为空
    处理 当前行
    移动到 下一行

那么上面的命令就可以这样理解

# line 自定义变量,指示当前行是否包含异常信息 
line = 0
while 当前行不为空
    if line == 1 
        输出当前行
    if $3 == 'ERROR'
        line = 1
    else
        line = 0

这段代码的作用就是找到含有 ERROR 的行,并将其下一行打印输出

sort

以行为单位对文本进行排序,如果要做统计,必须先排序,后续才能使用 uniq 的去重统计功能

uniq

删除重复的行,参数

  • -c 在输出行前面加上每行在输入文件中出现的次数。
  • -d 仅显示重复行。
  • -u 仅显示不重复的行

一些常用的 awk 命令

统计各个接口的 pv

分析 nginx 的 access 日志文件,假定你的日志格式里,请求 uri 是在第 14 个域

awk '{print $14}}' xxx_access.log | sort | uniq -c | sort -rn | head -n 20

统计慢接口

假定你的日志文件里,http 响应时间在第9个域,那么要统计响应时间超过 1 秒的接口数量

awk '{if($9>1)print $0}' | wc -l

如果想要输出具体是哪些接口,可以结合上面命令

awk '{if($9>1)print $0}'|awk '{print $14}' |sort|uniq -c|sort -rn|head -n 20

如果要分时段统计慢接口

  • -F :自定义分隔符,因为时间是用 : 分隔的,所以经过 awk 分隔后第一个域就是小时数了
awk '{if($9>1)print $1}'|awk -F ':' '{print $1}'|uniq -c

统计各响应码

假定你的日志文件里 http 响应码是第二个域

awk '{print $2}'| sort | uniq -c | sort -rn

相关推荐

「Python条件结构」if…else实现判断奇偶数

功能要求用户从键盘上输入一个整数,判断该数是奇数还是偶数。说明:能被2整除的整数叫偶数,不能被2整除的叫奇数;即该数除以2后余数为0时该数为偶数,否则该数为奇数。求余数运算符为“%”。实例代码num...

Python if else条件语句详解

前面我们看到的代码都是顺序执行的,也就是先执行第1条语句,然后是第2条、第3条……一直到最后一条语句,这称为顺序结构。但是对于很多情况,顺序结构的代码是远远不够的,比如一个程序限制了只能成年人使用,儿...

python基础篇: python中的流程控制,你都了解吗?

在之前的文章中大致的介绍过python中的流程控制语句,今天通过一些案例来详细了解一下python中的流程语句。目前python中流程控制语句,包含如下,如有遗漏欢迎留言补充。在python中条件判断...

python中if语句

if语句用来判断,当不同的条件成立去做与之对应事情;格式如下:if条件:执行代码条件为True才会去做执行代码布尔类型(bool)说到布尔类型,就像开关只有两个值一样,布尔类型的值只有两个...

python中的循环语句到底难不难

好多初学者会有一种这样的心里:循环难不难?该怎么学习?下面来给大家分析下.Python中的循环语句并不难,但需要理解其核心逻辑和应用场景。以下是针对零基础学习者的清晰解析,通过对比、示例和常见误...

Python6大基础运算符,看完这篇之后会让你有一个彻底认识

昨天我们准备好了Python程序所需要的的东西,那么今天我们开始了解Python的各种基础运算符,这些要是不熟悉下来你后面的路也会走的很艰难Python支持基础运算符,常见的算术运算符有+、-、*、/...

Python基础:条件语句和循环语句

下面会详细讲解一下Python关于条件语句和循环语句,会包含一些示例代码。我们首先来介绍条件语句(if-else),然后再讨论循环语句(for和while循环)。条件语句(if-else)在Pytho...

Python合集之Python循环语句(一)

在上一节的合集中,我们了解了Python流程控制语句中if语句的嵌套及条件表达会的相关知识,本节我们将进一步了解一下Python循环语句中的while语句的相关知识。在日常生活中很多问题都无...

Python“三步”即可爬取,毋庸置疑

声明:本实例仅供学习,切忌遵守robots协议,请不要使用多线程等方式频繁访问网站。#第一步导入模块importreimportrequests#第二步获取你想爬取的网页地址,发送请求,获取网页内...

「Python条件结构」if…else实现三角形判断

功能要求编写程序,判断输入的三个数是否能构成三角形的三个边。如果可以,打印“可以构成三角形”;如果不可以,打印“不可以构成三角形”。构成三角形的条件是:三条边都等于0,且任何2条边的边长之和都大于第三...

Python中检查对象是否具有某个属性的方法

技术背景在Python编程中,经常会遇到需要检查一个对象是否具有某个特定属性的情况。例如,在调用对象的属性之前,需要先确认该属性是否存在,以避免引发AttributeError异常。以下将介绍几种常见...

Python条件语句:从入门到精通

导语条件语句是编程中的基础概念,它允许我们根据不同的条件执行不同的代码块。在Python中,条件语句的灵活性和易读性使其成为编写逻辑判断和流程控制的强大工具。本教程将带您深入了解Python条件语句的...

简单学Python——条件语句if

条件语句是用来判断给定的条件是否满足(表达式值是否为0或False),并根据判断的结果(真或假)决定执行的语句。Python条件语句用的是if或if和else、elif等搭配实现的。代码执行的过程:i...

Python合集之Python跳转语句(一)

在上一节的合集中,我们了解了Python循环嵌套语句的相关知识,本节我们将进一步了解一下Python跳转语句中的break的相关知识。当循环条件一直满足时,程序会一直执行下去,如果希望在中间离开循环...

新手学Python避坑,学习效率狂飙! 八、Python 布尔值判断

布尔值判断系统知识在Python里,布尔类型仅有两个值:True和False,它们常被用于条件判断。下面从几个方面展开介绍:1.布尔运算逻辑与(and):只有当两个操作数都为True时,...

取消回复欢迎 发表评论: