性能文章>Linux性能问题分析流程与性能优化>

Linux性能问题分析流程与性能优化转载

191000

导语

本篇主要详细解读了Linux性能相关的性能问题分析和优化方案,内容更偏向干货,基础知识较多。

 

正文

排查顺序

整体情况:

  • top/htop/atop命令查看进程/线程、CPU、内存使用情况,CPU使用情况;
  • dstat 2查看CPU、磁盘IO、网络IO、换页、中断、切换,系统I/O状态;
  • vmstat 2查看内存使用情况,内存状态;
  • iostat -d -x 2查看所有磁盘的IO情况,系统I/O状态;
  • iotop查看IO靠前的进程,系统的I/O状态;
  • perf top查看占用CPU最多的函数,CPU使用情况;
  • perf record -ag -- sleep 15;perf report查看CPU事件占比,调用栈,CPU使用情况;
  • sar -n DEV 2查看网卡的吞吐,网卡状态;
  • /usr/share/bcc/tools/filetop -C查看每个文件的读写情况,系统的I/O状态;
  • /usr/share/bcc/tools/opensnoop显示正在被打开的文件,系统的I/O状态;
  • mpstat -P ALL 1 单核CPU是否被打爆;
  • ps aux --sort=-%cpu 按CPU使用率排序,找出CPU消耗最多进程;
  • ps -eo pid,comm,rss | awk '{m=$3/1e6;s["*"]+=m;s[$2]+=m} END{for (n in s) printf"%10.3f GB %s\n",s[n],n}' | sort -nr | head -20 统计前20内存占用;
  • awk 'NF>3{s["*"]+=s[$1]=$3*$4/1e6} END{for (n in s) printf"%10.1f MB %s\n",s[n],n}' /proc/slabinfo | sort -nr | head -20 统计内核前20slab的占用;

进程分析,进程占用的资源:

  • pidstat 2 -p 进程号查看可疑进程CPU使用率变化情况;
  • pidstat -w -p 进程号 2查看可疑进程的上下文切换情况;
  • pidstat -d -p 进程号 2查看可疑进程的IO情况;
  • lsof -p 进程号查看进程打开的文件;
  • strace -f -T -tt -p 进程号显示进程发起的系统调用;

协议栈分析,连接/协议栈状态:

  • ethtool -S 查看网卡硬件情况;
  • cat /proc/net/softnet_stat/ifconfig eth1 查看网卡驱动情况;
  • netstat -nat|awk '{print awk $NF}'|sort|uniq -c|sort -n查看连接状态分布;
  • ss -ntp或者netstat -ntp查看连接队列;
  • netstat -s 查看协议栈情况;

方**

RED方法:监控服务的请求数(Rate)、错误数(Errors)、响应时间(Duration)。Weave Cloud在监控微服务性能时提出的思路。

USE方法:监控系统资源的使用率(Utilization)、饱和度(Saturation)、错误数(Errors)。

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

性能分析工具

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

Linux 内核的各个子系统出发,汇总了对各个子系统进行性能分析时,你可以选择的工具。不过,虽然这个图是性能分析最好的参考资料之一,它其实还不够具体。比如,当你需要查看某个性能指标时,这张图里对应的子系统部分,可能有多个性能工具可供选择。但实际上,并非所有这些工具都适用,具体要用哪个,还需要你去查找每个工具的手册,对比分析做出选择。

CPU分析思路

首先,从 CPU 的角度来说,主要的性能指标就是 CPU 的使用率、上下文切换以及 CPU Cache 的命中率等。下面这张图就列出了常见的 CPU 性能指标。

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区


内存分析思路


接着我们来看内存方面。从内存的角度来说,主要的性能指标,就是系统内存的分配和使用、进程内存的分配和使用以及 SWAP 的用量。下面这张图列出了常见的内存性能指标。

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

IO分析思路

从文件系统和磁盘 I/O 的角度来说,主要性能指标,就是文件系统的使用、缓存和缓冲区的使用,以及磁盘 I/O 的使用率、吞吐量和延迟等。下面这张图列出了常见的 I/O 性能指标。

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

网络分析思路

从网络的角度来说,主要性能指标就是吞吐量、响应时间、连接数、丢包数等。根据 TCP/IP 网络协议栈的原理,我们可以把这些性能指标,进一步细化为每层协议的具体指标。这里我同样用一张图,分别从链路层、网络层、传输层和应用层,列出了各层的主要指标。

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

基准测试工具

除了性能分析外,很多时候,我们还需要对系统性能进行基准测试。比如,

  • 在文件系统和磁盘 I/O 模块中,我们使用 fio 工具,测试了磁盘 I/O 的性能。
  • 在网络模块中,我们使用 iperf、pktgen 等,测试了网络的性能。
  • 而在很多基于 Nginx 的案例中,我们则使用 ab、wrk 等,测试 Nginx 应用的性能。

 

Linux性能问题分析流程与性能优化数据图表-heapdump性能社区

 

分类:
标签:
请先登录,再评论

暂无回复,快来写下第一个回复吧~

为你推荐

在调试器里看LINUX内核态栈溢出
图灵最先发明了栈,但没有给它取名字。德国人鲍尔也“发明”了栈,取名叫酒窖。澳大利亚人汉布林也“发明”了栈,取名叫弹夹。1959年,戴克斯特拉在度假时想到了Stack这个名字,后来被广泛使用。
LONG究竟有多长,从皇帝的新衣到海康SDK
转眼之间初中毕业30年了,但我仍清楚的记得初中英语的一篇课文,题目叫《皇帝的新装》(“The king’s new clothes”)。这篇课文的前两句话是:”Long long ago, there
雕刻在LINUX内核中的LINUS故事
因为LINUX操作系统的流行,Linus 已经成为地球人都知道的名人。虽然大家可能都听过钱钟书先生的名言:“假如你吃个鸡蛋觉得味道不错,又何必认识那个下蛋的母鸡呢?” 但是如果真是遇到一个“特别显赫”
如何使用Linux内核中没有被导出的变量或函数?
本文详细介绍了使用EXPORT_SYMBOL宏导出函数或变量、使用kallsyms_lookup_name()查找函数或变量的虚拟地址以及内核模块中直接使用内核函数的虚拟地址等3种方案解决没有被EXPORT_SYMBOL 相关的宏导出的变量或函数不能直接使用的问题
LINUX网络子系统中DMA机制的实现
我们先从计算机组成原理的层面介绍DMA,再简单介绍Linux网络子系统的DMA机制是如何的实现的。 计算机组成原理中的DMA 以往的I/O设备和主存交换信息都要经过CPU的操作。不论是最早的轮询方式,
内存泄漏(增长)火焰图
本文总结了在分析内存增长和内存泄漏问题用到的4种追踪方法得到有关内存使用情况的代码路径,使用栈追踪技术对代码路径进行检查,并且会以火焰图的形式把它们可视化输出,在Linux上演示分析过程,随后概述其它系统的情况。
为什么容器内存占用居高不下,频频 OOM(续)
在之前的文章《[为什么容器内存占用居高不下,频频 OOM](https://heapdump.cn/article/1589003)》 中,我根据现状进行了分析和说明,收到了很多读者的建议和疑
通过生产者与消费者模型感受死锁
一. 实验目的及实验环境 1.实验目的通过观察、分析实验现象,深入理解产生死锁的原因,学会分析死锁的方法, 并利用 pstack、 gdb 或 core 文件分析( valgrind (DRD+Hel