当前位置:首页>Linux>Linux系统运维基本功:Cron、日志、基础排错总结

Linux系统运维基本功:Cron、日志、基础排错总结

  • 2026-10-11 06:48:45
Linux系统运维基本功:Cron、日志、基础排错总结

对于Linux运维工程师来说,定时任务(Cron)+ 日志管理(Log)+ 故障排查(Troubleshooting) 是每天都会接触的核心技能。

如果把运维能力比作武功:

  • Cron = 自动化执行能力
  • Log = 系统黑匣子
  • Troubleshooting = 故障诊断能力

掌握这三项,才能从“会部署”成长为“会运维”。


一、Cron(定时任务管理)

1. Cron的作用

实现:

  • 自动备份
  • 自动巡检
  • 自动清理日志
  • 自动同步时间
  • 自动执行脚本

例如:

每天凌晨备份数据库每5分钟检查服务状态每周清理历史日志每月生成巡检报告

2. 服务状态检查

RHEL9/Kylin:

systemctl status crond

启动:

systemctl enable --now crond

查看是否开机启动:

systemctl is-enabled crond

3. crontab格式

* * * * * command│ │ │ │ ││ │ │ │ └── 星期│ │ │ └──── 月│ │ └────── 日│ └──────── 小时└────────── 分钟

4. 常见案例

每5分钟执行

*/5 * * * * /data/check.sh

每天凌晨1点

01 * * * /data/backup.sh

每周日凌晨

00 * * 0 /data/weekly.sh

5. 查看任务

crontab -l

编辑:

crontab -e

删除:

crontab -r

6. Cron故障排查

查看日志:

journalctl -u crond

检查:

grep CRON /var/log/cron

常见问题:

问题
原因
不执行
权限不足
找不到命令
PATH环境变量缺失
无输出
未重定向日志
脚本报错
换行符Windows格式

推荐:

*/5 * * * * /data/check.sh >> /var/log/check.log 2>&1

二、Linux日志管理


1. 为什么日志重要

日志记录:

  • 用户登录
  • 服务启动
  • 系统错误
  • 网络连接
  • 安全事件

故障发生后:

日志就是第一现场。


2. systemd日志

查看全部日志:

journalctl

实时查看:

journalctl -f

最近启动日志:

journalctl -b

查看服务日志:

journalctl -u nginx

查看今天日志:

journalctl --since today

3. 常见日志文件

系统日志

/var/log/messages

安全日志

/var/log/secure

查看登录:

grep sshd /var/log/secure

内核日志

dmesg

查看错误:

dmesg -T | grep error

Cron日志

/var/log/cron

审计日志

/var/log/audit/audit.log

4. 日志分析命令

查看最新100行

tail -100 /var/log/messages

实时监控

tail -f /var/log/messages

搜索错误

grep-i error logfile

搜索异常

grep -Ei "error|fail|warn|critical"

统计出现次数

grep ERROR app.log | wc-l

5. 日志轮转

配置:

/etc/logrotate.conf

目录:

/etc/logrotate.d/

测试:

logrotate -vf /etc/logrotate.conf

三、Linux基础排错体系

运维排错核心原则:

现象 → 定位 → 分析 → 验证 → 解决


1. 服务无法访问

检查进程

ps-ef | grep nginx

或

systemctl status nginx

检查端口

ss -lntp

查看:

ss -lntp | grep80

检查防火墙

firewall-cmd --list-all

检查SELinux

getenforce

查看拒绝:

ausearch -m AVC

2. CPU过高

查看:

top

推荐:

htop

排序:

top-o %CPU

查看线程:

top-Hp PID

3. 内存不足

查看:

free -h

分析:

vmstat 1

查看进程:

ps aux --sort=-%mem | head

4. 磁盘空间满

查看:

df -h

目录分析:

du -sh *

查找大文件:

find / -type f -size +1G

5. 磁盘IO高

查看:

iostat -x1

重点:

指标
说明
util
利用率
await
等待时间
svctm
服务时间
avgqu-sz
队列长度

6. 网络故障

查看网卡:

ip addr

路由:

ip route

DNS:

cat /etc/resolv.conf

测试:

ping

端口:

telnet IP PORT

或

nc-zv IP PORT

7. 登录失败

查看:

last

失败登录:

lastb

认证日志:

grep sshd /var/log/secure

四、运维排错黄金流程(面试必答)

用户反馈故障        │        ▼确认现象        │        ▼查看日志        │        ▼检查服务状态        │        ▼检查资源(CPU/内存/磁盘)        │        ▼检查网络        │        ▼检查配置变更        │        ▼定位根因        │        ▼修复验证        │        ▼输出故障报告

五、高级运维必须掌握的20个命令

tophtopfreevmstatiostatsardmesgjournalctlsystemctlsslsoftcpdumpstraceperfpidstatmpstatiftopiotopausearchsealert

运维核心能力成长路线

L1 运维工程师├── Cron├── 日志分析├── 基础排错L2 高级运维├── 性能分析├── 网络排障├── 安全审计├── 自动化运维L3 SRE├── 故障复盘├── 可观测性├── 容量规划├── 混沌工程L4 架构师├── 高可用设计├── 容灾设计├── 云原生架构├── AI运维(AIOps)

对于有 10 年传统运维经验的工程师而言,Cron、日志、基础排错已经属于基本功。下一阶段更值得重点投入的是:系统化故障分析(RCA)、性能调优(CPU/内存/IO/网络)、自动化巡检、可观测性平台(Prometheus + Grafana + ELK)、以及SRE体系建设。这些能力更容易形成技术壁垒和架构视角。

最新文章

随机文章