欢迎来到罐子的实验室
本次目标
掌握一组「文本加工」工具,能把杂乱的数据搜、改、截、排、比成你要的样子。结合上一模块的管道,你将能组合出强大的数据处理流水线。
学完你能做什么:
1. grep:按关键词搜行
grep 在输入里找包含某个模式的行,把它们打印出来:
user@host:~$ cat names.txtalicebobcharliedaveuser@host:~$ grep ali names.txtaliceuser@host:~$ grep a names.txt# 含字母 a 的行alicecharliedave
可以配合管道从其他命令的输出里找:
user@host:~$ ls /etc | grep sshsshssh_configsshd_config
常用选项
动手练习 1:日志里找错误
任务:在 syslog(系统日志,常见于 /var/log/syslog)里找出含 error 的行(忽略大小写)。
思路引导:grep -i error /var/log/syslog。如果没权限,自己造个文件练。
参考答案:
user@host:~$ grep -i error /var/log/syslog | head# head 详见下一节,限制看前 10 行
常见错误:以为 grep 只能匹配整行——它匹配的是行中任意位置出现模式即可。
2. grep -v:反向过滤
-v 反过来——找出不匹配的行。常用于「排除干扰」:
user@host:~$ cat log.txtINFO startingERROR db downINFO retryWARNING slowuser@host:~$ grep -v INFO log.txtERROR db downWARNING slow
动手练习 2:剔除注释行
任务:很多配置文件里 # 开头的行是注释。把 /etc/ssh/sshd_config 里所有非注释行显示出来(即排除 # 开头的)。
思路引导:grep -v '^#',其中 ^ 表示行首。
参考答案:
user@host:~$ grep -v '^#' /etc/ssh/sshd_config | grep -v '^$'# 第二个 grep -v '^$' 再去掉空行
💡 ^ 在 grep 里表示「行首」,$ 表示「行尾」。^# = 以
开头。
3. sed:流编辑器
sed(stream editor)能对输入流做「编辑」——最常用的是查找替换。语法:
sg = global,替换一行中所有匹配(不加 g 只替换每行第一个)
user@host:~$ echo ”I love Windows” | sed ”s/Windows/Linux/g”I love Linuxuser@host:~$ echo ”a b a b a” | sed ”s/a/X/”X b a b a# 没 g,只换第一个user@host:~$ echo ”a b a b a” | sed ”s/a/X/g”X b X b X# 有 g,全换
动手练习 3:批量改文本
任务:有个 urls.txt,每行一个网址都是 http:// 开头。把它们全改成 https://。
思路引导:sed "s/http:\/\//https:\/\//g"。注意 / 在 sed 里是分隔符,要转义。
参考答案:
user@host:~$ cat urls.txthttp://example.comhttp://test.orguser@host:~$ sed ”s/http:\/\//https:\/\//g” urls.txthttps://example.comhttps://test.org
💡 分隔符其实可以是任意字符。换成分隔符更清爽:sed "s|http://|https://|g"。
sed -i 会直接修改原文件(要小心,先备份):
user@host:~$ sed -i.bak ”s|http://|https://|g” urls.txt# .bak 会保留备份
常见错误:把分隔符 / 写在模式里忘了转义——换分隔符最省事。
4. tr:字符级转换
tr(translate)做字符级的转换或删除,比 sed 轻量。
替换字符
user@host:~$ echo ”hello” | tr 'a-z' 'A-Z'# 小写转大写HELLOuser@host:~$ echo ”okMkoAoE” | tr 'MAE' 'NEE'# 按位置对应替换okNkoEGE
tr 集合1 集合2:集合1 的每个字符 → 集合2 对应位置的字符。
删除字符 -d
user@host:~$ echo ”ok!” | tr -d '!'okuser@host:~$ echo ”1-2-3-4” | tr -d '-'1234
压缩重复 -s
user@host:~$ echo ”aaabbbccc” | tr -s 'abc'abc# 把连续重复的 a/b/c 各压成一个
删除换行符
把多行合并成一行,常用 tr -d '\n' 或 tr '\n' ' ':
user@host:~$ printf ”a\nb\nc\n” | tr '\n' ' 'a b c
💡 \n 表示换行符。在 tr 里它必须加引号,否则 Shell 会先解析。
动手练习 4:清洗数据
任务:你拿到一串电话号码 138-1234-5678,去掉所有 -,得到 13812345678。
参考答案:
user@host:~$ echo ”138-1234-5678” | tr -d '-'13812345678
5. head / tail:取头尾
head 取开头几行,tail 取末尾几行,默认各 10 行。
user@host:~$ head /etc/passwd# 前 10 行user@host:~$ head -n 3 /etc/passwd# 前 3 行user@host:~$ tail -n 5 /var/log/syslog# 最后 5 行
tail -f 是跟踪模式——文件有新内容追加就实时显示,看日志的神器:
user@host:~$ tail -f /var/log/syslog# Ctrl-C 退出
动手练习 5:看大文件前几行
任务:/var/log/syslog 可能很大。先看前 5 行了解格式。
参考答案:
user@host:~$ head -n 5 /var/log/syslogJun 30 18:00:01 host systemd[1]: Started Session....
6. cut:按列截取
cut 把每行按分隔符切开,取出指定列。
user@host:~$ cat scores.txtalice 90 85 78bob 75 92 88user@host:~$ cut -d ' ' -f 1 scores.txt# -d 分隔符,-f 第几列alicebobuser@host:~$ cut -d ' ' -f 2- scores.txt# 第 2 到末列90 85 7875 92 88
-d 指定分隔符(这里是空格,要加引号),-f 指定字段号(从 1 开始)。
动手练习 6:取用户名
任务:/etc/passwd 每行用 : 分隔,第一个字段是用户名。用 cut 列出所有用户名。
参考答案:
user@host:~$ cut -d: -f1 /etc/passwdrootdaemon...user
常见错误:分隔符是空格时忘了引号——cut -d -f1 会被 Shell 当成 -d 后面没参数。写 -d ' '。
7. sort:排序
sort 把输入的行排序输出。
user@host:~$ cat words.txtbananaapplecherryuser@host:~$ sort words.txtapplebananacherry
常用选项
动手练习 7:排序并去重
任务:有个 access.log 每行一条访问记录,第二列(空格分隔)是 IP。找出所有不同的 IP(去重),按 IP 排序。
思路引导:cut 取出 IP 列 → sort -u 去重排序。
参考答案:
user@host:~$ cut -d ' ' -f2 access.log | sort -u
常见错误:以为 sort 会按数字大小排——默认是字典序,9 比 11 大。排数字加 -n。
8. diff:比较差异
diff 逐行比较两个文件,告诉你哪里不同:
user@host:~$ cat old.txtline1line2line3user@host:~$ cat new.txtline1changedline3user@host:~$ diff old.txt new.txt2c2< line2---> changed
解读:2c2 表示「第一个文件第 2 行 change 成第二个文件第 2 行」,< 后是旧内容,> 后是新内容。
常用 diff -u(unified 格式,更紧凑)或 diff --color(彩色)。
动手练习 8:对比配置
任务:对比 /etc/passwd 和它的备份 /etc/passwd-(很多系统会留备份),看看最近改了什么。
参考答案:
user@host:~$ diff /etc/passwd- /etc/passwd
💡 结合进程替换(→《模块 06》),还能比较两个命令的输出:diff <(cmd1) <(cmd2)。
9. 综合实战:组合拳
把这些工具用管道串起来,威力倍增。一个真实场景:
「找出 /var/log/syslog 里今天含 error 的行,按时间排序,只看错误本身(去掉时间戳前缀),输出前 20 条」
user@host:~$ grep -i error /var/log/syslog \ | cut -d' ' -f3- \# 去掉前面的”月 日 时:分:秒 主机名” | sort \ | head -n 20
(行末 \ 是续行符,表示命令没完下一行继续。)
动手练习 9:综合流水线
任务:造一个 1 万行的测试文件(seq 10000 > nums.txt,每行一个数字),用一行命令找出所有 7 的倍数(行号是 7 的倍数),统计有多少个。
思路引导:grep 找以 0/7/4 结尾的行不靠谱。更简单:awk(不在本模块范围)。变通方法——seq 直接生成 7 的倍数。
参考答案(用 seq 的步长):
user@host:~$ seq 0 7 10000 | wc -l# 从 0 开始,步长 7,到 100001429
(如果非要从 nums.txt 里筛,那是 awk 的活,进阶内容。本练习意在体会「工具组合」的思路。)
本模块速查表
| | |
|---|
grep 模式 | | grep -i -n error log |
grep -v 模式 | | grep -v '^#' file |
sed "s/a/b/g" | | sed "s|http|https|g" |
tr 集合1 集合2 | | tr 'a-z' 'A-Z' |
tr -d 字符 | | tr -d '-' |
head -n N | | head -n 20 |
tail -f | | tail -f log |
cut -d -f | | cut -d: -f1 /etc/passwd |
sort -nu | | sort -u |
diff | | diff a b |
管道思维
原始数据 → 过滤(grep) → 切分(cut) → 加工(sed/tr) → 整理(sort) → 截取(head) → 结果
每一步都是「输入 → 处理 → 输出」,像流水线一样串联。
下一步
数据能处理了,但每条命令的参数你都得手敲、记不住、不能复用。Shell 提供变量让命令「记住」值——这是自动化的第一步。