当前位置:首页>Linux>Linux 从0到1 : 07 · 文本数据处理

Linux 从0到1 : 07 · 文本数据处理

  • 2026-10-11 05:43:02
Linux 从0到1 : 07 · 文本数据处理
 欢迎来到罐子的实验室
    今天来学习文本数据处理  

    本次目标

    掌握一组「文本加工」工具,能把杂乱的数据搜、改、截、排、比成你要的样子。结合上一模块的管道,你将能组合出强大的数据处理流水线。

学完你能做什么:

  • 用 grep 按关键词搜文本(含反向匹配)
  • 用 sed 做查找替换
  • 用 tr 转换/删除字符
  • 用 head/cut/sort 截取与排序
  • 用 diff 比较两份文本

1. grep:按关键词搜行

grep 在输入里找包含某个模式的行,把它们打印出来:

user@host:~$ cat names.txtalicebobcharliedaveuser@host:~$ grep ali names.txtaliceuser@host:~$ grep a names.txt# 含字母 a 的行alicecharliedave

可以配合管道从其他命令的输出里找:

user@host:~$ ls /etc | grep sshsshssh_configsshd_config

常用选项

选项
作用
-i
忽略大小写
-v反向
匹配(找出不含模式的行)
-n
显示行号
-r
递归搜目录里的所有文件
-c
只输出匹配行数,不显示内容
-E
启用扩展正则(支持 |、+ 等)
--color
高亮匹配的部分

动手练习 1:日志里找错误

任务:在 syslog(系统日志,常见于 /var/log/syslog)里找出含 error 的行(忽略大小写)。

思路引导:grep -i error /var/log/syslog。如果没权限,自己造个文件练。

参考答案:

user@host:~$ grep -i error /var/log/syslog | head# head 详见下一节,限制看前 10 行

常见错误:以为 grep 只能匹配整行——它匹配的是行中任意位置出现模式即可。


2. grep -v:反向过滤

-v 反过来——找出不匹配的行。常用于「排除干扰」:

user@host:~$ cat log.txtINFO startingERROR db downINFO retryWARNING slowuser@host:~$ grep -v INFO log.txtERROR db downWARNING slow

动手练习 2:剔除注释行

任务:很多配置文件里 # 开头的行是注释。把 /etc/ssh/sshd_config 里所有非注释行显示出来(即排除 # 开头的)。

思路引导:grep -v '^#',其中 ^ 表示行首。

参考答案:

user@host:~$ grep -v '^#' /etc/ssh/sshd_config | grep -v '^$'# 第二个 grep -v '^$' 再去掉空行

💡 ^ 在 grep 里表示「行首」,$ 表示「行尾」。^# = 以

开头。


3. sed:流编辑器

sed(stream editor)能对输入流做「编辑」——最常用的是查找替换。语法:

sed ”s/旧词/新词/g”
  • s
     = substitute(替换)
  • g
     = global,替换一行中所有匹配(不加 g 只替换每行第一个)
user@host:~$ echo ”I love Windows” | sed ”s/Windows/Linux/g”I love Linuxuser@host:~$ echo ”a b a b a” | sed ”s/a/X/”X b a b a# 没 g,只换第一个user@host:~$ echo ”a b a b a” | sed ”s/a/X/g”X b X b X# 有 g,全换

动手练习 3:批量改文本

任务:有个 urls.txt,每行一个网址都是 http:// 开头。把它们全改成 https://。

思路引导:sed "s/http:\/\//https:\/\//g"。注意 / 在 sed 里是分隔符,要转义。

参考答案:

user@host:~$ cat urls.txthttp://example.comhttp://test.orguser@host:~$ sed ”s/http:\/\//https:\/\//g” urls.txthttps://example.comhttps://test.org

💡 分隔符其实可以是任意字符。换成分隔符更清爽:sed "s|http://|https://|g"。

sed -i 会直接修改原文件(要小心,先备份):

user@host:~$ sed -i.bak ”s|http://|https://|g” urls.txt# .bak 会保留备份

常见错误:把分隔符 / 写在模式里忘了转义——换分隔符最省事。


4. tr:字符级转换

tr(translate)做字符级的转换或删除,比 sed 轻量。

替换字符

user@host:~$ echo ”hello” | tr 'a-z' 'A-Z'# 小写转大写HELLOuser@host:~$ echo ”okMkoAoE” | tr 'MAE' 'NEE'# 按位置对应替换okNkoEGE

tr 集合1 集合2:集合1 的每个字符 → 集合2 对应位置的字符。

删除字符 -d

user@host:~$ echo ”ok!” | tr -d '!'okuser@host:~$ echo ”1-2-3-4” | tr -d '-'1234

压缩重复 -s

user@host:~$ echo ”aaabbbccc” | tr -s 'abc'abc# 把连续重复的 a/b/c 各压成一个

删除换行符

把多行合并成一行,常用 tr -d '\n' 或 tr '\n' ' ':

user@host:~$ printf ”a\nb\nc\n” | tr '\n' ' 'a b c

💡 \n 表示换行符。在 tr 里它必须加引号,否则 Shell 会先解析。

动手练习 4:清洗数据

任务:你拿到一串电话号码 138-1234-5678,去掉所有 -,得到 13812345678。

参考答案:

user@host:~$ echo ”138-1234-5678” | tr -d '-'13812345678

5. head / tail:取头尾

head 取开头几行,tail 取末尾几行,默认各 10 行。

user@host:~$ head /etc/passwd# 前 10 行user@host:~$ head -n 3 /etc/passwd# 前 3 行user@host:~$ tail -n 5 /var/log/syslog# 最后 5 行

tail -f 是跟踪模式——文件有新内容追加就实时显示,看日志的神器:

user@host:~$ tail -f /var/log/syslog# Ctrl-C 退出

动手练习 5:看大文件前几行

任务:/var/log/syslog 可能很大。先看前 5 行了解格式。

参考答案:

user@host:~$ head -n 5 /var/log/syslogJun 30 18:00:01 host systemd[1]: Started Session....

6. cut:按列截取

cut 把每行按分隔符切开,取出指定列。

user@host:~$ cat scores.txtalice 90 85 78bob 75 92 88user@host:~$ cut -d ' ' -f 1 scores.txt# -d 分隔符,-f 第几列alicebobuser@host:~$ cut -d ' ' -f 2- scores.txt# 第 2 到末列90 85 7875 92 88

-d 指定分隔符(这里是空格,要加引号),-f 指定字段号(从 1 开始)。

动手练习 6:取用户名

任务:/etc/passwd 每行用 : 分隔,第一个字段是用户名。用 cut 列出所有用户名。

参考答案:

user@host:~$ cut -d: -f1 /etc/passwdrootdaemon...user

常见错误:分隔符是空格时忘了引号——cut -d -f1 会被 Shell 当成 -d 后面没参数。写 -d ' '。


7. sort:排序

sort 把输入的行排序输出。

user@host:~$ cat words.txtbananaapplecherryuser@host:~$ sort words.txtapplebananacherry

常用选项

选项
作用
-n
按数字排序(不然 11 排在 2 前面)
-r
反序
-u
去重(unique)
-k N
按第 N 列排序
-t X
指定列分隔符 X

动手练习 7:排序并去重

任务:有个 access.log 每行一条访问记录,第二列(空格分隔)是 IP。找出所有不同的 IP(去重),按 IP 排序。

思路引导:cut 取出 IP 列 → sort -u 去重排序。

参考答案:

user@host:~$ cut -d ' ' -f2 access.log | sort -u

常见错误:以为 sort 会按数字大小排——默认是字典序,9 比 11 大。排数字加 -n。


8. diff:比较差异

diff 逐行比较两个文件,告诉你哪里不同:

user@host:~$ cat old.txtline1line2line3user@host:~$ cat new.txtline1changedline3user@host:~$ diff old.txt new.txt2c2< line2---> changed

解读:2c2 表示「第一个文件第 2 行 change 成第二个文件第 2 行」,< 后是旧内容,> 后是新内容。

常用 diff -u(unified 格式,更紧凑)或 diff --color(彩色)。

动手练习 8:对比配置

任务:对比 /etc/passwd 和它的备份 /etc/passwd-(很多系统会留备份),看看最近改了什么。

参考答案:

user@host:~$ diff /etc/passwd- /etc/passwd

💡 结合进程替换(→《模块 06》),还能比较两个命令的输出:diff <(cmd1) <(cmd2)。


9. 综合实战:组合拳

把这些工具用管道串起来,威力倍增。一个真实场景:

「找出 /var/log/syslog 里今天含 error 的行,按时间排序,只看错误本身(去掉时间戳前缀),输出前 20 条」

user@host:~$ grep -i error /var/log/syslog \ | cut -d' ' -f3- \# 去掉前面的”月 日 时:分:秒 主机名” | sort \ | head -n 20

(行末 \ 是续行符,表示命令没完下一行继续。)

动手练习 9:综合流水线

任务:造一个 1 万行的测试文件(seq 10000 > nums.txt,每行一个数字),用一行命令找出所有 7 的倍数(行号是 7 的倍数),统计有多少个。

思路引导:grep 找以 0/7/4 结尾的行不靠谱。更简单:awk(不在本模块范围)。变通方法——seq 直接生成 7 的倍数。

参考答案(用 seq 的步长):

user@host:~$ seq 0 7 10000 | wc -l# 从 0 开始,步长 7,到 100001429

(如果非要从 nums.txt 里筛,那是 awk 的活,进阶内容。本练习意在体会「工具组合」的思路。)


本模块速查表

工具
作用
经典用法
grep 模式
按关键词搜行
grep -i -n error log
grep -v 模式
反向(排除)
grep -v '^#' file
sed "s/a/b/g"
查找替换
sed "s|http|https|g"
tr 集合1 集合2
字符替换
tr 'a-z' 'A-Z'
tr -d 字符
删除字符
tr -d '-'
head -n N
取前 N 行
head -n 20
tail -f
实时跟踪
tail -f log
cut -d -f
按列截取
cut -d: -f1 /etc/passwd
sort -nu
排序去重
sort -u
diff
比较差异
diff a b

管道思维

原始数据 → 过滤(grep) → 切分(cut) → 加工(sed/tr) → 整理(sort) → 截取(head) → 结果

每一步都是「输入 → 处理 → 输出」,像流水线一样串联。


下一步

数据能处理了,但每条命令的参数你都得手敲、记不住、不能复用。Shell 提供变量让命令「记住」值——这是自动化的第一步。

最新文章

随机文章