字数 2458,阅读大约需 13 分钟
从"能用"到"用好"。本篇讲清 alignment、I/O 调度、PE 大小、监控告警 等让 LVM 性能最佳的关键点。
一、Alignment(对齐):性能的基础
1.1 什么是 alignment?
LVM 把磁盘切成 PE,每个 PE 从某个偏移开始。偏移如果不与底层存储块对齐,会导致读写跨越两次操作,性能损失 10~50%。
硬盘物理块大小:
HDD 4Kn(Advanced Format):4 KiB
SSD NAND page:16 KiB
NVMe block:4 KiB
PE 默认 4 MiB(4096 KiB),本身是 4K 的倍数,对齐没问题
LVM2 默认已经处理好 alignment(pvcreate --dataalignment 自动设置)。
1.2 检查 alignment
# 看 PV 的 PE 起始位置和底层对齐
$ pvs -o+pv_pe_start,pv_pe_size /dev/sdb
PV VG Fmt Attr PSize PFree Start SSize
/dev/sdb vg_data lvm2 a-- 500g 0 1.00m 4.00m
# Start = 1.00m 表示 PE 从 1 MiB 处开始(已对齐)
判断标准:
1.3 修复 alignment
# pvcreate 时显式指定
$ pvcreate --dataalignment 1m /dev/sdb
# 老 PV 修正(很危险,慎用!)
$ pvcreate --dataalignment 1m --uuid <uuid> --restorefile <backup> /dev/sdb
二、PE 大小选择
2.1 默认 4 MiB 的由来
4 MiB 兼顾:
- • 元数据开销(每 4 MiB 才 1 个 LE 元数据)
2.2 何时调大 PE?
# 创建 VG 时设置 PE 大小
$ vgcreate -s 16M vg_data /dev/sdb
PE 大小一旦设定,无法在 VG 内修改,需要重建 VG。
2.3 大 PE 的代价
PE 越大,扩容粒度越大。例如 32 MiB PE 想加 30 MiB 空间,需要扩 32 MiB(浪费 2 MiB)。
三、I/O 调度器选择
3.1 Linux I/O 调度器
# 看当前调度器
$ cat /sys/block/sdb/queue/scheduler
[mq-deadline] kyber bfq none
# 看磁盘类型
$ cat /sys/block/sdb/queue/rotational
1 # HDD
0 # SSD/NVMe
3.2 推荐配置
| | |
|---|
| mq-deadline | |
| mq-deadline | |
| none | |
3.3 调整方法
# 临时
$ echo mq-deadline > /sys/block/sdb/queue/scheduler
# 永久(通过 udev 规则)
# /etc/udev/rules.d/60-scheduler.rules
ACTION=="add|change", KERNEL=="sd[a-z]", ATTR{queue/rotational}=="1", ATTR{queue/scheduler}="mq-deadline"
ACTION=="add|change", KERNEL=="sd[a-z]", ATTR{queue/rotational}=="0", ATTR{queue/scheduler}="none"
$ udevadm control --reload-rules
四、lvchange 调优参数
4.1 readahead(预读)
# 自动模式(推荐)
$ lvchange -r auto vg_data/lv_db
# 强制大预读(适合顺序读)
$ lvchange -r 1024 vg_data/lv_db # 单位:512B sectors
现代 kernel 会自动调整,无需手动设。
4.2 分配策略
LV 的 PE 分配策略:
| | |
|---|
inherit | | |
normal | | |
contiguous | | |
cling | | |
anywhere | | |
$ lvchange --alloc cling vg_data/lv_mirror
一般保持默认即可。
五、SSD 上的 LVM 调优
5.1 启用 trim/discard
# 文件系统 mount 时加 discard
# /etc/fstab
/dev/vg_data/lv_db /data xfs defaults,discard 0 0
# 或定期 fstrim
$ systemctl enable fstrim.timer
5.2 多 SSD 条带化
# 4 块 SSD 做 RAID0(条带),性能 ≈ 4× 单盘
$ lvcreate -L 100G -i 4 -I 256 -n lv_ssd_stripe vg_data
5.3 SSD + HDD 混合:LVM Cache
# SSD 做 cache pool,HDD 上的 LV 加速
# 详见 [06 - 高级篇](06-高级篇-条带化与镜像.md)
$ lvconvert --type cache --cachepool vg_data/cache_pool vg_data/lv_db
六、I/O 监控与瓶颈定位
6.1 iostat
$ yum install -y sysstat # 或 apt
$ iostat -x 1
关键字段:
6.2 iotop
$ iotop -o # 只显示有 I/O 的进程
6.3 dstat
$ dstat -d -m -n -c # 综合监控
6.4 bcc/ebpf 工具(高级)
# biosnoop:看具体块设备 I/O
$ /usr/share/bcc/tools/biosnoop
# biotop:按进程统计
$ /usr/share/bcc/tools/biotop
七、生产环境监控告警
7.1 Zabbix 监控项
# Zabbix UserParameter 示例
UserParameter=lvm.vg.free[*],/usr/sbin/vgs --noheadings --nosuffix --units g -o vg_free $1 | awk '{print $1}'
UserParameter=lvm.lv.data[*],/usr/sbin/lvs --noheadings --nosuffix -o data_percent $1 | awk '{print $1}'
UserParameter=lvm.pv.missing,/usr/sbin/pvs --noheadings -a | grep -c unknown
7.2 Prometheus + node_exporter
node_exporter 自带 LVM 监控(需启用 textfile collector):
# /etc/default/prometheus-node-exporter
TEXTFILE_COLLECTOR_DIR=/var/lib/node_exporter/textfile
# lvm-exporter 脚本
$ cat /etc/cron.d/lvm-exporter
*/5 * * * * root /usr/local/bin/lvm-exporter.sh
7.3 告警阈值建议
八、LVM 性能基准测试
8.1 fio
# 顺序读
$ fio --name=seq-read --filename=/dev/vg_data/lv_db --rw=read \
--bs=1M --size=5G --numjobs=1 --runtime=60 --time_based --ioengine=libaio --direct=1
# 顺序写
$ fio --name=seq-write --filename=/dev/vg_data/lv_db --rw=write \
--bs=1M --size=5G --numjobs=1 --runtime=60 --time_based --ioengine=libaio --direct=1
# 随机读(IOPS 测试)
$ fio --name=rand-read --filename=/dev/vg_data/lv_db --rw=randread \
--bs=4k --size=5G --numjobs=4 --runtime=60 --time_based --ioengine=libaio --direct=1
# 4K 随机写
$ fio --name=rand-write --filename=/dev/vg_data/lv_db --rw=randwrite \
--bs=4k --size=5G --numjobs=4 --runtime=60 --time_based --ioengine=libaio --direct=1
8.2 对比性能
# 测裸盘
$ fio --filename=/dev/sdb ...
# 测 LVM LV
$ fio --filename=/dev/vg_data/lv_db ...
# 测文件系统
$ fio --filename=/mnt/lv_db/testfile ...
正常情况下:
- • 文件系统略慢(10~30% 损耗,xfs 比 ext4 损耗小)
九、最佳实践
9.1 设计阶段
✅ 使用 mdadm 或 LVM RAID 提供冗余(不能只用 LVM 条带)
✅ LUKS 加密 + 密钥文件自动解锁(生产标准)
✅ PE 默认 4M,大容量场景用 16M
✅ 为不同业务创建独立 LV(避免互相影响)
✅ thin pool 给开发测试用,给生产 OLTP 用普通 LV
9.2 运维阶段
✅ 每天备份 /etc/lvm/backup/
✅ 启用 lvm2-monitor 服务
✅ 监控 SMART,提前换盘
✅ 每周 fstrim SSD 文件系统
✅ 重要数据多副本 + 异地备份
✅ pvmove 限速,避免业务抖动
9.3 故障应急
✅ 保留关键操作清单打印贴墙
✅ 重大变更前手动 vgcfgbackup
✅ 建立应急响应流程(RPO/RTO 明确)
9.4 文档和知识
✅ 维护 LVM 拓扑图(哪些盘 → 哪些 VG → 哪些 LV → 挂载点)
✅ 变更前在测试环境演练
✅ 保留所有变更的操作记录
十、进阶:LVM 与其他技术
10.1 LVM + ZFS / Btrfs
/dev/sdb
↓
LVM(thin pool + 快照)
↓
ZFS(zpool 用 LV 作为 vdev)
好处:LVM 负责"硬件层管理",ZFS 负责"文件系统 + 快照"。但这种组合较少见,不如直接用 ZFS 自带的卷管理。
10.2 LVM + Docker overlay2
Docker 用 overlay2,底层用 LVM:
物理盘 → LVM thin pool → LV → mkfs.xfs → /var/lib/docker (overlay2)
这种方式在 K8s 节点上常见,性能好且支持 thin。
10.3 LVM + iSCSI / SAN
# 把 LV 通过 iSCSI 共享给其他机器
$ yum install -y targetd targetcli
$ targetcli /backstores/block create lv_db /dev/vg_data/lv_db
$ targetcli /iscsi create iqn.2024-01.com.example:storage
...
警告:同一时刻只允许一个客户端挂载 iSCSI 的 LV,多客户端同时挂载会损坏 FS。
十一、本篇小结
性能调优的核心:
| |
|---|
| |
| |
| HDD 用 deadline,SSD 用 none |
| discard mount option 或 fstrim |
| |
| |
最佳实践口诀:
设计阶段:业务拆分独立 LV,OLTP 不用 thin
运维阶段:metadata 备份,SMART 监控
故障阶段:先备份再操作,vgcfgrestore 是底牌
性能阶段:调对齐、调调度、调 SSD
十二、教程总结
整个 LVM2 系列教程到此结束。从概念到实战,从日常运维到故障应急,你应该已经掌握了:
接下来:在测试环境动手实验,把所有命令跑一遍,把典型场景都试一遍(扩容、缩容、快照、pvmove、故障模拟)。LVM 是练出来的,不是看出来的。
祝你成为 LVM 高手 🎉
附录:命令速查卡
# ===== PV =====
pvcreate /dev/sdX # 创建 PV
pvremove /dev/sdX # 删除 PV
pvs / pvdisplay / pvscan # 查看
# ===== VG =====
vgcreate vg_name /dev/sdX # 创建 VG
vgcreate -s 8M vg_name /dev/sdX # 设置 PE 大小
vgextend vg_name /dev/sdX # 加 PV
vgreduce vg_name /dev/sdX # 减 PV
vgremove vg_name # 删 VG
vgchange -a y vg_name # 激活 VG
vgcfgbackup vg_name # 备份 metadata
vgcfgrestore vg_name # 恢复 metadata
vgs / vgdisplay / vgscan # 查看
vgsplit / vgmerge # 拆分/合并 VG
# ===== LV =====
lvcreate -L 10G -n lv_name vg_name # 创建 LV(按大小)
lvcreate -l 100%FREE -n lv_name vg_name # 占满剩余
lvcreate -i 3 -I 64 -n lv_name vg_name # 条带化
lvcreate -m 1 -n lv_name vg_name # 镜像
lvcreate -L 10G --thinpool tp_name vg_name # 创建 thin pool
lvcreate -V 100G --thin -n lv_name vg_name/tp_name # 创建 thin LV
lvcreate -L 1G -s -n snap_name vg_name/lv_name # 创建快照
lvcreate -s --thin -n snap_name vg_name/lv_name # thin 快照
lvextend -L +10G vg_name/lv_name # 扩容
lvextend -l +100%FREE vg_name/lv_name # 占满剩余
lvextend -L +10G -r vg_name/lv_name # 一键扩容 LV+FS
lvreduce -L 5G vg_name/lv_name # 缩容
lvresize -L +5G vg_name/lv_name # resize 统一命令
lvremove vg_name/lv_name # 删除 LV
lvchange -a y/n vg_name/lv_name # 激活/停用
lvconvert -m 1 vg_name/lv_name # 加镜像
lvconvert --type raid1 vg_name/lv_name # 转 RAID1
lvconvert --type cache --cachepool cp vg/lv # 加缓存
lvconvert --uncache vg_name/lv_name # 去缓存
lvconvert --repair vg_name/lv_name # 修复镜像
lvs / lvdisplay / lvscan # 查看
# ===== 维护 =====
pvmove /dev/sdX # 迁移数据
pvmove -n lv_name /dev/sdX /dev/sdY # 迁移某 LV
pvmove --rate 50M /dev/sdX # 限速
vgreduce --removemissing vg_name # 移除 missing PV
mdadm --manage /dev/mdX --fail /dev/sdY # 标记 RAID 盘故障
mdadm --manage /dev/mdX --remove /dev/sdY # 移除故障盘
mdadm --manage /dev/mdX --add /dev/sdY # 加新盘
# ===== 加密 =====
cryptsetup luksFormat /dev/sdX # 加密
cryptsetup open /dev/sdX crypt_name # 打开
cryptsetup close crypt_name # 关闭
cryptsetup luksAddKey /dev/sdX # 加密码
cryptsetup status crypt_name # 状态