当前位置:首页>Linux>Linux LVM(十):性能调优与最佳实践

Linux LVM(十):性能调优与最佳实践

  • 2026-09-18 16:27:31
Linux LVM(十):性能调优与最佳实践

字数 2458,阅读大约需 13 分钟

从"能用"到"用好"。本篇讲清 alignment、I/O 调度、PE 大小、监控告警 等让 LVM 性能最佳的关键点。

一、Alignment(对齐):性能的基础

1.1 什么是 alignment?

LVM 把磁盘切成 PE,每个 PE 从某个偏移开始。偏移如果不与底层存储块对齐,会导致读写跨越两次操作,性能损失 10~50%。

硬盘物理块大小:
  HDD 4Kn(Advanced Format):4 KiB
  SSD NAND page:16 KiB
  NVMe block:4 KiB

PE 默认 4 MiB(4096 KiB),本身是 4K 的倍数,对齐没问题

LVM2 默认已经处理好 alignment(pvcreate --dataalignment 自动设置)。

1.2 检查 alignment

# 看 PV 的 PE 起始位置和底层对齐
$ pvs -o+pv_pe_start,pv_pe_size /dev/sdb
  PV         VG      Fmt  Attr PSize  PFree  Start  SSize
  /dev/sdb   vg_data lvm2 a--  500g  0      1.00m  4.00m

# Start = 1.00m 表示 PE 从 1 MiB 处开始(已对齐)

判断标准:

底层设备
推荐 PE 起始
4Kn 硬盘
1 MiB
SSD
1 MiB
RAID 5/6
1 MiB
软件 RAID(mdadm)
1 MiB

1.3 修复 alignment

# pvcreate 时显式指定
$ pvcreate --dataalignment 1m /dev/sdb

# 老 PV 修正(很危险,慎用!)

$ pvcreate --dataalignment 1m --uuid <uuid> --restorefile <backup> /dev/sdb

二、PE 大小选择

2.1 默认 4 MiB 的由来

4 MiB 兼顾:

  • • 元数据开销(每 4 MiB 才 1 个 LE 元数据)
  • • 对齐 4Kn 硬盘
  • • 细粒度扩容(小到 4 MiB)

2.2 何时调大 PE?

场景
推荐 PE
极大容量(> 100 TB)
16 MiB 或 32 MiB
极大文件(视频、备份)
16 MiB
极小文件(数十万小文件)
1 MiB 或 4 MiB
一般场景
4 MiB(默认)
# 创建 VG 时设置 PE 大小
$ vgcreate -s 16M vg_data /dev/sdb

PE 大小一旦设定,无法在 VG 内修改,需要重建 VG。

2.3 大 PE 的代价

PE 越大,扩容粒度越大。例如 32 MiB PE 想加 30 MiB 空间,需要扩 32 MiB(浪费 2 MiB)。

三、I/O 调度器选择

3.1 Linux I/O 调度器

# 看当前调度器
$ cat /sys/block/sdb/queue/scheduler
[mq-deadline] kyber bfq none

# 看磁盘类型

$ cat /sys/block/sdb/queue/rotational
1   # HDD
0   # SSD/NVMe

3.2 推荐配置

磁盘类型
推荐调度器
原因
HDD(机械)
mq-deadline
 或 bfq
减少寻道
SSD SATA
mq-deadline
 或 none
无寻道开销
NVMe
none
NVMe 自带调度

3.3 调整方法

# 临时
$ echo mq-deadline > /sys/block/sdb/queue/scheduler

# 永久(通过 udev 规则)

# /etc/udev/rules.d/60-scheduler.rules

ACTION=="add|change", KERNEL=="sd[a-z]", ATTR{queue/rotational}=="1", ATTR{queue/scheduler}="mq-deadline"
ACTION=="add|change", KERNEL=="sd[a-z]", ATTR{queue/rotational}=="0", ATTR{queue/scheduler}="none"

$ udevadm control --reload-rules

四、lvchange 调优参数

4.1 readahead(预读)

# 自动模式(推荐)
$ lvchange -r auto vg_data/lv_db

# 强制大预读(适合顺序读)

$ lvchange -r 1024 vg_data/lv_db   # 单位:512B sectors

现代 kernel 会自动调整,无需手动设。

4.2 分配策略

LV 的 PE 分配策略:

策略
行为
适用
inherit
用 VG 默认
默认
normal
跨盘分布
一般
contiguous
集中在同一盘
镜像旧场景
cling
镜像分布约束
镜像
anywhere
任意位置
一般
$ lvchange --alloc cling vg_data/lv_mirror

一般保持默认即可。

五、SSD 上的 LVM 调优

5.1 启用 trim/discard

# 文件系统 mount 时加 discard
# /etc/fstab

/dev/vg_data/lv_db /data xfs defaults,discard 0 0

# 或定期 fstrim

$ systemctl enable fstrim.timer

5.2 多 SSD 条带化

# 4 块 SSD 做 RAID0(条带),性能 ≈ 4× 单盘
$ lvcreate -L 100G -i 4 -I 256 -n lv_ssd_stripe vg_data

5.3 SSD + HDD 混合:LVM Cache

# SSD 做 cache pool,HDD 上的 LV 加速
# 详见 [06 - 高级篇](06-高级篇-条带化与镜像.md)

$ lvconvert --type cache --cachepool vg_data/cache_pool vg_data/lv_db

六、I/O 监控与瓶颈定位

6.1 iostat

$ yum install -y sysstat   # 或 apt
$ iostat -x 1

关键字段:

  • • %util 接近 100%:磁盘忙
  • • await 高:响应慢
  • • r/sw/s:IOPS
  • • rkB/swkB/s:吞吐量

6.2 iotop

$ iotop -o    # 只显示有 I/O 的进程

6.3 dstat

$ dstat -d -m -n -c    # 综合监控

6.4 bcc/ebpf 工具(高级)

# biosnoop:看具体块设备 I/O
$ /usr/share/bcc/tools/biosnoop

# biotop:按进程统计

$ /usr/share/bcc/tools/biotop

七、生产环境监控告警

7.1 Zabbix 监控项

# Zabbix UserParameter 示例
UserParameter=lvm.vg.free[*],/usr/sbin/vgs --noheadings --nosuffix --units g -o vg_free $1 | awk '{print $1}'
UserParameter=lvm.lv.data[*],/usr/sbin/lvs --noheadings --nosuffix -o data_percent $1 | awk '{print $1}'
UserParameter=lvm.pv.missing,/usr/sbin/pvs --noheadings -a | grep -c unknown

7.2 Prometheus + node_exporter

node_exporter 自带 LVM 监控(需启用 textfile collector):

# /etc/default/prometheus-node-exporter
TEXTFILE_COLLECTOR_DIR=/var/lib/node_exporter/textfile

# lvm-exporter 脚本

$ cat /etc/cron.d/lvm-exporter
*/5 * * * * root /usr/local/bin/lvm-exporter.sh

7.3 告警阈值建议

指标
警告
严重
VG 剩余空间
< 20%
< 10%
thin pool Data%
> 80%
> 95%
thin pool Meta%
> 60%
> 80%
missing PV
1 个
2 个+
pvmove 进度停滞
> 24h
> 48h
镜像同步失败
任何
立即

八、LVM 性能基准测试

8.1 fio

# 顺序读
$ fio --name=seq-read --filename=/dev/vg_data/lv_db --rw=read \
      --bs=1M --size=5G --numjobs=1 --runtime=60 --time_based --ioengine=libaio --direct=1

# 顺序写

$ fio --name=seq-write --filename=/dev/vg_data/lv_db --rw=write \
      --bs=1M --size=5G --numjobs=1 --runtime=60 --time_based --ioengine=libaio --direct=1

# 随机读(IOPS 测试)

$ fio --name=rand-read --filename=/dev/vg_data/lv_db --rw=randread \
      --bs=4k --size=5G --numjobs=4 --runtime=60 --time_based --ioengine=libaio --direct=1

# 4K 随机写

$ fio --name=rand-write --filename=/dev/vg_data/lv_db --rw=randwrite \
      --bs=4k --size=5G --numjobs=4 --runtime=60 --time_based --ioengine=libaio --direct=1

8.2 对比性能

# 测裸盘
$ fio --filename=/dev/sdb ...

# 测 LVM LV

$ fio --filename=/dev/vg_data/lv_db ...

# 测文件系统

$ fio --filename=/mnt/lv_db/testfile ...

正常情况下:

  • • 裸盘 ≈ LV(性能损耗 < 5%)
  • • 文件系统略慢(10~30% 损耗,xfs 比 ext4 损耗小)

九、最佳实践

9.1 设计阶段

✅ 使用 mdadm 或 LVM RAID 提供冗余(不能只用 LVM 条带)
✅ LUKS 加密 + 密钥文件自动解锁(生产标准)
✅ PE 默认 4M,大容量场景用 16M
✅ 为不同业务创建独立 LV(避免互相影响)
✅ thin pool 给开发测试用,给生产 OLTP 用普通 LV

9.2 运维阶段

✅ 每天备份 /etc/lvm/backup/
✅ 启用 lvm2-monitor 服务
✅ 监控 SMART,提前换盘
✅ 每周 fstrim SSD 文件系统
✅ 重要数据多副本 + 异地备份
✅ pvmove 限速,避免业务抖动

9.3 故障应急

✅ 保留关键操作清单打印贴墙
✅ 重大变更前手动 vgcfgbackup
✅ 建立应急响应流程(RPO/RTO 明确)

9.4 文档和知识

✅ 维护 LVM 拓扑图(哪些盘 → 哪些 VG → 哪些 LV → 挂载点)
✅ 变更前在测试环境演练
✅ 保留所有变更的操作记录

十、进阶:LVM 与其他技术

10.1 LVM + ZFS / Btrfs

/dev/sdb
   ↓
LVM(thin pool + 快照)
   ↓
ZFS(zpool 用 LV 作为 vdev)

好处:LVM 负责"硬件层管理",ZFS 负责"文件系统 + 快照"。但这种组合较少见,不如直接用 ZFS 自带的卷管理。

10.2 LVM + Docker overlay2

Docker 用 overlay2,底层用 LVM:

物理盘 → LVM thin pool → LV → mkfs.xfs → /var/lib/docker (overlay2)

这种方式在 K8s 节点上常见,性能好且支持 thin。

10.3 LVM + iSCSI / SAN

# 把 LV 通过 iSCSI 共享给其他机器
$ yum install -y targetd targetcli
$ targetcli /backstores/block create lv_db /dev/vg_data/lv_db
$ targetcli /iscsi create iqn.2024-01.com.example:storage
...

警告:同一时刻只允许一个客户端挂载 iSCSI 的 LV,多客户端同时挂载会损坏 FS。

十一、本篇小结

性能调优的核心:

维度
关键点
Alignment
默认就好,老 PV 要查 pv_pe_start
PE 大小
默认 4M,特殊场景用 8M/16M
I/O 调度
HDD 用 deadline,SSD 用 none
SSD trim
discard mount option 或 fstrim
监控
iostat + Zabbix + 告警
冗余
RAID + 备份 + 多副本

最佳实践口诀:

设计阶段:业务拆分独立 LV,OLTP 不用 thin
运维阶段:metadata 备份,SMART 监控
故障阶段:先备份再操作,vgcfgrestore 是底牌
性能阶段:调对齐、调调度、调 SSD

十二、教程总结

整个 LVM2 系列教程到此结束。从概念到实战,从日常运维到故障应急,你应该已经掌握了:

能力
对应章节
理解 LVM 三层架构
01
30 分钟搭建第一个 LVM
02
查看和监控
03
在线扩缩容
04
快照备份
05
条带化、镜像、cache
06
Thin Provisioning
07
pvmove 在线迁移
08
生产级存储栈
09
虚拟化/容器场景
10
故障排查与恢复
11
性能调优与最佳实践
12

接下来:在测试环境动手实验,把所有命令跑一遍,把典型场景都试一遍(扩容、缩容、快照、pvmove、故障模拟)。LVM 是练出来的,不是看出来的。

祝你成为 LVM 高手 🎉


附录:命令速查卡

# ===== PV =====
pvcreate /dev/sdX                       # 创建 PV
pvremove /dev/sdX                       # 删除 PV
pvs / pvdisplay / pvscan                # 查看

# ===== VG =====

vgcreate vg_name /dev/sdX               # 创建 VG
vgcreate -s 8M vg_name /dev/sdX         # 设置 PE 大小
vgextend vg_name /dev/sdX               # 加 PV
vgreduce vg_name /dev/sdX               # 减 PV
vgremove vg_name                        # 删 VG
vgchange -a y vg_name                   # 激活 VG
vgcfgbackup vg_name                     # 备份 metadata
vgcfgrestore vg_name                    # 恢复 metadata
vgs / vgdisplay / vgscan                # 查看
vgsplit / vgmerge                       # 拆分/合并 VG

# ===== LV =====

lvcreate -L 10G -n lv_name vg_name              # 创建 LV(按大小)
lvcreate -l 100%FREE -n lv_name vg_name         # 占满剩余
lvcreate -i 3 -I 64 -n lv_name vg_name          # 条带化
lvcreate -m 1 -n lv_name vg_name                # 镜像
lvcreate -L 10G --thinpool tp_name vg_name      # 创建 thin pool
lvcreate -V 100G --thin -n lv_name vg_name/tp_name  # 创建 thin LV
lvcreate -L 1G -s -n snap_name vg_name/lv_name  # 创建快照
lvcreate -s --thin -n snap_name vg_name/lv_name # thin 快照

lvextend -L +10G vg_name/lv_name               # 扩容
lvextend -l +100%FREE vg_name/lv_name          # 占满剩余
lvextend -L +10G -r vg_name/lv_name            # 一键扩容 LV+FS
lvreduce -L 5G vg_name/lv_name                 # 缩容
lvresize -L +5G vg_name/lv_name                # resize 统一命令
lvremove vg_name/lv_name                       # 删除 LV
lvchange -a y/n vg_name/lv_name                # 激活/停用
lvconvert -m 1 vg_name/lv_name                 # 加镜像
lvconvert --type raid1 vg_name/lv_name         # 转 RAID1
lvconvert --type cache --cachepool cp vg/lv    # 加缓存
lvconvert --uncache vg_name/lv_name            # 去缓存
lvconvert --repair vg_name/lv_name             # 修复镜像

lvs / lvdisplay / lvscan                       # 查看

# ===== 维护 =====

pvmove /dev/sdX                                # 迁移数据
pvmove -n lv_name /dev/sdX /dev/sdY            # 迁移某 LV
pvmove --rate 50M /dev/sdX                     # 限速
vgreduce --removemissing vg_name               # 移除 missing PV
mdadm --manage /dev/mdX --fail /dev/sdY        # 标记 RAID 盘故障
mdadm --manage /dev/mdX --remove /dev/sdY      # 移除故障盘
mdadm --manage /dev/mdX --add /dev/sdY         # 加新盘

# ===== 加密 =====

cryptsetup luksFormat /dev/sdX                 # 加密
cryptsetup open /dev/sdX crypt_name            # 打开
cryptsetup close crypt_name                    # 关闭
cryptsetup luksAddKey /dev/sdX                 # 加密码
cryptsetup status crypt_name                   # 状态

最新文章

随机文章