当前位置:首页>Linux>深入理解 Linux VXLAN 驱动:从内核源码看虚拟网络的工作原理

深入理解 Linux VXLAN 驱动:从内核源码看虚拟网络的工作原理

  • 2026-09-20 21:28:03
深入理解 Linux VXLAN 驱动:从内核源码看虚拟网络的工作原理

做 VXLAN 的时候遇到过一个问题:ECMP 没有按预期分流,所有流量走一条路径。追了一天源码才发现,源端口没变,交换机以为是一个流。读完这段之后,这类问题基本就不会再踩了。

VXLAN 是什么

VXLAN(Virtual eXtensible Local Area Network)是一种网络虚拟化技术,核心思路很简单:把以太网帧包进 UDP 包,穿过 IP 网络,到了对端再拆出来。

VM A 发送一个以太网帧,经过 VXLAN 封装后变成 IP/UDP/VXLAN/以太网帧,穿过底层网络,到达 VM B 所在的主机,解封装后 VM B 拿到原始帧。整个过程对 VM 完全透明。

在内核里,VXLAN 以伪网络设备(pseudo net device)的形式存在。你执行 ip link add vxlan0 type vxlan id 100 remote 239.1.1.1,内核就创建一个 vxlan_dev 结构体,注册为一个标准网络接口。之后一切和网络设备相关的操作(收发、ARP、路由)都走常规路径。

核心数据结构

读源码先看结构体,这是理解任何内核驱动的第一步。VXLAN 驱动有四个关键结构体。

网络命名空间级:struct vxlan_net

structvxlan_net {structsocket *sock;/* UDP 封装套接字 */structhlist_headvni_list[VNI_HASH_SIZE];/* VNI 哈希表,1024 桶 */};

每个网络命名空间维护一个 vxlan_net,只负责两件事:

  • 持有全局 UDP 套接字,接收所有 VXLAN 流量
  • 维护 VNI 哈希表,把 VNI 映射到对应的 vxlan_dev

VNI 是 24 位标识符,最多支持 1600 万个隔离网络。内核用 10 位哈希(1024 个桶)做查找:

staticinlinestruct hlist_head *vni_head(struct net *net, u32 id){structvxlan_net *vn = net_generic(net, vxlan_net_id);return &vn->vni_list[hash_32(id, VNI_HASH_BITS)];}

设备级:struct vxlan_dev

structvxlan_dev {structhlist_nodehlist;structnet_device *dev;structvxlan_rdstdefault_dst;/* 默认目的地(组播地址等) */    __be32 saddr;                   /* 源 IP */    __be16 dst_port;                /* 目的 UDP 端口 */    __u16 port_min, port_max;       /* 源端口范围 */    __u8 tos, ttl;    u32 flags;                      /* VXLAN_F_LEARN 等标志 */unsignedlong age_interval;     /* FDB 老化时间 */structtimer_listage_timer;/* 老化定时器 */spinlock_t hash_lock;unsignedint addrcnt, addrmax;structhlist_headfdb_head[FDB_HASH_SIZE];/* FDB 哈希表,256 桶 */};

这是驱动的核心结构体。每个 ip link add vxlan0 type vxlan 就创建一个实例。

关键字段:

  • default_dst:没有精确 FDB 条目时,作为默认转发目标
  • fdb_head[]:256 桶哈希表,存 MAC → 远端 IP+端口的映射
  • age_timer:定时器,定期清理过期 FDB 条目(默认 300 秒)
  • flags:控制行为的开关,后面详解

转发表条目:struct vxlan_fdb

structvxlan_fdb {structhlist_nodehlist;/* 哈希表链表节点 */structrcu_headrcu;/* RCU 回调 */unsignedlong updated, used;    /* 更新时间、最后使用时间 */structvxlan_rdstremote;/* 远程端点 */    u16 state;                      /* NUD 状态 */    u8 flags;                       /* NTF_* 标志 */    u8 eth_addr[ETH_ALEN];          /* MAC 地址 */};

VXLAN 的转发表(FDB),存的是"源 MAC → 远端 IP + 端口 + VNI"的映射。

注意 remote 字段是 struct vxlan_rdst,而 vxlan_rdst 里有 remote_next 指针——一个 MAC 地址可以对应多个远端端点。组播场景下就这么实现多目的地转发。

VXLAN 协议头

structvxlanhdr {    __be32 vx_flags;    /* 固定为 0x08000000 */    __be32 vx_vni;      /* VNI 左移 8 位,低 8 位保留 */};

8 字节,4 字节标志 + 4 字节 VNI。就这么简单。

加上外层 IP(20 字节)+ UDP(8 字节)+ 内层以太网头(14 字节),总共需要 50 字节的 headroom:

#define VXLAN_HEADROOM (20 + 8 + 8 + 14)

初始化流程

模块加载:vxlan_init_module

staticint __init vxlan_init_module(void){    get_random_bytes(vxlan_salt, sizeof(vxlan_salt));  /* 哈希盐,防碰撞 */    register_pernet_device(&vxlan_net_ops);             /* 注册网络命名空间回调 */    rtnl_link_register(&vxlan_link_ops);                /* 注册 rtnetlink 设备类型 */return0;}

两步关键操作:

  1. 注册 pernet 操作:每个网络命名空间创建时,调用 vxlan_init_net
  2. 注册 rtnl_link 类型:让 ip link add type vxlan 命令生效

get_random_bytes 给哈希表加盐,避免恶意的 VNI 碰撞攻击。

网络命名空间初始化:vxlan_init_net

staticintvxlan_init_net(struct net *net){structvxlan_net *vn = net_generic(net, vxlan_net_id);int err;/* 创建 UDP 套接字 */    err = sock_create_kern(AF_INET, SOCK_DGRAM, IPPROTO_UDP, &vn->sock);if (err)goto out;    sk = vn->sock->sk;    vxlan_addr.sin_family = AF_INET;    vxlan_addr.sin_port = htons(vxlan_port);    kernel_bind(vn->sock, (struct sockaddr *)&vxlan_addr, sizeof(vxlan_addr));/* 关键:标记为封装套接字,注册接收回调 */    udp_sk(sk)->encap_type = 1;    udp_sk(sk)->encap_rcv = vxlan_udp_encap_recv;    udp_encap_enable();/* 初始化 VNI 哈希表 */for (h = 0; h < VNI_HASH_SIZE; ++h)        INIT_HLIST_HEAD(vn->vni_list[h]);out:return err;}

这里有个关键设计:所有 VXLAN 流量通过一个 UDP 套接字接收,而不是每个设备一个 socket。

encap_rcv 直接绕过 proto_rcv 指向隧道接收回调,这是内核专门给隧道协议留的 fast path,不是 bug。

encap_rcv 指向 vxlan_udp_encap_recv——这是接收路径的入口点。UDP 层收到 8472 端口的包后,直接调这个回调,不走正常的 proto_rcv 路径。

接收路径

入口:vxlan_udp_encap_recv

外部包到达    │    ▼UDP 层解析端口 8472    │    ▼vxlan_udp_encap_recv()          ← 封装接收回调    │    ├─ 1. 剥离外层 UDP 头    ├─ 2. 校验 VXLAN 头(flags 必须为 0x08000000)    ├─ 3. 提取 VNI,查找对应的 vxlan_dev    ├─ 4. 剥离 VXLAN 头    ├─ 5. eth_type_trans() 将内层以太网帧递交给网络栈    ├─ 6. 如果开启学习模式,调用 vxlan_snoop() 学习源 MAC    ├─ 7. 重置 skb 头部指针    ├─ 8. ECN 解封装处理    └─ 9. netif_rx() 递交给上层协议

关键代码:

/* 校验 VXLAN 头 */vxh = (struct vxlanhdr *)skb->data;if (vxh->vx_flags != htonl(VXLAN_FLAGS) ||    (vxh->vx_vni & htonl(0xff)))goto error;/* 提取 VNI,查找设备 */vni = ntohl(vxh->vx_vni) >> 8;vxlan = vxlan_find_vni(sock_net(sk), vni);if (!vxlan) {    netdev_dbg(skb->dev, "unknown vni %d\n", vni);goto drop;}/* 剥离 VXLAN 头,递交给网络栈 */__skb_pull(skb, sizeof(struct vxlanhdr));skb->protocol = eth_type_trans(skb, vxlan->dev);/* MAC 地址学习 */if ((vxlan->flags & VXLAN_F_LEARN) &&    vxlan_snoop(skb->dev, oip->saddr, eth_hdr(skb)->h_source))goto drop;netif_rx(skb);

MAC 地址学习:vxlan_snoop

staticboolvxlan_snoop(struct net_device *dev, __be32 src_ip,const u8 *src_mac){structvxlan_fdb *f = vxlan_find_mac(vxlan, src_mac);if (f) {/* 已有条目:检查 IP 是否变化 */if (f->remote.remote_ip == src_ip)returnfalse;          /* 无变化,正常处理 */if (f->state & NUD_NOARP)returntrue;           /* 静态条目,禁止迁移 *//* MAC 地址迁移了,更新条目 */        f->remote.remote_ip = src_ip;        f->updated = jiffies;    } else {/* 新 MAC,学习并创建 FDB 条目 */        vxlan_fdb_create(vxlan, src_mac, src_ip,                         NUD_REACHABLE, NLM_F_EXCL|NLM_F_CREATE,                         vxlan->dst_port, vni, 0, NTF_SELF);    }returnfalse;}
  • 看到新 MAC:写入 FDB 表,记录 MAC → 远端 IP
  • 看到已知 MAC 换了 IP:更新映射(静态条目除外)
  • 静态条目(NUD_NOARP):禁止自动学习覆盖

学习到的 FDB 条目会触发 vxlan_fdb_notify(),通过 Netlink 通知用户态。ip neigh show 就能看见。

学习逻辑不难,但有个细节:静态条目(NUD_NOARP)禁止覆盖。

发送路径

入口:vxlan_xmit

staticnetdev_tx_tvxlan_xmit(struct sk_buff *skb, struct net_device *dev){structvxlan_dev *vxlan = netdev_priv(dev);structethhdr *eth = eth_hdr(skb);/* Proxy ARP 模式:处理 ARP 请求 */if ((vxlan->flags & VXLAN_F_PROXY) &&        ntohs(eth->h_proto) == ETH_P_ARP)return arp_reduce(dev, skb);/* 查找目的 MAC 对应的远端 */    f = vxlan_find_mac(vxlan, eth->h_dest);/* 无条目?使用默认目的地 */if (f == NULL) {        rdst = vxlan->default_dst;if (vxlan->flags & VXLAN_F_L2MISS)            vxlan_fdb_miss(vxlan, eth->h_dest);  /* 通知用户态 */    } else {        rdst = f->remote;    }/* 多目的地:克隆包分别发送 */for (rdst = rdst->remote_next; rdst; rdst = rdst->remote_next)        vxlan_xmit_one(skb_clone(skb, GFP_ATOMIC), dev, rdst, did_rsc);/* 发送主包 */    vxlan_xmit_one(skb, dev, rdst, did_rsc);}

核心封装:vxlan_xmit_one

staticnetdev_tx_tvxlan_xmit_one(struct sk_buff *skb,struct net_device *dev,struct vxlan_rdst *rdst, bool did_rsc){/* 1. 查找路由 */    rt = ip_route_output_key(dev_net(dev), fl4);/* 2. 本地路由优化:如果目的地是本机,直接 bypass 封装 */if (rt->rt_flags & RTCF_LOCAL) {        vxlan_encap_bypass(skb, vxlan, dst_vxlan);return NETDEV_TX_OK;    }/* 3. 预留头部空间 */    skb_cow_head(skb, VXLAN_HEADROOM);/* 4. 计算源端口(基于 flow hash 或 MAC hash) */    src_port = vxlan_src_port(vxlan, skb);/* 5. 写入 VXLAN 头 */    vxh = (struct vxlanhdr *)__skb_push(skb, sizeof(*vxh));    vxh->vx_flags = htonl(VXLAN_FLAGS);    vxh->vx_vni = htonl(vni << 8);/* 6. 写入 UDP 头 */    uh = udp_hdr(skb);    uh->dest = dst_port;     /* 远端端口 */    uh->source = src_port;   /* 源端口 */    uh->check = 0;           /* 关闭 UDP 校验和 *//* 7. 写入外层 IP 头 */    iph = ip_hdr(skb);    iph->daddr = dst;    iph->saddr = vxlan->saddr;    iph->ttl = ttl;/* 8. 发送 */    iptunnel_xmit(skb, dev);}

源端口选择:负载均衡的关键

static __be16 vxlan_src_port(conststruct vxlan_dev *vxlan,struct sk_buff *skb){/* 优先使用 L4 flow hash(硬件可能已计算) */    hash = skb_get_rxhash(skb);if (!hash)/* 回退:对源/目的 MAC 做 jhash */        hash = jhash(skb->data, 2 * ETH_ALEN, skb->protocol);/* 映射到配置的源端口范围 */return htons((((u64)hash * range) >> 32) + vxlan->port_min);}

这段代码花了我一晚上才看懂。原来 ECMP 失效的原因不是哈希算法不对,是源端口全一样,交换机以为是同一个流。

通过哈希分散流量到不同源端口,交换机就能按流分发,底层 ECMP 才有效。哈希输入是内层帧的源/目的 MAC 和协议类型。skb_get_rxhash 是硬件已经算好的流哈希,优先使用。硬件返回 0 时才回退到手动计算。

本地路由优化:vxlan_encap_bypass

staticvoidvxlan_encap_bypass(struct sk_buff *skb,struct vxlan_dev *src_vxlan,struct vxlan_dev *dst_vxlan){/* 直接内部转发,跳过 IP/UDP/VXLAN 封装 */    skb->dev = dst_vxlan->dev;    __skb_pull(skb, skb_network_offset(skb));    netif_rx(skb);    /* 直接递交给接收侧 */}

目的 IP 就是本机时,跳过完整的封装/发送流程,直接修改 skb->dev 后递交给接收侧。

在同一个主机上创建多个 VXLAN 设备做测试时,这个优化省去了不必要的编码-解码开销。

转发表(FDB)管理

数据结构

FDB 使用 256 桶的哈希表:

structhlist_headfdb_head[FDB_HASH_SIZE];/* FDB_HASH_SIZE = 256 */

哈希函数基于 MAC 地址:

static u32 eth_hash(constunsignedchar *addr){    u64 value = get_unaligned((u64 *)addr);#ifdef __BIG_ENDIAN    value = be64_to_cpu(value);#else    value = le64_to_cpu(value);#endifreturn hash_64(value, FDB_HASH_BITS);    /* 8 位 = 256 桶 */}

三种 FDB 条目来源

来源
方式
状态
自动学习
vxlan_snoop()NUD_REACHABLE
用户态静态配置
ip neigh addNUD_PERMANENT
 / NUD_REACHABLE
组播默认
default_dst
—

老化机制:vxlan_cleanup

staticvoidvxlan_cleanup(unsignedlong arg){structvxlan_dev *vxlan = (struct vxlan_dev *)arg;/* 遍历所有哈希桶 */for (h = 0; h < FDB_HASH_SIZE; ++h) {        hlist_for_each_safe(p, n, &vxlan->fdb_head[h], hlist) {            f = hlist_entry(p, struct vxlan_fdb, hlist);/* 静态条目永不老化 */if (f->state & NUD_PERMANENT)continue;/* 超过老化时间则删除 */            timeout = f->used + vxlan->age_interval * HZ;if (time_before_eq(timeout, jiffies)) {                vxlan_fdb_destroy(vxlan, f);            }        }    }/* 重新调度定时器 */    mod_timer(&vxlan->age_timer, next_timer);}

参数:

  • FDB_AGE_DEFAULT = 300(5 分钟)
  • FDB_AGE_INTERVAL = 10 * HZ(每 10 秒扫描一次)

定时器每 10 秒唤醒一次,扫描所有 FDB 条目,将超过 5 分钟未使用的条目标记为 STALE 并删除。静态条目不受影响。

Proxy ARP 功能:arp_reduce

当启用 VXLAN_F_PROXY 标志时,VXLAN 设备会代理 ARP 请求:

staticintarp_reduce(struct net_device *dev, struct sk_buff *skb){structarphdr *arp = arp_hdr(skb);    __be32 tip, sip;structsk_buff *reply;structvxlan_fdb *f;if (arp->ar_op != htons(ARPOP_REQUEST))return0;memcpy(&tip, arp->ar_tipn, sizeof(tip));memcpy(&sip, arp->ar_sipn, sizeof(sip));    f = vxlan_find_mac(vxlan, arp->ar_sha);if (!f)return0;    reply = arp_create(ARPOP_REPLY, ETH_P_ARP, sip, dev, tip,                       f->ha.addr, arp->ar_sha, arp->ar_sha);    netif_rx_ni(reply);return1;}

VXLAN 设备代替目标 VM 响应 ARP 请求,VM 之间像在同一二层通信。

代价是 ARP 缓存可能过时。VM 迁移后,远端 VM 的 ARP 表不会自动更新,除非目标 VM 发 gratuitous ARP。生产环境一般关掉这个功能——SDN 控制器自己的 ARP 机制更可靠。

Route Short-Circuit:route_shortcircuit

当启用 VXLAN_F_RSC 时,如果目的 IP 在本机路由表中可达,跳过 VXLAN 封装直接转发:

staticboolroute_shortcircuit(struct net_device *dev, struct sk_buff *skb){structiphdr *iph = ip_hdr(skb);structneighbour *n;    n = neigh_lookup(arp_tbl, iph->daddr, dev);if (n) {/* 直接修改以太网头,交给本地网卡发送 */memcpy(eth_hdr(skb)->h_dest, n->ha, dev->addr_len);returntrue;    }returnfalse;}

本地可达的流量直接走物理网卡,省掉隧道封装。

multicast 组播支持

当 VXLAN 使用组播地址作为目的地时,驱动会自动加入 IGMP 组:

staticintvxlan_join_group(struct net_device *dev){structip_mreqnmreq = {        .imr_multiaddr.s_addr = vxlan->default_dst.remote_ip,        .imr_ifindex = vxlan->default_dst.remote_ifindex,    };int err;    rtnl_unlock();    lock_sock(sk);    err = ip_mc_join_group(sk, &mreq);    /* 内核级 IP_ADD_MEMBERSHIP */    release_sock(sk);    rtnl_lock();return err;}

先释放 RTNL 再获取 sock 锁——ip_mc_join_group 内部要拿 RTNL,顺序反了就是死锁。

同一个组播组可能被多个 VXLAN 设备使用,驱动通过 vxlan_group_used() 去重——只在第一个设备加入、最后一个设备离开时真正加入/离开组播组。

标志位详解

标志
宏
作用
自动学习
VXLAN_F_LEARN
启用 vxlan_snoop() 自动学习 MAC
Proxy ARP
VXLAN_F_PROXY
启用 arp_reduce() 代理 ARP
路由短路
VXLAN_F_RSC
启用 route_shortcircuit() 绕过封装
L2 未命中通知
VXLAN_F_L2MISS
FDB 无条目时通知用户态
L3 未命中通知
VXLAN_F_L3MISS
ARP 无匹配时通知用户态

生产环境最常用 LEARN 和 PROXY。RSC 减少隧道封装。L2MISS 和 L3MISS 是给 SDN 控制器用的,没有控制器的场景基本用不到。

整体架构图

┌─────────────────────────────────────────────────────────────┐│                        应用层 / 容器网络                     ││              ip link add vxlan0 type vxlan id 100 ...       │└──────────────────────────┬──────────────────────────────────┘                           │┌──────────────────────────▼──────────────────────────────────┐│                    struct vxlan_dev(网络设备)               ││    ┌─────────────┐    ┌─────────────┐    ┌─────────────────┐ ││    │ fdb_head[256]│    │  age_timer   │    │   default_dst   │ ││    │  MAC→IP 映射 │    │   5min 老化  │    │   组播/默认路由 │ ││    └─────────────┘    └─────────────┘    └─────────────────┘ ││    flags: LEARN|PROXY|RSC|L2MISS|L3MISS                      │└──────────────────────────┬──────────────────────────────────┘                           │              ┌────────────┼────────────┐              ▼            ▼            ▼        vxlan_xmit()  vxlan_snoop()  arp_reduce()        (发送封装)      (接收学习)    (Proxy ARP)              │            │              ▼            ▼        ┌─────────────────────────────┐        │   IP + UDP + VXLAN + Eth    │        │   外层: src_ip → dst_ip     │        │   UDP: src_port → 8472      │        │   VXLAN: VNI=100            │        │   内层: 原始以太网帧          │        └─────────────────────────────┘              │              ▼        物理网卡 → 网络

参考:Linux 3.10 drivers/net/vxlan.c,作者 Stephen Hemminger

最新文章

随机文章