比较两组连续数据时,很多分析会从均值开始,也在均值处结束。如果两组平均值几乎相同,我们很容易得出“表现差不多”的印象。但平均值只是一处分布特征,它看不见数据有多分散,也看不见低值和高值尾部各自堆积了多少观测。
直方图能够补充形状信息,却需要人为选择箱宽。箱子切得细,局部起伏会变多;切得粗,峰值和尾部又可能被抹平。两组半透明直方图叠在一起时,颜色覆盖还会进一步增加阅读负担。
经验累积分布函数,简称 ECDF,提供了另一种观察角度。它不需要设置箱宽,而是直接告诉我们:在任意一个数值处,有多大比例的观测不超过这个数。本期用一组均值刻意设为相同的模拟数据,看看 ECDF 如何揭示被平均值隐藏的差异。
我们模拟两组各 1,200 条处理时间。Group A 相对集中,Group B 更分散并具有更长的右尾;随后将 Group B 按比例缩放,使两组样本均值完全相同。这样的设计可以把注意力集中在分布形状,而不是简单的均值差异上。
分析需要回答三个问题:不同箱宽会怎样改变直方图的视觉印象;两组在中位数和高分位数上相差多少;当业务真正关心“处理时间超过某个阈值的比例”时,ECDF和互补ECDF能提供什么信息。
对任意数值 x,ECDF计算样本中小于或等于 x 的观测比例。将 x 从小到大排列后,曲线从 0 逐步上升至 1,每个观测都会让曲线向上跳一步。因此,纵轴为 0.90 时对应第 90 百分位数;固定一个横轴阈值,也可以直接读出有多少观测没有超过它。
与直方图相比,ECDF不需要人为选择箱宽,也不通过平滑假设构造曲线。代价是它不会直接显示局部“峰”在哪里,而且样本较小时阶梯会十分明显。两条ECDF曲线的垂直距离表示在同一个阈值下,两组累计比例相差多少。
如果重点位于右尾,可以绘制互补ECDF。它把纵轴改成“超过当前阈值的比例”,并常配合对数尺度,让原本挤在接近零位置的稀少高值更容易区分。对数坐标改善的是视觉分辨率,不会增加尾部样本量,也不会消除极端分位数的不确定性。
本例使用 NumPy 的随机数生成器构造 Gamma 分布数据,并固定随机种子保证结果可复现。Group A 的形状参数更大,因此数据更集中;Group B 的形状参数更小,因此分布更右偏、尾部更长。随后只对 Group B 做整体比例缩放,使它与 Group A 的样本均值一致。
代码分为三段。第一段生成数据并输出描述统计;第二段用两种箱宽绘制重叠直方图,同时计算关键分位数;第三段绘制完整ECDF和右尾互补ECDF,并量化两条累计曲线的最大垂直差以及超过业务阈值 120 的比例。
import numpy as npimport pandas as pdimport matplotlib# 使用无界面后端,确保本次绘图可以直接保存为PNGmatplotlib.use(”Agg”)import matplotlib.pyplot as plt# 固定随机种子,生成均值相同但离散程度不同的两组模拟数据RANDOM_STATE = 20260721rng = np.random.default_rng(RANDOM_STATE)n_per_group = 1200group_a = rng.gamma(shape=16.0, scale=5.0, size=n_per_group)group_b_raw = rng.gamma(shape=4.0, scale=20.0, size=n_per_group)group_b = group_b_raw * group_a.mean() / group_b_raw.mean()# 整理成长表,便于汇总两组位置和离散程度data = pd.DataFrame({”group”: np.repeat([”Group A”, ”Group B”], n_per_group),”value”: np.concatenate([group_a, group_b]),})summary = data.groupby(”group”)[”value”].agg([”count”, ”mean”, ”median”, ”std”])# 输出关键描述统计,先确认均值相同不代表分布相同print(summary.round(2).to_string())print(f”标准差之比(B/A): {group_b.std(ddof=1) / group_a.std(ddof=1):.2f}”)
输出:
count mean median stdgroupGroup A 1200 79.46 77.71 19.64Group B 1200 79.46 72.02 40.82标准差之比(B/A): 2.08
两组均值都为 79.46,这是模拟过程刻意控制的结果。但 Group B 的标准差达到 40.82,是 Group A 的 2.08 倍;Group B 的中位数反而更低。仅凭相同均值描述这两组数据,会漏掉非常显著的离散程度与偏态差异。
# 使用两种分箱宽度画直方图,观察视觉结论对分箱的敏感性fig, axes = plt.subplots(1, 2, figsize=(11.0, 4.8), sharey=True)colors = {”Group A”: ”#2A6F97”, ”Group B”: ”#D1495B”}for ax, bin_width in zip(axes, [10, 25]):bins = np.arange(0, 241 + bin_width, bin_width)ax.hist(group_a, bins=bins, density=True, alpha=0.48,color=colors[”Group A”], label=”Group A”)ax.hist(group_b, bins=bins, density=True, alpha=0.48,color=colors[”Group B”], label=”Group B”)ax.set_title(f”Histogram: Bin Width = {bin_width}”, loc=”left”)ax.set_xlabel(”Processing time”)ax.grid(axis=”y”, alpha=0.18)axes[0].set_ylabel(”Density”)axes[0].legend()fig.tight_layout()fig.savefig(”python_histogram_bins.png”, dpi=180, bbox_inches=”tight”)plt.close(fig)# 计算几个常用分位数,量化直方图中不易稳定读取的尾部差异quantile_levels = [0.10, 0.50, 0.90, 0.95]quantiles_a = np.quantile(group_a, quantile_levels)quantiles_b = np.quantile(group_b, quantile_levels)# 逐个输出分位数差值,避免只比较均值或最高柱形for level, value_a, value_b in zip(quantile_levels, quantiles_a, quantiles_b):print(f”P{int(level * 100):02d}: A={value_a:.2f}, B={value_b:.2f}, B-A={value_b - value_a:.2f}”)
输出:
P10: A=55.79, B=32.13, B-A=-23.66P50: A=77.71, B=72.02, B-A=-5.69P90: A=104.66, B=134.56, B-A=29.90P95: A=113.62, B=157.69, B-A=44.07

箱宽从 10 增加到 25 后,局部柱形明显减少,Group A 的集中峰和 Group B 的右尾都变得更粗略。两种画法都没有错,但视觉细节取决于分箱选择。分位数进一步说明:Group B 的 P10 比 Group A 低 23.66,而 P95 高 44.07,分布同时向低值端和高值端展开。
# 绘制完整ECDF,让每个观测都参与阶梯曲线而不需要选择箱宽fig, axes = plt.subplots(1, 2, figsize=(11.2, 4.9))axes[0].ecdf(group_a, color=colors[”Group A”], linewidth=2.2, label=”Group A”)axes[0].ecdf(group_b, color=colors[”Group B”], linewidth=2.2, label=”Group B”)axes[0].axhline(0.90, color=”#6C757D”, linestyle=”--”, linewidth=1.4)axes[0].set_title(”Empirical Cumulative Distribution”, loc=”left”)axes[0].set_xlabel(”Processing time”)axes[0].set_ylabel(”Cumulative proportion”)axes[0].legend()axes[0].grid(alpha=0.18)# 再画互补ECDF并使用对数纵轴,专门观察较慢的右尾部分axes[1].ecdf(group_a, complementary=True, color=colors[”Group A”],linewidth=2.2, label=”Group A”)axes[1].ecdf(group_b, complementary=True, color=colors[”Group B”],linewidth=2.2, label=”Group B”)axes[1].set_yscale(”log”)axes[1].set_ylim(1 / n_per_group, 1)axes[1].set_title(”Complementary ECDF for the Right Tail”, loc=”left”)axes[1].set_xlabel(”Processing time”)axes[1].set_ylabel(”Proportion above threshold”)axes[1].legend()axes[1].grid(alpha=0.18, which=”both”)fig.tight_layout()fig.savefig(”python_ecdf_comparison.png”, dpi=180, bbox_inches=”tight”)plt.close(fig)# 在共同阈值网格上计算两条ECDF的最大垂直距离及业务阈值比例grid = np.sort(np.unique(np.concatenate([group_a, group_b])))ecdf_a = np.searchsorted(np.sort(group_a), grid, side=”right”) / n_per_groupecdf_b = np.searchsorted(np.sort(group_b), grid, side=”right”) / n_per_groupmax_gap_index = np.argmax(np.abs(ecdf_a - ecdf_b))threshold = 120# 输出描述性差异,不把最大垂直距离直接解释成显著性检验print(f”最大ECDF垂直差: {abs(ecdf_a[max_gap_index] - ecdf_b[max_gap_index]):.3f}”)print(f”最大差所在数值: {grid[max_gap_index]:.2f}”)print(f”超过120的比例-A: {np.mean(group_a > threshold):.1%}”)print(f”超过120的比例-B: {np.mean(group_b > threshold):.1%}”)
输出:
最大ECDF垂直差: 0.211最大差所在数值: 56.21超过120的比例-A: 2.9%超过120的比例-B: 15.3%

左图中两条曲线发生交叉,而不是一条始终位于另一条之上。这表示两组的差异并非简单的整体平移:Group B 在较低数值处积累得更快,但进入高值区后又留下更长的右尾。两条曲线在约 56.21 处的累计比例相差最大,垂直差为 0.211。
右图把超过阈值的比例放在纵轴,并使用对数尺度展开尾部。超过 120 的观测在 Group A 中占 2.9%,在 Group B 中达到 15.3%。如果处理时间过长代表风险或成本,这个差异显然比“二者平均值都是 79.46”更有决策意义。
本例展示了均值的压缩作用。Group B 同时包含更多较低值和更多极高值,两端变化互相抵消后,最终得到与 Group A 相同的均值。中位数、标准差和尾部分位数则从不同角度还原了这种差异。
直方图适合观察局部峰值和大致形状,但箱宽会影响呈现。ECDF不需要分箱,可以在任意阈值读取累计比例,也可以从任意累计比例反查分位数。两者应被看作互补工具:直方图帮助识别形状,ECDF帮助进行稳定的阈值和分位数比较。
最大ECDF垂直差 0.211 在这里仅作为描述性指标。它在形式上与两样本 Kolmogorov–Smirnov 统计量相似,但本文没有进行显著性检验,也不能仅凭这个数字说明差异具有业务重要性。业务判断仍应落在预先关心的阈值、损失函数或容许范围上。
ECDF同样存在边界。它没有直接给出抽样不确定性,极端尾部只有少量观测支撑;组间样本量不同时,每一步的高度也不同。正式分析可以增加置信带、重采样区间或适当的分布检验,但不应让一个 P 值替代对差异位置与实际大小的解释。
当两组连续数据需要比较时,均值只能作为起点。至少还应查看中位数、离散程度和与业务相关的尾部比例。尤其在右偏数据、等待时间、费用、响应时长和风险指标中,相同均值可能对应完全不同的实际体验。
ECDF的核心价值是避免任意分箱,并把“有多少数据低于这个值”直接呈现在图上;互补ECDF则把问题翻转为“有多少数据超过这个值”,更适合观察长尾和超阈值风险。
本例使用经过刻意缩放的模拟数据,只用于展示方法。真实分析中应保留原始量纲和数据生成过程,提前确定重要阈值,并结合样本量、抽样设计与领域后果解释曲线差异。
