
支持向量机常被简化成一句话:寻找一条间隔最大的分类边界。真正写代码时,困难却往往不在SVC().fit(),而在边界之外的整套流程。特征要不要标准化,C和gamma怎样选择,调参时能不能看测试集,最终的高分又具体错在了哪一类样本上,这些决定比单独调用模型更重要。
本文用scikit-learn内置的Breast Cancer Wisconsin数据演示RBF核支持向量分类器。我们会先划出一份完全隔离的测试集,再把标准化和SVM封装进Pipeline,只在训练集内部做16组参数的五折交叉验证。模型选定后,测试集只使用一次。
内置数据规模较小,来自特定历史样本;本次单次划分得到的结果不能代表真实临床部署性能,更不能替代外部验证、概率校准、阈值选择和前瞻性评估。
输入是569个样本和30个连续数值特征,目标类别为malignant和benign。任务是训练一个RBF-SVM二分类模型,在类别数量不完全相等的情况下兼顾两类召回率,并保留一份未参与调参的测试集作最终评估。
最终需要回答四个问题:标准化怎样避免数据泄漏;C与gamma的组合在哪个区域表现稳定;交叉验证选出的模型在独立测试集上表现怎样;错误集中在哪个真实类别。评价主指标采用平衡准确率,即分别计算每一类召回率后取平均,避免多数类对普通准确率形成过强影响。
线性支持向量机希望找到一个间隔尽可能宽的分隔超平面,真正决定边界位置的训练样本称为支持向量。RBF核把样本间的距离转换为相似度,使模型能够形成非线性边界,而无需手工显式构造高维映射。
C控制错分惩罚与宽间隔之间的权衡。较大的C更强调训练样本分类正确,边界可能变得更复杂;较小的C允许更多训练误差,正则化更强。gamma控制单个样本的影响范围:数值较大时影响更局部,过大可能追随训练数据细节;数值较小时影响更平滑,过小又可能欠拟合。二者必须结合考察,不能各自独立寻找最优值。
SVM对特征尺度敏感。若某一列取值范围是0至1,另一列是0至1000,后者会在距离计算中占据不成比例的影响。标准化必须在每个交叉验证折的训练部分上拟合,再应用到该折验证部分。把StandardScaler放入Pipeline,可以让GridSearchCV自动保持这个边界,避免先对全体训练数据甚至测试数据计算均值和标准差。
数据直接由load_breast_cancer(as_frame=True)载入,无需联网下载。完整数据中malignant为212例,benign为357例。我们按类别分层切分25%作为测试集,使训练集和测试集维持相近类别比例。
模型固定使用RBF核,并设置class_weight="balanced",让类别权重与训练数据中的类别频率成反比。参数网格包含4个C和4个gamma,共16种组合;每种组合在训练集上做五折分层交叉验证,评分为平衡准确率。搜索结束后,GridSearchCV会用最佳参数在完整训练集上重新拟合模型。
参数热图用于观察整个搜索区域,而不是只盯着最高分。最终测试结果则同时给出两类召回率、支持向量数和混淆矩阵。代码不启用probability=True,因为本文研究的是分类边界而非概率预测;需要风险概率时应另行使用校准方法并验证校准表现。
import osfrom pathlib import Path# 把Matplotlib缓存放到可写目录,保证后台环境绘图稳定os.environ[”MPLCONFIGDIR”] = ”/tmp/wechat_python_svm_mpl_20260811”import matplotlibmatplotlib.use(”Agg”)import matplotlib.pyplot as pltimport numpy as npimport pandas as pdimport sklearnfrom sklearn.datasets import load_breast_cancerfrom sklearn.metrics import balanced_accuracy_score, confusion_matrix, recall_scorefrom sklearn.model_selection import GridSearchCV, StratifiedKFold, train_test_splitfrom sklearn.pipeline import Pipelinefrom sklearn.preprocessing import StandardScalerfrom sklearn.svm import SVC# 固定数据划分与交叉验证随机种子,保证结果可复现RANDOM_SEED = 20260811dataset = load_breast_cancer(as_frame=True)X = dataset.datay = dataset.target# 先留出测试集,后续调参只能接触训练集X_train, X_test, y_train, y_test = train_test_split(X,y,test_size=0.25,stratify=y,random_state=RANDOM_SEED,)# 类别0是malignant,类别1是benign,输出分布便于解释指标train_counts = y_train.value_counts().sort_index()test_counts = y_test.value_counts().sort_index()print(”数据来源:scikit-learn内置Breast Cancer Wisconsin数据”)print(f”样本数 / 特征数:{X.shape[0]} / {X.shape[1]}”)print(f”完整类别分布:malignant={(y == 0).sum()},benign={(y == 1).sum()}”)print(f”训练集:{len(X_train)};测试集:{len(X_test)}”)print(f”scikit-learn版本:{sklearn.__version__}”)
输出:
数据来源:scikit-learn内置Breast Cancer Wisconsin数据样本数 / 特征数:569 / 30完整类别分布:malignant=212,benign=357训练集:426;测试集:143scikit-learn版本:1.9.0
测试集在任何标准化和参数搜索之前划出。stratify=y不是让两边样本完全相同,而是尽量保持类别比例;固定随机种子则让本次教学结果可重复。
# 标准化放进Pipeline,确保每个交叉验证折只使用自己的训练部分拟合尺度svm_pipeline = Pipeline([(”scaler”, StandardScaler()),(”svc”, SVC(kernel=”rbf”, class_weight=”balanced”)),])# C控制正则化权衡,gamma控制单个样本影响范围c_values = [0.1, 1.0, 10.0, 100.0]gamma_values = [0.0001, 0.001, 0.01, 0.1]param_grid = {”svc__C”: c_values,”svc__gamma”: gamma_values,}# 调参只在训练集内做五折分层交叉验证,评分使用平衡准确率cv = StratifiedKFold(n_splits=5, shuffle=True, random_state=RANDOM_SEED)grid_search = GridSearchCV(estimator=svm_pipeline,param_grid=param_grid,scoring=”balanced_accuracy”,cv=cv,n_jobs=1,refit=True,return_train_score=True,)grid_search.fit(X_train, y_train)print(f”候选组合:{len(c_values) * len(gamma_values)} 个”)print(f”交叉验证:{cv.get_n_splits()} 折分层划分”)print(f”最佳C:{grid_search.best_params_['svc__C']}”)print(f”最佳gamma:{grid_search.best_params_['svc__gamma']}”)print(f”最佳CV平衡准确率:{grid_search.best_score_:.3f}”)
输出:
候选组合:16 个交叉验证:5 折分层划分最佳C:10.0最佳gamma:0.001最佳CV平衡准确率:0.969
所有16组组合都只使用训练集内部折进行比较。最佳组合不是在测试集上挑出的,因此后面测试集仍能承担相对独立的最终检查。这个搜索网格是教学范围,不保证已经覆盖所有合理参数。
# 将每组参数的验证分数整理为C乘gamma矩阵cv_results = pd.DataFrame(grid_search.cv_results_)score_matrix = np.zeros((len(gamma_values), len(c_values)))for row_id, gamma in enumerate(gamma_values):for col_id, c_value in enumerate(c_values):matched = cv_results[(cv_results[”param_svc__gamma”] == gamma)& (cv_results[”param_svc__C”] == c_value)]score_matrix[row_id, col_id] = matched[”mean_test_score”].iloc[0]# 热图展示参数区域,而不只报告单个最佳点fig, ax = plt.subplots(figsize=(8.2, 5.6))image = ax.imshow(score_matrix, cmap=”YlGnBu”, vmin=score_matrix.min() - 0.005, vmax=score_matrix.max())ax.set_title(”RBF-SVM Cross-validated Balanced Accuracy”, pad=14, weight=”bold”)ax.set_xlabel(”C”)ax.set_ylabel(”Gamma”)ax.set_xticks(range(len(c_values)), [str(value) for value in c_values])ax.set_yticks(range(len(gamma_values)), [str(value) for value in gamma_values])for row_id in range(score_matrix.shape[0]):for col_id in range(score_matrix.shape[1]):ax.text(col_id, row_id, f”{score_matrix[row_id, col_id]:.3f}”, ha=”center”, va=”center”, weight=”bold”)fig.colorbar(image, ax=ax, label=”Mean CV balanced accuracy”)fig.tight_layout()grid_plot = Path(”/tmp/python_svm_grid_heatmap.png”)fig.savefig(grid_plot, dpi=180, bbox_inches=”tight”)plt.close(fig)# 训练分数与验证分数的差距只作为过拟合线索,不替代测试集评估best_index = grid_search.best_index_best_train_score = cv_results.loc[best_index, ”mean_train_score”]cv_gap = best_train_score - grid_search.best_score_print(f”参数网格最高分:{score_matrix.max():.3f}”)print(f”参数网格最低分:{score_matrix.min():.3f}”)print(f”最佳组合训练-CV差距:{cv_gap:.3f}”)print(f”Grid chart:{grid_plot.name} ({grid_plot.stat().st_size:,} bytes)”)
输出:
参数网格最高分:0.969参数网格最低分:0.500最佳组合训练-CV差距:0.012Grid chart:python_svm_grid_heatmap.png (69,131 bytes)

热图显示参数组合之间差异很大。C=0.1、gamma=0.0001时平衡准确率只有0.500,接近二分类中只识别一类的水平;C=10、gamma=0.001达到0.969。多个相邻组合也在0.96附近,说明高分并非只存在于一个孤立点。最佳组合训练分数比验证分数高0.012,这只是轻微过拟合线索,仍需测试集验证。
# 最佳模型已经在完整训练集上重拟合,现在才使用留出测试集best_model = grid_search.best_estimator_test_pred = best_model.predict(X_test)test_balanced_accuracy = balanced_accuracy_score(y_test, test_pred)malignant_recall = recall_score(y_test, test_pred, pos_label=0)benign_recall = recall_score(y_test, test_pred, pos_label=1)cm_count = confusion_matrix(y_test, test_pred, labels=[0, 1])cm_normalized = confusion_matrix(y_test, test_pred, labels=[0, 1], normalize=”true”)# 并排呈现样本数和行归一化比例,避免只看总正确率fig, axes = plt.subplots(1, 2, figsize=(10.4, 4.8))for ax, matrix, title, value_format in [(axes[0], cm_count, ”Confusion Matrix (Counts)”, ”d”),(axes[1], cm_normalized, ”Confusion Matrix (Row %)”, ”.1%”),]:image = ax.imshow(matrix, cmap=”Blues”, vmin=0)ax.set_title(title, pad=12, weight=”bold”)ax.set_xlabel(”Predicted class”)ax.set_ylabel(”True class”)ax.set_xticks([0, 1], [”Malignant”, ”Benign”])ax.set_yticks([0, 1], [”Malignant”, ”Benign”])threshold = matrix.max() / 2for row_id in range(2):for col_id in range(2):value = matrix[row_id, col_id]label = format(value, value_format)color = ”white” if value > threshold else ”#17324D”ax.text(col_id, row_id, label, ha=”center”, va=”center”, color=color, weight=”bold”, fontsize=12)fig.tight_layout()confusion_plot = Path(”/tmp/python_svm_confusion_matrix.png”)fig.savefig(confusion_plot, dpi=180, bbox_inches=”tight”)plt.close(fig)# 支持向量数量反映最终边界由多少训练样本共同支撑support_counts = best_model.named_steps[”svc”].n_support_print(f”测试集平衡准确率:{test_balanced_accuracy:.3f}”)print(f”Malignant召回率:{malignant_recall:.3f}”)print(f”Benign召回率:{benign_recall:.3f}”)print(f”混淆矩阵:{cm_count.tolist()}”)print(f”支持向量数(malignant / benign):{support_counts[0]} / {support_counts[1]}”)print(f”Confusion chart:{confusion_plot.name} ({confusion_plot.stat().st_size:,} bytes)”)
输出:
测试集平衡准确率:0.991Malignant召回率:0.981Benign召回率:1.000混淆矩阵:[[52, 1], [0, 90]]支持向量数(malignant / benign):31 / 50Confusion chart:python_svm_confusion_matrix.png (44,852 bytes)

测试集53个malignant样本中52个被正确识别,1个被预测为benign;90个benign样本全部正确。行归一化图把两类召回率直接显示为98.1%和100.0%。这个结果来自143例测试样本的一次固定划分,1个样本的变化就会明显改变比例,不能把0.991视为稳定的临床性能估计。
本次模型选择过程给出C=10和gamma=0.001。它们不是SVM的普遍最佳参数,只是当前数据、预处理、训练划分、类别权重、参数网格和评分规则共同作用下的选择。换数据或换评价目标必须重新调参。
平衡准确率高于交叉验证均值并不罕见,因为测试集只是一个有限随机样本。不能据此判断模型比交叉验证更好,更不能反过来用这个测试结果继续修改参数,否则测试集会逐渐变成调参集。若需要更稳定的模型比较,可采用嵌套交叉验证;若要给出部署结论,还需要独立外部数据。
最终SVC使用了81个支持向量,其中malignant类31个、benign类50个。支持向量是决定边界的重要训练样本,但数量本身不是越少越好或越多越好。它与数据重叠程度、C、gamma和类别权重共同变化,适合帮助理解模型复杂度,不应单独充当性能指标。
RBF-SVM的可靠实战不只是训练一个分类器,而是把尺度处理、参数选择和最终评估放在正确边界内。先隔离测试集,再用Pipeline封装标准化与模型,随后只在训练集交叉验证中选择C和gamma,最后用混淆矩阵解释测试错误,这条流程比一个漂亮分数更值得复用。
SVC适合中小规模、特征为连续数值且非线性边界可能重要的分类问题。其训练成本会随样本量快速上升,达到数万甚至更大规模时应评估LinearSVC、随机特征核近似或其他可扩展模型。任何医疗数据应用还必须补充数据代表性、缺失处理、概率校准、阈值决策、外部验证和风险治理。
