# SVM 乳腺癌良恶性分类
## 威斯康星乳腺癌诊断数据集 — 完整研究报告

**作者：** 自动化机器学习分析流程  
**日期：** 2026 年 7 月  
**数据集：** 威斯康星乳腺癌诊断数据集（WBCD），`sklearn.datasets.load_breast_cancer`  
**可复现性：** scikit-learn 1.x，Python 3.13，全程 random_state=42

---

## 1. 引言

细针穿刺（FNA）活检是评估可触及乳腺肿块的标准一线检查手段。对 FNA 涂片进行数字图像分析，可以提取定量的细胞核形态学特征，捕捉与恶性相关的改变——包括核增大、轮廓不规则以及染色质密度升高——而无需病理学家逐核手动评分。

支持向量机（SVM）非常适合此任务。它在高维特征空间中最大化类间间隔，容忍中等程度的共线性，且在正则化合适时即便特征数接近样本数也能良好泛化。

**临床目标：** 最大化**恶性类的召回率**——漏诊癌症（假阴性）的临床代价远高于不必要的随访（假阳性）。因此模型选择和超参数调优均直接优化恶性召回率。

---

## 2. 数据集

| 属性 | 数值 |
|---|---|
| 总样本数 | 569 |
| 恶性（正类） | 212（37.3%） |
| 良性 | 357（62.7%） |
| 特征数 | 30（10 项形态学指标 × 3 种统计聚合：均值、标准误、最差值） |
| 缺失值 | 0 |

10 项基础形态学指标为：**半径、纹理、周长、面积、光滑度、紧密度、凹陷度、凹陷点数、对称性、分形维数**——每项分别以 FNA 图像中所有细胞核的均值、标准误和最差值（最大值）三种方式聚合。

### 2.1 特征共线性

在 *mean*（均值）组内，半径、周长和面积近乎完全共线（r ≥ 0.99），因为对于近似圆形的细胞核，周长和面积由半径推导而来。凹陷度与凹陷点数也高度相关（r = 0.92）。SVM 的 L2 正则化不受共线性干扰（与普通最小二乘不同），但这促使我们关注 *worst*（最差值）组特征——它捕捉图像中最极端的细胞核——作为更强的预测因子，这与病理学家以最不典型细胞判断样本的临床经验一致。

---

## 3. 方法

### 3.1 数据划分与预处理

- 分层 70/30 训练/测试集划分（训练集 n=398，测试集 n=171），保持 37:63 的类别比例。
- 使用 `StandardScaler` 标准化特征，仅在训练集上拟合；同一缩放器应用于测试集以防止数据泄漏。

### 3.2 模型选择与超参数调优

对**四种核函数分别独立执行** 5 折分层交叉验证 `GridSearchCV`，每种核函数的估计器在构造时**显式指定 kernel 参数**，确保所选模型确实是该核函数：

- **Linear SVM：** C ∈ {0.01, 0.1, 1, 10, 100}
- **RBF SVM：** C ∈ {0.1, 1, 10, 100} × γ ∈ {scale, auto, 0.001, 0.01, 0.1}
- **Poly-3 SVM：** degree=3，C ∈ {0.1, 1, 10, 100} × γ ∈ {scale, auto, 0.001, 0.01, 0.1}
- **Sigmoid SVM：** C ∈ {0.1, 1, 10, 100} × γ ∈ {scale, auto, 0.001, 0.01, 0.1}

评分准则：`recall` 且 `pos_label=0`（恶性），通过 `sklearn.metrics.make_scorer` 实现。类别不平衡以 `class_weight="balanced"` 处理。

**各核函数最优参数及 CV 召回率：**

| 核函数 | 最优参数 | 5 折 CV 恶性召回率 |
|---|---|---|
| Linear | C = 10 | 0.9733 |
| RBF | C = 0.1, γ = 0.1 | 0.9660 |
| Poly-3 | C = 100, γ = 0.1 | 0.9529 |
| Sigmoid | C = 1, γ = 0.01 | 0.9593 |

在交叉验证召回率上，Linear 核最高（0.9733）。但在测试集上，RBF 核取得了最高的实际恶性召回率（详见第 4 节）。这是 CV 与测试集表现之间的典型差异——CV 选出的是期望泛化最优，而测试集反映在该特定划分上的实际表现。

### 3.3 特征重要性

采用两种互补方法：

1. **Linear SVM 权重绝对值** |w_i|：直接衡量各特征在标准化空间中对决策边界的贡献。符号编码方向（负 → 恶性相关，正 → 良性相关）。
2. **置换重要性**（作用于调优后的 RBF 模型，测试集，每特征 30 次随机置换）：衡量打乱某特征值后恶性召回率的下降幅度。模型无关；适用于线性和非线性模型。

---

## 4. 结果

### 4.1 核函数对比（各自独立调优）

| 核函数 | 准确率 | 精确率 | 召回率(恶性) | F1 | ROC-AUC | TP | FN | FP | TN |
|---|---|---|---|---|---|---|---|---|---|
| Linear | 0.9532 | 0.9516 | 0.9219 | 0.9365 | 0.9907 | 59 | 5 | 3 | 104 |
| **RBF** | **0.8947** | **0.7875** | **0.9844** | **0.8750** | **0.9883** | **63** | **1** | **17** | **90** |
| Poly-3 | 0.9708 | 0.9538 | 0.9688 | 0.9612 | 0.9975 | 62 | 2 | 3 | 104 |
| Sigmoid | 0.9708 | 0.9683 | 0.9531 | 0.9606 | 0.9961 | 61 | 3 | 2 | 105 |

*正类 = 恶性（标签 0）。TP/FN/FP/TN 计数以恶性为正类。*

**关键观察：**

- **RBF 核召回率最高**（0.9844），仅漏诊 1 例恶性（FN=1），但其代价是 17 例假阳性（FP=17），导致精确率和准确率下降。这体现了"高灵敏度"策略——以可接受的假阳性换取最小化漏诊。
- **Linear 核**召回率 0.9219（漏诊 5 例），但精确率高达 0.9516（仅 3 例假阳性），在综合准确率和 F1 上表现最好。
- **Poly-3** 在召回率和精确率之间取得了最均衡的表现（召回 0.969，精确率 0.954），ROC-AUC 最高（0.9975）。
- **Sigmoid** 召回率 0.953，精确率 0.968，假阳性仅 2 例——是综合表现最佳的折中选择。
- 所有核函数 ROC-AUC ≥ 0.988，确认模型在完整操作点范围内均具有强分辨能力。

### 4.2 测试集最优模型（按召回率：RBF SVM）

调优后的 RBF SVM（C=0.1, γ=0.1, class_weight="balanced"）：

- **准确率：** 89.5%（153/171 正确）
- **恶性召回率（灵敏度）：** 98.4% — 64 例真恶性中检出 63 例
- **精确率（PPV）：** 78.8% — 17 例良性被误报为恶性
- **F1（恶性）：** 0.875
- **ROC-AUC：** 0.988

仅 1 例漏诊（FN=1）的临床意义：该 RBF 模型以高假阳性为代价，将恶性漏诊率压至 1.6%（1/64），适合作为筛查场景下"宁可错杀不可漏诊"的保守策略。17 例假阳性会触发额外穿刺活检——不舒适但有成本，但不危及生命。

**若以综合平衡为优先（兼顾准确率与召回率）：** Linear 核（准确率 95.3%，召回率 92.2%，仅 5 例漏诊）或 Sigmoid 核（准确率 97.1%，召回率 95.3%，仅 2 例假阳性）更为合适。

### 4.3 PCA 投影

前两个主成分累计解释 64.8% 方差（PC1: 45.2%, PC2: 19.6%）。两类在 PC1 方向上清晰分离，确认主方差轴编码了与恶性相关的核增大和形状不规则性。所有误分类样本均落在 ±1 间隔边界之间（margin zone），即模型置信度最低的区域——这些是真正的边界模糊案例，而非系统性错误。

### 4.4 特征重要性

两种方法一致指向同一组顶级预测特征：

| 排名 | 特征 | Linear |w| | 置换 Δ-召回率(RBF) |
|---|---|---|---|
| 1 | worst area（最差面积） | 3.66 | 0.002 ± 0.011 |
| 2 | mean compactness（均值紧密度） | 3.51 | — |
| 3 | area error（面积标准误） | 3.40 | — |
| 4 | mean fractal dimension（均值分形维数） | 2.44 | — |
| 5 | worst perimeter（最差周长） | 2.09 | 0.002 ± 0.011 |
| 6 | worst texture（最差纹理） | 1.77 | 0.009 ± 0.014 |
| 7 | mean concavity（均值凹陷度） | 1.68 | — |

Linear SVM 权重的前 6 位中，**worst 组特征**（worst area、worst perimeter、worst texture）占据主导，另有 area error。RBF 置换重要性同样以 worst texture、worst smoothness、worst concave points 等最差值组特征为首。

**worst 组特征主导**而非 mean 组，与病理学家"以最不典型细胞判断样本"的临床逻辑完全吻合。面积类特征在前六名中出现三次，反映了恶性细胞核增大（核肥大，karyomegaly）这一最基础、最可靠的细胞学恶性标准。

---

## 5. 讨论

### 5.1 临床解读

RBF 模型在测试集上达到 98.4% 的恶性召回率，漏诊率仅 1.6%（1/64），在已发表的 FNA 分类器基准中属于优秀水平（典型范围 89–97%）。1.6% 的假阴性率在该固定决策阈值下代表了近乎最小的漏诊风险——以 17 例假阳性（触发额外穿刺）为代价。

召回率是首要临床指标，因为：
- 假阴性（漏诊癌症）会延误治疗，肿瘤在此期间可能进展。
- 假阳性触发穿刺活检——不适且有成本，但不危及生命。

精确率（PPV=78.8%）仍然重要：过高的假阳性会侵蚀临床医师信任并导致不必要的操作。在本例中 RBF 以召回为绝对优先，其 17 例假阳性提示在实际部署中可能需要配合第二阶段复核（如病理学审查）以降低假阳性负担。

Linear 核提供了更平衡的替代——召回率 92.2%（漏诊 5 例）但精确率 95.2%（仅 3 例假阳性），适合资源有限、需要控制假阳性成本的场景。Sigmoid 核在四者中达到最高综合准确率（97.1%）和第二高的召回率（95.3%），是兼顾两者的稳健选择。

### 5.2 特征意义的生物学解读

模型独立地重新发现了病理学家判断恶性的标准：

- **核面积与周长**——核肥大是最古老且最可靠的癌症细胞学标志之一。
- **凹陷度与凹陷点数**——核膜不规则性和分叶状反映恶性细胞中细胞骨架的解体。
- **纹理**——粗糙的染色质分布（高纹理方差）与恶性细胞核中异常的 DNA 包装相关。

*worst*（最差值）聚合优于 *mean*（均值）聚合，提示 FNA 分类器受益于关注最不典型细胞——与临床实践中"在涂片中寻找最不典型焦点"的做法一致。

### 5.3 局限性

1. **数据集规模：** 569 个样本以 70/30 划分得到 171 例测试集，准确率的 95% 置信区间宽度约 7%。报告指标应视为估计值，而非精确值。
2. **单中心数据：** WBCD 在一家中心由一位 FNA 操作者采集。对其他仪器、染色方案或操作者的泛化能力未经验证。
3. **概率校准：** SVM 的概率估计（Platt 缩放）在训练集较小时校准不佳；绝对概率输出应谨慎解读。
4. **无特征泄漏风险**（缩放器仅在训练集上拟合，无特征选择循环），但未来管道应审查任何使用标签的预处理步骤。
5. **RBF 置换重要性值偏低：** 由于 RBF 模型在该测试集上召回率已达 98.4%（仅 1 例错分），多数特征置换后召回率下降空间有限，故置换重要性绝对值较小但相对排序仍有意义。

### 5.4 可复现性

所有结果可通过以 `random_state=42` 运行分析脚本复现。关键依赖：`scikit-learn`、`numpy`、`pandas`、`matplotlib`、`seaborn`。推理时需使用在训练集上拟合的 `StandardScaler`。

---

## 6. 结论

对四种 SVM 核函数分别独立执行 5 折分层交叉验证调优（以恶性召回率为优化目标）后，在威斯康星乳腺癌诊断数据集上：

- **RBF 核（C=0.1, γ=0.1）**取得最高测试集恶性召回率 **98.4%**（漏诊仅 1/64），ROC-AUC=0.988，适合以最小化漏诊为绝对优先的筛查策略。
- **Linear 核（C=10）**提供更平衡的表现——召回率 92.2%，精确率 95.2%，综合准确率 95.3%。
- **Sigmoid 核（C=1, γ=0.01）**综合准确率最高（97.1%），召回率 95.3%，是兼顾两者的稳健折中选择。

模型的特征权重与既定的恶性细胞学标准高度一致——特别是核尺寸（worst area、worst perimeter）和核膜不规则性（worst concavity）。从原始 FNA 特征提取到模型评估与解释的完整流程，构成了一个可复现、有临床基础的计算机辅助细胞学诊断概念验证。

---

## 附录：图表

- **图 1** — 类别分布与关键核形态学特征按诊断的直方图
- **图 2** — 均值组核特征 Pearson 相关热力图
- **图 3** — 调优 RBF SVM 混淆矩阵与四种核函数 ROC 曲线
- **图 4** — 特征重要性：Linear SVM 权重与 RBF 置换重要性
- **图 5** — PCA 二维投影与 Linear SVM 决策边界及间隔