# 准确率悖论

> 在数据类别极度不平衡的情况下（如99%是好人，1%是坏人），一个模型如果全都预测“好人”，其准确率高达99%，但这个模型是完全无用的（因为它抓不到坏人）

- ID: m00769
- 分类: technical
- 领域: 统计学

## 定义

在数据类别极度不平衡的情况下（如99%是好人，1%是坏人），一个模型如果全都预测“好人”，其准确率高达99%，但这个模型是完全无用的（因为它抓不到坏人）。脚手架作用：警惕虚荣指标。当听到“99%准确率”时，先别急着鼓掌，要看基准概率是多少。对于罕见事件的预测（如癌症筛查、欺诈检测），查全率（Recall）往往比准确率（Accuracy）更重要。

## 机制

在不平衡数据下，准确率 = 正确预测数 / 总数，被多数类主导。一个全预测多数类的"傻模型"准确率虚高却无判别力。真正重要的是对少数类的识别（查全率、查准率、AUC）。

## 练习

1. 先看基准类别分布（多数类占比）。 2. 不单看准确率，改用混淆矩阵。 3. 对不平衡问题关注 Recall / F1 / AUC。 4. 必要时重采样或更换评估指标。

## 脚手架用法

警惕虚荣指标。当听到“99%准确率”时，先别急着鼓掌，要看基准概率是多少。对于罕见事件的预测（如癌症筛查、欺诈检测），查全率（Recall）往往比准确率（Accuracy）更重要。

[阅读网页](https://thinkingmodels.site/entries/detail/m00769)
