# 信息增益

> KL散度（英語：Kullback-Leibler divergence，簡稱KLD），在訊息系统中称为相对熵（relative entropy），在连续时间序列中称为随机性（randomness），在统计模型推断中称为訊息增益（information gain）。也称訊息散度（information divergence）。 KL散度是两个機率分布P和Q差别的非对称性的度量。 KL散度是用来度量使用基于Q的分布来编码服从P的分布的样本所需的额外的平均比特数。典型情况下，P表示数据的真实分布，Q表示数据的理论分布、估计的模型分布、或P的近似分布。

- ID: m07561
- 分类: decide
- 领域: 决策科学

## 定义

熵减少量：某特征对分类不确定性的减少。公式：IG = H(父节点) - 加权平均H(子节点)特征选择：选择信息增益最大的特征分裂。脚手架作用：量化"这个信息有多少价值"。不是所有信息都同等有用，信息增益帮助识别最有区分力的特征。

## 机制

信息增益 = 父节点熵 − 按某特征分裂后子节点熵的加权平均，量化该特征减少了多少不确定性。基于香农熵：越能纯净划分样本（子节点更纯），增益越大。决策树（ID3/C4.5）据此选每次分裂的最优特征。

## 练习

1）计算当前节点熵H(父)；2）对每个候选特征，按取值划分子集并加权平均熵；3）取增益最大者分裂；4）递归直到纯或达深度/样本阈值；5）注意增益偏向多值特征，可用增益率（C4.5）修正。

## 脚手架用法

量化"这个信息有多少价值"。不是所有信息都同等有用，信息增益帮助识别最有区分力的特征。

[阅读网页](https://thinkingmodels.site/entries/detail/m07561)
