朴素贝叶斯中的拉普拉斯平滑(Laplace Smoothing)解决的是什么问题? 拉普拉斯平滑在朴素贝叶斯中解决的问题一、核心问题零概率问题朴素贝叶斯分类器通过计算后验概率进行分类c∗arg⁡max⁡cP(c)∏i1nP(wi∣c)c^* \arg\max_c P(c) \prod_{i1}^{n} P(w_i|c)c∗argcmax​P(c)i1∏n​P(wi​∣c)其中条件概率通过最大似然估计P(wi∣c)count(wi,c)∑wcount(w,c)P(w_i|c) \frac{count(w_i, c)}{\sum_w count(w, c)}P(wi​∣c)∑w​count(w,c)count(wi​,c)​问题出在这里如果词wiw_iwi​在类别 c 的训练文档中从未出现过则count(wi,c)0 ⟹ P(wi∣c)0count(w_i, c) 0 \implies P(w_i|c) 0count(wi​,c)0⟹P(wi​∣c)0由于各词概率是连乘关系一个零概率会导致整个乘积为零P(w1∣c)×P(w2∣c)×⋯×P(wk∣c)⏟0×⋯0P(w_1|c) \times P(w_2|c) \times \cdots \times \underbrace{P(w_k|c)}_{0} \times \cdots 0P(w1​∣c)×P(w2​∣c)×⋯×0P(wk​∣c)​​×⋯0这意味着仅因为一个词在训练集中未见过整个类别的概率就被强制清零无论其他词的证据多么强烈。具体示例训练集: 科技类文档中从未出现词 破产 财经类文档中 破产 出现 50 次 待分类文档: 某科技公司面临破产重组 → P(破产 | 科技) 0 → P(科技 | 文档) P(科技) × P(某|科技) × P(科技|科技) × P(破产|科技) × ... 0 → 科技类概率被直接清零尽管 科技公司 强烈暗示科技类本质零概率将没见过等同于不可能发生这是不合理的——训练集有限未出现的词不代表概率为零。二、拉普拉斯平滑的解决方案原理给计数加上一个小的常数α\alphaα通常α1\alpha 1α1确保概率永远不为零P(wi∣c)count(wi,c)α∑wcount(w,c)α∣V∣P(w_i|c) \frac{count(w_i, c) \alpha}{\sum_w count(w, c) \alpha |V|}P(wi​∣c)∑w​count(w,c)α∣V∣count(wi​,c)α​其中α\alphaα平滑参数α1\alpha1α1为标准拉普拉斯平滑α1\alpha1α1为利德斯通平滑∣V∣|V|∣V∣词表大小所有可能特征的维度分母加α∣V∣\alpha|V|α∣V∣是为了保证所有词的概率之和仍为 1∑wP(w∣c)1\sum_{w} P(w|c) 1∑w​P(w∣c)1为什么分母要加α∣V∣\alpha|V|α∣V∣∑w∈VP(w∣c)∑w∈Vcount(w,c)α∑wcount(w,c)α∣V∣∑wcount(w,c)α∣V∣∑wcount(w,c)α∣V∣1\sum_{w \in V} P(w|c) \sum_{w \in V} \frac{count(w,c) \alpha}{\sum_w count(w,c) \alpha|V|} \frac{\sum_w count(w,c) \alpha|V|}{\sum_w count(w,c) \alpha|V|} 1w∈V∑​P(w∣c)w∈V∑​∑w​count(w,c)α∣V∣count(w,c)α​∑w​count(w,c)α∣V∣∑w​count(w,c)α∣V∣​1概率的归一化性质得以保持。平滑效果情况无平滑拉普拉斯平滑α1词出现 0 次P0P 0P0P1Nc∣V∣P \frac{1}{N_c |V|}PNc​∣V∣1​极小但非零词出现 10 次P10NcP \frac{10}{N_c}PNc​10​P11Nc∣V∣P \frac{11}{N_c |V|}PNc​∣V∣11​略降词出现 1000 次P1000NcP \frac{1000}{N_c}PNc​1000​P1001Nc∣V∣P \frac{1001}{N_c |V|}PNc​∣V∣1001​几乎不变关键特性低频词包括零频词获得一个小的非零概率避免清零高频词概率几乎不受影响α\alphaα相对计数可忽略所有词的概率被略微拉平因此也叫加一平滑三、平滑参数 α 的影响P(wi∣c)count(wi,c)α∑wcount(w,c)α∣V∣P(w_i|c) \frac{count(w_i, c) \alpha}{\sum_w count(w, c) \alpha |V|}P(wi​∣c)∑w​count(w,c)α∣V∣count(wi​,c)α​α 值名称效果适用场景α 0无平滑零概率问题不应使用α 1拉普拉斯平滑标准加一平滑通用默认0 α 1利德斯通(Lidstone)平滑轻度平滑低频词概率更小特征空间大时α 1过度平滑概率分布趋于均匀一般不推荐α 越大 → 概率分布越均匀 → 区分力下降 α 越小 → 越接近原始分布 → 零概率风险增加 α 1 是精度与安全性的平衡点文本分类中的特殊考量文本分类词表∣V∣|V|∣V∣通常很大数万维分母中α∣V∣\alpha|V|α∣V∣项显著当∣V∣50000|V| 50000∣V∣50000α1\alpha 1α1时分母增加 50000若某类总词频Nc100000N_c 100000Nc​100000则分母变为 150000所有概率被压缩至原来的 2/3这使得α1 在大词表下可能过度平滑实践建议文本分类中常取α0.1\alpha 0.1α0.1甚至更小或通过交叉验证在{0.01,0.05,0.1,0.5,1.0}\{0.01, 0.05, 0.1, 0.5, 1.0\}{0.01,0.05,0.1,0.5,1.0}中选最优值。四、先验概率也需要平滑类别先验P(c)P(c)P(c)同样可能面临零概率某类别在训练集中无样本同样需要平滑P(c)NcαNαKP(c) \frac{N_c \alpha}{N \alpha K}P(c)NαKNc​α​其中KKK为类别数。不过当每个类别都有训练样本时先验概率的平滑影响较小。五、总结要点说明解决的问题训练集中未出现的词导致条件概率为零连乘清零整个类别概率核心公式P(w∣c)count(w,c)α∑count(w,c)α∣V∣P(w|c) \frac{count(w,c) \alpha}{\sum count(w,c) \alpha|V|}P(w∣c)∑count(w,c)α∣V∣count(w,c)α​本质思想“没见过” ≠ “不可能”给所有词一个小的非零概率下界关键约束分母加α∣V∣\alpha|V|α∣V∣保证概率归一化参数选择α1 为标准默认文本分类大词表下常取 α0.01~0.1适用范围条件概率和先验概率均需平滑拉普拉斯平滑的本质是用**“未观测到不等于不可能”**的贝叶斯思想修正最大似然估计的极端情况以极小的概率估计偏差换取了模型鲁棒性的大幅提升是朴素贝叶斯分类器不可或缺的组成部分。

本月热点