ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GBDT梯度提升树结果解读:迭代拟合与变量重要性

GBDT梯度提升树结果解读:迭代拟合与变量重要性 GBDT分类模型结果解读一、方法概述GBDTGradient Boosting Decision Tree是一种基于决策树的集成学习算法通过将多个弱分类器回归树进行迭代加权来提升模型的预测准确性。在每一次迭代中GBDT根据上一轮模型的预测结果计算残差并将残差作为下一轮模型的训练目标逐步减小预测误差。本研究利用SPSSAU软件对欺诈检测数据进行GBDT分类建模分析以评估该方法在欺诈识别任务中的有效性。在SPSSAU【机器学习】模块选择【GBDT】将变量拖拽至右侧对应分析框操作如下图二、数据概览本研究共纳入1000个样本以换设备次数、支付失败次数、换IP次数、换IP国次数、交易金额5项指标作为自变量以欺诈标签0非欺诈1欺诈作为因变量进行分类建模。因变量分布如下表所示由表1可知1000个样本中非欺诈样本标签0为600例占比60.00%欺诈样本标签1为400例占比40.00%。数据无缺失值全部纳入分析。由表2可知按照8:2的比例将数据划分为训练集800个样本占80.00%和测试集200个样本占20.00%用于模型训练与泛化能力评估。三、特征权重分析由表3可知GBDT模型的特征权重分布以行为特征为主导。换设备次数的权重最高为0.32532.53%对模型构建起关键作用。换IP国次数位居第二权重为0.25425.42%。交易金额的权重为0.17717.69%支付失败次数的权重为0.17617.64%两者权重几乎相同。以上四项特征的权重合计达到93.28%。换IP次数的权重为0.0676.72%贡献相对较小。值得注意的是GBDT模型中换设备次数和换IP国次数两项行为特征合计权重达57.95%表明设备更换和跨国IP变更是欺诈检测的重要信号。图1 GBDT特征权重分布图由图1可知GBDT的特征权重分布呈现两级分化格局换设备次数32.53%和换IP国次数25.42%构成第一梯队权重合计57.95%支付失败次数17.64%和交易金额17.69%构成第二梯队权重合计35.33%换IP次数6.72%的贡献最小。该分布表明在GBDT模型中用户行为模式的变化设备更换频率、IP国家变更是欺诈判别的首要依据。四、训练集模型评估由表4可知GBDT模型在训练集上表现出极高的拟合效果。整体准确率达到99.80%综合f1-score为0.997接近完美分类。非欺诈类0.0的精确率为0.996召回率为1.000f1-score为0.998欺诈类1.0的精确率为1.000召回率为0.994f1-score为0.997。训练集上的优异表现说明模型充分学习了数据中的分类模式。五、测试集模型评估由表5可知GBDT模型在测试集上的整体准确率为89.00%综合精确率为89.93%综合召回率为89.00%综合f1-score为0.886。相较于训练集准确率99.80%测试集性能有所下降存在一定的过拟合现象但整体分类效果良好。从各类别看非欺诈类0.0的精确率为0.861召回率为0.984f1-score为0.919召回率高达98.4%表明模型对非欺诈样本的覆盖能力极强。欺诈类1.0的精确率为0.964召回率为0.730f1-score为0.831。欺诈类精确率较高96.4%但召回率为73.0%约27%的欺诈样本未能被识别。该结果与CatBoost模型的测试集表现完全一致准确率89.00%f1-score0.886说明两种基于梯度提升的算法在本数据集上的泛化能力相当。六、模型参数汇总由表6可知GBDT模型采用deviance对数损失函数构建100棵回归树学习率为0.1树最大深度为6。样本采样率为1.0节点分裂最小样本数为2叶节点最小样本数为1模型收敛参数为0.001。模型在测试集上取得89.00%的准确率和0.886的f1-score。七、结论本研究基于SPSSAU平台利用GBDT算法对1000个欺诈检测样本进行分类建模分析。结果表明换设备次数32.53%和换IP国次数25.42%是最重要的两个欺诈判别特征两者权重合计57.95%。模型在测试集上的准确率为89.00%综合f1-score为0.886整体分类效果良好。GBDT的特征权重分布强调行为模式变化设备更换、IP国家变更的判别价值与CatBoost模型的测试集表现一致验证了梯度提升方法在该数据集上的稳定性。
返回列表