
决策树分类分析结果解读决策树Decision Tree是机器学习中一种直观且易于理解的非监督学习方法其结构类似于树形图包含一个根节点、若干个内部节点和若干个叶节点。每个内部节点对应一个属性测试叶节点对应一个分类结果从根节点到叶节点的每条路径代表一条分类规则。决策树通过递归地将样本集合按照特征值进行划分使得每个子集中的样本尽可能属于同一类别。决策树具有可解释性强、无需数据预处理等优点但容易出现过拟合问题可通过剪枝技术加以缓解。本研究基于SPSSAU平台采用CART决策树算法对鸢尾花数据集进行三分类建模分析。在SPSSAU【机器学习】模块选择【决策树】将变量拖拽至右侧对应分析框操作如下图一、数据基本信息本次分析采用鸢尾花Iris数据集共包含150个样本分为刚毛鸢尾花A、变色鸢尾花B和弗吉尼亚鸢尾花C三类每类各50个样本各占33.333%。自变量为X1、X2、X3、X4四个特征指标因变量Y为鸢尾花类别。数据集无缺失值三类样本完全均衡适合进行决策树分类建模。从表1可以看出150个样本全部有效三类鸢尾花各50个类别分布完全均衡为决策树模型的训练和评估提供了良好的数据基础。二、特征权重分析从表2特征权重可以看出各特征对决策树模型分类的贡献呈现高度集中的特点。X4的权重高达92.20%是模型分类的绝对核心特征说明花瓣宽度是决策树区分三类鸢尾花最重要的判据X3的权重为4.73%X1的权重为3.07%两者对分类的贡献较小X2的权重为0.00%表明该特征在决策树的节点分裂过程中未被选用对分类没有产生实质性贡献。X4单独贡献了超过90%的模型权重这与决策树倾向于选择区分度最高的特征进行根节点分裂的特性一致。三、决策树结构分析图1 决策树结构图从图1决策树结构图可以看出决策树从根节点开始通过一系列节点分裂规则对鸢尾花样本进行分类。根节点包含全部训练样本采用gini系数衡量节点纯度。每个内部节点显示分裂所用的属性名称及分裂阈值gini值表示该节点的纯度指标gini值越低表示节点纯度越高samples表示该节点包含的样本数量value显示各类别在该节点中的样本分布class表示该节点的最终分类结果。从决策树结构可以清晰地看出X4花瓣宽度在树的顶层分裂中发挥了关键作用这与特征权重分析中X4权重高达92.20%的结果一致。四、模型评估结果数据集按8:2的比例划分为训练集120个样本和测试集30个样本。从表3训练集评估结果来看决策树模型在训练集上达到了100%的准确率三个类别的精确率、召回率和f1-score均为1.000实现了完美分类。这是因为决策树在不限制树深度的情况下能够持续分裂节点直至每个叶节点中的样本完全属于同一类别从而在训练集上达到完美的拟合效果。从表4测试集评估结果来看决策树模型在测试集上的整体准确率为93.33%综合精确率为93.33%综合召回率为93.33%综合f1-score为0.933模型效果较优。刚毛鸢尾花A继续保持完美分类精确率和召回率均为1.000变色鸢尾花B的精确率和召回率均为0.923有1个B类样本被误判弗吉尼亚鸢尾花C的精确率和召回率均为0.833有1个C类样本被漏判且1个非C类样本被误判为C类。训练集准确率100%与测试集准确率93.33%之间存在约6.7个百分点的差距说明决策树在不限制深度的情况下存在一定程度的过拟合但测试集表现仍然较好。五、模型参数设置与数据集划分从表5可以看出本次决策树分析采用gini系数作为节点分裂标准节点划分方式为best最优划分树最大深度不做限制允许决策树充分生长直至叶节点完全纯净。节点分裂的最小样本数为2叶节点最小样本数为1。数据未进行额外预处理。模型最终在测试集上的准确率为93.33%综合f1-score为0.933。从表6可以看出150个样本中120个80%分配至训练集30个20%分配至测试集无预测集和缺失数据。六、结论本研究利用SPSSAU平台采用CART决策树算法对150个鸢尾花样本进行三分类建模分析采用gini系数作为节点分裂标准树最大深度不做限制。分析结果表明X4权重92.20%是鸢尾花分类的绝对核心特征X34.73%和X13.07%贡献较小X2未产生贡献0.00%。决策树在训练集上达到了100%的完美分类测试集准确率为93.33%综合f1-score为0.933整体分类效果较优。训练集与测试集之间存在约6.7个百分点的准确率差距说明不限制深度的决策树存在一定程度的过拟合后续可通过设置最大深度、最小叶节点样本数或采用剪枝策略来改善泛化能力。决策树以其直观的可解释性和良好的分类效果在鸢尾花分类任务中展现了独特的优势。