一、XGBoost所属模块

XGBoost在SPSSAU中属于【机器学习】模块。

二、方法概述

XGBoost是一种常用的集成学习方法,既可用于分类,也可用于回归。它适合变量较多、关系较复杂的场景,常用于预测建模、效果识别以及变量重要性判断。

三、变量设置规则

1. 总体要求

XGBoost共需要设置2类变量,分别是分析项(X定量)和因变量Y。两类变量都为必填。

2. 具体设置

(1)分析项(X定量)

● 最少放入1个,最多可放入400个变量,且为必填。

● 用于放入模型的输入特征,也就是参与分类或预测判断的定量变量。

(2)因变量Y

● 只能放入1个变量,且为必填。

● 用于放入模型要预测的目标变量。若Y为类别数据,通常对应分类任务;若Y为定量数据,通常对应回归任务。

四、参数设置及解释说明

1. 训练集比例

● 用于设置总样本中有多少比例参与模型训练,默认值为0.8。

● 训练样本越多,模型学习通常越充分;但测试样本会相应减少。一般可先使用默认设置。

2. 数据归一化

● 可选None、norm、mas、mms。

● None表示不处理;norm表示正态标准化;mas表示区间化;mms表示归一化。

● 如果不同变量量纲差异较大,通常可考虑进行处理,以减少尺度差异对模型训练的影响。

3. 保存预测值

● 勾选后会额外保存预测信息。

● 分类任务下通常会保存预测类别和各类别预测概率;回归任务下会保存预测值。

4. 保存训练测试标识

● 勾选后会生成训练集和测试集标识,其中训练集记为1,测试集记为2。

● 适合后续检查样本划分情况,也便于把结果写回原始数据继续使用。

5. 交叉验证

● 默认不进行,也可以选择2折、3折、5折或10折。

● 交叉验证用于反复检验模型稳定性,折数越高,结果通常更稳,但计算时间也会更长。

6. 提开器类型

● 可选树模型、线性模型和DART算法。

● 树模型适用于大多数常见情况;当特征数量明显多于样本量时,可考虑线性模型;数据集较大时也可考虑DART算法,但需要注意过拟合风险。

7. 学习器数量

● 用于设置模型构建时所使用的学习器数量,默认值为100。

● 数量越多,模型通常能学到更多信息,但计算时间也会增加。

8. 学习率

● 该参数表示模型参数更新的步长,默认值为0.1。

● 数值越小,模型更新越谨慎,通常需要更多迭代;数值较大时训练更快,但稳定性可能下降。

9. 树最大深度

● 用于控制每棵树的最大深度,默认值为6。

● 深度越大,模型对数据关系拟合得越充分,但也更容易出现过拟合。

10. 样本采样率

● 用于设置训练每棵树时所使用的样本比例,默认值为1.0。

● 如果适当降低该数值,通常有助于减少过拟合风险。

11. 特征采样率

● 用于设置训练每棵树时所使用的特征比例,默认值为1.0。

● 适当降低该参数,通常有助于增加模型多样性,也可帮助缓解过拟合。

12. 最小子节点权重

● 表示树的每个叶子节点上所有样本权重和的最小值,默认值为1.0。

● 数值越大,模型分裂通常会更保守,有助于减少过度拟合。

13. 分裂收益阈值

● 用于衡量每次节点分裂是否值得继续,默认值为0.0。

● 该值越高,模型越不容易进行额外分裂,因此能在一定程度上控制节点过度分裂。

14. L1正则化

● 用于通过增加约束来防止过拟合,默认值为0.0。

● 该值越大,模型权重通常越稀疏,也更有利于特征筛选。

15. L2正则化

● 用于通过增加约束来防止过拟合,默认值为1.0。

● 该值越大,模型权重通常会被压缩得更多,从而帮助提升模型稳定性。

16. 任务类型

● 可选自动判断、分类任务和回归任务,默认是自动判断。

● 如果因变量类型非常明确,系统通常可以自动识别;若希望强制按分类或回归方式运行,也可手动指定。

五、分析结果表格及其解读

SPSSAU完成XGBoost分析后,会根据任务类型和参数情况输出不同结果表,常见包括基本信息汇总、特征权重值、模型评估结果、训练集模型评估结果、交叉验证模型评估结果、测试集模型评估结果、模型汇总表和数据集情况。

1. 表1:XGBoost基本信息汇总或XGBoost分类基本信息汇总

这张表用于展示样本总体情况。分类任务下会呈现各类别频数与占比;回归任务下会呈现有效、缺失和总计情况。

● 频数:表示每个类别或状态对应的样本数量。样本过少的类别,后续识别结果通常更不稳定。

● 百分比:表示对应样本在总体中的占比。若类别分布不均衡,模型可能更偏向样本量较大的类别。

● 有效样本:表示真正参与建模的数据量。有效样本越充分,结果通常越可靠。

● 缺失样本:表示未进入建模的数据量。若缺失占比较高,需要更谨慎看待结果代表性。

2. 表2:特征权重值

该表格在输出相关结果时出现,用于展示各分析项在模型中的相对重要性。不同提开器类型下,呈现方式可能不同。

● 项或分类:用于标识进入模型的变量,或不同类别下对应的权重结果。

● 权重值:表示该变量对模型结果的相对贡献。通常数值越大,说明该变量越重要;数值越小,说明影响相对有限。

3. 表3:模型评估结果或训练集模型评估结果

这部分表格用于判断模型在训练阶段的表现。回归任务下通常包含R方值、MAE、MSE、RMSE、MAD、MAPE、EVS、MSLE等指标;分类任务下通常包含精确率、召回率、f1-score和样本数。

● R方值:用于衡量模型解释结果变化的能力,通常越接近1越好;若数值较低,说明模型拟合能力有限。

● MAE:表示平均误差水平,越接近0越好,越小说明预测偏差越小。

● MSE:表示误差平方后的平均水平,越接近0越好,对较大的预测偏差更敏感。

● RMSE:表示整体误差水平,越小越好,便于直观理解预测偏差大小。

● MAD:表示中位数绝对误差,对异常值不那么敏感,越小越好。

● MAPE:表示平均百分误差,越小越好,适合观察相对误差水平。

● EVS:表示模型对数据波动的解释力度,通常越接近1越好。

● MSLE:表示对数误差水平,越小越好,可作为辅助参考。

● 精确率:表示模型判定为某类时有多大概率判对,越高越好。

● 召回率:表示某类别真实样本被识别出来的比例,越高越好。

● f1-score:综合反映精确率与召回率的平衡情况,越高越好。

● 样本数:表示对应类别参与评估的样本量,样本量过少时,该类指标波动可能更大。

4. 表4:交叉验证模型评估结果或测试集模型评估结果

交叉验证模型评估结果仅在开启交叉验证时输出,用于观察模型在重复划分训练数据后的稳定表现;测试集模型评估结果用于判断模型在未参与训练的数据上的实际表现。

● 如果交叉验证结果与训练集结果接近,通常说明模型稳定性较好。

● 如果测试集表现明显弱于训练集,通常说明模型在新样本上的泛化能力一般,后续可考虑调整参数或优化数据。

5. 表5:模型汇总表

该表格用于集中展示模型参数设置及模型评估效果,便于快速回顾本次分析方案。

● 参数名:表示本次分析采用的参数项目。

● 参数值:表示对应参数的实际设定,作用是帮助复现实验过程。

● 模型评估效果:用于汇总关键效果指标。若准确率及综合平均指标较高,通常说明模型整体表现较好。

6. 表6:数据集情况

该表格用于展示训练集、测试集、预测集和缺失数据的数量与占比。

● 训练集:用于模型学习,比例过低时模型可能学得不充分。

● 测试集:用于检验模型实际效果,过少时评估稳定性可能不足。

● 预测集:表示仅用于生成预测结果的数据。

● 缺失数据:表示未能进入分析的数据量,若占比偏高,需要关注数据完整性问题。

六、分析结果图表及其解读

SPSSAU完成XGBoost分析后,在输出单列特征权重时通常会生成特征权重图;在分类任务下,还会输出测试集结果混淆矩阵。

1. 图1:特征权重图

该图表本质上是条形图,用于直观展示各特征在模型中的相对重要性。

● 条形越长,通常说明该特征对模型结果影响越大。

● 如果少数变量明显高于其他变量,说明模型更依赖这些关键特征。

2. 图2:测试集结果混淆矩阵

该图表在分类任务下输出,用于查看真实类别与预测类别之间的对应关系,是判断分类效果的直观图形。

● 如果对角线位置数值更集中、更高,通常说明模型分类更准确。

● 如果非对角线位置数值较多,说明某些类别更容易被混淆。

以上就是SPSSAU XGBoost的相关内容,更深入教程可查看SPSSAU帮助手册、教学视频、疑难解惑等资料。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐