Skip to main content

如何评估变量对预测的影响

预测变量影响评估工具用于评估解释变量对基于森林的增强分类与回归工具生成的空间统计模型文件(.ssm)内预测值的作用程度。 您必须提供包含与训练输入模型文件所用解释变量相同的输入要素,并确保解释变量字段、距离要素和解释栅格相匹配。 该工具将生成一张输出表,表内包含图表与数值,可展示各变量对预测值的影响以及二者关联关系的形态。

普通最小二乘法(OLS)、逻辑回归等传统回归模型,通过回归系数解释变量带来的影响。 举例来说,普通最小二乘法的系数可反映单一解释变量升高时,预测值的增减幅度;逻辑回归系数则代表分类预测场景下优势比的变动情况。 但机器学习模型大多属于非线性模型,不存在简易系数,无法直观体现不同解释变量取值下预测值的变动规律。 可视化各解释变量对预测值影响程度的通用方式为绘制部分依赖性图。

部分依赖性图

部分依赖性图用于展示单一解释变量取不同数值时,预测值的平均变动幅度,其余所有解释变量的取值均保持固定不变。 例如在普通最小二乘法模型中,部分依赖性图呈现为一条直线,直线斜率等于回归系数。 但机器学习模型的变量关联为非线性关系,因此预测值会随解释变量区间发生不同变化:部分区间内上升、部分区间内下降,或是呈现其他更为复杂的曲线形态。

例如,下图展示了因变量随解释变量不同取值的响应变化规律。 解释变量取极大值与极小值时,平均预测值相对更高;取中间区间值时,平均预测值相对更低。

部分依赖性图

注:

解释变量的部分依赖性图构建逻辑为:对该解释变量取多组不同值进行预测,同时保持其余所有解释变量的取值固定为原始值。 针对每个测试取值,工具会计算全部输入要素的预测值,再求取平均值。 随后将平均值与解释变量的测试取值一一对应,绘制成曲线。

连续解释变量

连续变量部分响应图表用于展示每个连续解释变量的部分依赖性图。 解释变量的取值显示于 x 轴,平均预测值显示于 y 轴。

连续解释变量的部分依赖性图。

所有连续解释变量展示在左侧网格中,点击任意变量即可在右侧查看对应的独立图表。 网格内的所有图表共用统一的 y 轴刻度,便于对比各变量的影响效果。

分类解释变量

分类变量部分响应图表用于展示每一个分类解释变量对应的部分依赖性图。 x 轴展示分类变量下各个类别,y 轴展示平均预测值。

例如,下图展示了两组分类解释变量(颜色、类型)的部分依赖性图。 针对颜色变量:蓝色对应的预测值偏低,红色对应的预测值更高,绿色对应的数值略高于蓝色。 同理,C 类对应的预测值更低,A 类与 D 类对应的预测值更高。

分类解释变量的部分依赖性图。

分类因变量

当因变量为分类变量(即分类模型)时,部分依赖性图将展示各变量对分类为每个类别概率的影响。 默认状态下,每张图表的 y 轴会展示要素被划分为第一类的平均概率,您可在图表属性面板中修改图表展示的目标类别。 在数据选项卡中,单击数值字段下的选择按钮,然后选择要显示的类别。 每次仅开启一个类别,以使图表能正确显示部分依赖性图。

在图表属性面板中切换展示类别。

最佳做法和限制

以下是使用此工具时的最佳做法和限制:

  • 部分依赖性图的前提假设为所有解释变量相互独立。 部分依赖性图可单独展示单个解释变量的作用效果;但当多个变量存在相关性、存在共有信息时,图表无法区分各变量独立带来的影响。 该现象与传统回归模型中的多重共线性问题类似。