您所不了解的回归分析内容
回归分析用于理解、建模、预测和解释复杂现象。 它有助于解答诸如“为什么美国某些地区的考试成绩持续高于全国平均水平?”或“为什么城市中某些区域的住宅入室盗窃率如此之高?”之类的问题。 例如,您可以使用回归分析,通过收入、受教育程度以及健康食品可及性等一组相关变量来解释儿童肥胖症。
通常,回归分析有助于解答这些“为什么”的问题,以便您能采取相应的应对措施。 例如,如果您发现提供新鲜果蔬作为午餐的学校中儿童肥胖率较低,则可以利用该信息指导政策制定,并针对学校午餐计划做出决策。 同样,了解有助于解释高犯罪率的变量,可以使您对未来的犯罪做出预测,从而更有效地分配预防资源。
这些是人们通常会向您介绍的关于回归分析的内容。
但他们没有告诉您的是,寻找一组能够解答您的问题或解释您尝试建模的复杂现象的解释变量,往往并非易事。 儿童肥胖、犯罪、考试成绩以及几乎所有您希望使用回归分析进行建模的对象,都是十分复杂的课题,极少有简单的答案。 如果您曾经尝试构建过自己的回归模型,那么对此应该深有体会。
幸运的是,在运行广义线性回归 (GLR)工具时,系统会为您提供一组诊断指标,以帮助您确定模型是否已正确指定;只有正确指定的模型才是值得信赖的模型。 本文将审阅并解释其中几项需要通过的检查,以便您对自己的模型充满信心。 这些诊断指标以及可用于解决某些最常见回归分析问题的技术,是能够简化您工作的重要资源。
提示:
在理解下文介绍的信息后,您可能会决定使用探索性回归工具,以帮助您找到满足 GLR 方法所有要求的模型。
入门
选择您想要理解、预测或建模的变量是您的首要任务。 该变量被称为因变量。 在上述示例中,被建模的因变量即为儿童肥胖、犯罪和考试成绩。
接下来,您需要确定哪些因素可能有助于解释您的因变量。 这些变量被称为解释变量。 在儿童肥胖的示例中,解释变量可能是收入、受教育程度以及健康食品的可及性等因素。 您需要在此处开展研究,以确定所有可能重要的解释变量;请参考理论和现有文献、咨询专家,并始终信赖您的常识。 提前进行的初步调研将增加您找到优秀模型的几率。
选定因变量和候选解释变量后,您就可以开始分析了。 建议使用广义线性回归 (GLR) 或探索性回归开始您的回归分析,因为这些工具可以执行重要的诊断测试,以告知您是已找到有用的模型还是仍需开展部分工作。
GLR 工具会生成多个输出,包括回归残差图、图表和汇总报告。 回归残差图显示了模型的低估(预测不足)和高估(过度预测),分析该地图是寻找优秀模型的重要步骤。 汇总报告主要以数字形式呈现,其中包含了您在进行以下六项检查时需要使用的所有诊断指标。

六项诊断检查
检查 1:这些解释变量是否对我的模型有所帮助?
在参考理论和现有研究后,您需要确定一组候选解释变量。 您会有充分的理由将每个变量纳入模型中。 然而,在运行模型后,您会发现某些解释变量在统计上是显著的,而另一些则不显著。
您将如何确定哪些解释变量是显著的? GLR 工具会计算模型中每个解释变量的系数,并进行统计检验以确定该变量是否对模型有所帮助。 该统计检验会计算系数实际为零的概率。 如果系数为零(或非常接近零),则说明相关的解释变量对模型没有帮助。 然而,当统计检验对某个特定解释变量返回一个较小的概率(p 值)时,这表明系数为零的可能性极小(即概率极低)。 当概率小于 0.05 时,汇总报告中对应概率旁的星号表示相关解释变量对模型至关重要(换句话说,其系数在 95% 的置信度水平下具有统计学显著性)。 因此,您需要寻找与统计显著概率相关联的解释变量(即寻找带星号的变量)。
GLR 工具会同时计算每个解释变量的概率和稳健概率。 对于空间数据,您所建模的关系在整个研究区域内发生变化是十分常见的。 这些关系具有非平稳性特征。 当关系具有非平稳性时,您只能信赖稳健概率来确定某个解释变量是否具有统计学显著性。
您如何确定模型中的关系是否具有非平稳性? 汇总报告中包含的另一项统计检验是用于检验非平稳性的Koenker 诊断(Koenker 的学生化 Breusch-Pagan 统计量)。 Koenker p 值旁的星号表示您所建模的关系表现出统计学上显著的非平稳性,此时请务必参考稳健概率。

通常,如果解释变量在统计上不显著,您会将其从模型中移除。 然而,如果理论表明某个变量非常重要,或者该变量是您分析的重点,那么即使它不具有统计学显著性,您也可以选择保留它。
注:
在寻找正确指定的 GLR 模型的过程中,您可能会尝试使用各种不同的解释变量。 请注意,解释变量系数(及其统计显著性)可能会根据您在模型中包含的变量组合发生剧烈变化。
检查 2:这些关系是否符合预期?
确定解释变量是否对模型切实有所帮助固然重要,但您还需要检查与每个系数相关联的符号 (+/-),以确保其关系符合您的预期。 解释变量系数的符号指示了该关系是正相关还是负相关。 例如,假设您正在对犯罪行为进行建模,而其中一个解释变量是邻里平均收入。 如果收入变量的系数为负数,则意味着随着邻里收入的增加,犯罪率趋于下降(负相关关系)。 如果您正在对儿童肥胖进行建模,并且快餐可及性变量的系数为正,这表明儿童肥胖率随着快餐可及性的提高而增加(正相关关系)。
在创建候选解释变量列表时,您应该为每个变量列出预期的关系(正相关或负相关)。 如果模型所报告的关系与理论或常识不符,您将很难对该模型产生信任。 假设您正在构建一个用于预测森林火灾发生频率的模型,而您的回归模型对降水量变量返回了正系数。 您可能不曾预料到在降雨量充沛的地区森林火灾发生频率反而会增加。
系数符号不符合预期往往指示着模型存在其他问题,这些问题会随着您继续进行其他诊断检查而逐渐显现。 只有在您的模型通过了所有诊断检查的前提下,您才能信赖解释变量系数的符号和强度。 如果您确实找到了一个模型,尽管其系数符号不符合预期,但却通过了所有诊断检查,那么您可能发现了一个学习新知识的契机。 森林火灾发生频率与降水量之间可能确实存在正相关关系,因为在您的研究区域内,引发森林火灾的主要诱因是雷电。 尝试获取研究区域的雷电数据以查看是否能提高模型性能,这或许是值得的。
检查 3:是否存在冗余的解释变量?
在选择要包含在分析中的解释变量时,请寻找能够从不同方面探讨建模对象的变量;避免使用提供相似信息的变量。 例如,如果您试图对房屋价值进行建模,通常不会同时引入房屋面积和卧室数量这两个解释变量。 这两个变量都与房屋大小有关,同时包含两者可能会导致模型不稳定。 归根结底,包含冗余变量的模型是无法信赖的。
您如何确定两个或多个变量是否冗余? 幸运的是,只要存在两个以上的解释变量,广义线性回归 (GLR)工具就会为每个变量计算方差膨胀因子 (VIF)。 VIF 值是衡量变量冗余度的指标,可以帮助您确定可以从模型中移除哪些变量,而不会损害模型的解释能力。 通常情况下,VIF 值大于 7.5 即被视为存在问题。 如果您有两个或多个变量的 VIF 值高于 7.5,则应每次移除一个变量并重新运行 OLS,直到冗余消除。 请注意,您并不需要移除所有具有高 VIF 值的变量。 例如,在对房屋价值进行建模时,面积和卧室数量可能都会导致 VIF 值偏高。 然而,移除了这两个变量中的一个后,冗余即会消除。 包含一个反映房屋大小的变量至关重要,您只是不希望冗余地对房屋价值的这一方面进行建模。
检查 4:我的模型是否存在偏差?
这听起来可能很难回答,但答案其实非常简单。 如果拥有正确指定的 GLR 模型,则模型残差(高估值和低估值)应呈均值为零的正态分布(形如钟形曲线)。 然而,当模型存在偏差时,残差的分布是不均衡的,如下所示。 在模型存在偏差的情况下,您无法完全信赖预测结果。 有几种策略可以帮助您纠正此问题。

统计学上显著的 Jarque-Bera 诊断(寻找星号)表明您的模型存在偏差。 有时,模型在处理低值时表现良好,但对高值的预测却不尽人意(反之亦然)。 在儿童肥胖症的示例中,这意味着在儿童肥胖率较低的地区,模型运行效果较好,但在儿童肥胖率较高的地区,预测结果则会出现偏差。 模型偏差也可能是由影响模型估计的异常值(离群值)所导致的。
为帮助解决模型偏差,您可以为所有模型变量创建一个散点图矩阵。 因变量与其中一个解释变量之间的非线性关系是导致模型偏差的常见原因。 在散点图矩阵中,这些关系可能表现为一条曲线。 线性关系则表现为对角直线。

如果您发现因变量与某个解释变量之间存在非线性关系,则需要进行一些调整工作。 GLR 是一种线性回归方法,它假设您所建模的关系是线性的。 如果不是线性关系,您可以尝试对变量进行变换,以查看是否能建立起更具线性特征的关系。 常见的变换方式包括对数变换和指数变换。 如果某些解释变量呈极度偏斜分布,您或许也可以通过对其进行变换来消除模型偏差。

散点图矩阵也可以揭示数据中的异常值。 要确定异常值是否对模型产生了影响,可以尝试在包含和排除该异常值的情况下分别运行广义线性回归 (GLR),观察其对模型性能的改变程度,并检查移除异常值是否能纠正模型偏差。 在某些情况下(尤其是当您认为异常值代表错误或脏数据时),您可以直接从分析中删除这些异常值。

检查 5:我是否找到了所有关键的解释变量?
通常,在开始分析时,您会先假设哪些变量是重要的预测变量。 也许您认为 5 个特定变量就能构建出一个优秀模型,或者您有一份包含 10 个可能相关变量的确定清单。 虽然带着假设开展回归分析非常重要,但发挥您的创造力与洞察力进行更深层次的探究同样不可或缺。 请克制局限于初始变量列表的倾向,尽量考虑所有可能影响建模对象的潜在变量。 为每个候选解释变量绘制专题图,并将其与因变量地图进行对比。 审阅相关文献。 凭直觉在地图数据中寻找关联性。 尽量提出尽可能多的候选空间变量,例如距离城市中心的距离、与主要高速公路的接近度,或者到大型水体的距离。 如果您认为地理过程会影响数据中的相互关系,那么此类变量对于分析将尤为重要。 实际上,在找到能够有效捕获因变量空间结构的解释变量之前,您的模型将一直缺少关键解释变量,并且您将无法通过此处列出的所有诊断检查。
模型残差中出现具有统计学显著性的空间自相关,便是缺失一个或多个关键解释变量的证据。 在回归分析中,残差空间自相关问题通常表现为聚类形式:高估值(过度预测)聚集在一起,低估值(预测不足)也聚集在一起。 您如何确定模型残差中是否存在具有统计学显著性的空间自相关? 针对您的回归残差运行空间自相关工具,可以确定空间自相关是否存在问题。 统计上显著的 z 得分表明模型中遗漏了关键解释变量。
寻找这些缺失的解释变量往往既是一门艺术,也是一门科学。 请尝试以下策略,看看是否有帮助:
检查 GLR 残差图
广义线性回归 (GLR) 工具的标准输出是一幅回归残差图。 深紫色区域表示实际值(您的因变量)高于模型的预测值。 较深的绿松石色区域则表示实际值低于预测值。 有时,仅仅查看残差图就能提示您可能遗漏了哪些内容。 例如,如果您发现自己在城市化区域内持续高估,可以考虑添加一个反映到城市中心距离的变量。 如果过度预测似乎与山峰或谷底有关,也许您需要添加一个高程变量。 您是否能看到区域性聚类,或者能识别出数据中的趋势? 如果是这样,通过创建虚拟变量来捕获这些区域差异可能会非常有效。 虚拟变量的经典示例是区分城市和农村特征的变量。 通过为所有农村要素赋值为 1,为其他所有要素赋值为 0,您或许能够捕获景观中对模型可能很重要的空间关系。 有时,创建模型残差的热点图有助于将广泛的区域模式可视化。
找出缺失的空间变量不仅有可能改进您的模型,而且该过程还能帮助您以新颖而创新的方式更深入地理解所建模的现象。
注:
虽然在 GLR 模型中包含空间组织哑元非常有用,但在运行地理加权回归 (GWR) 时,您需要将其移除,以避免出现局部多重共线性问题。
检查非平稳性
您还可以尝试运行地理加权回归,并为每个解释变量创建系数表面,或创建局部 R2 值的地图。 选择性能良好的 GLR 模型(即调整后 R2 值较高且通过了全部或大部分其他诊断检查的模型)。 由于 GWR 会为研究区域中的每个要素创建回归方程,因此系数表面可用于说明因变量与每个解释变量之间的关系如何随地理位置变化而起伏;局部 R2 值的地图则显示了模型解释力的空间变化。 有时,观察这些地理变异会激发您关于可能遗漏了哪些变量的灵感:主要高速公路附近解释力的骤降、随着距离海岸越远而出现的解释力下降、工业区附近系数符号的改变,或者强烈的东西向趋势或边界——所有这些都提供了可能用于改进模型的空间变量信息。

检查系数表面时,请寻找系数符号由正变负(或由负变正)的解释变量。 这非常重要,因为 GLR 可能会忽略这些高度非平稳变量的预测潜力。 举例来说,考虑儿童肥胖症与健康食品获取途径之间的关系。 在汽车拥有率较低的低收入地区,远离超市可能是健康饮食选择的真实屏障。 然而,在拥有更多车辆的高收入地区,步行距离内有超市可能实际上是不受欢迎的;到超市的距离可能根本不会构成购买健康食品的屏障。 尽管 GWR 能够对这些复杂关系进行建模,但 GLR 却无法做到。 GLR 是一种全局模型,它期望变量关系在整个研究区域内保持一致(即具有平稳性)。 当系数符号相反时,它们便会相互抵消。 可以将其理解为 (+1) + (-1) = 0。 当您发现某些变量的系数发生了剧烈变化(特别是符号发生改变)时,即使它们在统计上不显著,也应该将它们保留在模型中。 在您后续过渡到 GWR 时,这类变量将会非常有效。
尝试将 GLR 拟合到更小的子集研究区域
GWR 在处理非平稳性时极为有用,以至于用户很容易被吸引直接转向 GWR,而未先寻找正确指定的 GLR 模型。 遗憾的是,GWR 并不具备所有的诊断功能来帮助您确定解释变量是否具有统计学显著性、残差是否呈正态分布,或者最终确定您是否拥有一个优秀的模型。 除非您能确定您的 GLR 模型未能通过这六项检查的唯一原因完全是由于非平稳性,否则 GWR 并不能修复未正确指定的模型。 存在非平稳性的证据往往是:某些解释变量在研究区域的某些部分表现出极强的正相关关系,而在其他部分则表现出极强的负相关关系。 有时,问题不在于单个解释变量,而在于模型中所使用的一整套解释变量。 有可能是:某一套变量可以为研究区域的某一部分提供一个优秀的模型,但另一套完全不同的变量在其外部区域表现最好。 为验证是否属于这种情况,您可以选择几个较小的子集研究区域,并尝试将 GLR 模型分别拟合到这些区域。 请根据您认为与模型相关的具体过程来选择子集区域(例如:高收入与低收入地区、旧住宅与新住宅区)。 或者,也可以根据 GWR 的局部 R2 值地图来选择区域;模型性能较差的位置如果使用另一套不同的解释变量,其建模效果可能会更好。
提示:
对于识别更大范围研究区域内的子区域,空间约束多元聚类工具会非常有用。
如果您确实在几个较小的子集区域中找到了正确指定的 GLR 模型,则可以断定非平稳性就是症结所在,并可以采用在所有子集区域模型中找到的完整解释变量集转向 GWR。 如果您在较小的子集区域中仍无法找到正确指定的模型,则说明您正试图建模的事物过于复杂,无法简化为简单的一系列数值测量和线性关系。 在这种情况下,您可能需要探索其他替代性的分析方法。
尽管所有这些步骤会带来一定的工作量,但对探索性数据分析而言,这也是一个极好的实践过程,有助于您更好地理解数据并发现可供使用的新变量。 它甚至可能帮助您构建出一个优秀的模型。
检查 6:我对因变量的解释程度如何?
现在是评估模型性能的时候了。 调整后 R2 值是衡量解释变量对因变量建模效果的重要指标。 R2 值通常也是大多数人在学习回归分析时最早接触的指标之一。 那么,为什么要把这一重要检查留在最后呢? 您可能不知道的是,除非您已经通过了上述所有诊断检查,否则您无法信赖计算出的 R2 值。 如果您的模型存在偏差,它可能在某些特定区域或因变量的某一特定数值范围内表现良好,但在其他情况下却表现得十分糟糕。 R2 值并不能反映出这种偏差 同样,如果残差空间自相关,您便无法信赖模型中的系数关系。 如果存在冗余的解释变量,您可能会得到极高的 R2 值,但此时模型是不稳定的;它无法反映出您试图建模的真实关系,甚至仅仅由于增加一个观测值,就会产生截然不同的结果。
然而,完成其他各项检查,并确信已满足了所有必需的标准后,即可通过评估调整后的 R2 值,来了解您的模型对因变量的解释程度了。 R2 值的范围在 0 到 1 之间,代表解释比例的百分比。 假设您正在对犯罪率进行建模,并找到了一个通过了上述全部五项检查、且调整后 R2 值为 0.65 的模型。 这说明,您模型中的解释变量可以解释犯罪率因变量 65% 的变化。 调整后 R2 值的优劣需要在一定程度上进行主观判定。 在某些科学领域,能够解释复杂现象的 23% 就已经非常令人兴奋了。 而在其他领域,R2 值可能需要接近 80% 或 90% 才能引起人们的注意。 无论何种情况,调整后 R2 值都有助于您评判模型的性能表现。
另一个帮助您评估模型性能的重要诊断指标是修正赤池信息准则 (AICc)。 AICc 值是比较多个模型时非常实用的度量指标。 例如,您可能会尝试使用几组不同的解释变量来对学生的考试成绩进行建模。 在一个模型中,您可能仅使用人口统计变量,而在另一个模型中,您可能会选择与学校和班级相关的变量,例如生均费用支出和师生比例。 只要所有要进行比较的模型其因变量都相同(在此示例中为学生考试成绩),您就可以利用每个模型的 AICc 值来确定哪一个模型性能更佳。 AICc 值越小的模型,对观测数据的拟合度就越好。
另外,请不要忘记…
在您一步步构建正确指定的回归模型时,请牢记,分析的最终目标是理解您的数据,并利用这种理解去解决问题、解答疑问。 事实上,即使您尝试了多个模型(无论变量是否经过变换)、探索了若干小型研究区域、分析了系数表面,仍可能无法找到一个正确指定的 GLR 模型。 但是,这一点至关重要,您依然在为所建模现象的现有知识体系做出贡献。 如果您假设的能够作为准确预测指标的模型最终在统计上根本不显著,那么发现这一事实也是极有价值的信息。 如果您认为影响显著的某个变量在某些区域呈正相关关系,而在其他区域呈负相关关系,那么了解这一事实无疑会加深您对该问题的理解。 您在此处所做的工作(即尝试使用 广义线性回归 (GLR) 寻找优秀的全局模型,然后应用 地理加权回归 (GWR) 来探索模型变量之间的区域变异)始终都将是非常有价值的。
有关回归分析的更多信息及实践教程,请参阅 https://www.esriurl.com/spatialstats。