局部异常值分析 (时空模式挖掘工具)
汇总
标识出空间和时间环境中的统计显著性聚类和异常值。 该工具是 Anselin Local Moran's I 统计的时空实现。
插图

用法
时空立方体中每个立方图格都有
LOCATION_ID、time_step_ID、COUNT值以及创建立方体时包含的所有汇总字段或变量。 与同一物理位置相关的条柱将共享同一位置 ID,这些条柱组合起来可表示时间序列。 与同一时间步长间隔相关的条柱将共享同一时间步长 ID,这些条柱组合起来可构成时间片。 每个条柱的计数值反映在相关时间步长间隔内出现在相关位置的事件或记录的数量。
此工具使用 Anselin Local Moran's I 统计 的时空实现来分析 netCDF 输入时空立方体中的变量。
输出要素将添加到内容窗格,并对所有分析位置的时空分析汇总结果进行渲染。 如果指定面分析掩膜,分析位置为落入分析掩膜范围内的位置;否则,分析位置为至少含有一个时间步长间隔的至少一个点的位置。

除了输出要素以外,工具运行过程中还将分析汇总以 消息 的形式写入地理处理窗格底部。 可将鼠标悬停在进度条上、单击弹出按钮
或展开地理处理窗格中的消息详细信息部分来访问消息。 您还可以通过目录窗格中的 地理处理历史记录 访问先前运行的工具对应的消息。局部异常值分析工具会标识出空间和时间环境中的统计显著性聚类和异常值。 有关默认输出类别定义和此分析工具所采用算法的详细信息,请参阅 局部异常值分析的工作原理。
为识别该时空立方体中的聚类和异常值,此工具使用了 Anselin Local Moran's I 统计 的时空实现,该统计考虑了相邻立方图格值上下文中每个立方图格的值。
要确定每个分析邻域中将包括哪些立方图格,工具首先要查找落在指定空间关系的概念化范围内的相邻立方图格。 然后,对于这些立方图格中的每个立方图格,包括位于上 N 个时间步长的相同位置的立方图格,其中 N 是指定的邻域时间步长值。
空间关系的概念化参数的选择应反映要分析的要素之间的固有关系。 对要素在空间中彼此交互方式构建的模型越逼真,结果就越准确。 有关建议概述,请参阅 选择空间关系的概念化:最佳做法。
默认空间关系的概念化为固定距离。 如果立方图格的质心落在邻域距离范围内并且其时间间隔在指定的邻域时间步长范围内,该立方图格将视为邻域。 如果未提供邻域距离值,将基于点数据的空间分布来计算邻域距离值。 如果未提供邻域时间步长值,该工具将使用默认值,即 1 个时间步长间隔。
相邻要素数参数可以覆盖固定距离选项的邻域距离,还可以扩展仅邻接边和邻接边拐角选项的邻域搜索。 在这些情况下,系统会将相邻要素数用作最小数值。 例如,如果将固定距离的邻域距离指定为 10 英里,并将相邻要素数参数指定为 3,所有立方图格至少会接收到 3 个空间相邻要素(即使必须增加邻域距离才能找到它们)。 只有在未达到最小相邻要素数时,才增加这些立方图格的距离。 同样,借助邻接选项,对于具有少于此相邻要素数目的条柱,将根据质心邻近性选择附加邻域。
邻域时间步长值是分析邻域中包括的时间步长间隔的数量值。 例如,如果立方体的时间步长间隔为三个月并且指定邻域时间步长为 2,则分析邻域中将包括指定的空间关系的概念化范围内的所有立方图格计数及其之前两个时间步长间隔(涵盖九个月的时间段)的所有相关立方图格。
排列可用于确定找到您所分析值的实际空间分布的可能性。 对于各个排列而言,各条柱周围的邻域值将随机进行重新排列,并会计算出 Anselin Local Moran's I 值。 结果即为值的参考分布,随后会将该参考分布与实际观测到的 Moran's I 进行比较,以确定在随机分布中查找到观测值的可能性。 默认为 499 次置换;然而,随机样本分布会随着置换的增加而改进,进而提高伪 p 值的精度。
如果将置换检验次数参数设置为 0,则结果为传统 p 值而不是伪 p 值。
该工具所采用的排列可利用具有多个 CPU(或多核 CPU)的系统来提高性能。 该工具将默认使用 50% 可用处理器运行;但是,可以使用 并行处理因子 环境增大或减小使用的 CPU 数。 在更大的时空立方体中或具有更大排列数目的工具运行中,处理速度的增量最为明显。
面分析掩膜要素图层可能包括一个或多个定义分析研究区域的面。 这些面将指出点要素可能发生的位置,还应该排除不可能存在点的区域。 例如,如果正在分析入室盗窃趋势,可以使用面分析掩膜来排除没有任何家庭的大湖、国家公园或其他区域。
面分析掩膜与输入时空立方体的范围相交,不会扩展立方体的尺寸。
如果用于设置研究区域的面分析掩膜的覆盖范围超过最初创建立方体时所使用的输入要素范围,可以使用面分析掩膜作为 范围环境 来重新创建立方体。 这将确保面分析掩膜所覆盖的全部区域都包括在局部异常值分析工具中。 创建立方体期间,将面分析掩膜用作 范围环境 设置,以确保立方体的范围与面分析掩膜的范围匹配。
该工具可使用时空立方体中各位置的下列属性来创建新的输出要素类。 以下字段可用于自定义输出的可视化。 有关其他分析结果的详细信息,请参阅 局部异常值分析的工作原理。
Number of OutliersPercentage of OutliersNumber of Low ClustersPercentage of Low ClustersNumber of Low OutliersPercentage of Low OutliersNumber of High ClustersPercentage of High ClustersNumber of High OutliersPercentage of High Outliers具有
No Spatial Neighbors的位置具有
Outlier in the Most Recent Time Step的位置Cluster Outlier Type和其他汇总统计
Cluster Outlier Type将始终指示置信度为 95% 的统计显著性聚类和异常值,并且仅具有统计显著性的条柱才能拥有此字段中的值。 该显著性可反映出 错误发现率 (FDR) 校正。输出要素类的默认渲染基于
CO_TYPE字段,并会显示统计显著性的位置。 它将会显示作为显著性高-高聚类、高-低异常值、低-高异常值、低-低聚类中一部分的位置,或曾经归类为多种类型的位置。为确保每个位置至少有一个时态邻域,不会在第一个时间片中计算 Local Moran's 指数。 但是,第一个时间片中的条柱值将包含在全局平均值的计算中。
通过运行局部异常值分析工具可将一些分析结果添加回 netCDF 输入时空立方体中。 在相邻立方图格环境中分析各个立方图格,以测量高值和低值的聚类,并识别出各个聚类中的所有空间和时间异常值。 该分析的结果为时空立方体中各立方图格的 Local Moran's I 指数、伪 p 值(如果未使用排列,则为 p 值)以及聚类或异常值类型 (
CO_TYPE)。添加到输入时空立方体的变量汇总如下:
变量名称
描述
维度
OUTLIER_{ANALYSIS_VARIABLE}_INDEX计算得出的 Local Moran's I 指数。
三个维度:时空立方体中每个立方图格对应一个 Local Moran's I 指数值。
OUTLIER_{ANALYSIS_VARIABLE}_PVALUEAnselin Local Moran's I 统计 伪 p 值或 p 值,用于测量 Local Moran's I 值的统计显著性。
三个维度:时空立方体中每个立方图格对应一个 p 值或伪 p 值。
OUTLIER_{ANALYSIS_VARIABLE}_TYPE结果类别类型可区分具有统计显著性的高值(高-高)聚类、低值(低-低)聚类、高值主要由低值围绕的异常值(高-低)以及低值主要由高值围绕的异常值(低-高)。
三个维度:时空立方体中每个条柱对应一个聚类或异常值类型。 立方图格基于 FDR 校正。
OUTLIER_{ANALYSIS_VARIABLE}_HAS_SPATIAL_NEIGHBORS表示具有空间邻域以及只依赖于时态邻域的位置。
两个维度:每个位置对应一个分类。 对不具有空间邻域的位置进行分析将致使计算仅依赖于时态邻域。
OUTLIER_{ANALYSIS_VARIABLE}_ZTRANz 得分,即该值偏离平均值的标准差数。
三个维度:时空立方体中每个条柱对应一个 z 得分值。
OUTLIER_{ANALYSIS_VARIABLE}_LAG空间滞后值。
三个维度:时空立方体中每个条柱对应一个空间滞后值。
参数
| 标注 | 说明 | 数据类型 |
|---|---|---|
|
输入时空立方体 |
包含要分析的变量的时空立方体。 时空立方体具有 |
File |
|
分析变量 |
要分析的 netCDF 文件中的数值变量。 |
String |
|
输出要素 |
输出要素类,包含被视为统计显著性聚类或异常值的位置。 |
Feature Class |
|
邻域距离 (可选) |
分析邻域的空间范围。 该值用于确定应将哪些要素一起分析以便访问本地时空聚类。 |
Linear Unit |
|
邻域时间步长 |
包含在分析邻域中的时间步长间隔数。 该值用于确定应将哪些要素一起分析以便访问本地时空聚类。 |
Long |
|
置换检验次数 (可选) |
伪 p 值计算对应的随机置换检验。 默认置换检验次数为 499。 如果选择 0 次置换检验,则会计算标准 p 值。
|
Long |
|
面分析掩膜 (可选) |
具有用于定义分析研究区域的一个或多个面的面要素图层。 例如,可使用面分析掩膜将大湖从分析中排除。 在输入时空立方体中定义并落在掩膜外的立方图格将不包括在分析中。 此参数仅适用于格网立方体。 |
Feature Layer |
|
空间关系的概念化 (可选) |
指定要素空间关系的定义方式。
|
String |
|
空间邻域数 (可选) |
用于指定邻域的最小数目或精确数目以包括在目标条柱的计算中的整数。 对于 K 最近邻,每个立方图格正好具有这个指定数量的相邻要素。 对于固定距离,每个立方图格将至少具有这么多的相邻要素(如有必要,邻域距离将临时增大以确保达到这么多的相邻要素)。 选中一个邻接概念化后,将向每个条柱分配至少该最小数目的相邻要素。 对于具有少于此相邻要素数目的条柱,将根据要素质心邻近性获得附加相邻要素。 |
Long |
|
定义全局窗口 (可选) |
Anselin Local Moran's I 统计数据工作原理为对根据每个条柱的邻域计算的局部统计数据与全局值进行比较。 可以使用此参数来控制用于计算全局值的条柱。
|
String |
环境
当前工作空间, 临时工作空间, 输出坐标系, 地理变换, 随机数生成器, 并行处理因子
特殊情况
- 随机数生成器
-
The Random Generator Type used is always Mersenne Twister.
许可信息
- 基本: 是
- 标准: 是
- 高级: 是