Как работает Многовариантный пространственный кластерный анализ (Ripleys K Function)
Инструмент Многовариантный пространственный кластерный анализ, основанный на K-функции Рипли, представляет собой еще один способ анализа пространственного распределения точечных данных об инцидентах. Отличительной особенностью этого метода от других в этом наборе инструментов (Пространственная автокорреляция и Анализ горячих точек) является то, что он обобщает пространственную зависимость (кластеризацию объектов или разброс объектов) в диапазоне расстояний. Во многих исследованиях анализа закономерностей объектов требуется выбор подходящего масштаба анализа. Например, для анализа часто требуется Диапазон расстояний или пороговое расстояние. При изучении пространственных закономерностей на различных расстояниях и в разных пространственных масштабах закономерности меняются, часто отражая преобладание определенных действующих пространственных процессов. K-функция Рипли иллюстрирует, как изменяется пространственная кластеризация или дисперсия центроидов объектов при изменении размера окрестности.
При использовании этого инструмента укажите количество расстояний для оценки и, при необходимости, начальное расстояние и/или приращение расстояния. Используя эту информацию, инструмент вычисляет среднее количество соседних объектов, связанных с каждым объектом; соседними объектами являются те, которые находятся ближе, чем оцениваемое расстояние. По мере увеличения расстояния оценки каждый объект, как правило, будет иметь больше соседей. Если среднее количество соседей для определенного расстояния оценки выше/больше, чем средняя концентрация объектов во всей исследуемой области, распределение считается кластеризованным на этом расстоянии.
Используйте этот инструмент, когда вас интересует, как кластеризация/рассеивание ваших объектов меняется на разных расстояниях (разных масштабах анализа).
Вычисления
Был предложен ряд вариаций оригинальной K-функции Рипли. Здесь реализовано распространенное преобразование K-функции, часто называемое L(d).
K-функция определяется следующим образом:
где \(d\) — расстояние, \(n\) равно общему количеству объектов, \(A\) представляет общую площадь объектов и \(k_{ij}\) — вес. Если поправка по границам отсутствует, то вес будет равен единице, когда расстояние между \(i\) и \(j\) меньше \(d\), и будет равен нулю для всех остальных случаев. Использование заданного метода поправка по границам приведет к небольшим изменениям \(k_{ij}\).
При преобразовании L(d) Ожидаемое значение K равно Расстоянию
Значения по умолчанию для Начальное расстояние и Приращение расстояния вычисляются следующим образом:
Мы всегда знаем Число диапазонов расстояний (значение по умолчанию составляет 10). Мы используем это значение итераций, чтобы вычислить Приращение расстояния по умолчанию, если оно не задано.
Мы изначально вычисляем значение Максимального расстояния как 25 процентов от максимальной длины экстента минимального ограничивающего прямоугольника вокруг входных объектов. Если Метод коррекции границ - Сократить область анализа, то Максимальное расстояние принимает значение, равное большему из двух: 25 % от максимальной длины экстента или 50 % от минимальной длины экстента минимального ограничивающего прямоугольника.
Если задано Начальное расстояние, Приращение расстояния равно (Максимальное расстояние - Начальное расстояние) / Итерации.
Если Начальное расстояние не задано, Приращение расстояния равно Максимальное расстояние / Итерации, а Начальное расстояние устанавливается равным значению Приращение расстояния.
Интерпретация результатов невзвешенной K-функции
Когда наблюдаемые значения К больше, чем ожидаемые значения К для определенного расстояния, в таком случае распределение более кластеризовано нежели случайно для обозначенного расстояния (масштаб анализа). Когда наблюдаемые значения К меньше, чем ожидаемые значения К, распределение более дисперсно нежели случайно для обозначенного расстояния (масштаб анализа). Когда наблюдаемые значения К больше, чем верхняя граница доверительного интервала (HiConfEnv), пространственную кластеризацию для данного расстояния можно считать статистически значимой. Когда наблюдаемое значение K меньше нижней границы доверительного интервала (LwConfEnv), пространственная дисперсия для этого расстояния статистически значима.
Когда Поле веса не задано, граница доверительного интервала конструируется посредством случайного распределения точек в пределах изучаемой области и для данного распределения вычисляется значение k. Каждое случайное перераспределение точек носит название "перестановка". Если к примеру, выбрано 99 перестановок, инструмент случайным выбором перераспределит набор из исходных точек 99 раз для каждой итерации. После 99-кратного распределения точек инструмент выбирает для каждого расстояния значения k, которые отклонились от ожидаемого значения k в большую и меньшую сторону на наибольшую величину; эти значения сформируют доверительный интервал. Границы доверительного интервала следуют (имеют такую же форму и положение) как и синяя линия, показывающая величины ожидаемых К для невзвешенных К.

Интерпретация результатов взвешенной K-функции
K-функция всегда оценивает пространственное распределение объектов относительно полной пространственной случайности (CSR), даже когда предоставлено Поле веса. Можно считать, что вес представляет собой количество совпадающих объектов в каждом местоположении объекта. Например, объект с весом 3 можно интерпретировать как 3 совпадающих объекта. Однако есть одно отличие: объект не может быть своим собственным соседом. Следовательно, вы получите другой результат для набора данных, в котором есть 3 отдельные совпадающие точки с весом 1 (все будут считаться соседями друг друга), чем для набора данных с одной точкой с весом 3 (объект не считается соседом для самого себя). Результаты взвешенной K-функции всегда будут более кластеризованными, чем результаты без поля весов. Полезно запустить K-функцию для точек без веса, чтобы получить базовую линию, показывающую, насколько кластеризация связана исключительно с местоположением объектов. Затем вы можете сравнить базовую линию с взвешенными результатами, чтобы получить представление о том, сколько дополнительной кластеризации или дисперсии добавляется, когда учитывается вес. Взвешенная K-функция показывает кластеризацию (рассеяние), которая превосходит (или уступает) кластеризацию, полученную из невзвешенного распределения. На самом деле, вместо CSR вы можете использовать результаты невзвешенной K-функции, чтобы представить ожидаемый шаблон (с ее собственной доверительной границы). В данном случае возможны две нулевые гипотезы:
Структура расположения взвешенных объектов не является значительно более кластеризованной (дисперсным), чем базовая структура расположения для этих объектов. Нулевая гипотеза отвергается, если наблюдаемые взвешенные результаты выходят за пределы доверительного интервала невзвешенных результатов.
Структура расположения взвешенных точек более кластеризована (дисперсно), чем могла быть. Вы отвергаете нулевую гипотезу, если наблюдаемые невзвешенные результаты попадают в доверительный интервал для взвешенных результатов K-функции.
Когда Поле веса определено, только значения весов случайным образом перераспределяются, чтобы рассчитать доверительные границы, в то время как местоположение точек остается фиксированным. По существу, когда Поле веса определено, местоположение остается фиксированным и инструмент оценивает кластеризацию значений объектов в пространстве. Поскольку результаты значительно обусловлены фиксированными местоположениями объектов, для взвешенного анализа K доверительный интервал обычно следует за или зеркально отражает красную линию наблюдаемого K.
Дополнительные ресурсы
Bailey, T. C., and A. C. Gatrell. Interactive Spatial Data Analysis. Longman Scientific & Technical, Harlow, U.K. 395 pp. 1995.
Boots, B., and A. Getis. Point Pattern Analysis. Sage University Paper Series on Quantitative Applications in the Social Sciences, series no. 07–001. Sage Publications. 1988.
Getis, A. Interactive Modeling Using Second-Order Analysis. Environment and Planning A, 16: 173–183. 1984.
Mitchell, Andy. The ESRI Guide to GIS Analysis, Volume 2. ESRI Press, 2005.