Оптимизированный анализ выбросов (Инструменты Пространственная статистика)
Краткая информация
Приведенный набор точек инцидентов или взвешенных объектов (точек или полигонов) создает карту статистически значимых горячих и холодных точек, а также пространственных выбросов на основе статистического показателя Anselin Локальный индекс Морана I. При этом выполняется оценка характеристик класса входных объектов для получения оптимальных результатов.
Узнайте больше о том, как работает оптимизированный анализ выбросов
Иллюстрация

Использование
Инструмент выявляет статистически значимые кластеры высоких значений (горячие точки) и низких значений (холодные точки), а также выбросы высоких и низких значений в ваших данных. Он автоматически агрегирует данные об инцидентах, определяет соответствующую шкалу анализа и корректирует как для множественного тестирования, так и пространственной зависимости. Этот инструмент обрабатывает ваши данные, чтобы определить настройки, которые помогут получить оптимальные результаты анализа кластеров и выбросов. Если вы хотите полный контроль над этими настройками, используйте инструмент Анализ кластеров и выбросов.
Примечание:
Данные об инцидентах представляют собой точки, отображающие события (преступления, дорожно-транспортные происшествия) или объекты (деревья, магазины), где основное внимание уделяется наличию или отсутствию, а не измеряемому атрибуту, связанному с каждой точкой.
Вычисленные для выполнения оптимального анализа кластеров и выбросов параметры отображаются в виде сообщений во время работы инструмента. Связанные рабочие процессы и алгоритмы описаны в разделе Как работает Оптимизированный анализ выбросов.
Инструмент создает новый Выходной класс объектов с новыми атрибутами, включающими локальный индекс I Морана (
LMiIndex), z-оценку, псевдо p-значение и тип кластера/выбросов (COType) для каждого объекта во Входном классе объектов. Он также содержит поле (NNeighbors), в которое записывается для каждого объекта число соседних объектов, включенных в вычисление.Выходные данные этого инструмента включают гистограмму, отображающую значение анализируемой переменной (либо Поле анализа, либо число инцидентов в каждом полигоне). Диаграмма доступна под выходным классом пространственных объектов на панели Содержание.
Область
COTypeвыявляет статистически значимые высокие и низкие кластеры (HHиLL), а также высокие и низкие выбросы (HLиLH), скорректированные для множественного тестирования и пространственной зависимости с помощью метода коррекции False Discovery Rate (FDR).Z-оценки и р-значения являются измерениями статистической значимости, которая определяет, можно ли отклонить нулевую гипотезу. В действительности, они показывают, насколько очевидное сходство (пространственная кластеризация) или несходство (пространственные выбросы) являются чем-то большим, нежели случайное распределение. P-значения и z-оценки в Выходном классе пространственных объектов не отражают коррекцию FDR (False Discovery Rate). Дополнительные сведения о z-оценке и p-значениях см. в разделе Что такое z-оценка? Что такое p-значение?](what-is-a-z-score-what-is-a-p-value.md)
Высокое положительное значение z-оценки для объекта свидетельствует, что окружающие объекты имеют схожие значения (либо низкие, либо высокие). Поле
COTypeв Выходном классе объектов будет содержать значение HH для статистически значимого кластера с высокими значениями и LL для статистически значимого кластера с низкими значениями.Малое отрицательное значение z-оценки (например, менее -3,96) для объекта свидетельствует о статистической значимости пространственных выбросов в данных. Поле
COTypeв Выходном классе объектов имеет значение HL для объекта с высоким значением, окруженного объектами с низкими значениями, и LH для объекта с низкими значениями, окруженного объектами с высокими значениями.В поле
COTypeвсегда указываются статистические значимые кластеры и выбросы на основании коррекции FDR с уровнем достоверности 95%. Только статистически значимые объекты имеют значения, указанные в полеCOType.Когда Входной класс объектов не имеет проекции (т.е. когда координаты заданы в градусах, минутах и секундах), или когда в качестве выходной системы координат используется Географическая система координат, расстояния в этих случаях будут рассчитываться с помощью хордовых измерений. Измерения хордовых расстояний применяются постольку, поскольку они могут быть быстро вычислены и дают очень хорошие оценки истинных геодезических расстояний, по крайней мере, для точек, расстояние между которыми в пределах порядка тридцати градусов. Хордовые расстояния основаны на эллипосиде вращения. Если взять две любые точки на поверхности Земли, то хордовым расстоянием между ними будет длина прямой линии, проходящей через трехмерное тело Земли и соединяющей эти две точки. Хордовые расстояния выражаются в метрах.
Внимание:
Следует обязательно производить проецирование ваших данных, если область исследования превышает 30 градусов. Хордовые расстояния не обеспечивают точных оценок геодезических расстояний, превышающих 30 градусов.
Входными объектами могут быть точки или полигоны. Для полигонов требуется Поле анализа.
Если Вы предоставляете Поле анализа, то оно должно содержать разные значения. Для математических расчетов этой статистики требуется, чтобы анализируемые переменные обладали некоторой вариабельностью; например, анализ не будет выполняться, если все входящие значения равны 1.
С Полем анализа этот инструмент подходит для всех данных (точки и полигоны), в том числе для выборочных данных. В действительности, этот инструмент эффективен и надежен даже в случаях, когда число объектов очень большое. Когда объектов много, инструмент получает больше информации для вычисления точных и надежных результатов. Когда объектов мало, инструмент по-прежнему будет работать, чтобы получить точные и надежные результаты, но у него будет меньше информации, с которой он может работать.
С точечными данными вам иногда может понадобиться анализ значений данных по каждому из точечных объектов, и следовательно, вы будете использовать Поле анализа. В других случаях вам будет нужно лишь получить оценку пространственных структурных закономерностей (кластеризацию) местоположений точек или инцидентов точек. Решение вопроса о том, добавлять ли Поле анализа или нет, зависит от исследуемой вами задачи.
Анализ точечных объектов с Полем анализа позволит вам получить ответ на такие вопросы, как: где сконцентрированы высокие и низкие значения?
Выбранное поле анализа может представлять следующее:
Количество (например, число ДТП на перекрестках)
Показатели (например, безработица в городах, где каждый город показан точечным объектом)
Средние (например, среднее значение результатов тестов по математике, проведенных во всех школах)
Индексы (например, оценка уровня потребительской удовлетворенности автодилерами по всей стране)
Анализ точечных объектов без добавления Поля анализа позволит вам определить места статистически значимой интенсивной или невысокой концентрации точек. Такой тип анализа поможет вам найти ответ на такие вопросы, как: В каком месте имеется много точек? В каком месте очень мало точек?
Если вы не будете использовать Поле анализа, инструмент соберет все ваши точки для их подсчета и использования в качестве поля анализа. Есть три возможных схемы агрегации:
Для Подсчета количества инцидентов внутри прямоугольной сетки и Подсчета количества инцидентов внутри гексагональной сетки вычисляется подходящий размер ячейки, использующийся для создания регулярной или гексагональной сетки, покрывающей точки инцидентов и вычисления числа точек в каждой ячейке. Если не существует векторного слоя Ограничивающие полигоны, определяющие места возможных инцидентов, то ячейки сетки с нулевым количеством точек удаляются, и анализируются только оставшиеся ячейки. При наличии векторного слоя ограничивающих полигонов сохраняются и анализируются все ячейки внутри ограничивающих полигонов. Количество точек для каждой полигональной ячейки используется в качестве поля анализа.
Примечание:
Хотя агрегация по сетке используется чаще, гексагональные сетки могут лучше подходить для определенных типов анализа.
Для Подсчет количества инцидентов внутри полигонов агрегации необходимо предоставить векторный слой Полигоны для агрегирования инцидентов по количеству. Инциденты точек, попадающие внутрь каждого полигона, будут посчитаны, и эти полигоны со связанным количеством инцидентов будут затем проанализированы. Опция Подсчет количества инцидентов внутри полигонов агрегации является подходящей стратегией агрегации, когда точки связаны с административными единицами, такими как участки, округа или школьные районы. Вы также можете использовать эту опцию, если вы хотите, чтобы изучаемая область оставалась одной и той же во время множественных анализов, чтобы воспользоваться преимуществом сравнения.
Для Замыкание ближайших инцидентов для создания взвешенных точек вычисляется расстояние замыкания и используется для агрегирования близлежащих точек инцидентов. Каждой агрегированной точке присваивается количество, отражающее число инцидентов, которые были замкнуты друг с другом. Агрегированные точки затем анализируются, при этом количество инцидентов используется в качестве поля анализа. Опция Замыкание ближайших инцидентов для создания взвешенных точек является подходящей стратегией агрегации, когда у вас есть много совпадающих или почти совпадающих точек, и вы хотите сохранить аспекты пространственной структурной закономерности исходных точечных данных.
Примечание:
Во многих случаях вы можете решить использовать опции Замыкание ближайших инцидентов для создания взвешенных точек, Подсчет количества инцидентов внутри прямоугольной сетки и Подсчет количества инцидентов внутри гексагональной сетки, чтобы узнать, результаты какой из них наилучшим образом отражают пространственную структурную схему исходных точечных данных. Решения с использованием сетки и шестиугольников могут искусственным образом разделить кластеры точечных инцидентов, но выходные данные при этом могут быть проще для интерпретации для некоторых пользователей, чем взвешенные выходные точечные данные. Хотя агрегация по прямоугольной сетке используется чаще, гексагональные сетки могут лучше подходить для определенных типов анализа.
Внимание:
Анализ точечных данных без указания Поля анализа имеет смысл только в том случае, если у вас есть все известные точечные инциденты, и вы можете быть уверены в отсутствии предвзятости анализируемого распределения точек. С отобранными данными вы почти всегда будете включать Поле анализа (если только у вас не будет особого интереса в пространственных структурных закономерностях схемы ваших данных).
Когда вы выбираете опцию Подсчет количества инцидентов внутри прямоугольной сетки или Подсчет количества инцидентов внутри гексагональной сетки для Метода агрегирования данных инцидентов, вы можете дополнительно предоставить векторный слой Ограничивающие полигоны, определяющие места возможных инцидентов. Когда не предоставлено никаких ограничивающих полигонов, инструмент не может узнать, должно ли расположение без инцидента иметь значение 0, указывающее, что инцидент возможен, но не произошел, или расположение должно быть удалено из анализа, поскольку инциденты никогда не происходят в данном расположении. Соответственно, если не существует ни одного ограничивающего полигона, то для анализа берутся только те ячейки, которые содержат как минимум один инцидент. Если такое поведение вам не подходит, вы можете предоставить векторный слой Ограничивающие полигоны, определяющие места возможных инцидентов, чтобы убедиться, что берутся все местоположения внутри ограничивающих полигонов. Прямоугольные или шестиугольные ячейки, в которых нет инцидентов, получат значение количества инцидентов, равное нулю.
Любые инциденты, не попадающие в Ограничивающие полигоны, определяющие места возможных инцидентов или в Полигоны для агрегирования инцидентов в количество, будут исключены из анализа.
Параметр Выполнение трансформации определяет количество перестановок, используемых при анализе. Выбор числа перестановок является компромиссом между точностью и временем обработки. Увеличение числа перестановок повышает точность, поскольку увеличивается диапазон возможных значений для вычисления псевдо p.
Перестановки используются для определения вероятности обнаружения фактического пространственного распределения анализируемых вами значений. Для каждой перестановки, значения, окружающие каждый объект, перераспределяются в случайном порядке, затем вычисляется значение локального индекса Морана I. Результат референсного распределения значений затем сравнивается с наблюдаемым индексом Морана I для определения вероятного нахождения наблюдаемого значения в случайном распределении. По умолчанию используется 499 перестановок; однако распределение случайной выборки улучшается при увеличении числа перестановок, что повышает точность псевдо p-значений.
Инструмент вычислит оптимальный масштаб анализа на основе характеристик ваших данных, но вы можете настроить масштаб анализа, задав параметр Диапазон расстояний в разделе Опции переопределения. Для объектов, у которых нет соседей в пределах указанного расстояния, Диапазон расстояний увеличивается таким образом, чтобы обнаружить хотя бы один соседний объект для включения в вычисления.
Вместо использования оптимальных по умолчанию настроек размера ячейки сетки и масштаба анализа, можно воспользоваться Опциями переопределения для установки Размера ячейки или Диапазона расстояния для анализа.
Опция Размер ячейки позволяет установить размер ячейки сетки, используемой для агрегирования ваших точечных данных. Например, можно использовать сетку с ячейками размером 50 на 50 метров. Если агрегирование выполняется по гексагональной сетке, Размер ячейки определяет высоту каждого шестиугольника, а ширина полученных шестиугольников будет равняться 2 высотам, деленным на квадратный корень из 3.

Вам необходимо использовать инструменты Углубленного анализа пространственно-временных закономерностей или инструмент Построить матрицу пространственных весов совместно с инструментом Анализ кластеров и выбросов, если вы хотите идентифицировать пространственно-временные горячие точки. Подробная информация о пространственно-временном кластерном анализе содержится в разделах Углубленный анализ пространственно-временных закономерностей или Пространственно-временной кластерный анализ.
Слои карты можно использовать для определения Входного класса объектов. Если в слое есть выборка, только выбранные объекты будут включены в анализ.
Слой Выходных объектов автоматически добавляется в таблицу содержания с методом отображения по умолчанию, примененным к полю
COType. Метод отображения определяется файлом слоя в<ArcGIS Pro>\\Resources\\ArcToolBox\\Templates\\Layers. Вы можете заново применить механизм отрисовки по умолчанию, если необходимо, с помощью инструмента Применить символы слоя.Внимание:
При использовании шейп-файлов, помните, что в них нельзя хранить пустые (null) значения. Инструменты или другие процедуры, создающие шейп-файлы из прочих входных данных, могут хранить значения NULL в виде 0 или оперировать ими как нулем. В некоторых случаях нули в шейп-файлах хранятся как очень маленькие отрицательные числа. Это может привести к неожиданным результатам. Дополнительные сведения см. в разделе Рекомендации по геообработке выходных данных шейп-файла.
Параметры
| Подпись | Объяснение | Тип данных |
|---|---|---|
|
Входные объекты |
Точечный или полигональный класс объектов, для которых будет выполняться анализ кластеров и выбросов. |
Feature Layer |
|
Выходные объекты |
Выходной класс объектов для представления полей с результатами. |
Feature Class |
|
Поле анализа (Дополнительный) |
Числовое поле (количество инцидентов, тяжести преступления, тестовые оценки и т.д.), которое должно быть оценено. |
Field |
|
Метод агрегирования данных инцидентов (Дополнительный) |
Метод агрегирования, используемый для создания объектов с весами для анализа из данных точек инцидентов.
|
String |
|
Ограничивающие полигоны, определяющие места возможных инцидентов (Дополнительный) |
Полигональный класс объектов, определяющий, где может произойти инцидент из Входных объектов. |
Feature Layer |
|
Полигоны для агрегирования инцидентов в блоки (Дополнительный) |
Полигоны, используемые для агрегирования Входных объектов инцидентов с целью получения количества инцидентов для каждого полигона. |
Feature Layer |
|
Выполнение трансформации. (Дополнительный) |
Произвольное базовое распределения для анализа создается с использованием перестановок. Выбор числа перестановок является компромиссом между точностью и временем обработки. Выберите предпочтительные для вас скорость и точность. Для более значимых и точных результатов требуется больше времени.
|
String |
|
Размер ячейки (Дополнительный) |
Размер ячейки сетки, используемой для агрегирования Входных объектов. При агрегации в гексагональную сетку, это расстояние используется в качестве высоты для построения гексагональных полигонов. |
Linear Unit |
|
Диапазон расстояний (Дополнительный) |
Пространственный экстент области анализа соседей. Это значение определяет, какие объекты будут проанализированы вместе, чтобы оценить локальную кластеризацию. |
Linear Unit |
Параметры среды
Выходная система координат, Географические преобразования, Текущая рабочая область, Временная рабочая область, Поддержка полноценных имен полей, Наличие выходных значений M, Разрешение M, Допуск M, Выходные данные содержат Z значения, Выходное Z-значение по умолчанию, Разрешение Z, Допуск Z, Разрешение XY, Допуск XY, Генератор случайных чисел
Особые случаи
- Выходная система координат
-
Feature geometry is projected to the Output Coordinate System prior to analysis. All mathematical computations are based on the Output Coordinate System spatial reference. When the Output Coordinate System is based on degrees, minutes, and seconds, geodesic distances are estimated using chordal distances.
- Генератор случайных чисел
-
The Random Generator Type used is always Mersenne Twister.
Информация о лицензировании
- Basic: Да
- Standard: Да
- Advanced: Да
Связанные разделы
- Обзор группы инструментов Картографирование кластеров
- Моделирование пространственных отношений
- Что такое z-оценка? Что такое p-значение?
- Пространственные веса
- Пространственная автокорреляция (Глобальный индекс Морана I)
- Как работает оптимизированный анализ выбросов
- Анализ кластеров и выбросов (Anselin Локальный индекс Морана I)
- Анализ горячих точек (Getis-Ord Gi*)
- Оптимизированный анализ горячих точек
- Поиск инструмента геообработки