Поиск сходства (Инструменты Пространственная статистика)
Краткая информация
Определяет, какой из объектов-кандидатов имеет наибольшее сходство или наибольшее различие с одним или несколькими входными объектами на основе их атрибутов.
Более подробно о том, как работает инструмент Поиск сходства
Иллюстрация

Использование
Вам следует указать слой, содержащий значения Входных объектов для сопоставления и второй слой, который содержит значения Объектов кандидатов, из которого сопоставления будут получены. Часто эти значения находятся в том же векторном слое. Один из вариантов подразумевает создание двух отдельных наборов данных. Другой вариант - создать слои с двумя разными определяющими запросами, иногда это проще. Например, если у вас есть файл со сведениями о преступлениях, которые были совершены в прошлом месяце, и вы хотите найти все преступления, которые больше всего похожи на последние угоны автомобилей, вы можете сделать следующее:
Скопируйте слой, отображающий все преступления, на панель Содержание, чтобы сделать дубликат слоя. Затем измените имя слоя.
На переименованном слое создайте выборку или задайте определяющий запрос, чтобы найти последний случай угона автомобиля. Используйте этот слой для параметра Входные объекты для сопоставления.
Примените выборку или задайте определяющий запрос для исходного слоя, чтобы исключить из него последние автоугоны. Используйте этот слой для параметра Объекты-кандидаты.
Если есть несколько значений Входных объектов для сопоставления, то сопоставление будет основано на средних значениях Атрибутов интереса. Поэтому, например, если у вас есть два значения Входных объектов для сопоставления и одно из значений Атрибутов интереса является численностью населения, инструмент будет искать значения Объектов-кандидатов с населением, наиболее соответствующим среднему значению. Если значения населения равны 100 и 102, например, инструмент ищет кандидаты со значением около 101.
Примечание:
Если есть несколько значений Входных объектов для сопоставления, выберите аналогичные значения в параметре Атрибуты интереса. Если, например, первый объект имеет значение населения 100, а другой – 100 000 жителей, инструмент возьмет среднее от этих значений и будет искать кандидатов с населением около 50050. Это усреднённое значение не близко к численности ни одного из значений Входных объектов для сопоставления.
Значения Выходных объектов всегда содержат точки, если только значения Входных объектов для сопоставления и Объектов-кандидатов не являются полигонами или линиями. Создание полигональных или линейных значений Выходных объектов может замедлить производительность для больших наборов данных. Отметьте параметр Сократить выходные данные до точек, чтобы использовать точечную геометрию для улучшения производительности.
С помощью параметра Наибольшее или наименьшее сходство вы можете найти результаты, используя опции Наибольшее сходство или Наименьшее сходство, чтобы сопоставить значения Входных объектов для сопоставления. Иногда полезно увидеть оба варианта. Если вы введете 3 для параметра Число результатов и выберите Оба для параметра Наибольшее или наименьшее сходство, например, инструмент вернет три наиболее схожих и три наименее схожих объекта-кандидата.
- Любое найденное решение в Выходных объектах будет либо решением наибольшего сходства, либо, по крайней мере, похожим на целевые Входные объекты для сопоставления; одно решение не может быть тем и другим (и результаты решения не будут дублироваться в параметре Выходные объекты). Соответственно, когда вы выбираете Оба для параметра Наибольшее или наименьшее сходство, максимально возможное число сопоставленных результатов (Число результатов) будет равно половине Объектов-кандидатов. Если введенное значение для Числа результатов будет слишком большим, инструмент постарается сделать его максимально возможным.
Чтобы изучить пространственную закономерность или сходство, вы можете ранжировать сходство для всех Объектов-кандидатов. Для этого укажите 0 для параметра Число результатов. Инструмент определит количество корректных объектов в наборе данных кандидатов и запишет их все в Выходные объекты в порядке от наиболее до наименее похожего.
Опциями параметра Метод сопоставления являются Значения атрибута, Ранжированные значения атрибутов и Профили атрибутов.
Значения атрибутов – у наиболее похожих кандидатов будут наименьшие суммы среднеквадратических отклонений для всех значений Атрибутов интереса; перед вычислением разностей все значения будут стандартизированы.
Ранжированные значения атрибутов – наиболее похожие кандидаты будут иметь наименьшую сумму квадратов рангов для всех значений Атрибутов интереса. Параметр Выходные объекты включает эти суммы в поле
SIMINDEX(Сумма квадратов различий ранга).Профили атрибутов — вычисляется косинусный коэффициент подобия. Косинусный коэффициент подобия определяет те же связи среди стандартизованных значений атрибутов, а не пытается сопоставить значения. Например, есть четыре значения Атрибутов интереса с именами A1, A2, A3 и A4. A2 в два раза больше A1, A3 примерно равно A2, а A4 в три раза больше A3. Для Профилей атрибутов инструмент проверит кандидатов с похожими отношениями атрибутов: в два раза больше, примерно равно, а затем в три раза больше. Поскольку этот метод проверяет отношения атрибутов, вам нужно указать как минимум два значения Атрибутов интереса. Вы можете использовать метод косинусного подобия (Профили атрибутов) для поиска мест, похожих на Лос-Анджелес, но меньшего масштаба. Косинусный коэффициент подобия может иметь значения от 1.0 (полное сходство) до -1.0 (полное различие). Значение косинусного коэффициента подобия записывается в поле
SIMINDEX(Сходство по косинусу) параметра Выходные объекты.
Значения Атрибутов интереса должны быть числовыми и должны существовать (то же имя и тот же тип поля) в обоих наборах данных: Входные объекты для сопоставления и Объекты-кандидаты. При выборе параметра Атрибуты интереса инструмент перечислит все числовые поля, найденные в наборе данных Входные объекты для сопоставления. Если инструмент не находит соответствующие поля для Объектов-кандидатов, то появится предупреждение о том, что недостающие атрибуты будут исключены из анализа. Если исключены все значения Атрибутов интереса, то сопоставление не может быть выполнено, появится ошибка, говорящая о том, что инструмент не может выполнить требуемый анализ.
Все атрибуты, использованные для сопоставления, записываются в Выходные объекты. Параметр Поля для присоединения к выходным данным позволяет включить в выходную таблицу дополнительные поля. Поскольку числовые поля Атрибутов интереса не являются подходящими идентификаторами, вы можете присоединить поле имени или другого идентификатора для каждого найденного решения. Если вам нужно выбрать одно из нескольких найденных совпадений, вы также можете присоединить другие нечисловые атрибуты. Если искомое решение должно быть одним из нескольких типов землепользования, например, присоединение категорийного атрибута землепользования поможет вам найти решения, соответствующие запросу. Вы также можете включить дополнительные числовые атрибуты в выходную таблицу только в качестве справочника. Например, вы ищете подходящее место обитания для конкретного вида животного. Вы можете использовать известные местоположения обитания этих видов в качестве параметра Входные объекты для сопоставления. Вы можете выбрать Атрибуты интереса, которые связаны с успешным обитанием видов. И дополнительно вы можете присоединить числовой атрибут площади к значениям Выходных объектов, но не потому, что вы хотите точно найти такое же значение площади для целевого объекта, а потому что вы ищите решения с возможно большей площадью.
Все значения Входных объектов для сопоставления и найденные решения будут записаны в Выходные объекты с Атрибутами интереса и Полями для присоединения к выходным данным. Кроме того, в Выходные объекты будут добавлены следующие поля:
Имя поля
Псевдоним поля
Описание
Примечания
MATCH_IDMATCH_ID
Все целевые объекты слоя Входные объекты для сопоставления перечислены первыми, а в поле
MATCH_IDуказан их идентификатор OID или FID. Для найденных сопоставлений в этом поле указывается значение NULL.Если Выходные объекты представлены шейп-файлом, значения NULL обозначаются очень большим отрицательным числом (например, -21474836).
CAND_IDCAND_ID
Все решения для сопоставления записываются рядом, а это значение становится их OID или FID идентификатором. Целевые объекты слоя Входные объекты для сопоставления имеют значение NULL в этом поле.
Если Выходные объекты представлены шейп-файлом, значения NULL обозначаются очень большим отрицательным числом (например, -21474836).
SIMRANKРанг сходства
Когда вы выбираете значение Наибольшее сходство или Оба для параметра Метод сопоставления, все найденные решения получают ранг от наиболее до наименее схожих. Наиболее сходное решение получает значение ранга 1.
Это поле включается в Выходные объекты, когда вы выбираете Наибольшее сходство или Оба для параметра Метод сопоставления.
DSIMRANKРанг различия
Когда вы выбираете Наименьшее сходство или Оба для параметра Метод сопоставления, все найденные решения получают ранг от наименее до наиболее схожих. Наименее сходное решение получает значение ранга 1.
Это поле включается в Выходные объекты, когда вы выбираете Наименьшее сходство или Оба для параметра Метод сопоставления.
SIMINDEXСумма квадратов значений различия, Сумма квадратов различий ранга или Сходство по косинусу
В этом поле определяется количественное значение сходства с целевым объектом.
Когда вы задаете значений атрибутов для параметра Метод сопоставления, у поля будет псевдоним
Sum of Squared Value Differences.Когда вы задаете Ранжированные значения атрибутов для параметра Метод сопоставления, у поля будет псевдоним
Sum of Squared Rank Differences.Когда вы задаете Профили атрибутов для параметра Метод сопоставления, то у поля будет псевдоним
Cosine Similarity.
Для получения дополнительной информации о том, как вычисляются эти индексы, см. раздел Как работает Поиск сходства.
Если есть только одно значение Входных объектов для сопоставления, то целевым объектом будет этот объект. Если указано более одного Входного объекта для сопоставления, то целевой объект будет временным объектом, созданным на основе средних значений для всех значений Атрибутов интереса.
LABELRANKРанг отображения
Это поле используется только для целей отображения. Инструмент использует это поле для задания метода отображения результатов анализа по умолчанию.
Слой Выходных объектов автоматически добавляется в таблицу содержания с методом отображения по умолчанию, примененным к полю
LABELRANK. Применяемое отображение определяется файлом слоя в<ArcGIS Pro>\\Resources\\ArcToolBox\\Templates\\Layers. Способ отображения по умолчанию, если это необходимо, можно применить заново с помощью инструмента Применить символы слоя.Примечание:
По умолчанию размер выборки равен 10 000 записям. Если значение Число результатов больше значения по умолчанию, вам нужно увеличить размер выборки, чтобы отрисовать все результаты. Чтобы увеличить размер выборки, откройте панель Символы и щелкните вкладку Дополнительные опции символов
. Разверните Размер выборки и измените значение параметра Максимальный размер выборки.
Параметры
| Подпись | Объяснение | Тип данных |
|---|---|---|
|
Входные объекты для сопоставления |
Слой или выборка из слоя, который содержит объекты для сопоставления; вы ищите другие объекты, которые похожи на них. Если указано более одного объекта, сопоставление основывается на средних значениях атрибутов. Подсказка:Когда значения Входных объектов для сопоставления и Объектов-кандидатов поступают из одного слоя набора данных, вы можете сделать следующее:
|
Feature Layer |
|
Объекты-кандидаты |
Слой или выборка в слое, которая содержит объекты-кандидаты для сопоставления. Инструмент ищет среди этих кандидатов объекты с наибольшим сходством (или наибольшим различием) с Входными объектами для сопоставления. Подсказка:Когда значения Входных объектов для сопоставления и Объектов-кандидатов поступают из одного слоя набора данных, вы можете сделать следующее:
|
Feature Layer |
|
Выходные объекты |
Выходной класс объектов, содержащий записи для каждого из значений Входных объектов для сопоставления и для всех найденных сопоставленных объектов. |
Feature Class |
|
Сократить выходные данные до точек |
Определяет, будет ли геометрия параметра Выходные объекты сжата до точек, либо она будет совпадать с исходной геометрией (линии или полигоны) входных объектов, если значения параметров Входные объекты для сопоставления и Объекты-кандидаты являются линиями или полигонами. Этот параметр доступен только при условии наличия лицензии Advanced. При отметке этого параметра повысится производительность работы инструмента для больших линейных и полигональных наборов данных.
|
Boolean |
|
Наибольшее или наименьшее сходство |
Определяет, будут ли идентифицированы объекты, которые наиболее или наименее схожи со значениями Входные объекты для сопоставления.
|
String |
|
Метод сопоставления |
Будет ли сопоставление основываться на значениях, степенях или на отношениях между косинусами.
|
String |
|
Число результатов |
Число сопоставлений для поиска. Ввод нулевого значения, либо числа большего, чем общее число Объектов-кандидатов, приведет к ранжированию всех объектов-кандидатов. Значение по умолчанию равно 10. |
Long |
|
Атрибуты интереса |
Числовые атрибуты, представляющие критерий сопоставления. |
Field |
|
Поля для присоединения к выходным данным (Дополнительный) |
Поля, которые будут включены в Выходные объекты. Эти поля не используются для определения сходства, они будут включены в Выходные объекты как справочная информация. |
Field |
|
Масштабировать данные (Дополнительный) |
Указывает, будут ли значения каждого поля анализа масштабированы таким образом, чтобы среднее значение равнялось 0, а дисперсия — единице. Это масштабирование гарантирует, что каждому полю анализа будет присвоен равный приоритет в результатах. Масштабирование также устраняет влияние линейных единиц измерения; например, одни и те же данные, измеренные в метрах и футах, приведут к эквивалентному результату. В некоторых случаях, например, при использовании вложений, величина значений переменных связана с их важностью. Переменные такого типа не следует масштабировать.
|
Boolean |
Параметры среды
Выходная система координат, Географические преобразования, Текущая рабочая область, Временная рабочая область, Поддержка полноценных имен полей, Наличие выходных значений M, Разрешение M, Допуск M, Выходные данные содержат Z значения, Выходное Z-значение по умолчанию, Разрешение Z, Допуск Z, Разрешение XY, Допуск XY
Информация о лицензировании
- Basic: Ограниченные
Для использования параметра Сократить выходные данные до точек требуется лицензия Advanced. - Standard: Ограниченные
Для использования параметра Сократить выходные данные до точек требуется лицензия Advanced. - Advanced: Да