Skip to main content

Как работает инструмент Вычислить составной индекс

Индекс — это параметр, который измеряет предмет интереса, часто это что-то, что трудно непосредственно измерить или определить, например, социальная уязвимость или бизнес-инновации. Инструмент Вычислить составной индекс создает индекс путем сочетания нескольких переменных в одну. В этом инструменте используется рабочий процесс из трех этапов для предварительной обработки переменных, объединения переменных и последующей обработки индекса.

Рабочий процесс создания индекса

Надлежащее построение индекса зависит от корректного определения его назначения в ходе разработки и прозрачности процесса во время коммуникации. Инструмент Вычислить составной индекс пошагово проводит вас по процессу создания корректного индекса и помогает визуализировать и интерпретировать результаты.

Подробнее о рекомендациях по созданию составных индексов в ArcGIS

Возможное применение

Ниже приведены потенциальные возможности применения инструмента Вычислить составной индекс:

  • Отдел по охране окружающей среды хочет вычислить индекс качества воздуха для информирования органов управления и жителей об уровне загрязнения воздуха. Они собирают данные со станций мониторинга, соответствующих критериям загрязняющих веществ. Аналитик может запустить инструмент Вычислить составной индекс, чтобы объединить индикаторы отдельных загрязнителей в единый индекс качества воздуха.

    Создание индекса качества воздуха

  • Департамент здравоохранения хочет создать индекс риска для здоровья дыхательных путей, чтобы выявить наличие неравенства в отношении окружающей среды. Для этого аналитик может запустить инструмент Вычислить составной индекс несколько раз, чтобы создать индекс с несколькими суб-индексами, при этом в ходе первого запуска инструмента создаются суб-индексы для разных доменов, а последний запуск инструмента создает окончательный индекс.

    Объединение суб-индексов в единый индекс

  • Юрисдикция хочет подать заявку на инфраструктурный грант, и для подтверждения квалификации им необходимо доказать, что эти ресурсы пойдут в недостаточно обслуживаемые сообщества. Они могут создать индекс, комбинирующий показатели развития инфраструктуры и демографические переменные для идентификации наиболее плохо обслуживаемых районов.

Как проводится предварительная обработка переменных

Чтобы создать соответствующий индекс, переменные должны быть в совместимой шкале. Для этого в инструменте предлагаются параметры предварительной обработки, которые приводят различные входные переменные к общей шкале измерений, чтобы их можно было соответствующим образом комбинировать. Инструмент также может инвертировать переменные таким образом, чтобы значения высоких значений в каждой переменной совпадали друг с другом.

Предварительная обработка переменных для приведения к общей шкале.

Примечание:

Воспользуйтесь инструментом Трансформировать поля для преобразования.

Предварительная обработка переменных для обращения значений

Примите во внимание смысл низких и высоких значений каждой переменной и убедитесь, что они согласуются друг с другом. Например, в индексе социальной уязвимости места с более низким средним доходом более уязвимы, но места с низким процентом людей без страховки менее уязвимы; направления этих переменных противоположны в контексте самого индекса.

Когда вы вводите каждую переменную в инструмент, подумайте, нужно ли ее инвертировать; в этом случае поставьте отметку Обратить направление, чтобы изменить направление переменной.

Обращение направления переменных

Обратная величина переменной вычисляется путем умножения каждого значения на -1 и пересчета поля в пределах исходного диапазона переменной.

Предварительная обработка переменных для приведения к одинаковой шкале

Используйте параметр Метод пересчета входных переменных для выбора единого метода масштабирования. Выбранный метод будет применен ко всем переменным и итоговым полям, которые будут представлены в результатах. Доступны следующие опции:

  • Минимум-максимум - этот метод пересчитывает значения в диапазон от 0 до 1 на основе минимального и максимального значений каждой переменной. Этот метод является самым простым, поскольку он сохраняет распределение входных переменных и выполняет пересчет по шкале от 0 до 1, которую легко интерпретировать.

    Масштабирование типа Минимум – максимум

    В этом методе применяется следующая формула:

\[ x'= \frac{x - \text{min}(x)} {\text{max}(x) - \text{min}(x)} \]

Поскольку этот метод сохраняет распределение переменных, на него могут влиять искаженные распределения и выбросы. Например, если есть один выброс с очень высоким значением, этот выброс получит значение 1, но остальные значения будут похожими и близкими к нулю. В результате сокращенной вариации при предварительной обработке эта переменная может иметь меньшее влияние на результирующий индекс.

Этот метод также зависит от минимальных и максимальных значений во входных данных, что делает его менее подходящим для сравнения индексов за несколько периодов времени, когда минимальные и максимальные значения переменной могут изменяться с каждым временным шагом.

  • Минимум-максимум (пользовательские диапазоны данных) - этот метод пересчитывает значения в диапазон от 0 до 1 на основе возможных минимального и максимального значений каждой переменной. Этот метод полезен, когда возможный минимум и максимум пока не существуют в диапазоне переменной или вы хотите создать индекс, который должен оставаться сопоставимым по мере получения дополнительных данных.

    Пользовательское масштабирование типа Минимум – максимум

    В этом методе применяется следующая формула:

\[ x'= \frac{x - \text{specified_min}} {\text{specified_max} - \text{specified_min}} \]

Есть несколько возможностей настройки возможного минимума и возможного максимума:

  • Когда индекс будет сравниваться во времени, а в текущих данных нет диапазона значений, которые могли бы быть у индекса в другие периоды времени.

    • Когда есть эталонная статистика, такая как минимум и максимум более широкой области исследования. Например, индекс по области исследования, установленной во Франции, может учитывать минимум и максимум для всех стран Европы.

    • Когда есть желаемый эталон, такой как ожидаемая продолжительность жизни в индексе человеческого развития. Хотя в самих данных цифры ожидаемой продолжительности жизни может не быть, выбранный эталон по-прежнему используется для задания контекста индекса.

    • Когда есть априорное знание теоретических минимумов и максимумов переменных, например, знание абсолютных температурных диапазонов на Земле и использование ежедневных записей с меньшим диапазоном.

    • Процентиль — этот метод преобразует переменные в процентили от 0 до 1. Этот метод может оказаться полезным, когда ранги каждой переменной важнее их фактических значений. Он также устойчив к выбросам и искаженным распределениям, поскольку переменные преобразуются в равномерное распределение.

    Формула масштабирования процентиля

    Существуют различные определения процентилей. В этом методе применяется следующая формула:

    \[ P = \frac{R - 1}{N - 1} \]

    где \(R\) - порядковый ранг (в случае связей используется минимальное значение ранга), \(N\) - количество значений, а \(P\) - итоговый процентиль.

    Процентили обозначают положение значения относительно других значений внутри переменной. Например, хотя разница в доходе между $50,000 and $60000 долларов может быть несущественной, разница в процентилях может быть большой, если существует множество объектов со значениями между ними.

  • Ранг — этот метод ранжирует входные значения, присваивая значение 1 наименьшему значению в переменной и увеличивая на 1 для каждого значения. Этот метод может оказаться полезным, когда ранги каждой переменной важнее их фактических значений. Метод также устойчив к выбросам и асимметричным распределениям.

    Масштабирование рангов

    Метод использует метод среднего ранга, который разрешает связи путем присвоения среднего значения ранга связанным наблюдениям.

    Этот метод похож на процентили, но диапазон значений находится между 1 и количеством записей в таблице.

  • Z-оценка — этот метод стандартизирует каждую переменную с помощью формулы Z-оценки. Этот метод применим, когда каждое значение следует рассматривать относительно среднего значения переменной. Например, когда вы хотите узнать, выше или ниже среднего значения по стране процент людей, живущих за чертой бедности, и насколько.

    Масштабирование Z-оценки

    В этом методе применяется следующая формула:

    \[ x' = \frac{x - \bar{x}}{\sigma_x} \]

    где \(x'\) - это z-оценка, \(x\) - это исходное значение, \(\bar{x}\) - это среднее (average), а \(\sigma_x\) - это стандартное отклонение.

    Z-оценки выражаются в стандартных отклонениях, являющихся мерой разброса данных. Z-оценка, равная 2, означает, что значение на два стандартных отклонения больше среднего, а z-оценка, равная -1, - на одно стандартное отклонение меньше среднего. Этот метод менее чувствителен к неблагоприятным последствиям выбросов по сравнению с методом минимума-максимума. Однако он дает отрицательные значения, что делает его несовместимым с методами мультипликативной комбинации.

  • Z-оценка (пользовательский) — этот метод стандартизирует каждую переменную с помощью формулы Z-оценки на основе пользовательского значения среднего и стандартного отклонения. Этот метод используется при создании индексов, которые сравниваются со справочной статистикой или сравниваются во времени.

    Пользовательское масштабирование Z-оценки

    В этом методе применяется следующая формула:

\[ x' = \frac{x - \bar{x}_c}{\sigma_c} \]

где \(x'\) - это стандартизированное значение, \(x\) - исходное значение, \(\bar{x_c}\) - пользовательское среднее, а \(\sigma_c\) - пользовательское стандартное отклонение.

Используйте параметр Пользовательская стандартизация, чтобы установить базовые среднее значение и стандартное отклонение.

Например, чтобы создать годовой индекс развития, который будет обновляться в течение следующих 10 лет, используя первый год в качестве точки сравнения, создайте индекс для первого года, используя опцию z-оценки, которая использует фактическое среднее значение и стандартное отклонение для каждой переменной. Затем используйте то же среднее значение и стандартное отклонение в параметре Пользовательская стандартизация в последующие годы. Это делает результаты сопоставимыми по всем годам, используя для сравнения распределение за первый год.

Этот метод также используется при сравнении значений с теоретическим средним значением, которое может не совпадать со средним значением данных. Например, если национальный уровень безработицы составляет 8 процентов, но средний уровень безработицы в данных составляет 13 процентов, z-оценки могут быть установлены по отношению к среднему национальному значению и национальному стандартному отклонению, и выборка в данных будет иметь более положительные значения, отражая уровень безработицы выше, чем в среднем по стране.

  • Флаг по пороговому значению (бинарный) — этот метод преобразует переменную в двоичные значения (0, 1), которые указывают, находится ли значение выше или ниже указанного порога. Этот метод удобен, когда важно выделить определенные значения, а изменение значений не играет роли.

    Масштабирование флага по пороговому значению

    Эта опция активирует параметр Метод масштабирования для порогов, который позволяет устанавливать пороги в диапазоне масштабируемой переменной.

    Этот метод используется в следующих случаях:

    • Эксперты в области качества воздуха хотят выделить места, которые превышают пороговые значения для здоровья человека по нескольким переменным качества воздуха. Они устанавливают исходные переменные параметра Метод масштабирования порогов и задают эти пороги.

    • Правительственное учреждение хочет выделить местоположения, которые очень уязвимы в нескольких доменах. Параметр Метод масштабирования порогов они задают как процентили, а сам порог как Больше, чем 0.9 для каждой переменной, чтобы подсветить неблагополучные локации.

    • Международная организация хочет выделить страны, показатели человеческого развития которых стабильно ниже среднего. Они задают параметр Метод масштабирования порогов как z-оценку, а пороги как Меньше, чем 0, чтобы определить местоположения ниже среднего.

    Этот метод наиболее полезен в сочетании с опцией комбинации суммы для подсчета количества раз, когда местоположение превышает пороговые значения.

    На метод не влияют выбросы во входных переменных, но информация об уровне интервала в каждой входной переменной теряется, поскольку каждая переменная преобразуется в двоичную (0, 1) форму.

  • Необработанные значения—использует исходные значения переменной.

    Этот метод следует использовать только в том случае, если все переменные находятся в сопоставимой шкале. Например, когда все переменные являются стандартной единицей, такой как проценты или части на миллион. Этот метод также может быть полезен, когда стандартизация или преобразование переменных уже были выполнены до запуска инструмента.

Примечание:

Выбранный вариант масштабирования применяется ко всем переменным. Если вам нужно применить различные параметры масштабирования к каждой переменной, используйте другие инструменты, такие как Стандартизировать поле или Переклассифицировать поле, прежде чем использовать этот инструмент.

Если в поле есть пустые значения, инструмент не сможет вычислить индекс для записей. Воспользуйтесь инструментом Заполнить пропущенные значения для вставки значений, если это допустимо, либо найдите подходящие данные.

Как инструмент комбинирует переменные в единый индекс

Как только переменные предварительно обработаны в соответствии с общей шкалой, они агрегируются для создания единого значения. У параметра Метод объединения пересчитанных переменных есть следующие опции:

  • Сумма

  • Среднее

  • Умножить

  • Геометрическое среднее

Опции Сумма и Среднее считаются аддитивными методами, а Умножить и Геометрическое среднее - мультипликативными методами.

Аддитивные методы

Методы комбинирования Сумма и Среднее относительно просты для интерпретации и часто используются различными индексами. Эти методы почти идентичны; они приводят к распределениям одинаковой формы, которые отличаются только масштабом, и, следовательно, результирующая индексная карта будет выглядеть одинаково. Отличаются только значения.

Методы аддитивного комбинирования

Эти методы позволяют использовать высокие значения одной переменной для компенсации низких значений другой переменной.

Аддитивная компенсация

Мультипликативные методы

Методы Умножение и Геометрическое среднее требуют большей осторожности при использовании, так как результирующие значения индекса могут быть намного выше, чем при использовании аддитивного метода, и эти методы плохо работают при использовании отрицательных значений.

Методы мультипликативного комбинирования

Несмотря на свои недостатки, мультипликативные методы имеют то преимущество, что они не позволяют высоким значениям одной переменной компенсировать низкие значения другой переменной; чтобы значение индекса было высоким, несколько переменных должны иметь высокие значения.

Мультипликативные методы не выполняют компенсацию

Примечание:

Параметр Предустановленный метод пересчета и объединения переменных предоставляет шаблоны, которые устанавливают методы предварительной обработки и комбинирования на основе часто используемых подходов к созданию индексов.

Взвешивание

Переменные могут быть взвешены, чтобы отобразить относительную важность каждого фактора, влияющего на индекс. По умолчанию для всех весов установлено 1, что означает, что у всех переменных одинаковый вес. Однако может быть важным обозначить различия в относительном вкладе той или иной переменной по сравнению с другими. Изменяя вес одной из переменных на 2 и сохраняя веса остальных равными 1, вы обозначаете, что переменная должна считаться в два раза более важной, чем другие, по ее вкладу в конечный индекс.

Вы также можете использовать веса, которые в сумме дают 1: например, если используются три переменные, и одна из них должна считаться вдвое более важной, чем две другие, вы можете использовать значения веса 0,5, 0,25 и 0,25.

В аддитивных методах веса применяются путем умножения каждой переменной на соответствующий вес. В мультипликативных методах веса применяются путем возведения каждой переменной в степень соответствующего веса.

Веса оказывают значительное влияние на итоговый индекс. Независимо от того, решите ли вы сохранить равные веса или изменить веса в пользу переменных, использование весов добавляет субъективности анализу. Кроме того, вы можете непреднамеренно выполнять взвешивание из-за корреляции и различий в дисперсии между вашими переменными. Чтобы узнать больше о влиянии корреляции и дисперсии на индекс, см. документ с рекомендациями по созданию составных индексов.

Как происходит постобработка индексов

Как только переменные предварительно обработаны и объединены в необработанный индекс, последующая обработка может помочь сделать индекс более понятным. Параметры в категории Выходные настройки позволяют регулировать направление, масштаб и классифицировать значения.

Обращение значений индекса

Изучите назначение индекса и определите, соответствуют ли высокие значения индекса вашим намерениям. Используйте отметку для параметра Обратить выходные значения индекса для дополнительного инвертирования исходного индекса, чтобы высокие значения становились низкими, и наоборот.

Обращение значений индекса

Примечание:

Соблюдайте осторожность при изменении значений индекса для мультипликативных методов, так как эти результаты будут отличаться от обращения входных переменных.

Пересчет индекса с использованием минимального и максимального значений

Используйте параметр Минимальное и максимальное выходные значения индекса для настройки диапазона выходного индекса. Эта опция применима для использования шкалы, которую легче интерпретировать, независимо от выбранных методов предварительной обработки и комбинирования. Например, укажите Минимальное значение 0 и Максимальное значение 100, чтобы пересчитать необработанный индекс до этого диапазона. Эта опция использует следующую формулу:

\[ x' = a + \frac{(x - \min(x))(b - a)} {\max(x) - \min(x)} \]

где \(x\) - исходное значение, \(min(x)\) - минимальное значение, найденное в индексе, \(max(x)\) - максимальное значение, найденное в индексе, \(a\) - указанное минимальное значение, \(b\) - указанное максимальное значение, а \(x'\) - пересчитанное значение.

Пересчет выходного индекса Минимум-максимум

Классификация индекса

В дополнение к необработанному выходному индексу вы можете дополнительно классифицировать выходной индекс, чтобы дополнительно исследовать результаты. У параметра Дополнительные классифицированные выходные данные есть четыре метода, которые можно использовать: Равный интервал, Квантиль, Стандартное отклонение и Пользовательский, каждый из которых будет представлен дополнительным полем в результатах.

Метод равных интервалов делит диапазон индекса на интервалы равной длины.

Классификация Равный интервал

Метод квантилей делит значения на классы, чтобы каждый класс имел одинаковое количество признаков или строк. Этот метод создает карту, аналогичную индексному процентильному слою, но использует классы, в отличие от непрерывного процентильного распределения. Используйте этот параметр для создания карты квинтилей (с пятью классами), децилей (с 10 классами) или других типов квантилей на основе количества классов.

Классификация Квантиль

Метод стандартного отклонения классифицирует индекс, чтобы показать количество стандартных отклонений каждого значения от среднего.

Классификация Стандартное отклонение

Метод пользовательских классов разбивает непрерывный индекс, используя пользовательские границы класса и пользовательские метки. Вы можете добавить числовые или текстовые метки, такие как Низкий, Средний и Высокий.

Пользовательская классификация

Интерпретация результатов

Визуализация и исследование полученного индекса — важный шаг в подготовке индекса к дальнейшему использованию. Инструмент создает различные карты и диаграммы, которые помогают интерпретировать результат.

Выходные слои

Когда для параметра Выходные объекты или таблица задан класс пространственных объектов или шейп-файл (а не добавление к входным данным), инструмент создает несколько слоев, которые включаются в выходной составной слой:

Составной слой результатов

Подсказка:

Используйте горячие клавиши Ctrl и Shift для быстрого раскрытия или скрытия списка слоев в рамках составного слоя.

Индексный слой отображает распределение значений индекса после любого необязательного пересчета или обращения. Слой предоставляет непрерывную картограмму, которую можно использовать для оценки результатов индексации. Вы можете использовать карту для оценки высоких и низких значений индекса, сохраняя распределение индекса и любые выбросы.

Индексный слой

Слой процентилей индекса отображает относительные позиции (ранги) между значениями индекса. Итоговые цвета карты соответствуют рангам значений индекса, поэтому они не сохраняют распределение или какой-либо смысл фактических различий индексов. Используйте этот метод, если вы хотите оценить, как местоположения связаны друг с другом на основе их рейтинга индекса.

Слой индекса - процентили

Слой классов индексов с равными интервалами показывает классы на основе индексного распределения значений, но он группирует значения в классы на основе равных интервалов, заданных параметром Количество классов выходного индекса. Этот слой классифицируется на основе индексного слоя.

Слой индекса - равные интервалы

Слой индексных квантилей присваивает равное количество признаков каждому классу и является классифицированной формой слоя индексных процентилей. Число классов задается в параметре Количество классов выходного индекса.

Слой индекса - квантиль

Слой классов стандартных отклонений индекса визуализирует местоположения выше и ниже среднего индекса. Цветовая шкала помогает выделить чрезвычайно высокие и низкие значения индекса, что может быть полезно для определения мест, которые могут потребовать дальнейшего изучения.

Слой индекса - среднеквадратическое отклонение

Слой пользовательских классов индекса отображает указанные категории на карте и может использоваться для многих целей, например, для разделения непрерывного индекса на нечетные категории на основе запланированных вмешательств. Например, вы можете назвать классы как Низкий, Средний и Высокий.

Слой индекса - пользовательские классы

Выходные диаграммы

Инструмент создает диаграммы, которые могут помочь получить ответы на различные вопросы об индексе.

Изучение распределения индекса

Первичный индексный слой в выходных данных составного слоя содержит гистограмму распределения индекса. Наряду с картой это может помочь вам понять распределение результатов.

Гистограмма индексов

Изучение распределения входных переменных

Основной индексный слой содержит две ящичковых диаграммы входных переменных: одна визуализирует распределения переменных до масштабирования, а другая визуализирует распределения переменных после масштабирования. Часто бывает полезно сравнить эти диаграммы бок о бок, чтобы оценить, как выбранный метод масштабирования изменил входные переменные. Сравнение этих диаграмм рядом может помочь оценить, оказал ли выбранный метод масштабирования ожидаемое влияние на распределение переменных.

Ящичковые диаграммы входных и масштабированных переменных

Вы также можете использовать ящичковые диаграммы для исследования выбросов, выбирая их на ящичковой диаграмме входных переменных и проверяя их расположение на карте. Затем вы можете просмотреть диаграмму предварительно обработанных переменных, чтобы проверить, устранил ли выбранный метод предварительной обработки эффект выброса.

Изучение результатов по каждому объекту

Векторный слой включает всплывающие окна, которые визуализируют значения индекса и входных переменных для каждого объекта. Воспользуйтесь инструментом Исследовать, чтобы щелкнуть объект, и используйте всплывающее окно для просмотра результатов.

Всплывающее окно значения и диапазона каждого индекса

Во всплывающем окне отображаются значение и диапазон результирующего индекса и каждой входной переменной. Черная линия на каждом столбце указывает среднее значение по всем объектам.

Изучите, какие переменные влияют на индекс

Индексный слой включает в себя матрицу диаграммы рассеяния, которая отображает корреляцию между индексом и каждой используемой переменной. Переменные с высокой корреляцией по отношению к индексу обычно соответствуют переменным, которые внесли наибольший вклад в индекс. Следовательно, можно считать, что любые переменные с низкой корреляцией с индексом оказывают меньшее влияние на индекс. Кроме того, рассмотрите, имеют ли какие-либо переменные низкую внутреннюю вариацию; переменные с низкой вариацией с меньшей вероятностью внесут значимую информацию в ваш индекс.

Отношения масштабированных переменных и индекса

Полученные карты и визуализация данных способствуют дальнейшей корректировке и уточнению индекса. Чтобы узнать больше о дополнительных соображениях при создании и оценке индекса, см. технический документ с рекомендациями.

Дополнительные ресурсы

См. Organisation for Economic Co-operation and Development Handbook on Constructing Composite Indicators: Methodology and User Guide.