Уменьшение измерений (Инструменты Пространственная статистика)
Краткая информация
Уменьшает количество измерений набора непрерывных переменных, агрегируя максимально возможное количество дисперсии в меньшее количество компонентов с помощью анализа по методу главных компонент (PCA) или линейного дискриминантного анализа пониженного ранга (LDA).
Переменные указываются как поля во входной таблице или векторном слое, а новые поля, представляющие новые переменные, сохраняются в выходной таблице или классе пространственных объектов. Количество новых полей будет меньше, чем количество исходных переменных, при этом сохранится максимально возможная вариабельность всех исходных переменных. Уменьшение измерений обычно используется для изучения многомерных отношений между переменными и для уменьшения вычислительных затрат алгоритмов машинного обучения, в которых требуемая память и время обработки зависят от количества измерений данных. Использование компонентов вместо исходных данных в алгоритмах анализа или машинного обучения часто может обеспечить сопоставимые (или лучшие) результаты при меньшем потреблении вычислительных ресурсов.
Более подробно о том, как работает инструмент Уменьшение измерений
Иллюстрация

Использование
В параметре Поля анализа должно быть указано как минимум два числовых поля, поскольку данные должны иметь как минимум два измерения, чтобы их можно было уменьшить.
Есть два варианта параметра Метод Уменьшения измерений:
Анализ по методу главных компонент (PCA) – этот метод последовательно строит компоненты, каждый из которых фиксирует максимально возможную общую дисперсию и корреляции между исходными переменными. Параметр Масштабировать данные можно использовать для масштабирования каждой исходной переменной, чтобы каждой переменной была задана одинаковая важность в главных компонентах. Если данные не масштабируются, переменные с большими значениями будут составлять большую часть общей дисперсии и будут чрезмерно представлены в первых нескольких компонентах. Этот метод рекомендуется, если вы собираетесь выполнить анализ или метод машинного обучения, в котором компоненты используются для прогнозирования значения непрерывной переменной.
Линейный дискриминантный анализ с пониженным рангом (LDA) – этот метод создает компоненты, которые максимизируют разделимость переменных анализа и различных уровней категориальной переменной, предоставленной в параметре Категориальное поле. Компоненты будут поддерживать максимально возможное различие между категориями, чтобы итоговые компоненты были наиболее эффективными при классификации каждой записи в одну из категорий. Этот метод автоматически масштабирует данные и рекомендуется в том случае, если вы собираетесь выполнить анализ или метод машинного обучения, в котором компоненты используются для классификации категории категориальной переменной.
Сообщения геообработки отображают процент и совокупный процент отклонения, поддерживаемый каждым компонентом.
Количество компонентов, которые будут созданы, зависит от того, указываете ли вы значения для параметров Минимальный процент отклонения для поддержания и Минимальное количество компонентов.
Если один параметр указан, а другой нет, значение указанного параметра определяет количество компонентов. Количество компонентов будет равно наименьшему количеству, необходимому для удовлетворения указанного минимума.
Если указаны оба параметра, используется большее из двух результирующих чисел компонентов.
Если ни один параметр не указан, количество компонентов определяется с использованием нескольких статистических методов, и инструмент будет использовать наибольшее количество компонентов, оцененное каждым из методов. Для обоих методов уменьшения измерений используются Метод сломанной трости и Критерий сферичности Бартлетта. Для PCA проверка перестановки также выполняется, если значение параметра Число перестановок больше нуля.
Информация о результатах каждого теста отображается в виде сообщений геообработки.
Если таблица создается с помощью параметра Выходная таблица собственных векторов, в выходной таблице создается диаграмма Scree Plot для визуализации дисперсии, поддерживаемой каждым компонентом.
Если таблица создается параметром Выходная таблица собственных векторов, в выходной таблице создается гистограмма для визуализации каждого из собственных векторов.
Вы можете присоединить поля компонентов к входной таблице с помощью параметра Присоединить поля к входным данным. Если вы присоедините поля компонентов, то связанная таблица не предоставляется.
Число компонент не может быть больше числа записей входного набора.. Также записи с пустыми значениями в каком-либо поле анализа будут исключены из вычислений. Если много записей содержат пустые значения, число компонентов, указанное в параметре Минимальное число компонентов не может быть обработано, и инструмент не выполнится. В этом случае рекомендуется удалить из анализа поля с большим количеством пустых значений или предварительно заполнить пропущенные значения с помощью инструмента Заполнить пропущенные значения.
Для получения дополнительной информации о PCA и LDA см. следующую ссылку:
- James, G., Witten, D., Hastie, T., Tibshirani, R. (2014). "An Introduction to Statistical Learning: with Applications in R." Springer Publishing Company, Incorporated. https://doi.org/10.1007/978-1-4614-7138-7
Дополнительную информацию о методах определения количества компонентов см. следующую ссылку:
- Peres-Neto, P., Jackson, D., Somers, K. (2005). "How many principal components? Stopping rules for determining the number of non-trivial axes revisited." Computational Statistics & Data Analysis. 49.4: 974-997. https://doi.org/10.1016/j.csda.2004.06.015.
Параметры
| Подпись | Объяснение | Тип данных |
|---|---|---|
|
Входная таблица или объекты |
Таблица или объекты, содержащие поля с измерением, которое будет уменьшено. |
Table View |
|
Выходная таблица или класс объектов (Дополнительный) |
Выходная таблица или класс пространственных объектов, содержащий результирующие компоненты уменьшения измерений. |
Table |
|
Поля анализа |
Поля, представляющие данные, измерения которых будут уменьшены. |
Field |
|
Метод Уменьшение измерений (Дополнительный) |
Задает метод, который будет использоваться для уменьшения измерений полей анализа.
|
String |
|
Масштабировать данные (Дополнительный) |
Определяет, будут ли значения каждого поля анализа масштабироваться, чтобы иметь дисперсию, равную единице. Такое масштабирование гарантирует, что каждому полю анализа будет дан равный приоритет в компонентах. Масштабирование также устраняет влияние линейных единиц измерения, например, одни и те же данные, измеренные в метрах и футах, приведут к эквивалентным компонентам. Значения полей анализа будут сдвинуты, чтобы иметь нулевое среднее значение для обоих вариантов.
|
Boolean |
|
Категориальное поле (Дополнительный) |
Поле, представляющее категориальную переменную для LDA. Компоненты будут поддерживать максимальный объем информации, необходимой для классификации каждой входной записи по этим категориям. |
Field |
|
Минимальный процент отклонения для поддержания (Дополнительный) |
Минимальный процент общей дисперсии полей анализа, который необходимо поддерживать в компонентах. Общая дисперсия зависит от того, были ли поля анализа масштабированы с помощью параметра Масштабировать данные. |
Long |
|
Минимальное количество компонентов (Дополнительный) |
Минимальное количество компонентов. |
Long |
|
Скопировать все поля в выходной набор данных (Дополнительный) |
Определяет, будут ли все поля из входной таблицы или компонентов копироваться и добавляться к выходной таблице или объектам. Поля, указанные в параметре Поля анализа, будут скопированы в выходные данные независимо от значения этого параметра.
|
Boolean |
|
Выходная таблица собственных значений (Дополнительный) |
Выходная таблица, содержащая собственные значения каждого компонента. Значения собственных векторов масштабируются таким образом, чтобы они имели единичную норму (сумма квадратов значений равна единице). |
Table |
|
Выходная таблица собственных векторов (Дополнительный) |
Выходная таблица, содержащая собственные векторы каждого компонента. |
Table |
|
Число перестановок (Дополнительный) |
Количество перестановок, используемых при определении оптимального количества компонентов. Значение по умолчанию – 0, что означает, что проверка перестановки выполняться не будет. |
Long |
|
Присоединение полей к входным данным (Дополнительный) |
Определяет, будут ли поля компонентов присоединяться к входному набору данных, или сохраняться в выходной таблице или классе объектов. Если вы присоединяете поля к входному набору данных, то параметр среды выходной системы координат будет проигнорирован.
|
Boolean |
Производные выходные данные
| Подпись | Объяснение | Тип данных |
|---|---|---|
|
Обновленная таблица или класс пространственных объектов. |
Обновленная входная таблица или класс объектов с присоединенными полями компонентов. |
Table View |
Параметры среды
Выходная система координат, Генератор случайных чисел
Информация о лицензировании
- Basic: Да
- Standard: Да
- Advanced: Да