Skip to main content

Подготовка данных для прогноза (Инструменты Пространственная статистика)

Краткая информация

Улучшает данные для рабочих процессов прогнозирования в инструментах Классификация на основе леса и регрессия, регрессия с бустингом, Обобщенная линейная регрессия и Прогнозирование только присутствия, а так же для других моделей. Это включает в себя разделение объектов на обучающие и тестовые наборы, извлечение переменных из растров и объектов расстояния, балансировку данных для повышения точности классификации и выполнение пространственного прореживания для пространственных данных со смещением.

Более подробно о том, как работает Подготовка данных для прогноза

Иллюстрация

Иллюстрация инструмента Подготовка данных для прогноза

Использование

  • Обучающие данные, к которым применялась балансировка, должны использоваться только для обучения моделей прогнозирования. Модели не должны проверяться на сбалансированных данных, чтобы избежать ошибок в точности и утечки данных.

  • Для использования растров в качестве независимых переменных необходима лицензия дополнительного модуля Spatial Analyst.

  • Если вы используете классификацию для прогнозирования редких событий или несбалансированных категорий, используйте параметр Тип балансировки, чтобы сбалансировать число выборок в пределах каждого категориального уровня. Методы избыточной выборки увеличат общее число объектов, а методы недостаточной выборки понизят число объектов.

  • Если параметр Тип разбиения установлен на Произвольное разбиение или Пространственное разбиение, выходные тестовые объекты можно использовать для оценки точности модели с помощью инструмента Прогнозировать, используя файл модели пространственной статистики. Убедитесь, что в качестве выходных данных указан файл модели пространственной статистики, перед тем как запускать выбранный инструмент анализа.

  • Если параметр Тип разбиения установлен на Произвольное разбиение или Пространственное разбиение, инструмент проверит, что все категориальные уровни как в переменной для прогнозирования, так и в независимых переменных будут представлены в выходных обучающих объектах. В тестовых наборах данных не обязательно должны присутствовать все категориальные уровни.

Параметры

Подпись Объяснение Тип данных

Входные объекты

Объекты, к которым будет применено разбиение, извлечение или балансировка.

Feature Class

Выходные объекты

Выходные объекты которые будут использоваться как обучающие объекты в инструменте модели.

Feature Class

Тип разбиения

(Дополнительный)

Определяет метод, который будет использоваться для разделения входных объектов на обучающие и тестовые поднаборы.

  • Произвольное разбиениеВходные объекты будут случайным образом разделены на обучающие и тестовые поднаборы. Используется по умолчанию.

  • Пространственное разбиениеВходные объекты будут пространственно разделены на обучающие и тестовые поднаборы.

  • НетВходные объекты не будут разделены.

String

Выходной тестовый поднабор объектов

(Дополнительный)

Поднабор параметра Входные объекты будет использован в качестве тестовых объектов. Этот параметр доступен, если Тип разбиения установлен на Произвольное разбиение или Пространственное разбиение.

Feature Class

Переменная для прогнозирования

(Дополнительный)

Переменная из параметра Входные объекты, содержащая значения, используемые для обучения модели. Это поле содержит известные (обучающие) значения переменной, которые будут использованы для прогнозирования в неизвестных местоположениях.

Field

Рассматривать переменную как Категориальную

(Дополнительный)

Определяет, будет ли значение параметра Переменная для прогнозирования интерпретироваться как категорийная переменная.

  • ОтмеченоЗначение параметра Переменная для прогнозирования будет интерпретироваться как категорийная переменная.

  • Не отмеченоЗначение параметра Variable to Predict не будет интерпретировано как категорийная переменная, будет интерпретироваться как непрерывная. Используется по умолчанию.

Boolean

Независимые переменные

(Дополнительный)

Список полей, представляющих независимые переменные, которые помогут прогнозировать значения или категории для параметра Переменная для прогнозирования. Включите опцию Категориальная для любых переменных, которые представляют классы или категории (например, наземный покров – его наличие или отсутствие).

Столбцы таблицы значений:

  • VariableVariables that represent classes or categories,

  • CategoricalSpecifies whether the variable is categorical.

Value Table

Независимые объекты расстояния

(Дополнительный)

Независимые объекты расстояния обучения. Независимые переменные будут созданы автоматически, путем вычисления расстояния от предоставленных объектов до Входных объектов. Расстояния будут вычислены от каждого из объектов набора, указанного в параметре Входные объекты до ближайшего объекта из этого набора. Если входные объекты являются полигонами или линиями, атрибуты расстояния вычисляются как расстояние между ближайшими сегментами пары объектов.

Feature Layer

Независимые растры

(Дополнительный)

Независимые переменные обучения, извлеченные из растров. Независимые переменные обучения будут автоматически созданы путем извлечения значений ячеек растра. Для каждого из Входных объектов значение ячейки растра извлекается в именно в этом местоположении. Билинейный пересчет растра используется, если значение растра извлекается из непрерывных растров. Метод ближайшего соседа используется, если значение растра извлекается из категориальных растров. Включите опцию Категориальная для любых переменных, которые представляют классы или категории например, наземный покров или наличие и отсутствие какого-либо явления.

Столбцы таблицы значений:

  • VariableThe explanatory training variables extracted from rasters.

  • CategoricalSpecifies whether the variable is categorical.

Value Table

Конвертировать полигоны в разрешение растра для обучения

(Дополнительный)

Определяет то, как полигоны будут рассматриваться, если Входные объекты являются полигонами с категориальной Переменной для прогнозирования, и заданы только Независимые растры.

  • ОтмеченоПолигоны будут разделены на все ячейки растра с центроидами, попадающими в пределы полигонов. Затем значения растра в каждом центроиде извлекаются и используются для обучения модели. Модель больше не обучается на полигонах, а обучается на значениях растра, извлеченных для каждого центроида ячейки. Используется по умолчанию.

  • Не отмеченоКаждому полигону будет присвоено среднее значение нижележащих непрерывных растров или значение большинства нижележащих категориальных растров.

Boolean

Процент данных как тестовый поднабор

(Дополнительный)

Процент входных объектов, которые будут сохранены как тестовый или проверочный набор данных. Значение по умолчанию равно 10.

Double

Тип балансировки

(Дополнительный)

Определяет метод, который будет использоваться для балансировки несбалансированного значения параметра Переменная для прогнозирования или для пространственного смещения входных данных. Метод балансировки применим только к параметру Выходные объекты.

  • НетВходные объекты не будут сбалансированы. Используется по умолчанию.

  • Пространственное прореживаниеПространственное смещение будет уменьшено за счет удаления объектов и проверкой того, что расстояние между каждым набором оставшихся точек равно или больше значения, заданного в параметре Минимальное расстояние ближайшей окрестности. Если Переменная для прогнозирования является категориальной, пространственное прореживание применяется к каждому отдельному классу. В противном случае пространственное прореживание будет применено ко всем Выходным объектам.

  • Произвольная недостаточная выборкаПроизвольные объекты будут удаляться из каждого класса, кроме класса меньшинства, до тех пор, пока число объектов не совпадет с числом объектов в классе меньшинства.

  • Недостаточная выборка ТомекаОбъекты в каждом классе не меньшинства, которые близки к объектам в классе меньшинства, будут удалены. Этот метод улучшит границу между классами, однако каждый класс может содержать разное число объектов.

  • Недостаточная выборка K-медоидовОбъекты из класса не меньшинства, которые не являются репрезентативными для этого класса, будут удаляться до тех пор, пока количество объектов не сравняется с количеством объектов из класса меньшинства.

  • Произвольная избыточная выборкаОбъекты в классе меньшинства будут дублироваться случайным образом до тех пор, пока их количество не сравняется с количеством объектов в классе большинства.

  • SMOTE (избыточная выборка)Синтетические объекты будут создаваться для класса меньшинства путем интерполяции между существующими объектами то тех пор, пока число объектов не совпадет с числом объектов в классе большинства.

String

Минимальное расстояние ближайшего соседства

(Дополнительный)

Минимальное расстояние между двумя любыми точками присутствия или двумя любыми точками в одной и той же категории параметра Переменной для прогнозирования, если применено пространственное прореживание.

Linear Unit

Число итераций прореживания

(Дополнительный)

Число итераций, которое будет использовано для поиска оптимального решения пространственного прореживания, с поддержанием минимального возможного числа объектов, с тем, чтобы не было двух объектов в пределах Минимального расстояния ближайшей окрестности. Минимальное число итераций - 1, а максимальное - 50. Значение по умолчанию равно 10.

Long

Кодировать категориальную независимую переменную

(Дополнительный)

Определяет, будет ли кодирована категориальная независимая переменная.

  • ОтмеченоКатегориальная независимая переменная будет закодирована. Каждое категорийное значение будет преобразовано в новое поле с присвоением значений 0 или 1. Значение 1 указывает наличие категориального значения, а 0 - отсутствие.

  • Не отмеченоКатегориальная независимая переменная не будет закодирована. Используется по умолчанию.

Boolean

Присоединить все поля из входных объектов

(Дополнительный)

Указывает, будут ли все поля скопированы из входных пространственных объектов в выходные объекты.

  • ОтмеченоВсе поля из входных пространственных объектов будут скопированы в выходные объекты. Используется по умолчанию.

  • Не отмеченоВ выходные объекты будут скопированы только входные поля.

Boolean

Параметры среды

Размер ячейки, Выходная система координат, Генератор случайных чисел

Информация о лицензировании

  • Basic: Ограниченные
    Для использования растров необходим Spatial Analyst
  • Standard: Ограниченные
    Для использования растров необходим Spatial Analyst
  • Advanced: Ограниченные
    Для использования растров необходим Spatial Analyst