Skip to main content

Оценка прогнозов Перекрестной проверкой (Инструменты Пространственная статистика)

Краткая информация

Оценивает производительность модели прогнозирования при помощи перекрестной проверки. Этот инструмент генерирует метрики проверки для моделей, созданных с использованием инструментов Классификация на основе леса и регрессия, регрессия с бустингом, Обобщённая линейная регрессия и Прогнозирование только присутствия. Он позволяет указать тип оценки (например, K-кратное или пространственное K-кратное распределение), число групп и балансировку редких событий для обеспечения надежной и непредвзятой оценки модели.

Как работает Оценка прогнозов перекрестной проверкой

Иллюстрация

Иллюстрация инструмента Оценка прогнозов перекрестной проверкой

Использование

  • Параметр Тип оценки содержит следующие опции для разбиения объектов по группам:

    • Пространственное k-кратное распределение — Используйте пространственную перекрестную проверку для оценки того, как модель выполняет прогноз объектов, географически находящихся вне изучаемой области обучающих данных.

    • Произвольное k-кратное распределение — Используйте произвольную перекрестную проверку для оценки того, как модель выполняет прогноз объектов, географически находящихся в изучаемой области обучающих данных

  • При использовании классификации для прогнозирования редких событий или несбалансированных категорий, применяйте параметр Тип балансировки, чтобы сбалансировать число выборок в пределах каждого категориального уровня. Протестируйте различные методы балансировки в этом инструменте, затем выберите наилучший метод и запустите его на полном обучающем наборе данных до прогнозирования, используя инструмент Подготовка данных для прогноза.

  • Перекрестная проверка не используется для создания одной модели или файла модели. Она создает показатели точности, которые можно использовать для оценки того, насколько хорошо модель и ее параметры прогнозируют данные, исключенные при обучении модели.

  • Этот инструмент не будет принимать объекты анализа, которые были сначала подвергнуты избыточной выборке в инструменте Подготовка данных для прогноза, то есть сбалансированы с использованием произвольной избыточной выборки или SMOTE. Данные с избыточной выборкой не могут быть использованы в наборе для проверки из-за утечки данных.

  • Учитываются параметры в исходном инструменте прогнозирования. Однако для результатов анализа, выполненного при помощи инструмента Классификация на основе леса и регрессия, регрессия с бустингом, данные проверки задаются как 0. Если параметр Оптимизация параметров использовался с инструментом Классификация на основе леса и регрессия, регрессия с бустингом, оптимальные параметры из запуска исходного инструмента будут применены при выполнении перекрестной проверки.

  • Инструмент создает следующие выходные данные:

    • Output Features—Записываются обучающий набор данных и результаты обучения и прогнозирования каждого объекта в обучающем наборе данных.

    • Output Validation Table—В таблицу записываются показатели оценки для каждого запуска проверки.

    Инструмент также создает множество полезных сообщений геообработки, включая Среднюю статистику диагностики вне выборки.

Параметры

Подпись Объяснение Тип данных

Объекты результата анализа

Класс объектов, содержащий результаты обучения, полученные с помощью инструментов Классификация на основе леса и регрессия, регрессия с бустингом, Обобщённая линейная регрессия или Прогнозирование только присутствия. Результаты обучения прогнозирования будут оценены при помощи перекрестной проверки.

Feature Layer

Выходные объекты

Выходные объекты будут содержать исходные независимые переменные, зависимые переменные и дополнительные поля, суммирующие результаты перекрестной проверки.

Feature Class

Выходная таблица проверок

Выходная таблица будет содержать показатели оценки для каждого запуска проверки.

Table

Входные объекты анализа

Входные объекты, которые будут использоваться в анализе, создавшем итоговые объекты анализа.

Feature Layer

Тип оценки

(Дополнительный)

Задает метод, который используется для разбиения значения параметра Объекты результата анализа на k групп.

  • Произвольное k-кратное распределениеОбъекты результата анализа будут произвольно разбиты на k групп. Каждая группа будет содержать одинаковое или схожее число объектов. При прогнозировании категорий (классификации) каждая категория в зависимой переменной будет отображаться в каждой обучающей группе. Используется по умолчанию.

  • Пространственное k-кратное распределениеОбъекты результата анализа будут пространственно разбиты на k групп при помощи кластеризации k-средних для входных центроидов полигонов или точек. При прогнозировании категорий (классификации) каждая категория в зависимой переменной будет отображаться в каждой обучающей группе. Каждая группа пространственно отделена от других.

String

Число групп

(Дополнительный)

Число групп, на которое будет разбито значение параметра Объекты результата анализа. Число групп должно быть больше 1. Значение по умолчанию равно 10.

Long

Тип балансировки

(Дополнительный)

Указывает метод, который будет использоваться для балансировки числа выборок каждой категории зависимой переменной в обучающей группе. Этот параметр активен, если исходная модель прогнозировала категориальную переменную.

  • НетОбъекты результата анализа не будут сбалансированы. Используется по умолчанию.

  • Произвольная недостаточная выборкаПроизвольные объекты будут удаляться из каждого класса, кроме класса меньшинства, до тех пор, пока число объектов не совпадет с числом объектов в классе меньшинства.

  • Недостаточная выборка ТомекаОбъекты в каждом классе не меньшинства, которые близки к объектам в классе меньшинства, будут удалены. Этот метод улучшит границу между классами, однако каждый класс может содержать разное число объектов.

  • Недостаточная выборка K-медоидовОбъекты из класса не меньшинства, которые не являются репрезентативными для этого класса, будут удаляться до тех пор, пока количество объектов не сравняется с количеством объектов из класса меньшинства.

  • Произвольная избыточная выборкаОбъекты в классе меньшинства будут дублироваться случайным образом до тех пор, пока их количество не сравняется с количеством объектов в классе большинства.

  • SMOTE (избыточная выборка)Синтетические объекты будут создаваться для класса меньшинства путем интерполяции между существующими объектами то тех пор, пока число объектов не совпадет с числом объектов в классе большинства.

String

Параметры среды

Генератор случайных чисел, Выходная система координат, Коэффициент параллельной обработки

Информация о лицензировании

  • Basic: Ограниченные
    Для использования растров необходим Spatial Analyst
  • Standard: Ограниченные
    Для использования растров необходим Spatial Analyst
  • Advanced: Ограниченные
    Для использования растров необходим Spatial Analyst