Skip to main content

Случайная выборка образца (Data Reviewer)

Краткая информация

Выбирает случайную выборку входных объектов или строк на основе указанного метода выборки.

Выходные данные представляют собой выборку, сделанную на входном слое в рамке карты. Также инструмент может создать файл .json, в котором записаны идентификаторы выбранных объектов (OID) и SQL-выражение, используемое для выборки. Выборку можно использовать для инструмента визуального обзора Просмотр объектов и рабочих процессов инструмента Запустить проверки данных.

Использование

  • Параметр Метод выборки содержит следующие опции:

    • Фиксированное число— число выбранных записей будет зависеть от значения параметра Число записей.

    • Процент— число выбранных записей будет основано на значении параметра Процент записей.

    • Автоматическое вычисление— число выбранных записей будет основано на вычислении с использованием значений параметров Уровень доверия и Предел погрешности.

  • У параметра Метод выборки есть опция Автоматическое вычисление, использующая следующие переменные для вычисления числа записей:

    \[ \begin{align*} z &= \text{scipy.stats.norm.ppf}\left(1 - \frac{1 - \text{confidence\_level}}{2}\right) \\ n &= \left(\frac{z}{m}\right)^2 \cdot \left(p \cdot (1 - p)\right) \\ n' &= \frac{n \cdot N}{n + (N - 1)} \end{align*} \]
    • Z-статистика для желаемого уровня доверия (z). Z-статистика вычисляется с использованием переменной уровня доверия и scipy.stats модуля z=scipy.stats.norm.ppf(1-(1-confidence_level)/2).

    • Предельно допустимая величина ошибки в доверительном интервале (m).

    • Вероятность (p) достигает максимума при 0,5, поскольку отсутствуют какие-либо предыдущие знания о том, будет ли определенный процент записей проверен или нет. Поскольку шансы на то, что записи пройдут или не пройдут, равны, 0,5 является наиболее консервативным значением для использования в уравнении дисперсии.

    • Размер совокупности (N) — это общее число записей в векторном слое или таблице.

  • Случайные OID выбираются с помощью модуля Python random random.sample(population, k), где population — список значений OID, а k — размер выборки.

  • Результатом работы этого инструмента является случайная выборка записей из значения параметра Входные строки на основе значения параметра Метод выборки.

  • Используйте дополнительный параметр Выходной файл, чтобы создать файл .json, включающий следующее:

    • Дата и время запуска инструмента

    • Рабочая область, из которой поступают входные данные

    • Название входных векторных слоев или таблиц

    • Общее число выбранных записей.

    • OID выбранных записей

    • SQL-выражение, которое использовалось для создания выборки

  • Все выборки, сделанные в параметре Входные строки, будут реализованы независимо от того, отключен ли переключатель Использовать выбранные записи.

  • Перед запуском этого инструмента в векторном слое или таблице должно быть поле ObjectID.

  • Если кнопка Использовать выбранные записи выключена, значение параметра Выходной файл записывает случайную выборку объектов на основе всего набора данных. Однако если применен определяющий запрос, во фрейме карты будут выбраны только объекты или строки, соответствующие запросу.

Параметры

Подпись Объяснение Тип данных

Входные строки

Данные, к которым будет применена выборка.

Feature Layer; Table View

Метод выборки

Определяет метод выборки, который будет использоваться.

  • Фиксированное числоЧисло выбранных записей будет основано на значении параметра Число записей.

  • ПроцентЧисло выбранных записей будет основано на значении параметра Процент записей.

  • Автоматическое вычислениеЧисло выбранных записей будет основано на вычислении с использованием значений параметров уровня доверия и допустимой погрешности.

String

Число записей

(Дополнительный)

Число записей, которые будут выбраны.

Этот параметр активен, если значение параметра Метод выборки равно Фиксированное число.

Long

Процент записей

(Дополнительный)

Процент записей во входных данных, которые будут выбраны.

Этот параметр активен, если значением параметра Метод выборки является Процент.

Long

Уровень доверия

(Дополнительный)

Уровень доверия — это вероятность того, что размер выборки статистически значим, выраженная в процентах, например, 98 или 95.

Этот параметр будет использоваться для расчета z-статистики (z).

Z-статистика может быть вычислена с помощью модуля scipy.stats z=scipy.stats.norm.ppf(1-(1-confidence_level)/2).

Этот параметр активен, если значением параметра Метод выборки является Автоматическое вычисление.

Long

Предел погрешности

(Дополнительный)

Предельно допустимая погрешность в уровне доверия, введенная в процентах, например, 8 или 5.

Этот параметр использует вычисленную z-статистику (z) для расчета фактического размера выборки (n') с использованием следующих уравнений: n=((z/m)^2)*(p*(1-p)) до n'=(n*N)/(n+(N-1)).

Этот параметр активен, если значением параметра Метод выборки является Автоматическое вычисление.

Long

Выходной файл

(Дополнительный)

Выходной файл .json, который будет содержать запись выбранных данных.

File

Производные выходные данные

Подпись Объяснение Тип данных

Обновленные строки

Обновленный входной слой с применением выборки.

Feature Layer; Table View

Параметры среды

Текущая рабочая область

Информация о лицензировании

  • Basic: Требуется Data Reviewer
  • Standard: Требуется Data Reviewer
  • Advanced: Требуется Data Reviewer