Случайная выборка образца (Data Reviewer)
Краткая информация
Выбирает случайную выборку входных объектов или строк на основе указанного метода выборки.
Выходные данные представляют собой выборку, сделанную на входном слое в рамке карты. Также инструмент может создать файл .json, в котором записаны идентификаторы выбранных объектов (OID) и SQL-выражение, используемое для выборки. Выборку можно использовать для инструмента визуального обзора Просмотр объектов и рабочих процессов инструмента Запустить проверки данных.
Использование
Параметр Метод выборки содержит следующие опции:
Фиксированное число— число выбранных записей будет зависеть от значения параметра Число записей.
Процент— число выбранных записей будет основано на значении параметра Процент записей.
Автоматическое вычисление— число выбранных записей будет основано на вычислении с использованием значений параметров Уровень доверия и Предел погрешности.
У параметра Метод выборки есть опция Автоматическое вычисление, использующая следующие переменные для вычисления числа записей:
\[ \begin{align*} z &= \text{scipy.stats.norm.ppf}\left(1 - \frac{1 - \text{confidence\_level}}{2}\right) \\ n &= \left(\frac{z}{m}\right)^2 \cdot \left(p \cdot (1 - p)\right) \\ n' &= \frac{n \cdot N}{n + (N - 1)} \end{align*} \]Z-статистика для желаемого уровня доверия (z). Z-статистика вычисляется с использованием переменной уровня доверия и
scipy.statsмодуляz=scipy.stats.norm.ppf(1-(1-confidence_level)/2).Предельно допустимая величина ошибки в доверительном интервале (m).
Вероятность (p) достигает максимума при 0,5, поскольку отсутствуют какие-либо предыдущие знания о том, будет ли определенный процент записей проверен или нет. Поскольку шансы на то, что записи пройдут или не пройдут, равны, 0,5 является наиболее консервативным значением для использования в уравнении дисперсии.
Размер совокупности (N) — это общее число записей в векторном слое или таблице.
Случайные OID выбираются с помощью модуля Python
randomrandom.sample(population, k), гдеpopulation— список значений OID, аk— размер выборки.Результатом работы этого инструмента является случайная выборка записей из значения параметра Входные строки на основе значения параметра Метод выборки.
Используйте дополнительный параметр Выходной файл, чтобы создать файл
.json, включающий следующее:Дата и время запуска инструмента
Рабочая область, из которой поступают входные данные
Название входных векторных слоев или таблиц
Общее число выбранных записей.
OID выбранных записей
SQL-выражение, которое использовалось для создания выборки
Все выборки, сделанные в параметре Входные строки, будут реализованы независимо от того, отключен ли переключатель Использовать выбранные записи.
Перед запуском этого инструмента в векторном слое или таблице должно быть поле
ObjectID.Если кнопка Использовать выбранные записи выключена, значение параметра Выходной файл записывает случайную выборку объектов на основе всего набора данных. Однако если применен определяющий запрос, во фрейме карты будут выбраны только объекты или строки, соответствующие запросу.
Параметры
| Подпись | Объяснение | Тип данных |
|---|---|---|
|
Входные строки |
Данные, к которым будет применена выборка. |
Feature Layer; Table View |
|
Метод выборки |
Определяет метод выборки, который будет использоваться.
|
String |
|
Число записей (Дополнительный) |
Число записей, которые будут выбраны. Этот параметр активен, если значение параметра Метод выборки равно Фиксированное число. |
Long |
|
Процент записей (Дополнительный) |
Процент записей во входных данных, которые будут выбраны. Этот параметр активен, если значением параметра Метод выборки является Процент. |
Long |
|
Уровень доверия (Дополнительный) |
Уровень доверия — это вероятность того, что размер выборки статистически значим, выраженная в процентах, например, 98 или 95. Этот параметр будет использоваться для расчета z-статистики (z). Z-статистика может быть вычислена с помощью модуля Этот параметр активен, если значением параметра Метод выборки является Автоматическое вычисление. |
Long |
|
Предел погрешности (Дополнительный) |
Предельно допустимая погрешность в уровне доверия, введенная в процентах, например, 8 или 5. Этот параметр использует вычисленную z-статистику (z) для расчета фактического размера выборки (n') с использованием следующих уравнений: Этот параметр активен, если значением параметра Метод выборки является Автоматическое вычисление. |
Long |
|
Выходной файл (Дополнительный) |
Выходной файл |
File |
Производные выходные данные
| Подпись | Объяснение | Тип данных |
|---|---|---|
|
Обновленные строки |
Обновленный входной слой с применением выборки. |
Feature Layer; Table View |
Параметры среды
Информация о лицензировании
- Basic: Требуется Data Reviewer
- Standard: Требуется Data Reviewer
- Advanced: Требуется Data Reviewer