Seleccionar muestra aleatoria (Herramientas de Data Reviewer)
Resumen
Selecciona una muestra aleatoria de las entidades o filas de entrada según el método de muestreo especificado.
El resultado es una selección realizada en la capa de entrada en el marco del mapa. La herramienta también puede crear un archivo .json que registra los Id. de objeto (OID) seleccionados y la expresión SQL utilizada para la selección. La selección se puede utilizar para los flujos de trabajo de la herramienta de revisión visual Examinar entidades y de la herramienta Ejecutar comprobaciones de datos.
Uso
El parámetro Método de muestreo ofrece las siguientes opciones:
Número fijo: el número de registros seleccionados se basará en el valor del parámetro Número de registros.
Porcentaje: el número de registros seleccionados se basará en el valor del parámetro Porcentaje de registros.
Cálculo automático: el número de registros seleccionados se basará en un cálculo que utiliza los valores de los parámetros Nivel de confianza y Margen de error.
La opción Calcular automáticamente del parámetro Método de muestreo utiliza las siguientes variables para calcular el número de registros:
\[ \begin{align*} z &= \text{scipy.stats.norm.ppf}\left(1 - \frac{1 - \text{confidence\_level}}{2}\right) \\ n &= \left(\frac{z}{m}\right)^2 \cdot \left(p \cdot (1 - p)\right) \\ n' &= \frac{n \cdot N}{n + (N - 1)} \end{align*} \]La estadística z para el nivel de confianza deseado (z). La estadística z se calcula utilizando la variable del nivel de confianza y el módulo
scipy.statsz=scipy.stats.norm.ppf(1-(1-confidence_level)/2).El margen de error aceptable en el intervalo de confianza (m).
La probabilidad (p) es mayor en 0,5 porque no hay datos históricos sobre si un determinado porcentaje de registros se aprobará o suspenderá. Dado que las probabilidades de que los registros se aprueben o suspendan son iguales, 0,5 es el valor más conservador que se puede utilizar en la ecuación de varianza.
El tamaño de la población (N) es el número total de registros en una capa de entidades o tabla.
Se seleccionan OID aleatorios utilizando el módulo
randomde Pythonrandom.sample(population, k), dondepopulationes la lista de valores de OID ykes el tamaño de la muestra.El resultado de esta herramienta es una selección aleatoria de registros del valor del parámetro Filas de entrada, basada en el valor del parámetro Método de muestreo.
Utilice el parámetro opcional Archivo de salida para crear un archivo
.jsonque incluya lo siguiente:La fecha y hora en que se ejecutó la herramienta
El espacio de trabajo del que se obtiene la entrada
El nombre de las capas o tablas de entidades de entrada
El número total de registros seleccionados
Los OID de los registros seleccionados
La expresión SQL que se utilizó para realizar la selección
Se implementarán todas las selecciones realizadas en el parámetro Filas de entrada, independientemente de si el botón de alternancia Usar los registros seleccionados está desactivado.
La tabla o capa de entidades debe tener un campo
ObjectIDantes de ejecutar esta herramienta.Si el botón de alternancia Usar los registros seleccionados está desactivado, el valor del parámetro Archivo de salida registrará una selección aleatoria de entidades basada en todo el dataset. Sin embargo, si se aplica una consulta de definición, solo se seleccionarán en el marco del mapa las entidades o filas que coincidan con la consulta.
Parámetros
| Etiqueta | Explicación | Tipo de datos |
|---|---|---|
|
Filas de entrada |
Datos a los que se aplicará la selección. |
Feature Layer; Table View |
|
Método de muestreo |
Especifica el método de muestreo que se utilizará.
|
String |
|
Número de registros (Opcional) |
Número de registros que se seleccionarán. Este parámetro está activo si el valor del parámetro Método de muestreo es Número fijo. |
Long |
|
Porcentaje de registros (Opcional) |
Porcentaje de registros de la entrada que se seleccionarán. Este parámetro está activo si el valor del parámetro Método de muestreo es Porcentaje. |
Long |
|
Nivel de confianza (Opcional) |
El nivel de confianza es la probabilidad de que un tamaño de muestra sea estadísticamente significativo, introducido como un porcentaje, por ejemplo, 98 o 95. Este parámetro se utilizará para calcular la estadística z (z). La estadística z se puede calcular mediante el módulo Este parámetro está activo si el valor del parámetro Método de muestreo es Calcular automáticamente. |
Long |
|
Margen de error (Opcional) |
Margen de error aceptable en el intervalo de confianza (m), especificado como porcentaje, por ejemplo, 8 o 5. Este parámetro utiliza la estadística z calculada (z) para calcular el tamaño real de la muestra (n') utilizando las siguientes ecuaciones: de <!-- Este parámetro está activo si el valor del parámetro Método de muestreo es Calcular automáticamente. |
Long |
|
Archivo de salida (Opcional) |
Archivo |
File |
Salida derivada
| Etiqueta | Explicación | Tipo de datos |
|---|---|---|
|
Filas actualizadas |
Entradas actualizadas con las selecciones aplicadas. |
Feature Layer; Table View |
Entornos
Información de licenciamiento
- Basic: Requiere Data Reviewer
- Standard: Requiere Data Reviewer
- Avanzado: Requiere Data Reviewer