Sélectionner un échantillonnage aléatoire (Outils Data Reviewer)
Résumé
Sélectionne un échantillon aléatoire d’entités ou de lignes en entrée en fonction de la méthode d’échantillonnage spécifiée.
La sortie est une sélection effectuée sur la couche en entrée dans la fenêtre cartographique. L’outil peut également créer un fichier .json qui enregistre les identifiants d’objets (OID) sélectionnés, ainsi que l’expression SQL utilisée pour la sélection. La sélection peut être utilisée pour les processus de l’outil de révision visuelle Browse Features (Parcourir les entités) et de l’outil Run Data Checks (Exécuter des vérifications des données).
Utilisation
Le paramètre Sample Method (Méthode d’échantillonnage) comporte les options suivantes :
Fixed Number (Nombre fixe) : le nombre d’enregistrements sélectionnés est basé sur la valeur du paramètre Number of Records (Nombre d’enregistrements).
Percentage (Pourcentage) : le nombre d’enregistrements sélectionnés est basé sur la valeur du paramètre Percentage of Records (Pourcentage d’enregistrements).
Auto Calculate (Calculer automatiquement) : le nombre d’enregistrements sélectionnés est basé sur un calcul utilisant les valeurs de paramètre Confidence Level (Niveau de confiance) et Margin of Error (Marge d’erreur).
L’option Auto Calculate (Calculer automatiquement) du paramètre Sample Method (Méthode d’échantillonnage) utilise les variables suivantes pour calculer le nombre d’enregistrements :
\[ \begin{align*} z &= \text{scipy.stats.norm.ppf}\left(1 - \frac{1 - \text{confidence\_level}}{2}\right) \\ n &= \left(\frac{z}{m}\right)^2 \cdot \left(p \cdot (1 - p)\right) \\ n' &= \frac{n \cdot N}{n + (N - 1)} \end{align*} \]Statistique z pour le niveau de confiance souhaité (z). La statistique z est calculée à l’aide de la variable du niveau de confiance et du module
scipy.statsz=scipy.stats.norm.ppf(1-(1-confidence_level)/2).Marge d’erreur acceptable dans l’intervalle de confiance (m).
La probabilité (p) est la plus élevée à 0,5 car il n’existe pas de connaissance antérieure indiquant si un certain pourcentage d’enregistrements réussit ou échoue. Étant donné que les chances de réussite ou d’échec des enregistrements sont équivalentes, 0,5 est la valeur la plus classique à utiliser dans l’équation de variance.
La taille de population (N) est le nombre total d’enregistrements dans une couche d’entités ou une table.
Les OID aléatoires sont sélectionnés à l’aide du module
randomrandom.sample(population, k), oùpopulationreprésente la liste des valeurs d’OID etk, la taille de l’échantillon.La sortie de cet outil est une sélection aléatoire d’enregistrements provenant de la valeur du paramètre Input Rows (Enregistrements en entrée), basée sur la valeur du paramètre Sample Method (Méthode d’échantillonnage).
Utilisez le paramètre facultatif Output File (Fichier en sortie) pour créer un fichier
.jsonincluant les éléments suivants :Date et heure à laquelle l’outil a été exécuté
L’espace de travail dont provient l’entrée
Le nom des couches ou tables d’entités en entrée
Le nombre total d’enregistrements sélectionnés
Les OID des enregistrements sélectionnés
L’expression SQL qui a été utilisée pour effectuer la sélection
Toutes les sélections effectuées dans le paramètre Input Rows (Enregistrements en entrée) sont implémentées, même si le bouton bascule Use the selected records (Utiliser les enregistrements sélectionnés) est désactivé.
La table ou couche d’entités doit avoir un champ
ObjectIDavant d’exécuter cet outil.Si le bouton bascule Use the selected records (Utiliser les enregistrements sélectionnés) est désactivé, la valeur du paramètre Output File (Fichier en sortie) enregistre une sélection aléatoire des entités en fonction de la totalité du jeu de données. Toutefois, si un ensemble de définition est appliqué, seules les entités ou les lignes correspondant à la requête sont sélectionnées dans la fenêtre cartographique.
Paramètres
| Etiqueter | Explication | Type de données |
|---|---|---|
|
Enregistrements en entrée |
Données auxquelles s’applique la sélection. |
Feature Layer; Table View |
|
Méthode d’échantillonnage |
Spécifie la méthode d’échantillonnage à utiliser.
|
String |
|
Nombre d’enregistrements (Facultatif) |
Nombre d’enregistrements qui seront sélectionnés. Ce paramètre est actif si la valeur du paramètre Sample Method (Méthode d’échantillonnage) est Fixed Number (Nombre fixe). |
Long |
|
Pourcentage d’enregistrements (Facultatif) |
Pourcentage d’enregistrements dans l’entrée qui seront sélectionnées. Ce paramètre est actif si la valeur du paramètre Sample Method (Méthode d’échantillonnage) est Percentage (Pourcentage). |
Long |
|
Niveau de confiance (Facultatif) |
Le niveau de confiance est la probabilité qu’une taille de l’échantillon, saisie sous forme de pourcentage, comme 98 ou 95, soit statistiquement pertinente. Ce paramètre est utilisé pour calculer la statistique z (z). Il est possible de calculer la statistique z à l’aide du module Ce paramètre est actif si la valeur du paramètre Sample Method (Méthode d’échantillonnage) est Auto Calculate (Calculer automatiquement). |
Long |
|
Marge d’erreur (Facultatif) |
Marge d’erreur acceptable dans le niveau de confiance, saisie sous forme de pourcentage, comme 8 ou 5. Ce paramètre utilise la statistique z calculée (z) pour calculer la taille réelle de l’échantillon (n’) à l’aide des équations suivantes : Ce paramètre est actif si la valeur du paramètre Sample Method (Méthode d’échantillonnage) est Auto Calculate (Calculer automatiquement). |
Long |
|
Fichier en sortie (Facultatif) |
Fichier |
File |
Sortie dérivée
| Etiqueter | Explication | Type de données |
|---|---|---|
|
Enregistrements mis à jour |
Entrée mise à jour avec les sélections appliquées. |
Feature Layer; Table View |
Environnements
Informations de licence
- Basic: Requiert Data Reviewer
- Standard: Requiert Data Reviewer
- Advanced: Requiert Data Reviewer