Skip to main content

Sélectionner un échantillonnage aléatoire (Outils Data Reviewer)

Résumé

Sélectionne un échantillon aléatoire d’entités ou de lignes en entrée en fonction de la méthode d’échantillonnage spécifiée.

La sortie est une sélection effectuée sur la couche en entrée dans la fenêtre cartographique. L’outil peut également créer un fichier .json qui enregistre les identifiants d’objets (OID) sélectionnés, ainsi que l’expression SQL utilisée pour la sélection. La sélection peut être utilisée pour les processus de l’outil de révision visuelle Browse Features (Parcourir les entités) et de l’outil Run Data Checks (Exécuter des vérifications des données).

Utilisation

  • Le paramètre Sample Method (Méthode d’échantillonnage) comporte les options suivantes :

    • Fixed Number (Nombre fixe) : le nombre d’enregistrements sélectionnés est basé sur la valeur du paramètre Number of Records (Nombre d’enregistrements).

    • Percentage (Pourcentage) : le nombre d’enregistrements sélectionnés est basé sur la valeur du paramètre Percentage of Records (Pourcentage d’enregistrements).

    • Auto Calculate (Calculer automatiquement) : le nombre d’enregistrements sélectionnés est basé sur un calcul utilisant les valeurs de paramètre Confidence Level (Niveau de confiance) et Margin of Error (Marge d’erreur).

  • L’option Auto Calculate (Calculer automatiquement) du paramètre Sample Method (Méthode d’échantillonnage) utilise les variables suivantes pour calculer le nombre d’enregistrements :

    \[ \begin{align*} z &= \text{scipy.stats.norm.ppf}\left(1 - \frac{1 - \text{confidence\_level}}{2}\right) \\ n &= \left(\frac{z}{m}\right)^2 \cdot \left(p \cdot (1 - p)\right) \\ n' &= \frac{n \cdot N}{n + (N - 1)} \end{align*} \]
    • Statistique z pour le niveau de confiance souhaité (z). La statistique z est calculée à l’aide de la variable du niveau de confiance et du module scipy.stats z=scipy.stats.norm.ppf(1-(1-confidence_level)/2).

    • Marge d’erreur acceptable dans l’intervalle de confiance (m).

    • La probabilité (p) est la plus élevée à 0,5 car il n’existe pas de connaissance antérieure indiquant si un certain pourcentage d’enregistrements réussit ou échoue. Étant donné que les chances de réussite ou d’échec des enregistrements sont équivalentes, 0,5 est la valeur la plus classique à utiliser dans l’équation de variance.

    • La taille de population (N) est le nombre total d’enregistrements dans une couche d’entités ou une table.

  • Les OID aléatoires sont sélectionnés à l’aide du module random random.sample(population, k), où population représente la liste des valeurs d’OID et k, la taille de l’échantillon.

  • La sortie de cet outil est une sélection aléatoire d’enregistrements provenant de la valeur du paramètre Input Rows (Enregistrements en entrée), basée sur la valeur du paramètre Sample Method (Méthode d’échantillonnage).

  • Utilisez le paramètre facultatif Output File (Fichier en sortie) pour créer un fichier .json incluant les éléments suivants :

    • Date et heure à laquelle l’outil a été exécuté

    • L’espace de travail dont provient l’entrée

    • Le nom des couches ou tables d’entités en entrée

    • Le nombre total d’enregistrements sélectionnés

    • Les OID des enregistrements sélectionnés

    • L’expression SQL qui a été utilisée pour effectuer la sélection

  • Toutes les sélections effectuées dans le paramètre Input Rows (Enregistrements en entrée) sont implémentées, même si le bouton bascule Use the selected records (Utiliser les enregistrements sélectionnés) est désactivé.

  • La table ou couche d’entités doit avoir un champ ObjectID avant d’exécuter cet outil.

  • Si le bouton bascule Use the selected records (Utiliser les enregistrements sélectionnés) est désactivé, la valeur du paramètre Output File (Fichier en sortie) enregistre une sélection aléatoire des entités en fonction de la totalité du jeu de données. Toutefois, si un ensemble de définition est appliqué, seules les entités ou les lignes correspondant à la requête sont sélectionnées dans la fenêtre cartographique.

Paramètres

Etiqueter Explication Type de données

Enregistrements en entrée

Données auxquelles s’applique la sélection.

Feature Layer; Table View

Méthode d’échantillonnage

Spécifie la méthode d’échantillonnage à utiliser.

  • Nombre fixeLe nombre d’enregistrements sélectionnés se base sur la valeur du paramètre Nombre d’enregistrements.

  • PourcentageLe nombre d’enregistrements sélectionnés est basé sur la valeur du paramètre Pourcentage d’enregistrements.

  • Calculer automatiquementLe nombre d’enregistrements sélectionnés se base sur un calcul utilisant les valeurs de paramètre Niveau de confiance et Marge d’erreur.

String

Nombre d’enregistrements

(Facultatif)

Nombre d’enregistrements qui seront sélectionnés.

Ce paramètre est actif si la valeur du paramètre Sample Method (Méthode d’échantillonnage) est Fixed Number (Nombre fixe).

Long

Pourcentage d’enregistrements

(Facultatif)

Pourcentage d’enregistrements dans l’entrée qui seront sélectionnées.

Ce paramètre est actif si la valeur du paramètre Sample Method (Méthode d’échantillonnage) est Percentage (Pourcentage).

Long

Niveau de confiance

(Facultatif)

Le niveau de confiance est la probabilité qu’une taille de l’échantillon, saisie sous forme de pourcentage, comme 98 ou 95, soit statistiquement pertinente.

Ce paramètre est utilisé pour calculer la statistique z (z).

Il est possible de calculer la statistique z à l’aide du module scipy.stats z=scipy.stats.norm.ppf(1-(1-confidence_level)/2).

Ce paramètre est actif si la valeur du paramètre Sample Method (Méthode d’échantillonnage) est Auto Calculate (Calculer automatiquement).

Long

Marge d’erreur

(Facultatif)

Marge d’erreur acceptable dans le niveau de confiance, saisie sous forme de pourcentage, comme 8 ou 5.

Ce paramètre utilise la statistique‎ z calculée (z) pour calculer la taille réelle de l’échantillon (n’) à l’aide des équations suivantes : n=((z/m)^2)*(p*(1-p)) à n'=(n*N)/(n+(N-1)).

Ce paramètre est actif si la valeur du paramètre Sample Method (Méthode d’échantillonnage) est Auto Calculate (Calculer automatiquement).

Long

Fichier en sortie

(Facultatif)

Fichier .json en sortie qui doit contenir un enregistrement des données sélectionnées.

File

Sortie dérivée

Etiqueter Explication Type de données

Enregistrements mis à jour

Entrée mise à jour avec les sélections appliquées.

Feature Layer; Table View

Environnements

Espace de travail courant

Informations de licence

  • Basic: Requiert Data Reviewer
  • Standard: Requiert Data Reviewer
  • Advanced: Requiert Data Reviewer