Skip to main content

Évaluer les prévisions avec la validation croisée (Outils de statistiques spatiales)

Résumé

Évalue les performances d’un modèle prédictif à l’aide de la validation croisée. Cet outil génère des métriques de validation pour les modèles créés à l’aide des outils Classification et régression basées sur une forêt et à boosting de gradient, Régression linéaire généralisée et Prévision de présence seule. Il vous permet de spécifier le type d’évaluation (par exemple, K blocs ou K blocs spatiaux), le nombre de groupes et l’équilibrage des événements rares pour garantir une évaluation fiable et non biaisée du modèle.

En savoir plus sur le fonctionnement de l’outil Évaluer les prévisions avec la validation croisée

Illustration

Illustration de l’outil Évaluer les prévisions avec la validation croisée

Utilisation

  • Le paramètre Evaluation Type (Type d’évaluation) comporte les options suivantes pour fractionner les entités en groupes :

    • Spatial k-fold (K blocs spatiaux) : utilisez la validation croisée spatiale pour évaluer la façon dont un modèle prévoit les entités qui se trouvent géographiquement à l’extérieur de la zone d’étude des données d’entraînement.

    • Random k-fold (K blocs aléatoires) : utilisez la validation croisée aléatoire pour évaluer la façon dont un modèle prévoit les entités qui se trouvent géographiquement à l’intérieur de la zone d’étude des données d’entraînement.

  • Lorsque vous utilisez la classification pour prévoir des événements rares ou des catégories non équilibrées, utilisez le paramètre Balancing Type (Type d’équilibrage) pour équilibrer le nombre d’échantillons dans chaque niveau catégoriel. Testez les différentes méthodes d’équilibrage dans cet outil. Sélectionnez ensuite la plus performante et exécutez-la sur le jeu de données d’entraînement complet avant de réaliser les prévisions à l’aide de l’outil Préparer les données pour la prévision.

  • La validation croisée n’est pas utilisée pour générer un seul modèle ou fichier de modèle. Elle génère des métriques de précision qui permettent d’évaluer la façon dont un modèle et ses paramètres prévoient des données qui ont été exclues lors de l’entraînement du modèle.

  • Cet outil n’accepte pas les entités d’analyse qui ont d’abord été sur-échantillonnées dans l’outil Préparer les données pour la prévision, c’est-à-dire équilibrées avec le sur-échantillonnage aléatoire ou la méthode SMOTE. Les données sur-échantillonnées ne peuvent pas être utilisées dans un jeu de validation à cause des pertes de données.

  • Les paramètres de l’outil de prévision d’origine sont respectés. Toutefois, pour les résultats d’analyse de l’outil Classification et régression basées sur une forêt et à boosting de gradient, les données de validation sont définies sur 0. Si le paramètre Optimize Parameters (Optimiser les paramètres) a été utilisé dans l’outil Classification et régression basées sur une forêt et à boosting de gradient, les paramètres optimaux de l’exécution d’origine de l’outil sont utilisés pour la validation croisée.

  • L’outil crée les sorties suivantes :

    • Output Features—Enregistre le jeu de données d’entraînement ainsi que les résultats d’entraînement et de prévision de chaque entité dans le jeu de données d’entraînement.

    • Output Validation Table—Enregistre les métriques d’évaluation pour chaque exécution de validation.

    L’outil produit également de nombreux messages de géotraitement, notamment la table Statistiques de diagnostic moyennes hors échantillon.

Paramètres

Etiqueter Explication Type de données

Entités de résultat d’analyse

Classe d’entités contenant les résultats en sortie de l’entraînement de l’outil Classification et régression basées sur une forêt et à boosting de gradient, Régression linéaire généralisée ou Prévision de présence seule. Les résultats d’entraînement de prévision seront évalués avec la validation croisée.

Feature Layer

Entités en sortie

Entités en sortie qui contiendront les variables indépendantes d’origine, la variable dépendante et les champs supplémentaires synthétisant les résultats de la validation croisée.

Feature Class

Table de validation en sortie

Table en sortie qui contiendra les métriques d’évaluation pour chaque exécution de validation croisée.

Table

Entités d’entrée d’analyse

Entités en entrée qui seront utilisées dans l’analyse prédictive qui a produit les entités de résultat d’analyse.

Feature Layer

Type d'évaluation

(Facultatif)

Désigne la méthode à utiliser pour fractionner la valeur du paramètre Analysis Result Features (Entités de résultat d’analyse) en K groupes.

  • K blocs aléatoiresLes entités de résultat d’analyse seront fractionnées de manière aléatoire en K groupes. Chaque groupe contiendra un nombre d’entités identique ou similaire. Si vous prévoyez des catégories (classification), chaque catégorie dans la variable dépendante apparaîtra dans chaque groupe d’entraînement. Il s’agit de l’option par défaut.

  • K blocs spatiauxLes entités de résultat d’analyse seront fractionnées spatialement en K groupes à l’aide de l’agrégation par K-moyennes sur les points ou centroïdes de polygones en entrée. Si vous prévoyez des catégories (classification), chaque catégorie dans la variable dépendante apparaîtra dans chaque groupe d’entraînement. Chaque groupe est séparé spatialement des autres.

String

Nombre de groupes

(Facultatif)

Nombre de groupes dans lesquels la valeur du paramètre Analysis Result Features (Entités de résultat d’analyse) est fractionnée. Le nombre de groupes doit être supérieur à 1. La valeur par défaut est 10.

Long

Type d’équilibrage

(Facultatif)

Indique la méthode qui sera utilisée pour équilibrer le nombre d’échantillons de chaque catégorie de variable dépendante dans le groupe d’entraînement. Ce paramètre est actif si le modèle d’origine prévoit une variable catégorielle.

  • AucunLes entités de résultat d’analyse ne seront pas équilibrées. Il s’agit de l’option par défaut.

  • Sous-échantillonnage aléatoireLes entités aléatoires sont supprimées de chaque classe non minoritaire jusqu’à ce que le nombre d’entités corresponde au nombre d’entités dans la classe minoritaire.

  • Sous-échantillonnage TomekLes entités de chaque classe non minoritaire qui sont proches des entités de la classe minoritaire seront supprimées. Cette méthode améliore la limite entre les classes ; toutefois, chaque classe peut comporter un nombre différent d’entités.

  • Sous-échantillonnage des K-médoïdesLes entités de la classe non minoritaire qui ne sont pas représentatives de la classe seront supprimées jusqu’à ce que le nombre d’entités corresponde au nombre d’entités dans la classe minoritaire.

  • Sur-échantillonnage aléatoireLes entités de la classe minoritaire seront dupliquées de manière aléatoire jusqu’à ce que le nombre d’entités corresponde au nombre d’entités de la classe majoritaire.

  • SMOTE (sur-échantillonnage)Des entités synthétiques seront générées pour la classe minoritaire par interpolation entre les entités existantes jusqu’à ce que le nombre d’entités corresponde au nombre d’entités de la classe majoritaire.

String

Environnements

Générateur de nombres aléatoires, Système de coordonnées en sortie, Facteur de traitement parallèle

Informations de licence

  • Basic: Limité
    Spatial Analyst est requis pour utiliser des rasters.
  • Standard: Limité
    Spatial Analyst est requis pour utiliser des rasters.
  • Advanced: Limité
    Spatial Analyst est requis pour utiliser des rasters.