Préparer les données pour la prévision (Outils de statistiques spatiales)
Résumé
Améliore les données pour les flux de travail prédictifs dans les outils Classification et régression basées sur une forêt et boostées, Régression linéaire généralisée et Prévision de présence uniquement, ainsi que dans d’autres modèles. Cela implique le fractionnement des entités en jeux d’entraînement et de test, l’extraction des variables à partir de rasters et d’entités de distance, l’équilibrage des données pour une meilleure précision de la classification et l’affinage spatial sur les données spatiales biaisées.
En savoir plus sur le fonctionnement de l’outil Préparer les données pour la prévision
Illustration

Utilisation
Les données d’entraînement ayant fait l’objet d’un équilibrage doivent uniquement être utilisées pour entraîner des modèles prédictifs. Les modèles ne doivent pas être validés sur des données ayant été équilibrées afin d’éviter les biais de précision et la fuite de données.
Une extension ArcGIS Spatial Analyst est requise pour utiliser des rasters en tant que variables explicatives.
Si vous utilisez la classification pour prédvoir des événements rares ou des catégories non équilibrées, utilisez le paramètre Balancing Type (Type d’équilibrage) pour équilibrer le nombre d’échantillons dans chaque niveau catégoriel. Les méthodes de sur-échantillonnage augmentent le nombre d’entités globales et les méthodes de sous-échantillonnage entraînent la diminution du nombre d’entités globales.
Lorsque le paramètre Splitting Type (Type de fractionnement) est défini sur Random Split (Fractionnement aléatoire) ou sur Spatial Split (Fractionnement spatial), les entités de test en sortie peuvent être utilisées pour évaluer la précision du modèle à l’aide de l’outil Prévoir à l’aide d’un fichier de modèle de statistiques spatiales. Vérifiez que la sortie est un fichier de modèle de statistiques spatiales lorsque vous exécutez l’outil d’analyse choisi.
Lorsque le paramètre Splitting Type (Type de fractionnement) est défini sur Random Split (Fractionnement aléatoire) ou sur Spatial Split (Fractionnement spatial), l’outil s’assure que tous les niveaux catégoriels de la variable à prévoir et de toutes les variables explicatives sont présents dans les entités d’entraînement en sortie. Il n’est pas nécessaire que tous les niveaux catégoriels soient présents dans le jeu de données de test.
Paramètres
| Etiqueter | Explication | Type de données |
|---|---|---|
|
Input Features (Entités en entrée) |
Entités sur lesquelles le fractionnement, l’extraction et l’équilibrage doivent être effectués. |
Feature Class |
|
Entités en sortie |
Entités en sortie utilisées comme entités d’entraînement dans un outil de modèle. |
Feature Class |
|
Type de fractionnement (Facultatif) |
Indique la méthode utilisée pour fractionner les entités en entrée en sous-ensembles d’entraînement et de test.
|
String |
|
Sous-ensemble d’entités de test en sortie (Facultatif) |
Sous-ensemble de la valeur du paramètre Input Features (Entités en entrée) qui peut être utilisé comme entités de test. Ce paramètre est disponible lorsque le paramètre Splitting Type (Type de fractionnement) est défini sur Random Split (Fractionnement aléatoire) ou sur Spatial Split (Fractionnement spatial). |
Feature Class |
|
Variable à prévoir (Facultatif) |
Variable de la valeur du paramètre Input Features (Entités en entrée) contenant les valeurs à utiliser pour entraîner un modèle. Ce champ contient des valeurs (d’entraînement) connues de la variable qui sera utilisée pour réaliser des prévisions à des localisations inconnues. |
Field |
|
Traiter les variables comme catégorielles (Facultatif) |
Indique si la valeur de paramètre Variable to Predict (Variable à prévoir) est traitée comme une variable catégorielle.
|
Boolean |
|
Variables explicatives (Facultatif) |
Liste des champs qui représentent les variables explicatives utilisées pour prévoir la valeur ou la catégorie de la valeur du paramètre Variable to Predict (Variable à prévoir). Cochez la case Categorical (Catégoriel) pour toutes les variables qui représentent des classes ou des catégories (par exemple, l’occupation du sol, la présence ou l’absence). Colonnes de la table de valeurs :
|
Value Table |
|
Entités de distance explicatives (Facultatif) |
Les entités de distance d’entraînement explicatives. Les variables explicatives sont automatiquement créées en calculant la distance entre les entités fournies et les valeurs du paramètre Input Features (Entités en entrée). Les distances sont calculées entre chacune des entités indiquées dans la valeur du paramètre Input Features (Entités en entrée) et l’entité la plus proche dans ce paramètre. Si la valeur de ce paramètre indique des polygones ou des lignes, les attributs de distance sont calculés comme la distance entre les segments les plus proches de la paire d’entités. |
Feature Layer |
|
Rasters explicatifs (Facultatif) |
Les variables d’entraînement explicatives extraites de rasters. Les variables d’entraînement explicatives sont automatiquement créées en extrayant des valeurs de cellule raster. Pour chacune des entités indiquées par la valeur du paramètre Input Features (Entités en entrée), la valeur de la cellule raster est extraite à la localisation exacte. Pour les rasters continus, la valeur de raster est extraite par la méthode de rééchantillonnage bilinéaire de raster. Pour les rasters catégoriels, la valeur de raster est extraite par la méthode d’affectation du voisin le plus proche. Cochez la case Categorical (Catégoriel) des rasters qui représentent des classes ou des catégories (comme l’occupation du sol, la présence ou l’absence). Colonnes de la table de valeurs :
|
Value Table |
|
Convertir les polygones en résolution raster pour l'entraînement (Facultatif) |
Détermine le mode de traitement des polygones si les valeurs du paramètre Input Features (Entités en entrée) sont des polygones avec une valeur catégorielle pour le paramètre Variable to Predict (Variable à prévoir) et que seules des valeurs du paramètre Explanatory Rasters (Rasters explicatifs) ont été fournies.
|
Boolean |
|
Pourcentage de données comme sous-ensemble de test (Facultatif) |
Pourcentage des entités en entrée qui est réservé en tant que jeu de données de test ou de validation. La valeur par défaut est 10. |
Double |
|
Type d’équilibrage (Facultatif) |
Spécifie la méthode utilisée pour équilibrer la valeur du paramètre non équilibré Variable to Predict (Variable à prévoir) ou le biais spatial des entités en entrée. La méthode d’équilibrage est appliquée uniquement à la valeur du paramètre Output Features (Entités en sortie).
|
String |
|
Distance minimale par rapport au plus proche voisin (Facultatif) |
Distance minimale entre deux points quelconques ou entre deux points de la même catégorie de la valeur du paramètre Variable to Predict (Variable à prévoir) lorsque l’affinage spatial est appliqué. |
Linear Unit |
|
Nombre d’itération pour l’affinage (Facultatif) |
Nombre d’itérations utilisées pour trouver la solution d’affinage spatial optimale, tout en conservant autant de points d’entités que possible et en veillant à ce qu’il n’y ait pas deux entités à une distance inférieure à la valeur spécifiée pour le paramètre Minimum Nearest Neighbor Distance (Distance minimale par rapport au plus proche voisin). Le nombre minimal d’itérations est 1 et le nombre maximal est 50. La valeur par défaut est 10. |
Long |
|
Encoder les variables explicatives catégorielles (Facultatif) |
Indique si les variables explicatives catégorielles doivent être encodées.
|
Boolean |
|
Ajouter tous les champs des entités en entrée (Facultatif) |
Indique si tous les champs sont copiés depuis les entités en entrée vers les entités en sortie.
|
Boolean |
Environnements
Taille de cellule, Système de coordonnées en sortie, Générateur de nombres aléatoires
Informations de licence
- Basic: Limité
Spatial Analyst est requis pour utiliser des rasters. - Standard: Limité
Spatial Analyst est requis pour utiliser des rasters. - Advanced: Limité
Spatial Analyst est requis pour utiliser des rasters.
Rubriques connexes
- Vue d’ensemble du jeu d’outils Modélisation de relations spatiales
- Évaluer les prévisions avec la validation croisée
- Classification et régression basées sur une forêt et boostées
- Régression linéaire généralisée
- Prévision de présence uniquement (MaxEnt)
- Fonctionnement de l’outil Évaluer les prévisions avec la validation croisée
- Fonctionnement de l’outil Préparer les données pour la prévision
- Rechercher un outil de géotraitement