Entraîner le modèle de régression Arbres aléatoires (Outils Image Analyst)
Résumé
Modélise la relation entre des variables explicatives (variables indépendantes) et un jeu de données cible (variable dépendante).
Utilisation
L’outil permet d’entraîner divers types de données. Les rasters en entrée (variables explicatives) peuvent être un raster ou une liste de rasters, à une bande ou multibande dans lequel chaque bande est une variable explicative, un raster multidimensionnel dans lequel les variables du raster sont des variables explicatives ou une combinaison de types de données.
Un jeu de données mosaïque en entrée est traité comme un jeu de données raster (non comme une collection de rasters). Pour utiliser une collection de rasters en entrée, générez des informations multidimensionnelles pour le jeu de données mosaïque et utilisez le résultat en entrée.
La cible en entrée peut être une classe d’entités ou un raster. Lorsque la cible est une entité, la valeur Target Value Field (Champ de valeur cible) doit être définie sur un champ numérique.
Si l’entité cible en entrée comporte un champ de date ou un champ qui définit la dimension, spécifiez une valeur à la fois pour le paramètre Target Value Field (Champ de valeur cible) et pour le paramètre Target Dimension Field (Champ de dimension cible).
La cible raster en entrée peut également être un raster multidimensionnel.
Si la cible en entrée est multidimensionnelle, les variables explicatives en entrée correspondantes doivent comporter au moins un raster multidimensionnel. Celles qui intersectent les dimensions cibles sont utilisées pour l’entraînement. Les autres rasters sans dimension dans la liste sont appliqués à toutes les dimensions. Si aucune variable explicative n’intersecte ou si elles sont toutes sans dimension, aucun entraînement n’a lieu.
Si la cible en entrée est sans dimension et que les variables explicatives ont une dimension, la première tranche est utilisée.
Si la sortie est un raster multidimensionnel, utilisez le format CRF. Si la sortie est un raster sans dimension, il peut être stocké dans n’importe quel format raster en sortie.
Les tailles de cellule des variables explicatives en entrée ont un impact sur le résultat d’entraînement et le délai de traitement. Par défaut, l’outil utilise la taille de cellule du premier raster explicatif. Vous pouvez changer ce comportement à l’aide du paramètre d’environnement Cell Size (Taille de cellule). En règle générale, l’entraînement avec une taille de cellule inférieure à celle de vos données n’est pas recommandé.
La valeur du paramètre Output Importance Table (Table d’importance en sortie) permet d’analyser l’importance de chaque variable explicative contribuant à prévoir la variable cible.
Check the Percent of Samples for Testing (Pourcentage d’échantillons à tester) pour calculer trois types d’erreurs : les erreurs sur les points d’entraînement, les erreurs sur les points de test et les erreurs sur les points de localisation test. Par exemple, si la valeur de pourcentage est définie sur 10, 10 pour cent des points d’échantillon d’entraînement sont utilisés comme référence en fonction de la localisation. Ces points de référence permettent de mesurer l’erreur d’interpolation dans l’espace : les points de localisation test. Les points d’échantillon d’entraînement restants sont divisés en deux groupes : un groupe contenant 90 pour cent des points d’échantillon d’entraînement et l’autre groupe contenant 10 pour cent des points d’échantillon d’entraînement. Le groupe contenant 90 pour cent des points permet d’entraîner le modèle de régression et le groupe contenant 10 pour cent des points est utilisé dans des tests de déduction de la précision.
La sélection du paramètre Percent of Samples for Testing (Pourcentage d’échantillons à tester) génère un nuage de points des valeurs d’échantillon d’entraînement de référence et prévues. Le coefficient de détermination (R-Carré) est également calculé comme une estimation de la qualité de l’ajustement.
Pour créer un nuage de points de valeurs prévues et de valeurs d’entraînement, vous pouvez utiliser l’outil Sample (Échantillon) pour extraire les valeurs prévues des rasters prévus. Réalisez ensuite une jointure tabulaire avec le champ
LocationIDdans la sortie de l’outil Sample (Échantillon) et le champObjectIDdans la classe du champ cible. Si l’entrée cible est un raster, vous pouvez générer des points aléatoires et extraire des valeurs à la fois du raster cible en entrée et du raster de prédiction.
Paramètres
| Etiqueter | Explication | Type de données |
|---|---|---|
|
Rasters en entrée |
Jeux de données raster monobandes, multidimensionnels ou multibandes, ou jeux de données mosaïque contenant des variables explicatives. |
Mosaic Dataset; Mosaic Layer; Raster Dataset; Raster Layer; Image Service; String |
|
Raster ou points cibles |
Raster ou classe d’entités ponctuelles contenant les données de la variable cible (variable dépendante). |
Feature Class; Feature Layer; Raster Dataset; Raster Layer; Mosaic Layer; Image Service |
|
Fichier de définition de régression en sortie |
Fichier au format JSON avec une extension |
File |
|
Champ de valeur cible (Facultatif) |
Nom de champ des informations à modéliser dans la classe d’entités ponctuelles cible ou le jeu de données raster. |
Field |
|
Champ de dimension cible (Facultatif) |
Champ de date ou numérique dans la classe d’entités ponctuelles en entrée qui définit les valeurs de dimension. |
Field |
|
Dimension du raster (Facultatif) |
Nom de la dimension du raster multidimensionnel en entrée (variables explicatives) qui fait référence à la dimension dans les données cibles. |
String |
|
Table d’importance en sortie (Facultatif) |
Table contenant des informations décrivant l’importance de chaque variable explicative utilisée dans le modèle. Un nombre plus élevé indique que la variable correspondante est davantage corrélée à la variable prédite et aura une plus grande part dans la prédiction. Les valeurs sont comprises entre 0 et 1 et la somme de toutes les valeurs est égale à 1. |
Table |
|
Nombre maximum d'arbres (Facultatif) |
Nombre maximal d'arbres dans la forêt. L’augmentation du nombre d’arbres entraîne des taux de précision accrus, même si cette amélioration se stabilise. Le nombre d'arbres augmente de manière linéaire le temps de traitement. La valeur par défaut est 50. |
Long |
|
Profondeur d'arbre maximum (Facultatif) |
Profondeur maximale de chaque arbre dans la forêt. La profondeur détermine le nombre de règles que chaque arbre peut créer pour parvenir à une décision. Les arbres ne peuvent pas dépasser la profondeur définie par ce paramètre. La valeur par défaut est 30. |
Long |
|
Nombre maximal d’échantillons (Facultatif) |
Nombre maximal d’échantillons à utiliser pour l’analyse de régression. Lorsque la valeur est inférieure ou égale à 0, le système utilise tous les échantillons du raster cible en entrée ou de la classe d’entités ponctuelles pour entraîner le modèle de régression. La valeur par défaut est 10 000. |
Long |
|
Nombre moyen de points par cellule (Facultatif) |
Spécifie si la moyenne est calculée lorsque plusieurs points d’entraînement entrent dans une cellule. Ce paramètre est applicable uniquement lorsque la cible en entrée est une classe d’entités ponctuelles.
|
Boolean |
|
Pourcentage d’échantillons à tester (Facultatif) |
Pourcentage des points de test à utiliser pour rechercher des erreurs. L’outil recherche trois types d’erreurs : les erreurs sur les points d’entraînement, les erreurs sur les points de test et les erreurs sur les points de localisation test. La valeur par défaut est 10. |
Double |
|
Nuages de points en sortie (PDF ou HTML) (Facultatif) |
Nuages de points en sortie au format PDF ou HTML. La sortie inclut des nuages de points des données d’entraînement, des données de test et des données test de localisation. |
File |
|
Entités d’échantillon en sortie (Facultatif) |
Classe d’entités en sortie qui contient les valeurs cibles et les valeurs prédites pour les points d’entraînement, les points de test et les points de test de localisation. |
Feature Class |
Environnements
Taille de cellule, Espace de travail courant, Etendue, Transformations géographiques, Système de coordonnées en sortie, Espace de travail temporaire
Informations de licence
- Basic: Requiert Image Analyst
- Standard: Requiert Image Analyst
- Advanced: Requiert Image Analyst