Skip to main content

Entraîner à l’aide d’AutoML (Outils GeoAI)

Résumé

Entraîne un modèle de Deep Learning en construisant des pipelines d’entraînement et en automatisant une grande partie du processus d’entraînement. Cela inclut l’analyse des données exploratoires, la sélection des entités, l’ingénierie des entités, la sélection des modèles, l’optimisation des hyperparamètres et l’entraînement des modèles. Sa sortie comprend des mesures de performances du meilleur modèle sur les données d’entraînement, ainsi que le paquetage de modèle de Deep Learning entraîné (.dlpk) utilisable comme entrée de l’outil Predict Using AutoML (Prévoir à l’aide d’AutoML) pour faire une prévision sur un nouveau jeu de données.

En savoir plus sur le fonctionnement d’AutoML

Utilisation

  • Vous devez installer la structure de Deep Learning correspondant à Python dans ArcGIS Pro.

    Découvrir comment installer des structures de Deep Learning pour ArcGIS

  • Le temps nécessaire à l’outil pour produire le modèle entraîné dépend des éléments suivants :

    • La quantité de données fournies pendant l’entraînement

    • La valeur du paramètre AutoML Mode (Mode AutoML)

    Par défaut, le minuteur est défini sur 240 minutes pour tous les modes. Quelle que soit la quantité de données utilisées pour l’entraînement, l’option Basic (De base) du paramètre AutoML Mode (Mode AutoML) ne nécessite pas l’intégralité des 240 minutes pour trouver le modèle optimal. Le processus d’ajustement se termine dès que le modèle optimal est identifié. L’option Advanced (Avancé) nécessite plus de temps en raison des tâches supplémentaires liées à l’ingénierie des entités, à la sélection des entités et à l’optimisation des hyperparamètres. En plus des nouvelles entités obtenues en combinant plusieurs entités à partir de l’entrée, l’outil crée des entités spatiales dont les noms vont de zone3_id à zone7_id. Ces nouvelles entités sont extraites des informations de localisation figurant dans les données en entrée et sont utilisées pour entraîner de meilleurs modèles. Pour plus d’informations sur les nouvelles entités spatiales, reportez-vous à la rubrique Fonctionnement d’AutoML. Si la quantité de données entraînées est élevée, il se peut que toutes les combinaisons de modèles ne soient pas évaluées dans le délai de 240 minutes. Dans ce cas, le modèle le plus performant déterminé dans ce délai est considéré comme le modèle optimal. Vous pouvez alors utiliser ce modèle ou ré-exécuter l’outil avec une valeur de paramètre Total Time Limit (Minutes) (Limite de durée totale [minutes]).

  • Une licence d’extension ArcGIS Spatial Analyst est requise pour utiliser des rasters en tant que variables explicatives.

  • La valeur du paramètre Output Report (Rapport en sortie) est un fichier au format HTML qui permet d’examiner les informations dans le répertoire de travail.

    La première page du rapport en sortie comprend des liens vers chacun des modèles évalués et affiche leurs performances sur un jeu de données de validation, ainsi que le temps ayant été nécessaire pour les entraîner. En fonction de la mesure d’évaluation, le rapport affiche le modèle le plus performant ayant été choisi.

    RMSE est la mesure d’évaluation par défaut utilisée pour les problèmes de régression, tandis que Logloss est la mesure par défaut utilisée pour les problèmes de classification. Les mesures suivantes sont disponibles dans le rapport en sortie :

    • Classification—AUC, Logloss, F1, Exactitude, Précision moyenne

    • Regression—MSE, RMSE, MAE, R2, MAPE, coefficient de Spearman, coefficient de Pearson

    Lorsque vous cliquez sur une combinaison de modèles, des détails sur l’entraînement de cette combinaison s’affichent, y compris les courbes d’apprentissage, les courbes d’importance des variables, les hyperparamètres utilisés, etc.

  • Les exemples de cas d’utilisation de l’outil incluent l’entraînement d’un modèle de génération d’énergie solaire annuelle en fonction de facteurs météorologiques, l’entraînement d’un modèle de prévision des récoltes à l’aide de variables associées et l’entraînement d’un modèle de prévision des valeurs des maisons.

  • Pour obtenir des informations sur les exigences relatives à l’exécution de cet outil ainsi que sur les problèmes qui peuvent survenir, reportez-vous à la rubrique Forum aux questions sur le Deep Learning.

  • Pour utiliser le paramètre Add Image Attachments (Ajouter des images en pièces jointes), préparez la valeur du paramètre Input Training Features (Entités d’entraînement en entrée) pour les images en pièces jointes en procédant comme suit :

  • Activez le paramètre Use Location Embeddings (Utiliser des embeddings de localisation) afin d’améliorer les performances du modèle pour les tâches de prévision spatialement dépendantes (en particulier si des jeux d’entités limités sont utilisés) en incluant des représentations vectorielles denses qui capturent les relations géographiques et environnementales complexes.

Paramètres

Etiqueter Explication Type de données

Entités d’entraînement en entrée

Classe d’entités en entrée allant être utilisée pour entraîner le modèle.

Feature Layer; Table View

Modèle en sortie

Modèle entraîné en sortie destiné à être enregistré en tant que paquetage de Deep Learning (fichier .dlpk).

File

Variable à prévoir

Champ de la valeur de paramètre Input Training Features (Entités d’entraînement en entrée) contenant les valeurs à utiliser pour entraîner le modèle. Ce champ contient des valeurs (d'entraînement) connues de la variable qui sera utilisée pour réaliser des prévisions à des emplacements inconnus.

Field

Traiter les variables comme catégorielles

(Facultatif)

Indique si la valeur de paramètre Variable to Predict (Variable à prévoir) est traitée comme une variable catégorielle.

  • ActivéLa valeur du paramètre Variable to Predict (Variable à prévoir) est traitée comme une variable catégorielle et une classification est effectuée.

  • DécochéLa valeur du paramètre Variable to Predict (Variable à prévoir) est traitée comme une valeur continue et une régression est effectuée. Il s’agit de l’option par défaut.

Boolean

Variables d’entraînement explicatives

(Facultatif)

Liste des champs qui représentent les variables explicatives utilisées pour prévoir la valeur ou la catégorie de la valeur du paramètre Variable to Predict (Variable à prévoir). Cochez la case correspondant aux variables qui représentent des classes ou des catégories (par exemple, l’occupation du sol, la présence ou l’absence).

Colonnes de la table de valeurs :

  • VariableExplanatory variables that will help predict the value or category of the variable to predict.

  • CategoricalSpecifies whether a variable represents classes or categories (such as land cover, presence, or absence).

Value Table

Entités de distance d’entraînement explicatives

(Facultatif)

Entités dont les distances depuis les entités d’entraînement en entrée seront estimées automatiquement et ajoutées comme variables plus explicatives. Les distances entre chacune des entités de distance d’entraînement explicatives en entrée et les entités d’entraînement en entrée les plus proches sont calculées. Les entités ponctuelles et surfaciques sont prises en charge, et si les entités de distance d’entraînement explicatives en entrée sont des polygones, les attributs de distance sont calculés comme étant la distance entre les segments les plus proches de la paire d’entités.

Feature Layer

Rasters d’entraînement explicatifs

(Facultatif)

Rasters dont les valeurs sont extraites du raster et considérées comme variables explicatives pour le modèle. Chaque couche forme une variable explicative. Pour chacune des entités d’entraînement en entrée, la valeur de la cellule raster est extraite à l’emplacement exact. Pour les rasters continus, la valeur de raster est extraite par la méthode de rééchantillonnage bilinéaire de raster. Pour les rasters catégoriels, la valeur de raster est extraite par la méthode d’affectation du voisin le plus proche. Si la valeur du paramètre Input Training Features (Entités d’entraînement en entrée) comporte des polygones et que vous avez fourni une valeur pour ce paramètre, une valeur de raster pour chaque polygone est utilisée dans le modèle. Chaque polygone se voit attribuer la valeur moyenne pour les rasters continus et la majorité pour les rasters catégoriels. Vérifiez que la case Categorical (Catégoriel) est cochée pour tous les rasters qui décrivent des classes ou des catégories, comme l’occupation du sol, la végétation ou le type de sol.

Colonnes de la table de valeurs :

  • RasterName of the explanatory variable supplied as rasters.

  • CategoricalSpecifies whether the explanatory variable is a categorical variable.

Value Table

Limite de durée totale (minutes)

(Facultatif)

Limite de durée totale en minutes nécessaire à l’entraînement du modèle AutoML. La valeur par défaut est définie sur 240 (4 heures).

Double

Mode AutoML

(Facultatif)

Spécifie l’objectif du mode AutoML et le degré d’intensité de la recherche AutoML.

  • BasicLe mode De base est utilisé pour expliquer la signification des différentes variables et des données. L’ingénierie des entités, la sélection des entités et l’optimisation des hyperparamètres n’ont pas lieu. Des descriptions et des explications entières des courbes d’apprentissage de modèle, des diagrammes d’importance des entités générés pour les modèles d’arbre et des diagrammes SHAP pour tous les autres modèles sont incluses dans les rapports. Ce mode nécessite le temps de traitement le plus faible. Il s’agit de l’option par défaut.

  • IntermédiaireLe mode Intermédiaire est utilisé pour entraîner un modèle allant servir dans des cas d’utilisation réels. Ce mode utilise la validation croisée cinq fois (CV) et produit le résultat des courbes d’apprentissage et des diagrammes d’importance dans les rapports, mais les diagrammes SHAP ne sont pas disponibles.

  • AdvancedLe mode Avancé est utilisé pour les compétitions d’entraînement machine (pour des performances optimales). Ce mode utilise la validation croisée dix fois (CV) et procède à l’ingénierie des entités, à la sélection des entités et à l’optimisation des hyperparamètres. Les entités d’entraînement en entrée sont attribuées à des grilles spatiales de différentes tailles en fonction de leur emplacement, et les ID de grille correspondants sont transmis au modèle en tant que variables explicatives catégorielles supplémentaires. Le rapport ne comprend que les courbes d’apprentissage ; l’explicabilité du modèle n’est pas disponible.

String

Algorithmes

(Facultatif)

Spécifie les algorithmes allant être utilisés pendant l’entraînement.

Par défaut, tous les algorithmes sont utilisés.

  • LinéaireL’algorithme supervisé Régression linéaire sera utilisé pour entraîner un modèle de Machine Learning de régression. S’il s’agit de la seule option spécifiée, assurez-vous que le nombre total d’enregistrements est inférieur à 10 000 et que le nombre de colonnes est inférieur à 1 000. D’autres modèles étant adaptés à des jeux de données plus volumineux, il est préférable d’utiliser cette option avec d’autres algorithmes plutôt qu’isolément.

  • Arbres aléatoiresL’algorithme de Machine Learning supervisé basé sur les arbres de décision Arbres aléatoires sera utilisé. Il peut être utilisé dans la classification et la régression.

  • XGBoostL’algorithme de Machine Learning supervisé XGBoost (extreme gradient boosting) sera utilisé. Il peut être utilisé dans la classification et la régression.

  • LightGBML’algorithme d’ensemble LightGBM (gradient boosting machine), basé sur les arbres de décision, sera utilisé. Il peut être utilisé dans la classification et la régression. L’algorithme LightGBM est optimisé pour des performances élevées dans les systèmes distribués.

  • DecisionTreeL’algorithme de Machine Learning supervisé DecisionTree, qui classe ou fait régresser les données par des réponses de valeur Vraie et Fausse à certaines questions, sera utilisé. Les arbres de décision sont faciles à comprendre et efficaces pour l’explicabilité.

  • ExtraTreesL’algorithme de Machine Learning supervisé d’ensemble ExtraTree (extremely randomized trees), qui utilise des arbres de décision, sera utilisé. Cet algorithme est semblable à l’algorithme Arbres aléatoires, à ceci près qu’il peut être plus rapide.

  • CatBoostL’algorithme CatBoost sera utilisé. Il utilise des arbres de décision pour la classification et la régression. Cette option peut utiliser une combinaison de variables explicatives catégorielles et non catégorielles sans prétraitement.

String

Validation Percentage (Pourcentage de validation)

(Facultatif)

Pourcentage de données en entrée allant être utilisées pour la validation. La valeur par défaut est 10.

Long

Rapport en sortie

(Facultatif)

Rapport en sortie qui sera généré sous forme de fichier .html. Si le chemin d’accès spécifié n’est pas vide, le rapport est créé dans un nouveau dossier sous ce chemin d’accès. Le rapport contient des détails sur les divers modèles et sur les hyperparamètres ayant été utilisés pendant l’évaluation et l’exécution de chaque modèle. Les hyperparamètres sont les paramètres qui contrôlent le processus d’entraînement. Ils ne sont pas mis à jour pendant l’entraînement et comprennent l’architecture du modèle, la vitesse d’apprentissage, le nombre d’époques, etc.

File

Table d’importance en sortie

(Facultatif)

Table en sortie contenant des informations sur l’importance de chaque variable explicative (champs, entités de distance et rasters) utilisée dans le modèle.

Table

Classe d’entités en sortie

(Facultatif)

Couche d’entités contenant les valeurs prédites par le modèle le plus performant sur la couche d’entités d’entraînement. Elle peut être utilisée pour vérifier les performances du modèle en comparant visuellement les valeurs prévues à la réalité de terrain.

Feature Class

Ajouter des images en pièces jointes

(Facultatif)

Indique si les images sont utilisées comme variables explicatives de la valeur de paramètre Input Training Features (Entités d’entraînement en entrée) pour l’entraînement d’un modèle de données multimodales ou mixtes. L’entraînement d’un modèle tabulaire de données multimodales ou mixtes implique l’utilisation de backbones de Machine Learning et de Deep Learning dans AutoML pour qu’un modèle unique assimile plusieurs types de formats de données. Les données en entrée peuvent combiner des variables explicatives provenant d’un ensemble varié de sources de données comme des descriptions de texte, les images correspondantes et des variables catégorielles et continues supplémentaires.

  • ActivéLes images en pièces jointes sont téléchargées et traitées comme des variables explicatives et un entraînement de données multimodales est effectué.

  • DécochéLes images en pièces jointes ne sont pas utilisées lors de l’entraînement. Il s’agit de l’option par défaut.

Boolean

Attributs d’entité sensible

(Facultatif)

Évalue et améliore l’équité des modèles entraînés pour les données tabulaires des modèles de classification et de régression. Définissez les deux composants suivants pour ce paramètre :

  • Sensitive Features (Entités sensibles) : attribut tel que la race, le genre, le statut socio-économique ou l’âge, susceptible d’introduire des préjugés dans les modèles de Machine Learning ou de Deep Learning. En sélectionnant des entités sensibles comme la race, le genre, le statut socio-économique ou l’âge, les préjugés associés aux entités sensibles spécifiques sont atténués en vue de générer un modèle objectif.

  • Underprivileged Groups (Groupes défavorisés) : groupe discriminé généré par la valeur Sensitive Features (Entités sensibles) fournie.

Colonnes de la table de valeurs :

  • Sensitive FeaturesAn attribute such as race, gender, socioeconomic status, or age that can introduce bias in machine learning or deep learning models. By selecting sensitive features such as race, gender, socioeconomic status, or age, biases associated with the specific sensitive features are mitigated for an unbiased model.

  • Underprivileged GroupsThe discriminated group.

Value Table

Métrique d’équité

(Facultatif)

Indique les métriques d’équité qui sont utilisées pour mesurer l’équité des problèmes de classification et de régression. Elles serviront pour les recherches dans la grille, afin de sélectionner le modèle le plus équitable.

  • Ratio de parité démographiqueCette métrique est utilisée dans les modèles de classification. Mesure du ratio des taux de sélection entre différents groupes d’individus. Le taux de sélection est la proportion d’individus qui sont classés comme positifs par le modèle. La valeur idéale pour cette métrique est 1, ce qui indique que les taux de sélection sont égaux pour les différents groupes. L’équité pour cette métrique est comprise entre 0,8 et 1, ce qui signifie que le ratio des taux de sélection entre les groupes ne doit pas dépasser 20 pour cent.

  • Différence de parité démographiqueCette métrique est utilisée dans les modèles de classification. Elle est semblable à la métrique du ratio de parité démographique, mais la différence des taux de sélection entre différents groupes d’individus est mesurée, plutôt que le ratio. Le taux de sélection est la proportion d’individus qui sont classés comme positifs par le modèle. La valeur idéale pour cette métrique est 0, ce qui indique qu’il n’existe pas de différence de taux de sélection entre les groupes. L’équité pour cette métrique est comprise entre 0 et 0,25, ce qui signifie que les différences de taux de sélection entre les groupes ne doivent pas dépasser 25 pour cent.

  • Ratio de chances égaliséCette métrique est utilisée dans les modèles de classification. Mesure du ratio des taux d’erreur entre des groupes d’individus, comme des groupes de race ou de genre différents. La valeur idéale pour cette métrique est 1, ce qui indique que les taux d’erreur sont égaux pour les différents groupes. L’équité pour cette métrique est comprise entre 0,8 et 1, ce qui signifie que le ratio d’erreur entre les groupes ne doit pas dépasser 20 pour cent.

  • Différence de chances égaliséeCette métrique est utilisée dans les modèles de classification. Elle est semblable à la métrique du ratio de chances égalisée, mais la différence d’erreur entre différents groupes d’individus est mesurée, plutôt que le ratio. La valeur idéale pour cette métrique est 0, ce qui indique qu’il n’existe pas de différence d’erreur entre les groupes. L’équité pour cette métrique est comprise entre 0 et 0,25, ce qui signifie que la différence d’erreur entre les groupes ne doit pas dépasser 25 pour cent.

  • Ratio de perte pour un groupeCette métrique est utilisée dans les modèles de régression. Mesure du ratio de perte moyenne ou d’erreur pour un sous-groupe par rapport à un autre sous-groupe. Ce ratio fournit une mesure relative de la disparité des pertes entre les groupes. La valeur 1 indique qu’il n’existe pas de différence de perte entre les groupes, tandis que des valeurs supérieures ou inférieures à 1 indiquent des disparités relatives.

String

Utiliser des embeddings de localisation

(Facultatif)

Indique si des embeddings de localisation sont utilisés en tant que variables explicatives supplémentaires lors de l’entraînement pour améliorer l’efficacité prédictive du modèle basé sur la localisation.

L’utilisation d’embeddings de localisation entraîne la génération d’embeddings géographiques généralisés à partir de l’imagerie satellite et des coordonnées géographiques tirées de la valeur du paramètre Input Training Features (Entités d’entraînement en entrée). Vous obtenez ainsi un contexte spatial qui améliore les performances du modèle pour les prévisions qui dépendent de la localisation, telles que le prix de l’immobilier, la modélisation environnementale ou l’estimation démographique.

  • ActivéDes embeddings de localisation sont calculés et inclus en tant qu’entités, permettant l’intégration de données géospatiales multimodales et l’amélioration de la représentation spatiale lors de l’entraînement du modèle.

  • DécochéLes embeddings de localisation ne sont pas utilisés et le modèle s’appuie uniquement sur les variables tabulaires existantes, sans informations spatiales tirées de l’imagerie satellite et basées sur des embeddings. Il s’agit de l’option par défaut.

Boolean

Environnements

Système de coordonnées en sortie, Transformations géographiques

Informations de licence

  • Basic: Non
    Spatial Analyst est requis pour utiliser le paramètre Explanatory Training Rasters (Rasters d’entraînement explicatifs).
  • Standard: Non
    Spatial Analyst est requis pour utiliser le paramètre Explanatory Training Rasters (Rasters d’entraînement explicatifs).
  • Advanced: Oui
    Spatial Analyst est requis pour utiliser le paramètre Explanatory Training Rasters (Rasters d’entraînement explicatifs).