Skip to main content

Fonctionnement de l’outil Évaluer l’influence des variables pour les prévisions

L’outil Évaluer l’influence des variables pour les prévisions évalue la manière dont les variables explicatives affectent les valeurs prévues dans les fichiers de modèle de statistiques spatiales (.ssm) créés par l’outil Classification et régression basées sur une forêt et boostées. Vous devez indiquer des entités en entrée qui contiennent les mêmes variables explicatives que celles qui ont été utilisées pour entraîner le fichier de modèle en entrée, ainsi que les champs de variable explicative, les entités de distance et les rasters explicatifs correspondants. L’outil crée une table en sortie contenant des diagrammes et des valeurs montrant quelles variables ont eu un impact sur les valeurs prévues et la forme de la relation.

Les modèles de régression traditionnels, comme les moindres carrés ordinaires ou la régression logistique, expliquent l’influence des variables via les coefficients. Par exemple, les coefficients des moindres carrés ordinaires indiquent dans quelle mesure les prévisions augmentent ou diminuent lorsqu’une variable explicative spécifique augmente, et les coefficients de régression logistique indiquent la façon dont le ratio de chances évolue lors de la prévision de catégories. Cependant, les modèles de Machine Learning sont généralement non linéaires et ne possèdent pas de coefficients simples expliquant la façon dont les prévisions évoluent en fonction des différentes valeurs des variables explicatives. Une approche courante pour visualiser l’influence de chaque variable explicative sur les valeurs prévues consiste à utiliser des graphiques de dépendance partielle.

Graphiques de dépendance partielle

Les graphiques de dépendance partielle montrent l’évolution moyenne des prévisions pour diverses valeurs de chaque variable explicative, en laissant inchangées toutes les autres valeurs des variables explicatives. Par exemple, dans les moindres carrés ordinaires, les graphiques de dépendance partielle forment une ligne droite dont la pente est égale au coefficient. Cependant, pour les modèles de Machine Learning, les relations sont non linéaires. Par conséquent, les prévisions peuvent augmenter pour certaines plages de la variable explicative, diminuer pour d’autres, ou former d’autres courbes plus complexes.

Par exemple, le graphique ci-dessous montre la façon dont une variable dépendante réagit à différentes valeurs d’une variable explicative. Des valeurs faibles et élevées pour la variable explicative génèrent en moyenne des valeurs prévues plus élevées, mais les valeurs intermédiaires génèrent des valeurs prévues plus faibles.

Graphique de dépendance partielle

Remarque :

Le graphique de dépendance partielle pour une variable explicative est élaboré en établissant une prévision avec diverses valeurs de la variable explicative et en conservant les valeurs d’origine de toutes les autres variables explicatives. Pour chaque valeur testée, des prévisions sont calculées pour chaque entité en entrée et une moyenne de ces prévisions est ensuite établie. Les moyennes sont alors tracées par rapport aux valeurs testées de la variable explicative.

Variables explicatives continues

Le diagramme Réponse partielle des variables continues affiche les graphiques de dépendance partielle pour chaque variable explicative continue. Les valeurs de la variable explicative sont affichées sur l’axe des x, tandis que les valeurs moyennes prévues s’affichent sur l’axe des y.

Graphique de dépendance partielle des variables explicatives continues.

Chaque variable explicative continue est affichée dans une grille à gauche, et vous pouvez cliquer sur chaque variable pour afficher le diagramme individuel à droite. Les graphiques dans la grille partagent la même échelle que l’axe des y afin de faciliter la comparaison de leurs effets.

Variables explicatives catégorielles

Le diagramme Réponse partielle des variables catégorielles affiche les graphiques de dépendance partielle pour chaque variable explicative catégorielle. L’axe des x affiche chaque catégorie de la variable catégorielle ainsi que les valeurs moyennes prévues sur l’axe des y.

Par exemple, l’image suivante présente les graphiques de dépendance partielle pour deux variables explicatives catégorielles : couleur et type. Pour la variable couleur, le bleu génère une valeur prévue plus faible, le rouge, des valeurs prévues plus élevées et le vert, des valeurs légèrement plus élevées. De même, le type C génère des valeurs prévues plus faibles, tandis que les types A et D génèrent des valeurs prévues plus élevées.

Graphique de dépendance partielle pour les variables explicatives catégorielles.

Variables dépendantes catégorielles

Lorsque la variable dépendante est catégorielle (modèle de classification), les graphiques de dépendance partielle montrent la façon dont chaque variable affecte la probabilité de classer chaque catégorie. Par défaut, l’axe des y de chaque diagramme affiche la probabilité moyenne que l’entité soit classée dans la première catégorie, mais vous pouvez changer la catégorie affichée par le diagramme dans la fenêtre Chart Properties (Propriétés du diagramme). Sur l’onglet Data (Données), cliquez sur le bouton Select (Sélectionner) sous Numeric field(s) (Champs numériques), puis sélectionnez la catégorie à afficher. Activez une seule catégorie à la fois pour que le diagramme affiche correctement le graphique de dépendance partielle.

Changez la catégorie dans la fenêtre Chart Properties (Propriétés du diagramme).

Pratiques conseillées et limitations

Voici les meilleures pratiques et limitations concernant l’utilisation de l’outil :

  • Les graphiques de dépendance partielle supposent que chaque variable explicative est indépendante. Les graphiques de dépendance partielle montrent l’effet de chaque variable explicative isolément, mais si plusieurs variables sont corrélées et partagent des informations mutuelles, les graphiques ne peuvent pas séparer leur influence individuelle. Cela est analogue à la multicolinéarité dans la régression traditionnelle.