Skip to main content

Comment fonctionne la prédiction des valeurs manquantes à l’aide du modèle IA

Les jeux de données spatiaux et tabulaires du monde réel contiennent souvent des valeurs manquantes ou incomplètes dues à des pannes de capteurs, l’absence de réponse de la part des sondes, des problèmes d’intégration de données ou des erreurs de saisie manuelle. Les valeurs manquantes réduisent la qualité des données, limitent l’analyse et peuvent avoir des effets négatifs sur la modélisation et la prise de décision en aval. La suppression d’enregistrements sans valeur entraîne souvent une perte d’informations importantes, faisant de l’imputation intelligente une étape cruciale du prétraitement.

L’outil Prévoir les valeurs manquantes à l’aide d’un modèle IA renseigne les valeurs numériques manquantes dans les couches d’entités et les tables autonomes à l’aide de modèles avancés de Machine Learning et de Deep Learning. Contrairement aux méthodes statistiques de comblement qui opèrent indépendamment sur des champs individuels, cet outil capture les relations entre tous les champs disponibles, afin de produire des imputations statistiquement cohérentes et conscientes du contexte.

Cet outil ne prend pas en compte les relations entre les entités voisines dans l’espace ou le temps lors du remplissage des valeurs manquantes. L’outil Remplacer les valeurs manquantes convient davantage lorsque les données manquantes sont principalement influencées par la proximité spatiale ou la continuité temporelle.

L’outil prend actuellement en charge les modèles d’imputation basés sur XGBoost et d’imputation basés sur DistilGPT-2, présentés sous forme de fichiers de définition de modèle Esri (.emd) ou de paquetage de Deep Learning (.dlpk), ce qui permet de choisir l’approche la plus appropriée en fonction de la taille du jeu de données, de la complexité et des ressources du système.

Approche basée sur l’IA

Les méthodes d’imputation statistique (minimum, maximum, moyenne, médiane ou mode, par exemple) remplacent les valeurs manquantes à l’aide de statistiques globales ou de valeurs provenant d’emplacements voisins dans l’espace ou le temps. Bien que rapides et faciles à appliquer, ces approches présentent les limites suivantes :

  • Elles ignorent les relations entre champs multiples.

  • Elles traitent chaque valeur manquante indépendamment.

  • Elles ne parviennent pas à capturer les interactions ou dépendances non linéaires.

  • Elles peuvent fausser les résultats lorsque les valeurs manquantes ne sont pas aléatoires.

L’outil Predict Missing Values Using AI Model (Prédire les valeurs manquantes à l’aide du modèle d’IA) répond à ces limitations en modélisant la distribution conjointe des entités, permettant des imputations plus précises et plus réalistes, en particulier pour des ensembles de données complexes et fortement dimensionnels.

Modèles d’imputation pris en charge

L’outil prend en charge deux types principaux de modèles, tous deux étant accessibles par l’intermédiaire d’ArcGIS Living Atlas of the World.

Imputation basée sur XGBoost

Lorsque le modèle d’imputation basé sur XGBoost est utilisé, l’outil procède à l’imputation prédictive comme suit:

  • Les enregistrements avec des valeurs observées dans le champ cible sont utilisés pour l’entraînement.

  • Les champs restants servent de variables prédictives pour le champ cible.

  • Le modèle entraîné prédit les valeurs manquantes pour les enregistrements dont le champ cible est nul.

  • Le jeu de données est mis à jour avec des valeurs prédites.

Les principales caractéristiques du modèle sont les suivantes :

  • Efficace pour les tables volumineuses et le grand nombre de champs.

  • Capture les relations non linéaires et les interactions d’entités.

  • Peu de mémoire requise comparée aux modèles de Deep Learning.

  • Adapté aux processus de production et aux jeux de données d’entreprise volumineux.

Imputation basée sur DistilGPT-2

Lors de l’utilisation du modèle d’imputation basé sur DistilGPT-2, l’outil applique une stratégie d’imputation générative en lignes basée sur le Deep Learning. Cette stratégie peut se résumer ainsi :

  • Chaque ligne est sérialisée en une séquence de phrases de paires entités-valeurs.

  • Le modèle est affiné sur le jeu de données en entrée en utilisant la prédiction d’auto-régression du jeton suivant.

  • Les valeurs manquantes sont masquées lors de l’inférence.

  • Le modèle génère des valeurs manquantes en fonction des champs observés dans la même ligne.

  • Les sorties numériques générées sont converties à leur format numérique d’origine.

Cette approche permet au modèle d’apprendre les dépendances complexes dans tous les champs simultanément et a présenté moins de métriques d’erreur (RMSE et MAE, par exemple) dans le cadre de scénarii d’imputation complexes comparés aux références traditionnelles de Machine Learning.

Les principales caractéristiques du modèle sont les suivantes :

  • Apprend les distributions d’entités conjointes.

  • Efficace pour les jeux de données complexes et interdépendants.

  • Prend en charge l’extension future vers des modèles transformateurs supplémentaires.

  • Mémoire de GPU plus importante que XGBoost.

Considérations relatives aux performances et à la mémoire

Les modèles basés sur le Deep Learning sont gourmands en mémoire. Considérez les éléments suivants :

  • DistilGPT-2

    • Recommandé pour les tables contenant 40 champs au maximum.

    • Nécessite des GPU avec beaucoup de mémoire (au moins 24 Go).

    • Des erreurs de mémoire peuvent se produire avec des tableaux plus volumineux.

  • XGBoost

    • Prend en charge des tables plus volumineuses et un plus grand nombre de champs.

    • Moins d’espace mémoire et de besoins de calcul.

    • Recommandé pour les jeux de données à l’échelle de l’entreprise.

Solutions possibles pour les contraintes de mémoire :

  • Réduisez le nombre de champs en entrée grâce à la sélection d’entités.

  • Fractionnez les tables volumineuses en sous-ensembles plus petits.

  • Exécutez l’outil sur des systèmes cloud ou avec beaucoup de mémoire.

Quand utiliser cet outil

Utilisez l’outil ** Predict Missing Values Using AI Mode (Prédire les valeurs manquantes à l’aide du modèle IA)** lorsque ce qui suit est vrai :

  • Les valeurs manquantes apparaissent dans plusieurs champs liés entre eux.

  • La préservation des relations multivariées est importante.

  • L’imputation statistique produit des résultats irréalistes.

  • La qualité des données est essentielle pour l’analyse ou la modélisation en aval.

Lorsque des jeux de données plus simples sont utilisés, des écarts de champs individuels ou des cas dans lesquels des valeurs manquantes sont justifiées par la proximité spatiale ou temporelle, des outils tels que Fill Missing Values (Remplir les valeurs manquantes) sont souvent appropriés.

Bibliographie

  • Vadim Borisov, Kathrin Seßler, Tobias Leemann, Martin Pawelczyk, Gjergji Kasneci. « Language Models are Realistic Tabular Data Generators. » 12 octobre 2022. https://arxiv.org/abs/2210.06280

  • Tianqi Chen et Carlos Guestrin. « XGBoost: A Scalable Tree Boosting System. » 9 mars 2016. https://arxiv.org/abs/1603.02754

  • Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin. « Attention Is All You Need. » 12 juin 2017. https://arxiv.org/abs/1603.02754