Skip to main content

Exporter les données d’apprentissage pour l'apprentissage en profondeur (Outils Spatial Analyst)

Résumé

Convertit des données vectorielles ou raster étiquetées en jeux de données d’entraînement pour l’apprentissage profond via une image télédétectée. La sortie est un dossier de fragments d’image et un dossier de fichiers de métadonnées au format spécifié.

Utilisation

  • Cet outil crée des jeux de données d’entraînement pour prendre en charge des applications de Deep Learning tierces, telles que PyTorch, Microsoft CNTK, etc.

  • Les échantillons d’apprentissage de classe Deep Learning reposent sur de petites images secondaires (appelées fragments d’image) contenant l’entité ou la classe présentant un intérêt.

  • Utilisez vos données d’échantillon d’apprentissage de classification existantes ou vos données de classes d’entités SIG (une couche d’emprise de bâtiment, par exemple) pour générer les fragments d’image contenant l’échantillon de classe à partir de l’image source. Les fragments d’image sont souvent composés de lignes de 256 pixels et de colonnes de 256 pixels, sauf si la taille de l’échantillon d’apprentissage est plus importante. Chaque fragment d’image peut contenir un ou plusieurs objets. Si l’option Labeled Tiles (Tuiles étiquetées) est utilisée pour le paramètre Metadata Format (Format des métadonnées), il ne peut exister qu’un seul objet par fragment d’image.

  • Vous pouvez spécifier une valeur pour le paramètre Reference System (Système de référence) pour exporter les données d’entraînement dans l’espace cartographique ou l’espace pixel à utiliser pour l’entraînement du modèle Deep Learning.

  • Cet outil prend en charge l’exportation des données d’entraînement à partir d’une collection d’images. Vous pouvez ajouter un dossier d’images comme valeur du paramètre Input Raster (Raster en entrée). Si la valeur Input Raster (Raster en entrée) est un jeu de données mosaïque ou un service d’imagerie, vous pouvez également spécifier le paramètre Processing Mode (Mode de traitement) pour traiter la mosaïque en tant qu’entrée unique ou pour traiter chaque élément raster séparément.

  • Lorsque vous utilisez un service d’imagerie comme valeur pour Input Raster (Raster en entrée), l’outil respecte les limites définies par les attributs maxImageHeight et maxImageWidth du service d’imagerie, qui déterminent le nombre maximal de lignes et de colonnes que le service autorise dans une demande de client. Si cette limite est dépassée, l’outil échoue avec une erreur.

  • La taille de cellule et l’étendue peuvent être ajustées grâce aux paramètres d’environnement de géotraitement.

  • Cet outil respecte l’environnement Parallel Processing Factor (Facteur de traitement parallèle). Si l’environnement n’est pas spécifié, l’outil s’exécute sur un seul cœur. Lorsque des jeux de données volumineux sont utilisés, définissez pour l’environnement le nombre de cœurs que l’outil peut utiliser pour distribuer la charge de travail.

  • Pour obtenir des informations sur les exigences relatives à l’exécution de cet outil ainsi que sur les problèmes qui peuvent survenir, reportez-vous à la rubrique Forum aux questions sur le Deep Learning.

Paramètres

Etiqueter Explication Type de données

Raster en entrée

L’imagerie source en entrée, généralement une imagerie multispectrale.

Les exemples de types d’imagerie source en entrée sont par exemple l’imagerie satellite multispectrale, issue de drones, aérienne et du programme NAIP (National Agriculture Imagery Program). L’entrée peut être un dossier contenant des images.

Raster Dataset; Raster Layer; Mosaic Layer; Image Service; Map Server; Map Server Layer; Internet Tiled Layer; Folder

Dossier en sortie

Dossier dans lequel les fragments d’images et les métadonnées seront stockés.

Le dossier peut aussi être une URL de dossier qui utilise un fichier de connexion au stockage Cloud (*.acs).

Folder

Classe d’entités en entrée, raster classé ou table

Données d’échantillon d’entraînement sous forme vectorielle ou raster. Les entrées vectorielles doivent respecter le format d’échantillon d’entraînement généré dans la fenêtre Training Samples Manager (Gestionnaire d’échantillons d’entraînement). Les entrées raster doivent respecter un format raster classé généré par l’outil Classify Raster (Classer le raster).

L’entrée du raster peut également provenir d’un dossier de rasters classés. Les entrées de raster classé nécessitent une table attributaire de raster correspondante. Les tables en entrée doivent respecter un format d’échantillon d’entraînement généré par le bouton Label Objects for Deep Learning (Étiqueter les objets pour le Deep Learning) dans la fenêtre Training Samples Manager (Gestionnaire d’échantillons d’entraînement). Le respect du format d’échantillon d’apprentissage approprié permet de générer des résultats optimisés avec les informations statistiques. Toutefois, l’entrée peut également être une classe d’entités ponctuelles sans champ de valeur de classe ou un raster de type entier sans informations de classe.

Feature Class; Feature Layer; Raster Dataset; Raster Layer; Mosaic Layer; Image Service; Table; Folder

Format de l’image

Spécifie le format raster qui sera utilisé pour les fragments d’images en sortie.

Les formats PNG et JPEG prennent en charge jusqu’à trois bandes.

  • Format TIFFLe format TIFF sera utilisé.

  • Format PNGLe format PNG sera utilisé.

  • Format JPEGLe format JPEG sera utilisé.

  • MRF (Meta Raster Format)Meta Raster Format (MRF) va être utilisé.

String

Taille de tuile X

(Facultatif)

Taille des fragments d’image pour la dimension x.

Long

Taille de tuile Y

(Facultatif)

Taille des fragments d’image pour la dimension y.

Long

Pas en X

(Facultatif)

Distance de déplacement sur la direction x lors de la création des fragments d’image suivants.

Si le pas est égal à la taille de tuile, il n’y a pas de superposition. Si le pas est égal à la moitié de la taille de tuile, il y a une superposition de 50 %.

Long

Pas en Y

(Facultatif)

Distance de déplacement sur la direction y lors de la création des fragments d’image suivants.

Si le pas est égal à la taille de tuile, il n’y a pas de superposition. Si le pas est égal à la moitié de la taille de tuile, il y a une superposition de 50 %.

Long

Aucune tuile d’entités en sortie

(Facultatif)

Indique si les fragments d’image qui ne capturent pas d’échantillon d’apprentissage sont exportés.

Si cette option est sélectionnée, les fragments d’image qui ne capturent pas les données étiquetées sont également exportés. Si elle n’est pas sélectionnée, ils ne le sont pas.

  • ActivéTous les fragments d’images sont exportés, y compris ceux qui ne recouvrent pas d’échantillons d’apprentissage.

  • DécochéSeuls les fragments d’images recouvrant des échantillons d’apprentissage sont exportés. Il s’agit de l’option par défaut.

Boolean

Format de métadonnées

(Facultatif)

Spécifie le format utilisé pour les étiquettes de métadonnées en sortie.

Si les données d’échantillon d’entraînement en entrée constituent une couche de classe d’entités, telle qu’une couche de bâtiments ou un fichier d’échantillons d’entraînement de classification standard, utilisez l’option KITTI Labels (Étiquettes KITTI) ou PASCAL Visual Object Classes (Classes d’objets visuels PASCAL) (KITTI_rectangles ou PASCAL_VOC_rectangles dans Python). Les métadonnées en sortie sont un fichier .txt ou .xml comportant les données d’échantillon d’apprentissage qui se trouvent dans le rectangle d’emprise minimale. Le nom du fichier de métadonnées correspond à celui de l’image source en entrée. Si les données d’échantillon d’entraînement en entrée constituent une carte de classe, utilisez l’option Classified Tiles (Tuiles classées) (Classified_Tiles dans Python) comme format de métadonnées en sortie.

Pour le format de métadonnées KITTI, 15 colonnes sont créées, mais seules cinq d’entre elles sont utilisées dans l’outil. La première colonne contient la valeur de la classe. Les trois colonnes suivantes sont ignorées. Les colonnes 5 à 8 définissent le rectangle d’emprise minimale comportant quatre emplacements de coordonnées d’image : pixels de gauche, supérieur, de droite et inférieur. Le rectangle d’emprise minimale englobe le fragment d’apprentissage utilisé dans le classificateur de Deep Learning. Les autres colonnes ne sont pas utilisées.

  • KITTI Labels (Étiquettes KITTI)Les métadonnées suivent le même format que celui du jeu de données Object Detection Evaluation (Vérification de la détection d’objets) du KITTI (Karlsruhe Institute of Technology and Toyota Technological Institute). Le jeu de données KITTI est une suite de référence en matière de conception. Les fichiers d’étiquettes sont des fichiers de texte brut. Toutes les valeurs, numériques ou de chaînes, sont séparées par des espaces et chaque ligne correspond à un objet. Ce format est utilisé pour détecter les objets.

  • Classes d’objets visuels PASCALLes métadonnées suivent le même format que celui du jeu de données PASCAL_VOC (Pattern Analysis, Statistical Modeling and Computational Learning, Visual Object Classes). Le jeu de données PASCAL VOC est un jeu de données d’image standardisé pour la reconnaissance des classes d’objets. Les fichiers d’étiquettes sont au format XML et contiennent des informations sur le nom des images, la valeur de classe et les emprises. Ce format est utilisé pour détecter les objets. Il s’agit de l’option par défaut.

  • Classified Tiles (Tuiles classées)La sortie sera un fragment d’image classé par fragment d’image en entrée. Aucun autre type de métadonnées pour chaque fragment d’image n’est utilisé. Seule la sortie statistique comporte plus d’informations sur les classes, telles que les noms des classes, les valeurs des classes et les statistiques en sortie. Ce format est principalement utilisé pour la classification des pixels. Ce format est également utilisé pour la détection de changement lorsque la sortie est un fragment d’image classé issu de deux fragments d’image.

  • Masques RCNNLa sortie sera des fragments d’images comportant un masque sur les zones où se trouve l’échantillon. Le modèle génère des emprises et des masques de segmentation pour chaque instance d’un objet dans l’image. Ce format repose sur le réseau pyramidal d’entités (Feature Pyramid Network ou FPN) et une architecture ResNet101 dans le modèle d’infrastructure Deep Learning. Ce format est utilisé pour la détection d’objets. Toutefois, il peut également être utilisé pour le suivi d’objets lorsque le type de modèle Siam Mask est utilisé pendant l’entraînement, ainsi que pour la classification des pixels de séries temporelles lorsque l’architecture PSETAE est utilisée.

  • Labeled Tiles (Tuiles étiquetées)Chaque tuile en sortie portera l’étiquette d’une classe spécifique. Ce format est utilisé pour la classification des objets.

  • Tuiles à plusieurs étiquettesChaque tuile en sortie est étiquetée selon une ou plusieurs classes. Par exemple, une tuile peut porter les étiquettes agriculture et nuageux. Ce format est utilisé pour la classification des objets.

  • Exporter des tuilesLa sortie consiste en des fragments d’image sans étiquette. Ce format est utilisé pour les techniques de conversion d’image, telles que Pix2Pix et Super Resolution (Super Résolution).

  • CycleGANLa sortie consiste en des fragments d’image sans étiquette. Ce format est utilisé par la technique de conversion d’image CycleGAN visant à entraîner les images à ne pas se chevaucher.

  • ImagenetChaque tuile en sortie portera l’étiquette d’une classe spécifique. Ce format est utilisé pour la classification d’objets. Toutefois, il peut également être utilisé pour le suivi d’objets lorsque le type de modèle Deep Sort est utilisé pendant l’entraînement.

  • Segmentation panoptiqueLa sortie est un fragment d’image classé et une instance par fragment d’image en entrée. La sortie comporte également des fragments d’image qui masquent les zones où se trouve l’échantillon. Ces fragments d’image sont stockés dans un autre dossier. Ce format est utilisé pour la classification de pixels et la segmentation d’instances ; deux dossiers d’étiquettes en sortie sont donc générés.

String

Index de début

(Facultatif)
Héritage :

Ce paramètre est désormais obsolète.

Long

Champ de valeur de classe

(Facultatif)

Champ contenant les valeurs de classe. Si aucun champ n’est spécifié, le système recherche un champ -->value or classvalue<!--. Le champ doit être numérique, généralement un entier. Si l’entité ne contient pas de champ de classe, le système détermine que tous les enregistrements appartiennent à une même classe.

Field

Rayon de la zone tampon

(Facultatif)

Rayon d’une zone tampon autour de chaque échantillon d’apprentissage qui est utilisé pour délimiter une zone d’échantillon d’entraînement. Vous pouvez ainsi créer des échantillons d’apprentissage surfaciques circulaires à partir de points.

L’unité linéaire de la référence spatiale de la valeur du paramètre Input Feature Class Or Classified Raster Or Table (Classe d’entités, raster classé ou table en entrée) est utilisée.

Double

Input Mask Polygons (Polygones de masque en entrée)

(Facultatif)

Classe d’entités surfaciques qui délimite la zone dans laquelle les fragments d’image sont créés.

Seuls les fragments d’image se trouvant intégralement dans les polygones sont créés.

Feature Layer

Angle de rotation

(Facultatif)

Angle de rotation pour générer les fragments d’image.

Un fragment d’image est généré au préalable sans rotation. Il subit ensuite une rotation selon l’angle spécifié pour créer des fragments d’image supplémentaires. L’image est pivotée et un fragment est créé jusqu’à ce que la rotation soit complète. Par exemple, si vous spécifiez un angle de rotation de 45 degrés, l’outil crée huit fragments d’image. Ces huit fragments d’image sont créés aux angles suivants : 0, 45, 90, 135, 180, 255, 270 et 315.

L’angle de rotation par défaut est de 0, ce qui crée un fragment d’image par défaut.

Double

Système de référence

(Facultatif)

Indique le type de système de référence à utiliser pour interpréter l’image en entrée. Le système de référence spécifié doit correspondre au système de référence utilisé pour entraîner le modèle d’apprentissage profond.

  • Espace cartographiqueUn système de coordonnées basé sur la carte est utilisé. Il s’agit de l’option par défaut.

  • RésolutionLes coordonnées de l’espace pixel reposant sur des lignes et des colonnes sont utilisées sans rotation ni distorsion.

String

Mode de traitement

(Facultatif)

Spécifie comment tous les éléments raster figurant dans un jeu de données mosaïque ou un service d’imagerie seront traités. Ce paramètre est appliqué lorsqu’un raster en entrée est un jeu de données mosaïque ou service d’imagerie.

  • Process as mosaicked image (Traiter en tant qu’image mosaïquée)Tous les éléments raster figurant dans le jeu de données mosaïque ou le service d’imagerie seront mosaïqués ensemble, puis traités. Il s’agit de l’option par défaut.

  • Process all raster items separately (Traiter tous les éléments raster séparément)Tous les éléments raster figurant dans le jeu de données mosaïque ou le service d’imagerie seront traités en tant qu’images séparées.

String

Assombrir autour de l’entité

(Facultatif)

Indique si les pixels autour de chaque objet ou entité de chaque tuile d’images sont masqués.

Ce paramètre s’applique uniquement lorsque le paramètre Metadata Format (Format des métadonnées) est défini sur Labeled Tiles (Tuiles étiquetées) et qu’une classe d’entités ou un raster classé en entrée a été spécifié.

  • ActivéLes pixels entourant les objets ou les entités sont masqués.

  • DécochéLes pixels entourant les objets ou les entités ne sont pas masqués. Il s’agit de l’option par défaut.

Boolean

Mode de rognage

(Facultatif)

Indique si les tuiles exportées sont rognées de sorte qu’elles fassent toutes la même taille.

Ce paramètre s’applique uniquement si le paramètre Metadata Format (Format des métadonnées) est défini sur Labeled Tiles (Tuiles étiquetées) ou Imagenet et qu’une classe d’entités ou un raster classé en entrée a été spécifié.

  • Taille fixeLes tuiles exportées sont rognées de telle sorte qu’elles fassent la même taille et sont centrées sur l’entité. Il s’agit de l’option par défaut.

  • EmpriseLes tuiles exportées sont rognées de telle sorte que l’emprise géométrique entoure uniquement l’entité dans la tuile.

String

Raster en entrée supplémentaire

(Facultatif)

Source d’imagerie en entrée supplémentaire à utiliser pour les méthodes de conversion d’images.

Ce paramètre est valide lorsque le paramètre Metadata Format (Format des métadonnées) est défini sur Classified Tiles (Tuiles classées), Export Tiles (Tuiles exportées) ou CycleGAN.

Raster Dataset; Raster Layer; Mosaic Layer; Image Service; Map Server; Map Server Layer; Internet Tiled Layer; Folder

Classe d’entités d’instance

(Facultatif)

Données d’échantillons d’entraînement collectées contenant les classes pour la segmentation d’instances.

L’entrée peut également être une classe d’entités ponctuelles sans champ de valeur de classe ou un raster de type entier sans informations de classe.

Ce paramètre est valide uniquement lorsque le paramètre Metadata Format (Format des métadonnées) est défini sur Panoptic Segmentation (Segmentation panoptique).

Feature Class; Feature Layer; Raster Dataset; Raster Layer; Mosaic Layer; Image Service; Table; Folder

Champ de valeur de classe d’instance

(Facultatif)

Champ contenant les valeurs de classe pour la segmentation d‘instances. Si aucun champ n’est spécifié, l’outil utilise un champ de valeur ou de valeur de classe le cas échéant. Si l’entité ne contient pas de champ de classe, l’outil détermine que tous les enregistrements appartiennent à une même classe.

Ce paramètre est valide uniquement lorsque le paramètre Metadata Format (Format des métadonnées) est défini sur Panoptic Segmentation (Segmentation panoptique).

Field

Ratio de superposition de polygone minimale

(Facultatif)

Pourcentage de superposition minimale pour qu’une entité soit incluse dans les données d’entraînement. Si le pourcentage de superposition est inférieur à la valeur spécifiée, l’entité est exclue du fragment d’entraînement et n’est pas ajoutée au fichier d’étiquettes.

La valeur de pourcentage est exprimée sous la forme d’un nombre décimal. Par exemple, pour spécifier une superposition de 20 %, indiquez la valeur 0,2. La valeur par défaut est 0, ce qui signifie que toutes les entités sont incluses.

Ce paramètre améliore les performances de l’outil, ainsi que l’inférence. La vitesse est améliorée puisque moins de fragments d’entraînement sont créés. L’inférence est améliorée puisque le modèle est uniquement entraîné à détecter des lots importants d’objets et qu’il ignore les petits coins des entités. Cela signifie que l’outil Non Maximum Suppression (Suppression non maximale) détecte et retire un nombre moins important de faux positifs.

Ce paramètre est actif lorsque la valeur du paramètre Input Feature Class Or Classified Raster Or Table (Classe d’entités, raster classé ou table en entrée) est une classe d’entités.

Double

Environnements

Taille de cellule, Espace de travail courant, Etendue, Facteur de traitement parallèle, Espace de travail temporaire

Informations de licence

  • Basic: Nécessite Spatial Analyst ou Image Analyst
  • Standard: Nécessite Spatial Analyst ou Image Analyst
  • Advanced: Nécessite Spatial Analyst ou Image Analyst