Extraire l’intégration vers les champs (Outils GeoAI)
Résumé
Extrait les embeddings vectoriels stockés sous forme de champs BLOB (Binary Large Object) vers des champs numériques individuels dans une nouvelle classe d’entités en sortie.
Ce processus permet d’utiliser des dimensions d’embedding directement dans les outils ArcGIS Pro qui ne prennent pas en charge les champs de type BLOB.
Illustration

Utilisation
Vous allez spécifier une couche d’entités contenant un champ d’embedding stocké sous forme de champ BLOB (Binary Large Object) comme valeur du paramètre Input Features (Entités en entrée) et un emplacement de classe d’entités de géodatabase comme valeur du paramètre Output Features (Entités en sortie).
L’outil extrait les valeurs de champ correspondant à la valeur du paramètre Embedding Field (Champ d’embedding) en valeurs de type flottant individuelles avec des noms de champ commençant par la valeur du paramètre Output Field Prefix (Préfixe du champ en sortie).
Par exemple, si vous avez une couche d’entités contenant des emprises d’image satellite avec des embeddings générés par Deep Learning, et que vous souhaitez regrouper ces entités à l’aide de l’outil Agrégation multivariée ou localiser des emprises similaires dans l’espace d’embedding à l’aide de l’outil Recherche de similarité, procédez comme suit :
Utilisez la couche contenant le champ BLOB d’embedding comme valeur du paramètre Input Features (Entités en entrée).
Sélectionnez le champ BLOB qui stocke les vecteurs d’embedding sérialisés pour la valeur du paramètre Embedding Field (Champ d’embedding).
Spécifiez un emplacement de classe d’entités de géodatabase valide pour la valeur du paramètre Output Features (Entités en sortie).
Indiquez un préfixe pertinent pour la valeur du paramètre Output Field Prefix (Préfixe du champ en sortie) afin de nommer les nouveaux champs de dimension d’embedding. Par exemple, si la valeur du paramètre Output Field Prefix (Préfixe du champ en sortie) est embed_, les noms des champs de dimension d’embedding en sortie commencent par embed_1, embed_2, etc.
L’outil copie la valeur du paramètre Input Features (Entités en entrée) dans la valeur du paramètre Output Features (Entités en sortie) et conserve le champ BLOB d’origine. Il extrait ensuite chaque embedding dans une série de champs Float32, un champ par dimension d’embedding, en utilisant la valeur du paramètre Output Field Prefix (Préfixe du champ en sortie).
Remarque :
La valeur du paramètre Output Features (Entités en sortie) doit référencer une classe d’entités stockée dans une géodatabase fichier, mobile ou d’entreprise. Les sorties basées sur des dossiers, comme les shapefiles ou les GeoPackages, ne sont pas prises en charge. La valeur du paramètre Output Field Prefix (Préfixe du champ en sortie) doit respecter les règles de nommage des champs de géodatabase. Le préfixe ne peut pas commencer par un chiffre et ne peut contenir que des caractères alphanumériques ou des traits de soulignement.
- La dimensionnalité des embeddings est déterminée par la désérialisation du premier enregistrement BLOB valide rencontré. Cette dimensionnalité permet de définir le nombre de champs en sortie qui sont créés. Par exemple, si l’embedding contient 256 dimensions, l’outil crée 256 nouveaux champs Float32.
Remarque :
Toutes les entités doivent comporter des valeurs d’embedding valides. Si une valeur nulle est trouvée dans le champ d’embedding, l’outil échoue et renvoie une erreur. De plus, tous les embeddings doivent avoir la même dimensionnalité. Si un champ BLOB d’embedding dont la longueur ne correspond pas à la dimension établie est rencontré, l’outil arrête le traitement et signale l’ObjectID de l’entité non valide.
La classe d’entités en sortie contient toujours le même type de géométrie que les entités en entrée. Aucune modification géométrique ou transformation spatiale n’est effectuée par l’outil.
Les champs numériques extraits peuvent être utilisés directement en entrée d’outils tels que l’outil Agrégation multivariée et l’outil Recherche de similarité, et d’autres outils des boîtes à outils Spatial Analyst et Statistiques spatiales qui nécessitent des attributs numériques. Du fait que les dimensions d’embedding sont numériques, mais qu’elles ne sont pas intrinsèquement descriptives, il est souvent utile de conserver des identifiants ou des champs catégoriels provenant des valeurs Input Features (Entités en entrée) d’origine pour l’interprétation et la prise de décision.
Tous les attributs d’origine, y compris le champ BLOB d’embedding, sont conservés dans la classe d’entités en sortie avec les nouveaux champs de dimension d’embedding Float32 créés.
Paramètres
| Etiqueter | Explication | Type de données |
|---|---|---|
|
Input Features (Entités en entrée) |
Couche d’entités contenant le champ d’embedding stocké sous forme de champ BLOB. Toutes les entités doivent comporter des valeurs d’embedding valides. |
Feature Layer |
|
Entités en sortie |
Classe d’entités en sortie destinée à contenir les champs d’embedding extraits. Cette classe d’entités doit être stockée dans une géodatabase fichier, mobile ou d’entreprise. Le champ BLOB d’origine est conservé. |
Feature Class |
|
Champ d’embedding |
Champ BLOB tiré de la valeur du paramètre Input Features (Entités en entrée) et contenant des vecteurs d’embedding sérialisés. |
Field |
|
Préfixe du champ en sortie |
Préfixe utilisé pour nommer les nouveaux champs de dimension d’embedding créés. Conseil :Utilisez un préfixe court et pertinent pour faciliter la lecture et la gestion des noms de champ. Par exemple, la valeur embed_ produit des champs nommés embed_1, embed_2, ..., embed_n, où chaque champ représente une dimension d’embedding unique. Il est particulièrement important de choisir un préfixe clair si vous utilisez des embeddings de haute dimension car les analyses ultérieures, la sélection de champs et l’interprétation s’en trouvent simplifiées. |
String |
Environnements
Informations de licence
- Basic: Oui
- Standard: Oui
- Advanced: Oui
Rubriques connexes
- Fonctionnement de l’outil Extraire les embeddings vers des champs
- Agrégation multivariée
- Recherche de similarité
- Classification et régression basées sur une forêt et boostées
- Réduction des dimensions
- Rechercher un outil de géotraitement
- Vue d’ensemble du jeu d’outils Analyse basée sur des embeddings