Fonctionnement de l’outil Rechercher des entités similaires à l’aide d’embeddings
Disponible avec une licence Advanced.
L’outil Rechercher des entités similaires à l’aide d’embeddings effectue une recherche de similarité à grande échelle sur des données de localisation et d’image en comparant leurs représentations d’embedding. L’outil est optimisé pour le traitement de jeux de données d’embedding volumineux grâce au traitement parallèle. Cet outil est recommandé pour des analyses à exécution longue après une exploration préliminaire à l’aide de l’outil Rechercher des sites similaires.
Contrairement à la recherche de similarité interactive, cet outil s’exécute comme une opération de géotraitement et ne bloque pas la vue cartographique pendant l’exécution, ce qui le rend adapté aux recherches de similarité à grande échelle sollicitant un grand nombre de ressources.
Processus conceptuel
En principe, l’outil fonctionne comme suit :
Embeddings en entrée (espace de recherche)
Les entités d’embedding en entrée définissent l’espace de recherche pour l’analyse de similarité. Chaque entité contient une représentation d’embedding dérivée soit d’une imagerie, soit d’une localisation géographique.
Pour les embeddings d’image, les cellules de grille d’embedding représentent les entités extraites de l’imagerie sous-jacente. Tous les calculs de similarité sont effectués sur ces cellules de grille d’embedding. L’imagerie est affichée uniquement à titre de référence visuelle et n’est pas directement utilisée dans les calculs de similarité.

Pour les embeddings de localisation, chaque entité est représentée par un embedding dérivé de sa localisation géographique. La similarité est calculée en comparant ces embeddings basés sur la localisation.

De même, pour les embeddings de texte, chaque entité est représentée par un embedding dérivé de son attribut textuel associé. La similarité est calculée en comparant ces embeddings de texte, qui capturent les relations sémantiques entre les entités.
Entités de requête
Les entités de requête définissent les objets d’intérêt pour la recherche de similarité. Une ou plusieurs entités surfaciques peuvent être utilisées en tant que requêtes.
Toutes les entités ou cellules de grille d’embedding dans l’espace de recherche qui sont superposées avec les polygones de requête sont identifiées et la moyenne de leurs vecteurs d’embedding est calculée pour dériver un seul embedding de requête.
L’embedding de requête obtenu est ensuite comparé à tous les embeddings dans l’espace de recherche (entités d’embeding en entrée) à l’aide de la similarité cosinus pour identifier des entités similaires.

Spécification des polygones de requête
Dessinez les polygones de requête de manière interactive ou spécifiez une couche d’entités existante contenant les polygones de requête.
Évaluation de similarité et filtrage des résultats
L’embedding de requête dérivé est comparé aux embeddings dans l’espace de recherche et un score de similarité est calculé pour chaque embedding candidat dans l’espace de recherche.
Le paramètre de seuil est appliqué aux résultats du filtre. Seules les entités dont le score de similarité atteint ou dépasse le seuil minimal spécifié sont incluses dans la sortie.
L’outil détecte toutes les entités d’embedding qui répondent aux critères de similarité dans l’étendue spécifiée des entités en entrée.

Les résultats de la recherche de similarité sont écrits dans une classe d’entités en sortie, qui stocke les entités appariées avec tous les attributs disponibles.
Interprétation de la similarité basée sur les embeddings
La recherche de similarité est effectuée entièrement sur des représentations d’embedding. La définition de similarité dépend du type des embeddings utilisés et du modèle qui les a générés.
Embeddings de localisation
Lorsque des embeddings de localisation sont utilisés, chaque entité est représentée par un embedding dérivé de sa localisation et de sa zone géographiques. La similarité entre les entités est calculée en comparant ces représentations d’embedding.
Les caractéristiques spatiales encodées dans les embeddings dépendent du modèle d’embedding utilisé. Par conséquent, les entités considérées comme similaires sont basées sur les modèles appris par le modèle qui a généré les embeddings.
Embeddings d’image
Lorsque des embeddings d’image sont utilisés, les cellules de grille d’embedding représentent les entités extraites à partir de l’imagerie sous-jacente. La recherche de similarité est effectuée sur ces cellules de grille d’embedding et non sur les pixels des images eux-mêmes.
L’imagerie affichée sur ma carte est fournie uniquement à titre de référence visuelle et n’est pas directement utilisée dans les calculs de similarité. Toutes les comparaisons sont effectuées à l’aide des représentations d’embedding dérivées de l’imagerie.
Embeddings de texte
Lorsque des embeddings de texte sont utilisés, chaque entité est représentée par un embedding dérivé de son attribut textuel associé. La similarité entre les entités est calculée en comparant ces représentations d’embedding.
Dans tous les cas, la similarité est déterminée en comparant les représentations d’embedding ; les résultats peuvent varier selon le modèle d’embedding utilisé.
Bonnes pratiques pour la définition des entités de requête
Pour optimiser les résultats, réutilisez les entités de requête qui ont déjà produit des résultats significatifs dans un processus de recherche de similarité interactive. Vous pouvez exporter les entités de requête utilisées dans la recherche de similarité interactive et fournir ces entités exportées en tant que couche d’entités de requête pour cet outil. Cette approche permet de garantir des résultats de similarité cohérents et fiables lors de la mise à l’échelle de l’analyse à des jeux de données plus volumineux.