Skip to main content

Fonctionnement de l’outil Rechercher des entités similaires à l’aide d’embeddings

Disponible avec une licence Advanced.

L’outil Rechercher des entités similaires à l’aide d’embeddings effectue une recherche de similarité à grande échelle sur des données de localisation et d’image en comparant leurs représentations d’embedding. L’outil est optimisé pour le traitement de jeux de données d’embedding volumineux grâce au traitement parallèle. Cet outil est recommandé pour des analyses à exécution longue après une exploration préliminaire à l’aide de l’outil Rechercher des sites similaires.

Contrairement à la recherche de similarité interactive, cet outil s’exécute comme une opération de géotraitement et ne bloque pas la vue cartographique pendant l’exécution, ce qui le rend adapté aux recherches de similarité à grande échelle sollicitant un grand nombre de ressources.

Processus conceptuel

En principe, l’outil fonctionne comme suit :

Embeddings en entrée (espace de recherche)

Les entités d’embedding en entrée définissent l’espace de recherche pour l’analyse de similarité. Chaque entité contient une représentation d’embedding dérivée soit d’une imagerie, soit d’une localisation géographique.

Pour les embeddings d’image, les cellules de grille d’embedding représentent les entités extraites de l’imagerie sous-jacente. Tous les calculs de similarité sont effectués sur ces cellules de grille d’embedding. L’imagerie est affichée uniquement à titre de référence visuelle et n’est pas directement utilisée dans les calculs de similarité.

Représentation visuelle des embeddings d’image

Les embeddings d’image encodent les entités extraites de l’imagerie. Les calculs de similarité sont effectués sur les grilles d’embedding et non sur les pixels des images.

Pour les embeddings de localisation, chaque entité est représentée par un embedding dérivé de sa localisation géographique. La similarité est calculée en comparant ces embeddings basés sur la localisation.

Représentation visuelle des embeddings de localisation

Les entités spatiales encodées dans les embeddings de localisation dépendent du modèle d’embedding utilisé pour générer les embeddings. En conséquence, les entités considérées comme similaires sont basées sur les modèles appris par ce modèle.

De même, pour les embeddings de texte, chaque entité est représentée par un embedding dérivé de son attribut textuel associé. La similarité est calculée en comparant ces embeddings de texte, qui capturent les relations sémantiques entre les entités.

Entités de requête

Les entités de requête définissent les objets d’intérêt pour la recherche de similarité. Une ou plusieurs entités surfaciques peuvent être utilisées en tant que requêtes.

Toutes les entités ou cellules de grille d’embedding dans l’espace de recherche qui sont superposées avec les polygones de requête sont identifiées et la moyenne de leurs vecteurs d’embedding est calculée pour dériver un seul embedding de requête.

L’embedding de requête obtenu est ensuite comparé à tous les embeddings dans l’espace de recherche (entités d’embeding en entrée) à l’aide de la similarité cosinus pour identifier des entités similaires.

Représentation visuelle des entités de requête dans la recherche de similarité

Les vecteurs d’embedding des entités superposés aux polygones de requête sont moyennés pour calculer l’embedding de requête

Spécification des polygones de requête

Dessinez les polygones de requête de manière interactive ou spécifiez une couche d’entités existante contenant les polygones de requête.

Évaluation de similarité et filtrage des résultats

L’embedding de requête dérivé est comparé aux embeddings dans l’espace de recherche et un score de similarité est calculé pour chaque embedding candidat dans l’espace de recherche.

Le paramètre de seuil est appliqué aux résultats du filtre. Seules les entités dont le score de similarité atteint ou dépasse le seuil minimal spécifié sont incluses dans la sortie.

L’outil détecte toutes les entités d’embedding qui répondent aux critères de similarité dans l’étendue spécifiée des entités en entrée.

Représentation visuelle de la recherche d’entités similaires à l’aide des résultats de l’outil d’embedding

L’image en entrée est recouverte par les grilles d’embedding (à gauche) et une région de requête sélectionnée est utilisée pour calculer un embedding de requête moyen dont les entités d’embedding similaires sont mises en évidence sur la totalité de l’image (à droite). Les entités utilisées pour générer l’embedding de requête sont incluses dans les résultats.

Les résultats de la recherche de similarité sont écrits dans une classe d’entités en sortie, qui stocke les entités appariées avec tous les attributs disponibles.

Interprétation de la similarité basée sur les embeddings

La recherche de similarité est effectuée entièrement sur des représentations d’embedding. La définition de similarité dépend du type des embeddings utilisés et du modèle qui les a générés.

Embeddings de localisation

Lorsque des embeddings de localisation sont utilisés, chaque entité est représentée par un embedding dérivé de sa localisation et de sa zone géographiques. La similarité entre les entités est calculée en comparant ces représentations d’embedding.

Les caractéristiques spatiales encodées dans les embeddings dépendent du modèle d’embedding utilisé. Par conséquent, les entités considérées comme similaires sont basées sur les modèles appris par le modèle qui a généré les embeddings.

Embeddings d’image

Lorsque des embeddings d’image sont utilisés, les cellules de grille d’embedding représentent les entités extraites à partir de l’imagerie sous-jacente. La recherche de similarité est effectuée sur ces cellules de grille d’embedding et non sur les pixels des images eux-mêmes.

L’imagerie affichée sur ma carte est fournie uniquement à titre de référence visuelle et n’est pas directement utilisée dans les calculs de similarité. Toutes les comparaisons sont effectuées à l’aide des représentations d’embedding dérivées de l’imagerie.

Embeddings de texte

Lorsque des embeddings de texte sont utilisés, chaque entité est représentée par un embedding dérivé de son attribut textuel associé. La similarité entre les entités est calculée en comparant ces représentations d’embedding.

Dans tous les cas, la similarité est déterminée en comparant les représentations d’embedding ; les résultats peuvent varier selon le modèle d’embedding utilisé.

Bonnes pratiques pour la définition des entités de requête

Pour optimiser les résultats, réutilisez les entités de requête qui ont déjà produit des résultats significatifs dans un processus de recherche de similarité interactive. Vous pouvez exporter les entités de requête utilisées dans la recherche de similarité interactive et fournir ces entités exportées en tant que couche d’entités de requête pour cet outil. Cette approche permet de garantir des résultats de similarité cohérents et fiables lors de la mise à l’échelle de l’analyse à des jeux de données plus volumineux.