Fonctionnement de l’outil Recherche de similarité
L’outil Recherche de similarité identifie quels éléments Candidate Features (Entités candidates) sont les plus semblables (ou dissemblables) à un ou plusieurs éléments Input Features To Match (Entités en entrée à apparier). La similarité repose sur une liste spécifiée d’attributs numériques (Attributes Of Interest [Attributs d’intérêt]). Si plusieurs valeurs sont spécifiées pour Input Features To Match (Entités en entrée à apparier), la similarité se fonde sur les moyennes pour chacun des paramètres Attributes Of Interest (Attributs d’intérêt). La classe d’entités en sortie (Output Features [Entités en sortie]) contient les éléments Input Features To Match (Entités en entrée à apparier) ainsi que l’ensemble des éléments Candidate Features (Entités candidates) correspondants trouvés, classés par similarité (comme indiqué par le paramètre Most Or Least Similar [Les plus ou les moins similaires]). Le nombre de correspondances renvoyées se base sur la valeur du paramètre Number Of Results (Nombre de résultats).
Applications possibles
Vous pouvez utiliser l’outil Recherche de similarité pour trouver d’autres villes qui ressemblent à la vôtre en termes de population, d’éducation et de proximité avec des opportunités de loisirs spécifiques.
Les autorités locales peuvent souhaiter faire la promotion de leur ville auprès d’éventuelles entreprises afin d’augmenter les recettes fiscales. L’outil Recherche de similarité les aidera à identifier d’autres villes similaires afin de pouvoir se comparer en ce qui concerne les attributs d’attractivité (faible criminalité et forte croissance, par exemple). Ces collectivités pourraient aussi être intéressées par la recherche de lieux identiques, mais plus grands ou plus petits (similarité cosinus). Le fait de constater qu’elles sont similaires à des endroits plus petits ou plus grands qui ont attiré les entreprises qu’elles ciblent leur permettra de mettre en évidence les similitudes tout en soulignant soit les avantages d’être plus petites (moins d’embouteillages, atmosphère de petite ville), soit d’être plus grandes (plus de clients potentiels). Ces collectivités pourraient également être intéressées par des villes qui ne ressemblent pas à la leur. Si l’un des lieux les moins similaires représente une concurrence pour les entreprises qu’elles souhaitent attirer, cette analyse fournira les informations nécessaires pour présenter une comparaison.
Une responsable des ressources humaines peut, par exemple, souhaiter être en mesure de justifier les fourchettes de salaires au sein de sa société. Une fois qu’elle a identifié des villes semblables en termes de taille, de coût de la vie et d’aménagements, elle peut examiner les fourchettes de salaires pour ces villes afin de voir si elles sont en phase.
Un analyste de la criminalité souhaitera effectuer une recherche dans la base de données pour voir si un crime s’inscrit dans un modèle ou une tendance plus large.
Un programme d’activités sportives extrascolaires a remporté un vif succès dans la ville A. Les promoteurs souhaitent trouver d’autres villes présentant des caractéristiques semblables pour étendre leur programme.
Les forces de l’ordre ont découvert des zones où des drogues sont cultivées ou fabriquées. L’identification de lieux aux caractéristiques similaires peut les aider à cibler de futures recherches.
Une grande enseigne compte plusieurs magasins prospères et quelques-uns présentant des performances moins satisfaisantes. Trouver des lieux avec des caractéristiques démographiques et contextuelles similaires (accessibilité, visibilité, commerces complémentaires, etc.) aidera à identifier les meilleurs emplacements pour un nouveau magasin.
Méthodes d’appariement
L’appariement peut se baser sur des valeurs attributaires, des valeurs attributaires classées ou des profils attributaires (similarité cosinus). L’algorithme utilisé pour chacune de ces méthodes est décrit ci-dessous. Pour toutes les méthodes, s’il existe plus d’un élément Input Features To Match (Entités en entrée à apparier), les attributs de toutes les entités sont moyennés afin de créer une entité cible composite à utiliser pour l’appariement :

Valeurs attributaires
Lorsque vous sélectionnez Attribute values (Valeurs attributaires) pour le paramètre Match Method (Méthode d’appariement), l’outil standardise d’abord tous les éléments Attributes of Interest (Attributs d’intérêt). Pour chaque candidat, il soustrait ensuite les valeurs standardisées de celles de la cible, élève au carré les différences et additionne les différences au carré. Cette somme devient l’index de similarité de ce candidat. Une fois tous les candidats traités, ils sont classés du plus petit index (le plus similaire) au plus grand (le moins similaire).
Pour aller plus loin :
La standardisation des valeurs attributaires implique une transformation z dans laquelle la moyenne de toutes les valeurs est soustraite de chaque valeur et divisée par l’écart type pour toutes les valeurs (les paramètres Input Features to Match [Entités en entrée à apparier] et Candidate Features [Entités candidates] sont tous deux inclus dans les calculs de la moyenne et de l’écart type). La standardisation définit tous les attributs à la même échelle, même lorsque ceux-ci sont représentés par des types de nombres très différents : taux (chiffres de 0 à 1,0), population (avec des valeurs supérieures à un million) et distances (kilomètres, par exemple).
Valeurs attributaires classées
Lorsque vous sélectionnez Ranked attribute values (Valeurs attributaires classées) pour le paramètre Match Method (Méthode d’appariement), l’outil commence par classer chacun des éléments Attributes of Interest (Attributs d’intérêt), à la fois pour l’entité cible et pour tous les candidats. Pour chaque candidat, il additionne ensuite la différence au carré de chaque attribut en relation avec l’entité cible. Si la valeur de la population pour la cible est la 10e plus grande parmi tous les candidats et que la population du candidat examiné est la 15e plus grande, la somme de la différence de classement de la population au carré pour ce candidat serait \(10 - 15 = -5\) et \(-5^2\) est 25. La somme des différences de classement au carré pour tous les éléments Attributes of Interest (Attributs d’intérêt) devient l’index de similarité pour ce candidat. Une fois tous les candidats traités, ils sont classés du plus petit index (le plus similaire) au plus grand (le moins similaire).
Profils attributaires
Lorsque vous sélectionnez Attribute profiles (Profils attributaires) pour le paramètre Match Method (Méthode d’appariement), l’outil standardise d’abord tous les éléments Attributes of Interest (Attributs d’intérêt) (deux éléments Attributes of Interest [Attributs d’intérêt] sont requis au minimum pour cette méthode). Il utilise ensuite les mathématiques de similarité cosinus pour comparer le vecteur des attributs standardisés pour chaque candidat au vecteur des attributs standardisés pour l’entité cible appariée. La similarité cosinus de deux vecteurs, A et B, se calcule ainsi :
La similarité cosinus ne s’intéresse pas à l’appariement des amplitudes attributaires, mais cette méthode se concentre plutôt sur les relations entre les attributs. Si vous avez créé un profil (graphique linéaire) des attributs standardisés dans les vecteurs comparés (la cible et l’un des candidats), vous pouvez voir des profils très similaires ou très différents :

L’index de similarité cosinus est compris entre 1,0 (similarité parfaite) et -1,0 (dissemblance parfaite). Il est indiqué dans le champ SIMINDEX (Cosine Similarity [Similarité cosinus]). Vous pouvez utiliser cette méthode de similarité pour trouver des lieux ayant les mêmes caractéristiques, mais peut-être à une échelle plus grande ou plus petite.
Bonnes pratiques
Cartographie des modèles de similarité
Si vous définissez le paramètre Number of Results (Nombre de résultats) sur zéro, l’outil classe toutes les entités candidates. La sortie de cette analyse présente le modèle spatial de similarité. Notez que lorsque vous classez tous les candidats, vous obtenez des informations sur la similarité et sur la dissemblance.

Inclusion de variables spatiales
Supposons que vous connaissiez les endroits (zones surfaciques) où une espèce menacée se porte bien et que vous vouliez trouver d’autres lieux où elle pourrait aussi prospérer. Vous souhaitez rechercher des lieux similaires à ceux où l’espèce vit en toute quiétude, mais il faudrait aussi des endroits suffisamment grands et compacts pour assurer le succès de l’espèce. Pour cette analyse, on pourrait calculer une métrique de compacité pour chaque zone surfacique (les mesures de compacité courantes se basent sur la surface d’un polygone par rapport à la surface d’un cercle ayant le même périmètre). Vous pourriez alors inclure votre mesure de compacité et un attribut reflétant la taille du polygone (Shape_Area) dans le paramètre Fields To Append To Output (Champs à ajouter à la sortie) lors de l’exécution de l’outil Recherche de similarité. Le tri des dix meilleures correspondances de solutions en termes de compacité et de surface vous aidera à identifier les endroits les plus appropriés pour la réintroduction de l’espèce.
Peut-être dirigez-vous une enseigne qui souhaite se développer. Si certains magasins connaissent une belle réussite, vous pouvez utiliser des attributs reflétant les caractéristiques clés du succès pour vous aider à trouver des emplacements candidats au développement. Supposons que les produits que vous vendez soient les plus attrayants pour les étudiants et que vous souhaitiez éviter les emplacements près de vos magasins actuels ou près des concurrents. Avant d’exécuter l’outil Recherche de similarité, vous pourriez utiliser l’outil Near (Proche) pour créer vos variables spatiales : distance par rapport aux universités ou aux lieux à forte densité d’étudiants, distance par rapport aux magasins existants et distance par rapports aux concurrents. Vous pourriez ensuite inclure ces variables spatiales dans le paramètre Fields To Append To Output (Champs à ajouter à la sortie) lors du lancement de l’outil Recherche de similarité.