Cómo funciona la búsqueda de similitud
La herramienta Búsqueda de similitud identifica qué Entidades candidatas son más parecidas (o menos parecidas) a una o varias Entidades de entrada para coincidencia. La similitud se basa en una lista específica de atributos numéricos (Atributos de interés). Si se especifican varias entidades de entrada para coincidencia, la similitud se basa en promedios de cada uno de los atributos de interés. La clase de entidad de salida (Entidades de salida) contendrá las Entidades de entrada para coincidencia, junto con todas las Entidades candidatas coincidentes que se hayan encontrado, ordenadas por similitud (según se especifique en el parámetro Más o menos similar). El número de coincidencias devueltas se basa en el valor del parámetro Número de resultados.
Potenciales aplicaciones
Podría usar la herramienta Búsqueda de similitud para encontrar otras ciudades que sean igual que la suya en cuanto a población, educación y proximidad a oportunidades recreativas específicas.
Los responsables locales pueden querer promocionar su ciudad ante posibles empresas para aumentar los ingresos fiscales. La herramienta Búsqueda de similitud les ayudará a identificar otras ciudades similares para que puedan compararse en cuanto a atributos de atracción (como baja criminalidad y alto crecimiento). Estos responsables también podrían estar interesados en encontrar lugares similares a ellos, pero más grandes o más pequeños (similitud coseno). Descubrir que son similares a lugares más pequeños o grandes que han resultado atractivos para los negocios que quieren atraer les permitirá señalar las similitudes mientras destacan las ventajas de ser más pequeños (menos congestión, sabor a pueblo pequeño) o de ser más grandes (más clientes potenciales). Estos responsables también podrían estar interesados en ciudades que menos se parecen a ellos. Si alguno de los lugares menos similares representa competencia para los negocios que quieren atraer, este análisis proporcionará la información necesaria para presentar una comparación.
Es posible que una directora de recursos humanos quiera tener la posibilidad de justificar los rangos de salario de la compañía. Una vez que identifique ciudades similares en tamaño, coste de vida y servicios, podrá examinar los rangos salariales de esas ciudades para ver si están en la misma línea.
Una analista delictiva desea consultar la base de datos para ver si un delito forma parte de un patrón o una tendencia más amplios.
Un programa de actividad física extraescolar tuvo un gran éxito en la localidad A. Los promotores quieren encontrar otras localidades con características similares como candidatas para la ampliación del programa.
Un organismo policial ha descubierto zonas donde se cultivan o fabrican drogas. Identificar ubicaciones con características similares puede ayudarles a orientar búsquedas futuras.
Un gran minorista tiene varias tiendas exitosas y algunas que tienen bajo rendimiento. Encontrar ubicaciones con características demográficas y contextuales similares (accesibilidad, visibilidad, negocios complementarios, etc.) ayudará a identificar las mejores ubicaciones para una nueva tienda.
Métodos de coincidencia
La coincidencia puede basarse en valores de atributos, valores de atributos clasificados o perfiles de atributos (similitud coseno). El algoritmo empleado en cada uno de estos métodos se describe a continuación. Para todos los métodos, si hay varias entidades de entrada para coincidencia, los atributos de todas las entidades se promedian para crear una entidad objetivo compuesta que se utilice en el proceso de coincidencia:

Valores de atributos
Cuando selecciona Valores de atributos para el parámetro Método de coincidencia, la herramienta primero estandariza todos los atributos de interés. Para cada candidato, a continuación resta los valores estandarizados de los valores del objetivo, eleva las diferencias al cuadrado y suma las diferencias cuadradas. Esta suma se convierte en el índice de similitud de ese candidato. Una vez procesados todos los candidatos, estos se clasifican desde el índice más pequeño, el más similar, hasta el índice más grande, el menos similar.
Sumergirse:
La estandarización de los valores de atributos implica una transformación z en la que el valor medio de todos los valores se resta de cada valor y se divide entre la desviación estándar de todos los valores (tanto las entidades de entrada para coincidencia como las entidades candidatas están incluidas en los cálculos de media y desviación estándar). La estandarización pone todos los atributos en la misma escala aunque estén representados por tipos de números muy diferentes: tasas (número de 0 a 1,0), población (valores superior a 1 millón) y distancias (kilómetros, por ejemplo).
Valores de atributo clasificados
Cuando se selecciona Valores de atributos clasificados para el parámetro Método de coincidencia, la herramienta empezará clasificando cada uno de los Atributos de interés tanto para la entidad objetivo como para todos los candidatos. Para cada candidato, a continuación suma la diferencia al cuadrado de cada atributo con respecto a la entidad objetivo. Si el valor de población del objetivo es el décimo más alto entre todos los candidatos y la población del candidato considerado es la decimoquinta más alta, la diferencia de rangos de población para este candidato sería \(10 - 15 = -5\) y su \(-5^2\) sería 25. La suma de las diferencias de rangos al cuadrado de todos los Atributos de interés se convierte en el índice de similitud de este candidato. Una vez procesados todos los candidatos, estos se clasifican desde el índice más pequeño, el más similar, hasta el índice más grande, el menos similar.
Perfiles de atributos
Cuando selecciona Perfiles de atributos para el parámetro Método de coincidencia, la herramienta primero estandariza todos los atributos de interés (este método requiere al menos dos atributos de interés). A continuación, utiliza el cálculo de similitud coseno para comparar el vector de atributos estandarizados de cada candidato con el vector de atributos estandarizados de la entidad objetivo que se está comparando. La similitud coseno de dos vectores, A y B, se calcula de la siguiente manera:
La similitud coseno no se centra en la coincidencia de las magnitudes de los atributos, sino en las relaciones entre los atributos. Si se creara un perfil, es decir, un gráfico de líneas, de los atributos estandarizados de los vectores que se están comparando, el objetivo y uno de los candidatos, podrían observarse perfiles muy similares o muy diferentes:

El índice de similitud coseno varía desde 1,0 (similitud perfecta) hasta -1,0 (similitud perfecta) y se indica en el campo SIMINDEX (similitud coseno). Este método de similitud se utilizaría para encontrar lugares que tengan las mismas características, pero quizá a una escala mayor o menor.
Prácticas recomendadas
Cartografiar patrones de similitud
Si configura el parámetro Número de resultados en cero, la herramienta clasificará todas las entidades candidatas. La salida de este análisis mostrará el patrón espacial de similitud. Tenga en cuenta que cuando clasifica todos los candidatos, obtiene información sobre la similitud y la disimilitud.

Incluir variables espaciales
Supongamos que conoce las ubicaciones, es decir, las áreas poligonales, donde una determinada especie en peligro de extinción está prosperando y quiere encontrar otras ubicaciones donde también podría prosperar. Buscaría ubicaciones similares a las que han tenido éxito, pero puede que también necesite ubicaciones lo suficientemente grandes y compactas como para garantizar el éxito de la especie. Para este análisis, podría calcular una métrica de compactación para cada área poligonal; las mediciones habituales de compacidad se basan en el área de un polígono en relación con el área de un círculo con el mismo perímetro. Luego podría incluir la medición de compactación y un atributo que refleje el tamaño del polígono (Shape_Area) en el parámetro Campos para añadir a la salida cuando ejecute la herramienta Búsqueda de similitud. Clasificar las diez mejores coincidencias de solución tanto en términos de compactación como de área le ayudará a identificar los lugares más apropiados para la reintroducción de especies.
Quizá sea un minorista interesado en expandirse. Si tiene tiendas que han tenido éxito, puede utilizar atributos que reflejen las características clave del éxito para ayudarle a encontrar ubicaciones candidatas para la expansión. Supongamos que los productos que vende serán los más atractivos para los estudiantes universitarios y que quiere evitar ubicaciones cerca de sus tiendas actuales o cerca de la competencia. Antes de ejecutar la herramienta Búsqueda de similitud, usaría la herramienta Cerca para crear sus variables espaciales: distancia a universidades o lugares con alta densidad de estudiantes, distancia a tiendas existentes y distancia a competidores. Luego podría incluir estas variables espaciales en el parámetro Campos para añadir a la salida cuando ejecute la herramienta Búsqueda de similitud.