Skip to main content

相似性搜索的工作原理

相似性搜索工具用于识别哪些候选要素与一个或多个要匹配的输入要素最相似(或最相异)。 相似性基于指定的数值属性列表(感兴趣属性)。 若指定了多个要匹配的输入要素,将基于各感兴趣属性的平均值计算相似性。 输出要素类(输出要素)将包含要匹配的输入要素,以及所有匹配到的候选要素;所有要素按相似性排序(排序规则由最相似或最不相似参数指定)。 返回的匹配数量由结果数量参数的取值决定。

可能的应用

  • 您可使用相似性搜索工具,查找在人口规模、教育水平、与特定休闲场所的距离等方面与所在城市特征相似的其他城市。

  • 地方政务人员往往希望向意向企业推广本地城市,以扩大税收收入规模。 相似性搜索工具可帮助其定位同类城市,以便在低犯罪率、高增长率等吸引力属性维度上开展对标分析。 这类工作人员也可能需要查找属性特征相似但规模更大或更小的地点(采用余弦相似度算法)。 若目标企业更青睐规模偏小或偏大的城市,而本地与这类城市属性相似,工作人员便可突出二者的共性,同时强调自身的规模优势:规模偏小则交通拥堵更少、兼具小镇风貌;规模偏大则潜在客群更广。 这类工作人员也可能关注与本地特征差异最大的城市。 若部分最不相似的地区恰好是其意向招引企业的竞品布局区域,本次分析可提供开展对比论证所需的信息。

  • 某位人力资源经理可能需要论证公司薪资区间的合理性。 筛选出城市规模、生活成本、配套设施水平相近的城市后,即可对标这些城市的薪资区间,验证自身薪资标准的合理性。

  • 犯罪分析师需要检索数据库,判断某起案件是否属于更大范围的犯罪模式或犯罪趋势的一部分。

  • A 镇的课后健身项目成效显著,项目主办方希望筛选出特征相近的其他城镇,作为项目拓展的候选点位。

  • 某执法部门已排查出多处毒品种植或制造窝点的所在区域。 识别出具备同类特征的点位,有助于其后续精准开展排查工作。

  • 某大型零售商旗下既有多家经营表现良好的门店,也存在少量业绩不佳的门店。 筛选出人口特征、区位条件(可达性、可见度、互补业态等)相近的点位,有助于确定新店的最优选址。

匹配方法

匹配可基于三类依据:属性值、排序属性值,或属性配置文件(余弦相似度法)。 下文将详细说明各类方法对应的算法原理。 对于所有方法,若指定了多个要匹配的输入要素,工具会对所有要素的属性取平均值,生成一个复合目标要素用于匹配计算:

平均感兴趣属性

属性值

匹配方法参数选择属性值时,工具首先会对所有感兴趣属性执行标准化处理。 随后针对每个候选要素,用目标要素的标准化值减去候选要素的标准化值,对差值取平方后求和。 所得求和结果即为该候选要素的相似性指数。 处理完所有的候选要素后,将按指数从小到大对候选要素排序,指数越小相似度越高,指数越大相似度越低。

抢先版本:

属性值的标准化采用 z 变换实现:用每个属性值减去所有值的均值,再除以所有值的标准差(均值与标准差的计算范围同时包含要匹配的输入要素候选要素)。 标准化将所有属性放在同一比例中,即使它们由不同类型的数字表示时也是如此:比率(0 到 1.0 的数字)、人口(超过 1 百万)和距离(例如,千米)。

等级属性值

匹配方法参数选择排序属性值时,工具首先会对目标要素与所有候选要素的每一项感兴趣属性分别进行排名。 随后针对每个候选要素,计算其各项属性相对于目标要素的排名差值平方,并求和汇总。 例如,目标要素的人口规模在所有候选要素中排第 10 位,待计算候选要素的人口规模排第 15 位,则该候选要素人口属性的排名差值平方计算为:\(10 - 15 = -5\)\(-5^2\) = 25。 所有感兴趣属性的排名差值平方之和,即为该候选要素的相似性指数。 处理完所有的候选要素后,将按指数从小到大对候选要素排序,指数越小相似度越高,指数越大相似度越低。

属性剖面

匹配方法参数选择属性配置文件时,工具首先会对所有感兴趣属性执行标准化处理(该方法要求至少包含两项感兴趣属性)。 随后通过余弦相似度算法,将每个候选要素的标准化属性向量与待匹配目标要素的标准化属性向量进行比对。 两个向量 A 与 B 的余弦相似度计算公式如下:

\[ \text{Cosine Similarity Index} = \frac{\sum_{i=1}^{n} A_i B_i}{\sqrt{\sum_{i=1}^{n} (A_i)^2} \sqrt{\sum_{i=1}^{n} (B_i)^2}} \]

余弦相似度不关注属性数值大小的匹配程度,核心聚焦于各属性之间的关联关系。 若将比对向量(目标要素与单个候选要素)的标准化属性绘制成分布图(折线图),可直观看到二者的分布图高度相似或差异显著:

属性配置文件

上方一组属性的配置文件高度相似,下方一组属性的配置文件差异明显。

余弦相似度指数取值范围为 1.0(完全相似)至 -1.0(完全不相似),结果将存储于 SIMINDEX(余弦相似度)字段中。 该相似性方法适用于筛选特征一致但规模更大或更小的点位。

最佳做法

相似性模式制图

若将结果数量参数设为 0,工具将对所有候选要素进行排名。 本次分析的输出结果可直观呈现相似性的空间分布模式。 需要注意的是,对全部候选要素排名时,可同时获取相似性与差异性两方面信息。

排名相似性地图

包括空间变量

假设您已知某濒危物种生存状况良好的分布区域(面要素范围),希望查找该物种可能良好繁衍的其他区域。 您需要筛选与已知适宜区域特征相似的点位,同时还需保证区域面积充足、形态紧凑,以保障物种生存繁衍。 开展该分析时,可为每个面区域计算紧凑度指标(常用的紧凑度计算方式为面要素面积与同周长圆形面积的比值)。 运行相似性搜索工具时,可将紧凑度计算结果与反映面大小的属性(Shape_Area)一同添加至追加到输出的字段参数中。 从紧凑度与面积两个维度对前十组匹配结果进行排序,可辅助确定物种重引入的最适宜区域。

再比如有门店扩张需求的零售商家。 若您已有多家经营成功的门店,可借助反映门店成功核心特征的属性,筛选适合扩张的候选点位。 假设您销售的产品核心客群为大学生,且希望避开现有门店周边与竞品门店周边的点位。 运行相似性搜索工具前,可使用邻近工具生成所需的空间变量:到高校或大学生高密度区域的距离、到现有门店的距离,以及到竞品门店的距离。 运行相似性搜索工具时,可将这些空间变量纳入追加到输出的字段参数中。