选择随机样本 (Data Reviewer 工具)
汇总
根据指定的采样方法选择输入要素或行的随机样本。
输出为在地图框中的输入图层上的选择。 此工具还可以创建一个记录所选对象 ID (OID) 及用于选择的 SQL 表达式的 .json 文件。 选择可用于浏览要素 可视化检查工具和运行数据校验 工具工作流。
用法
采样方法参数具有以下选项:
固定数量—所选记录的数量将基于记录数量参数值。
百分比—所选记录的数量将基于记录百分比参数值。
自动计算—所选记录的数量将基于使用置信度和误差幅度参数值进行的计算。
采样方法参数的自动计算选项使用以下变量来计算记录的数量:
\[ \begin{align*} z &= \text{scipy.stats.norm.ppf}\left(1 - \frac{1 - \text{confidence\_level}}{2}\right) \\ n &= \left(\frac{z}{m}\right)^2 \cdot \left(p \cdot (1 - p)\right) \\ n' &= \frac{n \cdot N}{n + (N - 1)} \end{align*} \]所需置信度的 z 统计量 (z)。 z 统计量使用置信度变量和
scipy.stats模块z=scipy.stats.norm.ppf(1-(1-confidence_level)/2)进行计算。置信区间中可接受的误差幅度 (m)。
概率 (p) 在 0.5 时最高,因为无法预先了解特定比例的记录将通过还是未通过检查。 由于记录通过或未通过检查的概率相等,因此 0.5 是方差方程中使用的最保守值。
总体大小 (N) 是要素图层或表中的记录总数。
随机 OID 使用
randomPython 模块random.sample(population, k)进行选择,其中population是 OID 值的列表,k是样本大小。此工具的输出是基于采样方法参数值,从输入行参数值中随机选择的记录。
使用可选的输出文件参数创建一个包含以下内容的
.json文件:工具的运行日期和时间
输入源于的工作空间
输入要素图层或表的名称
选定记录总数
选定记录的 OID
用于选择的 SQL 表达式
无论使用所选记录切换按钮是否关闭,都将执行在输入行参数中所做的所有选择。
在运行工具前,要素图层或表必须具有
ObjectID字段。如果关闭使用选定记录切换按钮,则输出文件参数值将记录基于整个数据集的随机要素选择。 但是,如果应用定义查询,则仅地图框中与查询相匹配的要素或行处于选中状态。
参数
| 标注 | 说明 | 数据类型 |
|---|---|---|
|
输入行 |
将应用选择的数据。 |
Feature Layer; Table View |
|
采样方法 |
指定将使用的采样方法。
|
String |
|
记录数量 (可选) |
将选择的记录数量。 当采样方法参数值为固定数量时,此参数处于活动状态。 |
Long |
|
记录百分比 (可选) |
将在输入中选择的记录百分比。 当采样方法参数值为百分比时,此参数处于活动状态。 |
Long |
|
置信度 (可选) |
置信度是指样本大小具有统计显著性的可能性,以百分比形式输入(如 98 或 95)。 此参数将用于计算 z 统计量 (z)。 z 统计量可使用 当采样方法参数值为自动计算时,此参数处于活动状态。 |
Long |
|
误差幅度 (可选) |
置信度中可接受的误差幅度,以百分比形式输入(如 8 或 5)。 此参数使用计算出的 z 统计量 (z),通过以下公式计算实际样本大小 (n'): 当采样方法参数值为自动计算时,此参数处于活动状态。 |
Long |
|
输出文件 (可选) |
将包含所选数据记录的输出 |
File |
派生输出
| 标注 | 说明 | 数据类型 |
|---|---|---|
|
已更新行 |
已应用选择的已更新输入。 |
Feature Layer; Table View |
环境
许可信息
- 基本: 需要 Data Reviewer
- 标准: 需要 Data Reviewer
- 高级: 需要 Data Reviewer