Skip to main content

从文本中提取位置 (转换工具)

汇总

分析输入文本或文本文件,并将位置提取到点要素类。

如果输入文本是文件路径,则将打开标识的文件并分析其内容。 如果输入文本是非结构化信息(例如电子邮件消息)或半结构化文本(例如行程表单),则将分析输入文本本身。 该工具可提取文本或文件内容包含的位置,并将结果点添加到要素类中。

该工具将分析和处理文本,如下所示:

  • 识别在文本内容中指定的空间坐标,并创建表示这些位置的点。 可识别以下坐标格式:十进制度、度十进制分、度分秒、通用横轴墨卡托和军事格网参考系统。

  • 识别文本中指定的且在自定义位置文件中定义的地名,并创建表示这些位置的点。 自定义位置文件会将地名与表示该位置的空间坐标相关联。

  • 识别感兴趣文本,从提供的文本中提取此信息,并将其记录在输出要素类属性表的字段中。

用法

  • 参数默认值旨在优化坐标和日期的标识。 每个参数的默认值都可以修改。 修改的参数越少,工具的运行速度就越快。

  • 所有坐标格式默认为打开。 如果只想提取自定义位置而不想提取空间坐标,请关闭坐标格式参数。

  • 如果提供的输入是 Adobe PDF 文档,其内容包括空间坐标,且格式已打开,而输出要素类不包含表示空间坐标的要素,则您的计算机可能没有处理 PDF 文档所需的组件。

    了解有关扫描文件的详细信息

  • 使用自定义位置文件提取地名时,最好在文件中指定较少的地名。 例如,如果您将一个代表世界上所有地方的要素类转换为自定义位置文件,那么在这个过程中,您可能需要花费大量时间来查找不可能存在的地方,或者在您不感兴趣的领域进行分析。

    了解有关自定义位置文件的详细信息

  • 如果您感兴趣的地名拼写错误或有已知的变体,那么在自定义位置文件中指定常见的拼写错误和替代地名,而不是使用模糊匹配,通常会得到更好的结果。 开启模糊匹配后,如果地名中 70% 的字符与输入内容匹配,就会得到一个输出位置。 与提供已知的替代地名和拼写错误相比,这可能会产生更多的误报。

    模糊匹配的一个有用工作流程是,首先在关闭模糊匹配的情况下运行工具。 然后,再次在打开模糊匹配的情况下运行工具并检查结果。 这有助于识别可添加到自定义位置文件的拼写差异。

    了解有关模糊匹配的详细信息

参数

标注 说明 数据类型

输入文本或文件路径

将扫描以查找位置(坐标或自定义位置)、日期和自定义属性文本;用于定义文件路径的文本,将对该文本内容进行扫描以查找位置。 对于地理处理服务,当提供文件路径时,由于该文件未传输至服务器,因此该文件必须可通过服务进行访问。

String

输出要素类

包含点要素的要素类,代表找到的位置。

Feature Class

输入模板

(可选)

模板文件 (*.lxttmpl) 用于确定每个工具参数的设置。 如果提供了模板文件,除了决定要处理的输入内容和输出要素类的参数值外,其他参数的所有指定值都将被忽略。

提取位置窗格中的某些可用设置仅当其保存到模板文件中且该模板文件已在此参数中引用时才对此工具可用。 按如下所示设置:

  • Spatial coordinates in x,y format—允许将两个连续的数字(如 630084 4833438 或 981075.652ftUS 607151.272ftUS)识别为坐标,前提是它们对与输入文档相关的平面坐标系有效。 您可以指定识别带单位和不带单位的数字,还是只识别带测量单位的数字作为坐标。

  • Custom coordinate and date formats—允许您自定义将文本识别为空间坐标或日期的方式,尤其是用英语以外的语言书写或使用在美国不常用的格式时。 例如,在识别写为 30 20 10 N x 060 50 40 W 的空间坐标时,可以进行自定义,将经纬度之间的字符 x 识别为有效文本。 为适应文档的语言(本例中为法语)而进行自定义时,可以识别 60.91°N, 147.34°O 和 17 juillet, 2018 等坐标和日期。 此外,当使用两位数年份时,您可以控制与之匹配的年份范围。

  • Preferences for some ambiguous dates—诸如 10/12/2019 这样的日期是模糊的,因为它们既可以被解释为 2019 年 10 月 12 日,也可以被解释为 2019 年 12 月 10 日。 一些国家使用 m/d/yy 日期格式作为标准,其他国家则使用 d/m/yy 格式。 可以设置如何解释这些模糊日期的偏好,可以是 m/d/yy 或 d/m/yy,以适应文档的原产国。

  • Length of fields in the output feature class—您可以使用前文本字段长度(Python 中的 pre_text_length)和后文本字段长度(Python 中的 post_text_length)参数,指定包含从文档中提取的空间坐标周围文本的字段长度。 通过提取位置窗格,您可以控制属性表中几个附加字段的长度,包括包含从文档中提取的日期、转换为日期的原始文本、提取信息的文件名等字段。

File

经度和纬度

(可选)

指定是否搜索以十进制度数格式存储的经纬度坐标(偶发误报)。 例如:33.8N 77.035W 和 W77N38.88909。

  • 选中该工具将搜索十进制经纬度坐标。 这是默认设置。

  • 未选中该工具将不会搜索十进制经纬度坐标。

Boolean

带度数符号的 X Y

(可选)

指定是否搜索以十进制度数格式存储的带度数符号的 X Y 坐标(偶发误报)。 例如:38.8° -77.035° 和 -077d+38.88909d。

  • 选中该工具将搜索十进制带度数符号的 X Y 坐标。 这是默认设置。

  • 未选中该工具将不会搜索十进制带度数符号的 X Y 坐标。

Boolean

无符号的 X Y

(可选)

指定是否搜索以十进制度数格式存储的不带符号的 X Y 坐标(频发误报)。 例如:38.8 -77.035 和 -077.0, +38.88909。

  • 选中该工具将搜索十进制不带符号的 X Y 坐标(频发误报)。 这是默认设置。

  • 未选中该工具将不会搜索十进制不带符号的 X Y 坐标。

Boolean

经度和纬度

(可选)

指定是否搜索以度十进制分格式存储的经纬度坐标(偶发误报)。 例如:3853.3N 7702.100W 和 W7702N3853.3458。

  • 选中该工具将搜索度十进制分格式的经纬度坐标。 这是默认设置。

  • 未选中该工具将不会搜索度十进制分格式的经纬度坐标。

Boolean

带分符号的 X Y

(可选)

指定是否搜索以度十进制分格式存储的带有分符号的 X Y 坐标(偶发误报)。 例如:3853' -7702.1' 和 -07702m+3853.3458m。

  • 选中该工具将搜索度十进制分格式的带有分符号的 X Y 坐标。 这是默认设置。

  • 未选中该工具将不会搜索度十进制分格式的带有分符号的 X Y 坐标。

Boolean

经度和纬度

(可选)

指定是否搜索以度分秒格式存储的经纬度坐标(偶发误报)。 例如:385320.7N 770206.000W 和 W770206N385320.76。

  • 选中该工具将搜索度分秒格式的经纬度坐标。 这是默认设置。

  • 未选中该工具将不会搜索度分秒格式的经纬度坐标。

Boolean

带秒符号的 X Y

(可选)

指定是否搜索以度分秒格式存储的带有秒符号的 X Y 坐标(偶发误报)。 例如:385320" -770206.0" 和 -0770206.0s+385320.76s。

  • 选中该工具将搜索度分秒格式的带有秒符号的 X Y 坐标。 这是默认设置。

  • 未选中该工具将不会搜索度分秒格式的带有秒符号的 X Y 坐标。

Boolean

带分隔符的 X Y

(可选)

指定是否搜索以度分秒格式存储的带分隔符的 X Y 坐标(中度误报)。 例如:8:53:20 -77:2:6.0 和 -077/02/06/+38/53/20.76。

  • 选中该工具将搜索度分秒格式的带分隔符的 X Y 坐标。 这是默认设置。

  • 未选中该工具将不会搜索度分秒格式的带分隔符的 X Y 坐标。

Boolean

通用横轴墨卡托投影

(可选)

指定是否搜索通用横轴墨卡托 (UTM) 坐标(偶发误报)。 例如:18S 323503 4306438 和 18 north 323503.25 4306438.39。

  • 选中该工具将搜索 UTM 坐标。 这是默认设置。

  • 未选中该工具将不会搜索 UTM 坐标。

Boolean

UPS 北极

(可选)

指定是否在北极地区搜索通用极方位立体投影 (UPS) 坐标(偶发误报)。 例如:Y 2722399 2000000 和 north 2722399 2000000。

  • 选中该工具将搜索北极地区的 UPS 坐标。 这是默认设置。

  • 未选中该工具将不会搜索北极地区的 UPS 坐标。

Boolean

UPS 南极

(可选)

指定是否在南极地区搜索通用极方位立体投影 (UPS) 坐标(偶发误报)。 例如:A 2000000 3168892 和 south 2000000 3168892。

  • 选中该工具将搜索南极地区的 UPS 坐标。 这是默认设置。

  • 未选中该工具将不会搜索南极地区的 UPS 坐标。

Boolean

军事格网参考系

(可选)

指定是否搜索军事网格参考系统 (MGRS) 坐标(偶发误报)。 例如:18S UJ 13503 06438 和 18SUJ0306。

  • 选中该工具将搜索 MGRS 坐标。 这是默认设置。

  • 未选中该工具将不会搜索 MGRS 坐标。

Boolean

北极

(可选)

指定是否在北极地区搜索军事网格参考系统 (MGRS) 坐标(偶发误报)。 例如:Y TG 56814 69009 和 YTG5669。

  • 选中该工具将搜索北极地区的 MGRS 坐标。 这是默认设置。

  • 未选中该工具将不会搜索北极地区的 MGRS 坐标。

Boolean

南极

(可选)

指定是否在南极地区搜索军事网格参考系统 (MGRS) 坐标(中度误报)。 例如:A TN 56814 30991 和 ATN5630。

  • 选中该工具将搜索南极地区的 MGRS 坐标。 这是默认设置。

  • 未选中该工具将不会搜索南极地区的 MGRS 坐标。

Boolean

使用逗号作为小数分隔符

(可选)

指定是否将逗号 (,) 识别为小数分隔符。 默认情况下,扫描内容中由使用句号 (.) 或中间点 (·) 作为小数分隔符的数字定义的空间坐标,例如:Lat 01° 10·80' N Long 103° 28·60' E。 如果要处理的内容中,空间坐标由使用逗号 (,) 作为小数分隔符的数字定义,例如:52° 8′ 32,14″ N; 5° 24′ 56,09″ E,则将此参数设置为识别逗号作为小数分隔符。 该参数不会根据计算机操作系统的区域设置自动设置。

  • 选中逗号将被识别为小数分隔符。

  • 未选中句号或中间点将被识别为小数分隔符。 这是默认设置。

Boolean

解释为经度、纬度

(可选)

当数字与 x、y 坐标类似,两个数字都小于 90,并且没有用于表示哪个数字代表纬度或经度的符号或注记时,结果可能是模糊的。 将数字解释为经度-纬度坐标 (x,y),而不是纬度-经度坐标(即 y,x)。

  • 选中x、y 坐标解释为经度-纬度。

  • 未选中x、y 坐标解释为纬度-经度。 这是默认设置。

Boolean

输入坐标系

(可选)

用于解释输入中定义的空间坐标的坐标系。 默认为 GCS WGS 84。

Spatial Reference

输入自定义位置

(可选)

扫描输入内容时将使用的自定义位置文件 (.lxtgaz)。 在其他工具参数设定的限制范围内,创建一个点来代表自定义位置文件中出现的每个地名。

File

使用模糊匹配

(可选)

指定是否在搜索自定义位置文件时使用模糊匹配。

  • 选中搜索自定义位置文件时将使用模糊匹配。

  • 未选中搜索自定义位置文件时将使用精确匹配。 这是默认设置。

Boolean

所提取的最大要素数

(可选)

可提取要素的最大数量。 当达到最大数量时,工具将停止扫描输入内容中的位置。 在作为地理处理服务运行时,服务和服务器可能对允许的要素数量有不同的限制。

Long

忽略此第一个要素数

(可选)

在提取所有其他要素之前检测到并忽略的要素数量。 该参数可用于集中搜索数据的特定部分。

Long

所用月份名称

(可选)

指定是否搜索出现月份名称的日期(偶发误报)。 例如:12 May 2003 和 January 15, 1997。

  • 选中该工具将搜索出现月份名称的日期。 这是默认设置。

  • 未选中该工具将不会搜索出现月份名称的日期。

Boolean

M/D/Y 和 D/M/Y

(可选)

指定是否搜索数字格式为 M/D/Y 或 D/M/Y 的日期(中度误报)。 例如:5/12/03 和 1-15-1997。

  • 选中该工具将搜索数字格式为 M/D/Y 或 D/M/Y 的日期(中度误报)。 这是默认设置。

  • 未选中该工具将不会搜索数字格式为 M/D/Y 或 D/M/Y 的日期。

Boolean

YYYYMMDD

(可选)

指定是否搜索数字格式为 YYYYMMDD 的日期(中度误报)。 例如:20030512 和 19970115。

  • 选中该工具搜索数字格式为 YYYYMMDD 的日期(中度误报)。 这是默认设置。

  • 未选中该工具将不会搜索数字格式为 YYYYMMDD 的日期。

Boolean

YYMMDD

(可选)

指定是否搜索数字格式为 YYMMDD 的日期(频发误报)。 例如:030512 和 970115。

  • 选中该工具搜索数字格式为 YYMMDD 的日期(频发误报)。 这是默认设置。

  • 未选中该工具将不会搜索数字格式为 YYMMDD 的日期。

Boolean

YYJJJ

(可选)

指定是否搜索数字格式为 YYJJJ 或 YYYYJJJ 的日期(频发误报)。 例如:03132 和 97015。

  • 选中该工具搜索数字格式为 YYJJJ 或 YYYYJJJ 的日期(频发误报)。 这是默认设置。

  • 未选中该工具将不会搜索数字格式为 YYJJJ 或 YYYYJJJ 的日期。

Boolean

所提取的最大日期数

(可选)

提取日期的最大数量。

Long

忽略此第一个日期数

(可选)

在提取所有其他日期之前将被检测并忽略的日期数量。

Long

可接受日期范围的最早日期

(可选)

可接受的最早提取日期。 将提取与此值或更晚的值相匹配的检测日期。

Date

可接受日期范围的最近日期

(可选)

可接受的最晚提取日期。 将提取与此值或更早的值相匹配的检测日期。

Date

输入自定义属性

(可选)

将用于扫描输入内容的自定义属性文件 (.lxtca)。 将在输出要素类的属性表中为文件中定义的所有自定义属性创建字段。 扫描输入内容时,将检查其中是否包含与文件中指定的所有自定义属性相关的文本。 找到匹配后,就会从输入内容中提取相应的文本并存储到相应的字段中。

File

输入文件链接文本

(可选)

输入文件参数(Python 中的 in_file)传输到服务器时,输出数据中将作为文件名使用的文件路径。 如果未指定此参数,则将使用输入文件的路径,该路径可能是服务器上一个无法访问的文件夹。 未指定输入文件时,此参数不起作用。

String

输入文件日期和时间

(可选)

输入文件参数(Python 中的 in_file)传输到服务器时,已修改文件的 UTC 日期和时间将用作输出数据中的修改属性。 如果未指定此参数,则将使用输入文件的当前修改时间。 未指定输入文件时,此参数不起作用。

Date

前文本字段长度

(可选)

从输入文档中提取内容,为找到的位置提供上下文。 该参数定义了在定义位置的文本前提取的最大字符数。 提取的文本存储在输出要素类属性表的 Pre-Text 字段中。 默认为 254。 Pre-Text 字段的数据类型也有这个长度。 形状文件中文本字段的长度限制为 254 个字符;当输出为形状文件时,较大的字符数将被截断为 254 个字符。

Long

后文本字段长度

(可选)

从输入文档中提取内容,为找到的位置提供上下文。 该参数定义了在定义位置的文本后提取的最大字符数。 提取的文本存储在输出要素类属性表的 Post-Text 字段中。 默认为 254。 Post-Text 字段的数据类型也有这个长度。 形状文件中文本字段的长度限制为 254 个字符;当输出为形状文件时,较大的字符数将被截断为 254 个字符。

Long

坐标格式

(可选)

指定用于存储坐标位置的坐标格式。 属性表中的一个字段记录了定义点要素的空间坐标的标准表达。

  • DD - 十进制度坐标位置以十进制度格式记录。 这是默认设置。

  • DM - 十进制度分坐标位置以度十进制分格式记录。

  • DMS - 度分秒坐标位置以度分秒格式记录。

  • UTM - 通用横轴墨卡托投影坐标位置以墨卡托方位法格式记录。

  • MGRS - 军事格网参考系坐标位置以军事格网参考系格式记录。

String

需要词内换行

(可选)

指定是否使用词内换行搜索文本。 当单词(文本)由空格或标点符号(如欧洲语言)界定时,就会出现词内换行。

根据文本语言的不同,此设置可以生成频繁的误报或不频繁的误报。 例如,在不需要词内换行的情况下,搜索英文文本 Bernard 将匹配到文本 San Bernardino,而这很可能视为误报。 但是,当使用不使用词内换行的语言编写文本时,如果需要词内换行,则无法找到单词。 例如,对于 I flew to Tokyo(我飞往东京)的日语文本:私は東京に飛んで,在不需要词内换行的情况下,只能找到 Tokyo 一词:東京

  • 选中该工具将搜索由空格或标点符号界定的单词。 这是默认设置。

  • 未选中该工具将不会搜索由空格或标点符号界定的单词。

Boolean

环境

当前工作空间, 输出坐标系, 地理变换

许可信息

  • 基本: 否
  • 标准: 是
  • 高级: 是