Skip to main content

训练文本分类模型 (GeoAI 工具)

汇总

训练单标注或多标注的文本分类模型,可将非结构化文本分配到预定义的类别或标注中。

了解有关“文本分类”工作原理的详细信息

用法

  • 此工具还用于微调现有已训练模型。

  • 要使用 GPU 运行此工具,将处理器类型环境设置为 GPU。 如果您具有多个 GPU,则改为指定 GPU ID 环境。

  • 输入可以是包含训练数据的表或要素类,其中文本字段包含输入文本,标注字段包含目标类标注。

  • 此工具将使用基于转换器的骨干来训练文本分类模型,并且还支持使用 Mistral LLM 的提示进行上下文学习。 要安装 Mistral 主干,请参阅 ArcGIS Mistral 主干

  • 有关运行此工具的要求以及您可能遇到的问题的信息,请参阅深度学习常见问题

参数

标注 说明 数据类型

输入表

要素类或表,其中包含一个文本字段,用于存储模型的输入文本;以及一个标注字段,用于存储目标类标注。

Feature Layer; Table View

文本字段

输入要素类或表中包含将由模型进行分类的文本的文本字段。

Field

标注字段

输入要素类或表中包含用于训练模型的目标类标注的文本字段。 对于多标注文本分类,需指定多个文本字段。

Field

输出模型

将存储训练模型的输出文件夹位置。

Folder

预训练模型文件

(可选)

将用于微调新模型的预训练模型。 输入可以为 Esri 模型定义文件 (.emd) 或深度学习包文件 (.dlpk)。

可以对具有相似类的预训练模型进行微调以适应新模型。 预训练模型必须已使用将用于训练新模型的相同模型类型和骨干模型进行了训练。

File

最大轮数

(可选)

应用于将训练模型的最大轮数。 最大轮数值为 1 意味着数据集将通过神经网络传递一次。 默认值为 5。

Long

模型骨干

(可选)

指定作为模型编码器并提取输入文本的要素表示的预配置神经网络,采用固定长度矢量的形式。 将这些矢量作为输入传递给模型的分类中心词。

  • bert-base-cased该模型将使用 BERT 神经网络进行训练。 BERT 预训练中使用掩膜语言来建模目标和进行下一句预测。

  • roberta-base该模型将使用 RoBERTa 神经网络进行训练。 RoBERTa 修改了 BERT 的关键超参数,利用小批量处理和高学习率,消除了预训练目标和下一句训练的需求。

  • albert-base-v1该模型将使用 ALBERT 神经网络进行训练。 ALBERT 使用自监督损失,着重建模句间一致性,与 BERT 相比,可扩展性更佳。

  • xlnet-base-cased该模型将使用 XLNet 神经网络进行训练。 XLNet 是一种广义自回归预训练方法。 该方法允许通过最大限度提升分解顺序的所有排列的预期概率来学习双向上下文,从而克服了 BERT 的缺点。

  • xlm-roberta-base该模型将使用 XLM-RoBERTa 神经网络进行训练。 XLM-RoBERTa 是在 100 种不同语言上进行训练的多语言模型。 与某些 XLM 多语言模型不同,它不需要语言张量来了解使用的语言,并且可以从输入 ID 中识别正确的语言。

  • distilroberta-base该模型将使用 DistilRoBERTa 神经网络进行训练。 DistilRoBERTa 是一种英语语言模型,仅在 OpenWebTextCorpus 上由 roberta-base 神经网络监督进行预训练(OpenWebTextCorpus 是 OpenAI 的 WebText 数据集的复制品)。

  • distilbert-base-cased该模型将使用 DistilBERT 神经网络进行训练。 DistilBERT 通用语言表示模型更小。

  • mistral该模型将使用 Mistral 大型语言模型 (LLM) 创建。 Mistral 是一种仅限解码器的变换器模型,采用滑动窗口注意力、分组查询注意力和字节回退 BPE 分词器技术。 要安装 Mistral 主干,请参阅 ArcGIS Mistral 主干

String

批量大小

(可选)

一次需要处理的训练样本数。 默认值为 2。

增加批量大小可以提高工具性能;但是随着批量大小增加,所用内存也将随之增加。 如果出现内存不足错误,则降低批量大小。

Double

模型参数

(可选)

将用于初始化模型的附加参数。 受支持的模型参数为 Sequence Length,此参数用于设置训练数据的最大序列长度,将被考虑用于训练模型。

值表列:

  • NameThe name of the function argument.

  • ValueThe value of the function argument.

Value Table

学习率

(可选)

步长用于指示在训练过程中调整模型权重的大小。 如果未指定值,则将自动应用最佳学习率。

Double

验证百分比

(可选)

将用于验证模型的训练样本的百分比。 对于基于转换器的模型骨干,默认值为 10;对于 Mistral 骨干,默认值为 50。

Double

当模型停止改进时停止

(可选)

指定模型训练是在模型不再改进时停止,还是继续直至达到最大轮数参数值时才停止。

  • 选中当模型不再改进时,模型训练将停止,不考虑最大轮数参数值。 这是默认设置。

  • 未选中模型训练将一直持续,直至达到最大轮数参数值为止。

Boolean

创建可训练模型骨干

(可选)

指定是否冻结预训练模型中的骨干图层,以使权重和偏差保持原始设计。

  • 选中不会冻结骨干图层,model_backbone 参数值的权重和偏差可能会进行更改以更好地适合您的训练样本。 这需要更多的处理时间,但通常会产生更好的结果。 这是默认设置。

  • 未选中将冻结骨干图层,在训练过程中不会更改预定义的 model_backbone 参数值的权重和偏差。

Boolean

移除 HTML 标签

(可选)

指定是否从输入文本中移除 HTML 标签。

  • 选中将从输入文本中移除 HTML 标签。 这是默认设置。

  • 未选中不会从输入文本中移除 HTML 标签。

Boolean

移除 URL

(可选)

指定是否从输入文本中移除 URL。

  • 选中将从输入文本中移除 URL。 这是默认设置。

  • 未选中不会从输入文本中移除 URL。

Boolean

提示 (prompt)

(可选)

特定输入或指令用于指导大型语言模型 (LLM) 生成预期输出。

默认值是将提供的文本分类到指定的类别中。 不创建新的分类标注。

String

环境

处理器类型, GPU ID

许可信息

  • 基本: 否
  • 标准: 否
  • 高级: 是