Skip to main content

Entrenar modelo de transformación de texto (Herramientas de GeoAI)

Resumen

Entrena un modelo de transformación de texto para transformar, traducir o resumir texto.

Más información sobre cómo funciona la herramienta de transformación de texto

Uso

  • Esta herramienta también puede utilizarse para ajustar un modelo ya entrenado.

  • Para ejecutar esta herramienta utilizando la GPU, establezca el entorno Tipo de procesador en GPU. Si tiene más de una GPU, especifique el entorno de Id. de GPU en su lugar.

  • La entrada a la herramienta es una tabla o clase de entidad que contiene datos de entrenamiento con un campo de texto que contiene el texto de entrada y un campo de etiqueta que contiene el texto transformado.

  • Esta herramienta utiliza bases basadas en transformadores para entrenar modelos de transformación de texto y también es compatible con el aprendizaje en contexto con indicaciones mediante el LLM Mistral. Para instalar la base Mistral, consulte Base Mistral de ArcGIS.

  • Para obtener información sobre los requisitos para ejecutar esta herramienta y los problemas que pueden presentarse, consulte Preguntas frecuentes sobre el aprendizaje profundo.

Parámetros

Etiqueta Explicación Tipo de datos

Tabla de entrada

Una tabla o clase de entidad que contiene un campo de texto con el texto de entrada para el modelo y un campo de etiqueta que contiene el texto transformado objetivo.

Feature Layer; Table View

Campo de texto

Un campo de texto de la tabla o clase de entidad de entrada que contiene el texto de entrada que el modelo transformará.

Field

Campo de etiqueta

Un campo de texto de la tabla o clase de entidad de entrada que contiene el texto transformado objetivo para entrenar el modelo.

Field

Modelo de salida

La ubicación de la carpeta de salida donde se almacenará el modelo entrenado.

Folder

Archivo del modelo preentrenado

(Opcional)

Un modelo previamente entrenado que se usará para ajustar el nuevo modelo. La entrada puede ser un archivo de definición de modelo de Esri (".emd") o un archivo de paquete de aprendizaje profundo (".dlpk").

Es posible ajustar un modelo previamente entrenado que realice una tarea similar para que se adapte a los datos de entrenamiento. El modelo previamente entrenado debe haber sido entrenado con el mismo tipo de modelo y modelo base que se usará para entrenar el nuevo modelo.

File

Máximo de épocas

(Opcional)

El número máximo de épocas para las que se entrenará el modelo. Un valor máximo de época de 1 significa que el dataset se enviará una vez por la red neuronal. El valor predeterminado es 5.

Long

Modelo central

(Opcional)

Especifica la red neuronal preconfigurada que se usará como arquitectura para entrenar el nuevo modelo.

  • t5-smallEl nuevo modelo se entrenará con la red neuronal T5. T5 es un marco unificado que convierte cada problema de lenguaje en formato de texto a texto. t5-small es la variante pequeña de T5.

  • t5-baseEl nuevo modelo se entrenará con la red neuronal T5. T5 es un marco unificado que convierte cada problema de lenguaje en formato de texto a texto. t5-base es la variante mediana de T5.

  • t5-largeEl nuevo modelo se entrenará con la red neuronal T5. T5 es un marco unificado que convierte cada problema de lenguaje en formato de texto a texto. t5-large es la variante grande de T5.

  • mistralEl modelo se entrenará con el modelo de lenguaje grande (LLM) Mistral. Mistral es un transformador exclusivamente descodificador que utiliza atención de ventana deslizante, atención de consulta agrupada y divisor en tokens BPE de reserva de bytes. Para instalar la base Mistral, consulte Base Mistral de ArcGIS.

String

Tamaño de lote

(Opcional)

Número de muestras de entrenamiento que se procesarán a la vez. El valor predeterminado es 2.

El rendimiento de la herramienta puede mejorarse aumentando el tamaño del lote; sin embargo, conforme aumenta el tamaño del lote se utiliza más memoria. Si se produce un error de memoria insuficiente, utilice un tamaño de lote más pequeño.

Double

Argumentos de modelo

(Opcional)

Argumentos adicionales que se utilizarán para inicializar el modelo. El argumento de modelo admitido es Sequence Length, que se utiliza para fijar la longitud máxima de secuencia de los datos de entrenamiento que se tendrán en cuenta para entrenar el modelo.

Columnas de la tabla de valores:

  • NameThe name of the function argument.

  • ValueThe value of the function argument.

Value Table

Tasa de aprendizaje

(Opcional)

Tamaño del paso que indica cuánto se ajustarán los pesos del modelo durante el proceso de entrenamiento. Si no se especifica ningún valor, se derivará automáticamente una tasa de aprendizaje óptima.

Double

Porcentaje de validación

(Opcional)

El porcentaje de muestras de entrenamiento que se usará para validar el modelo. El valor predeterminado es 10 para las bases del modelo basadas en transformadores y 50 para la base Mistral.

Double

Detener cuando el modelo deja de mejorar

(Opcional)

Especifica si el entrenamiento del modelo se detendrá cuando el modelo deje de mejorar o continuará hasta alcanzar el valor del parámetro Máximo de épocas.

  • ActivadoEl entrenamiento del modelo se detendrá cuando el modelo deje de mejorar, independientemente del valor del parámetro Máximo de épocas. Esta es la opción predeterminada.

  • DesactivadoEl entrenamiento del modelo continuará hasta que se alcance el valor del parámetro Máximo de épocas.

Boolean

Convertir el modelo central en entrenable

(Opcional)

Especifica si las capas base del modelo previamente entrenado se congelarán, de modo que los pesos y sesgos sigan tal como se diseñaron originalmente.

  • ActivadoLas capas base no se congelarán, y los pesos y sesgos del valor del parámetro Base del modelo se pueden modificar para que se ajusten a las muestras de entrenamiento. Esto conlleva más tiempo de procesamiento, pero suele producir mejores resultados. Esta es la opción predeterminada.

  • DesactivadoLas capas base se congelarán, y los pesos y sesgos predefinidos del valor del parámetro Base del modelo no se modificarán durante el entrenamiento.

Boolean

Quitar etiquetas HTML

(Opcional)

Especifica si se eliminarán las etiquetas HTML del texto introducido.

  • ActivadoSe eliminarán las etiquetas HTML del texto introducido. Esta es la opción predeterminada.

  • DesactivadoLas etiquetas HTML del texto introducido no se eliminarán.

Boolean

Quitar URL

(Opcional)

Especifica si se eliminarán las direcciones URL del texto introducido.

  • ActivadoSe eliminarán las direcciones URL del texto introducido. Esta es la opción predeterminada.

  • DesactivadoLas direcciones URL del texto introducido no se eliminarán.

Boolean

Solicitar

(Opcional)

Entrada o instrucción específica dada a un modelo de gran lenguaje (LLM) para generar la salida esperada.

El valor predeterminado es Transformar el texto de entrada del campo de texto en el texto transformado presente en el campo de etiqueta.

String

Entornos

Tipo de procesador, Id. de GPU

Información de licenciamiento

  • Basic: No
  • Standard: No
  • Avanzado: Sí