Skip to main content

Entrenar modelo de reconocimiento de entidades (Herramientas de GeoAI)

Resumen

Entrena un modelo de reconocimiento de entidades con nombre para extraer un conjunto predefinido de entidades de texto sin procesar.

Más información sobre cómo funciona Reconocimiento de entidades

Uso

  • Esta herramienta también puede utilizarse para ajustar un modelo ya entrenado.

  • Para ejecutar esta herramienta utilizando la GPU, establezca el entorno Tipo de procesador en GPU. Si tiene más de una GPU, especifique el entorno de Id. de GPU en su lugar.

  • La entrada puede ser una clase de entidad o una tabla con un campo de texto y etiquetas de entidad con nombre, o una carpeta con datos de entrenamiento en archivos .json o .csv.

  • Esta herramienta utiliza bases basadas en transformadores para entrenar modelos NER y también es compatible con el aprendizaje en contexto con indicaciones mediante el LLM Mistral. Para instalar la base Mistral, consulte Base Mistral de ArcGIS.

  • Para obtener información sobre los requisitos para ejecutar esta herramienta y los problemas que pueden presentarse, consulte Preguntas frecuentes sobre el aprendizaje profundo.

Parámetros

Etiqueta Explicación Tipo de datos

Carpeta o tabla de entrada

La entrada puede ser cualquiera de las siguientes:

  • Clase de entidad o tabla que contiene un campo de texto con el texto de entrada para el modelo y las entidades etiquetadas en las que el campo de texto seleccionado se utilizará como texto de entrada del modelo y los campos restantes se tratarán como etiquetas de entidades nominales.

  • Carpeta que contiene datos de entrenamiento en forma de datasets estándar para tareas NER. Los datos de entrenamiento deben estar en archivos .json o .csv. El formato de archivo determina el tipo de dataset de la entrada.

    • Cuando la entrada es una carpeta, se admiten los tipos de datasets siguientes:

      • ner_json—La carpeta de datos de entrenamiento debe contener un archivo .json con texto y las entidades etiquetadas formateadas utilizando el formato de entrenamiento JSON de spaCy.

      • IOB—El formato IOB (etiquetas dentro, fuera, principio) propuesto por Ramshaw y Marcus en el artículo Text Chunking using Transformation-Based Learning.

        La carpeta de datos de entrenamiento debe contener los dos siguientes archivos .csv:

        • tokens.csv—Contiene texto como fragmentos de entrada

        • tags.csv—Contiene etiquetas IOB para los fragmentos de texto

      • BILUO—Extensión del formato IOB que contiene además las etiquetas L (último) y U (unidad).

        La carpeta de datos de entrenamiento debe contener los dos siguientes archivos .csv:

        • tokens.csv—Contiene texto como fragmentos de entrada

        • tags.csv—Contiene etiquetas BILUO para los fragmentos de texto

Folder; Feature Layer; Table View; Feature Class

Modelo de salida

La ubicación de la carpeta de salida donde se almacenará el modelo entrenado.

Folder

Archivo del modelo preentrenado

(Opcional)

Un modelo previamente entrenado que se usará para ajustar el nuevo modelo. La entrada puede ser un archivo de definición de modelo de Esri (".emd") o un archivo de paquete de aprendizaje profundo (".dlpk").

Es posible ajustar un modelo previamente entrenado con entidades similares para que se adapte al nuevo modelo. El modelo previamente entrenado debe haber sido entrenado con el mismo tipo de modelo y modelo base que se usará para entrenar el nuevo modelo.

File

Entidad de dirección

(Opcional)

La entidad de dirección se tratará como una ubicación. Durante la inferencia, dichas entidades se geocodificarán con el localizador especificado y se producirá una clase de entidad como resultado del proceso de extracción de entidades. Si no se proporciona ningún localizador o el modelo entrenado no extrae entidades de dirección, se generará en su lugar una tabla con las entidades extraídas.

String

Máximo de épocas

(Opcional)

El número máximo de épocas para las que se entrenará el modelo. Un valor máximo de época de 1 significa que el dataset se enviará una vez por la red neuronal. El valor predeterminado es 5.

Long

Modelo central

(Opcional)

Especifica la red neuronal preconfigurada que se usará como arquitectura para entrenar el nuevo modelo.

  • bert-base-casedEl modelo se entrenará con la red neuronal BERT. BERT se preentrena utilizando el objetivo de modelado del lenguaje enmascarado y la predicción de la siguiente frase.

  • roberta-baseEl modelo se entrenará con la red neuronal RoBERTa. RoBERTa modifica los hiperparámetros clave de BERT, eliminando el objetivo de preentrenamiento y entrenando la siguiente frase con lotes pequeños y tasas de aprendizaje más altas.

  • albert-base-v1El modelo se entrenará con la red neuronal ALBERT. ALBERT utiliza una pérdida autosupervisada que se centra en modelar la coherencia entre frases, lo que da lugar a una mejor escalabilidad que BERT.

  • xlnet-base-casedEl modelo se entrenará con la red neuronal XLNet. XLNet es un método de preentrenamiento autorregresivo generalizado. Permite aprender contextos bidireccionales maximizando la probabilidad esperada en todas las permutaciones del orden de factorización, que superan las desventajas de BERT.

  • xlm-roberta-baseEl modelo se entrenará con la red neuronal XLM-RoBERTa. XLM-RoBERTa es un modelo multilingüe entrenado en 100 idiomas diferentes. A diferencia de algunos modelos multilingües XLM, no requiere tensores lingüísticos para comprender qué idioma se utiliza e identifica el idioma correcto a partir de los ID de entrada.

  • distilroberta-baseEl modelo se entrenará con la red neuronal DistilRoBERTa. DistilRoBERTa es un modelo de idioma inglés preentrenado con la supervisión de la red neural base de RoBERTa basado únicamente en OpenWebTextCorpus, una reproducción del dataset WebText de OpenAI.

  • distilbert-base-casedEl modelo se entrenará con la red neuronal DistilBERT. DistilBERT es un modelo de representación del lenguaje más pequeño y de uso general.

  • mistralEl modelo se entrenará con el modelo de lenguaje grande (LLM) Mistral. Mistral es un transformador exclusivamente descodificador que utiliza atención de ventana deslizante, atención de consulta agrupada y divisor en tokens BPE de reserva de bytes. Para instalar la base Mistral, consulte Base Mistral de ArcGIS.

String

Tamaño de lote

(Opcional)

Número de muestras de entrenamiento que se procesarán a la vez. El valor predeterminado es 2.

El rendimiento de la herramienta puede mejorarse aumentando el tamaño del lote; sin embargo, conforme aumenta el tamaño del lote se utiliza más memoria. Si se produce un error de memoria insuficiente, utilice un tamaño de lote más pequeño.

Double

Argumentos de modelo

(Opcional)

Argumentos adicionales que se utilizarán para inicializar el modelo. El argumento de modelo admitido es Sequence Length, que se utiliza para fijar la longitud máxima de secuencia de los datos de entrenamiento que se tendrán en cuenta para entrenar el modelo.

Columnas de la tabla de valores:

  • NameThe name of the function argument.

  • ValueThe value of the function argument.

Value Table

Tasa de aprendizaje

(Opcional)

Tamaño del paso que indica cuánto se ajustarán los pesos del modelo durante el proceso de entrenamiento. Si no se especifica ningún valor, se derivará automáticamente una tasa de aprendizaje óptima.

Double

Porcentaje de validación

(Opcional)

El porcentaje de muestras de entrenamiento que se usará para validar el modelo. El valor predeterminado es 10 para las bases del modelo basadas en transformadores y 50 para la base Mistral.

Double

Detener cuando el modelo deja de mejorar

(Opcional)

Especifica si el entrenamiento del modelo se detendrá cuando el modelo deje de mejorar o continuará hasta alcanzar el valor del parámetro Máximo de épocas.

  • ActivadoEl entrenamiento del modelo se detendrá cuando el modelo deje de mejorar, independientemente del valor del parámetro Máximo de épocas. Esta es la opción predeterminada.

  • DesactivadoEl entrenamiento del modelo continuará hasta que se alcance el valor del parámetro Máximo de épocas.

Boolean

Convertir el modelo central en entrenable

(Opcional)

Especifica si las capas base del modelo previamente entrenado se congelarán, de modo que los pesos y sesgos sigan tal como se diseñaron originalmente.

  • ActivadoLas capas base no se congelarán, y los pesos y sesgos del valor del parámetro Base del modelo se pueden modificar para que se ajusten a las muestras de entrenamiento. Esto conlleva más tiempo de procesamiento, pero suele producir mejores resultados. Esta es la opción predeterminada.

  • DesactivadoLas capas base se congelarán, y los pesos y sesgos predefinidos del valor del parámetro Base del modelo no se modificarán durante el entrenamiento.

Boolean

Campo de texto

Un campo de texto de la tabla o clase de entidad de entrada que contiene el texto que utilizará el modelo como entrada. Este parámetro es necesario cuando el valor del parámetro Carpeta o tabla de entrada tiene una clase de entidad o tabla.

Field

Solicitar

(Opcional)

Entrada o instrucción específica dada a un modelo de gran lenguaje (LLM) para generar la salida esperada.

El valor predeterminado es Extraer entidades con nombre pertenecientes a las clases especificadas dentro del texto proporcionado. No etiquete entidades que pertenezcan a otra clase.

String

Entornos

Tipo de procesador, Id. de GPU

Información de licenciamiento

  • Basic: No
  • Standard: No
  • Avanzado: Sí