Skip to main content

Detectar objetos con aprendizaje profundo (Herramientas de Image Analyst)

Resumen

Ejecuta un modelo de aprendizaje profundo entrenado en un ráster de entrada para generar una clase de entidad con los objetos que encuentre. Las entidades pueden ser cuadros o polígonos de delimitación alrededor de los objetos encontrados o puntos en el centro de los objetos.

Esta herramienta requiere un archivo de definición de modelo que contenga información del modelo entrenado. El modelo se puede entrenar usando la herramienta Entrenar un modelo de aprendizaje profundo o mediante software de entrenamiento de terceros como PyTorch. El archivo de definición de modelo puede ser un archivo JSON de definición de modelo de Esri (.emd) o un paquete de modelo de aprendizaje profundo, y debe contener la ruta a la función ráster de Python que se llamará para procesar cada objeto y la ruta al archivo de modelo de aprendizaje profundo binario entrenado.

Uso

  • Debe instalar la API de Python de marco de aprendizaje profundo adecuada (como PyTorch) en el entorno de Python de ArcGIS Pro; de lo contrario, se producirá un error al agregar el archivo de definición de modelo de Esri a la herramienta. La información de marco adecuada se obtiene del creador del archivo de definición de modelo de Esri.

    Para configurar su equipo para usar marcos de aprendizaje profundo en ArcGIS Pro, consulte Instalar marcos de aprendizaje profundo para ArcGIS.

  • Esta herramienta llama a una API de Python de aprendizaje profundo de terceros (como PyTorch) y usa la función ráster de Python especificada para procesar cada objeto.

  • Ejemplos de casos de uso de esta herramienta se encuentran en la página de GitHub sobre la función ráster de Python de Esri. También puede escribir módulos de Python personalizados con los siguientes ejemplos e instrucciones del repositorio de GitHub.

  • El valor del parámetro Definición de modelo puede ser un archivo JSON de definición de modelo de Esri (.emd), una cadena de caracteres JSON o un paquete de modelo de aprendizaje profundo (.dlpk). Una cadena de caracteres JSON es útil cuando esta herramienta se utiliza en el servidor para pegar la cadena de caracteres JSON, en lugar de cargar el archivo .emd. El archivo .dlpk debe almacenarse localmente.

  • La herramienta puede procesar imágenes de entrada que estén en el espacio de mapa o en el espacio de píxeles. Las imágenes en el espacio de mapa se encuentran en un sistema de coordenadas basado en mapa. Las imágenes en el espacio de píxeles se basan en filas y columnas sin rotación ni distorsión. El sistema de referencia puede especificarse al generar los datos de entrenamiento en la herramienta Exportar datos de entrenamiento para aprendizaje profundo usando el parámetro Sistema de referencia. Si el modelo se entrena en un software de entrenamiento de terceros, el sistema de referencia debe especificarse en el archivo .emd usando el parámetro ImageSpaceUsed, que puede establecerse en MAP_SPACE o PIXEL_SPACE.

  • Para las capas de imágenes orientadas, el procesamiento siempre se realizará en el espacio de píxeles. Cuando se utiliza el espacio de píxeles para el procesamiento, las detecciones del espacio de píxeles se conservan en la tabla de salida del campo IShape.

  • El rendimiento de la herramienta puede mejorarse aumentando el tamaño del lote; sin embargo, conforme aumenta el tamaño del lote se utiliza más memoria. Si se produce un error de memoria insuficiente, utilice un tamaño de lote más pequeño. El valor de batch_size se puede ajustar con el parámetro Argumentos.

  • Los tamaños de lote son números cuadrados, como 1, 4, 9, 16, 25, 64, etc. Si el valor de entrada no es un número cuadrado, se utiliza el valor cuadrado más alto posible. Por ejemplo, si se especifica un valor de 6, el tamaño de lote se establece en 4.

  • Use el parámetro Supresión no máxima para identificar y eliminar entidades duplicadas de la detección de objetos. Para obtener más información sobre este parámetro, consulte la sección **Utilización de la herramienta **Supresión no máxima. Cuando las entradas son capas de imágenes orientadas, los duplicados se conservan con geometrías de terreno nulas.

  • Utilice la opción Procesar solo elementos candidatos del parámetro Modo de procesamiento para detectar objetos solo en imágenes seleccionadas del dataset del mosaico. Puede utilizar la herramienta Calcular candidatos de mosaico para encontrar las imágenes candidatas en un dataset de mosaico y un servicio de imágenes que mejor representen el área del mosaico.

  • Esta herramienta admite y utiliza varias GPU, si están disponibles. Para utilizar una GPU específica, determine el entorno Id. de GPU. Cuando el Id. de GPU no se define, la herramienta todas las GPU disponibles. Esta es la opción predeterminada.

  • Cuando el entorno Tipo de procesador se configura como CPU y el entorno Factor de procesamiento en paralelo no se especifica, la herramienta utilizará un valor de Factor de procesamiento en paralelo del 50 %.

Parámetros

Etiqueta Explicación Tipo de datos

Ráster de entrada

La imagen de entrada que se utilizará para detectar objetos. La entrada puede ser un solo ráster, varios rásteres de un dataset de mosaico, un servicio de imágenes, una carpeta de imágenes, una clase de entidad con imágenes adjuntas o una capa o dataset de imágenes orientadas.

Raster Dataset; Raster Layer; Mosaic Layer; Image Service; Map Server; Map Server Layer; Internet Tiled Layer; Folder; Feature Layer; Feature Class; Oriented Imagery Layer

Objetos de salida detectados

Clase de entidad de salida que contendrá geometrías que rodean al objeto u objetos detectados en la imagen de entrada.

Si la clase de entidad ya existe, los resultados se agregarán a la clase de entidad existente.

Feature Class

Definición de modelo

Este parámetro puede ser un archivo JSON de definición de modelo de Esri (.emd), una cadena de caracteres JSON o un paquete de modelo de aprendizaje profundo (.dlpk). Una cadena de caracteres JSON es útil cuando esta herramienta se utiliza en el servidor para pegar la cadena de caracteres JSON, en lugar de cargar el archivo .emd. El archivo .dlpk debe almacenarse localmente.

Contiene la ruta al archivo de modelo binario de aprendizaje profundo, la ruta a la función ráster de Python que se va a usar y otros parámetros, como el tamaño de tesela preferido o el relleno.

File; String

Argumentos

(Opcional)

La información del parámetro Definición de modelo se utilizará para rellenar este parámetro. Estos argumentos varían en función de la arquitectura del modelo. Los siguientes son los argumentos de modelo admitidos para los modelos entrenados en ArcGIS. Los modelos preentrenados de ArcGIS y los modelos de aprendizaje profundo personalizados pueden tener argumentos adicionales compatibles con la herramienta.

  • Relleno: el número de píxeles en el borde de las teselas de imágenes desde los cuales se combinarán las predicciones de las teselas adyacentes. Para suavizar la salida a la vez que se reducen los artefactos, aumente el valor. El valor máximo del relleno puede ser la mitad del valor del tamaño de tesela. El argumento está disponible para todas las arquitecturas del modelo.

  • Umbral de confianza: las detecciones con una puntuación de confianza superior a este umbral se incluirán en el resultado. Los valores permitidos son entre 0 y 1,0. El argumento está disponible para todas las arquitecturas del modelo.

  • Tamaño de lote: el número de teselas de imágenes que se procesarán en cada paso de la inferencia del modelo. Esto depende de la memoria de la tarjeta gráfica. El argumento está disponible para todas las arquitecturas del modelo.

  • Superposición NMS: el ratio de superposición máximo para dos entidades de superposición, definido como la relación del área de intersección sobre el área de combinación. El valor predeterminado es 0,1. El argumento está disponible para todas las arquitecturas del modelo.

  • Excluir las detecciones de relleno: si se establece en true, se filtrarán detecciones potencialmente truncadas cerca de los bordes que están en la región rellena de chips de imagen. El argumento está disponible para SSD, RetinaNet, YOLOv3, DETReg, MMDetection y Faster RCNN solamente.

  • Escalas TTA: realiza pruebas de aumento de tiempo utilizando diferentes escalas. Cada escala significa que el bloque de píxeles se procesará con las escalas proporcionadas. La escala predeterminada es 1, lo que significa que no se produce ningún escalado. Las distintas escalas están separadas por comas, por ejemplo, 0,9,1,1,1. En este caso, el bloque de píxeles se procesará tres veces, primero a una escala de 0,9, luego sin cambio de escala y, por último, con una escala de 1,1.

  • Aumento del tiempo de prueba: aplica un aumento del tiempo de prueba durante la predicción. Si se establece en True, las predicciones de orientaciones rotadas y volteadas de la imagen de entrada se fusionarán en la salida final y sus valores de confidencia se promediarán. Esto puede hacer que los valores de confianza caigan por debajo del umbral en el caso de los objetos que solo se detectan en unas cuantas orientaciones de la imagen. El argumento está disponible para todas las arquitecturas del modelo.

  • Tamaño de tesela: el ancho y la altura de las teselas de imágenes en que se dividen las imágenes para la predicción. El argumento solo está disponible para MaskRCNN.

  • Política de fusionado: la política para fusionar predicciones aumentadas. Las opciones disponibles son Mín., Máx. y Valor medio. Solo es aplicable cuando se utiliza el aumento del tiempo de prueba. El argumento solo está disponible para MaskRCNN.

  • Ráster clasificado de salida: la ruta al ráster de salida. El argumento solo está disponible para MaXDeepLab.

Columnas de la tabla de valores:

  • NameThe name of the function argument.

  • ValueThe value of the function argument.

Value Table

Supresión no máxima

(Opcional)

Especifica si se realizará la supresión no máxima, en la cual se identifican los objetos duplicados y se eliminan las entidades duplicadas con el valor de confianza más bajo.

  • ActivadoSe realizará la supresión no máxima y se eliminarán los objetos duplicados detectados. Cuando las entradas son capas de imágenes orientadas, los duplicados se conservan con geometrías de terreno nulas.

  • DesactivadoNo se realizará la supresión no máxima. Todos los objetos detectados estarán en la clase de entidad de salida. Esta es la opción predeterminada.

Boolean

Campo de puntuación de confianza

(Opcional)

Nombre del campo de la clase de entidad que contendrá las puntuaciones de confianza generadas por el método de detección de objetos.

Este parámetro es obligatorio cuando está activado el parámetro Supresión no máxima.

String

Campo de valor de clase

(Opcional)

El nombre del campo de valor de clase de la clase de entidad de entrada.

Si no se proporciona ningún nombre de campo, se utilizará un campo Classvalue o Value. Si estos campos no existen, se identificará que todos los registros pertenecen a una sola clase.

String

Máx. ratio de superposición

(Opcional)

El ratio de superposición máximo para dos entidades de superposición, definido como la relación del área de intersección sobre el área de combinación. El valor predeterminado es 0.

Double

Modo de procesamiento

(Opcional)

Especifica cómo se procesarán todos los elementos de ráster en un dataset de mosaico o un servicio de imágenes. Este parámetro se aplica si el ráster de entrada es un dataset de mosaico o un servicio de imágenes.

  • Procesar como imagen en mosaicoSe creará un mosaico con todos los elementos de ráster del dataset de mosaico o del servicio de imágenes y se procesarán. Esta es la opción predeterminada.

  • Procesar todos los elementos de ráster por separadoTodos los elementos de ráster del dataset de mosaico o del servicio de imágenes se procesarán como imágenes separadas.

  • Procesar solo los elementos candidatosSolo se procesarán los elementos de ráster con un valor de 1 o 2 en el campo Candidate de la tabla de atributos del datasets de mosaico de entrada.

String

Utilizar espacio de píxeles

(Opcional)

Especifica si la inferencia se realizará en imágenes en espacio de píxeles.

  • ActivadoLa inferencia se realizará en el espacio de píxeles y la salida se transformará de nuevo en el espacio de mapa. Esta opción es útil cuando se utilizan imágenes oblicuas o imágenes de callejero, que pueden distorsionar las entidades utilizando el espacio de mapa.

  • DesactivadoLa inferencia se hará en el espacio de mapa. Esta es la opción predeterminada.

Boolean

Objetos de interés

(Opcional)

Especifica los nombres de los objetos que detectará la herramienta. Las opciones disponibles se basarán en el valor del parámetro Definición de modelo.

Este parámetro solo está activo cuando el modelo detecta más de un tipo de objeto.

String

Salida derivada

Etiqueta Explicación Tipo de datos

Ráster clasificado de salida

El ráster clasificado de salida para la clasificación de píxeles. El nombre del dataset ráster será el mismo que el valor del parámetro Objetos de salida detectados.

Este parámetro solo es aplicable cuando el tipo de modelo es Segmentación panóptica.

Raster Dataset

Entornos

Tamaño de celda, Espacio de trabajo actual, Extensión, Transformaciones geográficas, Id. de GPU, Máscara, Sistema de coordenadas de salida, Factor de procesamiento en paralelo, Tipo de procesador, Espacio de trabajo temporal

Información de licenciamiento

  • Basic: Requiere Image Analyst
  • Standard: Requiere Image Analyst
  • Avanzado: Requiere Image Analyst