Skip to main content

Argumentos del aprendizaje profundo

Disponible con licencia de Image Analyst.

Los argumentos son una de las muchas formas de controlar cómo se entrenan y utilizan los modelos de aprendizaje profundo. En este tema, en la primera tabla figuran los argumentos de modelos admitidos en el entrenamiento de modelos de aprendizaje profundo. En la segunda tabla figuran los argumentos para controlar la forma de utilizar los modelos de aprendizaje profundo en la inferencia.

Argumentos de entrenamiento

La herramienta Entrenar un modelo de aprendizaje profundo incluye argumentos para entrenar modelos de aprendizaje profundo. Estos argumentos varían en función de la arquitectura del modelo. Puede cambiar los valores de estos argumentos para entrenar un modelo. Los argumentos son los siguientes:

  • attention_type: especifica el tipo de módulo. La opción predeterminada es PAM.

  • attn_res: número de atenciones en bloques residuales. Es un valor entero opcional. Este argumento solo se admite cuando el valor del parámetro Modelo base es SR3. El valor predeterminado es 16.

  • backend: especifica controla el marco de backend que se va a utilizar en este modelo.

  • bias: sesgo de la cabeza de Single Shot Detector (SSD). El valor predeterminado es -4,0.

  • box_batch_size_per_image: número de propuestas que se muestrearán durante el entrenamiento de la clasificación. El valor predeterminado es 512.

  • box_bg_iou_thresh: la intersección de combinación (IoU) máxima entre propuestas y el cuadro GT (realidad del terreno) para que puedan considerarse como negativas durante el entrenamiento de la cabeza de clasificación. El valor predeterminado es 0,5.

  • box_detections_per_img: número máximo de detecciones por imagen para todas las clases. El valor predeterminado es 100.

  • box_fg_iou_thresh: la IoU mínima entre propuestas y el cuadro GT para que puedan considerarse como positivas durante el entrenamiento de la cabeza de clasificación. El valor predeterminado es 0,5.

  • box_nms_thresh: el umbral de supresión no máxima (NMS) de la cabeza de predicción que se utiliza durante la inferencia. El valor predeterminado es 0,5.

  • box_positive_fraction: proporción de propuestas positivas en un lote minúsculo durante el entrenamiento de la cabeza de clasificación. El valor predeterminado es 0,25.

  • box_score_thresh: umbral de puntuación de clasificación que debe alcanzarse para que se devuelvan propuestas durante la inferencia. El valor predeterminado es 0,05.

  • channel_mults: multiplicadores de profundidad opcionales para resoluciones posteriores en U-Net. Este argumento solo se admite cuando el valor del parámetro Modelo base es SR3. El valor predeterminado es 1, 2, 4, 4, 8, 8.

  • channels_of_interest: lista de bandas espectrales (canales) de interés. Esto permite ignorar las bandas de rásteres de series de tiempo multitemporales basándose en esta lista. Por ejemplo, si hay bandas 0-4 en un dataset, pero en el entrenamiento solo se van a usar las bandas 0,1 y 2, la lista será [0,1,2].

  • class_balancing: especifica si la inversa de la pérdida de entropía cruzada se equilibrará con la frecuencia de píxeles por clase. El valor predeterminado es Falso.

  • d_k: dimensión de la clave y los vectores de consulta. El valor predeterminado es 32.

  • decode_params: diccionario que controla cómo se ejecutará el subtitulador de imágenes. Consta de los siguientes parámetros: embed_size, hidden_size, attention_size, teacher_forcing, dropout y pretrained_emb. El parámetro teacher_forcing es la probabilidad de teacher forcing. El forzamiento del profesor es una estrategia para entrenar redes neuronales recurrentes. Utiliza la salida del modelo de un paso de tiempo anterior como entrada, en lugar de la salida anterior, durante la retropropagación. El parámetro pretrained_emb especifica si se utilizará la incrustación de texto preentrenado. Si es Verdadero, utilizará la integración de texto rápido. Si es Falso, no utilizará la integración de texto previamente entrenada.

  • decoder_depth: el número de profundidades o capas dentro del componente decodificador.

  • depth: profundidad del modelo. El valor predeterminado es 17.

  • depths: el número de bloques en cada etapa. El valor predeterminado es [3, 3, 9, 3].

  • dice_loss_average: especifica si se utilizará el micromediado o el macromediado. El promedio macro calculará la métrica con independencia de la clase y tomará el promedio, con lo que todas las clases se tratan igual. El promedio micro agregará las contribuciones de todas las clases para calcular la métrica promedio. En una configuración de clasificación multiclase es preferible utilizar el promedio micro si puede haber un desequilibrio de clases que implique la existencia de muchas más muestras de una clase que de otra. El valor predeterminado es micro.

  • dice_loss_fraction: peso de la pérdida predeterminada (o pérdida focal) en comparación con la pérdida de fracción en la pérdida total para guiar el entrenamiento. El valor predeterminado es 0. Si focal_loss se configura en True, se utiliza la pérdida focal en lugar de la pérdida predeterminada. Si dice_loss_fraction se configura en 0, el entrenamiento utilizará la pérdida predeterminada (o pérdida focal) como pérdida total para guiar el entrenamiento. Si el valor dice_loss fraction es mayor que 0, el entrenamiento utilizará la siguiente fórmula como pérdida total para guiar el entrenamiento:

    \(=(1 \space – \space dice_loss_fraction) * default_loss \space + \space dice_loss_fraction * dice_loss\)

  • dims: la dimensión de la entidad en cada etapa. El valor predeterminado es [96, 192, 384, 768].

  • downsample_factor: factor que se utilizará para reducir la resolución de las imágenes. El valor predeterminado es 4.

  • drop: probabilidad de abandono. Para reducir el exceso de ajuste, aumente el valor. El valor predeterminado es 0,3.

  • dropout: probabilidad de abandono. Para reducir el exceso de ajuste, aumente el valor. Este argumento solo se admite cuando el valor del parámetro Modelo base es SR3. El valor predeterminado depende del valor del parámetro Tipo de modelo.

  • drop_path: la profundidad estocástica. Es un porcentaje que se expresa como un valor de punto flotante. El valor predeterminado es 0,1.

  • drop_path_rate: la tasa de profundidad estocástica. Es un porcentaje que se expresa como un valor de punto flotante. El valor predeterminado es 0,05.

  • drop_rate: una técnica para soltar neuronas aleatoriamente durante el entrenamiento, para evitar el sobreajuste. Es un porcentaje que se expresa como un valor de punto flotante. El valor predeterminado es 0,1.

  • embed_dim: dimensión de las integraciones. El valor predeterminado es 768.

  • feat_loss: especifica si se utilizará la pérdida de coincidencia de entidades del discriminador. El valor predeterminado es Verdadero.

  • focal_loss: especifica si se utilizará la pérdida focal. La pérdida focal puede manejar el problema del desequilibrio de clases con el modelo de detección de objetos de una sola etapa. El valor predeterminado es Falso.

  • forecast_timesteps: el número de intervalos en los que se hacen predicciones de entrenamiento. El valor predeterminado es 1.

  • gaussian_thresh: el umbral gaussiano, que establece el ancho de carretera requerido. El intervalo válido es de 0.0 a 1.0. El valor predeterminado es 0.6.

  • gen_blocks: número de bloques ResNet que se va a utilizar en el generador. El valor predeterminado es 9.

  • gen_network: especifica el modelo que se utilizará para el generador. Use global si la memoria de la GPU del equipo es escasa. El valor predeterminado es local.

  • gradcam: especifica si se debe usar la visualización Grad-CAM (representación cartográfica de activación de clases ponderada por gradientes). Si se configura en True, el mapa de calor Grad-CAM mostrará las regiones importantes que se utilizaron en la predicción.

  • grids: el número de cuadrículas en las que se dividirá la imagen para su procesamiento. Por ejemplo, establecer este argumento en 4 significa que la imagen se dividirá en 4 x 4 o 16 celdas de cuadrícula. Si no se especifica ningún valor, el valor de cuadrícula óptimo se calculará en función de las imágenes de entrada.

  • head_init_scale: valor de escalado inicial para los pesos y sesgos del clasificador. El valor predeterminado es 1.0.

  • hrs_each_step: el número de horas durante las cuales se recopilaron los datos en cada iteración. El valor predeterminado es 1.

  • ignore_classes: la lista de valores de clase en los que el modelo no incurrirá en pérdidas.

  • inner_channel: la dimensión de la primera capa U-net. Es un valor entero opcional. Este argumento solo se admite cuando el valor del parámetro Modelo base es SR3. El valor predeterminado es 64.

  • keep_dilation: especifica si se utilizará la dilatación. Cuando se configura en verdadero y se utiliza la arquitectura pointrend, podría mejorar la precisión a costa del consumo de memoria. El valor predeterminado es Falso.

  • lambda_feat: peso de la pérdida de coincidencia de entidades. El valor predeterminado es 10.

  • lambda_l1: peso de la pérdida de coincidencia de entidades. No se admite en imágenes de 3 bandas. El valor predeterminado es 100.

  • layer_scale_init_value: el valor inicial para la escala de capa. El valor predeterminado es 1e-6.

  • linear_end: entero opcional para programar el final. Este argumento solo se admite cuando el valor del parámetro Modelo base es SR3. El valor predeterminado es 1e-06.

  • linear_start: entero opcional para programar el inicio. Este argumento solo se admite cuando el valor del parámetro Modelo base es SR3. El valor predeterminado es 1e-02.

  • lsgan: especifica si se va a utilizar el error cuadrático medio en el entrenamiento. Si es falso, se utilizará la entropía cruzada binaria en su lugar. El valor predeterminado es Verdadero.

  • location_loss_factor: peso de la pérdida del cuadro de delimitación. Este factor ajusta el foco del modelo en la ubicación del cuadro de delimitación. Cuando se configura en Ninguno, arroja un peso igual en la ubicación y la pérdida de clasificación.

  • min_points: número de píxeles que se muestrearán de cada región enmascarada de entrenamiento. Este valor debe ser un múltiplo de 64.

  • mixup: especifica si se crearán nuevas imágenes de entrenamiento mezclando aleatoriamente las imágenes del conjunto de entrenamiento (Verdadero). El valor predeterminado es Falso.

  • mlp_ratio: ratio de perceptrón multicapa (MLP). El valor predeterminado es 4.

  • mlp1: las dimensiones de los espacios de entidades sucesivas de MLP1. El valor predeterminado es 32,64.

  • mlp2: las dimensiones de los espacios de entidades sucesivas de MLP2. El valor predeterminado es 128,128.

  • mlp4: las dimensiones del decodificador MLP. El valor predeterminado es 64,32.

  • model: modelo de base que se utilizará para entrenar el modelo. Las redes centrales disponibles dependen del valor del parámetro Tipo de modelo. Este argumento solo se admite para los tipos de modelo MMDetection y MMSegmentation. El valor predeterminado para MMDetection es cascade_rcnn. El valor predeterminado para MMSegmentation es mask2former.

  • model_weight: especifica si se utilizarán los pesos del modelo preentrenado. El valor también puede ser una ruta a un archivo de configuración que contenga los pesos de un modelo del repositorio de MMDetection o del repositorio de MMSegmentation. El valor predeterminado es Falso.

  • mtl_model: especifica el tipo de arquitectura que se utilizará para crear el modelo. Las opciones son linknet o reloj de arena para arquitecturas neuronales basadas en linknet o reloj de arena, respectivamente. El valor predeterminado es reloj de arena.

  • n_blocks_global: número de bloques residuales de la red del generador global. El valor predeterminado es 9.

  • n_blocks_local: número de bloques residuales de la red del intensificador local. El valor predeterminado es 3.

  • n_downsample_global: número de capas de submuestreo de la red del generador global.

  • n_dscr: número de discriminadores que se van a utilizar. El valor predeterminado es 2.

  • n_dscr_filters: número de filtros de discriminador en la primera capa de convolución. El valor predeterminado es 64.

  • n_gen_filters: número de filtros gen en la primera capa de convolución. El valor predeterminado es 64.

  • n_head: número de cabezas de observación. El valor predeterminado es 4.

  • n_layers_dscr: número de capas de la red del discriminador que se utilizarán en Pix2PixHD. El valor predeterminado es 3.

  • n_local_enhancers: número de intensificadores locales que se utilizarán. El valor predeterminado es 1.

  • n_masks: número máximo de etiquetas de clase e instancias que puede contener una imagen. El valor predeterminado es 30.

  • n_timestep: número de periodos de tiempo de difusión. Este valor es opcional. Este argumento solo se admite cuando el valor del parámetro Modelo base es SR3. El valor predeterminado es 1000.

  • norm: especifica si se va a utilizar la normalización de instancias o lotes. El valor predeterminado es instancia.

  • norm_groups: el número de grupos para la normalización de grupo. Es un valor entero opcional. Este argumento solo se admite cuando el valor del parámetro Modelo base es SR3. El valor predeterminado es 32.

  • num_heads: número de cabezas de observación. El valor predeterminado es 12.

  • orient_bin_size: el tamaño de bin para los ángulos de orientación. El valor predeterminado es 20.

  • orient_theta: anchura de la máscara de orientación. El valor predeterminado es 8.

  • oversample: especifica si se va a utilizar el sobremuestreo. Si se configura en verdadero, las clases desequilibradas del dataset se sobremuestrearán durante el entrenamiento. Esto es incompatible con los datasets multietiqueta. El valor predeterminado es Falso.

  • parallel_patch_embed: especifica si se dividen las imágenes de entrada en parches de imagen más pequeños para procesarlas en paralelo.

  • patch_size: tamaño de parche que se utilizará para generar integraciones de parche. El valor predeterminado es 16.

  • perceptual_loss: especifica si se va a utilizar la pérdida perceptual en el entrenamiento. El valor predeterminado es Falso.

  • pointrend: especifica si se va a utilizar la arquitectura PointRend sobre la cabeza de segmentación. Para obtener más información sobre la arquitectura PointRend, consulte el PDF de PointRend. El valor predeterminado es Falso.

  • pooling: estrategia de agrupación de integraciones de píxel que se va a utilizar. El valor predeterminado es media.

  • pyramid_sizes: número y tamaño de las capas de convolución que se aplicarán a las distintas subregiones. Este argumento es específico del modelo Pyramid Scene Parsing Network. El valor predeterminado es [1, 2, 3, 6].

  • qkv_bias: especifica si se va a utilizar el sesgo del vector QK en el entrenamiento. El valor predeterminado es Falso.

  • ratios: lista de relaciones de aspecto que se van a utilizar para los cuadros de anclaje. En la detección de objetos, una caja de anclaje representa la ubicación, la forma y el tamaño ideales del objeto que se está prediciendo. Por ejemplo, establecer este argumento en [1,0, 1,0], [1,0, 0,5] significa que la caja de anclaje es un cuadrado (1:1) o un rectángulo en el que el lado horizontal tiene la mitad del tamaño del lado vertical (1:0,5). El valor predeterminado de RetinaNet es [0,5, 1, 2]. El valor predeterminado de Single Shot Detector es [1,0, 1,0].

  • res_blocks: número de bloques residuales. Es un valor entero opcional. Este argumento solo se admite cuando el valor del parámetro Modelo base es SR3. El valor predeterminado es 3.

  • rpn_batch_size_per_image: número de delimitadores que se van a muestrear durante el entrenamiento de la RPN para calcular la pérdida. El valor predeterminado es 256.

  • rpn_bg_iou_thresh: la IoU máxima entre delimitadores y el cuadro GT para que puedan considerarse como negativas durante el entrenamiento de la cabeza de la RPN. El valor predeterminado es 0,3.

  • rpn_fg_iou_thresh: la IoU mínima entre delimitadores y el cuadro GT para que puedan considerarse como positivas durante el entrenamiento de la cabeza de la RPN. El valor predeterminado es 0,7.

  • rpn_nms_thresh: umbral de NMS que se utilizará para posprocesar las propuestas de la RPN. El valor predeterminado es 0,7.

  • rpn_positive_fraction: proporción de delimitadores positivos en un lote minúsculo durante el entrenamiento de la RPN. El valor predeterminado es 0,5.

  • rpn_post_nms_top_n_test: número de propuestas que se mantendrán después de aplicar la NMS durante las pruebas. El valor predeterminado es 1000.

  • rpn_post_nms_top_n_train: número de propuestas que se mantendrán después de aplicar la NMS durante el entrenamiento. El valor predeterminado es 2000.

  • rpn_pre_nms_top_n_test: número de propuestas que se mantendrán antes de aplicar la NMS durante las pruebas. El valor predeterminado es 1000.

  • rpn_pre_nms_top_n_train: número de propuestas que se mantendrán antes de aplicar la NMS durante el entrenamiento. El valor predeterminado es 2000.

  • scales: la cantidad de niveles de escala que subirá o bajará cada celda. El valor predeterminado es [1, 0,8, 0,63].

  • schedule: tipo de programación que se utilizará. Este valor es opcional. Las opciones son lineal, warmup10, warmup50, const, jsd y coseno. Este argumento solo se admite cuando el valor del parámetro Modelo base es SR3. El valor predeterminado es lineal.

  • seq_len: el número de bandas de marca de hora. Solo aplicable cuando el modelo es prithvi100m. El valor predeterminado es 1.

  • T: periodo que se utilizará durante la codificación posicional. El valor predeterminado es 1000.

  • timesteps_of_interest: lista de los intervalos de tiempo de interés; esto filtrará series de tiempo multitemporales basadas en la lista de intervalos de tiempo especificados. Por ejemplo, si el dataset tiene intervalos de tiempo 0, 1, 2 y 3, pero solo se utilizan los intervalos de tiempo 0, 1 y 2 en el entrenamiento, este parámetro debería configurarse en [0,1,2]; el resto de los intervalos de tiempo se filtrarán.

  • unet_aux_loss: especifica si se debe usar pérdida auxiliar durante el entrenamiento.

  • use_unet: especifica si se usará el decodificador U-Net para recuperar datos una vez que se complete la agrupación piramidal. Este argumento es específico del modelo Pyramid Scene Parsing Network. El valor predeterminado es Verdadero.

  • vgg_loss: especifica si se utilizará la pérdida de coincidencia de entidades VGG. Solo se admite en imágenes de 3 bandas. El valor predeterminado es Verdadero.

  • wavelengths: las longitudes de onda centrales de cada banda dentro del ráster de entrada; las longitudes de onda están en micrómetros. Es una matriz de valores de punto flotante que corresponden a cada banda, por ejemplo, [0.665,0.560,0.490]. Los backbones DOFA, CLAY y TERRAMIND requieren el parámetro de longitudes de onda para generar dinámicamente los pesos de incrustación de parches. Aunque el modelo intenta deducir estos datos a partir de los metadatos y los nombres de las bandas, es necesario introducirlos manualmente si faltan o no siguen el formato estándar. La siguiente lista recoge el nombre de la banda y su longitud de onda central: CoastalAerosol=0,443, CoastalBlue=0,443, Blue=0,490, Green=0,560, Red=0,665, Yellow=0,585, VegetationRedEdge_1=0,705, VegetationRedEdge_2=0,740, VegetationRedEdge_3=0,783, RedEdge=0.705, Infrared=0,865, NearInfrared=0,865, NIR=0,865, NearInfrared_1=0,842, NIR_1=0,842, NearInfrared_2=0,865, NIR_2=0,865, NarrowNearInfrared=0,87, NarrowNIR=0,87, ShortWaveInfrared=1,375, Cirrus=1,375, SWIR=1,375, ShortWaveInfrared_1=1,610, SWIR_1=1,610, ShortWaveInfrared_2=2,190, SWIR_2=2,190, MidInfrared=1,610, MIR=1,610, MidInfrared_1=1,610, MIR_1=1,610, MidInfrared_2=2,190, MIR_2=2,190, ThermalInfrared=11,450, Thermal=11,450, TIR=11,450, ThermalInfrared_1=10,895, Thermal_1=10,895, TIR_1=10,895, ThermalInfrared_2=12,005, Thermal_2=12,005, TIR_2=12,005, Panchromatic=0,592, WaterVapor=0,945, QA=0,0.

  • zooms: la cantidad de niveles de zoom que subirá o bajará cada celda de cuadrícula. Establecer este argumento en 1 significa que todas las celdas de cuadrícula permanecerán en el mismo tamaño o nivel de zoom. Un nivel de zoom de 2 significa que todas las celdas de cuadrícula serán el doble de grandes (ampliadas al 100%). Proporcionar una lista de niveles de zoom significa que todas las celdas de cuadrícula escalarán utilizando todos los números de la lista. El valor predeterminado es 1.

Tipo de modelo

Argumento

Valores válidos

3D-RCNet

(clasificación de píxeles)

depths

Una lista de enteros positivos. El valor predeterminado es [1, 2, 4, 2].

dims

Una lista de enteros positivos. El valor predeterminado es [32, 64, 128, 256].

drop_path_rate

Valores de punto flotante. El valor predeterminado es 0,05.

head_init_scale

Valores de punto flotante. El valor predeterminado es 1,0.

layer_scale_init_value

Valores de punto flotante. El valor predeterminado es 1e-6.

Detector de cambios

(clasificación de píxeles)

attention_type

PAM (módulo de atención piramidal) o BAM (módulo de atención básica). La opción predeterminada es PAM.

ClimaX

(clasificación de píxeles)

decoder_depth

Valor entero positivo. El valor predeterminado es 2.

depth

Valor entero positivo. El valor predeterminado es 8.

drop_path

Valor de punto flotante. El valor predeterminado es 0,1.

drop_rate

Valor de punto flotante. El valor predeterminado es 0,1.

embed_dim

Valor entero positivo. El valor predeterminado es 1024.

forecast_timesteps

Valor entero positivo. El valor predeterminado es 1.

hrs_each_step

Valor entero positivo. El valor predeterminado es 1.

mlp_ratio

Valor de punto flotante. El valor predeterminado es 4,0.

num_heads

Valor entero positivo. El valor predeterminado es 16.

parallel_patch_embed

True o False. La opción predeterminada es True.

patch_size

Valor entero positivo. El valor predeterminado es 4.

ConnectNet

(clasificación de píxeles)

gaussian_thresh

0,0 a 1,0. El valor predeterminado es 0.6.

mtl_model

linknet o hourglass. La opción predeterminada es hourglass.

orient_bin_size

Número positivo. El valor predeterminado es 20.

orient_theta

Número positivo. El valor predeterminado es 8.

CycleGAN

(traducción de imágenes)

gen_blocks

Un número entero positivo. El valor predeterminado es 9.

lsgan

True o False. La opción predeterminada es True.

DeepLab

(clasificación de píxeles)

class_balancing

True o False. La opción predeterminada es False.

dice_loss_average

micro o macro. La opción predeterminada es micro.

dice_loss_fraction

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0.

focal_loss

True o False. La opción predeterminada es False.

ignore_classes

Valores de clase válidos.

keep_dilation

True o False. La opción predeterminada es False.

mixup

True o False. La opción predeterminada es False.

pointrend

True o False. La opción predeterminada es False.

wavelengths

Una matriz de valores de punto flotante, separados por una coma, por ejemplo, [0.665,0.560,0.490].

FasterRCNN

(Detección de objetos)

box_batch_size_per_image

Enteros positivos. El valor predeterminado es 512.

box_bg_iou_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,5.

box_detections_per_img

Enteros positivos. El valor predeterminado es 100.

box_fg_iou_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,5.

box_nms_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,5.

box_positive_fraction

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,25.

box_score_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,05.

rpn_batch_size_per_image

Enteros positivos. El valor predeterminado es 256.

rpn_bg_iou_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,3.

rpn_fg_iou_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,7.

rpn_nms_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,7.

rpn_positive_fraction

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,5.

rpn_post_nms_top_n_test

Enteros positivos. El valor predeterminado es 1000.

rpn_post_nms_top_n_train

Enteros positivos. El valor predeterminado es 2000.

rpn_pre_nms_top_n_test

Enteros positivos. El valor predeterminado es 1000.

rpn_pre_nms_top_n_train

Enteros positivos. El valor predeterminado es 2000.

wavelengths

Una matriz de valores de punto flotante, separados por una coma, por ejemplo, [0.665,0.560,0.490].

Clasificador de entidades

(Clasificación de objetos)

gradcam

True o False. La opción predeterminada es False.

mixup

True o False. La opción predeterminada es False.

oversample

True o False. La opción predeterminada es False.

wavelengths

Una matriz de valores de punto flotante, separados por una coma, por ejemplo, [0.665,0.560,0.490].

Detector de bordes HED

(clasificación de píxeles)

wavelengths

Una matriz de valores de punto flotante, separados por una coma, por ejemplo, [0.665,0.560,0.490].

Subtitulador de imágenes

(traducción de imágenes)

El argumento decode_params se compone de los siguientes parámetros:

  • embed_size

  • hidden_size

  • attention_size

  • teacher_forcing

  • dropout

  • pretrained_emb

La opción predeterminada es {'embed_size':100, 'hidden_size':100, 'attention_size':100, 'teacher_forcing':1, 'dropout':0.1, 'pretrained_emb':False}.

MaskRCNN

(Detección de objetos)

box_batch_size_per_image

Enteros positivos. El valor predeterminado es 512.

box_bg_iou_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,5.

box_detections_per_img

Enteros positivos. El valor predeterminado es 100.

box_fg_iou_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,5.

box_nms_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,5.

box_positive_fraction

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,25.

box_score_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,05.

pointrend

True o False. La opción predeterminada es False. Si es True, utilizará la arquitectura PointRend sobre la capa de segmentación.

rpn_batch_size_per_image

Enteros positivos. El valor predeterminado es 256.

rpn_bg_iou_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,3.

rpn_fg_iou_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,7.

rpn_nms_thresh

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,7.

rpn_positive_fraction

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,5.

rpn_post_nms_top_n_test

Enteros positivos. El valor predeterminado es 1000.

rpn_post_nms_top_n_train

Enteros positivos. El valor predeterminado es 2000.

rpn_pre_nms_top_n_test

Enteros positivos. El valor predeterminado es 1000.

rpn_pre_nms_top_n_train

Enteros positivos. El valor predeterminado es 2000.

wavelengths

Una matriz de valores de punto flotante, separados por una coma, por ejemplo, [0.665,0.560,0.490].

MaXDeepLab

(Segmentación panóptica)

n_masks

Enteros positivos. El valor predeterminado es 30.

MMDetection

(detección de objetos)

model

atss, carafe, cascade_rcnn, cascade_rpn, dcn, deeplabv3, detectors, dino, double_heads, dynamic_rcnn, empirical_attention, fcos, foveabox, fsaf, ghm, hrnet, libra_rcnn, nas_fcos, pafpn, pisa, regnet, reppoints, res2net, sabl y vfnet.

La opción predeterminada es cascade_rcnn.

model_weight

False o una ruta de archivo. El valor predeterminado es False

MMSegmentation

(clasificación de píxeles)

class_balancing

True o False. La opción predeterminada es False.

ignore_classes

Valores de clase válidos.

model

ann, apcnet, ccnet, cgnet, deeplabv3, deeplabv3plus, dmnet , dnlnet, emanet, fastscnn, fcn, gcnet, hrnet, mask2former, mobilenet_v2, nonlocal_net, ocrnet, prithvi100m, psanet, pspnet, resnest, sem_fpn, unet y upernet.

La opción predeterminada es mask2former.

model_weight

False o una ruta de archivo. El valor predeterminado es False

seq_len

Un número entero positivo. El valor predeterminado es 1.

Extractor de carreteras de varias tareas

(clasificación de píxeles)

gaussian_thresh

0,0 a 1,0. El valor predeterminado es 0.6.

mtl_model

linknet o hourglass. La opción predeterminada es hourglass.

orient_bin_size

Número positivo. El valor predeterminado es 20.

orient_theta

Número positivo. El valor predeterminado es 8.

Pix2Pix

(traducción de imágenes)

perceptual_loss

True o False. La opción predeterminada es False.

Pix2PixHD

(traducción de imágenes)

feat_loss

True o False. La opción predeterminada es True.

gen_network

local o global. La opción predeterminada es local.

lambda_feat

Valores enteros positivos. El valor predeterminado es 10.

lambda_l1

Valores enteros positivos. El valor predeterminado es 100.

lsgan

True o False. La opción predeterminada es True.

n_blocks_global

Valores enteros positivos. El valor predeterminado es 9.

n_blocks_local

Valores enteros positivos. El valor predeterminado es 3.

n_downsample_global

Valores enteros positivos. El valor predeterminado es 4.

n_dscr

Valores enteros positivos. El valor predeterminado es 2.

n_dscr_filters

Valores enteros positivos. El valor predeterminado es 64.

n_gen_filters

Valores enteros positivos. El valor predeterminado es 64.

n_layers_dscr

Valores enteros positivos. El valor predeterminado es 3.

n_local_enhancers

Valores enteros positivos. El valor predeterminado es 1.

norm

instance o batch. La opción predeterminada es instance.

vgg_loss

True o False. La opción predeterminada es True.

PSETAE

(clasificación de píxeles)

channels_of_interest

Lista de números de banda (enteros que son mayores o iguales a 0).

d_k

Valores enteros positivos. El valor predeterminado es 32.

dropout

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0,2.

min_points

Múltiplos enteros de 64.

mlp1

Lista de enteros positivos. El valor predeterminado es 32,64.

mlp2

Lista de enteros positivos. El valor predeterminado es 128,128.

mlp4

Lista de enteros positivos. El valor predeterminado es 64,32.

n_head

Valores enteros positivos. El valor predeterminado es 4.

pooling

mean, std, max o min. La opción predeterminada es mean.

T

Valores enteros positivos. El valor predeterminado es 1000.

timesteps_of_interest

Lista de enteros que son mayores o iguales a 0.

Red de análisis de escenas de pirámide

(clasificación de píxeles)

class_balancing

True o False. La opción predeterminada es False.

dice_loss_average

micro o macro. La opción predeterminada es micro.

dice_loss_fraction

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0.

focal_loss

True o False. La opción predeterminada es False.

ignore_classes

Valores de clase válidos.

keep_dilation

True o False. La opción predeterminada es False.

mixup

True o False. La opción predeterminada es False.

pointrend

True o False. La opción predeterminada es False.

pyramid_sizes

[capa de convolución 1, capa de convolución 2, ..., capa de convolución n]

unet_aux_loss

True o False. La opción predeterminada es False.

use_unet

True o False. La opción predeterminada es True.

RetinaNet

(detección de objetos)

ratios

Una lista de números de punto flotante.

El valor predeterminado es 0,5,1,2.

scales

[valor de escala 1, valor de escala 2, valor de escala 3]

El valor predeterminado es [1, 0,8, 0,63].

wavelengths

Una matriz de valores de punto flotante, separados por una coma, por ejemplo, [0.665,0.560,0.490].

SAMLoRA

(clasificación de píxeles)

class_balancing

True o False. La opción predeterminada es False.

ignore_classes

Valores de clase válidos.

Single Shot Detector

(detección de objetos)

bias

Valor de punto flotante. El valor predeterminado es -4,0.

drop

Valor de punto flotante entre 0 y 1.

focal_loss

True o False. La opción predeterminada es False.

grids

Una lista de enteros positivos.

location_loss_factor

Valor de punto flotante entre 0 y 1.

ratios

La lista de relaciones de aspecto, donde cada relación de aspecto es un par de dos números de punto flotante, [valor horizontal, valor vertical]. El valor predeterminado es [1,0, 1,0].

wavelengths

Una matriz de valores de punto flotante, separados por una coma, por ejemplo, 0.665,0.560,0.490.

zooms

Una lista de números positivos de punto flotante.

Superresolución con base SR3

(traducción de imágenes)

attn_res

Enteros mayores que 0. El valor predeterminado es 16.

channel_mults

Conjuntos de multiplicadores enteros. El valor predeterminado es [1, 2, 4, 4, 8, 8].

downsample_factor

Valor entero positivo. El valor predeterminado es 4.

dropout

Valor de punto flotante. El valor predeterminado es 0.

inner_channel

Valor entero mayor que 0. El valor predeterminado es 64.

linear_start

Tiempo expresado como valor de punto flotante.

linear_end

Tiempo expresado como valor de punto flotante.

n_timestep

Valor entero mayor que 0. El valor predeterminado es 1000.

norm_groups

Valor entero mayor que 0. El valor predeterminado es 32.

res_blocks

Valor entero mayor que 0. El valor predeterminado es 3.

schedule

linear, warmup10, warmup50, const, jsd o cosine.

La opción predeterminada es linear.

Superresolución con base SR3_UViT

(traducción de imágenes)

depth

Valor de punto entero positivo. El valor predeterminado es 17.

downsample_factor

Valor entero positivo. El valor predeterminado es 4.

embed_dim

Valor de punto entero positivo. El valor predeterminado es 768.

mlp_ratio

Valor de punto flotante positivo. El valor predeterminado es 4,0.

num_heads

Valor de punto entero positivo. El valor predeterminado es 12.

patch_size

Valor de punto entero positivo. El valor predeterminado es 16.

qkv_bias

True o False. La opción predeterminada es False.

Superresolución con un backbone distinto de SR3 y SR3_UViT.

(traducción de imágenes)

downsample_factor

Valor entero positivo. El valor predeterminado es 4.

U-Net

(clasificación de píxeles)

class_balancing

True o False. La opción predeterminada es False.

dice_loss_average

micro o macro. La opción predeterminada es micro.

dice_loss_fraction

Valor de punto flotante entre 0 y 1. El valor predeterminado es 0.

focal_loss

True o False. La opción predeterminada es False.

ignore_classes

Valores de clase válidos.

mixup

True o False. La opción predeterminada es False.

Argumentos de inferencia

Los siguientes argumentos están disponibles para controlar cómo entrenar modelos de aprendizaje profundo para inferencia. La información del parámetro Definición de modelo se utilizará para rellenar el parámetro Argumentos de las herramientas de inferencia. Estos argumentos varían en función de la arquitectura del modelo. Los modelos preentrenados de ArcGIS y los modelos de aprendizaje profundo personalizados pueden tener argumentos adicionales compatibles con la herramienta.

Argumento

Tipo de inferencia

Valores válidos

batch_size

Número de teselas de imágenes que se procesarán en cada paso de la inferencia del modelo. Esto depende de la memoria de la tarjeta gráfica. El argumento está disponible para todas las arquitecturas del modelo.

Clasificar objetos

Clasificar píxeles

Detectar cambios

Detectar objetos

Valores enteros mayores que 0; suele ser un entero que es una potencia de 2.

direction

La dirección de la imagen se convierte de un dominio a otro. Para obtener información sobre este argumento, consulte Funcionamiento de CycleGAN.

El argumento solo está disponible para la arquitectura CycleGAN.

Clasificar píxeles

Las opciones disponibles son AtoB y BtoA.

exclude_pad_detections

Especifica si se filtrarán detecciones potencialmente truncadas cerca de los bordes que están en la región rellena de chips de imagen.

El argumento está disponible para SSD, RetinaNet, YOLOv3, DETReg, MMDetection y Faster RCNN solamente.

Detectar objetos

True o False.

merge_policy

Política que se utilizará para fusionar predicciones aumentadas. Solo es aplicable cuando se utiliza el aumento del tiempo de prueba.

En el caso de la herramienta Clasificar píxeles con aprendizaje profundo, el argumento está disponible para las arquitecturas MultiTaskRoadExtractor y ConnectNet. Si IsEdgeDetection está presente en el archivo .emd del modelo, BDCNEdgeDetector, HEDEdgeDetector y MMSegmentation también son arquitecturas disponibles.

En el caso de la herramienta Detectar objetos con aprendizaje profundo, el argumento solo está disponible para MaskRCNN.

Clasificar píxeles

Detectar objetos

Las opciones disponibles son mean, max y min.

nms_overlap

El ratio de superposición máximo para dos entidades de superposición, definido como la relación del área de intersección sobre el área de combinación. El argumento está disponible para todas las arquitecturas del modelo.

Detectar objetos

Valor de punto flotante de 0,0 a 1,0. El valor predeterminado es 0,1.

output_classified_raster

Ruta al ráster de salida. El argumento solo está disponible para MaXDeepLab.

Detectar objetos

Nombre y ruta del archivo del raster clasificado de salida.

padding

Número de píxeles en el borde de las teselas de imágenes desde los cuales se combinarán las predicciones de las teselas adyacentes. Para suavizar la salida a la vez que se reducen los artefactos, aumente el valor. El valor máximo del relleno debe ser inferior a la mitad del tamaño de la ficha. Por ejemplo, si su tamaño de tesela es 256, entonces el relleno debe ser inferior a 127. El argumento está disponible para todas las arquitecturas del modelo.

Clasificar píxeles

Detectar cambios

Detectar objetos

Valores enteros mayores que 0 y menores que la mitad del valor de tamaño de tesela.

predict_background

Especifica si se clasificará la clase de fondo. El argumento está disponible para UNET, PSPNET, DeepLab y MMSegmentation.

Clasificar píxeles

True o False.

return_probability_raster

Especifica si se mostrará un ráster de probabilidad. El ráster de probabilidad es un ráster cuyos píxeles especifican la probabilidad de que la variable de interés esté por encima o por debajo de un valor de umbral especificado.

Si ArcGISLearnVersion pertenece a la versión 1.8.4 u otra posterior en el archivo .emd del modelo, las arquitecturas MultiTaskRoadExtractor y ConnectNet están disponibles. Si ArcGISLearnVersion pertenece a la versión 1.8.4 u otra posterior e IsEdgeDetection está presente en el archivo .emd del modelo, las arquitecturas BDCNEdgeDetector, HEDEdgeDetector y MMSegmentation también están disponibles.

Clasificar píxeles

True o False.

score_threshold

Las predicciones por encima de esta puntuación de confianza se incluyen en el resultado. El argumento está disponible para todas las arquitecturas del modelo.

Este argumento suele utilizarse en modelos entrenados antes de ArcGIS Pro 3.5

Clasificar objetos

0 a 1,0

test_time_augmentation

Especifica si el aumento del tiempo de prueba se realizará al predecir. Si es True, las predicciones de variantes rotadas y volteadas de la imagen de entrada se fusionarán en la salida final. El argumento está disponible para la mayoría de las arquitecturas del modelo.

Clasificar objetos

Clasificar píxeles

True o False.

threshold

Las predicciones con una puntuación de confianza superior a este umbral se incluyen en el resultado.

En el caso de la herramienta Clasificar objetos con aprendizaje profundo, el argumento está disponible para todas las arquitecturas de modelos. Este argumento suele utilizarse en modelos entrenados en ArcGIS Pro 3.5 y versiones posteriores.

En el caso de la herramienta Clasificar píxeles con aprendizaje profundo, si ArcGISLearnVersion pertenece a la versión 1.8.4 u otra posterior en el archivo .emd del modelo, las arquitecturas MultiTaskRoadExtractor y ConnectNet están disponibles. Si ArcGISLearnVersion pertenece a la versión 1.8.4 u otra posterior e IsEdgeDetection está presente en el archivo .emd del modelo, las arquitecturas BDCNEdgeDetector, HEDEdgeDetector y MMSegmentation también están disponibles.

En el caso de la herramienta Detectar objetos con aprendizaje profundo, el argumento está disponible para todas las arquitecturas de modelos.

Clasificar objetos

Clasificar píxeles

Detectar objetos

0 a 1,0.

thinning

Especifica si el grosor de los bordes previstos se reducirá o si estos se reducirán a su esqueleto.

Si IsEdgeDetection está presente en el archivo .emd del modelo, BDCNEdgeDetector, HEDEdgeDetector y MMSegmentation son arquitecturas disponibles.

Clasificar píxeles

True o False.

tile_size

Ancho y altura de las teselas de imágenes en las que se dividirán las imágenes para la predicción.

En el caso de la herramienta Clasificar píxeles mediante aprendizaje profundo, el argumento solo está disponible para la arquitectura CycleGAN.

En el caso de la herramienta Detectar objetos con aprendizaje profundo, el argumento solo está disponible para MaskRCNN.

Clasificar píxeles

Detectar objetos

Valores enteros mayores que 0 y menores que el tamaño de la imagen.