Skip to main content

Deep-Learning-Argumente

Mit Image Analyst-Lizenz verfügbar.

Argumente sind eine der zahlreichen Möglichkeiten, mit denen gesteuert werden kann, wie Deep-Learning-Modelle trainiert und verwendet werden. In diesem Thema sind in der ersten Tabelle die unterstützten Modellargumente für das Trainieren von Deep-Learning-Modellen aufgeführt. Die zweite Tabelle enthält die Argumente, mit denen gesteuert werden kann, wie Deep-Learning-Modelle für die Inferenzierung verwendet werden.

Trainingsargumente

Das Werkzeug Deep-Learning-Modell trainieren enthält Argumente zum Trainieren von Deep-Learning-Modellen. Diese Argumente sind je nach Modellarchitektur unterschiedlich. Zum Trainieren eines Modells können Sie die Werte dieser Argumente ändern. Folgende Argumente stehen zur Verfügung:

  • attention_type: Gibt den Modultyp an. Die Standardeinstellung ist PAM.

  • attn_res: Aufmerksamkeitszahl in Residualblöcken. Dies ist ein optionaler ganzzahliger Wert. Dieses Argument wird nur unterstützt, wenn der Parameter Backbone-Modell den Wert SR3 hat. Der Standardwert ist 16.

  • backend: Gibt das Backend-Framework an, das für dieses Modell verwendet werden soll.

  • bias: Die Verzerrung für SSD-Head (Single Shot Detector). Der Standardwert ist -4,0.

  • box_batch_size_per_image: Die Anzahl der Vorschläge, die während des Trainings der Klassifizierung als Stichprobe genommen werden. Der Standardwert ist 512.

  • box_bg_iou_thresh: Die maximale Intersection of Union (IoU) zwischen den Vorschlägen und dem Überprüfungsfeld (Ground Truth, GT), damit diese während des Trainings des Klassifizierungskopfes als negativ angesehen werden können. Die Standardeinstellung ist 0,5.

  • box_detections_per_img: Die maximale Anzahl an Erkennungen pro Bild; für alle Klassen. Die Standardeinstellung ist 100.

  • box_fg_iou_thresh: Die minimale IoU zwischen den Vorschlägen und dem Überprüfungsfeld (GT), damit diese während des Trainings des Klassifizierungskopfes als positiv angesehen werden können. Die Standardeinstellung ist 0,5.

  • box_nms_thresh: Der NMS-Schwellenwert (Non Maximum Suppression) für den Vorhersagekopf. Wird während der Inferenzierung verwendet. Die Standardeinstellung ist 0,5.

  • box_positive_fraction: Der Anteil der positiven Vorschläge in einem minimalen Batch während des Trainings des Klassifizierungskopfes. Der Standardwert ist 0,25.

  • box_score_thresh: Der Schwellenwert für den Klassifizierungswert, der erreicht werden muss, damit während der Inferenzierung Vorschläge zurückgegeben werden. Der Standardwert ist 0,05.

  • channel_mults: Der Optionale Tiefenmultiplikatoren für nachfolgende Auflösungen in U-Net. Dieses Argument wird nur unterstützt, wenn der Parameter Backbone-Modell den Wert SR3 hat. Der Standard ist 1, 2, 4, 4, 8, 8.

  • channels_of_interest: Eine Liste der relevanten Spektralbänder (Kanäle). Hierdurch werden Bänder aus Rastern multitemporaler Zeitserien auf Grundlage dieser Liste herausgefiltert. Wenn ein Dataset etwa die Bänder 0–4 enthält, für das Training aber nur die Bänder 0, 1 und 2 verwendet werden sollen, lautet die Liste [0,1,2].

  • class_balancing: Gibt an, ob der Kreuzentropie-Verlust umgekehrt proportional zur Pixelhäufigkeit pro Klasse ausgeglichen wird. Die Standardeinstellung ist "False".

  • d_k: Die Dimension der Schlüssel- und Abfragevektoren. Der Standardwert ist 32.

  • decode_params: Ein Wörterbuch, das steuert, wie das Image Captioning ausgeführt wird. Es besteht aus den folgenden Parametern: embed_size, hidden_size, attention_size, teacher_forcing, dropout und pretrained_emb. Der Parameter teacher_forcing legt die Wahrscheinlichkeit für Teacher Forcing fest. Das Erzwingen durch Teacher ist eine Strategie zum Trainieren wiederkehrender neuronaler Netzwerke. Dabei wird die Modellausgabe während der Rück-Weitergabe aus einem früheren Zeitintervall anstelle der vorherigen Ausgabe als Eingabe verwendet. Der Parameter pretrained_emb gibt an, ob vortrainiertes Text-Embedding verwendet werden soll. Bei True wird schnelles Text-Embedding verwendet. Bei False wird das vortrainierte Text-Embedding nicht verwendet.

  • decoder_depth: Die Anzahl der Tiefen oder Layer innerhalb der Decoder-Komponente.

  • depth: Die Tiefe des Modells. Der Standardwert ist 17.

  • depths: Die Anzahl der Blöcke in den einzelnen Phasen. Der Standardwert ist [3, 3, 9, 3].

  • dice_loss_average: Gibt an, ob Mikro- oder Makro-Mittelwertberechnung verwendet wird. Bei einem Makrodurchschnitt wird der Kennwert unabhängig für jede Klasse berechnet, und dann wird der Durchschnitt gebildet. Dabei werden alle Klassen gleich behandelt. Bei einem Mikrodurchschnitt werden die Beiträge aller Klassen aggregiert, um den durchschnittlichen Kennwert zu berechnen. In einem Klassifizierungssystem mit mehreren Klassen ist der Mikrodurchschnitt vorzuziehen, wenn es möglicherweise ein Klassenungleichgewicht gibt, bei dem eine Klasse viel mehr Stichproben bereitstellt als andere Klassen. Als Standardeinstellung wird der Mikrodurchschnitt verwendet.

  • dice_loss_fraction: Die Gewichtung des Standardverlustes (oder Fokusverlustes) im Vergleich zum Würfelverlust im Gesamtverlust zum Steuern des Trainings. Die Standardeinstellung ist 0. Wird focal_loss auf True gesetzt, wird anstelle des Standardverlustes der Fokusverlust verwendet. Wird dice_loss_fraction auf 0 gesetzt, wird der Standardverlust (oder Fokusverlust) als Gesamtverlust verwendet, um das Training zu steuern. Wenn der Wert dice_loss fraction größer als 0 ist, wird beim Training die folgende Formel verwendet, die den Gesamtverlust zum Steuern des Trainings angibt:

    \(=(1 \space – \space dice_loss_fraction) * default_loss \space + \space dice_loss_fraction * dice_loss\)

  • dims: Die Feature-Bemaßung der einzelnen Phasen. Der Standardwert ist [96, 192, 384, 768].

  • downsample_factor: Der Faktor zum Reduzieren der Bilder. Die Standardeinstellung ist 4.

  • drop: Die Abbruchwahrscheinlichkeit. Erhöhen Sie den Wert, um die Überanpassung zu reduzieren. Der Standardwert beträgt 0,3.

  • dropout: Die Abbruchwahrscheinlichkeit. Erhöhen Sie den Wert, um die Überanpassung zu reduzieren. Dieses Argument wird nur unterstützt, wenn der Parameter Backbone-Modell den Wert SR3 hat. Der Standard hängt vom Wert des Parameters "Modelltyp" ab.

  • drop_path: Die stochastische Tiefe. Es handelt sich um einen Prozentsatz, der als ein Gleitkommawert ausgedrückt wird. Die Standardeinstellung ist 0.1.

  • drop_path_rate: Die Rate der stochastischen Tiefe. Es handelt sich um einen Prozentsatz, der als ein Gleitkommawert ausgedrückt wird. Der Standardwert ist 0,05.

  • drop_rate: Eine Technik, bei der während des Trainings zufällig Neuronen entfernt werden, um eine Überanpassung zu verhindern. Es handelt sich um einen Prozentsatz, der als ein Gleitkommawert ausgedrückt wird. Die Standardeinstellung ist 0.1.

  • embed_dim: Die Dimension von Embeddings. Der Standardwert ist 768.

  • feat_loss: Gibt an, ob der Verlust des Diskriminator-Feature-Abgleichs verwendet wird. Der Standardwert ist "True".

  • focal_loss: Gibt an, ob Fokusverlust verwendet wird. Der Fokusverlust kann das Problem von Klassenungleichgewichten beim einphasigen Objekterkennungsmodell lösen. Die Standardeinstellung ist "False".

  • forecast_timesteps: Die Anzahl der Intervalle, in denen Trainingsvorhersagen erstellt werden. Die Standardeinstellung ist 1.

  • gaussian_thresh: Der Gauß'sche Schwellenwert, mit dem die erforderliche Straßenbreite festgelegt wird. Der gültige Bereich liegt zwischen 0,0 und 1,0. Die Standardeinstellung ist 0,6.

  • gen_blocks: Die Anzahl der ResNet-Blöcke, die im Generator verwendet werden sollen. Der Standardwert ist 9.

  • gen_network: Gibt das Modell an, das für den Generator verwendet werden soll. Verwenden Sie global, wenn der Computer nur wenig GPU-Speicher hat. Der Standardwert lautet "lokal".

  • gradcam: Gibt an, ob die Grad-CAM-Visualisierung (Gradient-weighted Class Activation Mapping) verwendet werden soll. Wenn diese Option auf True festgelegt ist, zeigt die Grad-CAM-Heatmap die wichtigen Gebiete an, die bei der Vorhersage berücksichtigt wurden.

  • grids: Die Anzahl der Gitternetze, in die das Bild für die Verarbeitung aufgeteilt wird. Das Festlegen dieses Arguments auf "4" bedeutet beispielsweise, dass das Bild in 4 x 4 oder 16 Gitterzellen aufgeteilt wird. Wenn kein Wert angegeben wird, wird der optimale Gitternetzwert auf der Grundlage der Eingabe-Bilddaten berechnet.

  • head_init_scale: Ursprünglicher Skalierungswert für die Gewichtungen und Verzerrungen des Klassifikators. Der Standard ist 1,0.

  • hrs_each_step: Die Anzahl der Stunden, in denen jede Dateniteration gesammelt wurde. Die Standardeinstellung ist 1.

  • ignore_classes: Die Liste der Klassenwerte, bei denen das Modell keinen Verlust verzeichnen wird.

  • inner_channel: Die Dimension des ersten U-Net-Layers. Dies ist ein optionaler ganzzahliger Wert. Dieses Argument wird nur unterstützt, wenn der Parameter Backbone-Modell den Wert SR3 hat. Die Standardeinstellung ist 64.

  • keep_dilation: Gibt an, ob Dilatation verwendet werden soll. Wenn diese Option auf "True" festgelegt ist und die pointrend-Architektur verwendet wird, kann dies die Genauigkeit zu Lasten des Speicherbedarfs verbessern. Die Standardeinstellung ist "False".

  • lambda_feat: Die Gewichtung für den Verlust des Feature-Abgleichs. Die Standardeinstellung ist 10.

  • lambda_l1: Die Gewichtung für den Verlust des Feature-Abgleichs. Diese Option wird für 3-Band-Bilddaten nicht unterstützt. Die Standardeinstellung ist 100.

  • layer_scale_init_value: Der ursprüngliche Wert für einen Layer-Maßstab. Der Standardwert ist 1e-6.

  • linear_end: Ein optionaler ganzzahliger Wert zum Planen des Endes. Dieses Argument wird nur unterstützt, wenn der Parameter Backbone-Modell den Wert SR3 hat. Der Standardwert ist 1e-06.

  • linear_start: Ein optionaler ganzzahliger Wert zum Planen des Starts. Dieses Argument wird nur unterstützt, wenn der Parameter Backbone-Modell den Wert SR3 hat. Der Standardwert ist 1e-02.

  • lsgan: Gibt an, ob die mittlere quadratische Abweichung im Training verwendet wird. Bei "False" wird stattdessen die binäre Kreuzentropie verwendet. Der Standardwert ist "True".

  • location_loss_factor: Die Gewichtung des Verlustes des umgebenden Rechtecks. Dieser Faktor passt den Fokus des Models an die Position des umgebenden Rechtecks an. Wenn "Keine" festgelegt wird, erhalten die Position und der Klassifizierungsverlust die gleiche Gewichtung.

  • min_points: Die Anzahl der erfassten Pixel in den einzelnen maskierten Trainingsgebieten. Dieser Wert muss ein Vielfaches von 64 sein.

  • mixup: Gibt an, ob neue Trainingsbilder erstellt werden, indem Bilder von Trainingssätzen nach dem Zufallsprinzip kombiniert werden (True). Die Standardeinstellung ist "False".

  • mlp_ratio: Das Verhältnis von Multilayer-Perpceptronen (MLP). Die Standardeinstellung ist 4.

  • mlp1: Die Dimensionen weiterer Feature-Räume von MLP1. Der Standardwert ist 32,64.

  • mlp2: Die Dimensionen weiterer Feature-Räume von MLP2. Der Standardwert ist 128,128.

  • mlp4: Die Dimensionen von Decoder-MLP. Der Standardwert ist 64,32.

  • model: Das Backbone-Modell, das zum Trainieren des Modells verwendet wird. Die verfügbaren Backbones sind abhängig vom Parameterwert Modelltyp. Dieses Argument wird nur für die Modelltypen MMDetection und MMSegmentation unterstützt. Der Standardwert für MMDetection ist "cascade_rcnn". Der Standardwert für MMSegmentation ist "mask2former".

  • model_weight: Gibt an, ob die Gewichtungen des vortrainierten Modells verwendet werden sollen. Der Wert kann auch ein Pfad zu einer Konfigurationsdatei mit den Gewichtungen eines Modells aus dem Repository "MMDetection" oder dem Repository "MMSegmentation" sein. Die Standardeinstellung ist "False".

  • mtl_model: Gibt den Architekturtyp an, der zum Erstellen des Modells verwendet wird. Die Optionen sind linknet oder hourglass für linknet-basierte bzw. sanduhrbasierte neuronale Architekturen. Die Standardeinstellung ist hourglass.

  • n_blocks_global: Die Anzahl der Residualblöcke im globalen Generatornetzwerk. Der Standardwert ist 9.

  • n_blocks_local: Die Anzahl der Residualblöcke im globalen Enhancer-Netzwerk. Der Standardwert ist 3.

  • n_downsample_global: Die Anzahl der Reduzierungs-Layer im globalen Generatornetzwerk.

  • n_dscr: Die Anzahl der zu verwendenden Diskriminatoren. Die Standardeinstellung ist 2.

  • n_dscr_filters: Die Anzahl der Diskriminatorfilter im ersten Faltungs-Layer. Die Standardeinstellung ist 64.

  • n_gen_filters: Die Anzahl der Generationenfilter im ersten Faltungs-Layer. Die Standardeinstellung ist 64.

  • n_head: Die Anzahl der Attention-Heads. Die Standardeinstellung ist 4.

  • n_layers_dscr: Die Anzahl der Layer für das in Pix2PixHD verwendete Diskriminatornetzwerk. Der Standardwert ist 3.

  • n_local_enhancers: Die Anzahl der lokalen Enhancer, die verwendet werden sollen. Die Standardeinstellung ist 1.

  • n_masks: Die maximale Anzahl der Klassenbeschriftungen und Instanzen, die ein Bild enthalten kann. Der Standardwert ist 30.

  • n_timestep: Die Anzahl an Diffusionszeitschritten. Dies ist ein optionaler Wert. Dieses Argument wird nur unterstützt, wenn der Parameter Backbone-Modell den Wert SR3 hat. Der Standardwert ist 1000.

  • norm: Gibt an, ob die Instanznormalisierung oder Batch-Normalisierung verwendet wird. Der Standardwert lautet "Instanz".

  • norm_groups: Die Anzahl der Gruppen für die Gruppennormalisierung. Dies ist ein optionaler ganzzahliger Wert. Dieses Argument wird nur unterstützt, wenn der Parameter Backbone-Modell den Wert SR3 hat. Der Standardwert ist 32.

  • num_heads: Die Anzahl der Attention-Heads. Der Standardwert ist 12.

  • orient_bin_size: Die Abschnittsgröße für Ausrichtungswinkel. Die Standardeinstellung ist 20.

  • orient_theta: Die Breite der Ausrichtungsmaske. Die Standardeinstellung ist 8.

  • oversample: Gibt an, ob Oversampling verwendet wird. Bei Angabe von "True" wird beim Training für unausgewogene Klassen des Datasets Oversampling verwendet. Diese Option wird für Datasets mit mehreren Beschriftungen nicht unterstützt. Die Standardeinstellung ist "False".

  • parallel_patch_embed: Spezifiziert, ob die Eingabebilder in kleinere Bildabschnitte aufgeteilt werden sollen, um sie parallel zu verarbeiten.

  • patch_size: Die Mustergröße für die Generierung von Muster-Embeddings. Der Standardwert ist 16.

  • perceptual_loss: Gibt an, ob perzeptueller Verlust im Training verwendet werden soll. Die Standardeinstellung ist "False".

  • pointrend: Gibt an, ob die PointRend-Architektur auf dem Segmentierungskopf verwendet werden soll. Weitere Informationen zur PointRend-Architektur finden Sie in der PDF-Datei zu PointRend. Die Standardeinstellung ist "False".

  • pooling: Die zu verwendende Pooling-Strategie für das Pixel-Embedding. Der Standardwert ist "Mittelwert".

  • pyramid_sizes: Die Anzahl und Größe der Faltungs-Layer, die auf die verschiedenen Unterregionen anzuwenden sind. Dieses Argument gilt speziell für das Pyramid Scene Parsing Network-Modell. Die Standardeinstellung ist [1,2,3,6].

  • qkv_bias: Gibt an, ob QK-Vektor-Verzerrung im Training verwendet werden soll. Die Standardeinstellung ist "False".

  • ratios: Die Liste der für die Ankerboxen zu verwendenden Seitenverhältnisse. Bei der Objekterkennung stellt eine Ankerbox die ideale Position, Form und Größe des vorhergesagten Objekts dar. Das Festlegen dieses Arguments auf [1,0,1,0], [1,0, 0,5] bedeutet beispielsweise, dass die Ankerbox ein Quadrat (1:1) oder ein Rechteck ist, bei dem die horizontale Seite halb so groß ist wie die vertikale Seite (1:0,5). Die Standardeinstellung für RetinaNet ist [0,5,1,2]. Die Standardeinstellung für Single Shot Detector ist [1,0, 1,0].

  • res_blocks: Die Anzahl der Residualblöcke. Dies ist ein optionaler ganzzahliger Wert. Dieses Argument wird nur unterstützt, wenn der Parameter Backbone-Modell den Wert SR3 hat. Der Standardwert ist 3.

  • rpn_batch_size_per_image: Die Anzahl der Anker, die während des Trainings des RPN zur Berechnung des Verlustes als Stichprobe genommen werden. Der Standardwert ist 256.

  • rpn_bg_iou_thresh: Die maximale IoU zwischen dem Anker und dem Überprüfungsfeld (GT), damit diese während des Trainings des RPN als negativ angesehen werden können. Der Standardwert beträgt 0,3.

  • rpn_fg_iou_thresh: Die minimale IoU zwischen dem Anker und dem Überprüfungsfeld (GT), damit diese während des Trainings des RPN als positiv angesehen werden können. Der Standardwert ist 0,7.

  • rpn_nms_thresh: Der NMS-Schwellenwert, der für die Nachbearbeitung der RPN-Vorschläge verwendet wird. Der Standardwert ist 0,7.

  • rpn_positive_fraction: Der Anteil der positiven Anker in einem minimalen Batch während des Trainings des RPN. Die Standardeinstellung ist 0,5.

  • rpn_post_nms_top_n_test: Die Anzahl der Vorschläge, die nach Anwendung von NMS während des Testens beibehalten werden sollen. Der Standardwert ist 1000.

  • rpn_post_nms_top_n_train: Die Anzahl der Vorschläge, die nach Anwendung von NMS während des Trainings beibehalten werden sollen. Der Standardwert ist 2000.

  • rpn_pre_nms_top_n_test: Die Anzahl der Vorschläge, die vor Anwendung von NMS während des Testens beibehalten werden sollen. Der Standardwert ist 1000.

  • rpn_pre_nms_top_n_train: Die Anzahl der Vorschläge, die vor Anwendung von NMS während des Trainings beibehalten werden sollen. Der Standardwert ist 2000.

  • scales: Die Anzahl der Maßstabsebenen, die jede Zelle hoch- oder herunterskaliert wird. Die Standardeinstellung ist [1, 0,8, 0,63].

  • schedule: Der Typ des Plans, der verwendet werden soll. Dies ist ein optionaler Wert. Die Optionen sind linear, warmup10, warmup50, const, jsd und cosine. Dieses Argument wird nur unterstützt, wenn der Parameter Backbone-Modell den Wert SR3 hat. Der Standardwert ist linear.

  • seq_len: Die Anzahl der Zeitstempelbänder. Gilt nur, wenn das Modell "prithvi100m" ist. Die Standardeinstellung ist 1.

  • T: Der Zeitraum, der für die Positionscodierung verwendet werden soll. Der Standardwert ist 1000.

  • timesteps_of_interest: Die Liste der relevanten Zeitschritte. Hiermit werden multitemporale Zeitserien auf der Grundlage der angegebenen Liste von Zeitschritten gefiltert. Enthält das Dataset etwa die Zeitschritte 0, 1, 2 und 3 und werden nur die Zeitschritte 0, 1 und 2 für das Training verwendet, würde dieser Parameter auf [0,1,2] festgelegt. Der Rest der Zeitschritte wird herausgefiltert.

  • unet_aux_loss: Gibt an, ob Zusatzverlust im Training verwendet werden soll.

  • use_unet: Gibt an, ob der U-Net-Decoder zum Wiederherstellen von Daten verwendet wird, nachdem das Pyramiden-Pooling abgeschlossen ist. Dieses Argument gilt speziell für das Pyramid Scene Parsing Network-Modell. Der Standardwert ist "True".

  • vgg_loss: Gibt an, ob der Verlust des VGG-Feature-Abgleichs verwendet wird. Diese Option wird nur für 3-Band-Bilddaten unterstützt. Der Standardwert ist "True".

  • wavelengths: Die zentralen Wellenlängen für jedes Band innerhalb des Eingabe-Rasters; Die Wellenlängen werden in Mikrometern angegeben. Es handelt sich um ein Array von Gleitkommawerten, die jedem Band entsprechen, zum Beispiel [0,665,0,560,0,490]. Die DOFA-, CLAY- und TERRAMIND-Backbones benötigen den Wellenlängenparameter, um dynamisch Patch-Embedding-Gewichtungen zu generieren. Das Modell versucht zwar, diese Angaben aus Metadaten und Bandnamen abzuleiten, doch müssen sie manuell eingegeben werden, falls die Namen fehlen oder nicht dem Standard entsprechen. Die folgende Liste zeigt den Bandnamen und die zentrale Wellenlänge: CoastalAerosol=0,443, CoastalBlue=0,443, Blue=0,490, Green=0,560, Red=0,665, Yellow=0,585, VegetationRedEdge_1=0.705, VegetationRedEdge_2=0.740, VegetationRedEdge_3=0,783, RedEdge=0,705, Infrared=0,865, NearInfrared=0,865, NIR=0,865, NearInfrared_1=0,842, NIR_1=0,842, NearInfrared_2=0,865, NIR_2=0,865, NarrowNearInfrared=0,87, NarrowNIR=0,87, ShortWaveInfrared=1,375, Cirrus=1,375, SWIR=1,375, ShortWaveInfrared_1=1,610, SWIR_1=1,610, ShortWaveInfrared_2=2,190, SWIR_2=2,190, MidInfrared=1,610, MIR=1,610, MidInfrared_1=1,610, MIR_1=1,610, MidInfrared_2=2,190, MIR_2=2,190, ThermalInfrared=11,450, Thermal=11,450, TIR=11,450, ThermalInfrared_1=10,895, Thermal_1=10,895, TIR_1=10,895, ThermalInfrared_2=12,005, Thermal_2=12,005, TIR_2=12,005, Panchromatic=0,592, WaterVapor=0,945, QA=0,0.

  • zooms: Die Anzahl der Zoomstufen, die jede Zelle hoch- oder herunterskaliert wird. Das Festlegen des Arguments auf 1 bedeutet, dass alle Gitterzellen die gleiche Größe oder Zoomstufe beibehalten. Eine Zoomstufe von 2 bedeutet, dass alle Gitterzellen zweimal so groß werden (um 100 Prozent vergrößert). Die Bereitstellung einer Liste von Zoomstufen bedeutet, dass alle Gitterzellen mit allen Zahlen in der Liste skaliert werden. Die Standardeinstellung ist 1.

Modelltyp

Argument

Gültige Werte

3D-RCNet

(Pixelklassifizierung)

depths

Eine Liste positiver Ganzzahlen. Die Standardeinstellung ist [1, 2, 4, 2].

dims

Eine Liste positiver Ganzzahlen. Die Standardwerte sind [32, 64, 128, 256].

drop_path_rate

Gleitkommawerte. Der Standardwert ist 0,05.

head_init_scale

Gleitkommawerte. Der Standardwert ist 1,0.

layer_scale_init_value

Gleitkommawerte. Der Standardwert ist 1e-6.

Change Detector

(Pixelklassifizierung)

attention_type

PAM (Pyramid Attention Module) oder BAM (Basic Attention Module). Die Standardeinstellung ist PAM.

ClimaX

(Pixelklassifizierung)

decoder_depth

Positiver ganzzahliger Wert. Die Standardeinstellung ist 2.

depth

Positiver ganzzahliger Wert. Die Standardeinstellung ist 8.

drop_path

Gleitkommawert. Die Standardeinstellung ist 0.1.

drop_rate

Gleitkommawert. Die Standardeinstellung ist 0.1.

embed_dim

Positiver ganzzahliger Wert. Der Standardwert ist 1024.

forecast_timesteps

Positiver ganzzahliger Wert. Die Standardeinstellung ist 1.

hrs_each_step

Positiver ganzzahliger Wert. Die Standardeinstellung ist 1.

mlp_ratio

Gleitkommawert. Der Standardwert ist 4,0.

num_heads

Positiver ganzzahliger Wert. Der Standardwert ist 16.

parallel_patch_embed

True oder False. Die Standardeinstellung ist True.

patch_size

Positiver ganzzahliger Wert. Die Standardeinstellung ist 4.

ConnectNet

(Pixelklassifizierung)

gaussian_thresh

0,0 bis 1,0. Die Standardeinstellung ist 0,6.

mtl_model

linknet oder hourglass. Die Standardeinstellung ist hourglass.

orient_bin_size

Eine positive Zahl. Die Standardeinstellung ist 20.

orient_theta

Eine positive Zahl. Die Standardeinstellung ist 8.

CycleGAN

(Bild-zu-Bild-Übersetzung)

gen_blocks

Eine positive ganze Zahl. Der Standardwert ist 9.

lsgan

True oder False. Die Standardeinstellung ist True.

DeepLab

(Pixelklassifizierung)

class_balancing

True oder False. Die Standardeinstellung ist False.

dice_loss_average

micro oder macro. Die Standardeinstellung ist micro.

dice_loss_fraction

Gleitkommawert zwischen 0 und 1. Die Standardeinstellung ist 0.

focal_loss

True oder False. Die Standardeinstellung ist False.

ignore_classes

Gültige Klassenwerte.

keep_dilation

True oder False. Die Standardeinstellung ist False.

mixup

True oder False. Die Standardeinstellung ist False.

pointrend

True oder False. Die Standardeinstellung ist False.

wavelengths

Ein Array von Gleitkommawerten, getrennt durch ein Komma, zum Beispiel [0,665,0,560,0,490].

FasterRCNN

(Objekterkennung)

box_batch_size_per_image

Positive Ganzzahlen. Der Standardwert ist 512.

box_bg_iou_thresh

Gleitkommawert zwischen 0 und 1. Die Standardeinstellung ist 0,5.

box_detections_per_img

Positive Ganzzahlen. Die Standardeinstellung ist 100.

box_fg_iou_thresh

Gleitkommawert zwischen 0 und 1. Die Standardeinstellung ist 0,5.

box_nms_thresh

Gleitkommawert zwischen 0 und 1. Die Standardeinstellung ist 0,5.

box_positive_fraction

Gleitkommawert zwischen 0 und 1. Der Standardwert ist 0,25.

box_score_thresh

Gleitkommawert zwischen 0 und 1. Der Standardwert ist 0,05.

rpn_batch_size_per_image

Positive Ganzzahlen. Der Standardwert ist 256.

rpn_bg_iou_thresh

Gleitkommawert zwischen 0 und 1. Der Standardwert beträgt 0,3.

rpn_fg_iou_thresh

Gleitkommawert zwischen 0 und 1. Der Standardwert ist 0,7.

rpn_nms_thresh

Gleitkommawert zwischen 0 und 1. Der Standardwert ist 0,7.

rpn_positive_fraction

Gleitkommawert zwischen 0 und 1. Die Standardeinstellung ist 0,5.

rpn_post_nms_top_n_test

Positive Ganzzahlen. Der Standardwert ist 1000.

rpn_post_nms_top_n_train

Positive Ganzzahlen. Der Standardwert ist 2000.

rpn_pre_nms_top_n_test

Positive Ganzzahlen. Der Standardwert ist 1000.

rpn_pre_nms_top_n_train

Positive Ganzzahlen. Der Standardwert ist 2000.

wavelengths

Ein Array von Gleitkommawerten, getrennt durch ein Komma, zum Beispiel [0,665,0,560,0,490].

Feature Classifier

(Objektklassifizierung)

gradcam

True oder False. Die Standardeinstellung ist False.

mixup

True oder False. Die Standardeinstellung ist False.

oversample

True oder False. Die Standardeinstellung ist False.

wavelengths

Ein Array von Gleitkommawerten, getrennt durch ein Komma, zum Beispiel [0,665,0,560,0,490].

HED Edge Detector

(Pixelklassifizierung)

wavelengths

Ein Array von Gleitkommawerten, getrennt durch ein Komma, zum Beispiel [0,665,0,560,0,490].

Image Captioner

(Bild-zu-Bild-Übersetzung)

Das Argument decode_params besteht aus den folgenden Parametern:

  • embed_size

  • hidden_size

  • attention_size

  • teacher_forcing

  • dropout

  • pretrained_emb

Die Standardeinstellung ist {'embed_size':100, 'hidden_size':100, 'attention_size':100, 'teacher_forcing':1, 'dropout':0.1, 'pretrained_emb':False}.

MaskRCNN

(Objekterkennung)

box_batch_size_per_image

Positive Ganzzahlen. Der Standardwert ist 512.

box_bg_iou_thresh

Gleitkommawert zwischen 0 und 1. Die Standardeinstellung ist 0,5.

box_detections_per_img

Positive Ganzzahlen. Die Standardeinstellung ist 100.

box_fg_iou_thresh

Gleitkommawert zwischen 0 und 1. Die Standardeinstellung ist 0,5.

box_nms_thresh

Gleitkommawert zwischen 0 und 1. Die Standardeinstellung ist 0,5.

box_positive_fraction

Gleitkommawert zwischen 0 und 1. Der Standardwert ist 0,25.

box_score_thresh

Gleitkommawert zwischen 0 und 1. Der Standardwert ist 0,05.

pointrend

True oder False. Die Standardeinstellung ist False. : Wenn diese Option auf True festgelegt ist, wird die PointRend-Architektur auf dem Segmentierungskopf verwendet.

rpn_batch_size_per_image

Positive Ganzzahlen. Der Standardwert ist 256.

rpn_bg_iou_thresh

Gleitkommawert zwischen 0 und 1. Der Standardwert beträgt 0,3.

rpn_fg_iou_thresh

Gleitkommawert zwischen 0 und 1. Der Standardwert ist 0,7.

rpn_nms_thresh

Gleitkommawert zwischen 0 und 1. Der Standardwert ist 0,7.

rpn_positive_fraction

Gleitkommawert zwischen 0 und 1. Die Standardeinstellung ist 0,5.

rpn_post_nms_top_n_test

Positive Ganzzahlen. Der Standardwert ist 1000.

rpn_post_nms_top_n_train

Positive Ganzzahlen. Der Standardwert ist 2000.

rpn_pre_nms_top_n_test

Positive Ganzzahlen. Der Standardwert ist 1000.

rpn_pre_nms_top_n_train

Positive Ganzzahlen. Der Standardwert ist 2000.

wavelengths

Ein Array von Gleitkommawerten, getrennt durch ein Komma, zum Beispiel [0,665,0,560,0,490].

MaXDeepLab

(panoptische Segmentierung)

n_masks

Positive Ganzzahlen. Der Standardwert ist 30.

MMDetection

(Objekterkennung)

model

atss, carafe, cascade_rcnn, cascade_rpn, dcn, deeplabv3, detectors, dino, double_heads, dynamic_rcnn, empirical_attention, fcos, foveabox, fsaf, ghm, hrnet, libra_rcnn, nas_fcos, pafpn, pisa, regnet, reppoints, res2net, sabl und vfnet.

Die Standardeinstellung ist cascade_rcnn.

model_weight

False oder ein Dateipfad. Der Standardwert ist False.

MMSegmentation

(Pixelklassifizierung)

class_balancing

True oder False. Die Standardeinstellung ist False.

ignore_classes

Gültige Klassenwerte.

model

ann, apcnet, ccnet, cgnet, deeplabv3, deeplabv3plus, dmnet , dnlnet, emanet, fastscnn, fcn, gcnet, hrnet, mask2former, mobilenet_v2, nonlocal_net, ocrnet, prithvi100m, psanet, pspnet, resnest, sem_fpn, unet und upernet.

Die Standardeinstellung ist mask2former.

model_weight

False oder ein Dateipfad. Der Standardwert ist False.

seq_len

Eine positive ganze Zahl. Die Standardeinstellung ist 1.

Multi Task Road Extractor

(Pixelklassifizierung)

gaussian_thresh

0,0 bis 1,0. Die Standardeinstellung ist 0,6.

mtl_model

linknet oder hourglass. Die Standardeinstellung ist hourglass.

orient_bin_size

Eine positive Zahl. Die Standardeinstellung ist 20.

orient_theta

Eine positive Zahl. Die Standardeinstellung ist 8.

Pix2Pix

(Bild-zu-Bild-Übersetzung)

perceptual_loss

True oder False. Die Standardeinstellung ist False.

Pix2PixHD

(Bild-zu-Bild-Übersetzung)

feat_loss

True oder False. Die Standardeinstellung ist True.

gen_network

local oder global. Die Standardeinstellung ist local.

lambda_feat

Positive ganzzahlige Werte. Die Standardeinstellung ist 10.

lambda_l1

Positive ganzzahlige Werte. Die Standardeinstellung ist 100.

lsgan

True oder False. Die Standardeinstellung ist True.

n_blocks_global

Positive ganzzahlige Werte. Der Standardwert ist 9.

n_blocks_local

Positive ganzzahlige Werte. Der Standardwert ist 3.

n_downsample_global

Positive ganzzahlige Werte. Die Standardeinstellung ist 4.

n_dscr

Positive ganzzahlige Werte. Die Standardeinstellung ist 2.

n_dscr_filters

Positive ganzzahlige Werte. Die Standardeinstellung ist 64.

n_gen_filters

Positive ganzzahlige Werte. Die Standardeinstellung ist 64.

n_layers_dscr

Positive ganzzahlige Werte. Der Standardwert ist 3.

n_local_enhancers

Positive ganzzahlige Werte. Die Standardeinstellung ist 1.

norm

instance oder batch. Die Standardeinstellung ist instance.

vgg_loss

True oder False. Die Standardeinstellung ist True.

PSETAE

(Pixelklassifizierung)

channels_of_interest

Liste der Bandnummern (ganze Zahlen größer als oder gleich 0).

d_k

Positive ganzzahlige Werte. Der Standardwert ist 32.

dropout

Gleitkommawert zwischen 0 und 1. Der Standardwert ist 0,2.

min_points

Ganzzahlige Vielfache von 64.

mlp1

Liste positiver Ganzzahlen. Der Standardwert ist 32,64.

mlp2

Liste positiver Ganzzahlen. Der Standardwert ist 128,128.

mlp4

Liste positiver Ganzzahlen. Der Standardwert ist 64,32.

n_head

Positive ganzzahlige Werte. Die Standardeinstellung ist 4.

pooling

mean, std, max oder min. Die Standardeinstellung ist mean.

T

Positive ganzzahlige Werte. Der Standardwert ist 1000.

timesteps_of_interest

Liste ganzer Zahlen, die größer als oder gleich 0 sind.

Pyramid Scene Parsing Network

(Pixelklassifizierung)

class_balancing

True oder False. Die Standardeinstellung ist False.

dice_loss_average

micro oder macro. Die Standardeinstellung ist micro.

dice_loss_fraction

Gleitkommawert zwischen 0 und 1. Die Standardeinstellung ist 0.

focal_loss

True oder False. Die Standardeinstellung ist False.

ignore_classes

Gültige Klassenwerte.

keep_dilation

True oder False. Die Standardeinstellung ist False.

mixup

True oder False. Die Standardeinstellung ist False.

pointrend

True oder False. Die Standardeinstellung ist False.

pyramid_sizes

[Faltungs-Layer 1, Faltungs-Layer 2, ... , Faltungs-Layer n]

unet_aux_loss

True oder False. Die Standardeinstellung ist False.

use_unet

True oder False. Die Standardeinstellung ist True.

RetinaNet

(Objekterkennung)

ratios

Eine Liste von Gleitkommazahlen.

Die Standardeinstellung ist 0,5,1,2.

scales

[Maßstabswert 1, Maßstabswert 2, Maßstabswert 3]

Die Standardeinstellung ist [1, 0,8, 0,63].

wavelengths

Ein Array von Gleitkommawerten, getrennt durch ein Komma, zum Beispiel [0,665,0,560,0,490].

SAMLoRA

(Pixelklassifizierung)

class_balancing

True oder False. Die Standardeinstellung ist False.

ignore_classes

Gültige Klassenwerte.

Single Shot Detector

(Objekterkennung)

bias

Gleitkommawert. Der Standardwert ist -4,0.

drop

Gleitkommawert zwischen 0 und 1.

focal_loss

True oder False. Die Standardeinstellung ist False.

grids

Eine Liste positiver Ganzzahlen.

location_loss_factor

Gleitkommawert zwischen 0 und 1.

ratios

Die Liste der Seitenverhältnisse, wobei jedes Seitenverhältnis ein Paar von zwei Gleitkommazahlen ist, [horizontaler Wert, vertikaler Wert]. Die Standardeinstellung ist [1,0, 1,0].

wavelengths

Ein Array von Gleitkommawerten, getrennt durch ein Komma, zum Beispiel [0,665,0,560,0,490].

zooms

Eine Liste positiver Gleitkommazahlen.

Super-Resolution für SR3-Backbone

(Bild-zu-Bild-Übersetzung)

attn_res

Ganze Zahlen größer als 0. Der Standardwert ist 16.

channel_mults

Ganzzahlige Multiplikatorgruppen. Der Standard ist [1, 2, 4, 4, 8, 8].

downsample_factor

Positiver ganzzahliger Wert. Die Standardeinstellung ist 4.

dropout

Gleitkommawert. Die Standardeinstellung ist 0.

inner_channel

Ganzzahliger Wert größer als 0. Die Standardeinstellung ist 64.

linear_start

Zeit, ausgedrückt als Gleitkommawert.

linear_end

Zeit, ausgedrückt als Gleitkommawert.

n_timestep

Ganzzahliger Wert größer als 0. Der Standardwert ist 1000.

norm_groups

Ganzzahliger Wert größer als 0. Der Standardwert ist 32.

res_blocks

Ganzzahliger Wert größer als 0. Der Standardwert ist 3.

schedule

linear, warmup10, warmup50, const, jsd oder cosine.

Die Standardeinstellung ist linear.

Super-Resolution für SR3_UViT-Backbone

(Bild-zu-Bild-Übersetzung)

depth

Positiver ganzzahliger Punktwert. Der Standardwert ist 17.

downsample_factor

Positiver ganzzahliger Wert. Die Standardeinstellung ist 4.

embed_dim

Positiver ganzzahliger Punktwert. Der Standardwert ist 768.

mlp_ratio

Positiver Gleitkommawert. Der Standardwert ist 4,0.

num_heads

Positiver ganzzahliger Punktwert. Der Standardwert ist 12.

patch_size

Positiver ganzzahliger Punktwert. Der Standardwert ist 16.

qkv_bias

True oder False. Die Standardeinstellung ist False.

Super-Resolution mit einem anderen Backbone als SR3 und SR3_UViT.

(Bild-zu-Bild-Übersetzung)

downsample_factor

Positiver ganzzahliger Wert. Die Standardeinstellung ist 4.

U-Net

(Pixelklassifizierung)

class_balancing

True oder False. Die Standardeinstellung ist False.

dice_loss_average

micro oder macro. Die Standardeinstellung ist micro.

dice_loss_fraction

Gleitkommawert zwischen 0 und 1. Die Standardeinstellung ist 0.

focal_loss

True oder False. Die Standardeinstellung ist False.

ignore_classes

Gültige Klassenwerte.

mixup

True oder False. Die Standardeinstellung ist False.

Inferenzierungsargumente

Mit den folgenden Argumenten kann gesteuert werden, wie Deep-Learning-Modelle für die Inferenzierung trainiert werden. Die Informationen aus dem Parameter Modelldefinition werden zum Füllen des Parameters Argumente in den Inferenzwerkzeugen verwendet. Diese Argumente sind je nach Modellarchitektur unterschiedlich. Vortrainierte Modelle und benutzerdefinierte Deep-Learning-Modelle in ArcGIS verfügen ggf. über weitere Argumente, die von dem Werkzeug unterstützt werden.

Argument

Inferenztyp

Gültige Werte

batch_size

Die Anzahl der in den einzelnen Schritten der Modellinferenz verarbeiteten Kacheln. Dieser Wert hängt vom Speicher der Grafikkarte ab. Das Argument ist für alle Modellarchitekturen verfügbar.

Objekte klassifizieren

Pixel klassifizieren

Änderung erkennen

Objekte erkennen

Ganzzahlige Werte größer als 0; in der Regel eine ganze Zahl, die eine Potenz von 2n ist.

direction

Die Richtung in der das Bild von einer Domäne in eine andere übertragen wird. Weitere Informationen zu diesem Argument finden Sie unter How CycleGAN works.

Das Argument ist nur für die Architektur CycleGAN verfügbar.

Pixel klassifizieren

Die verfügbaren Optionen lauten AtoB und BtoA.

exclude_pad_detections

Gibt an, ob gekürzte Erkennungen in der Nähe der Kanten im aufgefüllten Bereich von Bildausschnitten gefiltert werden.

Das Argument ist nur für SSD, RetinaNet, YOLOv3, DETReg, MMDetection und Faster RCNN verfügbar.

Objekte erkennen

True oder False.

merge_policy

Die Richtlinie für das Zusammenführen erweiterter Vorhersagen. Dies gilt nur bei Verwendung von Test-Time-Augmentation.

Beim Werkzeug Pixel mit Deep Learning klassifizieren ist das Argument für die Architekturen MultiTaskRoadExtractor und ConnectNet verfügbar. Wenn IsEdgeDetection in der .emd-Datei des Modells vorhanden ist, sind auch die Architekturen BDCNEdgeDetector, HEDEdgeDetector und MMSegmentation verfügbar.

Beim Werkzeug Objekte mit Deep Learning erkennen ist das Argument nur für MaskRCNN verfügbar.

Pixel klassifizieren

Objekte erkennen

Die verfügbaren Optionen sind mean, max und min.

nms_overlap

Die maximale Überlappungsrate für zwei überlappende Features, die als Verhältnis von Schnittfläche zu Vereinigungsfläche definiert ist. Das Argument ist für alle Modellarchitekturen verfügbar.

Objekte erkennen

Ein Gleitkommawert von 0,0 bis 1,0. Die Standardeinstellung ist 0.1.

output_classified_raster

Der Pfad zum Ausgabe-Raster. Das Argument ist nur für MaXDeepLab verfügbar.

Objekte erkennen

Der Dateipfad und -name für das klassifizierte Ausgabe-Raster.

padding

Die Anzahl von Pixeln am Rahmen von Bildkacheln, aus denen Vorhersagen für benachbarte Kacheln verschmolzen werden. Um die Ausgabe zu glätten und gleichzeitig Artefakte zu reduzieren, erhöhen Sie den Wert. Der Maximalwert für Padding muss kleiner als die Hälfte der Kachelgröße sein. Beträgt die Kachelgröße beispielsweise 256, muss das Padding kleiner als 127 sein. Das Argument ist für alle Modellarchitekturen verfügbar.

Pixel klassifizieren

Änderung erkennen

Objekte erkennen

Ganzzahlige Werte größer als 0 und kleiner als die Hälfte des Wertes der Kachelgröße.

predict_background

Gibt an, ob die Hintergrundklasse klassifiziert wird. Das Argument ist für UNET, PSPNET, DeepLab und MMSegmentation verfügbar.

Pixel klassifizieren

True oder False.

return_probability_raster

Gibt an, ob ein Wahrscheinlichkeits-Raster ausgegeben wird. Ein Wahrscheinlichkeits-Raster ist ein Raster, dessen Pixel die Wahrscheinlichkeit angeben, mit der eine untersuchte Variable über oder unter einem bestimmten Schwellenwert liegt.

Wenn ArcGISLearnVersion 1.8.4 oder höher in der .emd-Datei des Modells vorhanden ist, sind die Architekturen MultiTaskRoadExtractor und ConnectNet verfügbar. Bei ArcGISLearnVersion 1.8.4 oder höher und wenn IsEdgeDetection in der .emd-Datei des Modells vorhanden ist, sind auch die Architekturen BDCNEdgeDetector, HEDEdgeDetector und MMSegmentation verfügbar.

Pixel klassifizieren

True oder False.

score_threshold

Über diesem Konfidenzwert liegende Vorhersagen sind im Ergebnis enthalten. Das Argument ist für alle Modellarchitekturen verfügbar.

Dieses Argument wird in der Regel bei Modellen verwendet, die vor ArcGIS Pro 3.5 trainiert wurden.

Objekte klassifizieren

0 bis 1,0

test_time_augmentation

Gibt an, ob beim Erstellen von Vorhersagen eine Test-Time-Augmentation durchgeführt wird. Wenn diese Option auf True festgelegt ist, werden Vorhersagen für gekippte und gedrehte Varianten des Eingabebilds in der endgültigen Ausgabe zusammengeführt. Das Argument ist für die meisten Modellarchitekturen verfügbar.

Objekte klassifizieren

Pixel klassifizieren

True oder False.

threshold

Vorhersagen, deren Konfidenzwert höher als dieser Schwellenwert ist, sind im Ergebnis enthalten.

Beim Werkzeug Objekte mit Deep Learning klassifizieren ist das Argument für alle Modellarchitekturen verfügbar. Dieses Argument wird in der Regel bei Modellen verwendet, die in ArcGIS Pro 3.5 oder einer späteren Version trainiert wurden.

Beim Werkzeug Pixel mit Deep Learning klassifizieren sind die Architekturen MultiTaskRoadExtractor und ConnectNet verfügbar, wenn ArcGISLearnVersion 1.8.4 oder höher in der .emd-Datei des Modells vorhanden ist. Bei ArcGISLearnVersion 1.8.4 oder höher und wenn IsEdgeDetection in der .emd-Datei des Modells vorhanden ist, sind auch die Architekturen BDCNEdgeDetector, HEDEdgeDetector und MMSegmentation verfügbar.

Beim Werkzeug Objekte mit Deep Learning erkennen ist das Argument für alle Modellarchitekturen verfügbar.

Objekte klassifizieren

Pixel klassifizieren

Objekte erkennen

0 bis 1,0.

thinning

Gibt an, ob die vorhergesagten Kanten ausgedünnt bzw. skelettiert sind.

Wenn IsEdgeDetection in der .emd-Datei des Modells vorhanden ist, sind die Architekturen BDCNEdgeDetector, HEDEdgeDetector und MMSegmentation verfügbar.

Pixel klassifizieren

True oder False.

tile_size

Die Breite und Höhe der Bildkacheln, in die die Bilddaten für Vorhersagen unterteilt werden.

Beim Werkzeug Pixel mit Deep Learning klassifizieren ist das Argument nur für die Architektur CycleGAN verfügbar.

Beim Werkzeug Objekte mit Deep Learning erkennen ist das Argument nur für MaskRCNN verfügbar.

Pixel klassifizieren

Objekte erkennen

Ganzzahlige Werte größer als 0 und kleiner als die Bildgröße.