Mit AutoML trainieren (GeoAI Tools)
Zusammenfassung
Trainiert ein Deep-Learning-Modell, indem Training-Pipelines erstellt und ein Großteil des Trainingsprozesses automatisiert wird. Dazu gehören explorative Datenanalyse, Feature-Auswahl, Feature Engineering, Modellauswahl, Hyperparameter-Optimierung und Modelltraining. Die Ausgaben enthalten Performance-Kennwerte des besten Modells in den Trainingsdaten sowie das trainierte Deep-Learning-Modellpaket (.dlpk), das als Eingabe für das Werkzeug Mit AutoML vorhersagen verwendet werden kann, um Vorhersagen für ein neues Dataset zu treffen.
Verwendung
Sie müssen das richtige Deep-Learning-Framework für Python in ArcGIS Pro installieren.
Informationen zum Installieren von Deep-Learning-Frameworks für ArcGIS
Wie lange es dauert, bis das Werkzeug das trainierte Modell erstellt, hängt von den folgenden Faktoren ab:
Menge der beim Training bereitgestellten Daten
Wert des Parameters AutoML-Modus
Standardmäßig ist der Timer für alle Modi auf 240 Minuten festgelegt. Unabhängig von der Menge der beim Training verwendeten Daten beansprucht die Suche nach dem optimalen Modell bei der Option Grundlegend des Parameters AutoML-Modus nicht die gesamten 240 Minuten. Der Anpassungsprozess wird abgeschlossen, sobald das optimale Modell identifiziert ist. Die Option Erweitert beansprucht aufgrund der zusätzlichen Tasks Feature Engineering, Feature-Auswahl und Hyperparameter-Optimierung mehr Zeit. Neben den neuen Features, die durch Kombinieren mehrerer Features aus der Eingabe entstehen, erstellt das Werkzeug räumliche Features mit Namen von "zone3_id" bis "zone7_id". Diese neuen Features werden aus den Positionsinformationen in den Eingabedaten extrahiert und zum Trainieren besserer Modelle verwendet. Weitere Informationen zu den neuen räumlichen Features finden Sie unter "Funktionsweise von AutoML". Wenn eine große Menge von Daten trainiert werden soll, können in 240 Minuten möglicherweise nicht alle Kombinationen der Modelle bewertet werden. In solchen Fällen wird das Modell, das in 240 Minuten am besten abschneidet, als optimales Modell betrachtet. Sie können entweder dieses Modell verwenden oder das Werkzeug mit einem höheren Wert für den Parameter Limit für Gesamtzeit (Minuten) erneut ausführen.
Eine Lizenz für die Erweiterung "ArcGIS Spatial Analyst" ist erforderlich, um Raster als erklärende Variablen zu verwenden.
Der Wert des Parameters Ausgabebericht ist eine Datei im HTML-Format, mit deren Hilfe die Informationen im Arbeitsverzeichnis überprüft werden können.
Die erste Seite des Berichts enthält Links zu den einzelnen bewerteten Modellen und gibt Aufschluss über ihre Performance bei Verwendung eines Validierungs-Datasets zusammen mit der Dauer des Trainings der Modelle. Der Bericht zeigt basierend auf den Bewertungskennwerten das ausgewählte Modell mit der besten Performance an.
RMSE ist der Standardbewertungskennwert für Regressionsprobleme, während Logloss der Standardkennwert für Klassifizierungsprobleme ist. Die folgenden Kennwerte sind im Ausgabebericht verfügbar:
Classification—AUC, Logloss, F1, Accuracy, Average Precision
Regression—MSE, RMSE, MAE, R2, MAPE, Spearman-Koeffizient, Pearson-Koeffizient
Wenn Sie auf eine Modellkombination klicken, werden zugehörige Details zum Training einschließlich der Lernkurven, der Variablenbedeutungskurven, der verwendeten Hyperparameter usw. angezeigt.
Anwendungsbeispiele für das Werkzeug sind das Trainieren eines auf Wetterfaktoren basierenden Modells für die jährliche Erzeugung von Sonnenenergie, das Trainieren eines Modells für Erntevorhersagen mithilfe zugehöriger Variablen und das Trainieren eines Modells für Vorhersagen von Immobilienwerten.
Weitere Informationen zu den Voraussetzungen für die Ausführung dieses Werkzeugs und eventuell dabei auftretenden Problemen finden Sie unter Häufig gestellte Fragen zu Deep Learning.
Um den Parameter Bildanlagen hinzufügen zu verwenden, bereiten Sie den Wert des Parameters Eingabe-Trainings-Features für Bildanlagen wie folgt vor:
Stellen Sie sicher, dass der Feature-Layer für jeden Datensatz ein Feld mit Bilddateipfaden enthält.
Verwenden Sie das Werkzeug Anlagen aktivieren, um Anlagen für den Feature-Layer zu aktivieren.
Verwenden Sie das Werkzeug Anlagen hinzufügen, um das Feld für den Bildpfad anzugeben und es dem Feature-Layer als Bildanlage hinzuzufügen.
Aktivieren Sie den Parameter Standort-Embeddings verwenden, um die Modell-Performance bei räumlich abhängigen Vorhersageaufgaben zu verbessern, insbesondere beim Arbeiten mit begrenzten Feature-Sets, indem Sie dichte Vektordarstellungen integrieren, die komplexe geographische und umgebungsbezogene Beziehungen erfassen.
Parameter
| Beschriftung | Erläuterung | Datentyp |
|---|---|---|
|
Eingabe-Trainings-Features |
Die Eingabe-Feature-Class, die zum Trainieren des Modells verwendet wird. |
Feature Layer; Table View |
|
Ausgabemodell |
Das trainierte Ausgabemodell, das als Deep-Learning-Paket ( |
File |
|
Vorherzusagende Variable |
Ein Feld aus dem Wert des Parameters Eingabe-Trainings-Features mit den Werten, die zum Trainieren des Modells verwendet werden. Dieses Feld enthält bekannte (Trainings-)Werte der Variablen, mit denen eine Vorhersage an unbekannten Positionen getroffen wird. |
Field |
|
Variable als kategorisch behandeln (Optional) |
Gibt an, ob der Wert des Parameters Vorherzusagende Variable als kategoriale Variable behandelt wird.
|
Boolean |
|
Erklärende Trainingsvariablen (Optional) |
Eine Liste der Felder, die erklärende Variablen darstellen und die Vorhersage des Wertes oder der Kategorie des Wertes des Parameters Vorherzusagende Variable unterstützen. Aktivieren Sie das zugehörige Kontrollkästchen für alle Variablen, die Klassen oder Kategorien darstellen (z. B. Landbedeckung, Anwesenheit oder Abwesenheit). Spalten der Wertetabelle:
|
Value Table |
|
Erklärende Trainings-Entfernungs-Features (Optional) |
Die Features, deren Entfernungen von den Eingabe-Trainings-Features automatisch geschätzt und als weitere erklärende Variablen hinzugefügt werden. Entfernungen werden von den einzelnen erklärenden Trainings-Entfernungs-Features der Eingabe zu den nächsten Eingabe-Trainings-Features berechnet. Es werden Punkt- und Polygon-Features unterstützt, und wenn es sich bei den Eingabewerten für erklärende Trainings-Entfernungs-Features um Polygone handelt, werden die Entfernungsattribute als Entfernung zwischen den nächstgelegenen Segmenten des Feature-Paares berechnet. |
Feature Layer |
|
Erklärende Trainings-Raster (Optional) |
Die Raster, deren Werte aus dem Raster extrahiert und als erklärende Variablen für das Modell behandelt werden. Jeder Layer bildet eine erklärende Variable. Der Wert der Raster-Zelle wird für jedes Feature in den Eingabe-Trainings-Features an der genauen Position extrahiert. Beim Extrahieren des Raster-Werts für kontinuierliche Raster wird bilineares Resampling verwendet. Beim Extrahieren eines Raster-Werts aus kategorialen Rastern wird ein Nächster-Nachbar-Resampling durchgeführt. Wenn der Wert des Parameters Eingabe-Trainings-Features Polygone aufweist und Sie einen Wert für diesen Parameter angegeben haben, wird im Modell für jedes Polygon ein Raster-Wert verwendet. Jedem Polygon wird für kontinuierliche Raster der Durchschnittswert und für Kategorie-Raster die Mehrheit zugewiesen. Vergewissern Sie sich, dass das Kontrollkästchen Kategorial für alle Raster aktiviert ist, die Klassen oder Kategorien darstellen, z. B. Landbedeckung, Vegetation oder Bodenart. Spalten der Wertetabelle:
|
Value Table |
|
Limit für Gesamtzeit (Minuten) (Optional) |
Das Limit für die Gesamtzeit des AutoML-Modelltrainings in Minuten. Der Standardwert beträgt 240 (4 Stunden). |
Double |
|
AutoML-Modus (Optional) |
Gibt das Ziel von AutoML und die Intensität der AutoML-Suche an.
|
String |
|
Algorithmen (Optional) |
Gibt die Algorithmen an, die beim Training verwendet werden. Standardmäßig werden alle Algorithmen verwendet.
|
String |
|
Validierungsprozentsatz (Optional) |
Der Prozentsatz der Eingabedaten, die für die Validierung verwendet werden sollen. Der Standardwert ist 10. |
Long |
|
Ausgabebericht (Optional) |
Der Ausgabebericht, der als |
File |
|
Ausgabetabelle zur Bedeutung (Optional) |
Eine Ausgabetabelle mit Informationen zur Bedeutung der einzelnen im Modell verwendeten erklärenden Variablen (Felder, Entfernungs-Features und Raster). |
Table |
|
Ausgabe-Feature-Class (Optional) |
Der Feature-Layer mit den Werten, die von dem beim Trainings-Feature-Layer am besten abschneidenden Modell vorhergesagt wurden. Er kann zum Überprüfen der Modell-Performance durch einen visuellen Vergleich der vorgesagten Werte mit den Überprüfungsdaten verwendet werden. |
Feature Class |
|
Bildanlagen hinzufügen (Optional) |
Gibt an, ob zum Trainieren eines Modells für multimodale oder gemischte Daten Bilder als erklärende Variablen des Wertes des Parameters Eingabe-Trainings-Features verwendet werden. Beim Trainieren eines tabellarischen Modells für multimodale oder gemischte Daten werden Machine-Learning- und Deep-Learning-Backbones in AutoML verwendet, um mit einem einzelnen Modell aus mehreren Typen von Datenformaten zu lernen. Die Eingabedaten können aus einer Kombination von erklärenden Variablen aus unterschiedlichen Datenquellen bestehen, z. B. Textbeschreibungen, entsprechende Bilder sowie zusätzliche kategoriale und kontinuierliche Variablen.
|
Boolean |
|
Attribute sensibler Features (Optional) |
Bewertet und verbessert die Fairness der trainierten Modelle für Tabellendaten von Klassifizierungs- und Regressionsmodellen. Legen Sie für diesen Parameter die folgenden beiden Komponenten fest:
Spalten der Wertetabelle:
|
Value Table |
|
Fairness-Kennwert (Optional) |
Gibt die Fairness-Kennwerte zum Messen der Fairness für Klassifizierungs- und Regressionsprobleme an, die bei der Rastersuche zum Auswählen des Modells mit der größten Fairness verwendet werden.
|
String |
|
Standort-Embeddings verwenden (Optional) |
Gibt an, ob Standort-Embeddings während des Trainings als zusätzliche erklärende Variablen verwendet werden, um die Vorhersagekraft des standortbasierten Modells zu verbessern. Bei der Verwendung von Standort-Embeddings werden generalisierte geographische Embeddings aus Satellitenbildern und geographischen Koordinaten aus dem Parameterwert Eingabe-Trainings-Features generiert. Dadurch wird ein räumlicher Kontext geboten, der die Modell-Performance bei standortabhängigen Vorhersagen, z. B. für Hauspreise, Umweltmodellierung und demografische Schätzungen, verbessert.
|
Boolean |
Umgebungen
Ausgabe-Koordinatensystem, Geographische Transformationen
Lizenzierungsinformationen
- Basic: Nein
Spatial Analyst ist für die Verwendung des Parameters "Erklärende Trainings-Raster" erforderlich. - Standard: Nein
Spatial Analyst ist für die Verwendung des Parameters "Erklärende Trainings-Raster" erforderlich. - Advanced: Ja
Spatial Analyst ist für die Verwendung des Parameters "Erklärende Trainings-Raster" erforderlich.
Verwandte Themen
- Überblick über das Toolset "Feature- und Tabellenanalyse"
- Suchen eines Geoverarbeitungswerkzeugs
- Überblick über das Toolset "Bilddaten-KI"
- Fairness-Optionen beim Werkzeug "Mit AutoML trainieren"
- Funktionsweise des LightGBM-Algorithmus
- Funktionsweise des Algorithmus für lineare Regression
- Funktionsweise des XGBoost-Algorithmus
- Funktionsweise des Entscheidungsbaumalgorithmus für Klassifizierung und Regression
- Funktionsweise des Extra-Trees-Algorithmus für Klassifizierung und Regression
- Funktionsweise des Random-Trees-Algorithmus für Klassifizierung und Regression