Skip to main content

Forest-basierte Klassifizierung und Regression (GeoAnalytics Server Tools)

Zusammenfassung

Erstellt Modelle und generiert Vorhersagen mithilfe einer Adaption des "Random Forest"-Algorithmus, einer von Leo Breiman und Adele Cutler entwickelten Methode für überwachtes maschinelles Lernen. Vorhersagen können sowohl für Kategorievariablen (Klassifizierung) als auch für kontinuierliche Variablen (Regression) getroffen werden. Erklärende Variablen können als Felder in der Attributtabelle der Trainings-Features vorliegen. Zusätzlich zur Validierung der Modell-Performance auf Grundlage der Trainingsdaten sind Vorhersagen für Features möglich.

Legacy:

Die Erweiterung "ArcGIS GeoAnalytics Server" wird in ArcGIS Enterprise abgekündigt. Die letzte Version von GeoAnalytics Server war in ArcGIS Enterprise 11.3 enthalten. Dieses Geoverarbeitungswerkzeug steht in ArcGIS Enterprise 11.3 und früheren Versionen zur Verfügung.

Verwendung

  • Mit diesem Werkzeug werden Hunderte von Strukturen erstellt, die als Sammlung von Entscheidungsstrukturen bezeichnet werden, um ein Modell für die Vorhersage zu generieren. Jede Entscheidungsstruktur wird mit zufällig generierten Teilen der ursprünglichen (Trainings-)Daten erstellt. Jede Struktur generiert eine eigene Vorhersage und hat eine Stimme bei Ergebnisabstimmung. Bei dem Forest-Modell werden die Stimmen aller Entscheidungsstrukturen berücksichtigt, um das Ergebnis einer unbekannten Stichprobe vorherzusagen oder zu klassifizieren. Dies ist wichtig, da bei einzelnen Strukturen Probleme durch eine Überanpassung eines Modells entstehen können; die Kombination mehrerer Strukturen in einem Forest löst jedoch dieses Problem der Überanpassung.

  • Dieses Werkzeug kann in zwei verschiedenen Operationsmodi verwendet werden. Im Modus Trainieren kann die Performance verschiedener Modelle beim Erkunden unterschiedlicher erklärender Variablen und Werkzeugeinstellungen ausgewertet werden. Wenn Sie ein gutes Modell gefunden haben, können Sie den Modus Trainieren und vorhersagen verwenden.

  • Dieses Werkzeug unterstützt keine Eingaben mit den Feldern "Nur Datum" oder "Nur Zeit".

  • Dieses Werkzeug ist datenabhängig und eignet sich am besten für große Datasets. Für ein optimales Ergebnis sollte es mit mindestens mehreren hundert Features trainiert werden. Für kleine Datasets ist dieses Werkzeug nicht geeignet.

  • Die Eingabe-Trainings-Features können Tabellen, Punkte, Linien oder Polygon-Features sein. Dieses Werkzeug funktioniert nicht mit Multipart-Daten.

  • Features mit Vorhersage- oder erklärenden Feldern, die mindestens einen NULL-Wert oder eine leere Zeichenfolge aufweisen, werden von der Ausgabe ausgeschlossen. Sie können die Werte bei Bedarf mit dem Werkzeug Feld berechnen ändern.

  • Diese Werkzeug erzeugt je nach Operationsmodus verschiedene Ausgaben:

    • Trainieren führt zu den beiden folgenden Ausgaben:

      • Output trained features—Enthält alle im erstellten Modell verwendeten Eingabe-Training-Features und erklärenden Variablen. Auch die Vorhersagen für alle Features, die zum Trainieren des Modells verwendet wurden, sind darin enthalten. Dies kann bei der Bewertung der Performance des erstellten Modells hilfreich sein.

      • Tool summary messages—Meldungen, die Ihnen dabei helfen, die Performance des erstellten Modells besser zu verstehen. Die Meldungen enthalten Informationen zu Modelleigenschaften, Variablenbedeutung und Validierungsdiagnosen.

    • Trainieren und vorhersagen führt zu den folgenden drei Ausgaben:

      • Output trained features—Enthält alle im erstellten Modell verwendeten Eingabe-Training-Features und erklärenden Variablen. Auch die Vorhersagen für alle Features, die zum Trainieren des Modells verwendet wurden, sind darin enthalten. Dies kann bei der Bewertung der Performance des erstellten Modells hilfreich sein.

      • Output predicted features—Ein Layer mit vorhergesagten Ergebnissen. Vorhersagen werden mit dem Modell, das aus dem Training-Layer generiert wurde, auf den vorherzusagenden Layer angewendet (verwenden Sie die Option Eingabe-Vorhersage-Features).

      • Tool summary messages—Meldungen, die Ihnen dabei helfen, die Performance des erstellten Modells besser zu verstehen. Die Meldungen enthalten Informationen zu Modelleigenschaften, Variablenbedeutung und Validierungsdiagnosen.

  • Mit dem Parameter Tabelle zur Variablenbedeutung erstellen können Sie eine Tabelle erstellen, um ein Diagramm der Variablenbedeutung für die Auswertung anzuzeigen. Die höchsten 20 Werte für die Variablenbedeutung werden auch im Meldungsfenster angegeben.

  • Erklärende Variablen können aus Feldern stammen und sollten eine Reihe von Werten enthalten. Wenn es sich bei der erklärenden Variablen um eine kategoriale Variable handelt, muss das Kontrollkästchen Kategorial aktiviert werden (Variablen des Typs "String" werden automatisch aktiviert). Erklärende Kategorievariablen dürfen höchstens 60 Einzelwerte enthalten, eine geringere Anzahl von Kategorien führt jedoch zu einer besseren Performance des Modells. Je mehr Kategorien eine Variable bei einer bestimmten Datengröße enthält, desto eher dominiert sie das Modell, sodass die Vorhersageergebnisse an Effektivität verlieren.

  • Beim Abgleich von erklärenden Variablen müssen das Trainingsfeld und das Vorhersagefeld Felder desselben Typs enthalten (z. B. muss ein Double-Feld im Trainingsfeld mit einem Double-Feld im Vorhersagefeld abgeglichen werden).

  • Forest-basierte Modelle extrapolieren nicht, mit ihnen kann nur ein Wert klassifiziert oder vorhergesagt werden, für den das Modell trainiert wurde. Verwenden Sie zum Trainieren des Modells Training-Features und erklärende Variablen innerhalb des Bereichs Ihrer Ziel-Features und -Variablen. Das Werkzeug kann nicht erfolgreich ausgeführt werden, wenn die erklärenden Variablen für die Vorhersage Kategorien enthalten, die in den Trainings-Features nicht vorhanden sind.

  • Der Standardwert für den Parameter Anzahl der Strukturen ist 100. Die Erhöhung der Anzahl von Strukturen im Forest-Modell führt zu einer genaueren Modellvorhersage, für die Berechnung des Modells wird jedoch mehr Zeit benötigt.

  • Unterstützt werden ein einzelner Layer für das Training und ein einzelner Layer für die Vorhersage. Wenn Sie mehrere Datasets miteinander kombinieren möchten, verwenden Sie zum Generieren von Eingabedaten die Werkzeuge Gitter mit mehreren Variablen erstellen und Über Gitter mit mehreren Variablen anreichern.

  • Dieses Geoverarbeitungswerkzeug wird von ArcGIS GeoAnalytics Server unterstützt. Die Analyse erfolgt auf dem GeoAnalytics Server, und die Ergebnisse werden in Ihren Inhalten in ArcGIS Enterprise gespeichert.

  • Bei der Ausführung von GeoAnalytics Server-Werkzeugen wird die Analyse auf dem GeoAnalytics Server ausgeführt. Für eine optimale Performance sollten die Daten dem GeoAnalytics Server über Feature-Layer zur Verfügung stehen, die auf Ihrem ArcGIS Enterprise-Portal gehostet werden. Alternativ können Big-Data-Dateifreigaben verwendet werden. Daten, auf die GeoAnalytics Server nicht lokal zugreifen kann, werden vor Analysebeginn auf den GeoAnalytics Server verschoben. Dadurch dauert die Ausführung eines Werkzeugs länger. Es kann zudem vorkommen, dass das Verschieben der Daten von ArcGIS Pro zum GeoAnalytics Server fehlschlägt. Die Wahrscheinlichkeit eines Fehlers hängt dabei von der Netzwerkgeschwindigkeit sowie der Größe und Komplexität der Daten ab. Es wird empfohlen, dass Sie Ihre Daten stets freigeben oder eine Big-Data-Dateifreigabe erstellen.

    Weitere Informationen zum Freigeben von Daten in Ihrem Portal

    Weitere Informationen zum Erstellen einer Big-Data-Dateifreigabe über Server Manager

Parameter

Beschriftung Erläuterung Datentyp

Vorhersagetyp

Gibt den Operationsmodus des Werkzeugs an. Das Werkzeug kann ausgeführt werden, um ein Modell ausschließlich für die Bewertung der Performance zu trainieren, Features vorherzusagen oder eine vorhergesagte Oberfläche zu erstellen.

  • Nur trainierenEin Modell wird trainiert, es werden jedoch keine Vorhersagen generiert. Prüfen Sie die Genauigkeit des Modells mit dieser Option, bevor Sie Vorhersagen generieren. Mit dieser Option werden Modelldiagnosen im Meldungsfenster und ein Diagramm der Variablenbedeutung ausgegeben. Hierbei handelt es sich um die Standardeinstellung.

  • Trainieren und vorhersagenEs werden Vorhersagen oder Klassifizierungen für Features generiert. Sowohl für die Trainings-Features als auch für die vorherzusagenden Features müssen erklärende Variablen angegeben werden. Die Ausgaben dieser Option sind eine Feature-Class, eine Modelldiagnose im Meldungsfenster und optional eine Tabelle der Variablenbedeutung.

String

Eingabe-Trainings-Features

Der Layer mit dem Parameter Vorherzusagende Variable und den Feldern mit erklärenden Trainingsvariablen.

Record Set

Ausgabe-Feature-Name

(Optional)

Der Name des Ausgabe-Feature-Layers.

String

Vorherzusagende Variable

(Optional)

Die Variable aus dem Parameter Eingabe-Trainings-Features mit den Werten, die zum Trainieren des Modells verwendet werden sollen. Dieses Feld enthält bekannte (Trainings-)Werte der Variablen, mit denen eine Vorhersage an unbekannten Positionen getroffen wird.

Field

Variable als kategorisch behandeln

(Optional)

Gibt an, ob es sich bei dem Parameterwert für Vorherzusagende Variable um eine kategoriale Variable handelt.

  • AktiviertDer Parameterwert für Vorherzusagende Variable ist eine kategoriale Variable, es wird eine Klassifizierung vom Werkzeug vorgenommen.

  • DeaktiviertDer Parameterwert für Vorherzusagende Variable ist kontinuierlich, es wird eine Regression vom Werkzeug ausgeführt. Dies ist die Standardeinstellung.

Boolean

Erklärende Variablen

(Optional)

Eine Liste der Felder, die erklärende Variablen darstellen und die Vorhersage des Wertes oder der Kategorie von Vorherzusagende Variable unterstützen. Aktivieren Sie das Kontrollkästchen Kategorial für alle Variablen, die Klassen oder Kategorien darstellen (z. B. Landbedeckung oder Anwesenheit oder Abwesenheit).

Spalten der Wertetabelle:

  • VariableA list of fields representing the explanatory variables that help predict the value of the variable to predict.

  • CategoricalSpecifies whether the variable is categorical.

    • CategoricalThe explanatory field is a categorical variable.

    • NumericThe explanatory field is a continuous variable.

Value Table

Tabelle der Variablenbedeutung erstellen

(Optional)

Gibt an, ob die Ausgabetabelle Informationen enthält, die die Bedeutung der einzelnen im Modell verwendeten erklärenden Variablen beschreiben.

  • AktiviertDie Ausgabetabelle enthält Informationen zu den einzelnen erklärenden Variablen.

  • DeaktiviertDie Ausgabetabelle enthält keine Informationen zu den einzelnen erklärenden Variablen. Dies ist die Standardeinstellung.

Boolean

Eingabe-Vorhersage-Features

(Optional)

Ein Feature-Layer, der Positionen darstellt, an denen Vorhersagen getroffen werden. Dieser Feature-Layer muss auch erklärende Variablen enthalten, die als Felder bereitgestellt wurden und den von den Trainingsdaten verwendeten Feldern entsprechen.

Record Set

Erklärende Variablen abgleichen

(Optional)

Eine Liste der angegebenen Werte für Erklärende Variablen aus den Eingabe-Trainings-Features rechts und den ihnen entsprechenden Feldern aus den Eingabe-Vorhersage-Features links.

Spalten der Wertetabelle:

  • Training FieldA list of variables that correspond to the training variables that will be made to make predictions.

  • Prediction FieldThe list of variables from the input training features that were used to train the model.

Value Table

Anzahl der Strukturen

(Optional)

Die Anzahl der Strukturen, die im Forest-Modell erstellt werden sollen. Eine höhere Anzahl von Strukturen führt zu einer genaueren Modellvorhersage, für die Berechnung des Modells wird jedoch mehr Zeit benötigt. Die Standardzahl von Strukturen beträgt 100.

Long

Minimale Elementgröße

(Optional)

Die minimale Anzahl der Beobachtungen, die mindestens erforderlich sind, um ein Element (also den Endpunkt einer Struktur, der keine weiteren Verzweigungen hat) beizubehalten. Das Standardminimum für die Regression ist 5, das für die Klassifizierung 1. Bei sehr großen Daten führt eine Erhöhung dieser Zahlen zu einer Erhöhung der Laufzeit des Werkzeugs.

Long

Maximale Strukturtiefe

(Optional)

Die maximale Anzahl von Teilungen entlang einer Struktur. Je größer die maximale Tiefe, desto mehr Teilungen werden erstellt. Dadurch steigt das Risiko einer Überanpassung des Modells. Die Standardeinstellung ist datenabhängig und abhängig von der Anzahl der erstellten Strukturen und der berücksichtigten Variablen.

Long

Pro Struktur verfügbare Daten (%)

(Optional)

Der Prozentsatz der für jeden Entscheidungsbaum verwendeten Eingabe-Trainings-Features. Die Standardeinstellung liegt bei 100 Prozent der Daten. Beispieldaten für jede Struktur werden nach dem Zufallsprinzip aus zwei Dritteln der angegebenen Daten entnommen.

Alle Entscheidungsbäume im Wald werden mithilfe eines zufälligen Beispiels oder einer zufälligen Teilmenge (etwa zwei Drittel) der verfügbaren Trainingsdaten erstellt. Durch die Verwendung eines niedrigeren Prozentsatzes der Eingabedaten für die einzelnen Entscheidungsbäume wird die Geschwindigkeit des Werkzeugs bei sehr großen Datasets beschleunigt.

Long

Anzahl der nach dem Zufallsprinzip erfassten Variablen

(Optional)

Die Anzahl der erklärenden Variablen für die Erstellung der einzelnen Entscheidungsstrukturen.

Alle Entscheidungsbäume im Wald werden mithilfe einer zufälligen Teilmenge der erklärenden Variablen erstellt. Durch eine Erhöhung der Anzahl der in den einzelnen Entscheidungsbäumen verwendeten Variablen steigt die Wahrscheinlichkeit einer Überanpassung des Modells, vor allem dann, wenn dominante Variablen vorhanden sind. Eine gängige Praxis besteht darin, die Quadratwurzel aus der Gesamtzahl der erklärenden Variablen zu ziehen, wenn Vorherzusagende Variable numerisch ist, oder die Gesamtzahl der erklärenden Variablen durch 3 zu teilen, wenn Vorherzusagende Variable kategorial ist.

Long

% der Trainingsdaten für die Validierung ausgeschlossen

(Optional)

Der Prozentsatz (zwischen 10 und 50 Prozent) der Eingabe-Trainings-Features, die als Test-Dataset für die Validierung reserviert sind. Das Modell wird ohne diese zufällige Teilmenge der Daten trainiert, und die beobachteten Werte für diese Features werden mit den vorhergesagten Werten verglichen. Der Standardwert ist 10 Prozent.

Long

Data Store

(Optional)

Gibt den ArcGIS Data Store an, in dem die Ausgabe gespeichert wird. Alle in einem Big Data Store vom Typ "spatiotemporal" gespeicherten Ergebnisse werden im WGS84 gespeichert. Ergebnisse, die in einem Data Store vom Typ "relational" gespeichert werden, behalten ihr Koordinatensystem bei.

  • Big Data Store vom Typ "spatiotemporal"Die Ausgabe wird in einem Big Data Store vom Typ "spatiotemporal" gespeichert. Dies ist die Standardeinstellung.

  • Data Store vom Typ "relational"Die Ausgabe wird in einem Data Store vom Typ "relational" gespeichert.

String

Abgeleitete Ausgabe

Beschriftung Erläuterung Datentyp

Trainierte Ausgabe-Features

Die Ausgabe mit den für das Training verwendeten Eingabevariablen sowie die beobachtete Variable zur Vorhersage von Parametern und die zugehörigen Vorhersagen, mit denen die Performance des Modells weiter geprüft werden kann.

Record Set

Tabelle der Variablenbedeutung

Tabelle mit Informationen, die die Bedeutung der einzelnen, im erstellten Modell verwendeten erklärenden Variablen beschreiben.

Record Set

Vorhergesagte Ausgabe-Features

Der Layer, der die Vorhersagen des Modells empfängt.

Record Set

Umgebungen

Ausgabe-Koordinatensystem, Ausdehnung, Aktueller Workspace

Sonderfälle

Ausgabe-Koordinatensystem

The coordinate system that will be used for analysis. Analysis will be completed in the input coordinate system unless specified by this parameter. For GeoAnalytics Tools, final results will be stored in the spatiotemporal data store in WGS84.

Lizenzierungsinformationen

  • Basic: Erfordert ArcGIS GeoAnalytics Server
    Verfügbar mit ArcGIS Enterprise 10.7
  • Standard: Erfordert ArcGIS GeoAnalytics Server
    Verfügbar mit ArcGIS Enterprise 10.7
  • Advanced: Erfordert ArcGIS GeoAnalytics Server
    Verfügbar mit ArcGIS Enterprise 10.7