Skip to main content

Zufallsstichprobe auswählen (Data Reviewer Tools)

Zusammenfassung

Wählt basierend auf der angegebenen Stichprobenmethode eine Zufallsstichprobe der Eingabe-Features oder -Zeilen aus.

Die Ausgabe ist eine Auswahl, die im Eingabe-Layer im Kartenrahmen erstellt wird. Das Werkzeug kann auch eine .json-Datei, in der die ausgewählten Objekt-IDs (OIDs) gespeichert werden, und den SQL-Ausdruck, der für die Auswahl verwendet wird, erstellen. Die Auswahl kann für die Workflows des Werkzeugs "Features durchsuchen" zur visuellen Überprüfung und des Werkzeugs "Datenprüfungen ausführen" verwendet werden.

Verwendung

  • Für den Parameter Stichprobenmethode gibt es die folgenden Optionen:

    • Feste Anzahl: Die Anzahl der ausgewählten Datensätze hängt vom Wert für den Parameter Anzahl der Datensätze ab.

    • Prozentsatz: Die Anzahl der ausgewählten Datensätze hängt vom Wert für den Parameter Prozentsatz der Datensätze ab.

    • Automatische Berechnung: Die Anzahl der ausgewählten Datensätze basiert auf einer Berechnung mit den Parameterwerten Konfidenzniveau und Fehlerspanne.

  • Für die Option Automatische Berechnung des Parameters Stichprobenmethode werden zum Berechnen der Anzahl der Datensätze die folgenden Variablen verwendet:

    \[ \begin{align*} z &= \text{scipy.stats.norm.ppf}\left(1 - \frac{1 - \text{confidence\_level}}{2}\right) \\ n &= \left(\frac{z}{m}\right)^2 \cdot \left(p \cdot (1 - p)\right) \\ n' &= \frac{n \cdot N}{n + (N - 1)} \end{align*} \]
    • Die Z-Statistik für das gewünschte Konfidenzniveau (z). Die Z-Statistik wird mit der Konfidenzniveauvariablen und dem scipy.stats-Modul z=scipy.stats.norm.ppf(1-(1-confidence_level)/2) berechnet.

    • Die zulässige Fehlerspanne im Konfidenzintervall (m).

    • Die Wahrscheinlichkeit (p) ist bei 0,5 am höchsten, da kein bisheriges Wissen darüber vorhanden ist, ob ein bestimmter Prozentsatz von Datensätzen erfolgreich oder nicht erfolgreich sein wird. Da die Wahrscheinlichkeit, dass Datensätze erfolgreich sind, gleich hoch ist, wie die Wahrscheinlichkeit, dass sie nicht erfolgreich sind, ist 0,5 der konservativste Wert, der in der Gleichung für Varianz verwendet wird.

    • Die Populationsgröße (N) ist die Gesamtzahl der Datensätze in einem Feature-Layer oder in einer Feature-Tabelle.

  • Zufalls-OIDs werden mit dem Python-random-Modul random.sample(population, k) ausgewählt, wobei population die Liste der OID-Werte und k die Größe der Stichprobe angibt.

  • Die Ausgabe dieses Werkzeugs ist eine Zufallsauswahl von Datensätzen aus dem Parameterwert Eingabezeilen, der auf dem Parameterwerte Stichprobenmethode basiert.

  • Verwenden Sie den optionalen Parameter Ausgabedatei, um eine .json-Datei zu erstellen, die folgende Daten enthält:

    • Datum und der Uhrzeit der Ausführung des Werkzeugs

    • Der Workspace, aus dem die Eingabe stammt

    • Der Name der Eingabe-Feature-Layer oder -Tabellen

    • Die Gesamtanzahl der ausgewählten Datensätze

    • Die OIDs der ausgewählte Datensätze

    • Der für die Auswahl verwendete SQL-Ausdruck

  • Alle im Parameter Eingabezeilen vorgenommen Auswahlen werden implementiert. Dabei spielt es keine Rolle, ob die Umschaltfläche Ausgewählte Datensätze verwenden deaktiviert ist.

  • Der Feature-Layer bzw. die Tabelle muss über ein Feld ObjectID verfügen, bevor dieses Werkzeug ausgeführt wird.

  • Wenn die Umschaltfläche Ausgewählte Datensätze verwenden deaktiviert ist, zeichnet der Wert des Parameters Ausgabedatei eine zufällige Auswahl von Features auf der Grundlage des gesamten Datasets auf. Wenn jedoch eine Definitionsabfrage angewendet wird, werden nur die Features oder Zeilen im Kartenrahmen ausgewählt, die der Abfrage entsprechen.

Parameter

Beschriftung Erläuterung Datentyp

Eingabezeilen

Die Daten, auf die die Auswahl angewendet wird.

Feature Layer; Table View

Stichprobenmethode

Gibt die Stichprobenmethode an, die verwendet wird.

  • Feste AnzahlDie Anzahl der ausgewählten Datensätze hängt vom Wert für den Parameter "Anzahl der Datensätze" ab.

  • ProzentsatzDie Anzahl der ausgewählten Datensätze hängt vom Wert für den Parameter "Prozentsatz der Datensätze" ab.

  • Automatische BerechnungDie Anzahl der ausgewählten Datensätze basiert auf einer Berechnung mit den Parameterwerten "Konfidenzniveau" und "Fehlerspanne".

String

Anzahl der Datensätze

(Optional)

Die Anzahl der Datensätze, die ausgewählt werden.

Dieser Parameter ist aktiv, wenn der Parameterwert Stichprobenmethode auf Feste Anzahl festgelegt ist.

Long

Prozentsatz der Datensätze

(Optional)

Der Prozentsatz der Datensätze in der Eingabe, der ausgewählt wird.

Dieser Parameter ist aktiv, wenn der Parameterwert Stichprobenmethode auf Prozentsatz festgelegt ist.

Long

Konfidenzniveau

(Optional)

Das Konfidenzniveau gibt die Wahrscheinlichkeit an, mit der eine Stichprobengröße statistisch signifikant ist, und wird in Prozent angegeben, z. B. 98 oder 95.

Dieser Parameter wird zum Berechnen der Z-Statistik (z) verwendet.

Die Z-Statistik kann mit dem scipy.stats-Modul z=scipy.stats.norm.ppf(1-(1-confidence_level)/2) berechnet werden.

Dieser Parameter ist aktiv, wenn der Parameterwert Stichprobenmethode auf Automatische Berechnung festgelegt ist.

Long

Fehlerspanne

(Optional)

Die zulässige Fehlerspanne im Konfidenzniveau. Sie wird in Prozent angegeben, z. B. 8 oder 5.

Bei diesem Parameter wird die berechnete Z-Statistik (z) verwendet, um die tatsächliche Stichprobengröße (n') anhand der folgenden Gleichungen zu berechnen: (<!--n=((z/m)^2)*p*(1-p)) zu n'=(n*N)/(n+(N-1)).

Dieser Parameter ist aktiv, wenn der Parameterwert Stichprobenmethode auf Automatische Berechnung festgelegt ist.

Long

Ausgabedatei

(Optional)

Die Ausgabe-.json-Datei, die den Datensatz mit den ausgewählten Daten enthält.

File

Abgeleitete Ausgabe

Beschriftung Erläuterung Datentyp

Aktualisierte Zeilen

Die aktualisierte Eingabe mit angewendeter Auswahl.

Feature Layer; Table View

Umgebungen

Aktueller Workspace

Lizenzierungsinformationen

  • Basic: Erfordert Data Reviewer
  • Standard: Erfordert Data Reviewer
  • Advanced: Erfordert Data Reviewer