Zufallsstichprobe auswählen (Data Reviewer Tools)
Zusammenfassung
Wählt basierend auf der angegebenen Stichprobenmethode eine Zufallsstichprobe der Eingabe-Features oder -Zeilen aus.
Die Ausgabe ist eine Auswahl, die im Eingabe-Layer im Kartenrahmen erstellt wird. Das Werkzeug kann auch eine .json-Datei, in der die ausgewählten Objekt-IDs (OIDs) gespeichert werden, und den SQL-Ausdruck, der für die Auswahl verwendet wird, erstellen. Die Auswahl kann für die Workflows des Werkzeugs "Features durchsuchen" zur visuellen Überprüfung und des Werkzeugs "Datenprüfungen ausführen" verwendet werden.
Verwendung
Für den Parameter Stichprobenmethode gibt es die folgenden Optionen:
Feste Anzahl: Die Anzahl der ausgewählten Datensätze hängt vom Wert für den Parameter Anzahl der Datensätze ab.
Prozentsatz: Die Anzahl der ausgewählten Datensätze hängt vom Wert für den Parameter Prozentsatz der Datensätze ab.
Automatische Berechnung: Die Anzahl der ausgewählten Datensätze basiert auf einer Berechnung mit den Parameterwerten Konfidenzniveau und Fehlerspanne.
Für die Option Automatische Berechnung des Parameters Stichprobenmethode werden zum Berechnen der Anzahl der Datensätze die folgenden Variablen verwendet:
\[ \begin{align*} z &= \text{scipy.stats.norm.ppf}\left(1 - \frac{1 - \text{confidence\_level}}{2}\right) \\ n &= \left(\frac{z}{m}\right)^2 \cdot \left(p \cdot (1 - p)\right) \\ n' &= \frac{n \cdot N}{n + (N - 1)} \end{align*} \]Die Z-Statistik für das gewünschte Konfidenzniveau (z). Die Z-Statistik wird mit der Konfidenzniveauvariablen und dem
scipy.stats-Modulz=scipy.stats.norm.ppf(1-(1-confidence_level)/2)berechnet.Die zulässige Fehlerspanne im Konfidenzintervall (m).
Die Wahrscheinlichkeit (p) ist bei 0,5 am höchsten, da kein bisheriges Wissen darüber vorhanden ist, ob ein bestimmter Prozentsatz von Datensätzen erfolgreich oder nicht erfolgreich sein wird. Da die Wahrscheinlichkeit, dass Datensätze erfolgreich sind, gleich hoch ist, wie die Wahrscheinlichkeit, dass sie nicht erfolgreich sind, ist 0,5 der konservativste Wert, der in der Gleichung für Varianz verwendet wird.
Die Populationsgröße (N) ist die Gesamtzahl der Datensätze in einem Feature-Layer oder in einer Feature-Tabelle.
Zufalls-OIDs werden mit dem Python-
random-Modulrandom.sample(population, k)ausgewählt, wobeipopulationdie Liste der OID-Werte undkdie Größe der Stichprobe angibt.Die Ausgabe dieses Werkzeugs ist eine Zufallsauswahl von Datensätzen aus dem Parameterwert Eingabezeilen, der auf dem Parameterwerte Stichprobenmethode basiert.
Verwenden Sie den optionalen Parameter Ausgabedatei, um eine
.json-Datei zu erstellen, die folgende Daten enthält:Datum und der Uhrzeit der Ausführung des Werkzeugs
Der Workspace, aus dem die Eingabe stammt
Der Name der Eingabe-Feature-Layer oder -Tabellen
Die Gesamtanzahl der ausgewählten Datensätze
Die OIDs der ausgewählte Datensätze
Der für die Auswahl verwendete SQL-Ausdruck
Alle im Parameter Eingabezeilen vorgenommen Auswahlen werden implementiert. Dabei spielt es keine Rolle, ob die Umschaltfläche Ausgewählte Datensätze verwenden deaktiviert ist.
Der Feature-Layer bzw. die Tabelle muss über ein Feld
ObjectIDverfügen, bevor dieses Werkzeug ausgeführt wird.Wenn die Umschaltfläche Ausgewählte Datensätze verwenden deaktiviert ist, zeichnet der Wert des Parameters Ausgabedatei eine zufällige Auswahl von Features auf der Grundlage des gesamten Datasets auf. Wenn jedoch eine Definitionsabfrage angewendet wird, werden nur die Features oder Zeilen im Kartenrahmen ausgewählt, die der Abfrage entsprechen.
Parameter
| Beschriftung | Erläuterung | Datentyp |
|---|---|---|
|
Eingabezeilen |
Die Daten, auf die die Auswahl angewendet wird. |
Feature Layer; Table View |
|
Stichprobenmethode |
Gibt die Stichprobenmethode an, die verwendet wird.
|
String |
|
Anzahl der Datensätze (Optional) |
Die Anzahl der Datensätze, die ausgewählt werden. Dieser Parameter ist aktiv, wenn der Parameterwert Stichprobenmethode auf Feste Anzahl festgelegt ist. |
Long |
|
Prozentsatz der Datensätze (Optional) |
Der Prozentsatz der Datensätze in der Eingabe, der ausgewählt wird. Dieser Parameter ist aktiv, wenn der Parameterwert Stichprobenmethode auf Prozentsatz festgelegt ist. |
Long |
|
Konfidenzniveau (Optional) |
Das Konfidenzniveau gibt die Wahrscheinlichkeit an, mit der eine Stichprobengröße statistisch signifikant ist, und wird in Prozent angegeben, z. B. 98 oder 95. Dieser Parameter wird zum Berechnen der Z-Statistik (z) verwendet. Die Z-Statistik kann mit dem Dieser Parameter ist aktiv, wenn der Parameterwert Stichprobenmethode auf Automatische Berechnung festgelegt ist. |
Long |
|
Fehlerspanne (Optional) |
Die zulässige Fehlerspanne im Konfidenzniveau. Sie wird in Prozent angegeben, z. B. 8 oder 5. Bei diesem Parameter wird die berechnete Z-Statistik (z) verwendet, um die tatsächliche Stichprobengröße (n') anhand der folgenden Gleichungen zu berechnen: (<!-- Dieser Parameter ist aktiv, wenn der Parameterwert Stichprobenmethode auf Automatische Berechnung festgelegt ist. |
Long |
|
Ausgabedatei (Optional) |
Die Ausgabe- |
File |
Abgeleitete Ausgabe
| Beschriftung | Erläuterung | Datentyp |
|---|---|---|
|
Aktualisierte Zeilen |
Die aktualisierte Eingabe mit angewendeter Auswahl. |
Feature Layer; Table View |
Umgebungen
Lizenzierungsinformationen
- Basic: Erfordert Data Reviewer
- Standard: Erfordert Data Reviewer
- Advanced: Erfordert Data Reviewer