Skip to main content

Funktionsweise von "Fehlende Werte mithilfe eines KI-Modells vorhersagen"

Räumliche und Tabellen-Datasets aus der Praxis enthalten häufig fehlende oder unvollständige Werte, die auf Ausfälle von Sensoren, Nichtbeantwortung von Suveys, Probleme bei der Datenintegration oder Fehler bei der manuellen Dateneingabe zurückzuführen sind. Fehlende Werte mindern die Datenqualität, schränken die Analyse ein und können sich negativ auf die nachfolgende Modellierung und Entscheidungsfindung auswirken. Das Verwerfen von Datensätzen mit fehlenden Werten führt häufig zu einem erheblichen Informationsverlust, weshalb eine intelligente Ergänzung ein wichtiger Schritt in der Vorverarbeitung ist.

Das Werkzeug Fehlende Werte mithilfe eines KI-Modells vorhersagen füllt fehlende numerische Werte in Feature-Layern und eigenständigen Tabellen mithilfe fortschrittlicher Modelle für maschinelles Lernen und Deep-Learning-Modelle auf. Im Gegensatz zu statistischen Methoden zur Ergänzung fehlender Daten, die einzelne Felder unabhängig voneinander behandeln, erfasst dieses Werkzeug die Beziehungen zwischen allen verfügbaren Feldern, um statistisch konsistente und kontextbezogene Ergänzungen zu erstellen.

Dieses Werkzeug berücksichtigt beim Ausfüllen fehlender Werte keine räumlichen oder zeitlichen Beziehungen zwischen benachbarten Features. Das Werkzeug Fehlende Werte ausfüllen eignet sich besser, wenn die fehlenden Daten in erster Linie durch räumliche Nähe oder zeitliche Kontinuität beeinflusst werden.

Das Werkzeug unterstützt derzeit sowohl die Modelle XGBoost based Imputation und DistilGPT-2 based Imputation, die als Modelldefinitionsdateien von Esri (.emd) oder Deep-Learning-Pakete (.dlpk) bereitgestellt werden. So können Sie je nach Größe und Komplexität des Datasets sowie den verfügbaren Systemressourcen den am besten geeigneten Ansatz auswählen.

KI-basierter Ansatz

Statistische Methoden zur Datenergänzung wie Minimum, Maximum, Mittelwert, Median oder Modus ersetzen fehlende Werte anhand von Gesamtstatistiken oder Werten aus räumlich oder zeitlich benachbarten Positionen. Diese Ansätze lassen sich zwar schnell und einfach umsetzen, weisen jedoch folgende Einschränkungen auf:

  • Beziehungen zwischen mehreren Feldern werden ignoriert.

  • Jeder fehlende Wert wird separat behandelt.

  • Nichtlineare Interaktionen oder Abhängigkeiten werden nicht erfasst.

  • Es kann zu Verzerrungen kommen, wenn fehlende Werte nicht zufällig sind.

Das Werkzeug Fehlende Werte mithilfe eines KI-Modells vorhersagen überwindet diese Einschränkungen, indem es die gemeinsame Verteilung der Features modelliert und so genauere und realistischere Ergänzungen ermöglicht, insbesondere bei komplexen, mehrdimensionalen Datasets.

Unterstützte Modelle für die Datenergänzung

Das Werkzeug unterstützt zwei Hauptmodelltypen, auf die beide über den ArcGIS Living Atlas of the World zugegriffen werden kann.

XGBoost based Imputation

Bei Verwendung des Modells "XGBoost-based Imputation" führt das Werkzeug die vorausgesagte Ergänzung wie folgt durch:

  • Datensätze mit beobachteten Werten im Zielfeld werden für das Training verwendet.

  • Die übrigen Felder dienen als Einflussvariablen für das Zielfeld.

  • Das trainierte Modell sagt fehlende Werte für Datensätze voraus, bei denen das Zielfeld NULL aufweist.

  • Das Dataset wird mit den vorhergesagten Werten aktualisiert.

Zu den wichtigsten Merkmalen des Modells gehören folgende:

  • Eignet sich besonders für große Tabellen und eine große Anzahl von Feldern

  • Erfasst nichtlineare Beziehungen und Wechselwirkungen zwischen Features

  • Geringere Speicheranforderungen im Vergleich zu Deep-Learning-Modellen

  • Geeignet für Produktions-Workflows und große Unternehmens-Datasets

DistilGPT-2 based Imputation

Bei Verwendung des Modells "DistilGPT-2 based Imputation" wendet das Werkzeug eine auf Deep Learning basierende generative Strategie für die Ergänzung von Daten auf Zeilenbasis an. Diese Strategie lässt sich wie folgt zusammenfassen:

  • Jede Zeile wird in eine satzähnliche Folge von Feature-Wert-Paaren serialisiert.

  • Das Modell wird anhand des Eingabe-Dataset unter Verwendung der autoregressiven Vorhersage des nächsten Token optimiert.

  • Fehlende Werte werden bei der Inferenz maskiert.

  • Das Modell generiert fehlende Werte unter Berücksichtigung der beobachteten Felder in derselben Zeile.

  • Generierte numerische Ausgaben werden wieder in ihr ursprüngliches numerisches Format umgewandelt.

Mit diesem Ansatz kann das Modell komplexe Abhängigkeiten über alle Felder hinweg gleichzeitig erlernen und hat in komplexen Szenarien zur Datenergänzung im Vergleich zu herkömmlichen Methoden des maschinellen Lernens niedrigere Fehlerkennzahlen (wie RMSE und MAE) erzielt.

Zu den wichtigsten Merkmalen des Modells gehören folgende:

  • Lernt gemeinsame Feature-Verteilungen

  • Eignet sich für komplexe, wechselseitig abhängige Datasets

  • Unterstützt zukünftige Erweiterungen um weitere Transformer-Modelle

  • Höhere Anforderungen an den GPU-Speicher als bei XGBoost

Überlegungen zu Performance und Speicher

Deep-Learning-Modelle sind speicherintensiv. Berücksichtigen Sie dabei folgende Aspekte:

  • DistilGPT-2

    • Empfohlen für Tabellen mit maximal 40 Feldern

    • Erfordert GPUs mit großem Arbeitsspeicher (24 GB oder mehr)

    • Bei umfangreicheren Tabellen können Speicherfehler auftreten

  • XGBoost

    • Unterstützt größere Tabellen und eine höhere Anzahl von Feldern

    • Geringerer Speicherbedarf und geringere Rechenanforderungen

    • Empfohlen für Datasets im Enterprise-Bereich

Im Folgenden finden Sie Lösungen für Speicherengpässe:

  • Verringern Sie die Anzahl der Eingabefelder durch Feature-Auswahl.

  • Teilen Sie umfangreiche Tabellen in kleinere Teilmengen auf.

  • Führen Sie das Werkzeug in Cloud-Systemen oder Systemen mit großem Arbeitsspeicher aus.

Anwendungsfälle für dieses Werkzeug

Verwenden Sie Fehlende Werte mithilfe eines KI-Modells vorhersagen, wenn Folgendes zutrifft:

  • In mehreren miteinander verbundenen Feldern gibt es fehlende Werte.

  • Es ist wichtig, multivariate Zusammenhänge zu erhalten.

  • Die statistische Ergänzung führt zu unrealistischen Ergebnissen.

  • Die Datenqualität ist für nachfolgende Analysen oder Modellierungen von entscheidender Bedeutung.

Bei der Arbeit mit einfacheren Datasets, einzelnen fehlenden Feldwerten oder Fällen, in denen fehlende Werte am besten durch räumliche oder zeitliche Nähe erklärt werden können, sind Werkzeuge wie Fehlende Werte ausfüllen oft geeignet.

Referenzen

  • Vadim Borisov, Kathrin Seßler, Tobias Leemann, Martin Pawelczyk, Gjergji Kasneci. "Language Models are Realistic Tabular Data Generators." 12. Oktober 2022. https://arxiv.org/abs/2210.06280

  • Tianqi Chen und Carlos Guestrin. "XGBoost: A Scalable Tree Boosting System". 9. März 2016. https://arxiv.org/abs/1603.02754

  • Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin. "Attention Is All You Need." 12. Juni 2017. https://arxiv.org/abs/1603.02754