Skip to main content

Как работает инструмент Прогнозировать отсутствующие значения, используя модель AI

Реальные пространственные и табличные наборы данных часто содержат отсутствующие или неполные значения из-за сбоев сенсоров, отсутствия ответов на запросы, проблем с интеграцией данных или ошибок при ручном их вводе. Отсутствующие значения снижают качество данных, ограничивают анализ и могут негативно повлиять на моделирование и принятие решений на последующих этапах. Отбрасывание записей с отсутствующими значениями часто приводит к значительной потере информации, что делает интеллектуальную подстановку ключевым этапом предварительной обработки.

Инструмент Прогнозировать отсутствующие значения, используя модель ИИ заполняет недостающие числовые значения в векторных слоях и автономных таблицах с помощью продвинутых моделей машинного обучения и глубокого обучения. В отличие от статистических методов заполнения пробелов, которые работают на отдельных полях независимо, этот инструмент фиксирует связи между всеми доступными полями для получения статистически согласованных и контекстно-ориентированных подстановок.

Этот инструмент не учитывает связи между соседними объектами в пространстве или времени при заполнении недостающих значений. Инструмент Заполнить пропущенные значения более уместен, когда недостающие данные в основном зависят от пространственной близости или временной непрерывности.

В настоящее время инструмент поддерживает как Подстановку XGBoost , так и Подстановку DistilGPT-2, упакованные в виде файлов определения модели Esri (.emd) или Пакетов глубокого обучения (.dlpkПакеты глубокого обучения), что позволяет выбрать наиболее подходящий подход по размеру набора данных, сложности и системным ресурсам.

Подход, основанный на ИИ

Методы статистической подстановки, такие как минимум, максимум, среднее, медиана или мода, заменяют отсутствующие значения глобальной статистикой или значениями из соседних точек пространства или времени. Хотя эти методы быстры и просты в применении, у них есть следующие ограничения:

  • Игнорирование связей между несколькими полями.

  • Рассмотрение каждого отсутствующего значения отдельно.

  • Не удается выявить нелинейные взаимодействия или зависимости.

  • Пропущенные значения могут искажать результаты, если они не случайны.

Инструмент Прогнозировать отсутствующие значения, используя модель AI устраняет эти ограничения, моделируя совместное распределение объектов, что позволяет делать более точные и реалистичные подстановки, особенно для сложных, многомерных наборов данных.

Поддерживаемые модели подстановки

Инструмент поддерживает два основных типа моделей, доступных через ArcGIS Living Atlas of the World.

Подстановка на основе XGBoost

При использовании модели подстановки на основе XGBoost инструмент выполняет предсказательную подстановку следующим образом:

  • Для обучения используются записи с наблюдаемыми значениями в целевом поле.

  • Оставшиеся поля служат предикторными переменными для целевого поля.

  • Обученная модель предсказывает недостающие значения для записей, в которых целевое поле равно null.

  • Набор данных обновляется прогнозируемыми значениями.

Ключевые характеристики модели:

  • Эффективна для больших таблиц и большого количества полей.

  • Фиксирует нелинейные связи и взаимодействия объектов.

  • Меньшие потребности в памяти по сравнению с моделями глубокого обучения.

  • Подходит для производственных рабочих процессов и больших корпоративных наборов данных.

Подстановка на основе DistilGPT-2

При использовании модели подстановки на базе DistilGPT-2 инструмент применяет генеративную стратегию подстановки на основе глубокого обучения. Эту стратегию можно кратко изложить следующим образом:

  • Каждая строка сериализуется в последовательность пар признак—значение, похожую на предложение.

  • Модель тонко настраивается на входном наборе данных с помощью авторегрессивного прогнозирования следующего токена.

  • Пропущенные значения маскируются при выводе.

  • Модель генерирует отсутствующие значения, обусловленные наблюдаемыми полями в той же строке.

  • Сгенерированные числовые выходные результаты преобразуются обратно в исходный числовой формат.

Этот подход позволяет модели одновременно изучать сложные зависимости во всех полях и демонстрирует более низкие показатели ошибок (такие как RMSE и MAE) в сложных сценариях подстановки по сравнению с традиционными базовыми показателями машинного обучения.

Ключевые характеристики модели:

  • Изучает совместные распределения объектов.

  • Эффективна для сложных взаимозависимых наборов данных.

  • Поддерживает будущую расширяемость для дополнительных моделей трансформаторов.

  • Требования к памяти GPU выше, чем у XGBoost.

Вопросы производительности и памяти

Модели на основе глубокого обучения требуют большого объема памяти. Примите во внимание следующее:

  • DistilGPT-2

    • Рекомендуется для таблиц с 40 или меньшим числом полей.

    • Требуется видеокарта с большим объемом памяти (24 ГБ и более).

    • Могут возникать ошибки памяти при расширении таблиц.

  • XGBoost

    • Поддерживает большие таблицы и большее количество полей.

    • Меньший объем памяти и требования к вычислениям.

    • Рекомендуется для наборов данных корпоративного уровня.

Ниже приведены обходные пути для ограничений памяти:

  • Сократите количество входных полей за счет выбора объектов.

  • Разбейте широкие таблицы на меньшие подмножества.

  • Запускайте инструмент в облаке или в системах с большим объемом памяти.

Когда используется этот инструмент

Используйте инструмент Прогнозировать отсутствующие значения, используя модель AI, если верно следующее:

  • Недостающие значения встречаются в нескольких взаимосвязанных полях.

  • Очень важно сохранить многомерные отношения.

  • Статистическая подстановка дает нереалистичные результаты.

  • Качество данных критически важно для дальнейшего анализа или моделирования.

При работе с более простыми наборами данных, отдельными пробелами в полях или случаями, когда отсутствующие значения лучше всего объясняются пространственной или временной близостью, такие инструменты, как Заполнить пропущенные значения, могут оказаться подходящими.

Литература

  • Vadim Borisov, Kathrin Seßler, Tobias Leemann, Martin Pawelczyk, Gjergji Kasneci. "Language Models are Realistic Tabular Data Generators." October 12, 2022. https://arxiv.org/abs/2210.06280

  • Tianqi Chen, and Carlos Guestrin. "XGBoost: A Scalable Tree Boosting System." March 9, 2016. https://arxiv.org/abs/1603.02754

  • Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin. "Attention Is All You Need." June 12, 2017. https://arxiv.org/abs/1603.02754