Skip to main content

Cómo funciona la herramienta Predecir valores faltantes con un modelo de IA

Los datasets espaciales y tabulares del mundo real suelen contener valores faltantes o incompletos debido a fallos de los sensores, falta de respuesta en las encuestas, problemas de integración de datos o errores en la introducción manual de datos. Los valores faltantes reducen la calidad de los datos, limitan el análisis y pueden afectar negativamente al modelado y la toma de decisiones posteriores. Descartar registros con valores faltantes suele provocar una pérdida significativa de información, lo que convierte la imputación inteligente en un paso de preprocesamiento fundamental.

La herramienta Predecir valores faltantes con un modelo de IA completa los valores numéricos faltantes en capas de entidades y tablas independientes utilizando modelos avanzados de aprendizaje automático y aprendizaje profundo. A diferencia de los métodos estadísticos de relleno de huecos que operan sobre campos particulares de forma independiente, esta herramienta captura las relaciones entre todos los campos disponibles para producir imputaciones estadísticamente consistentes y sensibles al contexto.

Esta herramienta no tiene en cuenta las relaciones entre entidades vecinas en el espacio o el tiempo al rellenar los valores que faltan. La herramienta Rellenar valores que faltan es más adecuada cuando los datos faltantes están influenciados principalmente por la proximidad espacial o la continuidad temporal.

Actualmente, la herramienta admite tanto modelos de imputación basados en XGBoost como en DistilGPT-2, empaquetados como archivos de definición de modelos de Esri (.emd) o paquetes de aprendizaje profundo (.dlpk), lo que le permite elegir el enfoque más adecuado en función del tamaño del dataset, la complejidad y los recursos del sistema.

Un enfoque basado en IA

Los métodos de imputación estadística, como el mínimo, el máximo, la media, la mediana o la moda, sustituyen los valores perdidos utilizando estadísticas globales o valores de ubicaciones vecinas en el espacio o el tiempo. Aunque son rápidos y fáciles de aplicar, estos enfoques presentan las siguientes limitaciones:

  • Ignoran las relaciones entre múltiples campos.

  • Tratan cada valor faltante de forma independiente.

  • No captan las interacciones o dependencias no lineales.

  • Pueden sesgar los resultados cuando los valores faltantes no son aleatorios.

La herramienta Predecir valores faltantes con un modelo de IA aborda estas limitaciones mediante el modelado de la distribución conjunta de las entidades, lo que permite imputaciones más precisas y realistas, sobre todo para datasets complejos y de alta dimensión.

Modelos de imputación compatibles

La herramienta admite dos tipos principales de modelos, ambos accesibles a través de ArcGIS Living Atlas of the World.

Imputación basada en XGBoost

Al utilizar el modelo de imputación basado en XGBoost, la herramienta realiza la imputación predictiva de la siguiente manera:

  • Los registros con valores observados en el campo de destino se utilizan para el entrenamiento.

  • Los campos restantes sirven como variables predictoras para el campo de destino.

  • El modelo entrenado predice los valores que faltan en los registros en los que el campo de destino es nulo.

  • El dataset se actualiza con los valores predichos.

Las características clave del modelo incluyen lo siguiente:

  • Es eficaz para tablas grandes y un elevado número de campos.

  • Captura relaciones no lineales e interacciones entre entidades.

  • Necesita menos requisitos de memoria en comparación con los modelos de aprendizaje profundo.

  • Es adecuado para flujos de trabajo de producción y datasets de grandes empresas.

Imputación basada en DistilGPT-2

Al utilizar el modelo de imputación basado en DistilGPT-2, la herramienta aplica una estrategia de imputación generativa, fila por fila, basada en el aprendizaje profundo. Esta estrategia se puede resumir de la siguiente manera:

  • Cada fila se serializa en una secuencia similar a una frase de pares de entidad-valor.

  • El modelo se ajusta sobre el dataset de entrada utilizando la predicción autorregresiva del siguiente token.

  • Los valores faltantes se ocultan durante la inferencia.

  • El modelo genera valores faltantes condicionados a los campos observados en la misma fila.

  • Las salidas numéricas generadas se convierten de nuevo a su formato numérico original.

Este enfoque permite al modelo aprender dependencias complejas entre todos los campos simultáneamente y ha demostrado métricas de error más bajas (como RMSE y MAE) en escenarios de imputación complejos en comparación con las referencias tradicionales de aprendizaje automático.

Las características clave del modelo incluyen lo siguiente:

  • Aprende distribuciones conjuntas de entidades.

  • Es eficaz para datasets complejos e interdependientes.

  • Admite la extensibilidad futura a modelos Transformer adicionales.

  • Necesita más requisitos de memoria de GPU que XGBoost.

Consideraciones sobre rendimiento y memoria

Los modelos basados en aprendizaje profundo consumen mucha memoria. Considere lo siguiente:

  • DistilGPT-2

    • Se recomienda para tablas con 40 campos o menos.

    • Requiere GPU con mucha memoria (24 GB o más).

    • Pueden producirse errores de memoria con tablas más amplias.

  • XGBoost

    • Admite tablas más grandes y un mayor número de campos.

    • La huella de memoria y los requisitos de computación son menores.

    • Se recomienda para datasets de escala empresarial.

A continuación se indican soluciones alternativas para las limitaciones de memoria:

  • Reduzca el número de campos de entrada mediante la selección de entidades.

  • Divida las tablas amplias en subconjuntos más pequeños.

  • Ejecute la herramienta en la nube o en sistemas con gran capacidad de memoria.

Cuándo utilizar esta herramienta

Utilice Predecir valores faltantes con un modelo de IA cuando se cumpla lo siguiente:

  • Se producen valores faltantes en varios campos interrelacionados.

  • Es importante preservar las relaciones multivariantes.

  • La imputación estadística produce resultados poco realistas.

  • La calidad de los datos es fundamental para el análisis o la modelización posteriores.

Cuando se trabaja con datasets más sencillos, lagunas en campos particulares o casos en los que los valores perdidos se explican mejor por la proximidad espacial o temporal, a menudo resultan adecuadas herramientas como Rellenar valores que faltan.

Referencias

  • Vadim Borisov, Kathrin Seßler, Tobias Leemann, Martin Pawelczyk, Gjergji Kasneci. "Language Models are Realistic Tabular Data Generators." 12 de octubre de 2022. https://arxiv.org/abs/2210.06280

  • Tianqi Chen y Carlos Guestrin. "XGBoost: A Scalable Tree Boosting System." 9 de marzo de 2016. https://arxiv.org/abs/1603.02754

  • Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin. "Attention Is All You Need." 12 de junio de 2017. https://arxiv.org/abs/1603.02754