Skip to main content

Cómo funciona Fusionar incorporaciones

La herramienta Fusionar incorporaciones permite agregar datos vectoriales de alta dimensión, o incorporaciones, de una capa de origen a una capa de polígonos de destino. Este proceso es esencial para resumir información compleja y conecta las incorporaciones localizadas sin procesar con unidades geográficas más grandes y significativas, como límites administrativos, cuencas hidrográficas o cuadrículas analíticas personalizadas.

Comprensión de las incorporaciones en ArcGIS

En los flujos de trabajo modernos de IA, la incorporación es una representación densa y de alta dimensión de una entidad que captura el significado semántico de dicha entidad.

Más información sobre las incorporaciones

En ArcGIS Pro, las incorporaciones se almacenan en un campo de BLOB (objeto binario grande), tal como se describe en Incorporaciones como campos BLOB.

Para garantizar el rendimiento y la compatibilidad cruzada con Python, C++ y JavaScript, la herramienta espera que estos BLOB se serialicen como matrices binarias de punto flotante de 32 bits (float32). Cuando se ejecuta la herramienta, lee estos búferes binarios directamente en la memoria como matrices numéricas, realiza una agregación matemática y los vuelve a serializar para almacenarlos en la clase de entidad de salida.

Cuando generas incorporaciones, por ejemplo, mediante modelos de aprendizaje profundo, el vector resultante captura la semántica de una ubicación. La herramienta Fusionar incorporaciones proporciona una forma de mover estos vectores entre distintas escalas geográficas a la vez que conserva su integridad matemática.

Incorporaciones en una vista de tabla

Cómo procesa la herramienta los datos

La herramienta sigue un flujo de trabajo de cuatro etapas para garantizar la precisión espacial y matemática:

Superposición espacial

La herramienta comienza determinando la superposición espacial precisa entre el valor del parámetro Entidades de incorporación (origen) y el valor del parámetro Entidades de destino (destino). Esto garantiza que solo las partes de las incorporaciones que se encuentran físicamente dentro de un polígono de destino contribuyan a su vector final. Mediante una lógica de intersección por pares, la herramienta gestiona datasets masivos con una alta complejidad topológica de forma más eficiente que los métodos de superposición estándar.

En el caso de los puntos, la herramienta identifica qué puntos están físicamente contenidos dentro de cada polígono de destino. En el caso de los polígonos, la herramienta calcula el área de intersección: la huella exacta en la que un polígono de incorporación de origen se superpone en un polígono de destino.

Lógica de agregación

El núcleo de la herramienta es su capacidad para fusionar varios vectores de alta dimensión en un único vector representativo del área de destino. El método de cálculo cambia en función de la geometría de entrada.

De punto a polígono (media simple)

De punto a polígono

Al agregar puntos en un polígono, la herramienta presupone que cada punto representa una observación discreta con la misma ponderación. El vector \(E_{\text{target}}\) es la media aritmética de todos los vectores \((E_i)\) que se encuentran dentro del límite. Esto resulta ideal para agregar incorporaciones de redes sociales geoetiquetadas o datos de sensores localizados.

\[ E_{target} = \frac{1}{n} \sum_{i=1}^{n} E_i \]
Nota:

Si un polígono de destino no contiene ningún punto, el campo Embedding de la salida permanecerá nulo.

Polígono a polígono (promedio de área ponderada)

Polígono Polígono

Cuando las incorporaciones de origen son polígonos, como teselas de una imagen de satélite o límites de condados, la herramienta utiliza interpolación ponderada por área. Esta lógica reconoce que una incorporación que cubre el 90% de un polígono de destino debe tener una influencia significativamente mayor en el resultado que una que solo cubre el 10%.

La herramienta calcula el peso (Wi) de cada incoporación superpuesta dividiendo el área de intersección (\(Area_i\)) por el área total superpuesta dentro de ese destino específico.

\[ E_{target} = \sum_{i=1}^{n} E_i \cdot \left(\frac{Area_i}{\sum Area}\right) \]

Cálculo vectorial

Mediante la biblioteca NumPy, la herramienta reconstruye los BLOB binarios como matrices, realiza los cálculos ponderados y, a continuación, vuelve a serializar los resultados en formato binario para su almacenamiento.

Generación de salida

Los resultados finales se escriben en una nueva clase de entidad. Se crea un nuevo campo BLOB, con el nombre predeterminado Embedding. Esta salida está optimizada para herramientas GeoAI posteriores, como Búsqueda de similitud.

Uso

Esta sección ofrece consejos prácticos y restricciones para asegurar que la herramienta funcione correctamente.

Preparación de datos

La herramienta busca específicamente un campo llamado Embedding. Asegúrese de que las entidades de origen tengan exactamente este nombre de campo y de que el tipo de dato esté establecido en BLOB.

Todas las incorporaciones de la entrada deben tener la misma longitud; por ejemplo, todas deben tener 128 o 512 dimensiones. Si la herramienta detecta incorporaciones con longitudes no coincidentes, omitirá esos registros y emitirá una advertencia.

Restricciones del espacio de trabajo

Debido a las limitaciones técnicas de los shapefiles y GeoPackages en cuanto al almacenamiento y la recuperación de grandes volúmenes de datos BLOB, el valor del parámetro Entidades de incorporación de salida debe almacenarse en una geodatabase de archivos, móvil o corporativa.

No se recomienda usar espacios de trabajo memory o in_memory con esta herramienta debido al consumo potencialmente elevado de RAM de los datasets de incoporaciones grandes.

Configuración del entorno

Para los cálculos de promedio de área ponderada, es muy recomendable utilizar un sistema de coordenadas proyectadas para el entorno del sistema de coordenadas de salida. El uso de un sistema de coordenadas geográficas (WGS84) puede provocar un rendimiento más lento y relaciones de área menos precisas en determinadas regiones.

Solución de problemas

Si un polígono de destino de la salida tiene un campo nulo Embedding, significa que ninguna entidad de origen se corta con ese polígono o que las entidades intersecantes contenían datos BLOB vacíos.